面向 LLM Skill 与 Harness 的风险检测

2026.07.14

面向 LLM Skill 与 Harness 的风险检测

1. 任务简介

本次汇报关注具备工具调用、代码执行和文件处理能力的 LLM Agent 所面临的新型攻击面。报告梳理 SKILL-INJECT、SkillAttack 以及 Agent Harness 安全审计相关工作,讨论如何识别 Skill 文件中的恶意指令、自动构造攻击路径并评估智能体运行环境的安全性。

2. 研究动机

Agent Skill 往往由自然语言说明、脚本、配置与资源文件构成,是扩展智能体能力的重要载体,也可能成为供应链攻击入口。攻击者可将恶意指令隐藏在看似正常的 Skill 描述中,使 Agent 在处理用户任务时自动读取并遵循这些指令。与直接提示注入相比,这类攻击更隐蔽,可能导致数据泄露、数据破坏、后门植入、钓鱼或任务操纵。

3. 方法设计

SKILL-INJECT 构建面向 Skill 文件攻击的评测基准,覆盖多种恶意与上下文相关注入场景,用于比较不同 Agent 的脆弱性。SkillAttack 以自动化红队测试为目标,通过攻击路径精炼将初始攻击线索扩展为更可行的多步路径。Harness 审计则将注意力放在 Agent 的工具接口、权限边界、运行时控制与安全策略,评估攻击是否能够突破实际执行约束。

4. 实施细节

报告介绍了由 Skill、攻击场景和注入任务对构成的基准设计,以及如何根据 Agent 的工具能力、上下文和防护策略评估攻击结果。攻击路径精炼会分析条件依赖与中间步骤,提高红队测试的覆盖率。系统审计则结合工具调用链、文件读写、命令执行与敏感数据访问等维度,检查 Harness 是否为恶意 Skill 提供了可利用的执行通道。

5. 实验与结论

相关研究显示,Skill 文件会显著扩大 Agent 的提示注入与供应链风险面,单纯依赖模型层面的拒答难以覆盖所有场景。报告认为,应在 Skill 安装、内容解析、工具权限、运行时监控和审计验证等环节建立分层防护。未来需要形成更贴近真实生态的安全基准,并研究可解释的攻击检测与最小权限执行机制。

本次组会演示文稿下载