BIV 对 Agent Skill 做「声明能力 ⊆ 实际能力」的类型化比对,在 OpenClaw 近 5 万 skill 上发现 80% 偏离,并把技能包本身当作需预运行审计的信任边界。
Claim
BIV 对 Agent Skill 做「声明能力 ⊆ 实际能力」的类型化比对,在 OpenClaw 近 5 万 skill 上发现 80% 偏离,并把技能包本身当作需预运行审计的信任边界。
Why it matters
MCP/skill 插件化把文件系统、凭据、网络与 shell 交给第三方工件;描述与实现不一致是供应链主风险。BIV 给出可规模化的预运行验证范式,直接服务 sandbox 与插件治理。
Summary
既有安全工作多盯恶意 prompt 与运行时风险,却很少校验 skill 工件(代码+指令+元数据)是否与声明一致。 共享能力 taxonomy(约 29 能力 / 7 族):声明轨(YAML/元数据+LLM 抽取)与实际轨(静态/污点/模式 + 指令侧 LLM)。偏离分类、根因(疏忽 vs 对抗)、恶意检测。OpenClaw 49943 skills:80% 有偏离;81.1% 疏忽 / 18.9% 对抗;5% 预测多阶段攻击链。906-skill 基准 F1=0.946。 静态为主,可能漏动态/混淆;预测≠已确认 exploit。需配合运行时沙箱与权限模型。 安装 skill/MCP 前做声明-实现比对门禁;优先审查凭据/指令覆盖/多阶段链;文档补全可消化多数非对抗偏离。
Actions
- (none)
Evidence
- (none)
Caveats
- (none)
Research queries
- (none)
Body
正文
背景
既有安全工作多盯恶意 prompt 与运行时风险,却很少校验 skill 工件(代码+指令+元数据)是否与声明一致。 共享能力 taxonomy(约 29 能力 / 7 族):声明轨(YAML/元数据+LLM 抽取)与实际轨(静态/污点/模式 + 指令侧 LLM)。偏离分类、根因(疏忽 vs 对抗)、恶意检测。OpenClaw 49943 skills:80% 有偏离;81.1% 疏忽 / 18.9% 对抗;5% 预测多阶段攻击链。906-skill 基准 F1=0.946。 静态为主,可能漏动态/混淆;预测≠已确认 exploit。需配合运行时沙箱与权限模型。 安装 skill/MCP 前做声明-实现比对门禁;优先审查凭据/指令覆盖/多阶段链;文档补全可消化多数非对抗偏离。
机制
见 claim 与证据链接;本条为 Mode B 契约规范化重写,保留既有结论。
取舍
证据与深度以原始 research 为准;未重新外采时以 primary URL 与既有 claim 为界。
动作
打开原文核对;将 claim 纳入团队实践清单;需要更深研时再开 Mode C。