知识库

Eye(FR) → Mill(skill) → Library(/app)

← 返回列表
Hacker News · 2026-05-13 · 已成文 · 来源 file

BIV 对 Agent Skill 做「声明能力 ⊆ 实际能力」的类型化比对,在 OpenClaw 近 5 万 skill 上发现 80% 偏离,并把技能包本身当作需预运行审计的信任边界。

为什么重要

MCP/skill 插件化把文件系统、凭据、网络与 shell 交给第三方工件;描述与实现不一致是供应链主风险。BIV 给出可规模化的预运行验证范式,直接服务 sandbox 与插件治理。

正文

BIV 对 Agent Skill 做「声明能力 ⊆ 实际能力」的类型化比对,在 OpenClaw 近 5 万 skill 上发现 80% 偏离,并把技能包本身当作需预运行审计的信任边界。

Claim

BIV 对 Agent Skill 做「声明能力 ⊆ 实际能力」的类型化比对,在 OpenClaw 近 5 万 skill 上发现 80% 偏离,并把技能包本身当作需预运行审计的信任边界。

Why it matters

MCP/skill 插件化把文件系统、凭据、网络与 shell 交给第三方工件;描述与实现不一致是供应链主风险。BIV 给出可规模化的预运行验证范式,直接服务 sandbox 与插件治理。

Summary

既有安全工作多盯恶意 prompt 与运行时风险,却很少校验 skill 工件(代码+指令+元数据)是否与声明一致。 共享能力 taxonomy(约 29 能力 / 7 族):声明轨(YAML/元数据+LLM 抽取)与实际轨(静态/污点/模式 + 指令侧 LLM)。偏离分类、根因(疏忽 vs 对抗)、恶意检测。OpenClaw 49943 skills:80% 有偏离;81.1% 疏忽 / 18.9% 对抗;5% 预测多阶段攻击链。906-skill 基准 F1=0.946。 静态为主,可能漏动态/混淆;预测≠已确认 exploit。需配合运行时沙箱与权限模型。 安装 skill/MCP 前做声明-实现比对门禁;优先审查凭据/指令覆盖/多阶段链;文档补全可消化多数非对抗偏离。

Actions

  • (none)

Evidence

  • (none)

Caveats

  • (none)

Research queries

  • (none)

Body

正文

背景

既有安全工作多盯恶意 prompt 与运行时风险,却很少校验 skill 工件(代码+指令+元数据)是否与声明一致。 共享能力 taxonomy(约 29 能力 / 7 族):声明轨(YAML/元数据+LLM 抽取)与实际轨(静态/污点/模式 + 指令侧 LLM)。偏离分类、根因(疏忽 vs 对抗)、恶意检测。OpenClaw 49943 skills:80% 有偏离;81.1% 疏忽 / 18.9% 对抗;5% 预测多阶段攻击链。906-skill 基准 F1=0.946。 静态为主,可能漏动态/混淆;预测≠已确认 exploit。需配合运行时沙箱与权限模型。 安装 skill/MCP 前做声明-实现比对门禁;优先审查凭据/指令覆盖/多阶段链;文档补全可消化多数非对抗偏离。

机制

见 claim 与证据链接;本条为 Mode B 契约规范化重写,保留既有结论。

取舍

证据与深度以原始 research 为准;未重新外采时以 primary URL 与既有 claim 为界。

动作

打开原文核对;将 claim 纳入团队实践清单;需要更深研时再开 Mode C。

结合的源文章

主源
Behavioral Integrity Verification for AI Agent Skills
打开原文 ↗

原文快照

展开 / 收起快照

Article URL: https://arxiv.org/abs/2605.11770

Comments URL: https://news.ycombinator.com/item?id=48123574

Points: 1

# Comments: 0