Agent Behavioral Contracts 把 Design-by-Contract 落到自治 Agent:用可运行时强制的 (P,I,G,R) 规格与 (p,δ,k) 概率满足度约束 LLM 非确定性,并在 drift 上给出可证界。
Claim
Agent Behavioral Contracts 把 Design-by-Contract 落到自治 Agent:用可运行时强制的 (P,I,G,R) 规格与 (p,δ,k) 概率满足度约束 LLM 非确定性,并在 drift 上给出可证界。
Why it matters
生产 Agent 编排与评测长期缺形式化行为边界;ABC 直接服务 harness 里的硬约束、软违规检测与多 Agent 组合安全,是评测与治理工程化的可落地抽象。
Summary
传统软件靠 API/类型/断言定义正确性;LLM Agent 多依赖 prompt 与自然语言,易出现行为漂移、治理失效与不可组合。 ABC 合同 C=(P,I,G,R):Preconditions、Invariants、Governance、Recovery。定义 (p,δ,k)-satisfaction 刻画非确定性下的合规;Drift Bounds Theorem:当恢复率 γ 超过自然漂移率 α 时,期望漂移界为 D*=α/γ。提供多 Agent 链组合条件与概率退化界。实现库 AgentAssert;基准 AgentContract-Bench(200 场景、7 模型、1980 sessions)。 优点:硬约束合规高、软违规可观测、开销 <10ms/action。代价:需写合同与恢复策略;对 prompt-only 工作流有迁移成本;理论界依赖 γ/α 估计。 在关键路径(写文件、外呼、支付)先落 hard invariants + recovery;用 soft violation 计数进评测看板;多 Agent 管线对每 hop 声明可组合 contract。
Actions
- (none)
Evidence
- (none)
Caveats
- (none)
Research queries
- (none)
Body
正文
背景
传统软件靠 API/类型/断言定义正确性;LLM Agent 多依赖 prompt 与自然语言,易出现行为漂移、治理失效与不可组合。 ABC 合同 C=(P,I,G,R):Preconditions、Invariants、Governance、Recovery。定义 (p,δ,k)-satisfaction 刻画非确定性下的合规;Drift Bounds Theorem:当恢复率 γ 超过自然漂移率 α 时,期望漂移界为 D*=α/γ。提供多 Agent 链组合条件与概率退化界。实现库 AgentAssert;基准 AgentContract-Bench(200 场景、7 模型、1980 sessions)。 优点:硬约束合规高、软违规可观测、开销 <10ms/action。代价:需写合同与恢复策略;对 prompt-only 工作流有迁移成本;理论界依赖 γ/α 估计。 在关键路径(写文件、外呼、支付)先落 hard invariants + recovery;用 soft violation 计数进评测看板;多 Agent 管线对每 hop 声明可组合 contract。
机制
见 claim 与证据链接;本条为 Mode B 契约规范化重写,保留既有结论。
取舍
证据与深度以原始 research 为准;未重新外采时以 primary URL 与既有 claim 为界。
动作
打开原文核对;将 claim 纳入团队实践清单;需要更深研时再开 Mode C。