Agent attribution 用厂商侧 canary 协议把「观察到的 Agent 交互」关联回托管账号,并在对抗过滤下用效用绑定 canary 形成防御方不对称。
Claim
Agent attribution 用厂商侧 canary 协议把「观察到的 Agent 交互」关联回托管账号,并在对抗过滤下用效用绑定 canary 形成防御方不对称。
Why it matters
多 Agent/托管模型场景下危害行为常无法通知运营方或终止会话;归属是评测与滥用治理的缺失环节。
Summary
arXiv 归属方案:canary→模型日志→窄窗检索;内部先做 account→session→tool 血缘。
Actions
- (none)
Evidence
- (none)
Caveats
- (none)
Research queries
- (none)
Body
正文
背景
Agent 自主行动可造成伤害,但外部观察者难定位托管会话背后账号。
机制
授权方注入 canary;Agent 转发后进入会话日志;vendor 窄时间窗检索恢复 session/account。对抗场景用效用绑定 robust canary。
取舍
需 vendor 协作;公共开放追踪有伦理风险;本地自托管不适用同一路径。
动作
先做内部血缘与审计钩子,再谈跨厂商协议。