Agent 写代码的 token 成本主要由「每轮重送的累积输入上下文」驱动,模型选择与无效探索比任务难度更能拉开账单。
Claim
Agent 写代码的 token 成本主要由「每轮重送的累积输入上下文」驱动,模型选择与无效探索比任务难度更能拉开账单。
Why it matters
做 Agent 编排/评测时若只看模型能力而不测请求级 token 与重复编辑,会系统性低估生产费用并误判 harness 优劣。
Summary
文章基于多模型 SWE-bench 类任务观察:agentic coding 相对 chat 可达约千倍 token;输入:输出比例极高;同正确结果下不同模型可差约 1.5M token;高方差与重复读改文件相关。
Actions
- (none)
Evidence
- (none)
Caveats
- (none)
Research queries
- (none)
Body
背景
Will Hackett 对 agent token 消耗的观察,把「贵」从感觉变成可对照的结构:不是偶尔多问一句,而是每轮把历史上下文重新喂给模型。
机制
- 输入主导:input:output 可到极高比例,账单跟上下文长度强相关。
- 模型方差:同一批已解任务,有的模型多烧约 1.5M token。
- 无效探索:反复 view/edit 同一文件是可观测的浪费信号。
- 重置:主动截断线程比「一直聊下去」更省。
取舍
- 简单任务路由廉价模型。
- 埋点:用户/项目/模型/阶段。
- 发现 thrashing 就重置或换策略,而不是加大 max_steps。
对我方
与 OpenClaw 1.3M 账单互证:一个是实验室方差,一个是生产舰队极端值。Vault 文章应把两者都挂在「成本一等公民」主题下。