百级并行 coding agent 在无预算约束时,单月可烧出约 1.3M 美元 / 6000 亿级 token 的真实账单——成本是 harness 的一等公民。
Claim
百级并行 coding agent 在无预算约束时,单月可烧出约 1.3M 美元 / 6000 亿级 token 的真实账单——成本是 harness 的一等公民。
Why it matters
做 Agent 编排与评测时若只比「能不能写对代码」、不比 token 与并发上限,会把生产不可用的方案误判为成功;企业采购也需把员工级无限额度与自付 API 分开看。
Summary
Tom's Hardware 报道 OpenClaw 作者 Peter Steinberger(后加入 OpenAI)晒出 30 天约 $1.3M 的 OpenAI API 用量:约 6030 亿 token、760 万请求,约 100 个 Codex 实例由约 3 人团队驱动。员工侧额度覆盖账单;社区对比指出同等年预算可雇大量工程师。与既有 token 经济学观察一致:agentic coding 的主成本是累积输入与 thrashing。
Actions
- (none)
Evidence
- (none)
Caveats
- (none)
Research queries
- (none)
Body
背景
OpenClaw 是开源 agent 相关项目;作者 Peter Steinberger 在加入 OpenAI 后仍以高并发 coding agent 推进开发。2026 年 5 月前后,其公开的 API 用量截图被 Tom's Hardware、The Next Web 等媒体转载,成为「agent 舰队到底烧多少钱」的公开标尺。
机制
- 规模:约 100 个 Codex 实例、约 3 人团队;30 天约 $1.3M、约 6030 亿 token、约 760 万请求。
- 谁付账:员工侧额度覆盖,不等于中小团队自付 API 可复制。
- 钱花在哪:agentic 主成本是每轮重送的累积输入上下文与重复 view/edit,而非单次 completion 的输出 token。
- 对照:社区指出年化同等预算可雇数十名高级工程师——「无限 agent」未必优于「人 + 节制 AI」。
取舍
- 无并发/日配额的 demo 不能当生产方案。
- 评测必须同时报 pass@k 与 token/$。
- 内部无限额度实验不要直接外推到客户账单。
对我方(Vault / Mode B)
沉淀文应把 成本约束写进 claim 与 actions;settle 后详情页要能读完整论述,而不是只有 frontmatter 摘要。