知识库

Eye(FR) → Mill(skill) → Library(/app)

← 返回列表
Hacker News · 2026-05-18 · 已成文 · 来源 file

Agent 写代码的 token 成本主要由「每轮重送的累积输入上下文」驱动,模型选择与无效探索比任务难度更能拉开账单。

为什么重要

做 Agent 编排/评测时若只看模型能力而不测请求级 token 与重复编辑,会系统性低估生产费用并误判 harness 优劣。

正文

Agent 写代码的 token 成本主要由「每轮重送的累积输入上下文」驱动,模型选择与无效探索比任务难度更能拉开账单。

Claim

Agent 写代码的 token 成本主要由「每轮重送的累积输入上下文」驱动,模型选择与无效探索比任务难度更能拉开账单。

Why it matters

做 Agent 编排/评测时若只看模型能力而不测请求级 token 与重复编辑,会系统性低估生产费用并误判 harness 优劣。

Summary

文章基于多模型 SWE-bench 类任务观察:agentic coding 相对 chat 可达约千倍 token;输入:输出比例极高;同正确结果下不同模型可差约 1.5M token;高方差与重复读改文件相关。

Actions

  • (none)

Evidence

  • (none)

Caveats

  • (none)

Research queries

  • (none)

Body

背景

Will Hackett 对 agent token 消耗的观察,把「贵」从感觉变成可对照的结构:不是偶尔多问一句,而是每轮把历史上下文重新喂给模型。

机制

  1. 输入主导:input:output 可到极高比例,账单跟上下文长度强相关。
  2. 模型方差:同一批已解任务,有的模型多烧约 1.5M token。
  3. 无效探索:反复 view/edit 同一文件是可观测的浪费信号。
  4. 重置:主动截断线程比「一直聊下去」更省。

取舍

  • 简单任务路由廉价模型。
  • 埋点:用户/项目/模型/阶段。
  • 发现 thrashing 就重置或换策略,而不是加大 max_steps。

对我方

与 OpenClaw 1.3M 账单互证:一个是实验室方差,一个是生产舰队极端值。Vault 文章应把两者都挂在「成本一等公民」主题下。

结合的源文章

主源
Observations on AI agent token consumption
打开原文 ↗

原文快照

展开 / 收起快照