面向智能导购的 Agent 评测实践
Claim
垂直 Agent 评测要产品化为闭环:结构化多维 Benchmark + LLM-as-judge + 人工抽样验收 + 自动报告;家居导购实践显示可把主观验收变成可复跑指标(文称 judge 准确率 91.9%)。
Why it matters
与高价率评测工作台同构:评测一等公民;导购场景的 22 维结构可迁移到其他业务 Agent。
Summary
大淘宝:家居导购 Agent 自动化评测链路——Benchmark/LLM judge/人工抽检/报告;gpt51 优于线上 qwen3-vl 约 16.4%(文称)。
Actions
- 为业务 Agent 建最小结构化评测维
- 人工抽样校准 LLM judge
- 上线门禁绑定评测报告
Evidence
- 面向智能导购的 Agent 评测实践 (primary): 结构化 Benchmark + LLM-as-a-judge;91.9% 自动评分准确率
Caveats
- 指标来自团队实践摘要
Research queries
- (none)
Body
背景
人工评测贵、主观、难复现,阻塞 Agent 迭代。
机制
- 结构化 Benchmark:基础/专业/补充指令 + 用户画像等 22 二级维。
- LLM-as-judge 自动打分 + 人工抽样校准。
- 自动化报告驱动模型/提示迭代。
取舍
Judge 偏差需抽样纠偏;Benchmark 建设前置成本高。
动作
- 业务 Agent 先建最小结构化评测维,再扩模型。
- Judge 准确率用人工抽样持续校准。
- 上线门禁绑定评测报告,不靠 demo。