知识库

Eye(FR) → Mill(skill) → Library(/app)

← 返回列表
BestBlogs.dev · 2026-05-15 · 已成文 · 来源 file

垂直 Agent 评测要产品化为闭环:结构化多维 Benchmark + LLM-as-judge + 人工抽样验收 + 自动报告;家居导购实践显示可把主观验收变成可复跑指标(文称 judge 准确率 91.9%)。

为什么重要

与高价率评测工作台同构:评测一等公民;导购场景的 22 维结构可迁移到其他业务 Agent。

正文

面向智能导购的 Agent 评测实践

Claim

垂直 Agent 评测要产品化为闭环:结构化多维 Benchmark + LLM-as-judge + 人工抽样验收 + 自动报告;家居导购实践显示可把主观验收变成可复跑指标(文称 judge 准确率 91.9%)。

Why it matters

与高价率评测工作台同构:评测一等公民;导购场景的 22 维结构可迁移到其他业务 Agent。

Summary

大淘宝:家居导购 Agent 自动化评测链路——Benchmark/LLM judge/人工抽检/报告;gpt51 优于线上 qwen3-vl 约 16.4%(文称)。

Actions

  • 为业务 Agent 建最小结构化评测维
  • 人工抽样校准 LLM judge
  • 上线门禁绑定评测报告

Evidence

Caveats

  • 指标来自团队实践摘要

Research queries

  • (none)

Body

背景

人工评测贵、主观、难复现,阻塞 Agent 迭代。

机制

  1. 结构化 Benchmark:基础/专业/补充指令 + 用户画像等 22 二级维。
  2. LLM-as-judge 自动打分 + 人工抽样校准。
  3. 自动化报告驱动模型/提示迭代。

取舍

Judge 偏差需抽样纠偏;Benchmark 建设前置成本高。

动作

  1. 业务 Agent 先建最小结构化评测维,再扩模型。
  2. Judge 准确率用人工抽样持续校准。
  3. 上线门禁绑定评测报告,不靠 demo。

结合的源文章

主源
面向智能导购的 Agent 评测实践
打开原文 ↗

原文快照

展开 / 收起快照

📌 一句话摘要

本文提出一套面向家居导购 Agent 的自动化评估链路,基于结构化多维度 Benchmark 和 LLM-as-a-judge 实现 91.9% 准确率的自动评分,并量化对比发现 gpt51 最优,较线上模型 qwen3-vl 提升 16.4%。

📝 详细摘要

本文来自大淘宝技术团队,分享了一套面向家居导购 Agent 的端到端自动化评估实践。文章首先指出传统人工评测成本高、主观性强、难以复现的问题,并提出了一个由 Benchmark 创建、LLM 模拟人工评测、人工抽样验收和自动化评测报告四个模块构成的闭环方案。核心创新在于构建了包含基础指令、专业指令、补充指令和用户画像四大一级维度、22 个二级维度的结构化评测体系,并采用 LLM-as-a-judge 进行自动评分,经人工校验准确率达 91.9%。通过该链路,团队对四种基座模型(gpt51、gemini25、外部模型 XX、qwen3-vl)进行了横向对比,发现 gpt51 综合表现最佳,总分 0.680,较当前线上模型 qwen3-vl 提升 16.4%。文章还深入分析了当前 Agent 的三大核心瓶颈:无法识别已有家具导致重复推荐、未抓住用户核心需求导致跑题、推荐过量无关商品。该评测体系为高频迭代下的 Agent 能力量化追踪提供了可复用的工程化方案。

💡 主要观点

  1. 构建了结构化多维度评测体系,覆盖四大一级维度和 22 个二级维度。 评测体系围绕基础指令(商品选择)、专业指令(空间设计)、补充指令(偏好与附加条件)和用户画像四类核心能力展开,二级维度用于检查细节完成度,使自动打分具备统一标准和可解释性。
  2. LLM-as-a-judge 自动评分准确率达 91.9%,可替代大部分人工评测。 通过多种大模型作为评审员进行交叉评分,并与人工标注的 GT 对比,验证了自动评测的可靠性,为高频迭代下的性能追踪提供了高效手段。
  3. 量化对比发现 gpt51 最优,较线上模型 qwen3-vl 提升 16.4%。 在四种基座模型的横向对比中,gpt51 总分 0.680 位列第一,优势主要体现在基础指令与专业指令两项核心能力上,而 qwen3-vl 在四个维度得分均为最低。
  4. 识别出三大核心瓶颈:无法识别已有家具、未抓住核心需求、推荐过量。 问题分析揭示了当前大模型在多模态理解、需求抽取与约束控制方面的关键短板,为后续优化提供了明确方向。

💬 文章金句

  • 我们搭建了端到端自动化评估链路,基于 LLM-as-a-judge 实现自动评分,评判准确率达到 91.9%,显著提升评测效率与准确性。
  • 从量化结果来看,目前四种基座模型呈现出明显的分层格局:gpt51 综合表现最佳,相比 qwen3-vl 提升 16.4%。
  • 问题分析进一步揭示了大模型在真实搭配任务中的核心瓶颈:无法识别已有家具、难以抓住用户核心需求、以及过度生成无关商品。
  • 本次评估体系的价值,在于提供了一种可持续运行的'能力量化方法'。

📊 文章信息

AI 初评:92
来源:大淘宝技术
作者:大淘宝技术
分类:人工智能
语言:中文
阅读时间:24 分钟
字数:5774
标签: Agent 评测, LLM-as-a-Judge, 智能导购, 多模态, Benchmark