高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践
Claim
Agent Skill 可用性不能靠主观「感觉能用」:高价率运营工作台把评测做成一等公民——约定驱动的目录结构 + Coding Agent 强制产出 + 双引擎评测闭环,把可用性变成可量化、可复跑的工程指标。
Why it matters
与 vault-deep-article / harness 直接同构:没有评测飞轮,Skill 迭代会停在 demo;金标设计陷阱(泄漏/过细/污染/多轮)是评测工程必修课。
Summary
阿里大淘宝:约定驱动(标准目录 skills/skill-data/pinchbench-suite)与 AI 编排固化规范;14 维通用评测 + Skill 专项;二元 LLM Judge;auto-evaluation 大脑 + pinchbench-eval 执行引擎;诚实复盘金标四陷阱与飞轮入口/出口/记忆未完全打通。
Actions
- 为沉淀 skill 建最小评测集(≥20)
- 制定金标防泄漏/污染 checklist
- 周报增加过门率/有用反馈指标
Evidence
- 高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践 (primary): 将评测作为一等公民;约定驱动与 AI 编排;金标设计四大陷阱
Caveats
- 依据 BestBlogs 精选摘要;未读原文全文
Research queries
- (none)
Body
背景
LLM Agent 场景下传统测试失效。团队把「评测」升为一等工程产物,而不是事后检查。
机制
- 约定驱动:标准化目录把规范沉到路径,Coding Agent 按约定自动产出,减少人为违规。
- 评测集:真实业务数据 + AI 生成;通用 14 维 + Skill 专项。
- LLM Judge:二元评分,强调可复现与可解释。
- 双引擎:auto-evaluation(大脑)与 pinchbench-eval(执行)闭环。
- 金标陷阱:信息泄漏、粒度过细、答案污染、多轮覆盖——各有工程应对。
- 飞轮硬骨头:入口/出口/记忆三环节仍未完全解决。
取舍
评测成本前置,换可持续迭代;飞轮不完整时仍会「评得出、改不稳」。
动作
- 为 vault-deep-article / 内部 Skills 建立最小评测集(即使 20 条)。
- 金标设计 checklist:防泄漏、防过细、防污染。
- 周报增加:过门率、浅跟率、用户有用反馈(飞轮出口)。