知识库

Eye(FR) → Mill(skill) → Library(/app)

← 返回列表
AI 沉淀 · 2026-07-18 · 已成文 · 来源 file

Agent Skill 可用性不能靠主观「感觉能用」:高价率运营工作台把评测做成一等公民——约定驱动的目录结构 + Coding Agent 强制产出 + 双引擎评测闭环,把可用性变成可量化、可复跑的工程指标。

为什么重要

与 vault-deep-article / harness 直接同构:没有评测飞轮,Skill 迭代会停在 demo;金标设计陷阱(泄漏/过细/污染/多轮)是评测工程必修课。

正文

高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践

Claim

Agent Skill 可用性不能靠主观「感觉能用」:高价率运营工作台把评测做成一等公民——约定驱动的目录结构 + Coding Agent 强制产出 + 双引擎评测闭环,把可用性变成可量化、可复跑的工程指标。

Why it matters

与 vault-deep-article / harness 直接同构:没有评测飞轮,Skill 迭代会停在 demo;金标设计陷阱(泄漏/过细/污染/多轮)是评测工程必修课。

Summary

阿里大淘宝:约定驱动(标准目录 skills/skill-data/pinchbench-suite)与 AI 编排固化规范;14 维通用评测 + Skill 专项;二元 LLM Judge;auto-evaluation 大脑 + pinchbench-eval 执行引擎;诚实复盘金标四陷阱与飞轮入口/出口/记忆未完全打通。

Actions

  • 为沉淀 skill 建最小评测集(≥20)
  • 制定金标防泄漏/污染 checklist
  • 周报增加过门率/有用反馈指标

Evidence

Caveats

  • 依据 BestBlogs 精选摘要;未读原文全文

Research queries

  • (none)

Body

背景

LLM Agent 场景下传统测试失效。团队把「评测」升为一等工程产物,而不是事后检查。

机制

  1. 约定驱动:标准化目录把规范沉到路径,Coding Agent 按约定自动产出,减少人为违规。
  2. 评测集:真实业务数据 + AI 生成;通用 14 维 + Skill 专项。
  3. LLM Judge:二元评分,强调可复现与可解释。
  4. 双引擎:auto-evaluation(大脑)与 pinchbench-eval(执行)闭环。
  5. 金标陷阱:信息泄漏、粒度过细、答案污染、多轮覆盖——各有工程应对。
  6. 飞轮硬骨头:入口/出口/记忆三环节仍未完全解决。

取舍

评测成本前置,换可持续迭代;飞轮不完整时仍会「评得出、改不稳」。

动作

  1. 为 vault-deep-article / 内部 Skills 建立最小评测集(即使 20 条)。
  2. 金标设计 checklist:防泄漏、防过细、防污染。
  3. 周报增加:过门率、浅跟率、用户有用反馈(飞轮出口)。

结合的源文章

主源
高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践
打开原文 ↗