Eye(FR) → Mill(skill) → Library(/app)
正典:已过质量门 / 已成文的 library 知识(has_ka)。人读与 AI 检索默认只看这里。
2026 Q2 的 Agent 主线不是「更大模型」:通用 Agent 成入口、MCP+Harness 支撑垂直化、Tokenmaxxing 因低有效反馈退潮——工程重点应转向 harness、评测与成本结构,而非堆 token。
专家级 Agent 能力鸿沟常出在「分层规则应用」而非检索本身:HSCodeComp 用海关 HS 编码场景证明,最强 Agent 与人类专家仍有约 45% 差距,评测必须考逐级工具调用与严格规则应用。
直播数字人要从静态 Workflow 升级到 Agentic,关键不只是「多叫几次工具」:需 AgentTuning 蒸馏降延迟、RLVR 压幻觉,再用 Multi-Agent RL 把多角色协作训进策略,才能同时要低延迟与事实正确。
AI Coding 交付质量要靠「验证左移」而非事后人审:操作规则 + 代码验证 Skill + 运行时/视觉验证 + 流水线复审组成关卡链,让 Agent 在改动当下过工程门,而不是靠最终大 PR 碰运气。
【第 3697 期】Claude Code 自动记忆功能详解:告别重复交代,让 AI 记住你的项目 — 来自收藏队列的工程/Agent 相关条目,沉淀为可检索 claim 卡。
围绕「造数据、搭 RAG 总超预算?北大这套开源 Skills 帮省 80%成本」:从 agent/MCP/harness/成本与工程化视角抽取可迁移结论,并落到可执行动作。
如何用 Skill 做竞品调研?:与 Agent/MCP/harness/Claude 工程化相关,值得纳入处理集沉淀。
AI 视频生成工作流要用「分镜图驱动」把叙事约束前置:先稳定镜头语言再生成动态,比端到端一次出片更可控、可迭代。
垂直域 AI 工作流需要「集合管理器」而非散落脚本:Wasup 一类工具把同域多条 workflow 收成可运营资产,降低一人一脚本的熵。
还人肉查?日志诊断 Skill:用 AI+MCP 一键解决 bug — 来自收藏队列的工程/Agent 相关条目,沉淀为可检索 claim 卡。
围绕「面向智能导购的 Agent 评测实践」:从 agent/MCP/harness/成本与工程化视角抽取可迁移结论,并落到可执行动作。
WWW'26 | 跨任务自适应的 Multi-Agent 协作新范式 — 来自收藏队列的工程/Agent 相关条目,沉淀为可检索 claim 卡。
腾讯开源 Agent 记忆技术方案,Token 消耗最高降低 61%:与 Agent/MCP/harness/Claude 工程化相关,值得纳入处理集沉淀。
给 Agent「贴文档」不可扩展:应用 Skill 把开源库源码与文档变成可检索上下文,从根上降低过时 API 与冷门库幻觉,而不是每次人手贴 README。
首个 Java Harness Framework 来了|AgentScope 把 OpenClaw 带到企业分布式场景:与 Agent/MCP/harness/Claude 工程化相关,值得纳入处理集沉淀。
Browser Use:为 Agent 构建 Runtime Harness — 来自收藏队列的工程/Agent 相关条目,沉淀为可检索 claim 卡。
数据研发 Agent「能跑但不值得信」的根因是 LLM 不擅长长程约束,而数仓极度依赖长程约束——必须用 Harness 六支柱(Identity/Orchestration/Context/Gate/Recovery/Evolution)把可控性从模型转移到工程体系。
面向 Agent 的领域工作台不应只是 API 包装:AI MediaKit 用 100+ 原子能力 + CLI + Skill,并把长任务的 task_id/轮询/结果回收下沉到工具层,让 Agent 做编排而不是自己实现异步状态机。
数据研发里 NL2SQL 难落地的根因不是「模型不够」,而是缺知识工程 + Harness:用 Multi-Agent 工作流、人工 Gate、技能幻觉检测与空间隔离,把人从「写 SQL」推到「做设计与审批」。
PC 端 AI 测试 Skill 要用「编译管线 + 阶段门控 + 失败自学习」,而不是让 agent 在浏览器里自由乱点:四趟编译把自然语言变成可执行步骤,七阶段门控避免无效执行,known-failures 沉淀把错误变成可复用知识。
Agent Skill 可用性不能靠主观「感觉能用」:高价率运营工作台把评测做成一等公民——约定驱动的目录结构 + Coding Agent 强制产出 + 双引擎评测闭环,把可用性变成可量化、可复跑的工程指标。
项目管理工具若内建 story points 与伪敏捷仪式会鼓励错误度量;Mainline 将故事尺寸硬编码为 1、用 start→release 时间分布替代规划扑克——agent 团队同样应用可观测吞吐替代虚荣指标。
存量生产工程的 AI Native 演进应分级(AINMM 五级):从点状工具到架构级嵌入——跳级「全面 agent 化」会放大不可维护性,成熟度模型用来对齐预期与投资节奏。
Agent 不可只靠提示词自律:要用 Hook 在工具调用前后拦截偷懒、越权与失忆——治理发生在执行路径上,而不是写在系统提示里当装饰。