PagePilot — PC 端 AI 测试 Skill 设计与实战
Claim
PC 端 AI 测试 Skill 要用「编译管线 + 阶段门控 + 失败自学习」,而不是让 agent 在浏览器里自由乱点:四趟编译把自然语言变成可执行步骤,七阶段门控避免无效执行,known-failures 沉淀把错误变成可复用知识。
Why it matters
Agent 做 UI/业务验收时,自由探索 ROI 差且不稳;组件化知识库 + CDP + DB 验证 + 门控是可上生产的 harness 形态。
Summary
支付宝商家中心场景:AI Agent + 组件知识库 + 浏览器自动化 + DB 验证。四趟编译、分层组件查找、Phase0–6 门控、known-failures 自学习。答疑助手 137 用例发现 64 Bug,号称省 70% 人力。
Actions
- 为 UI agent 测试加阶段门控
- 建立 known-failures.md 并强制复用
- 高风险步骤禁用自由探索
Evidence
- PagePilot — PC 端 AI 测试 Skill 设计与实战 (primary): 四趟编译管线;七阶段门控;known-failures 自学习;137 用例 64 Bug
Caveats
- 依据 BestBlogs 摘要与案例数据;ROI 数字来自原文转述
Research queries
- (none)
Body
背景
复杂 SPA/微前端上,纯 agent 点点点不稳定。需要把业务交互知识组件化,并把执行拆成可门控阶段。
机制
- 四趟编译:风格检测 → 元数据 → 组件匹配/置信度 → 可执行步骤。
- 组件查找链:local-components → 平台 components → 未匹配兜底。
- 七阶段门控:环境/登录/ID/DB/比对/报告/归档,未满足即停。
- 失败自学习:known-failures.md 记录错误码与处理建议。
取舍
工程与维护成本高,换稳定性与可复用错误知识;组件库需要业务共建。
动作
- 内部 UI agent 测试是否缺「阶段门控」。
- 建立 known-failures 知识文件并强制命中复用。
- 高风险步骤(登录、支付)禁止 agent 自由探索,必须确定性脚本/门控。