阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟
Claim
专家级 Agent 能力鸿沟常出在「分层规则应用」而非检索本身:HSCodeComp 用海关 HS 编码场景证明,最强 Agent 与人类专家仍有约 45% 差距,评测必须考逐级工具调用与严格规则应用。
Why it matters
评测集设计原则:Deep Search + 分层规则;可迁移到任何强合规/强规程领域的 agent 验收。
Summary
ACL 2026 最佳资源论文 HSCodeComp:专家级 Deep Search 基准,评估分层规则应用;揭示约 45% 能力鸿沟。
Actions
- 强规程业务自建分层规则评测
- 验收检查工具调用轨迹合规
- 差距大的层优先 harness/Gate
Evidence
- 阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟 (primary): 分层规则应用能力鸿沟约 45%;专家级 Deep Search 评测集
Caveats
- 差距数字来自论文/报道摘要
Research queries
- (none)
Body
背景
通用问答榜测不出专家规程任务的真实能力。
机制
- 任务:多模态商品档案 + 分层关税规则 + 历史裁定库。
- 专家标注构建高难样本。
- 评估逐级工具调用与规则应用,而非一次检索命中。
取舍
基准建设极贵;但能暴露「看起来会搜、实际不会用规则」的假强。
动作
- 强规程业务 agent 自建分层规则评测,不只用通用榜。
- 验收看中间工具轨迹是否合规。
- 人机差距大的层优先做 harness/Gate,而非只换大模型。