淘宝直播数字人 AgenticRL 实践:从 RLVR 到 MultiAgent RL
Claim
直播数字人要从静态 Workflow 升级到 Agentic,关键不只是「多叫几次工具」:需 AgentTuning 蒸馏降延迟、RLVR 压幻觉,再用 Multi-Agent RL 把多角色协作训进策略,才能同时要低延迟与事实正确。
Why it matters
生产 Agentic 系统的训练-服务闭环样本;与评测/门控、多 agent 编排直接相关。
Summary
淘宝直播数字人:Workflow→Agentic;AgentTuning 蒸馏、RLVR、Multi-Agent RL;延迟与事实正确性改进(文称)。
Actions
- 分清 workflow 壳与可学习策略层
- 幻觉用可验证奖励约束
- 延迟预算写入验收指标
Evidence
- 淘宝直播数字人 AgenticRL 实践:从 RLVR 到 MultiAgent RL (primary): 从 Workflow 到 Agentic;AgentTuning、RLVR、Multi-Agent RL
Caveats
- 指标来自团队实践摘要
Research queries
- (none)
Body
背景
静态意图-检索-生成链路难全局上下文与自我纠错。
机制
- Agentic:按需工具调用、自我纠错、多模态响应。
- AgentTuning 蒸馏:教师思维链→小模型,压延迟。
- RLVR:正确性/帮助性/长度奖励减幻觉。
- Multi-Agent RL:多角色协作策略。
取舍
训练与评测成本高;延迟与正确性需联合优化。
动作
- 生产 agent 分清 workflow 壳与可学习策略层。
- 幻觉用可验证奖励,而非只靠 prompt。
- 延迟预算写入验收,不只看 demo 效果。