CCD 感知编排
Claim
多 CCD CPU 上向量检索的瓶颈往往不在索引公式,而在跨 CCD 缓存失效、热表同驻污染与全局 work-stealing 破坏亲和性;冷热感知映射 + 拓扑感知窃取可带来数倍吞吐与数量级长尾改善——Agent/RAG 基座的系统层与算法层必须一起设计。
Why it matters
自建 ANNS 服务支撑 agent 检索时,只调 HNSW/IVF 参数会漏掉调度拓扑;CCD/NUMA 感知直接影响 SLA 与机器成本。
Summary
小红书引擎 ICDE 2026:针对 AMD EPYC 多 CCD,提出统一任务提交、热冷配对映射、三级窃取(本地/同CCD/跨CCD)。摘要称最高约 3.7× 吞吐、P999 降 60–90%、跨 CCD 窃取率大幅下降。
Actions
- 检查 ANNS 的 CCD/NUMA 亲和
- 度量跨 CCD steal 与 cache miss
- 拓扑优化与索引调优并列排期
Evidence
- CCD 感知编排摘要 (primary): 吞吐量最高提升 3.7 倍,P999 长尾延迟降低 60%-90%
Caveats
- 基于 BestBlogs 摘要;未读 ICDE 原文
Research queries
- (none)
Body
背景
工业级向量检索在 Chiplet CPU 上常达不到核数线性扩展。
机制
- 统一任务接口兼容 HNSW/IVF。
- 在线流量估计:热表与冷表配对同 CCD,避免多热同驻。
- 层级 work-stealing:优先本地与同 CCD,跨 CCD 降级。
取舍
调度复杂度↑,换吞吐与长尾;对其它负载需复测。
动作
- 检查 ANNS 部署是否跨 CCD 无亲和。
- 度量跨 CCD steal 与 L3 miss。
- 将拓扑感知列入与索引参数同级的优化 backlog。