DFBM

面向开放 Chiplet 生态的无死锁桥接模块

Zhiqiang Chen, Wenwen Fu, Yongwen Wang, Hongwei Zhou
National University of Defense Technology
HPCA 2026
Presenter: wzw
Date: 2026-05-09

三句话看懂

  • 瓶颈: open chiplet ecosystem 要求 plug-and-play,但现有 inter-chiplet deadlock 方案往往依赖 chiplet 内部 NoC / VC / permission network 细节。
  • 方法: 论文把 deadlock resolution 抽到边界桥模块 DFBM,用 coherence transaction dependency 预测包行为,再用 credit management + CVN-DB 做 admission control。
  • 结果: 在 gem5 + Garnet 多芯粒平台上,较 SOTA 带来 1%~7% latency 改善,同时把额外面积控制在 2.5% area overhead

开放生态缺什么

  • UCIe 解决的是 die-to-die interface 标准化,但没有自动解决 package-level routing deadlock
  • 多个内部各自 deadlock-free 的 chiplet 接到 interposer 后,仍可能形成新的 cyclic channel dependency
  • 对开放生态来说,问题不只是“能不能解死锁”,而是解法是否破坏 modularity / portability / vendor independence

现有解法为何不够开放

  • MTR: 依赖 boundary turn restriction,会牵制 floorplan / vertical channel 分布。
  • DeFT: 依赖 VC isolation,要求 chiplet 内部提供额外 VCs,集成成本更高。
  • RC: 用 permission network 做 injection control,但要侵入 chiplet 内部 NoC,验证和复用都更重。
  • 论文的切入点很明确: deadlock resolution 不应再绑定 chiplet 内部实现细节

关键观察

  • coherence protocol 自带因果依赖链: Request -> Fwd-Req -> Response
  • 这些 transaction 依赖会映射成跨 VN 的 packet activity 相关性,因此可在边界上做预测,而不必知道内部每条 route。
  • 另外 VN utilization 明显不对称,这给了共享 deadlock buffer 的空间。

DFBM 总览

  • DFBM 位于 chiplet NoC <-> interposer NoC 边界,只复用已有 VC signaling,不增加额外控制线。
  • 结构分成两块: CM (Credit Management) 负责准入;CVN-DB 负责拥塞时的共享 deadlock buffering。
  • 这篇 paper 最强的点就在这里: 把 deadlock resolution 变成 plug-and-play bridge module

一次 GetS 如何被预测

  • 作者用 R_t0 这类 transaction set 表示“某个 coherence request 最终会诱发哪些响应”,这样 DFBM 就能在边界预留足够 credit。
  • GETS,最直接的例子就是 GetS -> Data;若存在 0..K 个响应的不确定事务,再用 dummy packet 固化上界。

CM 两阶段流控

  • Stage 1: Expected Credit Table 把 coherence type 映射到所需 credit 数。
  • Stage 2: 将 expected credit 与当前 buffer occupancy 比较,决定是 admit 还是 block
  • CM 维护两类 credit: pre-allocated 给主动 Out-Reqreserved 给被外部请求触发的被动响应。

生命周期视角

  • Step 1: In-Req / In-Fwd-Req 进入 DFBM,CM 查表得到该事务在最坏情况下可能诱发的响应上界 Pmax
  • Step 2: 只有当 reserved credit >= Pmax 时才允许进入 chiplet,确保将来返回流量可被吸收。
  • Step 3: 若输出阻塞时间超过阈值,Out-Rsp / Out-Fwd-Req / Out-Req 被转入 deadlock buffer。
  • Step 4: 包退出后同时归还 credit,因此 DFBM 始终控制着“允许形成多少依赖链”。

CVN-DB 共享缓冲

  • CVN-DB 不是简单省面积,而是利用 VN 之间的时序不均衡做跨 VN 共享 deadlock buffer
  • 优先级严格按 Response > Fwd-Req > Request,因为高优先级消息由低优先级消息触发。
  • 这等于强制系统按依赖方向排空消息链,而不是让低优先级请求把缓冲先占满。

为何不会死锁

  • 证明直觉并不复杂: DFBM 保证 chiplet 发向 interposer 的包在最坏情况下都能被完全吸收。
  • 一旦 chiplet -> interposer 垂直通道不再形成阻塞依赖,CDG 中跨 chiplet 的关键环就被切断。
  • 所以作者做的不是 “recovery after deadlock”,而是在边界处让环根本闭合不起来

硬件账本

  • Area: dedicated per-VN deadlock buffer 时 DFBM 约 5%;换成 CVN-DB 后降到 2.5%
  • Power: 明显低于 DeFT 这种额外增加 VC 资源的做法;额外开销主要落在 interposer 侧。
  • Deployability: RC 的 1.9% 开销在 chiplet 内部;DFBM 则把复杂性外置到更便宜、可复用的 interposer。

实验设置

  • Platform: gem5 + Garnet,4 个 homogeneous chiplets + 共享 interposer。
  • Topology: chiplet 与 interposer 都是 4x4 mesh,routing 为 XY
  • Protocol / VN: MESI Two Level3 VNs,每个 VN 评估 2 / 4 VCs
  • Workloads: synthetic (uniform-random / transpose / bit-rotation) + full-system PARSEC
  • Baselines: MTR, DeFT, RC,分别代表 turn restriction、VC isolation、injection control 三条路线。

Synthetic 结果

  • 先读图: 横轴是 injection rate,纵轴是 latency;每组子图对比不同 VC 数和 traffic pattern。
  • 2 VCs 下,DFBM / RCMTR / DeFT 饱和点更靠右,论文给出的解释是 vertical channel 选择更自由
  • 在 uniform traffic 下,DFBM / RC 的 saturation throughput 相对 MTR / DeFT 约高 14%

全系统结果

  • PARSEC 下,DFBM 在各 workload 上都稳定优于 MTR / DeFT / RC,不是只在 synthetic traffic 才成立。
  • uniform channels: 相比 MTR 延迟下降 1%~7%,平均 3%
  • non-uniform channels: 论文还报告相对 MTR 仍有 1%~4% 降低,平均 2%,说明它对 floorplan / link asymmetry 更稳。

敏感性分析

  • VC=4 时继续增大 CVN-DB 容量几乎不提升性能,说明瓶颈已转向 vertical channel。
  • VC=2 时 buffer 容量确实重要,但超过某个阈值后收益快速递减。

共享缓冲代价

  • 共享缓冲相对 dedicated buffer 只有很小的性能损失,说明 priority-based admission 没有明显伤到 steady-state 性能。
  • 换来的收益是 area 从 dedicated per-VN 方案的 5% 压到 2.5%,这是 CVN-DB 最大的性价比来源。

结论

  • 论文最重要的贡献不是又提一个 routing policy,而是把 inter-chiplet deadlock resolution 抽象成边界桥模块
  • CM 用 protocol dependency 预测未来响应并控制准入,CVN-DB 用依赖顺序做跨 VN 排空。
  • 最终在不改 chiplet 内部 NoC 的前提下,拿到 1%~7% latency 改善与 2.5% area overhead

我的评价

  • 优点: 抓住了 open chiplet ecosystem 的真实痛点,抽象层次选得很准,工程闭环也完整。
  • 局限: 实验平台仍是 4x4 mesh + XY + homogeneous chiplets,对“arbitrary heterogeneous chiplets”的论断还偏 architecture claim。
  • 缺的实验: 更想看 mixed topology / mixed routing / mixed vendor metadata 的真正异构组合。
  • 后续方向: 把 expected credit table 自动从 coherence spec 生成,并验证在更复杂协议上的保守性成本。