Zhiqiang Chen, Wenwen Fu, Yongwen Wang, Hongwei Zhou
National University of Defense Technology
HPCA 2026
Presenter: wzw
Date: 2026-05-09
open chiplet ecosystem 要求 plug-and-play,但现有 inter-chiplet deadlock 方案往往依赖 chiplet 内部 NoC / VC / permission network 细节。DFBM,用 coherence transaction dependency 预测包行为,再用 credit management + CVN-DB 做 admission control。gem5 + Garnet 多芯粒平台上,较 SOTA 带来 1%~7% latency 改善,同时把额外面积控制在 2.5% area overhead。UCIe 解决的是 die-to-die interface 标准化,但没有自动解决 package-level routing deadlock。cyclic channel dependency。
turn restriction,会牵制 floorplan / vertical channel 分布。VC isolation,要求 chiplet 内部提供额外 VCs,集成成本更高。permission network 做 injection control,但要侵入 chiplet 内部 NoC,验证和复用都更重。Request -> Fwd-Req -> Response。VN 的 packet activity 相关性,因此可在边界上做预测,而不必知道内部每条 route。VN utilization 明显不对称,这给了共享 deadlock buffer 的空间。

chiplet NoC <-> interposer NoC 边界,只复用已有 VC signaling,不增加额外控制线。CM (Credit Management) 负责准入;CVN-DB 负责拥塞时的共享 deadlock buffering。
R_t0 这类 transaction set 表示“某个 coherence request 最终会诱发哪些响应”,这样 DFBM 就能在边界预留足够 credit。GETS,最直接的例子就是 GetS -> Data;若存在 0..K 个响应的不确定事务,再用 dummy packet 固化上界。
Expected Credit Table 把 coherence type 映射到所需 credit 数。expected credit 与当前 buffer occupancy 比较,决定是 admit 还是 block。pre-allocated 给主动 Out-Req,reserved 给被外部请求触发的被动响应。In-Req / In-Fwd-Req 进入 DFBM,CM 查表得到该事务在最坏情况下可能诱发的响应上界 Pmax。reserved credit >= Pmax 时才允许进入 chiplet,确保将来返回流量可被吸收。Out-Rsp / Out-Fwd-Req / Out-Req 被转入 deadlock buffer。
CVN-DB 不是简单省面积,而是利用 VN 之间的时序不均衡做跨 VN 共享 deadlock buffer。Response > Fwd-Req > Request,因为高优先级消息由低优先级消息触发。
chiplet -> interposer 垂直通道不再形成阻塞依赖,CDG 中跨 chiplet 的关键环就被切断。
5%;换成 CVN-DB 后降到 2.5%。1.9% 开销在 chiplet 内部;DFBM 则把复杂性外置到更便宜、可复用的 interposer。gem5 + Garnet,4 个 homogeneous chiplets + 共享 interposer。4x4 mesh,routing 为 XY。MESI Two Level,3 VNs,每个 VN 评估 2 / 4 VCs。uniform-random / transpose / bit-rotation) + full-system PARSEC。MTR, DeFT, RC,分别代表 turn restriction、VC isolation、injection control 三条路线。
injection rate,纵轴是 latency;每组子图对比不同 VC 数和 traffic pattern。2 VCs 下,DFBM / RC 比 MTR / DeFT 饱和点更靠右,论文给出的解释是 vertical channel 选择更自由。DFBM / RC 的 saturation throughput 相对 MTR / DeFT 约高 14%。
PARSEC 下,DFBM 在各 workload 上都稳定优于 MTR / DeFT / RC,不是只在 synthetic traffic 才成立。MTR 延迟下降 1%~7%,平均 3%。MTR 仍有 1%~4% 降低,平均 2%,说明它对 floorplan / link asymmetry 更稳。
VC=4 时继续增大 CVN-DB 容量几乎不提升性能,说明瓶颈已转向 vertical channel。VC=2 时 buffer 容量确实重要,但超过某个阈值后收益快速递减。
5% 压到 2.5%,这是 CVN-DB 最大的性价比来源。CM 用 protocol dependency 预测未来响应并控制准入,CVN-DB 用依赖顺序做跨 VN 排空。1%~7% latency 改善与 2.5% area overhead。4x4 mesh + XY + homogeneous chiplets,对“arbitrary heterogeneous chiplets”的论断还偏 architecture claim。expected credit table 自动从 coherence spec 生成,并验证在更复杂协议上的保守性成本。