Authors: Jovan Stojkovic, Abraham Farrell, Gerasimos Gerogiannis, Zhangxiaowen Gong*, Christopher J. Hughes*, Josep Torrellas Affiliation: UIUC, *Intel Labs Venue: ISCA 2026 Presenter: Zongwu Wang | 2026-07-03
Bottleneck: 1000+ 核一致性协议的三重困境——远端 home 访问的高延迟 + 广播 invalidate 的高流量 + 全位向量的高存储
Core Idea: 三项正交技术协同——TLH(本地化事务)、Dynamic Apportioning(动态空间竞争)、SetOverflow(per-set 溢出),首次同时改善延迟、流量和存储
Headline Result: 相比等面积 Dir₂B 平均加速 1.36×,load 延迟 −46.1%,以 24 bits/entry(vs 66 bits)实现与 full bit vector 差距 <1%
Obs 1 — 91% 远端 load miss 可本地化 (→ TLH) - 32-core cluster 下,绝大多数远端 home line 可由本地核心提供(Fig.3)。大量 line 是 read-mostly + 多线程共享
Obs 2 — Workload 差异巨大 (→ Dynamic Apportioning) - Redis 以 remote 为主,FaaSFunc 以 local 为主(Fig.4)。固定 local/remote 比例必然次优
Obs 3 — 多共享者稀有但关键 (→ SetOverflow) - 多数 line 只有 ≤2 sharer,少数被数十核共享。需按需溢出,不为少数犒赏全体





| Metric | Dir₂B → Dorado | Mechanism |
|---|---|---|
| Remote L2-missing loads | −89.6% | TLH: Temp home 截获 |
| Invalidation messages | −39% | SetOverflow + LRptr (1=32 cores) |
| Avg data load latency | −46.1% | TLH 消除 cross-cluster RT |
