Coherence Transaction Latency Breakdown
L2 Read Miss — Traditional Dir₂B vs Dorado (1024 cores, remote home line, 32-core clusters)
Traditional Dir₂B — Read Miss (Remote Home)
Requester
NoC Hop
Home Dir
Owner
Requester
L2 miss 5c
NoC→Home 60c
Dir lookup 8c
Fwd→Owner 60c
Data→Req 60c
Fill L2 5c
Total: ~198 cycles (3× cross-cluster @ 60c each)
Dorado — Read Miss (Remote Home, with Temporary Home)
Requester
Temp Home
(Local)
NoC
Global Home
(Remote)
Owner
Requester
1st:
L2 miss 5c
Temp→Global 60c
Dir lookup 8c
Create Temp
Data→Req 60c
Fill L2 5c
~138c (first miss: cross-cluster round-trip + dir ops)
2nd:
L2 miss 5c
Temp Home hit (local!) 10c
Data→Req 15c
Fill L2 5c
~35c (subsequent: local cluster only!)
🔴 Dir₂B per Remote Read Miss
NoC to Home Dir
60c
60
Home Dir lookup + Fwd
68c
68
Data Owner → Requester
60c
60
Total ≈ 198 cycles
— 3× cross-cluster trips
🟢 Dorado (avg, 91% local hit rate)
First: Temp + Global setup
138c
138 (9% of accesses)
Subsequent: Temp Home local
35c
35 (91% of accesses)
Weighted avg: 138×0.09 + 35×0.91 ≈ 44 cycles
46.1% latency reduction vs Dir₂B