Coherence Transaction Latency Breakdown

L2 Read Miss — Traditional Dir₂B vs Dorado (1024 cores, remote home line, 32-core clusters)

Traditional Dir₂B — Read Miss (Remote Home) Requester NoC Hop Home Dir Owner Requester L2 miss 5c NoC→Home 60c Dir lookup 8c Fwd→Owner 60c Data→Req 60c Fill L2 5c Total: ~198 cycles (3× cross-cluster @ 60c each) Dorado — Read Miss (Remote Home, with Temporary Home) Requester Temp Home (Local) NoC Global Home (Remote) Owner Requester 1st: L2 miss 5c Temp→Global 60c Dir lookup 8c Create Temp Data→Req 60c Fill L2 5c ~138c (first miss: cross-cluster round-trip + dir ops) 2nd: L2 miss 5c Temp Home hit (local!) 10c Data→Req 15c Fill L2 5c ~35c (subsequent: local cluster only!)

🔴 Dir₂B per Remote Read Miss

NoC to Home Dir60c
60
Home Dir lookup + Fwd68c
68
Data Owner → Requester60c
60
Total ≈ 198 cycles — 3× cross-cluster trips

🟢 Dorado (avg, 91% local hit rate)

First: Temp + Global setup138c
138 (9% of accesses)
Subsequent: Temp Home local35c
35 (91% of accesses)
Weighted avg: 138×0.09 + 35×0.91 ≈ 44 cycles
46.1% latency reduction vs Dir₂B