DRACO: Precision-Aware RBD Accelerator

基于精度感知量化的机器人刚体动力学加速器

Authors: Xingyu Liu; Jiawei Liang; Yipu Zhang; Linfeng Du; Chaofang Ma; Hui Yu; Jiang Xu; Wei Zhang Venue: ISCA/MICRO 2026 Presenter: zongwu wang Date: 2026-05-25

TL;DR

  • Bottleneck: 高 DOF 机器人 MAC 耗尽 DSP, Minv 倒数占 50%+ 延迟
  • Idea: 量化(32→24/18-bit) + division deferring + DSP 复用
  • Result: 8× 吞吐, 7.4× 延迟降低, Atlas 首次 1kHz 控制

机器人控制与 RBD

  • 控制环路 kHz 级, RBD 占 90% 运行时间

三大瓶颈

Key Observation

  • 机器人对模型误差有内在鲁棒性 → 量化误差可接受
  • 24-bit MAC = 1 DSP58, 32-bit = 4 DSP48 → 4× DSP 节省
  • RBD 递归致误差非线性传播 → 需系统化搜索位宽

RBD 函数与现有架构

DRACO 架构总览

量化框架: CMS 闭环仿真

误差传播与启发式剪枝

  • 误差界: $|\delta x| \leq 2^{-n_{\text{frac}}-1}$
  • 三类剪枝: 关节深度累积 · 惯量放大 · 高速放大

误差补偿

  • 对 Minv 对角项施加偏移矩阵
  • Frobenius 范数: 4.97 → 1.65

Division Deferring: 算法

  • Minv 后向 $D_i^{-1}$ 在最长路径, 占 >50% 运行时间
  • 同乘 $D_i$ 将除法暂缓为乘法, 缩放因子 $\alpha_i = D_i \cdot \alpha_{i+1}$

Division Deferring: 数据流

  • Mb 计算缩放因子(纯乘法) → 交错送入共享流水线除法器
  • 除法结果传至 Mf, 与前向传播并行
  • 3 个 Mb 共享 1 个除法器 → Minv 延迟 2×+

跨模块 DSP 复用

  • RNEA(快) vs Minv/ΔRNEA(慢) → II 失衡 → DSP 空闲

FD 计算: 端到端追踪

  • RNEA 前/后向 → ID(τ)
  • Minv 后向: division deferring 缩放因子
  • 共享除法器并行 → Mf 恢复 $M^{-1}$
  • 乘法器: $M^{-1} \cdot \tau$ → FD

Hardware Overhead

项目 DRACO Dadu-RBD
DSP 5073 4241
LUT 584k 638k
Power 33.5W 36.8W

Methodology

  • V80(DSP58) + U50(DSP48), 228MHz
  • iiwa(7-DOF), HyQ(12), Atlas(28), Baxter(15)
  • vs Pinocchio(CPU), GRiD(GPU), Roboshape/Dadu-RBD(FPGA)

延迟与吞吐

DSP 效率与控制率

  • Throughput/DSP: 4.2×–5.8× vs Dadu-RBD
  • Atlas: 55 steps@250Hz, 首次 1kHz 控制

Ablation: 量化精度

  • PID 最敏感: 8-bit > 1mm; 12-bit 满足 ±0.5mm
  • MPC 最鲁棒: <0.02mm

Ablation: Division Deferring & DSP 复用

Conclusion

  • 量化框架: DSP 降低 , 首个系统化 RBD 量化评估
  • Division deferring: Minv 加速 2×+, 纯代数变换
  • DSP 复用: 高 DOF 节省 16.1%
  • 协同 → 8× 吞吐, 7.4× 延迟降低, Atlas 首次 1kHz

Critique

  • Pros: 三层 co-design; 量化框架填空白; division deferring 优雅
  • Cons: 误差缺形式化界; 搜索 4h; 平台差异
  • Next: 量化 + 鲁棒控制器进一步压缩位宽