1 minrss原文 ↗

Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

为什么值得读蚂蚁 Ling Infra 与 RadixArk SGLang 把 Ling-3.0-flash 单请求解码速度从 288 tok/s 提到 606 tok/s,TPOT 从 3.33ms 降到 1.53ms。混合线性注意力 MoE 的推理优化实战。

Batch-1 解码的重要性与日俱增。Batch 1 让推理栈毫无隐藏开销的余地。没有批次来分摊启动成本,没有并发来填补流水线气泡。

本文旨在为 Ling-3.0-flash(一款混合线性注意力 MoE 模型)在 4 块 NVIDIA Blackwell GPU 上降低性能下限。

亮点:

模型架构:42 层,35 个 KDA 线性注意力 + 7 个 MLA 全注意力,512 个路由专家的 MoE,隐藏层大小 2560。

优化路线:主机端预取(host run-ahead)→ PDL 链式化 → 内核优化 → DSpark

两种空闲时间:

  1. 主机模式空闲——主机循环比 GPU 工作更长,解决办法是隐藏并压缩主机端工作
  2. GPU 模式空闲——权重带宽加内核节点延迟下限,解决办法是 dtype 处理、算子融合和启动依赖调度

如果可以重来,你还愿意花这段时间读它吗?

· 匿名阅读记录只用于改进推荐

Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54% | DeepRead