Batch-1 解码的重要性与日俱增。Batch 1 让推理栈毫无隐藏开销的余地。没有批次来分摊启动成本,没有并发来填补流水线气泡。
本文旨在为 Ling-3.0-flash(一款混合线性注意力 MoE 模型)在 4 块 NVIDIA Blackwell GPU 上降低性能下限。
亮点:
- 平均 TPOT 降低 54%(从 3.33 毫秒降至 1.53 毫秒),单请求吞吐量提升 2.1 倍(从 288 提升至 606 token/秒)
- DSpark 达到了 0.78 毫秒的平均 TPOT 和 1120 token/秒的吞吐量
模型架构:42 层,35 个 KDA 线性注意力 + 7 个 MLA 全注意力,512 个路由专家的 MoE,隐藏层大小 2560。
优化路线:主机端预取(host run-ahead)→ PDL 链式化 → 内核优化 → DSpark
- 移除每步的主机端固定操作让准备工作隐藏在 GPU 工作之后
- PDL 将 MoE、路由器、KDA 和全归约路径链接起来
- 将路由器门控和 lm_head 从 fp32 迁移到 bf16 带来约 +10% 性能提升
两种空闲时间:
- 主机模式空闲——主机循环比 GPU 工作更长,解决办法是隐藏并压缩主机端工作
- GPU 模式空闲——权重带宽加内核节点延迟下限,解决办法是 dtype 处理、算子融合和启动依赖调度