1 minrss原文 ↗

SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启

为什么值得读SGLang 用 CUDA IPC 零拷贝把模型权重加载从约 495 秒压到 0.63 秒(约 785 倍加速),端到端启动时间降 93.9%。推理引擎快速恢复的关键基础设施。

SGLang 团队推出 Weight Cache Daemon(权重缓存守护进程),这是一个常驻 GPU 进程,将量化后的模型权重保存在 GPU 内存中,并通过 CUDA IPC 零拷贝映射将其提供给新的 SGLang 引擎实例。

关键成果:

背景:随着 LLM 模型规模不断增大(Qwen3-235B、Ling-2.6-1T、Kimi K3),服务引擎的冷启动时间已成为生产效率的关键瓶颈。对 Ling-2.6-1T FP8 的剖析显示,从磁盘加载权重占启动时间的 93.9%。

设计核心:通过 CUDA IPC 实现持久化权重缓存。守护进程从磁盘加载模型权重、导出为 CUDA IPC 句柄、通过 Unix socket 提供给引擎进程。引擎在 meta 设备上初始化模型,然后将每个参数的数据指针替换为 IPC 映射的张量——零拷贝。

三种模式:daemon(首次启动)、client(快速重启)、off(默认磁盘加载)

安全性:配置不匹配时自动回退到磁盘加载;崩溃安全——守护进程崩溃时现有引擎继续运行。

如果可以重来,你还愿意花这段时间读它吗?

· 匿名阅读记录只用于改进推荐