SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启
推荐理由
AI 产品动态,值得关注实际能力和用户采用情况
ROBOAIRADAR BRIEF
结构化情报
01
发生了什么
SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将模型权重加载从约 495 秒降至约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。该守护进程在 GPU 内存中持久化后量化权重,支持多实例共享和亚秒级主备切换,是 Fast Engine Recovery Framework 的第一阶段。
02
为什么重要
AI 产品动态,值得关注实际能力和用户采用情况
信息说明
RoboAIRadar 对公开信源进行聚合、中文整理和价值判断,不替代原始报道。 涉及产品参数、交易金额或公司声明时,请以原文为准。
查看原始报道