群发资讯网

SGLang 联合阿里云 Qwen、英伟达,为 Blackwell GPU 带来 NVFP4 4 位 KV 缓存,专门加速长上下文与 Agent 推理。 相比 FP8,NVFP4 的单 Token 显存占用仅为 FP8 的 56%,可在 GPU 显存中多存放约 1.78 倍上下文数据。不同上下文长度下解码吞吐量提升显著:32K 提升 37%、160K 提升 58%,1M 超长上下文 ​

SGLang 联合阿里云 Qwen、英伟达,为 Blackwell GPU 带来 NVFP4 4 位 KV 缓存,专门加速长上下文与 Agent 推理。

相比 FP8,NVFP4 的单 Token 显存占用仅为 FP8 的 56%,可在 GPU 显存中多存放约 1.78 倍上下文数据。不同上下文长度下解码吞吐量提升显著:32K 提升 37%、160K 提升 58%,1M 超长上下文最高提速 78%。

精度方面近乎无损,在 GPQA-Diamond、AIME 2025 评测上,Qwen3.5-397B-A17B 使用 NVFP4 KV 缓存,效果与 FP8 持平。更高的缓存命中率保障 AgentX 场景吞吐量稳定扩展,而 FP8 方案在此场景容易提前触达资源瓶颈。

整套方案融合 NVFP4 两级缩放、解码内核量化与分页 KV 缓存技术。在 SGLang 框架只需添加启动参数`--kv-cache-dtype nvfp4`,即可一键启用该特性。这项优化尤其适合 Agent 多轮长任务,大幅缓解超长上下文场景下显存压力。