NVIDIA Jetson 上 Qwen3.5 9B NVFP4 开启 DFlash 推测解码,吞吐翻倍达 68.1 tokens/s
原标题:Double the throughput on the same edge platform. ⚡ See Qwen3.5 9B NVFP4 run with DFlash speculative decoding turned on and off, reaching 68.1 tokens/s with DFlash enabled on NVIDIA Jetson.
推荐理由
官方实测显示 Jetson 端侧运行 Qwen3.5 9B 开启 DFlash 后吞吐翻倍至 68.1 tokens/s,为机器人端侧大模型部署提供参考。
ROBOAIRADAR BRIEF
结构化情报
01
发生了什么
NVIDIA Robotics 展示在 NVIDIA Jetson 边缘平台上运行 Qwen3.5 9B NVFP4 模型的效果:对比开启与关闭 DFlash 推测解码两种情况,开启 DFlash 后吞吐量翻倍,达到 68.1 tokens/s。该演示表明推测解码可在同一边缘硬件上显著提升大模型推理速度,对端侧具身智能的模型部署具有参考价值。
02
为什么重要
官方实测显示 Jetson 端侧运行 Qwen3.5 9B 开启 DFlash 后吞吐翻倍至 68.1 tokens/s,为机器人端侧大模型部署提供参考。
信息说明
RoboAIRadar 对公开信源进行聚合、中文整理和价值判断,不替代原始报道。 涉及产品参数、交易金额或公司声明时,请以原文为准。
查看原始报道