性能突破

英伟达官方确认,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已适配 GB300 NVL72 平台。该模型总参数达 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,经 YaRN 可扩展至 100 万 Token,专为智能编程、文档处理及工具调用等长上下文 Agent 场景设计。

架构与实测

模型采用 Gated DeltaNet(GDN)Qwen Sparse Attention(QSA) 混合架构,显著降低长上下文下的计算与 KV 缓存开销。实测数据显示,在 GB300 NVL72 上单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超 200 Token/秒,并兼容 SGLang、vLLM 及 TensorRT-LLM 等主流推理框架。