一天一个ai大模型 Qwen3.8-Flash-Next 是阿里通义千问团队于 2026-08-26 开源的多模态 MoE 实验性权重模型,官方明确定位为 Qwen4 架构的早期预览版(类似当年 Qwen3-Next 之于 Qwen3.5)。它不是最终版 Qwen4,而是把下一代架构先交社区验证。
核心规格ai - 参数:主干 125B,外挂 51B N-gram Embedding + 4B MTP,每 token 仅激活 6B(512 专家中选 10 路由+1 共享)。- 上下文:原生 262,144 token,YaRN 扩至 1M。- 模态:文本/图像/视频输入,文本输出(带 vision encoder)。- 开源:HuggingFace / ModelScope 放权重,Qwen Community License 1.0(非 Apache/MIT,商用有条件)。- 生产版:QwenCloud 上的 "qwen3.8-flash" 是另一产物,默认 1M 上下文+内置工具,API 标价 (入 / 0.47 出 每百万 token(国内站折算约 1 元入/3 元出)。
架构四点重构(重点)
1. GDN + QSA 混合注意力:3/4 层用 Gated DeltaNet 压缩历史,1/4 层用 Qwen Sparse Attention 在 micro-block 级检索重要上下文,长序列注意力开销大幅下降(官方称 1M 上下文内核级 prefill 快 7.6×、decode 快 4.9×)。2. Gated Residual:残差流扩为 4 分支,动态门控读写,提升跨层信息流与训练稳定性。2. N-gram Embedding:2000 万条目查表扩容量,51B 参数可放 Host Memory 异步预取,不占满 GPU 显存。4. Muon 优化器:与 AdamW 分工,重拟合 scaling law,取消 batch-size warmup,训练步数更少。每日科技热点 成本与性能定位
- 官方自报:训练计算量约 Qwen3.7-Plus 的 1/9,编码/办公/Agent 任务反超。- 基准(厂商自报):DeepSWE 1.1 58.7、SWE-bench Pro 62.5、LiveCodeBench v6 91.9、GPQA Diamond 91.7、CoWorkBench 73.9;多数 Agent/代码项优于 DeepSeek-V4-Flash-0731,但 NL2Repo-Bench(48.1)弱于 DeepSeek、HLE(35.9)弱于 Opus 4.6。- 部署门槛:BF16 权重 ~335GB,FP8 ~173GB;稀疏激活省的是算力不是显存,GB300 上 FP8 至少 TP2、推荐 TP4。
怎么理解它
它不是“又一个 125B 模型”,而是阿里在验证一套把参数、算力、记忆分开调度的思路——大部分容量放 N-gram/Embedding 和稀疏专家里,每个 token 真算的只有 6B,配合线性注意力+稀疏检索把长上下文成本打下来。适合关注下一代架构、想自部署压推理成本、做长上下文 Agent 的人看;不建议把它当最终 Qwen4 能力下限,也不建议商用团队忽略 Community License 限制直接上。千问 补充:你上一条快讯里写的“MIT 协议、125B+51B 嵌入、激活 6B、入1出3”大体正确,但协议实际是 Qwen Community License 1.0 而非 MIT,这是选型时最容易踩的坑。如果你愿意,我可以把它和 DeepSeek-V4-Flash-0731 / GLM-5.3-Flash 按自部署门槛、License、Agent 基准拉一张一页对比表。
