模型库 / Qwen3.8 Flash-Next
Qwen3.8 Flash-Next 显存需求与显卡搭配
Qwen3.8-Flash-Next 是 2026 年 9 月的 Qwen4 架构预览:180B 总参数(含 51.2B n-gram 查找表与 MTP 层)、每 token 仅激活约 6B 的 MoE(512 路由专家 top-10 + 1 共享),48 层中 36 层为 Gated DeltaNet 线性注意力、仅 12 层为 QSA 全注意力(24 Q 头/2 KV 头),原生 256K 上下文。注意:许可证是 Qwen Community License 1.0,不是 Apache-2.0。Q4_K_M 权重约 110.3GB、总需求约 112.6GB——96GB 的 Mac(可用约 72GB)装不下,本站现有硬件在 Q4 口径全军覆没。
现实路径:128GB 的 M5 Max(可用约 96GB)跑 Q2_K(约 73.6GB)宽裕、Q3_K_M(约 92.3GB)勉强;256GB 的 M5 Ultra 才能 Q4 宽裕。6B 激活意味着装得下就飞快——M5 Max 614GB/s 理论约 125 tok/s;n-gram 表还可卸载进一步降压。9 月发布后 unsloth GGUF、Ollama 上架与 Mac 部署实测接连出现,是消费硬件「踮踮脚能够到」的最大新模型。
架构规格
| 总参数 | 180B |
| 激活参数(MoE:显存按总参数装,速度按激活参数跑) | 6B |
| 层数 | 48 |
| KV 头数 | 2 |
| Head 维度 | 256 |
| 原生上下文 | 256K |
| 开源协议 | qwen-community |
| 每 token KV 字节数(fp16) | 96.0 KB |
混合架构:48 层中仅 12 层为全注意力,其余 36 层 Gated DeltaNet 的 KV 不随上下文增长。上表 KV 列按标准 GQA 公式保守计算全部 48 层,实际 KV 约为显示值的 1/4。
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 191.5 GB | 193.8 GB |
| Q6_K | 147.8 GB | 150.1 GB |
| Q4_K_M | 110.3 GB | 112.6 GB |
| Q3_K_M | 90.0 GB | 92.3 GB |
| Q2_K | 71.3 GB | 73.6 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 3090 | 24.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 4090 | 24.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 5090 | 32.0 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| RTX A6000 | 48.0 GB | 本地不可行 | 需 3 张 | — | 试算 → |
| A100 80GB | 80.0 GB | 本地不可行 | Q2_K | ≈643 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 本地不可行 | Q2_K | ≈1057 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 本地不可行 | — | — | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 本地不可行 | 需 3 张 | — | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| Mac Studio M5 Ultra (96GB) | 72.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- 180B 模型为什么速度按 6B 算?
- MoE 稀疏激活:512 个路由专家每 token 只激活 10 个、加 1 个共享专家,激活参数约 6B;生成速度取决于每 token 读取的权重(约 3.7GB,Q4_K_M),而非总参数量。
- 96GB 的 Mac Studio 能跑 Qwen3.8-Flash-Next 吗?
- Q4_K_M(约 112.6GB)不可能;最低的 Q2_K 约 73.6GB,对 72GB 可用显存差 1.6GB,落在「需要多卡/多机」边界。128GB 的 M5 Max(Q2 宽裕/Q3 勉强)或 256GB 的 M5 Ultra(Q4 宽裕)才是单机答案。
- 商用前要注意什么?
- 它是 Qwen Community License 1.0(非 Apache-2.0),商用与再分发条款需逐条读;此外 51.2B 的 n-gram 表可卸载,卸载后精度略降但显存压力大减。
相关指南
在显卡兼容性查询工具中试算 Qwen3.8 Flash-Next →
数据核实于 2026-10-01