GPUFits

模型库 / Qwen3.8 Flash-Next

Qwen3.8 Flash-Next 显存需求与显卡搭配

Qwen3.8-Flash-Next 是 2026 年 9 月的 Qwen4 架构预览:180B 总参数(含 51.2B n-gram 查找表与 MTP 层)、每 token 仅激活约 6B 的 MoE(512 路由专家 top-10 + 1 共享),48 层中 36 层为 Gated DeltaNet 线性注意力、仅 12 层为 QSA 全注意力(24 Q 头/2 KV 头),原生 256K 上下文。注意:许可证是 Qwen Community License 1.0,不是 Apache-2.0。Q4_K_M 权重约 110.3GB、总需求约 112.6GB——96GB 的 Mac(可用约 72GB)装不下,本站现有硬件在 Q4 口径全军覆没。

现实路径:128GB 的 M5 Max(可用约 96GB)跑 Q2_K(约 73.6GB)宽裕、Q3_K_M(约 92.3GB)勉强;256GB 的 M5 Ultra 才能 Q4 宽裕。6B 激活意味着装得下就飞快——M5 Max 614GB/s 理论约 125 tok/s;n-gram 表还可卸载进一步降压。9 月发布后 unsloth GGUF、Ollama 上架与 Mac 部署实测接连出现,是消费硬件「踮踮脚能够到」的最大新模型。

架构规格

总参数180B
激活参数(MoE:显存按总参数装,速度按激活参数跑) 6B
层数48
KV 头数 2
Head 维度256
原生上下文256K
开源协议qwen-community
每 token KV 字节数(fp16)96.0 KB

混合架构:48 层中仅 12 层为全注意力,其余 36 层 Gated DeltaNet 的 KV 不随上下文增长。上表 KV 列按标准 GQA 公式保守计算全部 48 层,实际 KV 约为显示值的 1/4。

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 191.5 GB 193.8 GB
Q6_K 147.8 GB 150.1 GB
Q4_K_M 110.3 GB 112.6 GB
Q3_K_M 90.0 GB 92.3 GB
Q2_K 71.3 GB 73.6 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 — — 试算 →
RTX 3090 24.0 GB 本地不可行 — — 试算 →
RTX 4070 Ti Super 16.0 GB 本地不可行 — — 试算 →
RTX 4090 24.0 GB 本地不可行 — — 试算 →
RTX 5090 32.0 GB 本地不可行 需 4 张 — 试算 →
RTX A6000 48.0 GB 本地不可行 需 3 张 — 试算 →
A100 80GB 80.0 GB 本地不可行 Q2_K ≈643 tok/s 试算 →
H100 80GB 80.0 GB 本地不可行 Q2_K ≈1057 tok/s 试算 →
RX 7900 XTX 24.0 GB 本地不可行 — — 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 本地不可行 需 4 张 — 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 本地不可行 需 3 张 — 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 本地不可行 需 2 张 — 试算 →
Mac Studio M5 Ultra (96GB) 72.0 GB 本地不可行 需 2 张 — 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

180B 模型为什么速度按 6B 算?
MoE 稀疏激活:512 个路由专家每 token 只激活 10 个、加 1 个共享专家,激活参数约 6B;生成速度取决于每 token 读取的权重(约 3.7GB,Q4_K_M),而非总参数量。
96GB 的 Mac Studio 能跑 Qwen3.8-Flash-Next 吗?
Q4_K_M(约 112.6GB)不可能;最低的 Q2_K 约 73.6GB,对 72GB 可用显存差 1.6GB,落在「需要多卡/多机」边界。128GB 的 M5 Max(Q2 宽裕/Q3 勉强)或 256GB 的 M5 Ultra(Q4 宽裕)才是单机答案。
商用前要注意什么?
它是 Qwen Community License 1.0(非 Apache-2.0),商用与再分发条款需逐条读;此外 51.2B 的 n-gram 表可卸载,卸载后精度略降但显存压力大减。

相关指南

在显卡兼容性查询工具中试算 Qwen3.8 Flash-Next →

数据核实于 2026-10-01