Qwen3.8-Flash-Next 内存档位:16GB / 64·96GB / 计划中的 128GB 能装上什么
只按 Unsloth GGUF、社区 MLX 文件大小和官方卡片来读 2026-08-26 发布的 Qwen3.8-Flash-Next(125B-A6B + 51B n-gram),再映射到 AI Tech Engine 实验室的 RTX 4080 16GB / M1 Max 64GB / M2 Max 96GB / 计划中的 128GB。没有未实测的 tok/s。
Qwen3.8-Flash-Next 内存档位:16GB / 64·96GB / 计划中的 128GB 能装上什么
结论(Bottom Line) 2026 年 8 月 26 日发布的 Qwen3.8-Flash-Next,和 上一篇的 Qwen3.8-27B 不是同一个东西。官方卡片:骨干 125B(激活 6B)+ n-gram 嵌入 51B + MTP 4B。运算是稀疏的,磁盘和常驻容量却是工作站级。 Unsloth GGUF 大约 72.5–111GB,社区 MLX 4-bit 是 103.8GB。今天的在手机队(4080 16GB / M1 Max 64GB / M2 Max 96GB)要问的不是“能不能整份塞进显存”,而是 n-gram 和专家权重放在哪。 AMD AI Max+ 395 128GB、Gigabyte DGX Spark 128GB 仍未到货。 本文没有我们的 tok/s。
这不是抄基准表。而是 AI Tech Engine 把同一周发布的 Flash-Next 往 现有机队 上放时,文件进得去哪、在哪断开。
官方卡片 — 和 27B 有何不同
仓库:Hugging Face Qwen/Qwen3.8-Flash-Next。MarkTechPost 和社区摘要把许可证写成 qwen-community-1.0(不是 Apache 2.0)。商用或再分发前请自己看 HF LICENSE。
| 官方表述 | 这间实验室怎么读 | |
|---|---|---|
| 参数量 | 125B(激活 6B)+ n-gram 51B + MTP 4B | “6B 激活”讲的是 FLOPs。磁盘/常驻是 180B 级包装 |
| 类型 | Causal LM + Vision Encoder | 文本路径和打开视觉分开测 |
| 上下文 | 原生 262,144,YaRN 最大 1,000,000 | 满 262K 不是假设 |
| 布局 | 48 层,12 × (3 × (GDN→MoE) → 1 × (QSA→MoE)) |
稀疏注意力、MoE、n-gram 在一起 |
| N-gram | 20,000,000 条 bigram/trigram(第 2 层) | 以主机 RAM/SSD 卸载为前提。不只是加速器的问题 |
| 服务 | vLLM、SGLang、TokenSpeed、transformers、llama.cpp(GGUF) | 日常循环是 llama.cpp /(Mac)MLX。不把多 GPU FP8 配方搬成我们的结果 |
MarkTechPost 引用的检查点大小:FP8 172.78 GiB,BF16 335.28 GiB。稀疏激活只减少运算,不减少存储。
不搬 Qwen 自家基准表,也不搬“1/9 训练成本”的说法。对照集是 Qwen3.8-27B 映射 和 M1 Max 27B 实测。Flash-Next 速度格仍是空的。
社区量化文件大小(不是我们的实测)
我们没有重测这些值。它们是做加载计划时用的 文档 / 卡片数字。
Unsloth GGUF(unsloth/Qwen3.8-Flash-Next-GGUF,运行指南)
| quant | 标称大小 |
|---|---|
| UD-IQ1_S | 72.5 GB |
| UD-IQ1_M | 74.5 GB |
| UD-Q2_K_XL | 78.9 GB |
| UD-IQ3_XXS | 82.0 GB |
| UD-Q3_K_XL | 90.0 GB |
| UD-IQ4_XS | 93.7 GB |
| UD-Q4_K_XL | 111.3 GB |
Unsloth 文档同时写了“75GB RAM/统一内存,不必有 GPU 显存”,以及 n-gram(PLE)SSD/主机卸载。那是 他们的指南。 不等于我们箱子上会出现同样的数字。
llama.cpp 一侧,社区有报告称 2026-08-27 前后合并了 qwen4exp / Flash-Next 路径。这间实验室的构建 commit 和开关还没记下来。
社区 MLX(PipeNetwork 测量表)
| build | 标称 size |
|---|---|
| bfloat16(upstream) | 360.0 GB |
| 8-bit | 192.2 GB |
| 6-bit | 148.0 GB |
| mixed-4/8-bit | 106.2 GB |
| 4-bit | 103.8 GB |
仓库把 mixed-4/8-bit 写成 150GB 以下的推荐构建,并说 uniform 4-bit 的 PPL 损失很大(相对 bf16 +20.6%)。推荐的 MLX 构建整份进不了 M1 Max 64GB / M2 Max 96GB。 bf16 常驻 ~354GB、~24 tok/s 这类仓库句子不是我们的设备。不搬。
把 n-gram 放在 SSD 上的分割 GGUF(参考)
AtomicChat 等公开过把 n-gram 分片放在 SSD、从而降低快速内存需求的构建(例如总计 ~84.9–110.5GB,内存中标称 ~45.8–56.1GB)。即便卡片写成 64GB/96GB Mac 指南,这间实验室没有做过加载、质量、速度验证。 不把“有人说可以”和“我们的针”混在一起。
机队映射 — 今天 vs 计划
数字是“文件有没有地方放”,不是速度。
今天(在手)
| 路径 | RTX 4080 16GB | M1 Max 64GB MacBook | M2 Max 96GB Mac Studio |
|---|---|---|---|
| 官方 FP8/BF16 权重 | 不行(172–335 GiB 级) | 不行 | 不行 |
| Unsloth GGUF 全部常驻 RAM | 不行。 显存 16GB ≪ 72–111GB | 1-bit~低比特也很紧~不行(72GB+)。指南的 75GB 底已经被 64GB 低于 | 边界。 低比特 GGUF + 短上下文是尝试候选。Q4 级 111GB 超了 |
| GGUF + n-gram/专家卸载(llama.cpp CUDA/Metal) | 实验候选。 卡上只放激活专家和 KV,其余和 n-gram 在系统 RAM/SSD。要写“跑过了”,量化和卸载开关、成败必须一起写 | 实验候选。 社区有 Metal + mmap/SSD 路径,未实测 | 实验候选。 比 64GB 余量多。同样未实测 |
| MLX 4-bit / mixed(~104–106GB) | 不是对象 | 不推荐。 文件超过 64GB | 不推荐。 96GB 也装不下,或没有 KV/视觉位置 |
| 打开视觉 | 更紧。第一轮只做文本 | 同样 | 同样 |
4080 16GB 的要点不是“把 Flash-Next 塞进显存”,而是 16GB 计算 + 很大的系统内存 能不能做成 n-gram 卸载冒烟。成不成立仍是空格。
计划中(未到货)
| 路径 | AMD AI Max+ 395 128GB Strix Halo(计划中) | Gigabyte DGX Spark 128GB(计划中) |
|---|---|---|
| Unsloth Q4 级 GGUF(~93–111GB) | 权重+剩余 KV 一起扛的 目标档 | 同样。CUDA/llama.cpp,(如适用)vLLM 候选 |
| n-gram 放在 NVMe 的 runbook | 到货后确认 ROCm/Vulkan 路径 | 社区已经有 Spark 专用 runbook。到货前没有安装后记 |
| MLX | 不是 Apple | 不是 Apple |
| 购买 / 可买到(2026-08 末快照) | Strix Halo 128GB 迷你 PC 因 DRAM 供应,有缺货和高价报告混在一起。到货前不把价目表当基准 | Founders/转售 MSRP 区间是公开的,这间实验室下单和到货都还没确认 |
不把计划设备的标称(200B 推理等)当成 Flash-Next 的结果。
和 27B 那篇的关系
| Qwen3.8-27B 映射 | 本篇(Flash-Next) | |
|---|---|---|
| 架构 | 稠密 27B(+视觉) | MoE 125B-A6B + 51B n-gram |
| 4-bit 文件规模 | Unsloth ~14–18GB | Unsloth ~94–111GB(靠近 Q4) |
| 今天主力箱子 | M1/M2 Max 上 能上去 的一侧 | 在手箱子上,默认假设是 卸载 / 分割 |
| 我们的 tok/s | 有 M1 Max 实测 | 没有 |
Flash-Next 不是“把 27B 再映射一遍”。同一周的发布重新打开了机队的空格(128GB)和卸载实验。
这间实验室接下来要测什么(Flash-Next)
128GB 到货前,只在现有设备上。
- 加载画像 — 同一份 Unsloth GGUF 放到 4080(CUDA 卸载)/ M1 Max / M2 Max。成功、OOM、常驻内存、用过的开关。
- n-gram 位置 — RAM vs SSD(mmap)。标称的内存节省能不能在我们箱子上复现。
- 质量冒烟 — 不只是加载。短编码和指令跟随有没有崩/循环。(禁止粘贴基准分数)
- 先关掉视觉 — 第一轮文本。mmproj、视频往后排。
- 128GB 到货后 — 同一文件再上 Strix Halo、Spark,用同一根针测 Q4 级常驻 + 长上下文。
不会做的事:把 Qwen/Unsloth/MLX 仓库 tok/s 写成我们的数字,把 M5 Max、5090 社区速度外推到 4080、M1/M2,把计划中的 128GB 写成已经测过,或把 27B 实测表当成 Flash-Next 结果再用一遍。
今天核对的只有文件大小和档位映射。速度格留空。
推荐云 GPU 与工程工具
官网链接(联盟 ID 待发)联盟跟踪 ID 尚未发放。以下均为各产品官网,不会放入假的 ref/click ID。