AIAI Tech Engine
首页/基准报告/Qwen3.8-Flash-Next 内存档位:16GB / 64·96GB / 计划中的 128GB 能装上什么
#Qwen3.8-Flash-Next#本地LLM#内存档位#llama.cpp#MLX#测试床

Qwen3.8-Flash-Next 内存档位:16GB / 64·96GB / 计划中的 128GB 能装上什么

只按 Unsloth GGUF、社区 MLX 文件大小和官方卡片来读 2026-08-26 发布的 Qwen3.8-Flash-Next(125B-A6B + 51B n-gram),再映射到 AI Tech Engine 实验室的 RTX 4080 16GB / M1 Max 64GB / M2 Max 96GB / 计划中的 128GB。没有未实测的 tok/s。

AIAI Tech Engine Lab
已在独立测试床核对
SPONSORED / ADVERTISEMENT
预留广告位 — 仅在 AdSense 审核通过后接入控制台发放的单元 ID。

Qwen3.8-Flash-Next 内存档位:16GB / 64·96GB / 计划中的 128GB 能装上什么

结论(Bottom Line) 2026 年 8 月 26 日发布的 Qwen3.8-Flash-Next,和 上一篇的 Qwen3.8-27B 不是同一个东西。官方卡片:骨干 125B(激活 6B)+ n-gram 嵌入 51B + MTP 4B。运算是稀疏的,磁盘和常驻容量却是工作站级。 Unsloth GGUF 大约 72.5–111GB,社区 MLX 4-bit 是 103.8GB。今天的在手机队(4080 16GB / M1 Max 64GB / M2 Max 96GB)要问的不是“能不能整份塞进显存”,而是 n-gram 和专家权重放在哪。 AMD AI Max+ 395 128GB、Gigabyte DGX Spark 128GB 仍未到货。 本文没有我们的 tok/s。

这不是抄基准表。而是 AI Tech Engine 把同一周发布的 Flash-Next 往 现有机队 上放时,文件进得去哪、在哪断开。

官方卡片 — 和 27B 有何不同

仓库:Hugging Face Qwen/Qwen3.8-Flash-Next。MarkTechPost 和社区摘要把许可证写成 qwen-community-1.0(不是 Apache 2.0)。商用或再分发前请自己看 HF LICENSE。

官方表述 这间实验室怎么读
参数量 125B(激活 6B)+ n-gram 51B + MTP 4B “6B 激活”讲的是 FLOPs。磁盘/常驻是 180B 级包装
类型 Causal LM + Vision Encoder 文本路径和打开视觉分开测
上下文 原生 262,144,YaRN 最大 1,000,000 满 262K 不是假设
布局 48 层,12 × (3 × (GDN→MoE) → 1 × (QSA→MoE)) 稀疏注意力、MoE、n-gram 在一起
N-gram 20,000,000 条 bigram/trigram(第 2 层) 以主机 RAM/SSD 卸载为前提。不只是加速器的问题
服务 vLLM、SGLang、TokenSpeed、transformers、llama.cpp(GGUF) 日常循环是 llama.cpp /(Mac)MLX。不把多 GPU FP8 配方搬成我们的结果

MarkTechPost 引用的检查点大小:FP8 172.78 GiB,BF16 335.28 GiB。稀疏激活只减少运算,不减少存储。

不搬 Qwen 自家基准表,也不搬“1/9 训练成本”的说法。对照集是 Qwen3.8-27B 映射M1 Max 27B 实测。Flash-Next 速度格仍是空的。

社区量化文件大小(不是我们的实测)

我们没有重测这些值。它们是做加载计划时用的 文档 / 卡片数字。

Unsloth GGUF(unsloth/Qwen3.8-Flash-Next-GGUF运行指南

quant 标称大小
UD-IQ1_S 72.5 GB
UD-IQ1_M 74.5 GB
UD-Q2_K_XL 78.9 GB
UD-IQ3_XXS 82.0 GB
UD-Q3_K_XL 90.0 GB
UD-IQ4_XS 93.7 GB
UD-Q4_K_XL 111.3 GB

Unsloth 文档同时写了“75GB RAM/统一内存,不必有 GPU 显存”,以及 n-gram(PLE)SSD/主机卸载。那是 他们的指南。 不等于我们箱子上会出现同样的数字。

llama.cpp 一侧,社区有报告称 2026-08-27 前后合并了 qwen4exp / Flash-Next 路径。这间实验室的构建 commit 和开关还没记下来。

社区 MLX(PipeNetwork 测量表

build 标称 size
bfloat16(upstream) 360.0 GB
8-bit 192.2 GB
6-bit 148.0 GB
mixed-4/8-bit 106.2 GB
4-bit 103.8 GB

仓库把 mixed-4/8-bit 写成 150GB 以下的推荐构建,并说 uniform 4-bit 的 PPL 损失很大(相对 bf16 +20.6%)。推荐的 MLX 构建整份进不了 M1 Max 64GB / M2 Max 96GB。 bf16 常驻 ~354GB、~24 tok/s 这类仓库句子不是我们的设备。不搬。

把 n-gram 放在 SSD 上的分割 GGUF(参考)

AtomicChat 等公开过把 n-gram 分片放在 SSD、从而降低快速内存需求的构建(例如总计 ~84.9–110.5GB,内存中标称 ~45.8–56.1GB)。即便卡片写成 64GB/96GB Mac 指南,这间实验室没有做过加载、质量、速度验证。 不把“有人说可以”和“我们的针”混在一起。

机队映射 — 今天 vs 计划

数字是“文件有没有地方放”,不是速度。

今天(在手)

路径 RTX 4080 16GB M1 Max 64GB MacBook M2 Max 96GB Mac Studio
官方 FP8/BF16 权重 不行(172–335 GiB 级) 不行 不行
Unsloth GGUF 全部常驻 RAM 不行。 显存 16GB ≪ 72–111GB 1-bit~低比特也很紧~不行(72GB+)。指南的 75GB 底已经被 64GB 低于 边界。 低比特 GGUF + 短上下文是尝试候选。Q4 级 111GB 超了
GGUF + n-gram/专家卸载(llama.cpp CUDA/Metal) 实验候选。 卡上只放激活专家和 KV,其余和 n-gram 在系统 RAM/SSD。要写“跑过了”,量化和卸载开关、成败必须一起写 实验候选。 社区有 Metal + mmap/SSD 路径,未实测 实验候选。 比 64GB 余量多。同样未实测
MLX 4-bit / mixed(~104–106GB) 不是对象 不推荐。 文件超过 64GB 不推荐。 96GB 也装不下,或没有 KV/视觉位置
打开视觉 更紧。第一轮只做文本 同样 同样

4080 16GB 的要点不是“把 Flash-Next 塞进显存”,而是 16GB 计算 + 很大的系统内存 能不能做成 n-gram 卸载冒烟。成不成立仍是空格。

计划中(未到货)

路径 AMD AI Max+ 395 128GB Strix Halo(计划中 Gigabyte DGX Spark 128GB(计划中
Unsloth Q4 级 GGUF(~93–111GB) 权重+剩余 KV 一起扛的 目标档 同样。CUDA/llama.cpp,(如适用)vLLM 候选
n-gram 放在 NVMe 的 runbook 到货后确认 ROCm/Vulkan 路径 社区已经有 Spark 专用 runbook。到货前没有安装后记
MLX 不是 Apple 不是 Apple
购买 / 可买到(2026-08 末快照) Strix Halo 128GB 迷你 PC 因 DRAM 供应,有缺货和高价报告混在一起。到货前不把价目表当基准 Founders/转售 MSRP 区间是公开的,这间实验室下单和到货都还没确认

不把计划设备的标称(200B 推理等)当成 Flash-Next 的结果。

和 27B 那篇的关系

Qwen3.8-27B 映射 本篇(Flash-Next)
架构 稠密 27B(+视觉) MoE 125B-A6B + 51B n-gram
4-bit 文件规模 Unsloth ~14–18GB Unsloth ~94–111GB(靠近 Q4)
今天主力箱子 M1/M2 Max 上 能上去 的一侧 在手箱子上,默认假设是 卸载 / 分割
我们的 tok/s M1 Max 实测 没有

Flash-Next 不是“把 27B 再映射一遍”。同一周的发布重新打开了机队的空格(128GB)和卸载实验。

这间实验室接下来要测什么(Flash-Next)

128GB 到货前,只在现有设备上。

  1. 加载画像 — 同一份 Unsloth GGUF 放到 4080(CUDA 卸载)/ M1 Max / M2 Max。成功、OOM、常驻内存、用过的开关。
  2. n-gram 位置 — RAM vs SSD(mmap)。标称的内存节省能不能在我们箱子上复现。
  3. 质量冒烟 — 不只是加载。短编码和指令跟随有没有崩/循环。(禁止粘贴基准分数)
  4. 先关掉视觉 — 第一轮文本。mmproj、视频往后排。
  5. 128GB 到货后 — 同一文件再上 Strix Halo、Spark,用同一根针测 Q4 级常驻 + 长上下文。

不会做的事:把 Qwen/Unsloth/MLX 仓库 tok/s 写成我们的数字,把 M5 Max、5090 社区速度外推到 4080、M1/M2,把计划中的 128GB 写成已经测过,或把 27B 实测表当成 Flash-Next 结果再用一遍。

今天核对的只有文件大小和档位映射。速度格留空。

SPONSORED / ADVERTISEMENT
预留广告位 — 仅在 AdSense 审核通过后接入控制台发放的单元 ID。