Qwen3.8-27B 与 2026 年 8 月开放权重:这间实验室今天能加载什么
对照 Hugging Face 和官方文档核对 Qwen3.8-27B 与 Meta Muse Glimmer 30B,再映射到 AI Tech Engine 实验室的 M1 Max 64GB / M2 Max 96GB / RTX 4080 16GB 以及计划中的 128GB。没有未实测的 tok/s。
Qwen3.8-27B 与 2026 年 8 月开放权重:这间实验室今天能加载什么
结论(Bottom Line) 2026 年 8 月,这间实验室能在本地亲手碰到的开放权重是 Qwen3.8-27B 和 Meta Muse Glimmer 30B。两者都是 Apache 2.0。Qwen3.8-Max 级检查点(2.4T / 激活 95B)是自定义许可证,体量也在我们机队之外。今天能比较宽裕地托管 27B/30B 的是 M1 Max 64GB、M2 Max 96GB。RTX 4080 16GB 对 27B Q4 很紧,Glimmer Q4 也够不到 Meta 写的 24GB 信封。AMD AI Max+ 395 128GB 和 Gigabyte DGX Spark 128GB 仍在计划中。
这不是采购指南。而是 AI Tech Engine 在 今天桌上三台机器 上能加载什么,以及 还没到的两台 128GB 打开之后要测什么。我们没测过的 tok/s 不写。
Qwen3.8-27B — 官方卡片
仓库:Hugging Face Qwen/Qwen3.8-27B。README 许可证字段 apache-2.0。
| 官方表述 | 这间实验室怎么用 | |
|---|---|---|
| 参数量 | 卡片写 27B。HF 文件元数据也会显示 28B params | 用卡片上的 27B |
| 类型 | Causal Language Model with Vision Encoder | 只上文本和打开视觉,分开测 |
| 上下文 | 原生 262,144,扩展最大 1,000,000 | 满 262K 不是假设。只记录我们箱子能开到多少 token |
| 模态 | 原生图像、视频 | mmproj / 视觉路径开关对内存的影响,是要看的项 |
| 许可证 | Apache 2.0 | 本地再分发、内部实验阻力较小 |
| 官方服务推荐 | SGLang、vLLM、TokenSpeed | 日常循环是 Ollama / llama.cpp /(Mac)MLX。不主张 4080 16GB 上宽裕地用 vLLM 服务 |
Alibaba Cloud Community 2026-08-17 介绍:原生多模态稠密、Apache 2.0、262K 原生 / 1M 扩展(原文)。卡片上的基准分数表是 Qwen 自家数字,不搬来当我们的结果。
架构只留一行给实务:隐藏层布局 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))。64 层并不全是满注意力。KV 负担可能和老式稠密 27B 不同,但 文件大小 仍由量化决定。
官方仓库是 BF16 safetensors。这间实验室实际上加载的是 GGUF/MLX 量化。Unsloth GGUF 4-bit 文件大小(社区量化,不是官方权重):UD-IQ4_XS 14.3GB,UD-Q4_K_S 15.4GB,Q4_0 16.1GB,UD-Q4_K_M 16.5GB,UD-Q4_K_XL 17.6GB(unsloth/Qwen3.8-27B-GGUF)。Unsloth 文档里 4-bit 需求是总内存 16–19GB(docs)。“把 Q4 塞进 16GB 显存”必须和这些数字一起读。
Qwen3.8-Max / 2.4T — 不是这间实验室的对象
旗舰开放检查点:Qwen/Qwen3.8-2.4T-A95B。
| 官方表述 | |
|---|---|
| 参数量 | 总计 2.4T,激活 95B |
| 类型 | 仅文本。开放检查点没有视觉,thinking 关不掉 |
| 上下文 | 原生 262,144,扩展最大 1,010,000 |
| 许可证 | qwen3.8-max / Qwen3.8-Max License(不是 Apache 2.0) |
许可证原文(LICENSE):允许使用、修改、分发、托管、微调。月活超过 1 亿或月营收超过 2,000 万美元时须标明模型名。以 MaaS/AI Work Assistant 业务在 12 个月累计营收超过 5,000 万美元,需与 Qwen 另签许可。内部使用且不把模型或输出给第三方时,后者条款有例外。
Qwen Cloud 的 Qwen3.8-Max API 比这个检查点功能更多(视觉、non-thinking、默认 1M、内置工具)。名字一样,本地权重和 API 是两样东西。
体量:HF 写 2.4T BF16。Unsloth 公开的 1-bit GGUF 也有 397GB。就算两台计划中的 128GB 加在一起,这间实验室也不会托管它。Max 只当对照,挂个名字。
Meta Muse Glimmer 30B — 按官方页面核对
第一来源:Meta AI Research 博客、开发者文档、HF meta-models/Muse-Glimmer-30B。
| 官方表述 | |
|---|---|
| 参数量 | 30B。卡片含视觉编码器约 29.6B |
| 许可证 | Apache 2.0(权重、量化、drafter、感知编码器) |
| 上下文 | 文档默认 128K,支持更长。卡片 131,072+ |
| 模态 | 输入文本+图像,输出文本。无音频。视频按帧处理 |
| 本地设计 | 用量化把语言模型压到 20GB 以下,好在 24GB 或 32GB 信封里同时放下 KV、视觉、drafter |
GGUF(get-the-model):文本 Q4 KQuant-17GB 约 17GB(目标低于 24GB 显存),动态 Q4 约 20GB(32GB 目标),mmproj 约 1.4GB,DFlash 约 1.6GB。
Meta 把 llama.cpp、MLX、Ollama、ExecuTorch、vLLM、SGLang 写成路径。这间实验室眼下的循环是 Ollama / llama.cpp /(Mac)MLX。Meta 的 tok/s 表是 RTX 5090、M4 Max、M5 Max 的测量。那不是我们的 4080、M1 Max、M2 Max 数字。不搬。
Perplexity Portable Computer
VentureBeat 2026-08-25 和 官方产品页 对得上。
- 在 DGX Spark 以及 Linux + NVIDIA RTX 上,把 harness、编排器和本地模型打成一个包来跑。
- 本地模型:Qwen 3.8 27B 或 PPLX 27B。Nemotron 有预告。
- VentureBeat 引用:RTX 最低 24GB 显存 才是体验的底。Linux 优先,Windows 在 9 月,macOS 不在路线图上。
对我们的含义:在手的 4080 16GB 低于 24GB 底线。M1/M2 Mac 不是对象。计划中的 Gigabyte DGX Spark 128GB 才是试这款产品的位置。到货前不写安装后记。
机队映射 — 今天 vs 计划
数字是“权重组不进内存”,不是速度。
今天(在手)
| 负载 | RTX 4080 16GB(在手) | M1 Max 64GB MacBook(在手) | M2 Max 96GB Mac Studio(在手) |
|---|---|---|---|
| 7–8B Q4 | 日常 CUDA 循环 | 移动 / MLX | 常开,没问题 |
| 14B Q4 | 现实 | 宽裕 | 宽裕 |
| Qwen3.8-27B Q4 | 很紧。 4-bit 文件 14–18GB。打开 KV 或视觉很容易越过 16GB。Q3 或极短上下文冒烟测试 | 可以。 当前主力。不假设满 262K | 可以,更宽裕。 27B+工具循环的常开箱子 |
| Muse Glimmer 30B Q4 | 不推荐。 Meta 目标 24/32GB。17GB+mmproj 就会超过 16GB 或没有缓存 | 可以。 Meta 明确写了 Mac 本地。我们没有 tok/s | 可以。 图像输入和智能体余量比 64GB 好 |
| 70B Q4 | 不行 | 下限尝试。牺牲上下文 | 当前机队现实上限 |
| Qwen3.8-2.4T-A95B | 不行 | 不行 | 不行 |
| Portable Computer | 低于 24GB 底线 | 没有 Mac 路线图 | 没有 Mac 路线图 |
要在 4080 上写“跑过 27B”,量化和上下文、视觉开关必须一起写。不做无条件成功报告。
计划中(未到货)— 到货后的测量对象
| 负载 | AMD AI Max+ 395 128GB Strix Halo(计划中) | Gigabyte DGX Spark 128GB(计划中) |
|---|---|---|
| Qwen3.8-27B Q4 | 权重+长上下文+智能体状态一起扛的位置 | 同样。CUDA 栈,vLLM 候选 |
| Muse Glimmer 30B Q4 | 超过 24/32GB 目标的余量。常开本地智能体实验 | 同样。CUDA 服务 / harness |
| 70B Q4 | 买这台箱子的理由 | NVIDIA 标称微调最大 70B。推理标称 200B 未实测 |
| Qwen 2.4T | 不行 | 不行 |
| Portable Computer | 以 NVIDIA 为前提的产品。不是第一目标 | 官方 / VentureBeat 把 Spark 写成第一目标。到货后只确认能不能装上 |
这间实验室接下来要测什么(27B/30B)
128GB 到来之前,在手三台上也只留这些。速度表还在后面。
- 加载画像 — 同一份 Qwen3.8-27B GGUF/MLX、同一份 Glimmer Q4,放到 4080 / M1 Max / M2 Max。成功、OOM、占用内存。
- 上下文上限 — 视觉关掉,把上下文往上加,看在哪断。不把 262K/128K 标称当成我们的上限。
- 打开视觉 — 27B mmproj、Glimmer 1.4GB 投影器打开时,16GB vs 64GB vs 96GB 的差别。
- 运行时 — Ollama / llama.cpp / MLX。有的组合才写。没有的路径留空。
- 128GB 到货后 — 同一文件再上 Strix Halo、Spark,并加上 70B Q4 和工具循环墙钟。Portable Computer 只在 Spark 上试。
不会做的事:把 Qwen 自家基准分数搬成我们的结果,把 Meta 5090/M4 Max tok/s 写成我们的数字,声称 2.4T 能进 128GB,或把计划设备的标称 200B 写成 2026 年 8 月实验室能力。
文件大小和许可证今天已经核对。M1 Max 64GB 上 Qwen3.8-27B(MTPLX · omlx)和 Ornith-1.5-35B 的同 token 实测 在 后续文章。M2 Max 96GB、RTX 4080、计划中的 128GB 仍是空格。
推荐云 GPU 与工程工具
官网链接(联盟 ID 待发)联盟跟踪 ID 尚未发放。以下均为各产品官网,不会放入假的 ref/click ID。