AIAI Tech Engine
首页/基准报告/Qwen3.8-27B 与 2026 年 8 月开放权重:这间实验室今天能加载什么
#Qwen3.8#Muse Glimmer#开放权重#本地LLM#Apache-2.0#测试床

Qwen3.8-27B 与 2026 年 8 月开放权重:这间实验室今天能加载什么

对照 Hugging Face 和官方文档核对 Qwen3.8-27B 与 Meta Muse Glimmer 30B,再映射到 AI Tech Engine 实验室的 M1 Max 64GB / M2 Max 96GB / RTX 4080 16GB 以及计划中的 128GB。没有未实测的 tok/s。

AIAI Tech Engine Lab
已在独立测试床核对
SPONSORED / ADVERTISEMENT
预留广告位 — 仅在 AdSense 审核通过后接入控制台发放的单元 ID。

Qwen3.8-27B 与 2026 年 8 月开放权重:这间实验室今天能加载什么

结论(Bottom Line) 2026 年 8 月,这间实验室能在本地亲手碰到的开放权重是 Qwen3.8-27B 和 Meta Muse Glimmer 30B。两者都是 Apache 2.0。Qwen3.8-Max 级检查点(2.4T / 激活 95B)是自定义许可证,体量也在我们机队之外。今天能比较宽裕地托管 27B/30B 的是 M1 Max 64GB、M2 Max 96GB。RTX 4080 16GB 对 27B Q4 很紧,Glimmer Q4 也够不到 Meta 写的 24GB 信封。AMD AI Max+ 395 128GB 和 Gigabyte DGX Spark 128GB 仍在计划中。

这不是采购指南。而是 AI Tech Engine今天桌上三台机器 上能加载什么,以及 还没到的两台 128GB 打开之后要测什么。我们没测过的 tok/s 不写。

Qwen3.8-27B — 官方卡片

仓库:Hugging Face Qwen/Qwen3.8-27B。README 许可证字段 apache-2.0

官方表述 这间实验室怎么用
参数量 卡片写 27B。HF 文件元数据也会显示 28B params 用卡片上的 27B
类型 Causal Language Model with Vision Encoder 只上文本和打开视觉,分开测
上下文 原生 262,144,扩展最大 1,000,000 满 262K 不是假设。只记录我们箱子能开到多少 token
模态 原生图像、视频 mmproj / 视觉路径开关对内存的影响,是要看的项
许可证 Apache 2.0 本地再分发、内部实验阻力较小
官方服务推荐 SGLang、vLLM、TokenSpeed 日常循环是 Ollama / llama.cpp /(Mac)MLX。不主张 4080 16GB 上宽裕地用 vLLM 服务

Alibaba Cloud Community 2026-08-17 介绍:原生多模态稠密、Apache 2.0、262K 原生 / 1M 扩展(原文)。卡片上的基准分数表是 Qwen 自家数字,不搬来当我们的结果。

架构只留一行给实务:隐藏层布局 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))。64 层并不全是满注意力。KV 负担可能和老式稠密 27B 不同,但 文件大小 仍由量化决定。

官方仓库是 BF16 safetensors。这间实验室实际上加载的是 GGUF/MLX 量化。Unsloth GGUF 4-bit 文件大小(社区量化,不是官方权重):UD-IQ4_XS 14.3GB,UD-Q4_K_S 15.4GB,Q4_0 16.1GB,UD-Q4_K_M 16.5GB,UD-Q4_K_XL 17.6GB(unsloth/Qwen3.8-27B-GGUF)。Unsloth 文档里 4-bit 需求是总内存 16–19GB(docs)。“把 Q4 塞进 16GB 显存”必须和这些数字一起读。

Qwen3.8-Max / 2.4T — 不是这间实验室的对象

旗舰开放检查点:Qwen/Qwen3.8-2.4T-A95B

官方表述
参数量 总计 2.4T,激活 95B
类型 仅文本。开放检查点没有视觉,thinking 关不掉
上下文 原生 262,144,扩展最大 1,010,000
许可证 qwen3.8-max / Qwen3.8-Max License(不是 Apache 2.0)

许可证原文(LICENSE):允许使用、修改、分发、托管、微调。月活超过 1 亿或月营收超过 2,000 万美元时须标明模型名。以 MaaS/AI Work Assistant 业务在 12 个月累计营收超过 5,000 万美元,需与 Qwen 另签许可。内部使用且不把模型或输出给第三方时,后者条款有例外。

Qwen Cloud 的 Qwen3.8-Max API 比这个检查点功能更多(视觉、non-thinking、默认 1M、内置工具)。名字一样,本地权重和 API 是两样东西。

体量:HF 写 2.4T BF16。Unsloth 公开的 1-bit GGUF 也有 397GB。就算两台计划中的 128GB 加在一起,这间实验室也不会托管它。Max 只当对照,挂个名字。

Meta Muse Glimmer 30B — 按官方页面核对

第一来源:Meta AI Research 博客开发者文档HF meta-models/Muse-Glimmer-30B

官方表述
参数量 30B。卡片含视觉编码器约 29.6B
许可证 Apache 2.0(权重、量化、drafter、感知编码器)
上下文 文档默认 128K,支持更长。卡片 131,072+
模态 输入文本+图像,输出文本。无音频。视频按帧处理
本地设计 用量化把语言模型压到 20GB 以下,好在 24GB 或 32GB 信封里同时放下 KV、视觉、drafter

GGUF(get-the-model):文本 Q4 KQuant-17GB 约 17GB(目标低于 24GB 显存),动态 Q4 约 20GB(32GB 目标),mmproj 约 1.4GB,DFlash 约 1.6GB。

Meta 把 llama.cpp、MLX、Ollama、ExecuTorch、vLLM、SGLang 写成路径。这间实验室眼下的循环是 Ollama / llama.cpp /(Mac)MLX。Meta 的 tok/s 表是 RTX 5090、M4 Max、M5 Max 的测量。那不是我们的 4080、M1 Max、M2 Max 数字。不搬。

Perplexity Portable Computer

VentureBeat 2026-08-25官方产品页 对得上。

  • 在 DGX Spark 以及 Linux + NVIDIA RTX 上,把 harness、编排器和本地模型打成一个包来跑。
  • 本地模型:Qwen 3.8 27B 或 PPLX 27B。Nemotron 有预告。
  • VentureBeat 引用:RTX 最低 24GB 显存 才是体验的底。Linux 优先,Windows 在 9 月,macOS 不在路线图上

对我们的含义:在手的 4080 16GB 低于 24GB 底线。M1/M2 Mac 不是对象。计划中的 Gigabyte DGX Spark 128GB 才是试这款产品的位置。到货前不写安装后记。

机队映射 — 今天 vs 计划

数字是“权重组不进内存”,不是速度。

今天(在手)

负载 RTX 4080 16GB(在手) M1 Max 64GB MacBook(在手) M2 Max 96GB Mac Studio(在手)
7–8B Q4 日常 CUDA 循环 移动 / MLX 常开,没问题
14B Q4 现实 宽裕 宽裕
Qwen3.8-27B Q4 很紧。 4-bit 文件 14–18GB。打开 KV 或视觉很容易越过 16GB。Q3 或极短上下文冒烟测试 可以。 当前主力。不假设满 262K 可以,更宽裕。 27B+工具循环的常开箱子
Muse Glimmer 30B Q4 不推荐。 Meta 目标 24/32GB。17GB+mmproj 就会超过 16GB 或没有缓存 可以。 Meta 明确写了 Mac 本地。我们没有 tok/s 可以。 图像输入和智能体余量比 64GB 好
70B Q4 不行 下限尝试。牺牲上下文 当前机队现实上限
Qwen3.8-2.4T-A95B 不行 不行 不行
Portable Computer 低于 24GB 底线 没有 Mac 路线图 没有 Mac 路线图

要在 4080 上写“跑过 27B”,量化和上下文、视觉开关必须一起写。不做无条件成功报告。

计划中(未到货)— 到货后的测量对象

负载 AMD AI Max+ 395 128GB Strix Halo(计划中 Gigabyte DGX Spark 128GB(计划中
Qwen3.8-27B Q4 权重+长上下文+智能体状态一起扛的位置 同样。CUDA 栈,vLLM 候选
Muse Glimmer 30B Q4 超过 24/32GB 目标的余量。常开本地智能体实验 同样。CUDA 服务 / harness
70B Q4 买这台箱子的理由 NVIDIA 标称微调最大 70B。推理标称 200B 未实测
Qwen 2.4T 不行 不行
Portable Computer 以 NVIDIA 为前提的产品。不是第一目标 官方 / VentureBeat 把 Spark 写成第一目标。到货后只确认能不能装上

这间实验室接下来要测什么(27B/30B)

128GB 到来之前,在手三台上也只留这些。速度表还在后面。

  1. 加载画像 — 同一份 Qwen3.8-27B GGUF/MLX、同一份 Glimmer Q4,放到 4080 / M1 Max / M2 Max。成功、OOM、占用内存。
  2. 上下文上限 — 视觉关掉,把上下文往上加,看在哪断。不把 262K/128K 标称当成我们的上限。
  3. 打开视觉 — 27B mmproj、Glimmer 1.4GB 投影器打开时,16GB vs 64GB vs 96GB 的差别。
  4. 运行时 — Ollama / llama.cpp / MLX。有的组合才写。没有的路径留空。
  5. 128GB 到货后 — 同一文件再上 Strix Halo、Spark,并加上 70B Q4 和工具循环墙钟。Portable Computer 只在 Spark 上试。

不会做的事:把 Qwen 自家基准分数搬成我们的结果,把 Meta 5090/M4 Max tok/s 写成我们的数字,声称 2.4T 能进 128GB,或把计划设备的标称 200B 写成 2026 年 8 月实验室能力。

文件大小和许可证今天已经核对。M1 Max 64GB 上 Qwen3.8-27B(MTPLX · omlx)和 Ornith-1.5-35B 的同 token 实测后续文章。M2 Max 96GB、RTX 4080、计划中的 128GB 仍是空格。

SPONSORED / ADVERTISEMENT
预留广告位 — 仅在 AdSense 审核通过后接入控制台发放的单元 ID。