2026 本地 AI 实验室构成:16GB CUDA vs 64/96GB Mac vs 计划中的 128GB
AI Tech Engine 实验室的实际设备。RTX 4080 16GB、M1 Max 64GB、M2 Max 96GB 现在各自干什么,计划中的 Strix Halo 与 DGX Spark 128GB 为什么留给 70B 级和本地智能体。不写入未实测的 TPS。
2026 本地 AI 实验室构成:16GB CUDA vs 64/96GB Mac vs 计划中的 128GB
结论(Bottom Line) 今天实验室能实测的是三台。RTX 4080 16GB 是 CUDA 路径上偏快的中小模型机器,27B Q4 很紧。M1 Max 64GB、M2 Max 96GB 统一内存才是当前长上下文和大权重的主力。AMD Ryzen AI Max+ 395 128GB(Strix Halo)和 Gigabyte DGX Spark 128GB 仍未到货(计划中),到了以后会接手 70B 级和本地智能体。本文不写入我们没测过的 tok/s。
读本地 LLM 文章时,一张卡的显存和统一内存箱子常常被写成同一个数字。真实实验室里,两者的瓶颈不一样。16GB CUDA 算得快,但权重 + KV 缓存在卡里出不去。64/96GB Apple UMA 容量够,带宽和运行时路径却不是 CUDA。128GB 是为了补这块缝,不是已经跑完基准的机器。
截至 2026 年 8 月 30 日,AI Tech Engine 把 现在有的 和 还在计划的 分开写。
当前机队(在手)
| 设备 | 内存 | 内存结构 | 角色 | 状态 |
|---|---|---|---|---|
| MacBook(M1 Max) | 64GB | Apple 统一内存,官方最大 64GB、带宽最高 400GB/s | 移动、长上下文、MLX / llama.cpp | 在手 |
| Mac Studio(M2 Max) | 96GB | Apple 统一内存,官方最大 96GB、带宽最高 400GB/s | 常开本地服务器,14–32B,(有条件)70B Q4 | 在手 |
| CUDA 工作站(RTX 4080) | 16GB GDDR6X | 独立显存。NVIDIA 官方规格 16GB | 7–8B / 14B 舒服,27B Q4 很紧 | 在手 |
规格来自厂商页面。M1 Max 统一内存最大 64GB、400GB/s:Apple 新闻室(2021-10)。M2 Max 最大 96GB、400GB/s:Apple 新闻室(2023-01)。RTX 4080 16GB GDDR6X:NVIDIA GeForce RTX 4080 Family。
计划机队(未到货)
下面两台 现在不在实验室里。 是后续测量对象。
| 设备 | 内存 | 厂商标称 | 计划角色 | 状态 |
|---|---|---|---|---|
| AMD Ryzen AI Max+ 395(Strix Halo) | 128GB LPDDR5x | 官方最大内存 128GB。Halo Developer Platform 配置为 128GB、带宽 256GB/s、Radeon 8060S 40CU | 70B 级 Q4、本地智能体、ROCm / llama.cpp | 计划中 |
| Gigabyte DGX Spark(GIGABYTE AI TOP ATOM / NVIDIA GB10) | 128GB 统一 LPDDR5x | NVIDIA DGX Spark:128GB coherent unified,带宽 273GB/s。Gigabyte AI TOP ATOM 同样是 128GB 统一内存 | 70B 级、CUDA 智能体栈,(如适用)Portable Computer | 计划中 |
来源:AMD Ryzen AI Max+ 395、AMD Ryzen AI Halo Developer Platform、NVIDIA DGX Spark、GIGABYTE AI TOP ATOM。
NVIDIA 在 DGX Spark 上标称推理最大 200B 参数、微调最大 70B。那是 NVIDIA 产品页的主张,不是本实验室的实测。Gigabyte 也写单机 200B、用 ConnectX-7 两台相连时 405B。到货前,不会把那些标称当成我们的基准。
运行时:实际在用的路径
实验室给模型当主机,日常是这三条:
- Ollama — Mac 和 CUDA 上都用来快速拉起来。包着 GGUF 一类文件的接口。
- llama.cpp — 要自己动量化、上下文、层卸载时。CUDA / Metal /(计划中)Vulkan · ROCm。
- MLX — 仅 Apple Silicon。M1 Max、M2 Max 把权重放进统一内存时的主力之一。
CUDA 箱子以后也可以接 vLLM、SGLang。Qwen 官方卡片把这两项当生产服务引擎。但现在实验室的日常循环仍是 Ollama / llama.cpp / MLX。我们不会说 4080 16GB 上用 vLLM 能“宽裕地”跑 27B。
按档位看什么才现实
数字回答的是“权重组不进内存”,不是手感速度。KV 缓存、视觉投影器、智能体工具循环都会在权重之外再吃内存。所以同一份 27B Q4,在 16GB 显存和 96GB UMA 上的体感会分开。
7–8B 档
三台都轻松。这是 4080 16GB 的本职。Q4 权重只有几个 GB,上下文开得比较大也能留在卡里。Mac 在要功耗、噪音或出门时,用 MLX / llama.cpp 跑同样大小。这一档选的是运行时,不是容量。
14–32B 档(含 27B)
从这里设备开始分岔。
- RTX 4080 16GB: 14B Q4 是现实的日常负载。27B Q4 很紧。 Unsloth 公开的 Qwen3.8-27B GGUF,4-bit 大约 14.3–17.6GB(
UD-IQ4_XS14.3GB,UD-Q4_K_S15.4GB,Q4_016.1GB,UD-Q4_K_M16.5GB,UD-Q4_K_XL17.6GB,unsloth/Qwen3.8-27B-GGUF)。Unsloth 文档里 4-bit 总需求也是 16–19GB。把 Q4 放到 16GB 卡上,KV 缓存和多模态投影器几乎没位置。诚实的预期是:短上下文、更低量化(Q3),或“能加载但放弃智能体循环”。 - M1 Max 64GB / M2 Max 96GB: 当前 27–32B Q4 的主力。权重不会被 16GB 显存切掉,统一内存还能把上下文开得更大。带宽可能不如 4080 GDDR6X,但 能不能上去 是这两台在回答的问题。96GB Studio 比 64GB MacBook 更宽裕。长上下文、视觉输入、工具循环一齐打开,64GB 也会很快变紧。
- 计划中的 128GB: 不是“勉强把 27B 抬上去”,而是要把上下文和智能体状态一起带着走。现在只是计划。
70B 档
16GB CUDA 不成立。Q4 70B 权重自己就大约三十多 GB,再加 KV。
- M1 Max 64GB: 接近能 尝试 Q4 70B 的下限。就算上去,上下文、batch、视觉也很难一起开。
- M2 Max 96GB: 当前机队里把 70B Q4 停在本地最现实的箱子。离“宽裕的智能体运行时”仍远。
- 计划中的 128GB(Strix Halo / DGX Spark): 为 70B 级和本地智能体买的设备。到货前,不把标称 200B 推理当成我们的结果。
箱子怎么分工
实务分工大致固定:
- 4080 16GB — 重复多的短任务。7–8B / 14B、CUDA 内核确认、llama.cpp CUDA 构建、量化文件“能不能加载”的筛查。27B 只做到冒烟测试。
- M1 Max 64GB MacBook — 移动、草稿、MLX 路径、长上下文初稿。没电源的环境里跑 14–32B。
- M2 Max 96GB Mac Studio — 常开的本地端点。32B 前后,以及必要时的 70B Q4。Apple 路径的基准机。
- 计划中的 Strix Halo 128GB — x86 统一内存对照。同一份 70B GGUF,在带宽和 ROCm 路径上跟 Mac UMA 比。
- 计划中的 Gigabyte DGX Spark 128GB — NVIDIA 统一内存 + CUDA 软件栈。智能体 harness、以 Spark 为前提的本地包装(例如 Portable Computer)实验位。规格映射在开放权重那篇里。
不会把三台(现在)或五台(含计划)压成一个“实验室 TPS”。内存结构不同,瓶颈就不同。
诚实的边界
- 未实测速度。 Meta 把 Muse Glimmer Q4 的 tok/s 发在 RTX 5090、M4 Max、M5 Max 上。Unsloth 把 B200 上的 NVFP4 吞吐公开了。都不是我们的机队。不跟着抄。我们手头只有 M1 Max 64GB + Qwen3.8-27B 的 2026-08-30 实测。
- 16GB 的含义。 2026 年 8 月开放权重 27B/30B Q4 文件经常超过 16GB,或不超也留不出 KV。4080 在这间实验室不是“跑 27B 的卡”,而是“把 27B Q4 有多紧展示出来的卡”。
- 统一内存的含义。 64/96GB Mac 成为当前长上下文、大权重路径,是因为容量,不是速度炫耀。
- 128GB 还不是数据点。 到货后,用同一提示词、同一量化、同一上下文,把三种结构(16GB CUDA / Apple UMA / 128GB UMA)并排来测。
两台 128GB 到了以后要测什么
设备放到桌上之后,只测下面这些。在那之前留空。
- 同一权重能不能加载 — Qwen3.8-27B Q4、Muse Glimmer 30B Q4,再加一个 70B 级 Q4。成功/失败、占用内存、上下文能开到哪。
- 运行时矩阵 — 同一模型走 Ollama / llama.cpp /(Mac)MLX /(Spark)CUDA 服务。能对齐时用同一套提示词。
- 智能体循环 — 不是一次聊完。多轮工具调用,连失败重试一起算墙钟。不只报告 tok/s。
- Strix Halo vs DGX Spark — 都是 128GB,带宽(AMD 标称 256GB/s vs NVIDIA 标称 273GB/s)和软件栈不同。同一份 70B Q4 比内存余量和稳定性。
- 16GB 对照 — 4080 上失败的设置(长上下文、视觉+文本、带 drafter)在 128GB 上打不打得开。打得开,那就是买 128GB 的理由。
速度表出来之前,能写的句子只有一句。现在 16GB CUDA 是 27B Q4 的下限,64/96GB Mac 是长上下文路径,128GB 是为 70B 和智能体准备的计划扩展。
推荐云 GPU 与工程工具
官网链接(联盟 ID 待发)联盟跟踪 ID 尚未发放。以下均为各产品官网,不会放入假的 ref/click ID。