AIAI Tech Engine
只写实际拥有的设备

关于 AI Tech Engine

我们不会把广告文案或厂商标称分数当成自己的结果。报告只覆盖桌上现有设备核对过的内容。速度(tok/s)在用同一提示词自己测完之前都是空的。Gigabyte DGX Spark 128GB 已于 2026-08-31 到货并在现场。仍无实测 tok/s。AMD Strix Halo 128GB 仍在计划中。

1. 媒体使命与原则

本地 LLM 文章里,显存和统一内存常常被写成同一个数字。真实实验室里,16GB CUDA 与 64/96GB Apple UMA 的瓶颈并不一样。AI Tech Engine 按自己的设备来写这个差别。

前沿 API 价格对比和云租用说明只链到官方站点。还没有联盟 ID,也不会编造假的 ref。

2. 当前实验室硬件(截至 2026 年 8 月)

设备内存角色状态
MacBook(M1 Max)64GB 统一内存移动、长上下文初稿、MLX / llama.cpp在手
Mac Studio(M2 Max)96GB 统一内存常开本地服务器,27–32B Q4,(有条件)70B Q4在手
CUDA 工作站(RTX 4080)16GB GDDR6X日常 7–8B / 14B,27B Q4 很紧在手
Gigabyte DGX Spark128GB 统一 LPDDR5x70B 级、CUDA 智能体栈在手(2026-08-31 到货,现场 · 尚未实测 tok/s)
AMD Ryzen AI Max+ 395(Strix Halo)128GB LPDDR5x70B 级 Q4、本地智能体、ROCm 对照计划中(未到货)

本实验室没有 RTX 4090 24GB、M3 Max 128GB 或 H100 集群。旧介绍里的那些规格已经删掉。

3. 测量方法(尚无速度表)

  • 现在公开的:权重是否进得了内存、许可证、量化文件大小,以及打开视觉/长上下文时哪里先卡住
  • 接下来要测的:把同一份 GGUF/MLX 放到四台机器上(以后五台),记录加载成功/OOM、能开的上下文、工具循环墙钟。Spark tok/s 仍是空的
  • 仍然不会做的:把厂商 tok/s 当成我们的数字,或把已到货 Spark 的标称 200B、未到货的 Strix Halo 写成实验室能力

4. 透明度与联盟政策

当前推荐卡片只使用 RunPod、Vast.ai、Cursor 的官方站点 URL。尚未发放跟踪 ID,也不会放入假的 ref。真正的联盟 URL 到位后,只会通过 PUBLIC_AFFILIATE_RUNPOD_URL、PUBLIC_AFFILIATE_VAST_URL、PUBLIC_AFFILIATE_CURSOR_URL 替换。