关于 AI Tech Engine
我们不会把广告文案或厂商标称分数当成自己的结果。报告只覆盖桌上现有设备核对过的内容。速度(tok/s)在用同一提示词自己测完之前都是空的。Gigabyte DGX Spark 128GB 已于 2026-08-31 到货并在现场。仍无实测 tok/s。AMD Strix Halo 128GB 仍在计划中。
1. 媒体使命与原则
本地 LLM 文章里,显存和统一内存常常被写成同一个数字。真实实验室里,16GB CUDA 与 64/96GB Apple UMA 的瓶颈并不一样。AI Tech Engine 按自己的设备来写这个差别。
前沿 API 价格对比和云租用说明只链到官方站点。还没有联盟 ID,也不会编造假的 ref。
2. 当前实验室硬件(截至 2026 年 8 月)
| 设备 | 内存 | 角色 | 状态 |
|---|---|---|---|
| MacBook(M1 Max) | 64GB 统一内存 | 移动、长上下文初稿、MLX / llama.cpp | 在手 |
| Mac Studio(M2 Max) | 96GB 统一内存 | 常开本地服务器,27–32B Q4,(有条件)70B Q4 | 在手 |
| CUDA 工作站(RTX 4080) | 16GB GDDR6X | 日常 7–8B / 14B,27B Q4 很紧 | 在手 |
| Gigabyte DGX Spark | 128GB 统一 LPDDR5x | 70B 级、CUDA 智能体栈 | 在手(2026-08-31 到货,现场 · 尚未实测 tok/s) |
| AMD Ryzen AI Max+ 395(Strix Halo) | 128GB LPDDR5x | 70B 级 Q4、本地智能体、ROCm 对照 | 计划中(未到货) |
本实验室没有 RTX 4090 24GB、M3 Max 128GB 或 H100 集群。旧介绍里的那些规格已经删掉。
3. 测量方法(尚无速度表)
- 现在公开的:权重是否进得了内存、许可证、量化文件大小,以及打开视觉/长上下文时哪里先卡住
- 接下来要测的:把同一份 GGUF/MLX 放到四台机器上(以后五台),记录加载成功/OOM、能开的上下文、工具循环墙钟。Spark tok/s 仍是空的
- 仍然不会做的:把厂商 tok/s 当成我们的数字,或把已到货 Spark 的标称 200B、未到货的 Strix Halo 写成实验室能力
4. 透明度与联盟政策
当前推荐卡片只使用 RunPod、Vast.ai、Cursor 的官方站点 URL。尚未发放跟踪 ID,也不会放入假的 ref。真正的联盟 URL 到位后,只会通过 PUBLIC_AFFILIATE_RUNPOD_URL、PUBLIC_AFFILIATE_VAST_URL、PUBLIC_AFFILIATE_CURSOR_URL 替换。
推荐云 GPU 与工程工具
官网链接(联盟 ID 待发)联盟跟踪 ID 尚未发放。以下均为各产品官网,不会放入假的 ref/click ID。