M6 Mac mini 评测:预填充快 3.5 倍、解码只快 49%——899 美元的本地 AI 主机,瓶颈其实写死在两处
9 月 22 日第一批 M6 Mac mini 到货,评测和实测数据也跟着出来了。官网 8 月 25 日开预售、9 月 22 日起陆续送达,国行四档配置 ¥6999 / ¥8499 / ¥9999 / ¥12999(前两档 M6 + 16GB,第三档 M6 + 24GB,第四档 M5 Pro + 24GB)。
这篇不重复发布会通稿,只回答两个问题:这批机器跑本地模型到底快了多少,以及这些提升对 AI 应用意味着什么、不意味着什么。本站 9 月 17 日写过一篇开卖前的《M6 Mac mini 开卖前夜》(/posts/a420/),那篇算的是「值不值」;这篇补上到货后的实测数据和硬件层面的解释。
先把硬数字摆出来,再解释为什么其中一个是 3.5 倍、另一个只有 1.5 倍。
一、实测数据:三组独立来源
1.1 本地模型(Ziskind,Qwen3.5-9B 4bit)
YouTuber Alex Ziskind 在到货当天放出的对比测试,被 eTeknix 和 wccftech 在 9 月 22 日同步转述,是目前可见的唯一一份公开的 M6 vs M4 本地推理逐项对比:
| 项目 |
M6 Mac mini |
M4 Mac mini |
变化 |
| 预填充(prompt processing) |
742 tok/s |
210 tok/s |
+253.3% |
| 解码(token generation) |
26.9 tok/s |
18.0 tok/s |
+49.4% |
| llama-benchy 首 token 延迟 |
0.72 s |
2.50 s |
−71% |
| FLUX.1 单图生成 |
36 s |
94 s |
−61.7% |
| 整机功耗(实测) |
38 W |
44 W |
−14% |
测试模型是 4bit 量化的 Qwen3.5-9B,不是最重的模型,但足够把两代芯片的差异摊开。注意最后一行:更快的同时功耗更低,这一条比性能数字更有说服力——它不是靠拉高频率换来的。
1.2 CPU / GPU(Ars Technica,9 月 21 日的 M6 版评测)
Ars 的测试机是 24GB 版本,结论可以概括成三句:
• 单核性能比 M5 系列快约 8%–10%,图形性能也快约 10%;
• 多核比 M5 快约 20%,比 M4 快 50%–80%(部分项目更高);
• Blender 项目上接近 M4 Pro、比 M5 快约 40%——Ars 直接点名,这一项受益于 GPU 核心内置的神经加速器。
同一篇里还有一条反向结论值得记住:核心数仍然比核心新更重要。用同一块 18 核 CPU 的 M5 Max 作参照,重多核负载下它依然比 M6 快 60%–70%。M6 强在「入门芯片换代」,不在「越级挑战 Pro/Max」。
1.3 一个测量坑
Ars 提到:在 M6 上,powermetrics 不上报 CPU 功耗——日志里有这个字段,值恒为 0,M5 世代芯片上一切正常。作者已经去问苹果这是 bug 还是有意为之。所以任何「M6 的 CPU 功耗比 M4 低/高多少」的说法,目前都没有工具层面的依据;Ziskind 的 38W/44W 是整机口径,可以采信,但不能拆到 CPU 上。
二、M6 到底改了什么
把规格摊开看,M6 是入门芯片这几年最大的一次改动:
|
M6 |
M5 |
M4 |
| CPU 核心 |
2 超级核心 + 4 性能核心 + 6 能效核心(12 核) |
4 超级核心 + 6 能效核心(10 核) |
4 性能核心 + 6 能效核心(10 核) |
| GPU 核心 |
12(每核带神经加速器) |
10(每核带神经加速器) |
10 |
| 神经网络引擎 |
双 16 核(共 32 核) |
16 核 |
16 核 |
| 内存带宽 |
16GB 机型 153GB/s;24GB / 32GB 机型 170GB/s |
153GB/s |
120GB/s |
| 内存上限 |
32GB |
32GB |
32GB |
三个细节值得单独说:
第一,内存带宽分档。 16GB 机型只有 153GB/s(和 M5 一样),24GB 和 32GB 机型才有 170GB/s。买 16GB 版本的人,拿不到这一代最关键的 AI 提升。 这是本篇最实用的一条购买建议,后面还会回到它。
第二,powermetrics 的读数暗示 M6 内部还是「两种核心」。 六个能效核单独成簇,两个超级核心和四个性能核心被并成一组叫 "PS cluster";两者时钟区间相同(1.44GHz–4.79GHz),共享 20MB L2(M5 的超级核心簇是 16MB)。也就是说,苹果自己在调度上把三种核心当两种用。
第三,这一代可能只有 M6。 彭博社 Gurman 的说法是苹果不打算做完整的 M6 世代,Pro / Max / Ultra 可能直接跳到 M7。对买 Mac mini 的人来说,这个传闻的实际含义是:想要更强,要么现在上 M5 Pro,要么等到 M7 世代——中间不会有 M6 Pro 出现。
端口与形态(没变的部分)
外观沿用 M4 世代的 5×5 英寸、2 英寸厚机身,底部进风、主动散热。前面两个 10Gbps USB-C 加耳机孔,后面 2.5GbE(可选万兆)、HDMI 和三个雷雳口——M6 版是雷雳 4,M5 Pro 版才是雷雳 5。无线升到 Wi-Fi 7 和蓝牙 6。
雷雳这一条对 AI 用户不是小事,后面单独讲。
三、为什么一个是 3.5 倍,另一个只有 1.5 倍
这是本篇的核心。两个数字差这么多,不是苹果「优化得偏科」,而是本地推理的两个阶段卡在完全不同的硬件资源上。
3.1 预填充吃算力
预填充(prefill)是把整个提示一次性塞进模型、算出 KV 缓存。这一步是大矩阵乘法,与序列长度成正比,属于算力密集型:每读一次权重,就能在整段提示上摊开算。
M6 在这一步的改动全都对着算力去:GPU 从 10 核加到 12 核、每核内置神经加速器(专门加速矩阵乘)、神经网络引擎从 16 核翻到 32 核、P 核做到 4.79GHz。苹果自己的口径是 LM Studio 里的提示处理最高比 M4 快 4.8 倍;Ziskind 测出的 253% 反而更保守。
3.2 解码吃带宽,而且这次几乎只能吃带宽
解码(decode)是每生成一个 token,都要把全部权重读一遍。它不看算力看带宽:
解码速度上限 ≈ 内存带宽 ÷ 每 token 需要读的字节数
把 170GB/s 代进去,和 Ziskind 的实测对一下:
| 模型(4bit) |
权重体积(约) |
带宽上限 |
实测 / 理论上限 |
| Qwen3.5-9B |
5.3GB |
≈32 tok/s |
26.9 → 84% |
| 27B 级稠密模型 |
≈16GB |
≈10.6 tok/s |
— |
| 70B 级稠密模型 |
≈40GB |
装不下(32GB 上限) |
— |
内存带宽从 120GB/s(M4)到 170GB/s(M6 24/32GB 机型)是 1.42 倍,实测解码 1.49 倍——吻合到 5% 以内。这不是巧合,它说明解码这四百多 token 的提升,几乎全部来自那 50GB/s 的带宽增量,剩下的才是缓存和调度的微调。
结论:M6 的这次升级,买的是「读得快」,不是「吐得快」。 对 agent、RAG、代码库索引这类「长输入、短输出」的活,它提升是成倍级别的;对「让它写一篇三千字文章」这种长输出任务,你的体感提升大概就是 1.5 倍。
3.3 上下文(KV 缓存)也要吃内存
容量规划时容易漏掉 KV 缓存:
KV 字节数 ≈ 2 × 层数 × KV 头数 × head_dim × 上下文长度 × 每元素字节数
以 27B 级、约 48 层、GQA 8 个 KV 头的模型、8K 上下文、fp16 缓存为例,单条会话就要 1GB 上下;32K 上下文就是 4GB 级。24GB 机型装 16GB 的模型,剩下 8GB 是给系统、KV 缓存和图像生成共用的——这是「能装下」和「能舒服地用」之间的差别。
四、对 AI 应用的真实优势(按场景打分)
| 场景 |
适配度 |
原因 |
| 常驻本地 agent 主机 |
强 |
首 token 0.72s,单轮响应体感接近云端;38W 全天候开着也不心疼 |
| RAG / 代码库索引 / 批量 embedding |
强 |
预填充是它的长板,742 tok/s 的吞吐直接把索引时间砍到原来 1/3 |
| 图像生成(FLUX / SD) |
强 |
FLUX.1 单图 36s,比 M4 快 61.7%;M5 起加入的 GPU 神经加速器在这里最吃重 |
| 语音转写(Whisper 系) |
强 |
这类模型体积小、对带宽不敏感,M6 绰绰有余 |
| 长文生成 / 批量出文 |
中 |
解码受 170GB/s 封顶,27B 级模型约 10 tok/s,能忍但不爽 |
| 本地微调(LoRA / QLoRA) |
弱 |
32GB 内存上限 + 170GB/s 带宽,7B 级勉强,再大就出局 |
| 多机集群堆大模型 |
不支持 |
M6 版是雷雳 4,集群需要雷雳 5(M5 Pro 及以上才有) |
两个必须说清的限制:
内存上限 32GB 是硬墙。 4bit 量化下 32GB 大概能装 27B–34B 级稠密模型并留一点 KV 余量;再往上的 70B 级、以及那些「几百 B 参数、靠 MoE 激活」的模型,这台机器装不下。想要更大的模型,本地路线的下一站是 128GB 统一内存级设备(NVIDIA DGX Spark 的官方规格是 128GB LPDDR5x、273GB/s,标称最高支持 200B 参数;Mac Studio M5 Ultra 则是最高 512GB、1.2TB/s)。价差是数量级的:M6 Mac mini ¥6999 起,Mac Studio M5 Ultra 5499 美元起。
雷雳 4 = 不能进集群。 苹果在多机推理上的做法是用雷雳 5 + RDMA 把多台机器拼成一个共享内存池,Mac Studio 官方文稿里明确写了这条路。Mac mini 上只有 M5 Pro 版有雷雳 5;M6 版的三口雷雳 4 上限 40Gbps,进不了这个集群。如果你的规划是「先买一台,过两年再拼一台」,这个限制现在就得考虑进去。
电费这条账,值得算一次
38W 满载、一天 24 小时不停:
0.038 kW × 24 h = 0.912 kWh/天
按 0.6 元/kWh ≈ 0.55 元/天 ≈ 200 元/年
也就是说,只要你不关机,这台机器一年的电费在两百元级别。它的意义不是「省了多少钱」,而是本地推理的边际成本接近于零:跑一次 embedding、重排一次索引、让 agent 通宵跑批,不会再产生按 token 计费的心痛感。这是 M6 Mac mini 在 AI 场景里最容易被低估的优势——它是台可以「随便用」的机器。
但它为什么涨价 300 美元
因为内存。TrendForce 在 2026 年 2 月的报告里把 1Q26 常规 DRAM 合约价的环比涨幅上调到 +90%~95%,NAND 闪存 +55%~60%,来源是 CSP 和服务器厂商的抢产能。苹果在 6 月 25 日对 Mac、iPad 等产品线做了数百美元级别的涨价,$599 的 M4 Mac mini 从配置器里直接下架,入门档变成 512GB 存储的 $799;这一代 M6 Mac mini 起步价 $899(16GB + 256GB),Ars 的定评是:M6 Mac mini 的性能升级是真的,但 $599 那台「苹果史上最超值的桌面 Mac」没了。国行同理:¥6999 的入门档,16GB 内存 + 256GB 存储。
256GB 存储对本地 AI 是真不够。 一个 27B 4bit 模型 16GB、一个 9B 模型 5GB、FLUX 权重 24GB,加上系统,很快就满。建议直接按 512GB 起配置,或者用外置雷雳硬盘 + 软链把模型目录搬出去(第五节给了命令)。
五、上手:把模型跑起来
下面这些是我整理的可直接复制运行的脚本,用来复核上面每个结论。注意:我手上没有 Mac mini 实体,下面的代码是本地推理的标准流程 + 容量规划公式,实测数字请以你自己机器为准。
5.1 环境(一次装好)
# Homebrew 装推理工具
brew install llama.cpp # 含 llama-server / llama-bench
pip install mlx mlx-lm # 苹果自家的 MLX 栈
pip install huggingface_hub # 拉模型
export HF_ENDPOINT=https://hf-mirror.com # 国内网络需要
5.2 一条命令看真实吞吐
# llama-bench 直接输出 pp(预填充)与 tg(解码)两列,是核对 M6/M4 差异最快的方法
llama-bench -m ./qwen3.5-9b-q4_k_m.gguf -p 2048 -n 128 -r 3
# 输出里的 pp2048 = 预填充 tok/s,tg128 = 解码 tok/s
# Ziskind 那组 742 / 26.9 就是这两个量级的读数
5.3 用带宽算出你的理论上限,再看跑到了几成
# bw_check.py —— 判断「这台机器还值不值得为这个模型等」
BW = {"m6_16g": 153, "m6_24g": 170, "m6_32g": 170, "m4": 120} # GB/s
def headroom(chip, model_bytes_gb, measured_tok_s=None):
ceiling = BW[chip] / model_bytes_gb
print(f"{chip}: 理论上限 {ceiling:5.1f} tok/s")
if measured_tok_s:
print(f" 实测 {measured_tok_s:5.1f} tok/s = 效率 {measured_tok_s/ceiling:.0%}")
headroom("m6_24g", 5.3, 26.9) # 9B 4bit:上限 32.1,实测 26.9,效率 84%
headroom("m6_24g", 16.0) # 27B 4bit:上限 10.6
headroom("m4", 5.3, 18.0) # M4:上限 22.6,实测 18.0,效率 80%
跑出来应该是 84% 和 80% 两档效率——这说明苹果这代在解码路径上已经贴着带宽跑了,想再快只能加带宽,没有软件层面的便宜可捡。
5.4 容量规划:能不能装下,上下文留多少
# capacity.py —— 内存够不够,别等加载到 90% 才发现爆了
def kv_gb(layers, kv_heads, head_dim, ctx, bytes_per=2):
return 2 * layers * kv_heads * head_dim * ctx * bytes_per / 1024**3
def plan(name, params_b, weights_gb, layers, kv_heads, head_dim, ctx, ram_gb=24):
kv = kv_gb(layers, kv_heads, head_dim, ctx)
total = weights_gb + kv + 6 # 6GB:系统 + 图像/其他进程的余量
ok = "✅ 可以" if total <= ram_gb else "❌ 不够"
print(f"{name:12} 权重 {weights_gb:5.1f}GB + KV {kv:4.1f}GB + 余量 6GB = {total:5.1f}GB / {ram_gb}GB {ok}")
plan("9B q4", 9, 5.3, 36, 8, 128, 8192)
plan("27B q4", 27, 16.0, 48, 8, 128, 8192)
plan("27B q4", 27, 16.0, 48, 8, 128, 32768) # 上下文拉到 32K 再看一眼
24GB 机器上,27B + 8K 上下文是「勉强舒服」,32K 上下文就开始紧张——这正是 32GB 配置存在的理由。
5.5 起一个 OpenAI 兼容端点,给本地 agent 用
# 起服务(8K 上下文、Metal 全量卸载到 GPU)
llama-server -m ./qwen3.5-9b-q4_k_m.gguf \
-c 8192 -ngl 99 --host 127.0.0.1 --port 8080
# 用 curl 打一发,验证首 token 延迟
curl -s http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"messages":[{"role":"user","content":"用三句话解释 MoE 的稀疏激活"}],"stream":true}' \
| head -3
# 任何 OpenAI SDK 代码改一个 base_url 就能指到本地,agent 框架大多只要改这一行
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8080/v1", api_key="local")
print(client.chat.completions.create(
model="local", messages=[{"role": "user", "content": "hello"}]
).choices[0].message.content)
5.6 存储不够时把模型目录搬出去
# 假设外置雷雳盘挂载在 /Volumes/AI
mkdir -p /Volumes/AI/hf-cache
mv ~/.cache/huggingface /Volumes/AI/hf-cache/huggingface
ln -s /Volumes/AI/hf-cache/huggingface ~/.cache/huggingface
# Ollama 的模型目录同理
export OLLAMA_MODELS=/Volumes/AI/ollama-models
5.7 想看功耗,先避开那个坑
# 采样 GPU/CPU 功耗(M6 上 CPU 那项恒为 0,是已知行为/潜在 bug)
sudo powermetrics --samplers gpu_power,cpu_power -i 2000 -n 5
六、买哪一档
四档配置(国行),按 AI 用途排序:
| 配置 |
价格 |
带宽 |
适合谁 |
| M6 16GB / 256GB |
¥6999 |
153GB/s |
只是偶尔跑 9B 级小模型;AI 用户不建议——拿不到 170GB/s |
| M6 16GB / 512GB |
¥8499 |
153GB/s |
同上,但存储够用了;仍然只有 153GB/s |
| M6 24GB / 512GB |
¥9999 |
170GB/s |
本地 AI 的甜点档:27B 4bit + 8K 上下文可行,FLUX 出图 36s |
| M5 Pro 24GB / 512GB |
¥12999 |
307GB/s |
要雷雳 5 集群、要大带宽跑长上下文;单看解码就能再快近一倍 |
三条判断依据:
1. 16GB 和 24GB 不是「内存差 8GB」,是带宽差 17GB/s。 想跑本地模型,最低也该上 24GB 那档。
2. 要比解码速度,比带宽就行:307 / 170 ≈ 1.8,M5 Pro 在解码上大概能再快八成(同模型同量化)。
3. 要不要为集群留位置:打算以后拼多机,M6 版直接出局,别买了再后悔。
至于「现在买还是等」:内存价格是这轮涨价的直接原因(1Q26 DRAM 合约价环比 +90% 以上),而苹果这代可能不会有 M6 Pro/Max/Ultra——等,大概率等来的是同样的价格和更强的芯片;但如果你现在就需要一台 38W 常开、能跑 27B 的机器,24GB 那档是这一代唯一值得掏钱的位置。
七、不确定的部分
写评测最怕把「一件事」写成「一个结论」,所以把没验证的部分单独列出来:
• Ziskind 的数据是单一来源(YouTube 视频,经 eTeknix / wccftech 转述),本文引用的 742 / 26.9 / 0.72s / 36s / 38W 都是他的读数,没有第二份独立复核;Ars Technica 的评测没做 LLM 基准,两套数据只能互补、不能互证。
• powermetrics 在 M6 上 CPU 功耗恒为 0,M6 的 CPU 能效目前没有工具级证据。
• 本文的带宽上限计算是模型本身的结构性约束(解码 ≈ 带宽 / 权重字节数),实测效率 80%–84% 是在 9B 模型上的读数,换成 27B 或加入推测解码(speculative decoding)后效率会变。
• M6 Pro / Max / Ultra 是否存在只有 Gurman 的传闻,苹果未确认。
• 我没有 Mac mini 实体,第五节的脚本用于复核理论值与官方/第三方数,不代表我在这台机器上跑过。
参考链接
• Apple Newsroom:Mac mini with M6 and M5 Pro(2026-08-25)https://www.apple.com/newsroom/2026/08/apple-unveils-a-more-powerful-mac-mini-featuring-the-all-new-m6-and-m5-pro/
• Apple 中国:Mac mini 技术规格 https://www.apple.com.cn/mac-mini/specs/
• Ars Technica:M6 Mac mini review(2026-09-21)https://arstechnica.com/gadgets/2026/09/apple-m6-mac-mini-review-300-price-hike-spoils-a-nice-upgrade/
• eTeknix / wccftech:Ziskind 的 M6 vs M4 AI 实测转述(2026-09-22)
• TrendForce:1Q26 内存价格展望(2026-02-02)https://www.trendforce.com/presscenter/news/20260202-12911.html
• The Verge:苹果因内存成本上调产品价格(2026-06-25)https://www.theverge.com/tech/952162/apple-price-increase-ram-shortage
• Apple Newsroom:Mac Studio with M5 Max and M5 Ultra https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra/
• NVIDIA:DGX Spark 硬件概述 https://docs.nvidia.com/dgx/dgx-spark/hardware.html
• 本站前情:M6 Mac mini 开卖前夜 https://www.oferry.com/posts/a420/
参考链接
微信正文不支持外链,以下地址可复制到浏览器打开:
· https://www.apple.com/newsroom/2026/08/apple-unveils-a-more-powerful-mac-mini-featuring-the-all-new-m6-and-m5-pro/:https://www.apple.com/newsroom/2026/08/apple-unveils-a-more-powerful-mac-mini-featuring-the-all-new-m6-and-m5-pro/
· https://www.apple.com.cn/mac-mini/specs/:https://www.apple.com.cn/mac-mini/specs/
· https://arstechnica.com/gadgets/2026/09/apple-m6-mac-mini-review-300-price-hike-spoils-a-nice-upgrade/:https://arstechnica.com/gadgets/2026/09/apple-m6-mac-mini-review-300-price-hike-spoils-a-nice-upgrade/
· https://www.trendforce.com/presscenter/news/20260202-12911.html:https://www.trendforce.com/presscenter/news/20260202-12911.html
· https://www.theverge.com/tech/952162/apple-price-increase-ram-shortage:https://www.theverge.com/tech/952162/apple-price-increase-ram-shortage
· https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra/:https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra/
· https://docs.nvidia.com/dgx/dgx-spark/hardware.html:https://docs.nvidia.com/dgx/dgx-spark/hardware.html
· https://www.oferry.com/posts/a420/:https://www.oferry.com/posts/a420/