我评测了配备 256 GB 内存的 M5 Ultra Mac Studio它是运行本地 AI 代理的梦想级 Mac.而且我已经完全切换到本地模式,只用 Hermes 了.
M5 Ultra Mac Studio 评测:本地 AI 代理的梦想级 Mac
作者:Federico Viticci(MacStories)
发布日期:2026年9月21日
过去几天,我一直在测试目前(暂时)顶配的 M5 Ultra Mac Studio(配备 256 GB 内存)。
直接说结论:M5 Ultra Mac Studio 是运行本地 AI 代理的梦想机器。这台电脑能让你以出色的性能运行基于本地模型的个人助手,而且没有额外的云成本。如果你之前因为本地模型在智能和速度上远不及云端模型,而对测试 OpenClaw 或 Hermes Agent 持怀疑态度,这台 Mac 会彻底改变你的看法。
从上周四开始,我一直在将这台 Mac Studio 与它的前代——配备 512 GB 内存的 M3 Ultra——以及我自己装有 RTX 5090 的桌面游戏 PC 进行对比。就体积、价格、散热表现,以及苹果统一内存架构而言,M5 Ultra Mac Studio 从根本上改变了我对本地运行模型的看法,以及它们现在能实现什么。当然,RTX 5090 凭借更高的内存带宽仍有优势。但考虑到我那台 PC 的庞大体积、热量和噪音,我任何时候都更愿意选择 M5 Ultra Mac Studio。它还是一台 Mac,操作系统漂亮且不糟糕,还有充满活力的应用生态。(Windows 粉丝们抱歉,但微软软件永远得不到我的同情。)
正如我将在本文中探讨的,在 M5 Ultra Mac Studio 上运行最新模型是如此舒适和快速,我已经把它设为 Open Minis for iOS 和 Hermes Agent 的默认选择。没错:我最常用的个人助手(事实上比 Siri AI 还多用)现在完全由运行在 Mac Studio 上的本地模型驱动。此外,得益于 M5 Ultra 更快的 GPU 和更高的内存带宽,这些代理响应更快,在更大上下文窗口下仍保持高速,并能运行长时、多轮循环,而不会随着会话增长而变得缓慢。因此,我也在 Mac 上的 Codex 应用中使用本地模型——无论是作为主线程,还是由 GPT-6 Astra 编排的子代理——体验都非常棒。
我需要提前说明:我不是职业 AI 开发者,我不训练或微调模型。我本质上是个折腾者,已经玩本地 AI 模型超过一年了。今年夏天,我全身心投入本地 AI,用于一个大型项目(我将在下一节解释)。
本文的目标是提供两样东西:基于我四天内运行的大量测试得出的数字和可视化,以及对本地 AI 在我工作流程中实际用例的解释,以及我如何用它完成 MacStories 的工作。
开始吧。
为什么要用本地 AI?
先解决房间里的大象:既然云端前沿模型更好、往往更快,为什么还要折腾本地 AI?
这是个合理的问题。你需要昂贵硬件来运行这些模型,等你回本时,你本可以买最贵的 Anthropic 订阅好几年,还能省钱并获得更好性能。
不同人会有不同答案。有人可能说因为隐私:他们宁愿用本地智能处理敏感数据和文档,也不愿上传到外部云。另一些人可能觉得单纯很酷——我同意。对一些人来说是工作相关:如果你是 AI 开发者,有一个出色的本地设置来训练适配器或微调模型是有意义的。
对我来说,进入本地 AI 的旅程混合了“酷,为什么不呢?”的因素,以及隐私和成本的考虑。
正如我将在本周晚些时候与 Club MacStories 会员分享的,我今年夏天为 iOS 和 iPadOS 27 评测 的研究和写作设置,正是由本地 AI 驱动并成为可能的。6 月,我创建了一个内部应用叫 Desk,用来组织数百个与 iOS 和 iPadOS 27 相关的笔记、会话、PDF 文档和网页剪辑,以及评测章节。项目结束时共有 310 个文档。在 Desk 中,一个由 DeepSeek V4 Flash 驱动的代理团队(加上用于 PDF 的 olmOCR)全天候运行了 99 天,完成以下任务:
• 转录我最喜欢的 WWDC 会话(使用 summarize + LLM 处理)
• 从网页剪辑、会话、PDF 指南和我自己的笔记中提取 iOS 和 iPadOS 27 功能
• 跨不同来源交叉引用功能,并跟踪哪些功能属于评测的哪个章节
• 从我上传的截图中提取功能和 bug
• 使用 Notion API 在多个数据库中组织一切
当我在 6 月初开始使用这套设置时,我很快意识到,依赖 OpenAI 或 Anthropic API 来做这种始终在线的持久后台任务……至少可以说成本高得离谱。于是我转向本地 AI,结果就是你现在可以在 MacStories 上读到的 iOS 和 iPadOS 27 评测。它完全由我用传统人类方式写成。但整个研究栈、笔记之间的深度链接,以及对新功能和测试版的跟踪,都由我的代理在 Mac Studio 上本地完成,总成本为 0 美元。
如果你不觉得这很酷,或者这是一个值得探索的强大概念,那么这篇文章可能不适合你——我理解。处理这些模型很繁琐,我绝不会推荐给那些(完全合理地)只想花 20 美元用 Claude 的人。这种设置本质上是当前 AI 工作流的最前沿。
如果你站在另一端,觉得这很酷……让我告诉你:M5 Ultra Mac Studio 在由 MLX 驱动的本地模型性能上是巨大飞跃,我有几个例子可以证明。
提示处理与生成的飞跃
正如你可能从发布会和我最初的报道中看到的,M5 Ultra Mac Studio 外观与它取代的 M3 Ultra 相同,但采用了全新的苹果硅架构,使用 UltraFusion 将两颗双芯片 M5 Max 连接成四芯片架构,这在苹果生态系统中是首次。就本地 AI 工作负载而言,我们需要关注两个领域(也是我从去年M5 iPad Pro 本地 AI 评测以来一直关注的):GPU 和内存带宽。
M5 Ultra 拥有下一代 80 核 GPU,每个核心都有 Neural Accelerator,使其 AI 峰值 GPU 计算能力比 M3 Ultra 高出最多 4.5 倍。内存方面,苹果统一内存架构仍最高支持 512 GB(虽然该型号要到 10 月底才出),但带宽从 819 GB/s 跃升至 1.2 TB/s,比 M3 Ultra 高出 50%。
带着这些数字,我开始将 M5 Ultra 与配备 512 GB 内存的 M3 Ultra 以及我的 RTX 5090 进行测试。下面会分享更多测试细节,但简短版是:有了 M5 Ultra,你等待模型读取提示并开始生成回复的时间大大减少;而当它开始回答时,文本出现的速度也比 M3 Ultra 快得多。仅这两项改进就让这台机器适合现代需要与模型快速迭代的代理循环,以及更大的上下文窗口。
在我日常使用运行在 M5 Ultra 上的代理时,提示预填充(模型处理提示的速度)和令牌生成的这些改进是我立刻注意到的变化。当用 iOS 上的 Open Minis 并排比较 M3 Ultra 和 M5 Ultra 上运行的模型时,M5 Ultra 平均生成回复的速度比 M3 Ultra 快约 70%。正如我们稍后会看到的,像 Qwen3.8-Flash-Next 这样的模型在短提示下能超过 100 令牌/秒,在 64K 到 256K 上下文下仍能以 60 到 85 令牌/秒写入,这绝非小事,它使你与模型之间的代理式来回感觉非常好用,尤其是在涉及工具调用时。
然而,我对提示处理性能的提升更印象深刻。当你使用 Hermes 或 Codex 这类代理助手时,模型会收到一整块指令,包括系统提示、用户个性化、会话记忆、技能和 MCP 描述等。有些代理比其他代理更擅长精简指令,但一般来说,使用现代代理时,你并不是从空上下文窗口开始。正因为如此,我从未能持续在这波新代理中使用本地模型:它们能工作,但我会盯着空白屏幕和加载指示器好一会儿,模型才开始生成回复。而且在循环的每一轮,性能都会变差(因为会话上下文更大),我还要再等一会儿。
在我的测试中,提示处理平均提升了 150%——比我之前的设置快约 2.5 倍。仅这一变化就让本地模型成为 Open Minis 和 Hermes Agent 等应用中的可靠选择。当我让 M5 Ultra 上的 Flash-Next 用 RemCTL 获取我本周的任务时,我不用等代理处理我的提示和 Open Minis 的提示:几秒钟内它就开始推理、执行工具调用等。当我处理大型项目(如下面的体素斗兽场演示)时,模型能快速处理多轮循环、分派和协调子代理,并在线程变长时以 60 到 85 令牌/秒完成这一切。
这个交互式斗兽场演示完全由运行在 M5 Ultra Mac Studio 上的 Flash-Next 创建,通过 iOS 上的 Open Minis 及其 harness 管理。
我坚信能代理式执行任务(而不仅仅是回答问题)的助手,但为了感觉好用,它们必须快。过去几个月,我用 Open Minis 测试了几家“精品”云提供商:Inco(以超过 300 TPS 提供 Kimi K3)、Cerebras(以惊人的 1,800 TPS 提供 Qwen3.8-27B),以及 Fireworks 和 Baseten 等突破 150 TPS 的。所有这些在 Open Minis 和 Hermes 中用起来感觉极好,但它们很贵(上周我 10 分钟就烧光了 20 美元的 Inco 额度),当然,我的所有数据都去了……某个地方。当我启动带 Flash-Next 和我正在创建的 Apple CLI 集合的 Open Minis 时,一切都留在本地,在一台我能看到并能随时重启的电脑里。
最重要的是:像 Flash-Next 这样的模型“足够小”,可以在 256 GB 的 M5 Ultra 上以更高量化运行(我可以完全在 RAM 中运行 5-bit;6-bit 和 8-bit 可以用这种新架构将其 n-gram 表卸载到 SSD),但又足够智能,能维持长线程和多次代理式工具调用。
对我来说,5-bit 量化在这台 Ultra 上达到了智能、性能和内存消耗的最佳平衡。但我已经知道,如果有机会测试 512 GB 的 M5 Ultra,我会非常想测量不卸载到 SSD 的 8-bit 量化性能。
我还没有花太多时间把各种项目的编码任务卸载给本地模型,但做了一些有趣的实验。有了这种性能,尤其是考虑到在 256 GB 内存下可以用 oMLX 同时堆叠最多三个带有子代理的 Flash-Next 会话,我现在可以现实地考虑把更简单的编码任务交给本地模型,再让前沿云模型审查它们的工作。例如,我在 Codex 中设置了 Qwen3.8-Flash-Next,让我能用本地模型配合 Codex harness。这意味着我可以让主 GPT 模型编排本地子代理,让 Flash-Next 协调自己的子代理,甚至直接用手机上的 Codex Remote 使用该模型。
我通常不依赖图像生成,但为了这次评测:M5 Ultra 芯片是苹果官方资产;它背后的壁纸是由运行在 M5 Ultra 上的 Qwen-Image-2.1 本地生成的,耗时 180 秒,峰值 RAM 使用 78 GB。
我很好奇真正的开发者拿到 M5 Ultra 后会写什么。随着开源权重模型现在在消费级硬件上超越了大约 10 个月前被认为是“前沿”的水平,而 M5 Ultra 的性能现在让代理式编码变得可行,我认为我们很快会在 MLX 社区看到一些迷人的实验。
M5 Ultra vs. RTX 5090
正如你将从本文后面的可视化中看到的,NVIDIA 的 RTX 5090 尽管“只有”32 GB VRAM,仍比苹果的 M5 Ultra 更快,原因有二。
提示处理速度由计算决定:模型通过一次巨大的矩阵乘法读取整个提示,而这正是 NVIDIA Tensor Cores 的专长。苹果新的 Neural Accelerators(M5 Ultra 的 80 个 GPU 核心中每个都有一个)缩小了差距,但无法完全关闭。在 6,000 令牌提示上,M5 Ultra 以约 1,700 tok/s 读取;5090 用我在 LM Studio 中测试的 Qwen 模型达到了惊人的约 3,000。令牌生成则是带宽问题:模型一次写一个令牌,并从内存中拉出整个模型,因此 5090 的 1.79 TB/s 对 M5 Ultra 的 1.2 TB/s 在每个提示大小上都有稳定约 25% 的领先。5090 没有的是内存:在 256K 时,5090 只能用 8-bit 注意力缓存完成。32 GB VRAM 也就到此为止了。
然而,这个对比有两个问题。首先,虽然 5090 在较小模型上仍略胜 M5 Ultra,但它缺乏统一内存池意味着,如果我想以极快速度运行模型,我只能受限于 GPU 的 32 GB VRAM。一旦我想运行超过 32 GB 的任何东西(比如更高量化的 Flash-Next),5090 必须通过 PCIe 把模型层卸载到(慢得多的)系统 RAM,那可不是过日子的方式。
其次,我的游戏 PC 比能放在桌面上的 Mac Studio 庞大得多——而且我已经是紧凑构建(Lian-Li A3 机箱)。更不用说在高上下文窗口运行本地模型时它有多吵和多热:当一些基准测试跑完后我走进办公室,比公寓其他地方明显更热。相比之下,桌面上“小巧”的 Mac Studio 摸起来是温的,但比我的 5090 安静得多,风扇转得没那么快也没那么响,最重要的是,它允许我本地运行更大模型(如 GLM-5.3-Flash)并获得不错性能,这得益于苹果硅的统一内存。在日常使用中,当我一直运行时,除非把耳朵贴在电脑上,否则我几乎听不到 Studio 的风扇声。
从苹果近年来的进步来看,我不会惊讶未来看到一款内存带宽超过 5090 的 M7 Ultra。但那是另一个故事了。
关于测试的说明
最后,在进入原始数字和图表之前:我是如何测试一切的?
自动化测试由我用 GPT-6 Astra 构建的测试 harness 完成,它协调了多台 Codex 实例,覆盖我的 M3 Ultra 和 M5 Ultra Mac Studio,以及我的 Windows PC(使用 Codex 应用和 Computer Use)。在 macOS 上,我选择 oMLX(版本 0.7.0.dev2)作为 MLX 模型的本地后端,并在 macOS Golden Gate 27.0 上主要运行了相关模型。在 Windows 上,我使用 LM Studio 和 Qwen3.8-27B-GGUF,配合 CUDA 12 运行时,并将全部 66 层卸载到 GPU 进行全 GPU 测试,另有将模型在 GPU 和系统 RAM 之间分割的单独测试。
除了用 Open Minis 原生子代理进行的单独实验外,我还用自定义测试 harness 测量并发请求和涉及主模型与多个助手的工作流,oMLX 为 Mac 模型服务,LM Studio 为 Windows 模型服务。
数字由 Astra 在四天内收集,后来由 Claude Fable 5.1 和 Opus 5 使用 Anthropic 即将推出的 Projects 功能进行可视化(我在写这篇故事时得以提前测试)。交互式可视化用纯 HTML 和 CSS 基于 MacStories 风格构建,并包含我本人的评论和注释。
我制作以下交互式小部件的目标不仅是帮助你更清晰地理解数字,还要可视化这些统计数据在实践中意味着什么。我对这些模拟不同令牌每秒感觉的小部件相当满意,因为这是一个常常难以可视化的指标。我希望这些动画图表比你可能在其他地方看到的常规“静态”图表更有用(后者也包含在下面)。
可视化 M5 Ultra
(文章中包含大量交互式图表,比较 M5 Ultra 与 M3 Ultra 在不同提示长度、量化精度下的提示处理速度、生成速度、首令牌时间等。主要结论如下:)
• 提示处理:M5 Ultra 平均比 M3 Ultra 快约 150%(约 2.5 倍)。
• 生成速度:短提示下 M5 Ultra 可达 100+ tok/s,大上下文(64K–256K)下仍保持 60–85 tok/s。
• 首令牌时间(TTFT):大幅缩短,例如 256K 提示下 M5 Ultra 约 102 秒,M3 Ultra 约 245 秒。
• 量化测试:在 256 GB 内存下,4-bit 和 5-bit 可完全放入 RAM;6-bit 和 8-bit 需将嵌入表卸载到 SSD。5-bit 在智能与性能间达到最佳平衡。
• 与 RTX 5090 对比:5090 在计算和带宽上仍领先,但受 32 GB VRAM 限制,无法轻松运行更大模型;M5 Ultra 凭借统一内存在更大模型和日常使用体验上更优(更安静、更凉爽、更紧凑)。
• 并发与子代理:M5 Ultra 在同时处理 1–3 个请求时总吞吐量更高,适合代理式多任务。
M5 Ultra 用于本地 AI 代理
正如现在应该清楚的,M5 Ultra 的性能提升是真实的,它展示了苹果在自定义硅和统一内存架构上的投资正在为折腾者和开发者带来回报。
尽管做了这些测试,我感觉自己只是触及了 M5 Ultra 及其 256 GB 内存可能性的皮毛。随着更多开发者和开源维护者拿到 M5 Ultra(以及他们的代理),我确信我们会看到更多量化优化,让更大模型以更优性能在这台电脑上运行。例如,我甚至没时间测试 DwarfStar(一个有趣的意大利项目,能在各种 Mac 配置上用更少内存运行本地前沿模型);也没时间检查 Inco Splash(专为苹果硅和特定模型设计的新推理引擎)。同样,我没时间测试 Exo,其 RDMA 实现理论上应允许我通过 Thunderbolt 5 在 M3 Ultra 和 M5 Ultra 之间分割和分发推理,同时在前面运行 OpenAI 兼容服务器为本地代理提供 API。
当然,我甚至无法想象配备 512 GB 内存的高端 M5 Ultra 在扩展可本地运行的模型方面会带来什么。我希望最终也能测试它。
这次实验结束时,我有一个简单、 tangible 的结果:M5 Ultra 让我能以令人难以置信的性能运行本地代理,减少了盯着空白屏幕的时间,一切都发生在我桌上一台紧凑、凉爽、安静的机器上。
这在几年前似乎不可能。但我们现在已经做到了。
原文链接:https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
文章中包含大量交互式图表和动画可视化(提示处理、生成速度、首令牌时间、不同量化精度对比、与 RTX 5090 对比、并发测试等),建议直接访问原文体验完整效果。以上是主要正文的完整中文翻译。