Apple 在8 月25 日发表搭载M5 Max 与全新M5 Ultra 的新款Mac Studio,自8 月27 日上午9 时开放预购,并在9 月22 日正式供货。搭载M5 Ultra 的机型售价NT$199,900 起,教育优惠价NT$185,390 起;M5 Max 版本则是NT$84,900 起。国外专门介绍Mac 的作家MacStories 在供货前拿到256GB 统一记忆体的M5 Ultra 测试机,花了四天与前代M3 Ultra(512GB)以及自家搭载RTX 5090 的桌机对比,量测数据横跨4K 到256K 的提示长度、四种量化精度与并行请求。结论很直接:这台机器把本地端AI Agent 从「勉强能跑」推进到「可以当日常主力」。

规格与价格:频宽是这一代的重点
M5 Ultra 版Mac Studio最高可配36 核心CPU、80 核心GPU,每个GPU 核心都内置一颗神经网路加速器,专门加速矩阵乘法运算。统一记忆体最高维持在512GB,频宽则从M3 Ultra 的819GB/s 提升到1.2TB/s,增加50%。 Apple 官方数据称AI 峰值运算效能最高达M3 Ultra 的4.3 倍、M1 Ultra 的9.8 倍。
新款Mac Studio 首度支援Wi-Fi 7 与蓝牙6,并具备Thunderbolt 5。 Apple 也把RDMA(远端直接记忆体存取)纳入支援,让多部Mac Studio 能串成共享记忆体池;官方表示由四部机器组成的丛集,AI 运算速度可达单一系统的3 倍。 MacStories 测试的是256GB 机型,512GB 版本要到10 月底才会推出。
比M3 Ultra 快多少:提示处理快2.5 倍
对跑AI Agent 的人来说,最折磨人的是等待模型读完提示的那段空白(Prefill;预填充与TTFT;吐出首TOKEN时间)。现代Agent 每一轮都会送出系统提示、个人化设置、session 记忆、skill 与MCP 描述,上下文开场就有一大叠。 MacStories 表示,过去用本地模型跑这类Agent 时,只能盯着载入指示灯,而且对话越长越慢。
这次量测的改善主要落在提示处理。以Qwen3.8-Flash-Next 为例,M5 Ultra 平均比M3 Ultra 快150%,约2.5 倍。具体数字如下:
- 4K 提示:M5 Ultra 写入90.7 tok/s,M3 Ultra 为59.0 tok/s
- 256K 提示:M5 Ultra 74.7 tok/s,M3 Ultra 38.6 tok/s。 M5 Ultra 在256K 的写入速度,仍高于M3 Ultra 在4K 的表现
- 首字延迟(TTFT):256K 冷快取时,M3 Ultra 要等246 秒才吐出第一个字,M5 Ultra 是104 秒
- 256K 读取速度:M5 Ultra 2,544 tok/s,M3 Ultra 1,070 tok/s

短提示下,这颗模型能突破100 tok/s;即使上下文塞到64K 至256K,仍有60 至85 tok/s 的水准。 MacStories 说,这让本地模型在Open Minis 与Hermes Agent 这类需要反覆呼叫工具的应用里,终于站得住脚。
对上RTX 5090:单项更快,但卡在32GB
RTX 5090 在多数项目仍领先M5 Ultra。以Qwen3.8 27B 跑6,091 token 的提示为例,5090 读取3,031 tok/s、写入59 tok/s;M5 Ultra 是读取1,701 tok/s、写入48 tok/s;M3 Ultra 则是414 tok/s 与31 tok/s。

差距的来源分成两段。提示处理靠的是矩阵运算,这正是NVIDIA Tensor Core 的主场,Apple 的神经网路加速器缩小了差距但没追平。生成速度则取决于记忆体频宽,模型每写一个token 就要把整个模型从记忆体拉出来一次,5090 的1.79TB/s 对上M5 Ultra 的1.2TB/s,因此稳定领先约25%。

5090 的问题在容量。它只有32GB VRAM,一旦模型超过这个数字,就得通过PCIe 把层卸载到速度慢得多的系统记忆体。 MacStories 实测,改用借用系统RAM 的方式后,5090 在64K、128K、256K 的写入速度掉到4.6、2.9、1.5 tok/s。反观Mac Studio 是一整块统一记忆体,256GB 或512GB 都不会外溢。
体积与散热也是评测者在意的地方。 MacStories 描述,跑高上下文测试后走进办公室,整间房明显比其他空间闷热;相较之下,桌上的Mac Studio 只是摸起来温温的,风扇转速与噪音都低得多,日常跑4-bit 量化模型时,除非把耳朵贴到机器上,否则听不到风扇声。
量化与记忆体:5-bit 是甜蜜点
MacStories 在256GB 机型上测试Qwen 最新的3.8 Flash-Next 模型四种量化版本,结果是4-bit 与5-bit 可以完整放进记忆体,6-bit 与8-bit 必须把n-gram 嵌入表卸载到SSD。
- oQ4e:峰值占用155GB,全数在记忆体
- oQ5e:179GB,全数在记忆体
- oQ6e:嵌入表放SSD 后156GB。直接载入记忆体时,macOS 在176.6GB 因记忆体压力终止了伺服器
- oQ8e:嵌入表放SSD 后187GB。直接载入时oMLX 拒绝执行,预估载入过程需244.2GB,超过它允许的200.4GB
对照组M3 Ultra 的512GB 记忆体,四种量化都能完整放进RAM。 MacStories 认为5-bit 在256GB 机型上是智慧程度、效能与记忆体占用的平衡点,也提到若日后能测512GB 版本,最想量的是不靠SSD 卸载的8-bit 表现。
并行与子代理:三条同时跑反而更划算
MacStories 另外测试同时送出三个请求的情境。 M5 Ultra 在单一请求时合计输出66.2 tok/s,三个同时来则提升到81.5 tok/s,等于多出23% 的总吞吐量;M3 Ultra 从38.4 微升到39.9 tok/s,只有4%。每个个别请求都会变慢,但整台机器完成的工作量变多。
在5090 那台PC 上,评测者让主模型把一份帐务工作拆成三份交给子代理,循序执行需要44.8 秒,改成并行后缩短到32.1 秒。每个子代理的写入速度从63 tok/s 降到44 tok/s,整体仍提前完成。
实际用途:99 天不间断、成本0 元

MacStories 表示自己并非AI 开发者,不训练也不微调模型。他今年夏天为了iOS 与iPadOS 27 的评测,自建一套名为Desk 的内部应用,用来整理数百份笔记、session、PDF 与网页撷取内容。专案最后累积到310 份文件,一组以DeepSeek V4 Flash 为基础的代理加上olmOCR 处理PDF,连续99 天、24 小时不间断执行,负责转录WWDC 场次、从各类来源撷取功能、交叉比对,并通过Notion API 整理资料库。
他提到,这类长时间常驻的背景工作若改用OpenAI 或Anthropic 的API,成本高到难以负担,因此转向本地模型,最后这套研究流程的总花费是0 元。文章本身仍由他逐字撰写, AI AGENT 负责的是研究、笔记互连与新功能追踪。
另外,他用Qwen-Image-2.1在本机生成壁纸,耗时180 秒,峰值记忆体占用78GB。他也把Qwen3.8-Flash-Next 设为Open Minis for iOS 与Hermes Agent 的预设模型,并在Codex 里使用本地模型,让云端的主模型负责指挥本地子代理。
结语
MacStories 的结论是,M5 Ultra 的效能成长具体可量测,也反映Apple 在自研晶片与统一记忆体架构上的投入开始对本地AI 使用者产生实质回报。评测者坦言四天测试只碰到皮毛,还没来得及试DwarfStar、Inco Splash 与Exo 等专案,其中Exo 的RDMA 实作理论上能通过Thunderbolt 5 把运算分散到M3 Ultra 与M5 Ultra 两台机器上。
