苹果8 月发表搭载M5 Ultra 的新款Mac Studio,号称本地AI 效能最高提升4.3 倍、储存速度2 倍、CPU 速度1.3 倍,统一记忆体频宽来到每秒1.2TB。国外知名科技爱奇艺r 亚历克斯・齐斯金德(Alex Ziskind)把M5 Ultra 与前代M3 Ultra 并排正面对决,标题下的结论很直白:「Apple Wasn’t Messing Around」(苹果没在开玩笑)。他这次实测的是M5 Ultra 满配版本:80 核GPU、256GB 统一记忆体(512GB 版本隔月开卖)、8TB SSD,整机售价14,299 美元,M5 Ultra 版Mac Studio 起价则为5,499 美元。他笑说这代「效能升级,价格也升级不少」,测试机由苹果出借,对照组M3 Ultra 则是自掏腰包购买。
M5 Ultra AI 效能实测:本地AI 性能提升幅度与宣传文案相符
测试配置:36 核心、无能效核
M5 Ultra 的CPU 共36 核心,由24 个效能核心与12 个超级核心组成,Mac Studio 内完全没有能效核心。为求公平,两台机器跑的是同一版llama.cpp 与MLX 编译、载入完全相同的模型档。影像处理方面,M5 Ultra 的媒体引擎编解码区块是M5 Max 的两倍,官方宣称可同时播放多达33 条8K ProRes 422 30fps 视频流。 Geekbench 7 跑分也显示,36 核M5 Ultra 单核3,774 分、多核52,516 分,比32 核M3 Ultra 的平均值高出约30% 与35%,与官方「单执行绪1.25 倍、多执行绪1.3 倍」的说法大致吻合。

开发者工作负载:编译与储存起飞
对开发者而言,这台机器「效能过剩」。 Speedometer 网页效能测试从M3 Ultra 的47 分来到60.2 分。实际编译测试更明显:一个含10 万个命名空间与类别的大型.NET 专案,编译时间从71.7 秒缩到52.4 秒;纯Python 的曼德博(Mandelbrot)演算法测试从10.25 秒缩到5.8 秒,足足快两倍,主持人直呼「从没看过这么快」。
官方说储存快2 倍,实测还超过。 AmorphousDiskMark 顺序读写:M3 Ultra 读5930MB/s、写7788MB/s;M5 Ultra 读14,888MB/s、写逼近20,000MB/s。编译更依赖的随机读写同样快两倍以上,他的评语是「行销部门标2 倍的写法太保守」。这对AI 也有直接影响:载入一个140GB 的模型档时,读取速度快上一大截。
本地LLM 的两个关键数字
测本地大模型只看两个数字:提示处理(Prompt Processing,PP)与token 生成(Token Generation,TG)。 PP 是模型「读」提示词的过程,吃的是GPU 算力;TG 是模型「写」答案的过程,吃的是记忆体频宽。
M5 Ultra 的架构升级正对症下药:M3 世代的GPU 核心只是普通显示核心,M5 世代的每个GPU 核心内置一颗神经加速器(Neural Accelerator),等于每颗核心都有一块专用矩阵乘法AI 硬体。 llama.cpp 启动时的「has tensor」旗标在M3 Ultra 显示false、M5 Ultra 显示true,代表软体已针对M5 家族启用神经加速器路径。苹果官方也强调这是神经加速器首次进入Ultra 等级晶片,对比M3 Ultra 最高可达4.3 倍峰值AI 运算。

记忆体频宽实测:1.2TB/s 达阵约86%
官方标称1.2TB/s。先跑老牌的STREAM 基准测试(属CPU 端测试):M3 Ultra 312.9GB/s 对上M5 Ultra 583.6GB/s。改用GPU 端微基准测试(对AI 才有意义):M3 Ultra 实测724GB/s(官方标819GB/s,达阵约九成),M5 Ultra 实测1,039GB/s(官方标1.2TB/s,达阵约85% 到86%),实测频宽是M3 Ultra 的1.4 倍。

三种模型实测:MoE 与稠密模型都验证
- DeepSeek V4 Flash(2,840 亿参数,MoE):token 生成从37 提升到53 tokens/s(约1.5 倍),与频宽增幅一致;提示处理从483 提升到1,485 tokens/s(3 倍)。
- GPT-OSS 120B(1,200 亿参数,MoE):token 生成90 对130 tokens/s;提示处理1,300 对约3,200 tokens/s。长上下文测试中,已在6 万4,000 tokens 上下文的情况下再喂3 万2,000 tokens,M3 Ultra 要80 秒、M5 Ultra 只要56 秒。
- Qwen 3 8.27B(稠密模型):token 生成37 对54 tokens/s(1.47 倍);提示处理430 对1,800 tokens/s,超过4 倍。另以1 万4,000 tokens 的真实程式码文件测试,提示处理从33 秒缩到8 秒,实测4.2 倍,兑现官方「最高4 倍」的承诺。
MoE(专家混合)与稠密模型的token 生成都落在1.4 到1.5 倍,跟实测记忆体频宽的1.4 倍完全对上,验证了TG (token 生成)吃记忆体频宽的理论。最大的世代差落在提示处理,这正是M3、M4 世代一直的短板,神经加速器把它一次补到位。
四倍的前提与功耗代价
看到这先别急着刷卡,4 倍提示处理有前提:提示词要够长。要到约14,000 tokens 才摸到4 倍门槛;纯聊天等级的350 tokens 短提示只有1.6 倍。 「主要是聊天的用户感受不大,但喂它几个原始码档就会有感。」
能效提升有限:生成期间晶片功耗约45 瓦,M3 Ultra 为36 瓦(均为GPU 加CPU,非插座功耗),每瓦token 效率只提升约12%。待机功耗倒是更低,M5 Ultra 约8 到10 瓦,M3 Ultra 为11 到12 瓦。但GPU 满载时差距悬殊:M3 Ultra 接近200 瓦,M5 Ultra 超过400 瓦,风扇声明显更大,机身温度约43、44 度,「比M3 那代烫手不少」。
总结:token 生成1.5 倍,提示处理2 到4 倍
主持人的结论:token 生成1.5 倍是「不错的升级」,提示处理2 到4 倍对程式码代理(coding agent)用户「绝对有感」。预告的多工测试中,同时处理8 个请求时M5 Ultra 输出134 tokens/s,M3 Ultra 为75 tokens/s。他也预告后续将深入比较MLX 与llama.cpp、8-bit 模型,并用512GB 机型与Mac Studio 丛集测更大模型。
