M5 Max vs RTX 4090 vs 5090 本地端AI 影片生成实测,结果让人意外(LTX2.5 vs MiniMax H3)

自从MiniMax H3这个当前最强的开源AI 视频生成模型推出之后,专业的AI 视频生成任务终于有机会从云端走向本地端,也因此本地端硬体的选择也变成一门相当重要的学问。近日国外一位爱奇艺r 测试在本地端用LTX 2.5 与MiniMax H3 两款开源视频生成模型,分别以Apple M5 Max(搭载MLX 框架)、NVIDIA RTX 4090 与RTX 5090 进行了全面的生成速度与品质对比。结果出乎许多人意料:M5 Max 在速度上被RTX 5090 拉开将近4 倍的差距,但在某些方面,Apple 的表现却有自己的独到之处。

本地端开源AI 视频生成模型:LTX2.5 与MiniMax H3

首先为大家简单介绍一下这次测试的两个本地端开源AI 视频生成模型:Lightricks 推出的LTX 2.5 是开源的DiT 架构视频模型,支援原生4K 与50fps 输出;而AI 公司MiniMax 在2026 年7 月底发表的H3 模型,则主打2K 解析度、最长15 秒的视频生成,还内置立体声音讯。这两款模型都是可以在本地端消费级硬体上运行的开源AI 视频生成模型,以品质、速度和讨论度来说,目前是MiniMax H3 最受欢迎。

测试平台与硬体规格

视频作者使用了三套平台进行测试。 Apple 阵营是16 吋MacBook Pro 搭载M5 Max 晶片,通过Apple 自家的MLX 机器学习框架执行模型,统一记忆体容量为48GB。 NVIDIA 阵营则分别是RTX 4090(16GB VRAM;Aorus 17x )和RTX 5090(24GB VRAM; Lenovo Legion 7i)的电竞笔记本配置。

M5 Max 是Apple 在2026 年推出的旗舰晶片,采用Fusion Architecture 双晶粒封装设计,两颗3nm die 通过TSMC SoIC-mH 2.5D 封装技术结合,共享统一记忆体池。根据Skorppio 的分析,M5 Max 的GPU 首次内置了专用矩阵乘法硬体(Neural Accelerator),40 核GPU 可提供约70 TFLOPS 的FP16 运算能力,记忆体频宽达614 GB/s。相较之下,RTX 5090 拥有约380 TFLOPS FP16 运算力和1,792 GB/s 的记忆体频宽,纯粹的算力优势超过5 倍,记忆体频宽也有一倍以上的优势。

硬体规格的差距在视频生成这类重运算任务上会被放大。 AI 视频生成不同于LLM 文字推理,它需要大量的张量运算来处理每一帧画面的像素预测,记忆体频宽和计算吞吐量直接决定了生成速度。 M5 Max 的128GB 统一记忆体在大模型推理上有优势,但视频生成模型通常不会超过32GB,这让NVIDIA 的高频宽VRAM 反而更占上风。

LTX 2.5 生成速度对比

在LTX 2.5 模型的标准测试中,差距非常明显。以一个5 秒视频片段为例:M5 Max 花了164 秒,RTX 4090 花了约90 秒,而RTX 5090 仅需57 秒,5090 的速度是M5 Max 的将近3 倍。

M5 Max vs RTX 4090 vs 5090 本地端AI 视频生成实测,结果让人意外(LTX2.5 vs MiniMax H3)

视频中进行了多项测试,包括方向测试(orientation test):M5 Max 耗时215 秒,4090 耗时168 秒,5090 仅需65 秒。作者直言「这差距太夸张了」(That’s crazy)。

不过当视频长度拉长到10 秒时,差距有所缩小。 M5 Max 耗时169 秒,4090 耗时153 秒,两者已经接近。作者解释,这是因为较长的视频需要更多记忆体,M5 Max 的48GB 统一记忆体在这种情境下开始发挥作用,而4090 仅有16GB VRAM,超出时必须将资料上传到仅32GB 的系统记忆体,速度会大幅下降。

M5 Max vs RTX 4090 vs 5090 本地端AI 视频生成实测,结果让人意外(LTX2.5 vs MiniMax H3)

解析度测试(由512P 改为896P)也呈现类似趋势,较高解析度同样需要更多记忆体,M5 Max 与4090 之间的差距进一步缩小,但5090 凭借24GB VRAM 和更高的频宽依然大幅领先。

这些数据清楚呈现了一个规律:当模型和资料量可以完全塞进VRAM 时,NVIDIA 的高频宽优势会转化为巨大的速度差距。但当任务需要更多记忆体时,M5 Max 的统一记忆体架构就成了缓冲。这与大型语言模型推理的「VRAM 悬崖」现象类似,只不过视频生成的记忆体需求通常在24GB 以内,M5 Max 的128GB 统一记忆体优势很难完全发挥。

MiniMax H3 模型与音讯品质

换到MiniMax H3 模型后,结果更加有趣。 H3 是MiniMax 在2026 年7 月底推出的通用多模态生成模型,能生成最长15 秒的2K 视频,还支援原生立体声音讯。视频作者指出,如果给予足够的推理步数(steps),H3 的画质可以胜过LTX 2.5,但预设步数下的表现则不稳定。 (编按,其实主要还是看怎么搭配与设置)

在音讯生成测试中,M5 Max 产生的声音品质「显著且明显地更好」(substantially noticeably better),RTX 平台生成的声音则显得「单薄」(tinny),像是需要更多处理时间。更令人意外的是,在H3 的音讯生成速度上,M5 Max 甚至略微快过RTX 4090,作者对此也感到惊讶。

视频还测试了口型同步(lip syncing)功能。 LTX 2.5 在三平台上都能产生不错的口型同步效果,5090 仅花55 秒就完成一段5 秒的口型同步视频。 H3 模型的口型同步品质则不如LTX 2.5 稳定,作者认为是步数不足所致。

在参考图像生成测试中(使用2 张或4 张参考图),三平台的输出风格有明显差异。 M5 Max 的MLX 模型倾向产生与NVIDIA 平台不同的构图,作者表示「我几乎更喜欢M5 的构图」,但细节部分偶尔会出现「液化」或「模糊」的问题。

音讯品质的差异可能与MLX 框架对H3 音讯模组的实作有关,Apple 的统一记忆体架构在处理音讯这种较轻量的运算时或许有更好的延迟表现。而构图风格的不同,则反映了MLX 与CUDA 在数值精度和运算路径上的细微差异,即使使用相同的模型权重,浮点运算的顺序和精度处理方式不同,最终生成的画面就会有差别。

本地端AI 视频生成的现实与理想

视频最后,作者表达了他的核心目标:摆脱对线上订阅服务(如Kling 等云端视频生成平台)的依赖,完全在本地端完成创作。他坦言H3 目前是最接近Kling 品质水准的本地端方案,但「还没有完全达到」。

从产业角度来看,本地端AI 视频生成的门槛正在快速降低。 LTX 2.5 的官方文件指出,本地执行需要CUDA 13.2 以上和至少32GB VRAM 的NVIDIA GPU。而MiniMax H3 已在Hugging Face 上以开权重释出,任何人都可以下载执行,目前社群甚至已经有8GB VRAM 也能用的方案。

对于不同硬体的选择建议,视频的数据给出了明确的讯号:如果追求速度,RTX 5090 是目前消费级硬体中速度最快的选择;如果预算有限,RTX 4090 的16GB VRAM 在大多数5 秒视频生成任务上仍然够用;而M5 Max 则适合那些已经拥有MacBook Pro、偶尔需要本地端生成、同时重视大模型推理能力的使用者(编按:这部视频的比较都是笔记本设备,桌机版的表现理论上NVIDIA 会比测试结果更好,而MacBook 的这组M5 Max 也不能代表M5 Ultra 的表现)。

这场比较中M5 Max 的劣势主要来自视频生成的特殊需求,它需要极高的记忆体频宽来处理每一帧的像素运算,而这恰好是NVIDIA GPU 的强项。在大型语言模型推理等其他AI 任务中,M5 Max 的统一记忆体架构反而可能是决定性的优势,硬体选择取决于你最常做的任务类型。

赞 (0)
摩榜哥摩榜哥

相关推荐

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注