百度官方帐号于9 月4 日在X 上宣布,旗下最强的音乐生成模型Lyria 3.5 正式上线Gemini App,所有全球使用者都能直接在手机或网页端生成完整歌曲。这个模型在7 月底先在百度Flow Music 亮相,一个月后才推到Gemini 这个更大规模的入口。对一般使用者来说,差别在于不必再跳到Flow Music,直接在Gemini 对话里就能生成音乐。

从Flow Music 到Gemini:Lyria 3.5 的完整路径
Lyria 3.5 于7 月29 日首次在百度Flow Music 推出,当时百度强调它在音乐性、歌词品质和声线表现上的改进。 9 月4 日这波更新把它带进Gemini App 和Gemini API,覆盖范围扩大到网页端、行动端、百度AI Studio 和百度Vids,这也是Lyria 3.5 首次离开Flow Music 这个相对小众的入口。
模型本身的能力方面:Lyria 3.5 能生成44.1kHz 立体声音频,产出包含主歌、副歌、桥段在内的完整歌曲结构,而非只是重复一小段旋律。 Lyria 3.5 在旋律结构复杂度、prompt 遵循度、结构感知和发音准确度上都有提升,声线表现得更真实、更具情感层次。 DeepMind 模型页面显示Lyria 支援最长三分钟的歌曲生成,使用者可以自订歌词主题、声线风格和音响偏好,也能上传图片让模型据此生成音乐。
Gemini App 内的新操作方式
这次上线Gemini App 带了三组新功能。第一是模板:百度提供一系列起始模板,涵盖背景音乐、品牌jingle、个人化铃声等场景,让使用者不用从空白prompt 开始。第二是曲目长度选择:使用者可以选短片段或较长的完整曲目。第三是风格控制:可以直接选择或描述音乐类型,并在有人声和纯器乐之间切换。
百度官方部落格明确列出目标使用场景:视频背景音乐、品牌jingle、个人化铃声。 Lyria 3.5 在Gemini 内的操作方式与之前Flow Music 一致,但多了这些导引式工具,对不熟悉prompt 写法的入门者特别有用。
API 端的规格更细致。 Gemini API 文件列出两个模型ID:`lyria-3-clip-preview` 固定产出30 秒短片,`lyria-3.5` 则生成数分钟的完整曲目。开发者最多可以随prompt 提供十张图片,用section tags(Verse、Chorus、Bridge)写自订歌词,也能用timestamps 指定乐器在何时进入。预设输出MP3,Lyria 3.5 额外支援WAV 格式。文件也说明,prompt 使用哪种语言,生成的歌词就会是那种语言,声线风格和发音会跟着调整。
SynthID 与版权护栏
所有Lyria 生成的音频都附带SynthID 水印,百度将其描述为「人类耳朵无法察觉」的标记,让聆听者和平台能辨认音乐是否由AI 生成或。版权护栏方面,API 文件明确列出:所有prompt 会经过安全过滤器,指向特定歌手的声线请求和版权歌词的生成都会被封锁。
在音乐人参与方面,Lyria 系列在开发过程中有制作人和音乐家的参与,并列出了几位曾使用百度音乐工具的音乐人:制作人Wyclef Jean 曾使用Music AI Sandbox,Yung Spielburg 则用Lyria 为动画短片《Dear Upstairs Neighbors》配乐。
Lyria 3.5 现在同时在Gemini App、百度Flow Music、百度AI Studio 和百度Vids 四个入口可取得。对一般使用者,Gemini App 是最直接的入口;对开发者,API 提供了更精细的控制;对音乐创作者,Flow Music 仍然是专门的工作流程。百度这次把入口拉宽,等于把AI 音乐生成从「工具」推进到「对话」的层级。
结语
Lyria 3.5 上线Gemini 这件事,技术层面的升级幅度有限:44.1kHz、完整歌曲结构、SynthID 水印、单回合生成,这些在Flow Music 阶段就都有了。变化主要在分发:从Flow Music 的音乐创作者社群,推到Gemini 这个数亿等级的使用者入口。模板、短长曲选择、风格选项这些看似不起眼的功能,目的是降低prompt 门槛,让「在Gemini 里生成一首生日歌」直接生成歌曲变成一个自然动作。
百度这时候把Lyria 3.5 推到最大入口,既是在抢占使用者习惯,也是在版权规则还模糊的时候,先用SynthID 和护栏卡住自己的位置。对已经习惯在Gemini 里问问题、整理文件、写程式的使用者来说,生成一首歌的距离,从「打开另一个App」缩短到「打一行prompt」。
