Suno 不只做音乐了:新功能 Speech 可生成带配乐的语音旁白
Suno 把「说话」也做成了生成式音频
以 AI 音乐生成起家的 Suno 正在把能力边界从旋律扩展到人声。官方宣布,新功能 Speech 已在 Suno 的网页端和移动端开启公开测试,用户可以通过脚本或提示词描述来生成语音旁白,并且能够同时生成背景音乐,把语音与配乐合成为一条连贯的音轨。
Suno 首席产品官 Jack Brody 在公告中表示:「音乐永远是 Suno 的核心,也是我们所构建之物的核心。与此同时,我们的愿景一直延伸到其他形式的人类表达。今天我们通过 Speech 扩展 Suno 的可能性:这是首个把语音与音乐作为一条完整音轨一起生成的音频模型。」
两种模式,先描述还是先写稿
使用路径并不复杂:进入 Create 标签页,找到 Speech 选项即可。它提供两种模式:
- Simple(简单模式):在提示框中描述你想要的效果,例如「一位海盗船长在鼓舞船员」。
- Advanced(高级模式):如果你已经明确知道要说什么,可以直接填入自定义脚本。
高级设置还允许调整 AI 声音的性别、语音风格,以及对其他参数的进一步控制。背景音乐是可选的——如果你只想要干净的人声,可以用开关关掉配乐。Suno 给出的典型场景是:为诗歌配一段平静的配乐,或为戏剧化旁白、鼓舞人心的演讲配上更有能量的声音。
语音合成早已拥挤,Suno 的差异在哪
AI 生成语音并不新鲜。DeepMind 在深度学习语音合成上已经摸索了十年,Adobe 有文本转语音工具,ElevenLabs 自 2023 年推出以来也成为这一领域最具辨识度的平台之一。Suno 此时入场,更像是一次平台能力的横向扩张。
它的差异化在于「语音 + 音乐一起生成」。多数文本转语音工具解决的是「把字念出来」,而 Suno 试图解决的是一条完整音轨的听感问题:旁白和配乐不再分两次制作、再在后期里对齐,而是在同一次生成中完成。对于短内容创作者、播客片头、有声内容试水者来说,这种一体化流程可能比单纯的音色质量更有吸引力。
为什么 Suno 需要新故事
值得注意的是,Suno 的音乐生成器一路走来伴随着大量诉讼,版权争议始终是悬在其商业模式上的阴影。在这种背景下,Speech 既是产品线的自然延伸,也可能是一种风险分散:当音乐生成面临法律与授权不确定性时,语音旁白、企业配音、有声读物等场景的商业路径相对更清晰,也更容易与现有内容工作流衔接。
当然,Speech 目前仍处于公开测试阶段,实际音质、情感表现、多语言支持深度以及版权归属规则,都还需要在更大规模的使用中检验。Suno 能否把「音乐公司」的标签扩展为「音频生成平台」,这一步只是开始。

