影音音频🔥7.0
将语音与音乐作为单一连贯音轨共同生成,AI 音乐制作平台 Suno 推出 Speech 语音功能
📋总体概括
AI音乐制作平台Suno于当地时间10月1日宣布推出语音功能Speech,官方称其为业界首个能将语音与音乐作为单一连贯音轨共同生成的端到端闭源音频模型。与先做TTS再拼接BGM的传统工作流不同,Speech可单次生成完整融合语音朗读与原创BGM的音频。该功能此前已与小范围用户测试约一个月,现正式开放公测,内置在Suno平台中,用户输入文字并描述音色与音乐风格即可创作带BGM的语音内容。官方同时承认Beta版存在口音漂移、语调过于戏剧化等问题。
⚡关键信息
- ▸Suno于10月1日推出Speech功能,宣称是业界首个语音与音乐作为单一连贯音轨共同生成的音频模型
- ▸该模型采用端到端一体化生成,区别于传统先TTS再拼接BGM的两段式工作流
- ▸Speech已开放公测Beta,内置于Suno平台,输入文字并描述音色与音乐风格即可使用
- ▸官方此前与小范围用户测试约一个月,确认Beta版存在口音漂移与语调断句问题
🔥犀利点评
Suno这一步棋下得聪明:把TTS和配乐拆开做的人太多了,端到端生成一条连贯音轨才是真正的护城河,尤其对播客、有声书这类「人声+氛围」内容是刚需。但别急着欢呼,官方自曝的口音漂移问题恰恰暴露了一体化生成的代价——语音是精确工程,音乐是概率游戏,二者绑在一个模型里,错误也会一起生成。先跑通架构再修细节,Suno的路子对了,但离「能用」到「好用」还有距离。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →