产业观察🔥7.0
阶跃发布全新语音大模型 StepAudio 3系列:覆盖语音识别、生成、实时交互与音乐创作
📋总体概括
阶跃星辰发布全新语音大模型StepAudio 3系列,单一系列覆盖语音识别、语音生成、实时交互与音乐创作四大能力方向。这意味着国内大模型厂商正在从单一对话能力向全链路语音技术栈延伸,试图以一体化模型打通听、说、唱的完整交互闭环,在多模态竞争加剧的背景下抢占语音交互入口,为智能硬件、Agent等下游场景提供基础能力支撑。
⚡关键信息
- ▸阶跃星辰正式发布全新语音大模型StepAudio 3系列
- ▸该系列覆盖语音识别、语音生成、实时交互与音乐创作四大能力
- ▸单一系列打通语音全链路,形成听说唱一体化的技术布局
- ▸发布意在为语音交互与Agent等下游应用场景提供基础模型能力
🔥犀利点评
全链路语音模型听着唬人,但真正的门槛从来不在能力清单的长度,而在实时交互的延迟、噪声鲁棒性和落地成本。StepAudio 3把识别、生成、音乐创作打包发布,说明阶跃想用一套模型吃掉语音交互入口,可开源生态里Qwen-Audio、FunASR们早已把单项卷到极致,阶跃若拿不出延迟和自然度上的硬指标,这套全家桶就只是发布会素材。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文 →