影音音频
基于全国产化算力训练,讯飞星火语音基座大模型 Spark-Audio-1.0-Preview 上线
📋总体概括
科大讯飞9月16日上线Spark-Audio-1.0-Preview,一款基于全国产化算力训练的语音基座大模型。不同于传统先转文字再理解的级联方案,该模型直接理解原始语音,一次性处理人声、环境音与音乐,并保留语气、情绪等语义信息,避免级联方案的信息丢失与模块间错误累积。架构上采用0.65B Dense音频编码器搭配30B-A3B MoE大语言模型,训练数据达1300万小时音频。这是国产算力训练端到端语音大模型的代表性落地,对打破算力依赖、提升语音交互体验具有示范意义。
⚡关键信息
- ▸讯飞9月16日上线语音基座大模型Spark-Audio-1.0-Preview,基于全国产化算力训练
- ▸传统级联方案先转文字再理解,会丢失语气情绪和环境音,且模块割裂易累积错误
- ▸新模型直接理解语音,一次性处理人声、环境音、音乐及语义、情绪和场景
- ▸架构为0.65B Dense音频编码器搭配30B-A3B MoE大语言模型,使用1300万小时音频训练
🔥犀利点评
级联方案转文字那一下就把情绪和场景全过滤掉了,讯飞这次端到端直听语音才是语音大模型的正路。但真正值得琢磨的标签是「全国产化算力」——在算力管制背景下,能用国产卡把1300万小时音频啃下来,这本身就是对国产算力可用性的公开背书。0.65B编码器配30B-A3B小激活MoE也是务实的性价比打法。Preview版诚意几何,还得看实测延迟和噪声场景表现,别只停留在发布会PPT。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →