产业观察
科大讯飞发布Spark-Audio-1.0-Preview全国产语音基座大模型
📋总体概括
科大讯飞于9月16日发布全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。该模型支持文本与语音双模态输入、文本输出,可完成语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等任务,覆盖99种语言和202种方言识别,实现智能语音从「听清」到「听懂」的升级。目前模型已开放体验,API后续将在讯飞开放平台上线。
⚡关键信息
- ▸科大讯飞9月16日发布语音基座大模型Spark-Audio-1.0-Preview,核心卖点是采用全国产化算力训练
- ▸模型支持文本和语音双模态输入、文本模态输出,覆盖99种语言及202种方言识别
- ▸可支持语音转写、多语言翻译、环境音识别、说话人识别、情感分析及复杂音频问答等任务
- ▸产品定位是实现智能语音从「听清」到「听懂」的能力跃升,目前已开放体验
- ▸API后续将上线讯飞开放平台,面向开发者生态开放
🔥犀利点评
全国产算力训练是真正的看点——在GPU管制背景下,讯飞用国产算力跑出多模态语音基座,既是技术验证也是政治表态。但「Preview」后缀和尚未上线的API说明这更多是卡位式发布。99种语言、202种方言的数字很唬人,语音识别恰是讯飞老本行,问题在于语音大模型的商业模式至今没人跑通,先发不等于先赢。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 36氪快讯 阅读全文 →