产业观察

科大讯飞发布Spark-Audio-1.0-Preview全国产语音基座大模型

36氪快讯·2026/9/16 09:03:31🔗 原文

📋总体概括

科大讯飞于9月16日发布全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。该模型支持文本与语音双模态输入、文本输出,可完成语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等任务,覆盖99种语言和202种方言识别,实现智能语音从「听清」到「听懂」的升级。目前模型已开放体验,API后续将在讯飞开放平台上线。

关键信息

  • 科大讯飞9月16日发布语音基座大模型Spark-Audio-1.0-Preview,核心卖点是采用全国产化算力训练
  • 模型支持文本和语音双模态输入、文本模态输出,覆盖99种语言及202种方言识别
  • 可支持语音转写、多语言翻译、环境音识别、说话人识别、情感分析及复杂音频问答等任务
  • 产品定位是实现智能语音从「听清」到「听懂」的能力跃升,目前已开放体验
  • API后续将上线讯飞开放平台,面向开发者生态开放

🔥犀利点评

全国产算力训练是真正的看点——在GPU管制背景下,讯飞用国产算力跑出多模态语音基座,既是技术验证也是政治表态。但「Preview」后缀和尚未上线的API说明这更多是卡位式发布。99种语言、202种方言的数字很唬人,语音识别恰是讯飞老本行,问题在于语音大模型的商业模式至今没人跑通,先发不等于先赢。

本文由本站自动聚合,以下为原始来源:前往 36氪快讯 阅读全文