产业观察

科大讯飞发布全新语音识别大模型 Spark-ASR-2.0,明日上线讯飞输入法

IT之家·2026/9/23 08:35:48🔗 原文

📋总体概括

科大讯飞于9月23日发布新一代语音识别大模型Spark-ASR-2.0,并宣布9月24日上线讯飞输入法。该模型采用非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等技术,在中英文混合、方言、高噪、小音量、快语速、儿童等复杂场景识别效果明显提升,WER明显降低,官方称主要任务效果优于业界最优水平,且推理成本相对1.0版本仅增加约10%。其理念从「一字不差」转向结合上下文理解的「流畅成文」。

关键信息

  • 科大讯飞9月23日发布Spark-ASR-2.0语音识别大模型,明日上线讯飞输入法
  • 采用非自回归与LLM增强自回归协同、动态上下文注入等关键技术
  • 在中英文混合、方言、高噪、小音量等场景效果大幅提升,WER明显降低
  • 官方称主要任务效果优于业界最优水平,复杂声学场景优势显著
  • 推理成本相对Spark-ASR-1.0仅增加约10%,强调效果与成本平衡

🔥犀利点评

「优于业界最优」这种自评话术听听就好,测试集还来自自家产品数据,既是运动员又是裁判员。但推理成本只涨10%确实值得注意——语音识别拼到今天,准确率差距已不大,真正的护城河是方言、高噪这些脏活累活的工程积累,讯飞多年深耕的恰恰是这里。至于「流畅成文」,本质是让LLM替人润色转写稿,方向对,但也意味着识别结果开始掺入模型的主观判断。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文