产业观察🔥7.0

阿里千问发布 Qwen-Audio-3.1 系列语音大模型,并下调全线产品价格

IT之家·2026/9/23 07:15:26🔗 原文

📋总体概括

9月23日,阿里千问发布Qwen-Audio-3.1系列语音大模型,一次推出五款新模型,覆盖语音识别、语音合成、实时交互,并新增音频创作模型TTS-Next与音频理解模型ASR-Next,形成「理解-生成-交互-创作」完整音频能力栈。能力升级之外,千问同步下调全线语音模型价格,其中ASR降幅达95%,Realtime降幅约85%,TTS降价约70%。这是千问在语音赛道以模型迭代加激进降价的组合拳,直接压低开发者和企业调用语音AI的成本门槛。

关键信息

  • 阿里千问9月23日发布Qwen-Audio-3.1系列,一次推出五款语音模型,覆盖识别、合成与实时交互
  • 新增音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next
  • 全线语音模型降价:TTS约降70%,Realtime约降85%,ASR降幅达95%
  • ASR新增原生转写润色能力,可自动去除语气词、重组语义,并支持分角色结构化转写
  • 官方称新系列构成覆盖「理解-生成-交互-创作」的完整音频能力栈

🔥犀利点评

能力升级是常规操作,真正的杀招是那个95%的ASR降价——语音识别本质是高频、低毛利的管道生意,价格战打到地板价等于直接把中小厂商的生存空间清零。千问这套「理解-生成-交互-创作」全栈打法,摆明了要复制文本大模型的剧本:先用规模摊薄成本,再用价格封死追赶者的商业化路径。语音赛道的洗牌,恐怕比想象中来得更快。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文