产业观察🔥7.0

阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元

IT之家·2026/9/18 03:34:25🔗 原文

📋总体概括

阿里千问9月18日正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,可同时处理文本、图像、音频、视频输入,支持1M(百万Token)上下文。官方称其保持同尺寸文本模型能力的同时,全模态能力较上一代Qwen3.5-Omni-Plus在累计30项评测中平均提升超26%,其中音视频Agent与长程任务相关基准提升显著。定价方面,百万Token图文音视频输入仅0.8元,延续Flash系列低价策略,已在千问AI平台开放,主打低成本全模态大规模应用场景。

关键信息

  • 阿里千问9月18日上线Qwen3.8-Omni-Flash,原生支持文本、图像、音频、视频四种模态输入
  • 模型支持1M上下文,百万Token图文音视频输入定价0.8元,走极致低价路线
  • 相比上一代Qwen3.5-Omni-Plus,在累计30项评测上平均得分提升超过26%
  • WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分
  • 长音频与视频基础能力也有提升,LongAudioSpan和OmniVideoBench分别提升8.3分与9.6分

🔥犀利点评

0.8元百万Token,这是把全模态推理当白菜价卖,阿里摆明了要用价格战抢开发者生态。26%的平均提升听起来漂亮,但30项评测里挑出WildClawBench-MM涨36.5分这类数字做宣传,多少有点挑高光时刻的嫌疑。真正值得关注的不是跑分,而是1M上下文加全模态加上近乎免费的价格,这意味着视频理解类应用第一次有了跑得起的基础设施。Flash砍掉的是溢价,卷死的是二线模型厂商。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文