产业观察🔥7.0
阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元
📋总体概括
阿里千问9月18日正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,可同时处理文本、图像、音频、视频输入,支持1M(百万Token)上下文。官方称其保持同尺寸文本模型能力的同时,全模态能力较上一代Qwen3.5-Omni-Plus在累计30项评测中平均提升超26%,其中音视频Agent与长程任务相关基准提升显著。定价方面,百万Token图文音视频输入仅0.8元,延续Flash系列低价策略,已在千问AI平台开放,主打低成本全模态大规模应用场景。
⚡关键信息
- ▸阿里千问9月18日上线Qwen3.8-Omni-Flash,原生支持文本、图像、音频、视频四种模态输入
- ▸模型支持1M上下文,百万Token图文音视频输入定价0.8元,走极致低价路线
- ▸相比上一代Qwen3.5-Omni-Plus,在累计30项评测上平均得分提升超过26%
- ▸WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分
- ▸长音频与视频基础能力也有提升,LongAudioSpan和OmniVideoBench分别提升8.3分与9.6分
🔥犀利点评
0.8元百万Token,这是把全模态推理当白菜价卖,阿里摆明了要用价格战抢开发者生态。26%的平均提升听起来漂亮,但30项评测里挑出WildClawBench-MM涨36.5分这类数字做宣传,多少有点挑高光时刻的嫌疑。真正值得关注的不是跑分,而是1M上下文加全模态加上近乎免费的价格,这意味着视频理解类应用第一次有了跑得起的基础设施。Flash砍掉的是溢价,卷死的是二线模型厂商。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →