资讯

09-08 各Ai智能体评分排名

bilibili-36·2026/9/7 17:20:34🔗 原文

📋总体概括

2026年9月8日AI大模型双榜排名速览:LMArena用户盲测Elo榜覆盖第1至52名,Claude Fable 5.1、Opus 5、GPT-5.6、Kimi K3、GLM 5.2、Grok 4.5、Qwen3.8、DeepSeek V4等在列;Artificial Analysis智能指数区间约56至44,Claude Fable 5.1居首,GPT-6 Astra、Opus 5、Muse Spark 1.3等紧随其后。两大榜单口径不同但头部Claude系模型表现一致,国产模型在盲测榜占位明显。

关键信息

  • LMArena盲测Elo榜共52名,Claude Fable 5.1、Opus 5、GPT-5.6位列头部
  • Kimi K3、GLM 5.2、Qwen3.8、DeepSeek V4等国产模型进入LMArena总榜
  • Artificial Analysis智能指数约44至56,Claude Fable 5.1排名第一
  • GPT-6 Astra、Opus 5、Muse Spark 1.3在智能指数榜紧随其后
  • 两榜评测口径不同:一个靠用户盲测投票,一个靠独立机构综合评测

🔥犀利点评

双榜头部都是Claude,说明Anthropic确实是当下公认的第一梯队,这一点没悬念。真正值得看的是LMArena盲测榜——Kimi、GLM、Qwen、DeepSeek集体上榜,说明国产模型在真实用户体感上已经不虚,而不只是跑分漂亮。但要提醒一句:Elo投票容易被话术和格式讨好带偏,智能指数又偏学术,两个榜都别迷信,看交叉验证的头部格局就够了。

本文由本站自动聚合,以下为原始来源:前往 bilibili-36 阅读全文