产业观察🔥7.0

谷歌最前沿 AI 模型:Gemini 4 Argon 登场,长周期代码工程 DeepSWE 测试超 Claude Opus 5.5

IT之家·2026/9/30 22:57:36🔗 原文

📋总体概括

谷歌于9月30日发布迄今最先进AI模型Gemini 4 Argon,但未向公众全面开放。该模型主打长流程软件工程、企业知识工作和网络安全防御,单次输出上限从64,000 tokens提升至约100万tokens,适合处理大型代码库和长文档。在DeepSWE v1.1测试中取得77.9%的得分,超过Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%,网络安全基准并列第一,金融、法律等专业任务基准领先。

⚡关键信息

  • ▸谷歌9月30日发布Gemini 4 Argon,称其为最先进模型,但尚未面向公众全面开放
  • ▸单次输出上限提升至约100万tokens,为此前64,000 tokens的十余倍
  • ▸DeepSWE v1.1得分为77.9%,超过Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%
  • ▸主打长流程软件工程、企业知识工作和网络安全防御,网络安全基准并列第一
  • ▸金融、法律等专业任务基准领先,Gemini产品负责人称其多领域具备前沿能力

🔥犀利点评

DeepSWE领先对手不到4个百分点,谷歌就敢喊「迄今最强」,营销味远大于实质差距。更值得注意的是模型未全面开放——跑分漂亮却捂着不放,大概率还在内测打磨或等定价策略。百万tokens输出上限倒是实打实的差异化,长代码工程场景确实刚需。但榜单分数是厂商自选考卷,等第三方实测和开发者反馈再下结论不迟。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →