资讯🔥7.0

OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化

IT之家·2026/9/6 06:46:16🔗 原文

📋总体概括

据Fortune报道,OpenAI自9月3日发布GPT-6 Astra模型公告以来,多次修改其中的评测基准数据,部分更新让Astra表现更好,而竞争对手Anthropic旗下模型的部分成绩被下调。此次发布过程颇为反常:原定下午2点发布的博客被悄悄撤下,页面近两小时后才可正常访问,OpenAI先后以内容管理系统故障、互联网中断解释,但拒绝说明撤稿原因,仅强调与基准成绩无关。在AI行业竞争白热化背景下,基准数据反复变动引发对其评测公信力的质疑。

关键信息

  • OpenAI自9月3日下午首次发布GPT-6 Astra公告后,多次修改评测基准数据,部分数据至今仍在调整
  • 更新后的数据显示Astra表现有所提升,而Anthropic旗下模型的部分成绩出现下调
  • 原定下午2点发布的博客被撤下,官方X账号下午3点32分发链接时页面仍打不开,约一小时后才恢复访问
  • OpenAI先称是内容管理系统故障,后改称互联网中断,并拒绝披露撤稿具体原因,强调与基准成绩无关
  • 奥尔特曼在页面仍无法访问时发文称博客「真的非常棒」,时间线反常引发外界质疑

🔥犀利点评

发布一篇文章比训练一个模型还曲折,CMS故障、断网两套说辞对不上号,基准数据上线后还能反复涨跌,对手成绩还能顺势缩水——这套操作的公关味道浓得刺鼻。评测数字本应是中立的尺子,如今却成了可随时微调的宣传素材,OpenAI一边教育行业要相信评测,一边亲手演示怎么「运营」评测。真正的问题不是Astra强不强,而是以后谁还敢把OpenAI公布的成绩当真。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文