产业观察

BAT 集体重做「AI 预训练」,补「脏数据」的坑

雷峰网·2026/9/24 01:43:00🔗 原文

📋总体概括

近半年国内多家AI模型厂商密集重启预训练返工,BAT等大厂悉数在列,导火索高度一致:训练数据质量不达标。有厂商曾花一年时间死磕万亿参数大模型,实际落地表现却被市面上参数量仅其1%规模的小模型反超,复盘后发现问题根源在于脏数据污染了训练集。这场集体返工意味着行业竞争焦点正从卷参数、卷算力转向卷数据工程,数据清洗与治理能力成为决定模型成败的隐性门槛,也暴露出前期粗放式预训练的技术债。

关键信息

  • 国内一批AI模型厂商近大半年密集启动预训练返工,起因都指向训练数据质量不行
  • 有厂商花一年死磕万亿参数模型,落地表现却被市面上1%规模的小模型倒挂
  • 排查确认脏数据是导致大模型表现不及预期的核心拖累
  • BAT等巨头集体重做AI预训练,说明数据工程短板是行业普遍问题

🔥犀利点评

卷了一两年参数和算力,最后发现卡脖子的是数据这块地基,颇具讽刺意味。万亿参数打不过1%规模的小模型,不是架构不行,是喂进去的粮食发霉了。这波集体返工等于承认:大模型竞争的上半场大家都带着脏数据裸奔。接下来数据清洗、合成数据治理会成为真正的护城河,比拼的是脏活累活的工程能力,而非发布会上的PPT数字。

本文由本站自动聚合,以下为原始来源:前往 雷峰网 阅读全文