产业观察

中文互联网基础语料 4.0 发布:数据量 120GB,为大模型训练和 AI 发展提供可信数据支撑

IT之家·2026/9/15 14:49:09🔗 原文

📋总体概括

9月15日,在济南举行的2026年国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料4.0正式发布,数据量达120GB,已在「中文互联网语料资源平台」上线。该项目由中央网信办指导,中国网络空间安全协会联合国家互联网应急中心,会同百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等单位共建,在1.0至3.0版本基础上汇聚新的高质量可信数据,经严格加工处理后发布,旨在为大模型训练和AI发展提供可信数据支撑,丰富国内高质量中文语料供给体系。

关键信息

  • 中文互联网基础语料4.0于9月15日在济南发布,数据量120GB,已在中文互联网语料资源平台上线
  • 项目由中央网信办指导,中国网络空间安全协会联合国家互联网应急中心共同推进
  • 百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等企业参与语料共建
  • 用户可通过网安协会官网注册、认证后下载获取相关语料数据
  • 4.0版本是1.0至3.0基础上的阶段性成果,旨在为大模型训练提供可信中文数据

🔥犀利点评

120GB听起来慷慨,但放在动辄数万亿token的大模型预训练需求面前,这点量更像表态意义大于实用价值——官方想解决的是数据可信与合规问题,而非规模问题。真正的看点是共建共享机制能否持续扩容、打通更多行业数据源。中文高质量语料长期稀缺是国产大模型的真实短板,这个方向没错,只是别把阶段性成果当成突破。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文