资讯🔥7.0

万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链

华尔街见闻·2026/9/15 02:17:10🔗 原文

📋总体概括

OpenAI新旗舰GPT-6 Astra发布前后陷入争议:The Information援引内部消息称其采用recurrent depth(循环Transformer)设计,可能令部分或全部推理过程不可见,引发AI安全界关注。OpenAI首席科学家Jakub Pachocki亲自出面澄清,称当前前沿模型计算图深度与GPT-4差距仍在两倍以内,试图避免「奔向不可监控性的竞赛」。技术博主Sebastian Raschka随后发布万字长文,系统拆解循环深度与隐藏思维链的技术原理,为混乱的舆论提供技术视角。

关键信息

  • GPT-6 Astra发布前两天,The Information援引内部消息指其采用recurrent depth循环Transformer设计
  • 该设计被报道可能让模型部分乃至全部推理过程变得不可见,成为AI安全讨论焦点
  • OpenAI首席科学家Jakub Pachocki出面澄清,强调避免「不可监控性竞赛」
  • Pachocki称包括Astra在内的前沿模型计算图深度与GPT-4差距仍在两倍以内
  • 《Build a Large Language Model》作者Sebastian Raschka发万字长文拆解循环深度技术细节

🔥犀利点评

这场争议的本质不是技术,而是透明度的话语权。OpenAI一边用循环深度压缩推理成本,一边在「推理过程不可见」的消息发酵后才由首席科学家灭火——如果真无不可监控性,为何不在发布时主动讲清?Pachocki拿「与GPT-4深度差两倍以内」回应,恰恰回避了循环深度改变的是计算的质而非量。Raschka的长文有价值,但行业更需要的是监管强制下的可审计性,而不是靠博主解读和官方口径互相拉扯。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文