资讯
重置额度之神Tibo,剧透了Codex下一次大更新
📌 概要
<p>Codex 用户大概都知道重置额度的神 Tibo 。</p> <p>过去一段时间,Codex 一出问题,或者 OpenAI 想给用户补点额度,他就会跑到 X 上说一句:重置了。</p> <p>今天早上 Tibo 就在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。</p> <p><strong>Tibo 表示这次修复能让不同使用方式的用户额
<p>Codex 用户大概都知道重置额度的神 Tibo 。</p>
<p>过去一段时间,Codex 一出问题,或者 OpenAI 想给用户补点额度,他就会跑到 X 上说一句:重置了。</p>
<p>今天早上 Tibo 就在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。</p>
<p><strong>Tibo 表示这次修复能让不同使用方式的用户额度多撑 10% 到 50%。</strong></p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_fa3c291f5c2e4b2d9011b643fd70663c@1200352198_oswg273902oswg1080oswg680_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>在最近的访谈中,Matthew Berman 最近干脆当面问他:你到底是咋重置的?</p>
<p>答案可太有节目效果了——<strong>Tibo 真有一个实体按钮。</strong>觉得体验出了问题,需要补偿用户,他自己就能按。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_de93b219ece34d509a808e5139cd7e08@1200352198_oswg425773oswg1080oswg461_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>不过这场访谈更有意思的部分,还不仅仅是这个按钮。</p>
<p>几周前,Tibo 说过一句很大的话:</p>
<p><strong>再过两三个月,今天的 Codex 会显得很原始。</strong></p>
<p>Tibo 到底看见啥了?</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_c1d51459c3d94950a9f013579a07541a@1200352198_oswg40253oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<h2><strong>Tibo到底为啥说codex会变得「原始」?</strong></h2>
<p>Tibo 没有公布什么秘密模型,他说的反而都是现在 Codex 用户已经会碰到的小麻烦。</p>
<p>Skill 文件要自己维护,Memory 时不时忘东西。Agent 一多,人就得在几个任务之间来回切,看哪个跑完了,哪个卡住了,再把结果收回来。</p>
<p>主持人说,他现在经常同时开 10—15 个 Agent。开到这个数量以后,最先不够用的已经不是 GPU了,瓶颈现在是他自己的注意力。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_ef1b17d4376f4e40b161a47386a8e8b0@1200352198_oswg1112190oswg1024oswg1280_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>Tibo 则不太喜欢这种状态。</p>
<p>他想要的 Agent,应该知道你最近在做什么,知道团队正在推进什么,也知道什么时候该自己开始干活。很多今天摆在用户面前的 Skill、Memory、子 Agent,最后可能都不需要人亲自管理。</p>
<p>笔记本电脑本来就是围绕一个人的工作速度设计的。一个人不会同时打开 100 个程序,也不会一边编译,一边跑测试,再顺手验证十几个方案。</p>
<p>AI 却是这样工作的。</p>
<p>所以 Tibo 判断,未来 Agent 很自然地会往云端走。下一代模型需要的,不只是你的笔记本电脑。</p>
<p>然后访谈聊到了一个最近越来越常出现的词:<strong>Recursive Self-Improvement,递归自我改进,RSI。</strong></p>
<h2><strong>AI 到底有没有开始「自己改自己」</strong></h2>
<p>RSI 对 AI 来说,就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。</p>
<p>就这么一直滚下去。</p>
<p>这个理论其实早在计算机普及之前就出现了,1965 年,I. J. Good 就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_aee07de0ddb447119931571e94746360@1200352198_oswg309939oswg1080oswg499_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>一直以来,难搞的都是同一件事,机器怎么知道自己这次改对了?</p>
<p>2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。</p>
<p>理论很好看,工程上基本没法这么干。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_406635add8374e559d6dc69fc07d9519@1200352198_oswg591720oswg1080oswg720_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>软件开发和机器学习里,大部分有用的改动,都拿不出数学证明。</p>
<p>于是乎,后来大家换了种办法。</p>
<p>先改,再测。代码尤其适合这么干。测试过没过,可以直接跑。速度快了多少,有数字。显存降没降,也能量出来一个指标。</p>
<p>今年 Karpathy 开源的 autoresearch 比较直观。</p>
<p>给 Agent 一块 GPU,一个能改的 train.py,每轮 5 分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_fab6c75830c847d4807f4e658c138807@1200352198_oswg90432oswg1080oswg535_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>涨了就留。掉了就撤。然后继续。</p>
<p>人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。</p>
<p>Tibo 在访谈里把 RSI 的范围说得更宽。</p>
<p>模型不一定非要改自己的权重。它也可以去改 CUDA 内核、推理栈、Agent 框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新「指回自身」。</p>
<p>说得夸张一点,就是:<strong>AI 左脚踩右脚,机械飞升。</strong></p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_0ad46cae806d4c7ba08836c3733222b6@1200352198_oswg606711oswg1080oswg810_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>不过只要 AI 帮 AI 写点代码,就叫 RSI,显然又太吹牛了。</p>
<p>好的修改有没有留下来,坏的缺点有没有被放大?</p>
<p>新系统的改动有没有继续参与下一轮,并真的让RSI的飞轮转起来?</p>
<p>这个循环是不是真的跑了不止一次,还是一两轮增益就停了?</p>
<p>这些都得再看,任重而道远啊!少年AI!</p>
<h2><strong>现在已经走到哪一步了</strong></h2>
<p>近两年的公开案例里,「自我改进」其实已经有了好几种样子。</p>
<p>R-Zero 已经开始让模型自己给自己出题。</p>
<p>一个 Challenger 出题,一个 Solver 解题,新生成的数据继续拿去训练下一轮。在 Qwen3-4B 上,数学和通用推理平均分别涨了 6.49 和 7.54 个点。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_83dbb58e1ec54bc896a991d0c7e113b6@1200352198_oswg165113oswg843oswg426_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>不过考什么、怎么考,还得人来造考题,人距离完全退休还有一定距离。</p>
<p>OpenAI 这边,GPT-5.6 Sol 已经通过 Codex 去分析生产流量、试路由策略,甚至改过生产环境里的 GPU 内核。这些工作和其他优化一起,让端到端服务成本下降了 20%。Sol 还给自己的 draft model 跑了数百次实验,token 生成效率又涨了 15% 以上。</p>
<p>再看 Anthropic 是怎么做的。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_f3468c1300f04644a6bb0fec8d6a13e8@1200352198_oswg63710oswg657oswg921_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>他们拉了 9 个 Agent 做研究,累计跑了约 800 小时。Agent 自己想方案、跑实验、交换结果,5 天把「性能差距恢复率」做到 0.97。</p>
<p>人以前一周都没调出来的东西,现在一群 Agent 能自己往前拱。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_cf3246ad5b4f4eed920c94385fa6dae8@1200352198_oswg242338oswg1080oswg636_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>所以现在的 AI 已经不只是「帮研究员写代码」了。</p>
<p>它开始出题、跑实验、改系统,甚至真的碰到了生产环境。</p>
<p>至于能不能自己一轮接一轮往下改,现在还早着呢,只是模模糊糊有了这个轮廓。</p>
<p>不过非常期待科研工作者们有下一步突破,为他们加油吧!</p>
<h2><strong>分数涨了,不一定真变强了</strong></h2>
<p>循环一旦能自己跑,马上就会引出另一些问题。</p>
<p>谁来判断「变好了」?如何定义「变好了」?</p>
<p>Anthropic 的自动研究实验里,就出现过一些挺尴尬的情况。</p>
<p>有的 Agent 会挑对自己有利的随机种子。有的会从评分接口里猜测试标签。还有的直接去看本来不该看的答案代码。</p>
<p>最后分数还真能涨。只是涨得有点不是地方。</p>
<p>这就是 reward hacking。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_0157cb2543354a52b8147199fc9997b0@1200352198_oswg440042oswg1024oswg1024_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>如果连评测器也交给 AI 自己改呢?</p>
<p>最近好多人都在尝试这个方向。</p>
<p>可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。(dog)总不能无限套娃下去吧!</p>
<p>研究方向也有类似的问题。</p>
<p>Agent 可以很快试掉 100 个已经摆在桌上的方案。第 101 个方向为什么值得做,就没那么容易从 benchmark 里读出来。</p>
<p>Anthropic 把这种判断叫<strong>research taste,研究品味</strong>。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_de81208622ee4921a98dd8e6928204b9@1200352198_oswg493424oswg1080oswg1046_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>Agent 的运行时间拉长以后,也没那么乐观。</p>
<p>有研究者比较过 Agent 和 61 名人类机器学习专家的能力;只给 2 小时,最好的 Agent 得分大约是人类的 4 倍。</p>
<p>到 8 小时,人类已经略微领先。32 小时以后,人类得分大约是 Agent 的两倍。</p>
<p>Agent 很适合短时间内疯狂试方案。跑久以后,也会在一个不太对的方向上反复折腾。</p>
<p>反馈循环本身也有两面。</p>
<p>Nature 2024 年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260830/v2_b9e7cae48e0b4770a809882352488108@1200352198_oswg769364oswg1080oswg810_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>好的修改可以留下。坏的也可以。</p>
<p>Tibo 没有公布两三个月后的 Codex 长什么样,今天还 Agent 需要人不停发任务、看进度、收结果。</p>
<p>下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的 Agent 调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。</p>
<p>所以他那句「两三个月后会显得很原始」,可能改变的是我们用 Agent 的方式。</p>
<p class="editor-note">本文来自微信公众号<a href="https://mp.weixin.qq.com/s/8somRgG8EbAoUaeIGU1OuA" rel="noopener noreferrer nofollow" target="_blank">“APPSO”</a>,作者:发布明日产品的,36氪经授权发布。</p>