资讯
Anthropic 揭示“AI 训练 AI”新方法,比人类研究员成本更低、速度更快
📌 概要
<p>IT之家 8 月 29 日消息,<strong>用 AI 模型训练其他 AI 模型</strong>,正成为新一代 AI 实验室重点探索的方向。当地时间 28 日,Anthropic 研究员计划的一名研究人员展示了这种思路真正落地后可能呈现的样子。</p><p class="isSelectedEnd">Anthropic 发布了最新论文《自动化研究员能够可靠缓解对齐失效》,介绍如何利用 A
<p>IT之家 8 月 29 日消息,<strong>用 AI 模型训练其他 AI 模型</strong>,正成为新一代 AI 实验室重点探索的方向。当地时间 28 日,Anthropic 研究员计划的一名研究人员展示了这种思路真正落地后可能呈现的样子。</p><p class="isSelectedEnd">Anthropic 发布了最新论文《自动化研究员能够可靠缓解对齐失效》,介绍如何利用 AI 系统改善模型在一系列对齐基准测试中的表现。研究团队针对 10 种具体的失调行为设置测试,自动化系统最终<strong>让全部 10 项指标都有所改善,同时没有牺牲模型的整体能力</strong>。</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/cea6ae3a-35f7-4d7b-b5dc-6c6060f5afe3.png?x-bce-process=image/format,f_auto" /></p><p class="isSelectedEnd">这套系统由 Anthropic 研究员计划成员陈岳翰(音译)领导开发,工作流程与传统科研相似。自动化系统会先查阅已有文献,提出训练方法,再按照方案训练模型 30 分钟,并通过多轮尝试逐步提高测试成绩。<strong>有效方案会留下,无效方案则被淘汰,使整个研究过程能够快速扩大规模</strong>。</p><p class="isSelectedEnd">论文指出,总体来看,这些结果初步证明,自动化对齐后训练有望在近期成为一种真正可行的方法。</p><p class="isSelectedEnd">这项研究也向递归自我改进迈出了一步,而许多人把递归自我改进视为 AI 发展的下一个重要阶段。如果 AI 模型能够改进自身的对齐训练方法,那么进一步改进更广泛的训练流程也并非没有可能。到了那一步,人类 AI 研究人员甚至可能逐渐失去存在的必要。</p><p class="isSelectedEnd">论文也直接比较了自动化对齐研究员(AAR)和人类研究人员的表现:“最优秀的 AAR 方法平均只需 6 小时,就能超过经验丰富的人类研究人员提出的方案。人类引导的研究方向,并不会导致更强的表现。”</p><p class="isSelectedEnd">成本差距同样明显。“AAR 每小时只需要大约 4 美元<span class="exch-money-value">(IT之家注:现汇率约合 27 元人民币)</span>的 API 推理成本,而我们支付给人类研究人员的费用是每小时 150 美元<span class="exch-money-value">(现汇率约合 1,011 元人民币)</span>。”</p><p>不过这套方法仍有明显限制。自动化系统的效果首先取决于<strong>基准测试能否准确反映真正的对齐目标</strong>,即使测试本身可靠,建立和长期维护这些基准仍需要大量投入。自动化研究员依赖的研究文献同样需要持续维护和扩充。</p><p><span class="referenceTitle">参考</span></p><ul class="custom_reference list-paddingleft-1"><li class="list-undefined list-reference-paddingleft"><p><a href="https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures" target="_blank">Automated researchers can reliably mitigate alignment failures</a></p></li></ul>