资讯

Can LLMs Engineer Their Own Agent Harness? ByteDance Seed’s HarnessDev Says Only 34 of 64 Changes Generalize

marktechpost.com·2026/9/11 22:01:08🔗 原文

📋总体概括

字节跳动Seed联合SUTD、佐治亚理工、M-A-P与TokenWave.AI推出HarnessDev基准,首次以模型自建的Agent运行环境质量为评分对象,而非最终答案。6个创世LLM从零分种子出发,在5个基准、2207个任务上构建并依据执行反馈迭代进化harness。结果显示自建harness在写作与ML实验类任务上可匹敌人类参考实现,但在代码与搜索任务上落后;更关键的是64项进化改动中仅34项在留出任务上方向一致,泛化能力存疑。

关键信息

  • HarnessDev由字节Seed、SUTD、佐治亚理工、M-A-P和TokenWave.AI联合推出,评分对象是模型构建的可运行harness而非答案本身
  • 实验设置:6个创世LLM从0分种子起步,覆盖5个基准共2207个任务,靠执行反馈迭代进化
  • 自建harness在写作与ML实验类任务上追平人类参考实现,但在代码与搜索类任务上明显落后
  • 64项进化改动中仅34项在留出任务上产生同方向效果,泛化成功率刚过半
  • 该基准把「Agent能力差距」归因从模型权重转向harness工程这一此前被忽视的变量

🔥犀利点评

这个基准戳破了Agent圈最大的遮羞布:很多所谓模型能力差距,其实是harness工程水平的差距。但结果更耐人寻味——模型自己搭的harness只在写作、实验这类宽松任务上追平人类,一到代码、搜索这种硬仗就露馅;且进化改动一半以上无法泛化,说明模型是在过拟合执行反馈,而非真正理解harness设计原理。自我进化Agent离「工程能力」还差一个量级,别被自动化的表象唬住。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文