产业观察
Perplexity用真实错误训练其计算机代理:提示引导自蒸馏
原标题: Perplexity用真实错误训练其计算机代理:提示引导自蒸馏
📋总体概括
Perplexity Research发布一项新的后训练研究,用于其Perplexity Computer计算机代理模型。该方法直接在真实用户会话数据上训练,包括失败会话,核心是把拒绝采样微调(RFT)与「提示引导自蒸馏」相结合,让模型从真实错误中学习而非仅依赖合成数据。在线A/B测试显示,两个训练后检查点之间工具调用失败率从2.24%降至1.77%,团队称这是统计显著的21.2%相对降幅。这项工作表明,真实用户流量与失败案例本身可以成为代理模型迭代的高价值训练信号。
⚡关键信息
- ▸Perplexity Research发布新后训练研究,用Perplexity Computer的真实用户会话(含失败会话)训练模型
- ▸方法结合拒绝采样微调与提示引导自蒸馏,从真实错误中提取学习信号
- ▸在线A/B测试中工具调用失败率从2.24%降至1.77%
- ▸团队将此结果报告为统计显著的21.2%相对改善
🔥犀利点评
用真实失败会话当训练材料,这比刷合成基准务实得多——代理的短板从来不是不会答,而是不会用工具。不过21.2%的相对降幅基数本身只有2.24%,绝对改善不到0.5个百分点,落到每个用户头上体感有限。真正的看点是把失败流量变成可迭代资产的工程闭环,而非这个数字本身。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →