Aravind Srinivas@AravSrinivas2026年9月23日 04:39我们分享关于后训练方法的新研究:它让 Perplexity Computer agent 从真实用户会话中学习——模仿良好轨迹,并明确纠正可避免的错误(例如糟糕的工具调用,即便整体轨迹是成功的)。该方法将拒绝采样微调(RFT)与提示引导的自蒸馏相结合,在线上 A/B 测试中将工具调用失败减少了约 21%。打开原帖#511482