Aravind Srinivas

@AravSrinivas

我们分享关于后训练方法的新研究:它让 Perplexity Computer agent 从真实用户会话中学习——模仿良好轨迹,并明确纠正可避免的错误(例如糟糕的工具调用,即便整体轨迹是成功的)。该方法将拒绝采样微调(RFT)与提示引导的自蒸馏相结合,在线上 A/B 测试中将工具调用失败减少了约 21%。
打开原帖#511482
  1. 产业

    Rohan Paul:人工智能可以使目前由初级律师、顾问、银行家和广告商完成的大部分日常工作实现自动化
  2. 产业

    Hamel Husain:斯洛普死了吗
  3. 产业

    Rohan Paul:– https://arxiv.org/abs/2609.04872 标题…