Rohan Paul

@rohanpaul_ai

通过将更简单的工具界面与不断适应模型当前可以学习的内容的合成任务相结合,4B 编码代理在 SWE-bench 上经过验证,无需前沿模型蒸馏即可达到 61.5%。 FrogNano 从 Qwen3.5-4B 开始,并接受了大约 1,500 个综合软件工程任务的 RL 训练。 重要的是如何选择这些任务。 随着模型的改进,系统会产生新的问题,这些问题具有挑战性,但仍然可以学习,因此课程随着代理的改进而改进。 界面同样重要。 切换到更简单的 5 工具设置后,SWE-bench Verified 上的基本模型从 8.3% 提高到 37.2%。 5轮过后,FrogNano达到了61.5%。 – arxiv。组织/abs/2609.07925 标题:“FrogNano:通过在线任务综合训练 4B 编码代理”
打开原帖#511482
  1. 产业

    Sharif Shameem:你对未来的影响力比你想象的更大
  2. 产业

    Rohan Paul:谷歌的新论文表明,当 LLM 代理的工作流程存在于可编辑的过程图中(从执行…
  3. 产业

    Charles Frye:将你们的相互静音