Rohan Paul
@rohanpaul_ai
通过将更简单的工具界面与不断适应模型当前可以学习的内容的合成任务相结合,4B 编码代理在 SWE-bench 上经过验证,无需前沿模型蒸馏即可达到 61.5%。
FrogNano 从 Qwen3.5-4B 开始,并接受了大约 1,500 个综合软件工程任务的 RL 训练。
重要的是如何选择这些任务。
随着模型的改进,系统会产生新的问题,这些问题具有挑战性,但仍然可以学习,因此课程随着代理的改进而改进。
界面同样重要。
切换到更简单的 5 工具设置后,SWE-bench Verified 上的基本模型从 8.3% 提高到 37.2%。
5轮过后,FrogNano达到了61.5%。
– arxiv。组织/abs/2609.07925
标题:“FrogNano:通过在线任务综合训练 4B 编码代理”