Rohan Paul@rohanpaul_ai2026年9月25日 22:59在处理难题之前进行广泛探索的智能体在 4 项任务上的平均成功率为 74.54%,而直接处理难题时为 56.50%,因此从广泛开始。 人工智能代理经常在不熟悉的应用程序中摸索。通常的解决方法是收集新数据并重新训练,这是昂贵的。 在 RSIAgent 中,课程代理发明练习任务,参与者用代码解决它们,并且单独的验证器检查每个结果。练习从广泛的相关任务开始,然后深入实际任务及其疑难案例。 总体而言,该论文表示,在让代理在新应用程序中工作之前,先让它广泛练习,然后深入练习,并由单独的验证者决定保存什么。打开原帖#511482