Rohan Paul
@rohanpaul_ai
多数代理系统在每次运行后都会丢弃最合适的训练数据.
一个任务完成,有用的部分随它而消失:哪个模型被路由到哪里,哪个工具被叫来,什么回来,代理失败的地方,以及它是如何恢复的.
而现在,TokenRhythm发布了NeoHorse-1,一个4B/9B模型家庭在接受特工执行痕迹和结果的训练后.
因此,它接受了关于一个特工实际所做工作的培训,执行其工具调用、错误和回收,然后将这种经验反馈到培训中,以便下一个模型能够更好地运作。
NeoHorse-1是通过两个连接的环路对RSI进行早期工程验证:Data-RSI + Model-RSI.
NeoHorse-1检查站都从Quen3.5开始。
周围的训练圈使用内部产生的结构化执行轨迹
Token的调查程序是OpenSquilla Harness,用以捕 这次的信号包括路由决定、工具呼叫、故障、恢复步骤和结果。 更新后的模型回到OpenSquilla以生成下一轮的轨迹.
因为人工智能不会因为使用工具而自动改进。 关键是执行经验能否被获取、评价并转化为有用的培训数据。