Rohan Paul

@rohanpaul_ai

多数代理系统在每次运行后都会丢弃最合适的训练数据. 一个任务完成,有用的部分随它而消失:哪个模型被路由到哪里,哪个工具被叫来,什么回来,代理失败的地方,以及它是如何恢复的. 而现在,TokenRhythm发布了NeoHorse-1,一个4B/9B模型家庭在接受特工执行痕迹和结果的训练后. 因此,它接受了关于一个特工实际所做工作的培训,执行其工具调用、错误和回收,然后将这种经验反馈到培训中,以便下一个模型能够更好地运作。 NeoHorse-1是通过两个连接的环路对RSI进行早期工程验证:Data-RSI + Model-RSI. NeoHorse-1检查站都从Quen3.5开始。 周围的训练圈使用内部产生的结构化执行轨迹 Token的调查程序是OpenSquilla Harness,用以捕 这次的信号包括路由决定、工具呼叫、故障、恢复步骤和结果。 更新后的模型回到OpenSquilla以生成下一轮的轨迹. 因为人工智能不会因为使用工具而自动改进。 关键是执行经验能否被获取、评价并转化为有用的培训数据。
打开原帖#511482
  1. 产业

    Tomasz Tunguz:原来数学只是另一款棋盘游戏.
  2. 产业

    Matt Wolfe:我认为这是一个聪明的举动
  3. 产业

    Santiago Valdarrama:我们已经解决了编码问题