Hugging Face
@huggingface
同样的模型,同样的权重,在一个代理套件中得分62%,在另一个代理套件中得分33%。
@adithya_s_k和@huggingface团队刚刚发布了多线束RL的终极指南,这是今年最实用的RL文章之一,一切都是开放的!
诀窍很简单。不要碰安全带。将它指向代理而不是模型。代理使用编码代理使用的所有四种API格式(OpenAI Chat Completions, OpenAI Responses, Anthropic Messages, Gemini)。它记录了vLLM采样的确切令牌id和logprobs,您可以在此基础上进行训练。您不需要更改Claude Code、Codex或OpenCode的任何一行。
结果:
🔹同时训练4个线束,@liquidai的LFM2.5-2.6B从42%上升到54%
🔹减少31%的工具调用,这要归功于在更少的步骤中解决任务的小奖励
🔹仅OpenCode培训就将OpenCode从34%提高到58%,但多线束模型在各个方面都有所改进
他们还尝试了每个人都能找到的捷径:对Qwen3.8-27B上3189条成功发布的内容进行微调。模仿量稳定在47.5%,低于两次RL运行。复制一个更大的模型并不能让你成功。实践。
最好的部分是一切都是开放的:OpenEnv中的捕获代理、TRL中的训练器、任务、SFT数据、训练代码和所有七个训练模型。
特工们会穿上几十套脊甲。
现在开放模型可以被任何人训练。
在这里阅读👇
https://t.co/s2I8GI9SLS