Hugging Face

@huggingface

同样的模型,同样的权重,在一个代理套件中得分62%,在另一个代理套件中得分33%。 @adithya_s_k和@huggingface团队刚刚发布了多线束RL的终极指南,这是今年最实用的RL文章之一,一切都是开放的! 诀窍很简单。不要碰安全带。将它指向代理而不是模型。代理使用编码代理使用的所有四种API格式(OpenAI Chat Completions, OpenAI Responses, Anthropic Messages, Gemini)。它记录了vLLM采样的确切令牌id和logprobs,您可以在此基础上进行训练。您不需要更改Claude Code、Codex或OpenCode的任何一行。 结果: 🔹同时训练4个线束,@liquidai的LFM2.5-2.6B从42%上升到54% 🔹减少31%的工具调用,这要归功于在更少的步骤中解决任务的小奖励 🔹仅OpenCode培训就将OpenCode从34%提高到58%,但多线束模型在各个方面都有所改进 他们还尝试了每个人都能找到的捷径:对Qwen3.8-27B上3189条成功发布的内容进行微调。模仿量稳定在47.5%,低于两次RL运行。复制一个更大的模型并不能让你成功。实践。 最好的部分是一切都是开放的:OpenEnv中的捕获代理、TRL中的训练器、任务、SFT数据、训练代码和所有七个训练模型。 特工们会穿上几十套脊甲。 现在开放模型可以被任何人训练。 在这里阅读👇 https://t.co/s2I8GI9SLS
打开原帖#511482
  1. 产业

    Aravind Srinivas:就 Computer 能为你做什么而言,你的创造力才是上限
  2. 产业

    Aravind Srinivas:最近Perplexity 的一些开源贡献: •pplx-decider-v…
  3. 产业

    Alexandr Wang:你可能会问,为什么要开源呢? 首先,构建小工具很有趣