Tencent Hy

@TencentHunyuan

⚡️ 随着 LLM 强化学习扩展到更大的 GPU 集群和更多的训练数据,训练效率成为首要问题。 我们的新研究重新审视了经典的临界批量大小理论,并将其扩展到在线 LLM RL,其中模型生成自己的训练数据,并以不同的方式推出生成和训练规模。 在 GRPO 和 PPO 中,我们发现学习率重新调整可以在有限的批量大小范围内保留每个响应的学习。 在固定硬件上,扩大批量大小可将 PPO 生成阶段的吞吐量提高高达 2.29 倍,而我们测量的最佳 GRPO 配置在减少 29% 的时间内达到相同的验证目标。 🚀 阅读完整的研究: https://t.co/fohJP7qVKq
打开原帖#511482
  1. 产业

    Elon Musk:发一张首页的图是个好主意
  2. 产业

    Alexandr Wang:我们最近一直在用强化学习训练 muse 跳舞
  3. 产业

    Alexandr Wang:为了庆祝今晚的 connect,我要从 wang 宝库里放出几张 meme