2026-09-25 08:28
AI123
腾讯新研究揭示批量大小对大模型强化学习训练效率的影响
腾讯近期发布的一项研究将经典的临界批量大小理论扩展至在线大模型强化学习场景。在线强化学习中,模型在训练过程中自行生成训练数据,其数据生成与训练过程的扩展方式有所不同。研究团队在GRPO和PPO两类算法上进行实验,发现重新调整学习率可以在一定批量大小范围内保持每个响应的学习效果。在固定硬件条件下,增大批量大小可使PPO生成阶段的吞吐量最高提升2.29倍;在实测配置中,最佳GRPO配置达到相同验证目标所需时间减少了29%。
来源
- 2026-09-24 11:15 | X:⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training efficiency becomes a first-order concern. Our new re...阅读原文
⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training efficiency becomes a first-order concern.Our new research revisits classical critical-batch-size theory and extends it to online LLM RL, where the model generates its own training data and rollout generat...