Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ...

发布时间:2026/10/4 14:31:46
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ...
文章主要内容和创新点主要内容本文聚焦于多模态大语言模型(MLLM)强化学习(RL)训练中的效率问题,提出了一个名为Shuffle-R1的框架。研究发现,当前RL训练存在两个关键缺陷:优势值坍缩(Advantage Collapsing):批次中大多数优势值集中在零附近,导致有效梯度信号被淹没;轨迹沉默(Rollout Silencing):随着训练进行,贡献非零梯度的轨迹比例持续下降,造成数据利用率低。为解决这些问题,Shuffle-R1引入两个核心模块:成对轨迹采样(Pairwise Trajectory Sampling):从扩展的轨迹池中选择具有大优势值对比度的轨迹对(如最大优势值与最小优势值配对),增强梯度信号质量;基于优势的批次重排(Advantage-based Batch Shuffle):通过按优势值权重动态重排训练批次,增加有价值轨迹的曝光率,提升数据利用率。实验表明,Shuffle-R1在多个推理基准(如MathVerse、MathVista)上持续优于主流RL基线方法,甚至在部分任务上超越GPT-4o和Claude-3.7,且仅需一半训练步骤即可达到与GRPO相当的性能。创新点揭示了MLLM的RL微调中两个未被充分研究的效率瓶颈:优势值坍缩和轨迹沉默;