2025-06-03 科研追新
当日精选(由提交工具自动创建)。
SynthRL:通过可验证的数据合成扩展视觉推理
SynthRL通过种子筛选、难题扩展和严格验证,自动合成高质量视觉推理数据,从而提升视觉语言模型的强化学习训练效果。
SynthRL是一套面向可验证奖励强化学习(RLVR)的自动数据扩展管道,旨在提升视觉语言模型的复杂推理能力。该方法首先选择分布适当的种子问题,再在保持原始答案不变的前提下生成更具挑战性的变体,最后通过验证阶段确保问题正确且难度确有提升。应用于MMK12数据集时,SynthRL基于约8000个种子样本合成了超过3300个额外的可验证难题。使用这些合成数据训练的模型在五个域外视觉数学推理基准上均取得增益,且在高难度样本上的提升更为明显。
用途与启示
- 为视觉推理中的RLVR训练提供可扩展、质量可控的数据合成方案。
- 说明保留答案的难题变换与严格验证可以降低合成数据的错误风险。
- 表明高难度合成样本有助于模型形成更深层、更复杂的推理模式。
- 可作为数学视觉问答及其他可验证多模态任务的数据扩展范式。
📝 原始笔记(逐字保留)
**标题** : SynthRL:通过可验证的数据合成扩展视觉推理
**链接** :https://arxiv.org/abs/2506.02096
**摘要** :通过可验证奖励强化学习(RLVR)训练的视觉语言模型(VLM)在有效扩展测试时间计算方面取得了显着进展。在这项工作中,我们研究如何合成RL数据可以进一步提高RLVR。为此,我们提出了\textbf{SynthRL}-一个可扩展和有保证的管道,用于面向推理的RL训练中的自动数据缩放。SynthRL包括三个关键阶段:(1)选择具有适当分布的种子问题,(2)在保留原始答案的同时将其扩展为更具挑战性的变体,以及(3)确保近乎完美的正确性和难度增强的保证验证阶段。我们的实证实验证明了SynthRL的可扩展性和有效性。当应用于MMK 12数据集时,SynthRL从大约8 K个种子样本中合成了超过3.3K个额外的可验证的挑战性问题。使用我们的合成数据训练的模型在五个域外视觉数学推理基准测试中实现了一致的增益,与仅使用种子数据训练的基线模型相比有了显着的改进。值得注意的是,详细的分析表明,在最具挑战性的评估样本上,收益更为明显,突出了SynthRL在引发更深层次和更复杂的推理模式方面的有效性。