2025-05-23 科研追新
当日精选(由提交工具自动创建)。
合成数据强化学习:任务定义即你所需
Synthetic Data RL 仅依据任务定义与检索文档生成并筛选训练样本,即可用强化学习高效适配模型,在多个数学、医学、法律和金融基准上接近完整人工数据训练效果。
论文提出 Synthetic Data RL,一种仅依赖任务定义生成合成数据并进行强化微调的通用框架。该方法先结合任务定义和检索文档生成问答对,再依据模型的可解答性调整难度,并通过平均通过率筛选适合强化学习的样本。在 Qwen-2.5-7B 上,该方法使 GSM8K、MATH、GPQA、MedQA、法律 CQA 和金融 CFA 分别获得显著提升,并在相同数据预算下优于监督微调。实验还显示,额外加入少量人工示范带来的收益有限,说明高质量合成数据能够显著降低任务适配对人工标注的依赖。
用途与启示
- 以任务定义代替大规模人工标注,为垂直领域模型适配提供低成本数据方案。
- 通过可解答性、难度调节和平均通过率筛选,提高合成数据对强化学习训练的有效性。
- 适用于数学、科学、医学、法律和金融等具备明确任务定义或可检索资料的领域。
- 表明合成数据配合强化学习有机会在有限数据预算下接近完整人工数据的训练效果。
📝 原始笔记(逐字保留)
2. Synthetic Data RL: Task Definition Is All You Need
1. https://arxiv.org/abs/2505.17063
2. https://github.com/gydpku/Data_Synthesis_RL/
3. 强化学习(RL)是一种将基础模型适应于特定任务的强大方法,但其对大规模人工标注数据的依赖限制了其广泛应用。我们提出了合成数据强化学习(Synthetic Data RL),这是一种简单且通用的框架,通过仅使用从任务定义生成的合成数据对模型进行强化微调。
1. 我们的方法首先从任务定义和检索到的文档中生成问答对,然后根据模型的可解答性调整问题难度,并通过模型在样本中的平均通过率选择问题进行强化学习训练。
2. 在 Qwen-2.5-7B 上,我们的方法在 GSM8K 上比基础模型实现了 29.2%的绝对提升(相比指令微调提升 2.9 个百分点,相比 Self-Instruct 提升 6.6 个百分点),在 MATH 上提升 8.7%,在 GPQA 上提升 13.1%(相比 SynthLLM 提升 7.0 个百分点),在 MedQA 上提升 8.9%,在 CQA(法律)上提升 17.7%,在 CFA(金融)上提升 13.7%。它在相同数据预算下超越了监督微调,并且在各数据集上几乎达到使用完整人工数据的强化学习效果(例如,GSM8K 提升 17.2 个百分点)。添加 100 个人工示范仅使 GSM8K 的性能提升 0.4 个百分点,显示出有限的附加价值。 通过减少人工数据标注,合成数据强化学习实现了基于强化学习的模型适应的可扩展性和高效性。代码和演示可在[此 https URL](https://github.com/gydpku/Data_Synthesis_RL/) 获取。
# 专用算法