2025-05-26 科研追新
当日精选(由提交工具自动创建)。
Learning to Reason without External Rewards:无需外部奖励的推理学习
论文探索不依赖人工标注或外部奖励信号,让模型利用自身生成的反馈持续学习并提升推理能力。
论文研究语言模型如何在缺少外部奖励函数和标准答案的条件下学习推理。核心思路是从模型自身的生成结果与内在反馈中构造优化信号,以减少对人工标注、验证器或环境奖励的依赖。该方向将推理训练从固定监督数据扩展到更自主的探索与改进过程,为可持续的模型自我进化提供了新路径。
用途与启示
- 降低推理模型训练对人工标注、标准答案和外部验证器的依赖
- 为开放环境中的自主学习与持续自我改进提供训练思路
- 启发基于内生反馈、自生成数据和强化学习的推理系统设计
📝 原始笔记(逐字保留)
1. Learning to Reason without External Rewards 论文地址:https://arxiv.org/pdf/2505.19590