2025-05-27 科研追新
当日精选(由提交工具自动创建)。
ALITA:以最少预定义和最大自我进化实现可扩展智能体推理
ALITA 通过动态构建、复用和改进外部工具,让通用智能体在较少人工预定义的情况下实现可扩展推理与持续自我进化。
ALITA 是一种强调低预定义与高自我进化能力的通用智能体框架。面对复杂任务时,它能够按需创建和调用工具,并将有效能力积累下来,以扩展后续任务中的推理与执行能力。该设计试图减少固定工作流、手工工具配置和领域专用模块对智能体泛化能力的限制。项目已公开论文与 GitHub 代码,便于进一步验证和复现。
用途与启示
- 为构建能够自主扩展工具集的通用智能体提供参考架构
- 探索以能力积累和工具复用提升智能体长期泛化能力的路径
- 降低复杂智能体系统对人工工作流与预定义模块的依赖
- 可用于研究自我进化、工具学习及可扩展智能体推理
📝 原始笔记(逐字保留)
1. https://mp.weixin.qq.com/s/vmp8H-3S_HH6Gvb4dH5FxA
论文标题:ALITA: GENERALIST AGENT ENABLING SCALABLE AGENTIC REASONING WITH MINIMAL PREDEFINITION AND MAXIMAL SELF-EVOLUTION
论文链接:https://arxiv.org/abs/2505.20286
Twitter:https://x.com/JiahaoQiu99/status/1927376487285432790
GitHub:https://github.com/CharlesQ9/Alita
CMU 提出自我奖励训练 SRT:大模型能否实现无标签自训练?
CMU 提出自我奖励训练 SRT,利用模型多个解答的一致性生成奖励信号,使大型推理模型无需外部标签或真实验证器即可在线自训练。
论文提出自我奖励训练(Self-Rewarded Training,SRT),一种面向大型推理模型的在线自训练强化学习算法。训练期间,模型针对同一问题生成多个候选解答,并通过解答之间的一致性及多数投票估算正确答案。该估计结果被转化为替代性奖励信号,用于持续优化模型,而不依赖人工标注或真实验证器。与 RLVR 使用外部可验证奖励不同,SRT 探索了模型依靠自身判断信号实现性能提升的路径。
用途与启示
- 降低推理模型强化学习对人工标签和外部验证器的依赖
- 为缺少可靠验证规则的任务提供可扩展的自监督奖励机制
- 展示利用采样一致性推动模型自我进化的可行路径
- 启发对错误强化、答案偏置及训练稳定性的进一步研究
📝 原始笔记(逐字保留)
3. **CMU 的「自我奖励训练(SRT)」**:提出了一种名为「自我奖励训练」的在线自我训练强化学习算法,旨在让大型语言模型通过自身的判断信号进行自我监督和训练,从而在没有外部标签的情况下提升性能。
论文标题:Can Large Reasoning Models Self-Train?
论文链接:https://arxiv.org/abs/2505.21444
项目地址:https://self-rewarding-llm-training.github.io/
代码地址:https://github.com/tajwarfahim/srt
数据集:https://huggingface.co/collections/ftajwar/self-rewarding-llm-training-6835218091832c3664176553
受先前基于一致性自我提升研究的启发,研究团队引入了一种简单而有效的自我训练强化学习方法论,称为自我奖励训练(Self-Rewarded Training,SRT)。**该方法在强化学习训练期间,通过模型生成的多个解决方案之间的一致性来评估正确性,从而在没有标注数据的情况下提供自监督信号。**

SRT 概览。在 RLVR 方法中,系统通过真实验证器生成用于强化学习训练的奖励信号。与之相反,SRT 方法并不依赖真实验证器,而是通过模型自身生成结果的多数投票机制来估算真实值,并利用这一替代性奖励信号来训练模型。