2025-09-30 科研追新

当日精选(由提交工具自动创建)。

ReasoningBank:通过推理记忆扩展智能体自我进化

ReasoningBank 从智能体自主评判的成功与失败经验中提炼可泛化推理策略,并结合记忆导向的测试时扩展 MaTTS 持续提升智能体能力。

 自进化 智能体 智能体记忆 推理 模型评估

ReasoningBank 是一种面向自进化智能体的记忆框架,可从智能体自我评判的成功与失败经历中提炼可泛化的推理策略。智能体在测试时检索相关记忆来指导交互,并将新获得的经验重新整合进记忆库,从而持续学习。作者进一步提出记忆导向的测试时扩展 MaTTS,通过增加交互计算生成多样化经验,为高质量记忆合成提供对比信号。在网页浏览和软件工程基准上,该方法在效果与效率方面均优于保存原始轨迹或仅记录成功流程的记忆机制。

用途与启示
  • 为长期运行的智能体建立可积累、可检索并可更新的推理记忆。
  • 将失败经验转化为可泛化策略,减少重复犯错和无效探索。
  • 结合测试时扩展形成“更多经验—更好记忆—更有效探索”的自我强化循环。
  • 可用于网页操作、软件工程等持续任务中的智能体能力演化。
📝 原始笔记(逐字保留)
4. [推理银行:具有推理记忆的自进化代理](https://www.xiaohongshu.com/explore/68db76f3000000000503ad6d?app_platform=ios&app_version=9.2&share_from_user_hidden=true&xsec_source=app_share&type=normal&xsec_token=CBdmV3zWfsM8r78BYr5Nqt5SPlS6J24N2jHCox508C1VE=&author_share=1&xhsshare=WeixinSession&shareRedId=ODZFOTRHNU02NzUyOTgwNjY0OTc0Oko7&apptime=1759229927&share_id=209cc868e5f648129e0d7cfe341e2f19&wechatWid=e071d48db6d5ec0f08890ce3658fa485&wechatOrigin=menu) 1. [ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory](https://arxiv.org/abs/2509.25140) 2. 随着大型语言模型代理在持久的现实角色中越来越多地被采用,它们自然会遇到源源不断的任务流。然而,一个关键限制是它们未能从累积的交互历史中学习,迫使它们舍弃有价值的见解并重复过去的错误。我们提出了** ReasoningBank,一种新颖的记忆框架,用以从代理自我评判的成功和失败经验中提炼出可泛化的推理策略**。在测试时,代理从 ReasoningBank 检索相关记忆以指导其交互,然后将新的学习成果整合回去,使其随时间变得更有能力。 3. 基于这一强大的经验学习器,我们进一步引入了面向记忆的测试时扩展(MaTTS),通过扩展代理的交互经验加速并多样化这一学习过程。通过为每个任务分配更多计算,代理生成丰富且多样的经验,这些经验为合成更高质量记忆提供了丰富的对比信号。反过来,更好的记忆又能指导更有效的扩展,在记忆与测试时扩展之间建立起强大的协同效应。 在网页浏览和软件工程基准测试中,ReasoningBank 一直优于那些仅存储原始轨迹或仅保存成功任务流程的现有记忆机制,在提高效果和效率方面均有提升;MaTTS 进一步放大了这些收益。这些发现确立了以记忆驱动的经验扩展作为一种新的扩展维度,使智能体能够自我进化,并自然地出现新兴行为。 ## 2025-08-08 #### R-Zero:从零数据自我进化推理 LLM [#65](https://arxiv.org/abs/2508.05004) [R-Zero: Self-Evolving Reasoning LLM from Zero Data](https://papers.cool/arxiv/2508.05004) **Authors**: Chengsong Huang、Wenhao Yu、Xiaoyang Wang、Hongming Zhang、Zongxia Li、Ruosen Li、Jiaxin Huang、Haitao Mi、Dong Yu Self-evolving Large Language Models (LLMs) offer a scalable path toward super-intelligence by autonomously generating, refining, and learning from their own experiences. However, existing methods for training such models still rely heavily on vast human-curated tasks and labels, typically via fine-tuning or reinforcement learning, which poses a fundamental bottleneck to advancing AI systems toward capabilities beyond human intelligence. To overcome this limitation, we introduce R-Zero, a fully autonomous framework that generates its own training data from scratch. Starting from a single base LLM, R-Zero initializes two independent models with distinct roles, a Challenger and a Solver. These models are optimized separately and co-evolve through interaction: the Challenger is rewarded for proposing tasks near the edge of the Solver capability, and the Solver is rewarded for solving increasingly challenging tasks posed by the Challenger. This process yields a targeted, self-improving curriculum without any pre-existing tasks and labels. Empirically, R-Zero substantially improves reasoning capability across different backbone LLMs, e.g., boosting the Qwen3-4B-Base by +6.49 on math-reasoning benchmarks and +7.54 on general-domain reasoning benchmarks. 自我进化的大型语言模型(LLMs)通过自主生成、改进并从自身经验中学习,提供了一条通往超智能的可扩展路径。然而,现有训练此类模型的方法仍然在很大程度上依赖大量人工策划的任务和标签,通常通过微调或强化学习来实现,这对将人工智能系统推进到超越人类智能的能力构成了根本性瓶颈。 为克服这一限制,我们提出了 R-Zero,一个完全自主的框架,能够从零开始生成自己的训练数据。R-Zero 从单一基础 LLM 出发,初始化了两个具有不同角色的独立模型:挑战者(Challenger)和解答者(Solver)。这两个模型分别进行优化并通过交互共同进化:挑战者在提出接近解答者能力边界的任务时会获得奖励,而解答者在解决挑战者提出的越来越具挑战性的任务时会获得奖励。 该过程在没有任何预先存在的任务和标签的情况下生成了一个有针对性、自我改进的课程。 在实证上,R-Zero 在不同的骨干 LLMs 上显著提升推理能力,例如在数学推理基准上将 Qwen3-4B-Base 提升了 +6.49,在通用领域推理基准上提升了 +7.54。 [R-Zero:零数据自进化推理LLM(63▲) ](https://huggingface.co/papers/2508.05004?utm_source=digest-papers&utm_medium=email&utm_campaign=2025-08-08) ## 2025-08-07 #### SEAgent:具备自主经验学习的自我进化计算机使用代理 [#68](https://arxiv.org/abs/2508.04700)[SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience](https://papers.cool/arxiv/2508.04700) #68
0%