2025-06-12 科研追新

当日精选(由提交工具自动创建)。

大型语言模型具有内在元认知,但需要良好的评估透镜

研究提出自动化元认知评估框架 AutoMeco 与免训练的 MIRA 调整策略,用于检验并增强大型语言模型对自身推理步骤错误的感知能力。

 元学习 模型评估 推理 人工智能

以往研究多关注让大语言模型识别推理链中的错误,却较少系统考察模型是否意识到自身在哪一步出错。作者提出 AutoMeco,用于自动基准测试困惑度等现有“元认知透镜”,并分析其步骤级评价能力与适应性。论文还提出无需额外训练的马尔可夫内在奖励调整策略 MIRA,以改进当前元认知指标。三个数学推理数据集和三个大语言模型上的实验显示,AutoMeco 的验证方式具有合理性,MIRA 也能更准确地评估模型的元认知能力。

用途与启示
  • 为大语言模型的步骤级自我评价与错误感知提供自动化评估框架
  • 帮助判断困惑度等代理指标能否真实反映模型的元认知状态
  • 通过免训练策略提升自我验证、候选答案筛选及可靠推理能力
  • 为构建能够监控和修正自身推理过程的模型提供研究工具
📝 原始笔记(逐字保留)
1. 2025-06-12 12:05:13 Thursday| Large Language Models Have Intrinsic Meta-Cognition, but Need a Good Lens **标题** : 大型语言模型具有内在的元认知,但需要良好的镜头 **链接** :https://arxiv.org/abs/2506.08410 **作者** : Ziyang Ma, Qingyue Yuan, Zhenglin Wang, Deyu Zhou **备注** :Preprint **摘要** :以前的研究主要集中在大型语言模型(LLM)的认知错误检测能力上,通常会促使它们分析推理链中的错误。然而,很少有研究考察LLM的**元认知**能力(例如,他们的自我意识的步骤错误),这是至关重要的,他们的可靠性。尽管对LLM自我评价的研究提出了**困惑度**等能够反映答案正确性的测量指标,并将其作为元认知的透镜,但缺乏对LLM自我评价的步骤分析和适应性研究。本文研究了如何用现有的评价方法来评价法学硕士元认知,以及如何改进这些评价方法。具体来说,我们提出了AutoMeco,一个 **自动化的元认知评估框架** ,用于对现有的镜头进行基准测试。此外,提出了一种无需训练的马尔可夫内在奖励调整策略MIRA,以提高当前的元认知镜头。在三个数学推理数据集和三个LLM上的实验结果表明,AutoMeco验证方法与Best-of-N验证方法相比具有一定的合理性。此外,MIRA可以更好地评估LLM的元认知能力。 ## 认知能力

「Next-Token」范式改变:强化学习预训练来了

文章介绍将强化学习引入预训练阶段的新范式,探索突破传统下一词元预测训练方式的可能性。

 强化学习 模型训练 人工智能

文章聚焦“强化学习预训练”这一新方向,讨论其对传统 Next-Token Prediction 范式的改变。该思路尝试在预训练阶段引入奖励反馈,使模型不再仅依赖逐词预测目标。它可能为提升模型的推理、规划及长期决策能力提供新的训练路径。

用途与启示
  • 关注强化学习从后训练向预训练阶段前移的趋势
  • 为突破单一下一词元预测目标提供研究思路
  • 启发对奖励设计、训练稳定性与规模化效率的进一步探索
📝 原始笔记(逐字保留)
7. 2025-06-12 10:54:10 Thursday | 「Next-Token」范式改变!刚刚,强化学习预训练来了https://mp.weixin.qq.com/s/UABVUoHYTDlFWWNvD5R9Og

一致的路径通向真理:面向LLM推理的自我奖励强化学习

论文提出内在奖励机制CoVo,利用不同推理轨迹中间状态的一致性与波动性,在无需外部监督的情况下强化大模型推理能力。

 强化学习 推理 模型训练 自进化

作者提出自我奖励强化学习框架CoVo,以不同推理轨迹的中间状态作为内在监督信号。其核心观察是,正确推理的中间状态通常会收敛至最终答案,并且与其他候选轨迹的偏差较小。CoVo通过向量空间聚合策略联合衡量一致性和波动性,同时加入好奇心奖励以鼓励多样化探索。多个推理基准的实验显示,该方法在不依赖外部监督时可达到或超过监督强化学习的表现。

用途与启示
  • 为缺乏人工标注或可验证奖励的推理任务提供可扩展的强化学习方案
  • 展示了从模型内部推理轨迹构造奖励信号的可行性
  • 可用于降低LLM推理训练对外部奖励模型和监督数据的依赖
  • 为轨迹级自我评估、自我改进与探索机制的结合提供参考
📝 原始笔记(逐字保留)
8. 2025-06-12 12:01:12 Thursday | Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning **标题** : 一致的路径通向真理:LLM推理的自我奖励强化学习 **链接** :https://arxiv.org/abs/2506.08745 **作者** : Kongcheng Zhang, Qi Yao, Shunyu Liu, Yingjie Wang, Baisheng Lai, Jieping Ye, Mingli Song, Dacheng Tao **摘要** :强化学习(RL)的最新进展突出了其在复杂推理任务中的潜力,但有效的训练往往依赖于外部监督,这限制了其更广泛的适用性。在这项工作中,我们提出了一种新的自我奖励强化学习框架,通过利用不同推理轨迹之间的中间推理状态的一致性来增强大型语言模型(LLM)推理。我们的关键见解是, **正确的反应往往表现出一致的轨迹模式,在模型的可能性:他们的中间推理状态往往会收敛到自己的最终答案(高一致性)** ,与其他候选人的偏差最小(低波动性)。受这一观察的启发,我们引入了CoVo,这是一种内在的奖励机制,它通过强大的向量空间聚合策略整合了一致性和波动性,并辅以好奇心奖金来促进多样化的探索。CoVo使LLM能够以自我奖励的方式执行RL,为在没有外部监督的情况下学习推理提供了一条可扩展的途径。在不同的推理基准上进行的大量实验表明,CoVo实现了与监督RL相当甚至超过监督RL的性能。我们的代码可在https://github.com/sastpg/CoVo上获得。

Bingo:通过动态与显著性强化学习提升大模型推理效率

Bingo通过显著性长度奖励和动态长度奖励,在减少大模型冗余推理输出的同时兼顾准确率与推理效率。

 强化学习 推理 模型训练 系统优化

大型语言模型的推理过程常包含不必要的冗长或冗余内容,而直接使用长度奖励压缩输出又容易损害准确率。Bingo提出显著性长度奖励,逐步引导模型优先减少对答案贡献较低的非显著标记。其动态长度奖励在训练初期允许模型针对困难问题进行详细推理,随后逐渐加强效率约束。多个推理基准的实验显示,该方法优于普通奖励及多种长度奖励基线,实现了更好的准确率与效率平衡。

用途与启示
  • 为训练简洁且准确的推理模型提供新的强化学习奖励设计。
  • 通过区分标记重要性,避免长度压缩对关键推理步骤造成破坏。
  • 动态调整效率约束,可为不同训练阶段的奖励调度提供参考。
  • 有助于降低长链推理的生成成本与推理延迟。
📝 原始笔记(逐字保留)
9. 2025-06-12 12:10:11 Thursday | Bingo: Boosting Efficient Reasoning of LLMs via Dynamic and Significance-based Reinforcement Learning **标题** : 宾果:通过动态和基于重要性的强化学习提高LLM的高效推理 **链接** :https://arxiv.org/abs/2506.08125 **作者** : Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang **摘要** :大型语言模型已经展示了令人印象深刻的推理能力,但由于不必要的冗长或冗余输出,它们通常效率低下。虽然许多研究已经探索了强化学习(RL)来增强推理能力,但大多数主要集中在提高准确性上,对**推理效率**的关注有限。一些现有的方法引入了直接基于长度的奖励来鼓励简洁,但这通常会导致准确性的明显下降。在本文中,我们提出了Bingo,这是一个RL框架,它推进了基于长度的奖励设计,以提高推理效率。Bingo包含两个关键机制:一个是显著性长度奖励,它逐渐引导模型只减少不显著的标记;另一个是动态长度奖励,它最初鼓励对困难问题进行详细推理,但随着时间的推移而衰减,以提高整体效率。在多个推理基准上的实验表明,Bingo提高了准确性和效率。它在RL中优于vanilla reward和其他几个基于长度的奖励基线,在准确性和效率之间实现了有利的权衡。这些结果强调了明确训练LLM进行有效推理的潜力。

游戏玩家可以训练数学推理模型吗?

研究通过结合强化学习与内存优化技术,在单张消费级游戏 GPU 上训练出具有竞争力的 1.5B 参数数学推理模型。

 推理 逻辑推理 强化学习 模型训练 系统优化

该研究探索了资源受限条件下训练数学推理模型的可行性。作者将强化学习与内存优化技术结合,在单张 RTX 3080 Ti 消费级 GPU 上完成了 1.5B 参数模型的训练。实验显示,该模型在数学推理基准上的表现可与参数规模大数倍的模型相当,部分结果甚至更优。这说明高性能数学推理研究未必依赖昂贵的高端硬件集群。

用途与启示
  • 为个人研究者和小型团队提供低成本训练数学推理模型的实践方案
  • 展示强化学习与内存优化在消费级硬件上的协同价值
  • 推动数学推理模型研究与开发基础设施的普及
📝 原始笔记(逐字保留)
2025-06-12 13:35:53 Thursday | Can A Gamer Train A Mathematical Reasoning Model? **标题** : 游戏玩家可以训练数学推理模型吗? **链接** :https://arxiv.org/abs/2506.08935 **作者** : Andrew Shin **摘要** :虽然大型语言模型(LLM)在包括数学推理在内的各种任务中取得了显着的性能,但它们的开发通常需要大量的计算资源。最近的进步降低了训练模型的成本,但即使是这些方法也依赖于高端硬件集群。在本文中,我们证明了一个单一的平均游戏GPU可以训练一个坚实的数学推理模型,通过集成强化学习和内存优化技术。具体来说,我们训练的1.5 B参数的数学推理模型的RTX 3080 Ti的16 GB内存,实现可比或更好的数学推理基准性能比模型几倍大,在资源受限的环境。我们的研究结果挑战了这样一种范式,即最先进的数学推理需要大规模的基础设施,使高性能人工智能研究的访问民主化。https://github.com/shinandrew/YouronMath.

大语言模型数学推理综述

该综述系统梳理大语言模型在数学推理领域的研究进展与发展方向。

 推理 逻辑推理 人工智能

《A Survey on Large Language Models for Mathematical Reasoning》是一篇聚焦大语言模型数学推理能力的综述。文章旨在梳理该领域的主要研究进展、方法体系与相关问题。原始文本未提供论文摘要、作者、实验结论及链接等详细信息。

用途与启示
  • 帮助研究者快速了解大语言模型数学推理领域的整体脉络
  • 为数学推理方法选型及后续研究提供参考
  • 可作为整理相关论文、数据集与评估方法的入口
📝 原始笔记(逐字保留)
2025-06-12 12:04:01 Thursday|A Survey on Large Language Models for Mathematical Reasoning

RuleReasoner:通过领域感知动态采样强化规则推理

RuleReasoner通过依据历史奖励动态调整各领域的训练采样权重,提升小型推理模型在规则推理任务上的跨任务、跨领域泛化能力与训练效率。

 推理 逻辑推理 强化学习 模型训练 人工智能

RuleReasoner面向规则格式、类型和复杂度差异带来的泛化挑战,探索小型推理模型能否通过强化学习掌握稳健的规则推理能力。其核心是领域感知动态采样:根据历史奖励持续更新不同领域的采样权重,并为每个训练批次重新采样。该机制支持领域增强和灵活的在线训练调度,无需人工预先设计混合训练配方。实验中,该方法在8个分布内任务和3个分布外任务上分别取得平均4.1%和10.4%的提升,并展现出较高的计算效率。

用途与启示
  • 为多领域规则推理训练提供可自适应调整的数据采样策略。
  • 减少人工设计多任务数据混合比例与训练课程的成本。
  • 说明小型推理模型结合强化学习后,也可能获得较强的分布外泛化能力。
  • 可用于逻辑推理、结构化规则执行及跨领域推理系统的训练优化。
📝 原始笔记(逐字保留)
2025-06-12 13:36:22 Thursday | RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling **标题** : RuleReasoner:通过领域感知动态采样的强化基于规则的推理 **链接** :https://arxiv.org/abs/2506.08672 **作者** : Yang Liu, Jiaqi Li, Zilong Zheng **备注** :22 pages, 10 figures, 8 tables **摘要** :基于规则的推理已被公认为是推理的基本问题之一,而规则格式,类型和复杂性的偏差在现实世界中的应用提出了严峻的挑战。最近的研究表明,大型推理模型(LRM)具有显着的推理能力,其性能大大提高了强化学习(RL)。然而,它仍然是一个悬而未决的问题,小推理模型(SRM)是否可以学习基于规则的推理有效地跨不同的任务和领域的鲁棒泛化。为了解决这个问题,我们引入了增强的基于规则的推理,又名。RuleReasoner是一种简单而有效的方法, **通过广泛的策划任务和一种新颖的领域感知动态采样方法进行基于规则的推理** 。具体来说,RuleReasoner通过基于历史奖励更新不同域的采样权重来重新采样每个训练批次。这有利于强化学习的领域增强和灵活的在线学习时间表,避免了现有方法中使用的预先人类工程混合训练配方的需要。对分布内(ID)和分布外(OOD)基准的实证评估显示,RuleReasoner的性能明显优于前沿LRM(8个ID任务的平均分为$\Delta$4.1%,3个OOD任务的平均分为$\Delta$10.4%,超过OpenAI-o 1)。值得注意的是,我们的方法也表现出更高的计算效率相比,以前的动态采样方法RL。 ### 空间推理

Router-R1:通过强化学习实现多轮大模型路由与聚合

Router-R1将多模型路由与结果聚合建模为序列决策过程,通过强化学习让路由器在多轮推理中动态调用不同LLM,并兼顾任务性能与调用成本。

 推理 强化学习 智能体 人工智能框架 系统优化

Router-R1突破了传统LLM路由器单轮、一对一分配查询的限制,将多模型路由与响应聚合统一建模为序列决策过程。该框架以具备推理能力的LLM作为路由器,交替执行内部“思考”和动态“路由”动作,并把各模型的响应持续整合进上下文。训练采用格式奖励、最终结果奖励和成本奖励,在回答质量、调用价格与延迟之间进行权衡。七个通用及多跳问答基准的实验显示,该方法优于多种强基线,并能依据定价、延迟和示例表现等描述泛化到未见过的模型。

用途与启示
  • 为复杂任务提供多轮、多模型协同路由方案,充分利用不同LLM的互补能力。
  • 展示如何通过强化学习联合优化推理质量、调用成本与服务延迟。
  • 可用于构建能够动态选择模型、聚合答案并适配新模型的智能体系统。
📝 原始笔记(逐字保留)
2025-06-12 11:53:24 Thursday | Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning **标题** : Router-R1:通过强化学习教授LLM多轮路由和聚合 **链接** :https://arxiv.org/abs/2506.09033 **作者** : Haozhen Zhang, Tao Feng, Jiaxuan You **备注** :Code is available at this https URL **摘要** :各种大型语言模型(LLM)的迅速出现,刺激了LLM路由器的发展,它将用户查询分配给最合适的模型。然而,现有的LLM路由器通常执行单轮的一对一映射(\textit{即},将每个查询单独分配给单个模型),这限制了它们处理需要多个LLM互补优势的复杂任务的能力。在本文中,我们提出了\textbf{Router-R1},一个基于强化学习(RL)的框架, **将多LLM路由和聚合制定为顺序决策过程** 。Router-R1将路由器本身实例化为一个有能力的LLM,利用其推理能力将“思考”动作(内部审议)与“路由”动作(动态模型调用)交织在一起,并将每个响应集成到其不断发展的上下文中。为了指导学习,我们采用了一种轻量级的基于规则的奖励,包括格式奖励,最终结果奖励,以及一种用于性能和成本权衡优化的新型成本奖励,通过RL打开了一条优化性能-成本权衡的途径。Router-R1还仅以简单的模型描述符(如定价、延迟和示例性能)为条件,从而能够对看不见的模型选择进行强大的泛化。在七个通用和多跳QA基准测试上的实验表明,Router-R1的性能优于几个强基线,在保持稳健的泛化和成本管理的同时实现了卓越的性能。代码可在https://github.com/ulab-uiuc/Router-R1上获得。

e3:学习探索实现大模型测试时计算外推

e3通过训练大模型在上下文中执行生成、验证与细化等探索操作,使其在超过训练令牌预算时仍能通过增加测试时计算提升推理性能。

 推理 强化学习 模型训练 人工智能

测试时计算扩展的关键目标,是让模型在困难问题上通过延长思考获得持续的性能提升,但研究发现多数现有推理模型缺乏这种外推能力。e3将生成、验证、细化以及多假设测试等操作串联起来,训练模型在上下文中主动探索。其方法利用基础模型不同技能之间的不对称性、错误轨迹产生的负梯度,以及任务难度与训练令牌预算协同增长的课程设计。e3-1.7B在AIME 2025和HMMT 2025上取得同规模领先表现,并可外推至训练令牌预算的两倍,同时改善pass@1与pass@k。

用途与启示
  • 为构建能够有效利用更长推理预算的模型提供训练方案。
  • 表明单纯增加测试时令牌并不足够,模型还需要学习如何分配计算并开展上下文搜索。
  • 错误轨迹和技能不对称性可作为强化学习中促进探索的重要信号。
  • 可用于提升数学推理等高难度任务中的测试时计算扩展能力。
📝 原始笔记(逐字保留)
2. 2025-06-12 11:54:02 Thursday | e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs **标题** : e3:学习探索实现LLM测试时计算的外推 **链接** :https://arxiv.org/abs/2506.09026 **作者** : Amrith Setlur, Matthew Y. R. Yang, Charlie Snell, Jeremy Greer, Ian Wu, Virginia Smith, Max Simchowitz, Aviral Kumar **摘要** :**测试时缩放**提供了一种有希望的途径,通过在推理时利用更多的计算来改进LLM推理;然而,这种范式的真正希望在于外推(即,在困难问题上的性能改进,因为LLM保持“思考”更长时间,超出了他们接受培训的最大令牌预算)。令人惊讶的是, **我们发现大多数现有的推理模型不能很好地外推。我们表明,实现外推的一种方法是通过训练LLM来执行上下文内探索** :训练LLM通过链接操作(例如**生成,验证,细化**等)有效地花费其测试时间预算,或者在得出答案之前测试多个假设。为了 **实现在上下文中的探索** ,我们确定了三个关键成分作为我们的食谱e3的一部分:(1)链接技能,基础LLM具有不对称的能力,例如,链接验证(容易)与生成(困难),作为实现上下文搜索的一种方式;(2)利用来自不正确轨迹的“负”梯度来放大RL期间的探索,导致链接额外不对称的更长搜索轨迹;以及(3)通过专门设计的课程在训练期间将任务难度与训练令牌预算相结合,以构建上下文探索。我们的配方e3根据AIME'25和HMMT'25评分生成最知名的1.7B模型,并外推至训练令牌预算的2倍。我们的e3-1.7B模型不仅获得了很高的pass@1分数,而且在基础模型上提高了pass@k。 ### TTC 测试时响应/计算

MEMETRON:大型语言模型测试时响应优化的元启发式机制

MEMETRON将大模型解码建模为离散黑盒优化问题,通过混合元启发式搜索在无需重训练或梯度访问的情况下生成高奖励响应。

 推理 系统优化 人工智能框架

MEMETRON是一个任务无关的测试时响应优化框架,旨在突破贪婪搜索、采样和重排序等常规解码策略的局限。它将LLM解码表述为离散黑盒优化问题,并采用GENETRON与ANNETRON两种混合元启发式算法搜索响应空间。搜索过程由奖励模型以及LLM自身执行的上下文操作引导,无需重新训练模型或访问梯度。实验显示,该框架在人类偏好对齐任务上显著优于标准解码与重排序方法。

用途与启示
  • 为LLM提供可直接部署的测试时优化方案,在不修改模型参数的情况下提升响应质量。
  • 将任务目标显式编码为奖励函数,使解码过程能够针对特定目标进行搜索。
  • 模块化设计只依赖奖励函数和轻量提示模板,便于迁移到不同任务与模型。
  • 展示了元启发式算法在推理解码和模型对齐中的应用潜力。
📝 原始笔记(逐字保留)
3. 2025-06-12 12:02:45 Thursday | MEMETRON: Metaheuristic Mechanisms for Test-time Response Optimization of Large Language Models **标题** : MEMEMETRON:大型语言模型测试时响应优化的元启发式机制 **链接** :https://arxiv.org/abs/2506.08643 **作者** : Son The Nguyen, Theja Tulabandhula **摘要** :大型语言模型(LLM)越来越多地用于开放式和结构化任务,但它们的推理时间行为在很大程度上仍然取决于启发式解码策略,如贪婪搜索,采样或重新排序。这些方法提供了有限的控制,并且没有明确地针对特定任务目标进行优化。我们介绍MEMEETRON,一个任务不可知的框架,制定LLM解码作为一个离散的黑盒优化问题。MEMETRON利用混合元启发式算法GENETRON和ANNETRON,在奖励模型和LLM本身执行的上下文操作的指导下搜索响应空间。这种方法可以有效地发现高回报响应,而无需模型重新训练或梯度访问。该框架是模块化的,并在不同的任务中进行推广,只需要一个奖励函数和轻量级的提示模板。我们评估了我们的框架上的关键人类偏好对齐任务,并证明它显着优于标准的解码和重新排序方法,突出了其潜力,以提高对齐模型再训练。

NoWait:移除“等待”等思考标记可提升推理效率

NoWait通过抑制“Wait”“Hmm”等显式自我反思标记,在不损害模型实用性的情况下将思维链长度缩短27%至51%。

 推理 多模态 系统优化

大型推理模型在执行复杂的逐步推理时,常产生冗长、重复的“过度思考”内容。研究者提出NoWait,在推理过程中抑制“Wait”“Hmm”等自我反思标记,以减少不必要的思维链。该方法在文本、视觉和视频推理的10个基准及5个R1风格模型系列上进行了验证。实验显示,NoWait可将推理轨迹缩短27%至51%,同时基本不影响模型的任务实用性。

用途与启示
  • 为大模型提供即插即用的推理加速方案,减少输出延迟与计算成本
  • 说明显式自我反思标记并非高级推理所必需,可作为推理冗余的优化切入点
  • 可用于提升文本、视觉和视频等多模态推理系统的部署效率
📝 原始笔记(逐字保留)
2. 2025-06-12 13:37:29 Thursday | Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency **链接** :https://arxiv.org/abs/2506.08343 **作者** : Chenlong Wang, Yuanning Feng, Dongping Chen, Zhaoyang Chu, Ranjay Krishna, Tianyi Zhou **摘要** :大型推理模型的最新进展已经实现了复杂的逐步推理,但通常会引入大量的过度思考,导致冗长和冗余的输出,从而阻碍效率。在这项研究中,我们研究是否明确的自我反思,标志着令牌,如“等待”和“嗯”,是必要的高级推理。我们提出了NoWait,一个简单而有效的方法, **通过在推理过程中抑制这些标记来禁用显式的自我反射** 。在文本、视觉和视频推理任务的10个基准上进行的广泛实验表明,NoWait在5个R1风格的模型系列中将思维链轨迹长度减少了27%-51%,而不影响模型实用性。NoWait因此提供了一个即插即用的解决方案,用于高效和实用的多模态推理。

SwS:LLM 推理强化学习中的自我感知弱点驱动问题合成

SwS 通过持续识别模型在强化学习中的推理弱点并针对性合成新问题,显著提升不同规模 LLM 在主流推理基准上的泛化性能。

 数据合成 强化学习 推理 模型训练 自进化

可验证奖励强化学习依赖具有精确答案的高质量问题,但现有合成数据往往缺少可靠验证,且未充分考虑模型自身能力。SwS 将模型在强化学习迭代采样中始终无法掌握的问题定义为弱点,并从失败案例中提取核心概念。框架围绕这些概念定向合成新问题,用于后续增强训练,使模型逐步弥补薄弱环节。该方法无需外部知识蒸馏,在 8 个主流推理基准上将 7B 和 32B 模型的平均性能分别提升 10.0% 和 7.7%。

用途与启示
  • 根据模型真实失败案例定向生成训练题目,提高合成数据的有效性与采样效率。
  • 构建“识别弱点—合成问题—强化训练”的自我改进闭环。
  • 为缺少人工标注和外部蒸馏数据的 RLVR 训练提供可扩展的数据合成方案。
📝 原始笔记(逐字保留)
5. 🌈 2025-06-12 11:55:58 Thursday | SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning **标题** : SwS:LLM推理强化学习中的自我感知弱点驱动问题合成 **链接** :https://arxiv.org/abs/2506.08989 **作者** : Xiao Liang, Zhong-Zhi Li, Yeyun Gong, Yang Wang, Hengyuan Zhang, Yelong Shen, Ying Nian Wu, Weizhu Chen **备注** :Reinforcement Learning; Large Language Models; LLM Reasoning **摘要** :具有 **可验证奖励的强化学习(RLVR)** 已被证明可以有效地训练大型语言模型(LLM)进行复杂的推理任务,例如数学问题解决。RLVR可扩展性的先决条件是具有**精确和可验证答案**的高质量问题集。然而,在现有的面向蒸馏的合成数据集中,缺乏精心制作的人工标记的数学问题和有限的验证答案,限制了它们在RL中的有效性。此外,大多数问题合成策略不加选择地扩展问题集,而不考虑模型的能力,导致生成有用问题的效率低下。为了缓解这个问题,我们引入了一个自我意识的弱点驱动的问题合成框架(SwS),该框架系统地识别模型缺陷并利用它们来增强问题。具体来说,我们将弱点定义为模型在RL训练期间通过迭代采样始终无法学习的问题。然后,我们从这些失败案例中提取核心概念,并合成新的问题,以加强模型在后续增强训练中的薄弱环节,使其能够专注于并逐步克服其弱点。在不依赖外部知识蒸馏的情况下,我们的框架通过使模型能够自我识别并解决其在RL中的弱点来实现鲁棒的泛化,在8个主流推理基准中,7B和32B模型的平均性能分别提高了10.0%和7.7%。

自动生成用于阅读理解评估的推理问题

研究利用GPT-4o合成诊断性阅读理解推理题,生成题目中93.8%达到高质量标准,但仅42.6%准确匹配指定推理类型。

 数据合成 模型评估 人工智能应用 推理

论文提出阅读理解推理类型分类体系,并分析其在诊断性阅读理解题库中的分布。研究通过少样本提示让GPT-4o根据给定文章生成桥接推理题,同时比较使用与不使用思维链提示的效果。生成题目从整体质量、推理类型适配度和大模型推理表现三个方面进行评估,评分者间一致性超过0.90。结果显示,93.8%的问题质量较高并适用于3—12年级,但只有42.6%准确符合目标推理类型,说明自动生成仍需结合人工审核。

用途与启示
  • 支持规模化构建面向学龄学生的诊断性阅读理解评估题库
  • 表明大模型能够生成高质量推理题,但对细粒度推理类型的控制能力仍然有限
  • 可采用“模型生成+人工审核”的流程,在提升题库生产效率的同时保证教学适用性
  • 推理类型匹配率可作为教育题目合成系统的重要评估指标
📝 原始笔记(逐字保留)
6. 2025-06-12 13:02:36 Thursday | Automatic Generation of Inference Making Questions for Reading Comprehension Assessments **标题** : 自动生成用于阅读理解评估的推理问题 **链接** :https://arxiv.org/abs/2506.08260 **作者** : Wanjing Anya Ma, Michael Flor, Zuowei Wang **备注** :Accepted to the 20th Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2025), co-located with the ACL 2025 **摘要** :推理是阅读理解中一项重要而复杂的技能。有些推理需要解决跨句子的引用,有些则依赖于使用先验知识来填充文本中没有明确写入的细节。**诊断性RC**问题可以帮助教育工作者为学龄学生提供更有效和有针对性的阅读教学和干预。我们介绍了一个分类的推理类型RC和使用它来分析项目的分布在诊断RC项目银行。接下来,我们提出的实验,使用GPT-4 o生成桥接推理RC项目通过Few-Shot提示给定的阅读段落,比较条件和不链的思想提示。生成的项目进行了评估的三个方面:整体项目质量,适当的推理类型,和LLM推理,达到较高的评分员之间的协议0.90以上。我们的研究结果表明,GPT-4 o产生了93.8%的高质量的问题,适合在3-12年级的情况下操作使用,但是,只有42.6%的生成的问题准确匹配的目标推理类型。我们的结论是,自动项目生成与人类的判断相结合,提供了一个有前途的路径可扩展的,高质量的诊断RC评估。

SWE-Flow:以测试驱动方式合成软件工程数据

SWE-Flow 从真实项目的单元测试中推断增量开发流程,自动合成可验证的软件工程训练任务,并构建了包含逾1.8万个实例的评测基准。

 数据合成 SWE 软件工程 人工智能辅助编程 人工智能框架 模型训练 模型评估

SWE-Flow 是一个基于测试驱动开发(TDD)的软件工程数据合成框架,已被 ICML 2025 接收。它不依赖人工提交的问题描述,而是从封装高级需求的单元测试中自动推断增量开发步骤,并利用依赖图(RDG)捕获功能交互、生成结构化开发计划。框架会在每个步骤中生成部分代码库、对应测试与必要的代码修改,从而形成可完整验证的 TDD 任务。研究团队基于真实 GitHub 项目合成了 16,061 个训练实例和 2,020 个测试实例,并构建 SWE-Flow-Eval 基准;实验显示,这些数据可显著提升开放模型的 TDD 编码能力。

用途与启示
  • 将现有单元测试转化为结构化、可验证的软件工程训练数据,降低对人工问题描述和开发提交记录的依赖。
  • 为代码模型提供增量开发、测试通过与代码修改相结合的监督信号。
  • 通过 SWE-Flow-Eval 统一评估模型在测试驱动编码任务中的表现。
  • 依赖图驱动的数据合成思路可扩展至代码修复、仓库级开发和软件工程智能体训练。
📝 原始笔记(逐字保留)
7. 2025-06-12 13:38:21 Thursday | SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner **标题** : SWE-Flow:以测试驱动方式合成软件工程数据 **链接** :https://arxiv.org/abs/2506.09003 **作者** : Lei Zhang, Jiaxi Yang, Min Yang, Jian Yang, Mouxiang Chen, Jiajun Zhang, Zeyu Cui, Binyuan Hui, Junyang Lin **备注** :Accepted by ICML2025 **摘要** :我们介绍 **SWE-Flow**,一个基于测试驱动开发(TDD)的新型数据合成框架。与现有的软件工程数据依赖于人类提交的问题不同,**SWE-Flow** 直接从单元测试自动推断增量开发步骤,这些单元测试本质上封装了高级需求。**SWE-Flow** 的核心是构建一个RDG(Dependency Graph),它可以精确地捕获功能交互,从而生成一个结构化的、逐步的 * 开发计划 *。在每一步中,**SWE-Flow** 都会生成部分代码库、相应的单元测试和必要的代码修改,从而产生完全可验证的TDD任务。通过这种方法,我们从真实世界的GitHub项目中生成了16,061个训练实例和2,020个测试实例,创建了 SWE-Flow-Eval 基准。我们的实验表明,在这个数据集上微调开放模型可以显着提高基于TDD的编码性能。为了便于进一步研究,我们在[Github](https://github.com/Hambaobao/SWE-Flow)上发布了所有代码、数据集、模型和Docker镜像。

DeepMath-103K:用 10.3 万道高难数学题突破大模型推理瓶颈

DeepMath-103K 提供约 10.3 万道高难度、严格去污染且答案可验证的数学题,用于强化学习训练高级数学推理模型。

 数据合成 数据工程 推理 强化学习 模型训练

DeepMath-103K 是一个面向大模型数学推理训练的大规模数据集,共包含约 103,022 个数学问题。它重点解决现有数学数据难度不足、新颖性有限、答案难以验证以及与评测基准发生污染等问题。数据集强调高难度、严格去污染和答案可验证,适合用于强化学习训练高级推理模型。项目同时开放了论文、数据集、模型集合与代码,便于复现实验及绘图分析。

用途与启示
  • 为数学推理模型的强化学习训练提供大规模、高难度数据
  • 通过去污染设计降低训练数据与评测基准重叠造成的虚高结果
  • 利用可验证答案构造稳定、自动化的奖励信号
  • 可作为数学数据合成、筛选及难度分层流程的实验参考
📝 原始笔记(逐字保留)
2. 🌈 🌈🌈 (实验和绘图可以参考)2025-06-12 10:55:00 Thursday | 103K「硬核」题,让大模型突破数学推理瓶颈https://mp.weixin.qq.com/s/EkVeW5pLRM8_T6hrrs7lsA 在 AGI 的浩瀚征途中,数学推理能力始终是衡量其智能水平的关键试金石。然而,当前大语言模型(LLM)在数学推理,特别是通过强化学习(RL)进行训练时,正面临着前所未有的数据瓶颈:现有数据集普遍缺乏挑战性和新颖性、答案难以验证,且常与评估基准存在 “污染” 问题。 为了解决以上问题,DeepMath-103K 数据集横空出世,它以其大规模、高难度、严格去污染和可验证答案的特性,为 AI 数学推理领域带来进一步突破。 * 论文题目:DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning * 论文地址:https://arxiv.org/pdf/2504.11456 * 数据地址:https://hf.co/datasets/zwhe99/DeepMath-103K * 模型地址:https://hf.co/collections/zwhe99/deepmath-6816e139b7f467f21a459a9a * 代码地址:https://github.com/zwhe99/DeepMath 为了打破这些桎梏,DeepMath-103K 应运而生。它是一个包含约 **103,022 个数学问题**的全新大规模数据集,专为通过强化学习训练高级推理模型而设计。

AutoSDT:面向开放科学智能体的数据驱动发现任务合成管道

AutoSDT通过自动检索真实科学工作流并合成任务指令与代码解答,构建了覆盖多学科的高质量数据驱动科学发现数据集AutoSDT-5K。

 数据合成 数据工程 人工智能辅助编程 智能体 模型训练

AutoSDT是一个用于自动收集数据驱动科学发现编码任务的管道,利用大语言模型搜索不同来源、筛选生态有效的任务,并合成任务指令与代码解答。基于该管道构建的AutoSDT-5K包含5,404个任务,覆盖4个科学学科和756个Python包。专家评估显示,93%的任务具有生态有效性,92.2%的合成程序在功能上正确。在该数据集上训练的AutoSDT-Coder显著改善了ScienceAgentBench与DiscoveryBench表现,其中32B模型在ScienceAgentBench上达到与GPT-4o相当的7.8%成功率。

用途与启示
  • 为科学智能体提供可规模化生成的高质量编码训练数据
  • 展示从真实软件生态中筛选任务并合成可靠解答的数据构建范式
  • 帮助开放权重代码模型缩小与闭源模型在科学发现任务上的能力差距
  • 可用于研究科学任务生成、代码正确性验证与数据驱动发现智能体
📝 原始笔记(逐字保留)
20250917 # 数据发现 🌈🌈🌈 2025-06-12 13:42:17 Thursday | AutoSDT: Scaling Data-Driven Discovery Tasks Toward Open Co-Scientists **标题** : AutoSDT:将数据驱动的发现任务扩展到开放的合作科学家 **链接** :https://arxiv.org/abs/2506.08140 **作者** : Yifei Li, Hanane Nour Moussa, Ziru Chen, Shijie Chen, Botao Yu, Mingyi Xue, Benjamin Burns, Tzu-Yao Chiu, Vishal Dey, Zitong Lu, Chen Wei, Qianheng Zhang, Tianyu Zhang, Song Gao, Xuhui Huang, Xia Ning, Nesreen K. Ahmed, Ali Payani, Huan Sun **摘要** :尽管长期以来一直在努力加速人工智能的科学发现,但由于用于培训和评估的高质量数据有限,建立人工智能合作科学家仍然具有挑战性。为了解决这个数据稀缺的问题,我们提出了AutoSDT,这是一个自动管道,可以在现实世界的数据驱动的发现工作流中收集高质量的编码任务。 **AutoSDT利用LLM的编码功能和参数知识来搜索不同的源,选择生态上有效的任务,并合成准确的任务指令和代码解决方案。** 使用我们的管道,我们构建了AutoSDT-5 K,这是一个包含5,404个编码任务的数据集,用于数据驱动的发现,涵盖了四个科学学科和756个独特的Python包。据我们所知,AutoSDT-5 K是唯一一个自动收集的数据驱动科学发现的最大开放数据集。对256个任务子集的专家反馈显示了AutoSDT的有效性:93%的收集任务在生态上是有效的,92.2%的合成程序在功能上是正确的。在AutoSDT-5 K上训练的Qwen2.5-Coder-Instruct LLM系列,被称为AutoSDT-Coder,在两个具有挑战性的数据驱动的发现基准ScienceAgentBench和DiscoveryBench上显示出实质性的改进。最值得注意的是,AutoSDT-Coder-32 B在ScienceAgentBench上达到了与GPT-4 o相同的性能水平,成功率为7.8%,是其基础模型性能的两倍。在DiscoveryBench上,它将假设匹配分数提高到8.1,带来了17.4%的相对改善,缩小了开放权重模型和GPT-4 o之间的差距。

豆包大模型 1.6 发布

豆包大模型 1.6 于 2025 年 6 月 12 日正式发布。

 模型开发 人工智能

豆包大模型 1.6 于 2025 年 6 月 12 日发布。该版本是豆包大模型系列的一次更新。原始文本未提供具体能力、评测结果及获取方式。

用途与启示
  • 关注豆包大模型系列的版本演进
  • 后续可结合官方资料评估其能力提升与适用场景
📝 原始笔记(逐字保留)
15. 2025-06-12 10:53:36 Thursday | 豆包大模型1.6发布

Meta 发布世界模型 IntPhys 2

Meta 发布世界模型 IntPhys 2,进一步探索对物理世界的理解与建模。

 人工智能 模型开发

Meta 发布了世界模型 IntPhys 2。该模型聚焦物理世界的理解与建模,旨在提升 AI 对现实环境及其变化规律的认知能力。相关消息于 2025 年 6 月 12 日通过微信公众号发布,具体技术细节可参阅原文。

用途与启示
  • 关注世界模型在物理规律理解和环境预测方面的进展
  • 为具身智能、机器人及交互式智能体研究提供参考
  • 跟踪 Meta 在通用世界建模方向上的技术布局
📝 原始笔记(逐字保留)
8. 2025-06-12 10:53:21 Thursday | meta发布世界模型intphys2 https://mp.weixin.qq.com/s/i2lMeFX6VWWxqL_ZKmznfw

Mistral AI 发布推理模型系列 Magistral

Mistral AI 发布全新大语言模型系列 Magistral,主打持续反思与复杂任务推理能力。

 人工智能 模型开发 推理

欧洲人工智能公司 Mistral AI 发布了全新的大语言模型系列 Magistral。该系列重点强化推理能力,可在处理任务时持续反思并调整推理过程。Magistral 面向更复杂的问题求解场景,体现了 Mistral AI 在推理模型方向上的进一步布局。

用途与启示
  • 为复杂任务求解、逻辑推理和多步骤决策提供新的模型选择。
  • 持续反思机制可为提升模型推理可靠性提供参考。
  • 展现欧洲 AI 厂商在推理模型领域的最新进展。
📝 原始笔记(逐字保留)
9. 2025-06-12 10:53:25 Thursday | 欧洲人工智能公司 Mistral AI 发布了 Magistral,这是一个全新的大语言模型(LLM)系列,展现了强大的推理能力。它能够进行不断反思,并解决更复杂的任务。https://mp.weixin.qq.com/s/Go5dXv4DA3hy5lGhxxE8SA # 观点

测量数据科学自动化:AI 助手与智能体评估工具综述

该综述系统梳理了数据科学领域中 LLM 助手与智能体的评估工具,并指出现有评估在任务覆盖、人机协作和自动化模式方面的不足。

 智能体 模型评估 数据工程 人工智能应用 人工智能

论文综述了用于评估数据科学 LLM 助手和智能体的现有工具。当前评估主要集中于少数目标导向任务,较少覆盖数据管理与探索等关键活动。相关工作往往只考察纯辅助或完全自主两种模式,忽略介于二者之间的人机协作层级。此外,现有评估强调以智能体替代人类,尚未充分研究通过任务重构实现更高程度自动化的可能性。

用途与启示
  • 为构建数据科学智能体评测基准提供任务分类与工具参考
  • 提醒研究者扩大评估范围,纳入数据管理、探索和结果解释等环节
  • 推动对不同人机协作层级及任务重构型自动化的系统评估
📝 原始笔记(逐字保留)
2025-06-12 13:40:20 Thursday | Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents **标题** : 测量数据科学自动化:AI助手和代理评估工具的调查 **链接** :https://arxiv.org/abs/2506.08800 **作者** : Irene Testini, José Hernández-Orallo, Lorenzo Pacchiardi **摘要** :数据科学旨在从数据中提取见解,以支持决策过程。最近,大型语言模型(LLM)越来越多地被用作数据科学的助手,通过提出想法,技术和小代码片段,或用于解释结果和报告。一些数据科学活动的适当自动化现在有望通过LLM代理的兴起,即,由LLM提供支持的AI系统配备了额外的功能-例如代码执行和知识库-可以执行自我导向的操作并与数字环境交互。在本文中,我们调查的LLM助理和数据科学代理的评价。我们发现:(1)主要关注一小部分目标导向的活动,在很大程度上忽略了数据管理和探索活动;(2)专注于纯协助或完全自主的代理,而不考虑中间水平的人类-人工智能协作;(3)强调人类替代,因此忽略了由于任务转换而实现更高水平自动化的可能性。

通过多智能体反思增强大语言模型推理

论文提出DPSDP强化学习算法,将多轮答案细化建模为马尔可夫决策过程,通过演员—评论家多智能体协作和自生成数据提升大模型推理能力。

 智能体 强化学习 推理 自进化 模型训练

该研究将大语言模型的多轮答案验证与改进过程建模为马尔可夫决策过程,并提出通过动态规划进行直接策略搜索的DPSDP算法。DPSDP利用自生成数据开展直接偏好学习,联合训练演员与评论家智能体,使其能够迭代生成反馈并细化答案。理论分析表明,该方法可以匹配训练分布内任意策略的性能,并在分布内及分布外基准上取得提升。在MATH 500上,经过五轮细化和多数投票,基于Ministral的模型准确率由58.2%提升至63.2%,消融实验也验证了多智能体协作与分布泛化的作用。

用途与启示
  • 为利用测试时计算扩展大模型推理能力提供可训练的多智能体方案
  • 将答案生成、批评和修正统一到强化学习与动态规划框架中
  • 展示自生成偏好数据可用于协同训练演员—评论家智能体
  • 为提升数学推理及分布外泛化能力提供实践参考
📝 原始笔记(逐字保留)
1. 2025-06-12 12:06:22 Thursday| 通过多智能体反射加强LLM推理 **链接** :https://arxiv.org/abs/2506.08379 **作者** : Yurun Yuan, Tengyang Xie **备注** :International Conference on Machine Learning (ICML), 2025 **摘要** :利用更多的测试时计算已被证明是提高大型语言模型(LLM)推理能力的有效方法。在各种方法中,验证和改进范式脱颖而出,使动态的解决方案探索和反馈纳入。然而,现有的方法往往受到有限的反馈空间和缺乏协调的培训不同的当事人,导致次优性能。为了解决这个问题,我们将这个 **多轮细化过程建模为马尔可夫决策过程** ,并引入 **DPSDP(通过动态规划进行直接策略搜索)** ,这是一种强化学习算法,可以训练演员-评论家LLM系统通过对自我生成的数据进行直接偏好学习来迭代地细化答案。理论上,DPSDP可以匹配训练分布内的任何策略的性能。从经验上讲,我们实例化DPSDP与各种基础模型,并显示在分发和分发基准的改进。例如,在基准MATH 500上,五个细化步骤的多数投票将基于Ministral的模型的第一轮准确率从58.2%提高到63.2%。消融研究进一步证实了多智能体协作和分布泛化的好处。

从辩论到均衡:基于贝叶斯纳什均衡的信念驱动多智能体 LLM 推理

ICML 2025 论文提出多智能体协调框架 ECON,通过求解贝叶斯纳什均衡减少智能体间通信成本,并在六项推理与规划基准上平均超越现有多 LLM 方法 11.2%。

 智能体 博弈论 推理 任务规划 人工智能框架

该研究将多 LLM 协调重新建模为不完全信息博弈,要求每个智能体依据对其他智能体策略的概率信念做出最佳响应。作者提出高效纳什均衡协调框架 ECON,以分布式独立推理和集中式答案整合替代高成本的智能体间反复交换。理论分析表明,ECON 相比非均衡多智能体方案具有更严格的遗憾界。实验中,ECON 在六个复杂推理与规划基准上平均提升 11.2%,并能灵活集成不同模型,展现出良好的可扩展性。

用途与启示
  • 为多智能体 LLM 协作提供具有博弈论基础和收敛目标的设计思路。
  • 减少智能体间频繁通信带来的推理成本,适合构建高效的多模型集成系统。
  • 可用于复杂推理、任务规划及异构模型协作,并为扩大智能体规模提供参考。
📝 原始笔记(逐字保留)
2. 2025-06-12 12:08:32 Thursday| From Debate to Equilibrium: Belief-Driven Multi-Agent LLM Reasoning via Bayesian Nash Equilibrium **标题** : 从辩论到均衡:通过Bayesian Nash均衡进行信念驱动的多智能体LLM推理 **链接** :https://arxiv.org/abs/2506.08292 **作者** : Xie Yi, Zhanke Zhou, Chentao Cao, Qiyu Niu, Tongliang Liu, Bo Han **备注** :Accepted by ICML 2025 **摘要** :多智能体框架可以大大提高大型语言模型(LLM)的推理能力,但它们通常会产生沉重的计算成本,并且缺乏收敛保证。为了克服这些挑战,我们重铸多LLM协调作为一个不完全信息博弈,并寻求贝叶斯纳什均衡(BNE),其中每个代理最佳地响应其概率信念的其他策略。我们通过 **纳什均衡(ECON)** 引入了高效协调,这是一种分层的学习范式,将分布式推理与集中式最终输出结合在一起。在ECON下,每个LLM独立地选择最大化其预期奖励的响应,条件是其对合作代理的信念,而不需要昂贵的代理间交换。我们从数学上证明了ECON比非平衡多智能体方案获得了更严格的后悔界。从经验上看,ECON在跨越复杂推理和规划任务的六个基准测试中平均比现有的多LLM方法高出11.2%。进一步的实验证明了ECON能够灵活地整合其他模型,证实了其可扩展性,并为更大,更强大的多LLM集成铺平了道路。该代码可在https://github.com/tmlr-group/ECON上公开获取。

自适应语言模型(SEAL)

SEAL让语言模型自主生成训练数据与更新指令,并通过强化学习学习如何有效地自我更新。

 自进化 模型训练 强化学习 数据合成 模型开发

论文提出自适应语言模型框架 SEAL,使模型能够针对新知识或新任务生成称为“自我编辑”的训练内容。自我编辑可以包含合成数据、重写后的信息以及优化配置,并被用于模型的后训练更新。研究通过下游任务表现提供强化学习奖励,让模型逐步学会生成更有效的自我更新方案。实验覆盖知识融入与少样本任务适应,同时也揭示了持续更新中的灾难性遗忘问题。

用途与启示
  • 为无需人工设计数据流水线的模型持续学习提供新路径
  • 可用于知识注入、少样本适应和个性化模型更新
  • 表明自我生成数据与强化学习可共同驱动模型能力演化
  • 实际应用仍需解决灾难性遗忘、更新稳定性和算力成本问题
📝 原始笔记(逐字保留)
1. Self-Adapting Language Models 1. https://arxiv.org/abs/2506.10943 2. https://jyopari.github.io/posts/seal

EconWebArena:现实 Web 环境中的经济任务自治智能体评测基准

EconWebArena 通过360项真实经济网络任务,系统评估自治智能体在权威数据检索、多步交互、视觉理解与经济推理方面的能力。

 模型评估 智能体 多模态 推理 数据工程

EconWebArena 是一个面向真实网络环境中复杂多模态经济任务的自治智能体评测基准,包含来自82个权威网站的360项人工策划任务。任务覆盖宏观经济、劳动力、金融、贸易和公共政策,要求智能体浏览实时网站、理解结构化及视觉内容,并通过多步交互提取准确且具有时效性的数据。基准先由多个大语言模型生成候选任务,再经严格人工筛选,以保障任务清晰度、可行性和数据源可靠性。对多种先进多模态模型的实验显示,现有智能体在视觉定位、网页导航、多模态理解和规划推理方面仍存在显著性能缺口。

用途与启示
  • 为经济领域网页智能体提供贴近真实应用的统一评测平台。
  • 支持分析视觉定位、规划推理和交互设计对智能体表现的影响。
  • 揭示智能体在权威数据检索、动态网页导航及时间敏感信息提取方面的薄弱环节。
  • 可用于指导经济研究、金融分析和公共政策数据智能体的研发与优化。
📝 原始笔记(逐字保留)
3. 2025-06-12 13:43:03 Thursday | EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments **标题** : EcoWebArena:现实Web环境中对自治代理进行经济任务的基准测试 **链接** :https://arxiv.org/abs/2506.08136 **作者** : Zefang Liu, Yinzhu Quan **摘要** :我们介绍EconWebArena,在现实的网络环境中评估复杂的,多模态的经济任务的自主代理的基准。该基准包含来自82个权威网站的360个策划任务,涵盖宏观经济,劳动力,金融,贸易和公共政策等领域。每项任务都要求智能体浏览实时网站,解释结构化和视觉内容,与真实界面交互,并通过多步工作流程提取精确的时间敏感数据。我们通过 **促使多个大型语言模型(LLM)生成候选任务来构建基准,然后进行严格的人工策展,以确保清晰度,可行性和源代码可靠性** 。与以前的工作不同,EconWebArena强调对权威数据源的忠实性和基于网络的经济推理的需要。我们评估了一组不同的国家的最先进的多模态LLM作为网络代理,分析失败的情况下,并进行消融研究,以评估视觉接地,基于计划的推理和交互设计的影响。我们的研究结果揭示了巨大的性能差距,并强调了接地,导航和多模式理解方面的持续挑战,将EconWebArena定位为经济网络智能的严格测试平台。

ExpeRepair:双重记忆驱动的仓库级缺陷修复系统

中科院软件所提出 ExpeRepair,通过结合修复案例的情景记忆与高阶策略的语义记忆,在 SWE-Bench Lite 上取得 60.33% 的缺陷修复率。

 SWE 软件工程 人工智能辅助编程 智能体记忆 智能体

ExpeRepair 是一个面向仓库级软件缺陷修复的系统,通过模拟人类认知构建情景记忆与语义记忆。情景记忆用于保存具体项目中的历史修复案例,语义记忆则从案例中提炼可迁移的高阶修复策略。系统能够在持续解决问题的过程中积累经验,并将既有经验用于后续缺陷定位与补丁生成。其在 SWE-Bench Lite 基准上实现了 60.33% 的修复率。

用途与启示
  • 为仓库级自动缺陷修复引入可持续积累和复用的经验机制
  • 展示案例记忆与抽象策略结合对 AI 编程智能体性能的提升
  • 可用于辅助代码维护、自动生成补丁及构建具备长期记忆的软件工程智能体
📝 原始笔记(逐字保留)
1. [AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品](https://mp.weixin.qq.com/s/MjU9xPSfUyi0w1qegKgZ9Q) 1. **ExpeRepair** ——具有“双重记忆”的仓库级缺陷修复系统,它通过模拟人类认知的两种记忆模式: 1. 情景记忆:存储历史修复案例(如“具体如何修复Sympy项目的安全漏洞”) 2. 语义记忆:提炼高阶修复策略(如“处理资源泄漏时需同时关闭文件和释放句柄”) 2. 论文:https://arxiv.org/abs/2506.10484 3. 代码:https://github.com/ExpeRepair/ExpeRepair ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=MWIwNjgwMGY3YmU3YWI0Yjk2N2NkYjc5MzRkNTdiNGJfQXg1bElVb2h4aVl3RFN1YThWVThNbnBXbFRCcEVpVUNfVG9rZW46RWJ0YWJIQzJSb21FQmZ4UFRwamN5QjdMbk5mXzE3NTQ0NjI4MzQ6MTc1NDQ2NjQzNF9WNA)

从被动推理到主动推理:大型语言模型能否在不完整信息下提出正确问题?

AR-Bench通过侦探案件、情景谜题和猜数字任务评估大模型主动获取缺失信息的能力,揭示当前模型在主动推理上明显落后于被动推理。

 逻辑推理 推理 模型评估 智能体 数据工程

论文提出主动推理基准 AR-Bench,要求大模型与外部系统交互,通过提出问题获取解决任务所需的缺失证据或数据。基准包含侦探案件、情景谜题和猜数字三个任务家族,覆盖常识、逻辑与符号推理。实验发现,当代 LLM 经常无法有效获取或利用关键信息,主动推理能力与被动推理能力之间存在显著差距。基于树的搜索和后训练等方法只能带来有限提升,尚不足以满足真实场景部署需求。该论文已被 ICML 2025 接收。

用途与启示
  • 为不完整信息环境下的大模型推理能力提供专门评估基准
  • 推动模型从静态回答问题转向主动提问、取证和环境交互
  • 启示后续研究结合交互式学习、实时反馈回路与环境感知训练目标
  • 可用于衡量搜索、后训练及智能体策略对主动推理能力的实际增益
📝 原始笔记(逐字保留)
6. 2025-06-12 12:07:30 Thursday| From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information? **标题** : 从被动推理到主动推理:大型语言模型能否在不完整信息下提出正确的问题? **链接** :https://arxiv.org/abs/2506.08295 **作者** : Zhanke Zhou, Xiao Feng, Zhaocheng Zhu, Jiangchao Yao, Sanmi Koyejo, Bo Han **备注** :Accepted by ICML 2025 **摘要** :虽然现有的基准测试在不同领域探索大型语言模型(LLM)的推理能力,但它们主要评估被动推理,为模型提供获得解决方案所需的所有信息。相比之下,主动推理-法学硕士必须与外部系统交互以获取缺失的证据或数据-很少受到系统的关注。为了解决这一不足,我们提出了AR-Bench,一个新的基准设计明确评估法学硕士的**主动推理**能力。AR-Bench包括三个任务家族-侦探案件,情景谜题和猜测数字-它们共同模拟真实世界,代理场景并测量常识,逻辑和符号推理挑战的性能。对AR-Bench的实证评估表明,当代LLM在主动推理方面表现出明显的困难:他们经常无法获得或利用解决任务所需的信息。这种差距凸显了他们被动和主动推理能力之间的明显差异。此外,消融研究表明,即使是先进的策略,如基于树的搜索或后训练方法,也只能产生适度的收益,并且达不到现实世界部署所需的水平。总的来说,这些发现突出了推进主动推理方法的迫切需要,例如,结合互动学习、实时反馈回路和环境感知培训目标。该基准可在https://github.com/tmlr-group/AR-Bench上公开获得。
0%