2025-06-12 科研追新
当日精选(由提交工具自动创建)。
大型语言模型具有内在元认知,但需要良好的评估透镜
研究提出自动化元认知评估框架 AutoMeco 与免训练的 MIRA 调整策略,用于检验并增强大型语言模型对自身推理步骤错误的感知能力。
以往研究多关注让大语言模型识别推理链中的错误,却较少系统考察模型是否意识到自身在哪一步出错。作者提出 AutoMeco,用于自动基准测试困惑度等现有“元认知透镜”,并分析其步骤级评价能力与适应性。论文还提出无需额外训练的马尔可夫内在奖励调整策略 MIRA,以改进当前元认知指标。三个数学推理数据集和三个大语言模型上的实验显示,AutoMeco 的验证方式具有合理性,MIRA 也能更准确地评估模型的元认知能力。
- 为大语言模型的步骤级自我评价与错误感知提供自动化评估框架
- 帮助判断困惑度等代理指标能否真实反映模型的元认知状态
- 通过免训练策略提升自我验证、候选答案筛选及可靠推理能力
- 为构建能够监控和修正自身推理过程的模型提供研究工具
📝 原始笔记(逐字保留)
「Next-Token」范式改变:强化学习预训练来了
文章介绍将强化学习引入预训练阶段的新范式,探索突破传统下一词元预测训练方式的可能性。
文章聚焦“强化学习预训练”这一新方向,讨论其对传统 Next-Token Prediction 范式的改变。该思路尝试在预训练阶段引入奖励反馈,使模型不再仅依赖逐词预测目标。它可能为提升模型的推理、规划及长期决策能力提供新的训练路径。
- 关注强化学习从后训练向预训练阶段前移的趋势
- 为突破单一下一词元预测目标提供研究思路
- 启发对奖励设计、训练稳定性与规模化效率的进一步探索
📝 原始笔记(逐字保留)
一致的路径通向真理:面向LLM推理的自我奖励强化学习
论文提出内在奖励机制CoVo,利用不同推理轨迹中间状态的一致性与波动性,在无需外部监督的情况下强化大模型推理能力。
作者提出自我奖励强化学习框架CoVo,以不同推理轨迹的中间状态作为内在监督信号。其核心观察是,正确推理的中间状态通常会收敛至最终答案,并且与其他候选轨迹的偏差较小。CoVo通过向量空间聚合策略联合衡量一致性和波动性,同时加入好奇心奖励以鼓励多样化探索。多个推理基准的实验显示,该方法在不依赖外部监督时可达到或超过监督强化学习的表现。
- 为缺乏人工标注或可验证奖励的推理任务提供可扩展的强化学习方案
- 展示了从模型内部推理轨迹构造奖励信号的可行性
- 可用于降低LLM推理训练对外部奖励模型和监督数据的依赖
- 为轨迹级自我评估、自我改进与探索机制的结合提供参考
📝 原始笔记(逐字保留)
Bingo:通过动态与显著性强化学习提升大模型推理效率
Bingo通过显著性长度奖励和动态长度奖励,在减少大模型冗余推理输出的同时兼顾准确率与推理效率。
大型语言模型的推理过程常包含不必要的冗长或冗余内容,而直接使用长度奖励压缩输出又容易损害准确率。Bingo提出显著性长度奖励,逐步引导模型优先减少对答案贡献较低的非显著标记。其动态长度奖励在训练初期允许模型针对困难问题进行详细推理,随后逐渐加强效率约束。多个推理基准的实验显示,该方法优于普通奖励及多种长度奖励基线,实现了更好的准确率与效率平衡。
- 为训练简洁且准确的推理模型提供新的强化学习奖励设计。
- 通过区分标记重要性,避免长度压缩对关键推理步骤造成破坏。
- 动态调整效率约束,可为不同训练阶段的奖励调度提供参考。
- 有助于降低长链推理的生成成本与推理延迟。
📝 原始笔记(逐字保留)
游戏玩家可以训练数学推理模型吗?
研究通过结合强化学习与内存优化技术,在单张消费级游戏 GPU 上训练出具有竞争力的 1.5B 参数数学推理模型。
该研究探索了资源受限条件下训练数学推理模型的可行性。作者将强化学习与内存优化技术结合,在单张 RTX 3080 Ti 消费级 GPU 上完成了 1.5B 参数模型的训练。实验显示,该模型在数学推理基准上的表现可与参数规模大数倍的模型相当,部分结果甚至更优。这说明高性能数学推理研究未必依赖昂贵的高端硬件集群。
- 为个人研究者和小型团队提供低成本训练数学推理模型的实践方案
- 展示强化学习与内存优化在消费级硬件上的协同价值
- 推动数学推理模型研究与开发基础设施的普及
📝 原始笔记(逐字保留)
大语言模型数学推理综述
该综述系统梳理大语言模型在数学推理领域的研究进展与发展方向。
《A Survey on Large Language Models for Mathematical Reasoning》是一篇聚焦大语言模型数学推理能力的综述。文章旨在梳理该领域的主要研究进展、方法体系与相关问题。原始文本未提供论文摘要、作者、实验结论及链接等详细信息。
- 帮助研究者快速了解大语言模型数学推理领域的整体脉络
- 为数学推理方法选型及后续研究提供参考
- 可作为整理相关论文、数据集与评估方法的入口
📝 原始笔记(逐字保留)
RuleReasoner:通过领域感知动态采样强化规则推理
RuleReasoner通过依据历史奖励动态调整各领域的训练采样权重,提升小型推理模型在规则推理任务上的跨任务、跨领域泛化能力与训练效率。
RuleReasoner面向规则格式、类型和复杂度差异带来的泛化挑战,探索小型推理模型能否通过强化学习掌握稳健的规则推理能力。其核心是领域感知动态采样:根据历史奖励持续更新不同领域的采样权重,并为每个训练批次重新采样。该机制支持领域增强和灵活的在线训练调度,无需人工预先设计混合训练配方。实验中,该方法在8个分布内任务和3个分布外任务上分别取得平均4.1%和10.4%的提升,并展现出较高的计算效率。
- 为多领域规则推理训练提供可自适应调整的数据采样策略。
- 减少人工设计多任务数据混合比例与训练课程的成本。
- 说明小型推理模型结合强化学习后,也可能获得较强的分布外泛化能力。
- 可用于逻辑推理、结构化规则执行及跨领域推理系统的训练优化。
📝 原始笔记(逐字保留)
Router-R1:通过强化学习实现多轮大模型路由与聚合
Router-R1将多模型路由与结果聚合建模为序列决策过程,通过强化学习让路由器在多轮推理中动态调用不同LLM,并兼顾任务性能与调用成本。
Router-R1突破了传统LLM路由器单轮、一对一分配查询的限制,将多模型路由与响应聚合统一建模为序列决策过程。该框架以具备推理能力的LLM作为路由器,交替执行内部“思考”和动态“路由”动作,并把各模型的响应持续整合进上下文。训练采用格式奖励、最终结果奖励和成本奖励,在回答质量、调用价格与延迟之间进行权衡。七个通用及多跳问答基准的实验显示,该方法优于多种强基线,并能依据定价、延迟和示例表现等描述泛化到未见过的模型。
- 为复杂任务提供多轮、多模型协同路由方案,充分利用不同LLM的互补能力。
- 展示如何通过强化学习联合优化推理质量、调用成本与服务延迟。
- 可用于构建能够动态选择模型、聚合答案并适配新模型的智能体系统。
📝 原始笔记(逐字保留)
e3:学习探索实现大模型测试时计算外推
e3通过训练大模型在上下文中执行生成、验证与细化等探索操作,使其在超过训练令牌预算时仍能通过增加测试时计算提升推理性能。
测试时计算扩展的关键目标,是让模型在困难问题上通过延长思考获得持续的性能提升,但研究发现多数现有推理模型缺乏这种外推能力。e3将生成、验证、细化以及多假设测试等操作串联起来,训练模型在上下文中主动探索。其方法利用基础模型不同技能之间的不对称性、错误轨迹产生的负梯度,以及任务难度与训练令牌预算协同增长的课程设计。e3-1.7B在AIME 2025和HMMT 2025上取得同规模领先表现,并可外推至训练令牌预算的两倍,同时改善pass@1与pass@k。
- 为构建能够有效利用更长推理预算的模型提供训练方案。
- 表明单纯增加测试时令牌并不足够,模型还需要学习如何分配计算并开展上下文搜索。
- 错误轨迹和技能不对称性可作为强化学习中促进探索的重要信号。
- 可用于提升数学推理等高难度任务中的测试时计算扩展能力。
📝 原始笔记(逐字保留)
MEMETRON:大型语言模型测试时响应优化的元启发式机制
MEMETRON将大模型解码建模为离散黑盒优化问题,通过混合元启发式搜索在无需重训练或梯度访问的情况下生成高奖励响应。
MEMETRON是一个任务无关的测试时响应优化框架,旨在突破贪婪搜索、采样和重排序等常规解码策略的局限。它将LLM解码表述为离散黑盒优化问题,并采用GENETRON与ANNETRON两种混合元启发式算法搜索响应空间。搜索过程由奖励模型以及LLM自身执行的上下文操作引导,无需重新训练模型或访问梯度。实验显示,该框架在人类偏好对齐任务上显著优于标准解码与重排序方法。
- 为LLM提供可直接部署的测试时优化方案,在不修改模型参数的情况下提升响应质量。
- 将任务目标显式编码为奖励函数,使解码过程能够针对特定目标进行搜索。
- 模块化设计只依赖奖励函数和轻量提示模板,便于迁移到不同任务与模型。
- 展示了元启发式算法在推理解码和模型对齐中的应用潜力。
📝 原始笔记(逐字保留)
NoWait:移除“等待”等思考标记可提升推理效率
NoWait通过抑制“Wait”“Hmm”等显式自我反思标记,在不损害模型实用性的情况下将思维链长度缩短27%至51%。
大型推理模型在执行复杂的逐步推理时,常产生冗长、重复的“过度思考”内容。研究者提出NoWait,在推理过程中抑制“Wait”“Hmm”等自我反思标记,以减少不必要的思维链。该方法在文本、视觉和视频推理的10个基准及5个R1风格模型系列上进行了验证。实验显示,NoWait可将推理轨迹缩短27%至51%,同时基本不影响模型的任务实用性。
- 为大模型提供即插即用的推理加速方案,减少输出延迟与计算成本
- 说明显式自我反思标记并非高级推理所必需,可作为推理冗余的优化切入点
- 可用于提升文本、视觉和视频等多模态推理系统的部署效率
📝 原始笔记(逐字保留)
SwS:LLM 推理强化学习中的自我感知弱点驱动问题合成
SwS 通过持续识别模型在强化学习中的推理弱点并针对性合成新问题,显著提升不同规模 LLM 在主流推理基准上的泛化性能。
可验证奖励强化学习依赖具有精确答案的高质量问题,但现有合成数据往往缺少可靠验证,且未充分考虑模型自身能力。SwS 将模型在强化学习迭代采样中始终无法掌握的问题定义为弱点,并从失败案例中提取核心概念。框架围绕这些概念定向合成新问题,用于后续增强训练,使模型逐步弥补薄弱环节。该方法无需外部知识蒸馏,在 8 个主流推理基准上将 7B 和 32B 模型的平均性能分别提升 10.0% 和 7.7%。
- 根据模型真实失败案例定向生成训练题目,提高合成数据的有效性与采样效率。
- 构建“识别弱点—合成问题—强化训练”的自我改进闭环。
- 为缺少人工标注和外部蒸馏数据的 RLVR 训练提供可扩展的数据合成方案。
📝 原始笔记(逐字保留)
自动生成用于阅读理解评估的推理问题
研究利用GPT-4o合成诊断性阅读理解推理题,生成题目中93.8%达到高质量标准,但仅42.6%准确匹配指定推理类型。
论文提出阅读理解推理类型分类体系,并分析其在诊断性阅读理解题库中的分布。研究通过少样本提示让GPT-4o根据给定文章生成桥接推理题,同时比较使用与不使用思维链提示的效果。生成题目从整体质量、推理类型适配度和大模型推理表现三个方面进行评估,评分者间一致性超过0.90。结果显示,93.8%的问题质量较高并适用于3—12年级,但只有42.6%准确符合目标推理类型,说明自动生成仍需结合人工审核。
- 支持规模化构建面向学龄学生的诊断性阅读理解评估题库
- 表明大模型能够生成高质量推理题,但对细粒度推理类型的控制能力仍然有限
- 可采用“模型生成+人工审核”的流程,在提升题库生产效率的同时保证教学适用性
- 推理类型匹配率可作为教育题目合成系统的重要评估指标
📝 原始笔记(逐字保留)
SWE-Flow:以测试驱动方式合成软件工程数据
SWE-Flow 从真实项目的单元测试中推断增量开发流程,自动合成可验证的软件工程训练任务,并构建了包含逾1.8万个实例的评测基准。
数据合成 SWE 软件工程 人工智能辅助编程 人工智能框架 模型训练 模型评估
SWE-Flow 是一个基于测试驱动开发(TDD)的软件工程数据合成框架,已被 ICML 2025 接收。它不依赖人工提交的问题描述,而是从封装高级需求的单元测试中自动推断增量开发步骤,并利用依赖图(RDG)捕获功能交互、生成结构化开发计划。框架会在每个步骤中生成部分代码库、对应测试与必要的代码修改,从而形成可完整验证的 TDD 任务。研究团队基于真实 GitHub 项目合成了 16,061 个训练实例和 2,020 个测试实例,并构建 SWE-Flow-Eval 基准;实验显示,这些数据可显著提升开放模型的 TDD 编码能力。
- 将现有单元测试转化为结构化、可验证的软件工程训练数据,降低对人工问题描述和开发提交记录的依赖。
- 为代码模型提供增量开发、测试通过与代码修改相结合的监督信号。
- 通过 SWE-Flow-Eval 统一评估模型在测试驱动编码任务中的表现。
- 依赖图驱动的数据合成思路可扩展至代码修复、仓库级开发和软件工程智能体训练。
📝 原始笔记(逐字保留)
DeepMath-103K:用 10.3 万道高难数学题突破大模型推理瓶颈
DeepMath-103K 提供约 10.3 万道高难度、严格去污染且答案可验证的数学题,用于强化学习训练高级数学推理模型。
DeepMath-103K 是一个面向大模型数学推理训练的大规模数据集,共包含约 103,022 个数学问题。它重点解决现有数学数据难度不足、新颖性有限、答案难以验证以及与评测基准发生污染等问题。数据集强调高难度、严格去污染和答案可验证,适合用于强化学习训练高级推理模型。项目同时开放了论文、数据集、模型集合与代码,便于复现实验及绘图分析。
- 为数学推理模型的强化学习训练提供大规模、高难度数据
- 通过去污染设计降低训练数据与评测基准重叠造成的虚高结果
- 利用可验证答案构造稳定、自动化的奖励信号
- 可作为数学数据合成、筛选及难度分层流程的实验参考
📝 原始笔记(逐字保留)
AutoSDT:面向开放科学智能体的数据驱动发现任务合成管道
AutoSDT通过自动检索真实科学工作流并合成任务指令与代码解答,构建了覆盖多学科的高质量数据驱动科学发现数据集AutoSDT-5K。
AutoSDT是一个用于自动收集数据驱动科学发现编码任务的管道,利用大语言模型搜索不同来源、筛选生态有效的任务,并合成任务指令与代码解答。基于该管道构建的AutoSDT-5K包含5,404个任务,覆盖4个科学学科和756个Python包。专家评估显示,93%的任务具有生态有效性,92.2%的合成程序在功能上正确。在该数据集上训练的AutoSDT-Coder显著改善了ScienceAgentBench与DiscoveryBench表现,其中32B模型在ScienceAgentBench上达到与GPT-4o相当的7.8%成功率。
- 为科学智能体提供可规模化生成的高质量编码训练数据
- 展示从真实软件生态中筛选任务并合成可靠解答的数据构建范式
- 帮助开放权重代码模型缩小与闭源模型在科学发现任务上的能力差距
- 可用于研究科学任务生成、代码正确性验证与数据驱动发现智能体
📝 原始笔记(逐字保留)
豆包大模型 1.6 发布
豆包大模型 1.6 于 2025 年 6 月 12 日正式发布。
豆包大模型 1.6 于 2025 年 6 月 12 日发布。该版本是豆包大模型系列的一次更新。原始文本未提供具体能力、评测结果及获取方式。
- 关注豆包大模型系列的版本演进
- 后续可结合官方资料评估其能力提升与适用场景
📝 原始笔记(逐字保留)
Meta 发布世界模型 IntPhys 2
Meta 发布世界模型 IntPhys 2,进一步探索对物理世界的理解与建模。
Meta 发布了世界模型 IntPhys 2。该模型聚焦物理世界的理解与建模,旨在提升 AI 对现实环境及其变化规律的认知能力。相关消息于 2025 年 6 月 12 日通过微信公众号发布,具体技术细节可参阅原文。
- 关注世界模型在物理规律理解和环境预测方面的进展
- 为具身智能、机器人及交互式智能体研究提供参考
- 跟踪 Meta 在通用世界建模方向上的技术布局
📝 原始笔记(逐字保留)
Mistral AI 发布推理模型系列 Magistral
Mistral AI 发布全新大语言模型系列 Magistral,主打持续反思与复杂任务推理能力。
欧洲人工智能公司 Mistral AI 发布了全新的大语言模型系列 Magistral。该系列重点强化推理能力,可在处理任务时持续反思并调整推理过程。Magistral 面向更复杂的问题求解场景,体现了 Mistral AI 在推理模型方向上的进一步布局。
- 为复杂任务求解、逻辑推理和多步骤决策提供新的模型选择。
- 持续反思机制可为提升模型推理可靠性提供参考。
- 展现欧洲 AI 厂商在推理模型领域的最新进展。
📝 原始笔记(逐字保留)
测量数据科学自动化:AI 助手与智能体评估工具综述
该综述系统梳理了数据科学领域中 LLM 助手与智能体的评估工具,并指出现有评估在任务覆盖、人机协作和自动化模式方面的不足。
论文综述了用于评估数据科学 LLM 助手和智能体的现有工具。当前评估主要集中于少数目标导向任务,较少覆盖数据管理与探索等关键活动。相关工作往往只考察纯辅助或完全自主两种模式,忽略介于二者之间的人机协作层级。此外,现有评估强调以智能体替代人类,尚未充分研究通过任务重构实现更高程度自动化的可能性。
- 为构建数据科学智能体评测基准提供任务分类与工具参考
- 提醒研究者扩大评估范围,纳入数据管理、探索和结果解释等环节
- 推动对不同人机协作层级及任务重构型自动化的系统评估
📝 原始笔记(逐字保留)
通过多智能体反思增强大语言模型推理
论文提出DPSDP强化学习算法,将多轮答案细化建模为马尔可夫决策过程,通过演员—评论家多智能体协作和自生成数据提升大模型推理能力。
该研究将大语言模型的多轮答案验证与改进过程建模为马尔可夫决策过程,并提出通过动态规划进行直接策略搜索的DPSDP算法。DPSDP利用自生成数据开展直接偏好学习,联合训练演员与评论家智能体,使其能够迭代生成反馈并细化答案。理论分析表明,该方法可以匹配训练分布内任意策略的性能,并在分布内及分布外基准上取得提升。在MATH 500上,经过五轮细化和多数投票,基于Ministral的模型准确率由58.2%提升至63.2%,消融实验也验证了多智能体协作与分布泛化的作用。
- 为利用测试时计算扩展大模型推理能力提供可训练的多智能体方案
- 将答案生成、批评和修正统一到强化学习与动态规划框架中
- 展示自生成偏好数据可用于协同训练演员—评论家智能体
- 为提升数学推理及分布外泛化能力提供实践参考
📝 原始笔记(逐字保留)
从辩论到均衡:基于贝叶斯纳什均衡的信念驱动多智能体 LLM 推理
ICML 2025 论文提出多智能体协调框架 ECON,通过求解贝叶斯纳什均衡减少智能体间通信成本,并在六项推理与规划基准上平均超越现有多 LLM 方法 11.2%。
该研究将多 LLM 协调重新建模为不完全信息博弈,要求每个智能体依据对其他智能体策略的概率信念做出最佳响应。作者提出高效纳什均衡协调框架 ECON,以分布式独立推理和集中式答案整合替代高成本的智能体间反复交换。理论分析表明,ECON 相比非均衡多智能体方案具有更严格的遗憾界。实验中,ECON 在六个复杂推理与规划基准上平均提升 11.2%,并能灵活集成不同模型,展现出良好的可扩展性。
- 为多智能体 LLM 协作提供具有博弈论基础和收敛目标的设计思路。
- 减少智能体间频繁通信带来的推理成本,适合构建高效的多模型集成系统。
- 可用于复杂推理、任务规划及异构模型协作,并为扩大智能体规模提供参考。
📝 原始笔记(逐字保留)
自适应语言模型(SEAL)
SEAL让语言模型自主生成训练数据与更新指令,并通过强化学习学习如何有效地自我更新。
论文提出自适应语言模型框架 SEAL,使模型能够针对新知识或新任务生成称为“自我编辑”的训练内容。自我编辑可以包含合成数据、重写后的信息以及优化配置,并被用于模型的后训练更新。研究通过下游任务表现提供强化学习奖励,让模型逐步学会生成更有效的自我更新方案。实验覆盖知识融入与少样本任务适应,同时也揭示了持续更新中的灾难性遗忘问题。
- 为无需人工设计数据流水线的模型持续学习提供新路径
- 可用于知识注入、少样本适应和个性化模型更新
- 表明自我生成数据与强化学习可共同驱动模型能力演化
- 实际应用仍需解决灾难性遗忘、更新稳定性和算力成本问题
📝 原始笔记(逐字保留)
EconWebArena:现实 Web 环境中的经济任务自治智能体评测基准
EconWebArena 通过360项真实经济网络任务,系统评估自治智能体在权威数据检索、多步交互、视觉理解与经济推理方面的能力。
EconWebArena 是一个面向真实网络环境中复杂多模态经济任务的自治智能体评测基准,包含来自82个权威网站的360项人工策划任务。任务覆盖宏观经济、劳动力、金融、贸易和公共政策,要求智能体浏览实时网站、理解结构化及视觉内容,并通过多步交互提取准确且具有时效性的数据。基准先由多个大语言模型生成候选任务,再经严格人工筛选,以保障任务清晰度、可行性和数据源可靠性。对多种先进多模态模型的实验显示,现有智能体在视觉定位、网页导航、多模态理解和规划推理方面仍存在显著性能缺口。
- 为经济领域网页智能体提供贴近真实应用的统一评测平台。
- 支持分析视觉定位、规划推理和交互设计对智能体表现的影响。
- 揭示智能体在权威数据检索、动态网页导航及时间敏感信息提取方面的薄弱环节。
- 可用于指导经济研究、金融分析和公共政策数据智能体的研发与优化。
📝 原始笔记(逐字保留)
ExpeRepair:双重记忆驱动的仓库级缺陷修复系统
中科院软件所提出 ExpeRepair,通过结合修复案例的情景记忆与高阶策略的语义记忆,在 SWE-Bench Lite 上取得 60.33% 的缺陷修复率。
ExpeRepair 是一个面向仓库级软件缺陷修复的系统,通过模拟人类认知构建情景记忆与语义记忆。情景记忆用于保存具体项目中的历史修复案例,语义记忆则从案例中提炼可迁移的高阶修复策略。系统能够在持续解决问题的过程中积累经验,并将既有经验用于后续缺陷定位与补丁生成。其在 SWE-Bench Lite 基准上实现了 60.33% 的修复率。
- 为仓库级自动缺陷修复引入可持续积累和复用的经验机制
- 展示案例记忆与抽象策略结合对 AI 编程智能体性能的提升
- 可用于辅助代码维护、自动生成补丁及构建具备长期记忆的软件工程智能体
📝 原始笔记(逐字保留)
从被动推理到主动推理:大型语言模型能否在不完整信息下提出正确问题?
AR-Bench通过侦探案件、情景谜题和猜数字任务评估大模型主动获取缺失信息的能力,揭示当前模型在主动推理上明显落后于被动推理。
论文提出主动推理基准 AR-Bench,要求大模型与外部系统交互,通过提出问题获取解决任务所需的缺失证据或数据。基准包含侦探案件、情景谜题和猜数字三个任务家族,覆盖常识、逻辑与符号推理。实验发现,当代 LLM 经常无法有效获取或利用关键信息,主动推理能力与被动推理能力之间存在显著差距。基于树的搜索和后训练等方法只能带来有限提升,尚不足以满足真实场景部署需求。该论文已被 ICML 2025 接收。
- 为不完整信息环境下的大模型推理能力提供专门评估基准
- 推动模型从静态回答问题转向主动提问、取证和环境交互
- 启示后续研究结合交互式学习、实时反馈回路与环境感知训练目标
- 可用于衡量搜索、后训练及智能体策略对主动推理能力的实际增益