2025-06-25 科研追新

当日精选(由提交工具自动创建)。

你内心有许多狼:运用认知模型解读 LLM 中的价值权衡

研究借助礼貌言语认知模型量化 LLM 对信息效用与社交效用的权衡,发现推理模型尤其偏重信息效用,而基础模型及预训练数据对这种倾向具有持续影响。

 元学习 模型评估 推理 模型训练 强化学习

论文将认知科学中的礼貌言语模型用于解释 LLM 在社交场景中的多元价值权衡,量化模型对信息准确性、关系维护和他人感受等竞争性效用的权重。作者比较了前沿黑盒模型在不同推理努力程度下的表现,并追踪开源模型经过强化学习后训练时的动态变化。结果显示,推理模型普遍更加重视信息效用而非社交效用,这种趋势在数学推理能力较强的开源模型中尤为明显。研究还发现,基础模型和预训练数据的选择会在训练初期造成显著且持久的效用差异,其影响可能超过反馈数据集或对齐方法。

用途与启示
  • 为解释 LLM 的礼貌、诚实、共情等高层行为提供可量化的认知建模框架。
  • 帮助研究者比较不同基础模型、预训练数据与后训练方法对价值取向的影响。
  • 可用于优化推理模型训练,在信息准确性与社交适宜性之间进行更精细的调控。
  • 为持续监测模型对齐过程中的价值漂移与行为变化提供评估工具。
📝 原始笔记(逐字保留)
6. 2025-06-26 14:33:29 Thursday | **#1 你内心有许多狼:运用认知模型解读 LLMs 中的价值权衡 [PDF** **()] [复制] [Kimi** **(2)** **] [相关]** **[Inside you are many wolves: Using cognitive models to interpret value trade-offs in LLMs](https://papers.cool/arxiv/2506.20666)** **[PDF()]** **[Copy]** **[Kimi(2)]** **[REL]** **Authors** : [Sonia K. Murthy](https://arxiv.org/search/?searchtype=author&query=Sonia%20K.%20Murthy), [Rosie Zhao](https://arxiv.org/search/?searchtype=author&query=Rosie%20Zhao), [Jennifer Hu](https://arxiv.org/search/?searchtype=author&query=Jennifer%20Hu), [Sham Kakade](https://arxiv.org/search/?searchtype=author&query=Sham%20Kakade), [Markus Wulfmeier](https://arxiv.org/search/?searchtype=author&query=Markus%20Wulfmeier), [Peng Qian](https://arxiv.org/search/?searchtype=author&query=Peng%20Qian), [Tomer Ullman](https://arxiv.org/search/?searchtype=author&query=Tomer%20Ullman) 作者:索尼娅·K·穆尔蒂、罗西·赵、詹妮弗·胡、沙姆·卡卡德、马库斯·沃尔夫迈尔、钱鹏、托默·厄尔曼 日常社交情境中,人们常常需要权衡相互冲突的目标——既要传达严酷真相,又要维系信任关系,同时还需顾及他人感受。这种价值权衡是人类决策与语言运用的核心特征,然而目前用于解读 LLMs 中此类动态多元价值概念的工具仍十分有限。认知科学领域提出的"认知模型"通过量化说话者在选择行为或话语时对竞争性效用函数的权重分配,为人类的价值权衡提供了形式化描述。本研究采用前沿的礼貌言语认知模型,系统评估 LLMs 在多大程度上再现了类人的价值权衡机制。我们通过双重维度展开分析:前沿黑盒模型中的推理"努力程度"差异,以及开源模型在强化学习后训练阶段的表现动态。研究发现,推理模型普遍呈现信息效用高于社交效用的特征,这一现象在数学推理能力较强的开源模型中尤为显著。 我们从 LLMs 训练动态中发现,相较于反馈数据集或对齐方法,基础模型和预训练数据的选择在训练初期就会导致效用值发生大幅变化,并产生持续影响。研究表明,我们的方法能灵敏响应快速演变的 LLM 生态系统的多元特性,这些发现有助于:构建其他高层行为的假设框架、优化推理模型的训练方案、在模型训练过程中更精准地调控不同价值间的权衡。 学科分类: 计算与语言 , 人工智能 发布时间: 2025-06-25 17:58:12 UTC ### 创造力

DnD:仅靠提示词数秒生成任务专属 LoRA 权重

DnD 利用轻量文本编码器和级联超卷积解码器,根据无标签任务提示词在数秒内生成 LoRA 权重,实现无需训练的自适应模型定制。

 人工智能应用 自动化部署 系统优化

DnD 是一种基于提示词的参数生成器,可以在不进行传统微调的情况下为 LLM 生成任务专属参数。它结合轻量级文本编码器与级联超卷积解码器,仅根据无标签任务描述便可在数秒内生成 LoRA 权重矩阵。其计算开销据称比全量微调低约 12,000 倍,并在常识推理、数学、编码和多模态零样本基准上超过需要训练的强 LoRA 方法。该方法还表现出跨领域泛化能力,为低成本、即时化的大模型定制提供了新路径。

用途与启示
  • 将模型适配从训练流程转化为基于自然语言任务描述的即时参数生成。
  • 适合需要快速切换任务或领域、但缺乏标注数据与训练资源的应用场景。
  • 可作为按需部署 LoRA、构建可组合模型能力和降低个性化服务成本的技术方案。
📝 原始笔记(逐字保留)
2. 2025-06-25 10:42:37 Wednesday | LLM进入「拖拽时代」!只靠Prompt,几秒定制一个大模型,效率飙升12000倍 https://mp.weixin.qq.com/s/geOn7zyJRQwfJra38EjcxQ DnD是一种基于提示词的参数生成器,能够对LLM进行无需训练的自适应微调。 通过一个轻量级文本编码器与一个级联超卷积解码器的组合,DnD能在数秒内,仅根据无标签的任务提示词,生成针对该任务的LoRA权重矩阵。 总结来说,DnD的核心优势如下: * **极致效率:** 其计算开销比传统的全量微调低12,000倍。 * **卓越性能:** 在零样本学习的常识推理、数学、编码及多模态基准测试中,其性能比最强大的、需要训练的LoRA模型还要高出30%。 * **强大泛化:** 仅需无标签的提示词,即可在不同领域间展现出强大的泛化能力 ## RAG

OctoThinker:中期训练促进强化学习规模化

研究表明,高质量数学语料、长思维链问答数据及扩大中期训练规模可增强基础模型的强化学习兼容性,并据此推出 OctoThinker 模型家族。

 强化学习 模型训练 推理 数据工程 模型开发

研究比较了 Llama 与 Qwen 等基础模型在强化学习后训练中的差异,分析中期训练的数据质量、格式与规模如何影响推理任务表现。实验发现,MegaMath-Web-Pro 等高质量数学语料以及长思维链问答和指令数据可以显著增强强化学习效果,但过长响应也可能造成训练不稳定。作者提出“稳定后衰减”的两阶段中期训练策略:先以恒定学习率训练 2000 亿 token,再在三个思维链分支上以衰减学习率训练 200 亿 token。由此得到的 OctoThinker 模型缩小了 Llama 系模型与 Qwen 等高强化学习适配模型之间的差距,并开源超过 700 亿 token 的数学推理密集型语料库 MegaMath-Web-Pro-Max。

用途与启示
  • 为面向强化学习的基础模型预训练与中期训练提供可复用的数据配方和扩展策略
  • 说明模型的强化学习潜力不仅取决于架构,也受到数学语料质量、思维链格式和指令数据的显著影响
  • 提醒研究者在增加长思维链数据时控制回答长度与格式,以降低强化学习训练不稳定性
  • 为构建更适合大规模推理强化学习的开源模型和数据集提供参考
📝 原始笔记(逐字保留)
8. 2025-06-26 14:35:16 Thursday | **#6 OctoThinker:训练中期激励强化学习规模化 [PDF** **(14)** **] [复制] [Kimi** **(10)** **] [相关] ** **[#6](https://arxiv.org/abs/2506.20512)****[OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling](https://papers.cool/arxiv/2506.20512)**** [PDF(14)] [Copy] [Kimi(10)] [REL]** 作者:王增志,周凡,李雪峰,刘鹏飞 不同基础语言模型家族(如 Llama 和 Qwen)在强化学习(RL)后训练阶段会表现出差异化行为,尤其在推理密集型任务上。什么样的基础语言模型适合强化学习?深入理解这一问题对开发下一代可扩展 RL 的基础模型至关重要。本研究探讨了中期训练策略如何塑造 RL 动态特性,重点关注 Qwen 和 Llama 两个代表性模型家族。我们的研究发现:(1)高质量数学语料(如 MegaMath-Web-Pro)能显著提升基础模型和 RL 性能,而现有替代方案(如 FineMath-4plus)则效果不佳;(2)进一步添加问答式数据(特别是长思维链推理示例)可增强 RL 效果,且指令数据能进一步释放这种增益;(3)长思维链虽能提升推理深度,但也会导致模型响应冗长和 RL 训练不稳定,凸显数据格式化的重要性;(4)扩大中期训练规模始终能带来更强的下游 RL 性能。 基于这些洞见,我们提出了一种两阶段中期训练策略"稳定后衰减":基础模型首先以恒定学习率在 2000 亿 token 上进行训练,随后在三个专注于思维链的分支上以衰减学习率完成 200 亿 token 训练。由此诞生的 OctoThinker 模型家族展现出强大的强化学习兼容性,缩小了与更适配强化学习的模型家族(如 Qwen)之间的性能差距。我们希望这项工作能为强化学习时代的基础模型预训练策略提供参考。为支持后续研究,我们开源了模型及精选的超过 700 亿 token 数学推理密集型语料库(即 MegaMath-Web-Pro-Max)。 学科分类:计算与语言 , 人工智能 , 机器学习 发布时间:2025 年 6 月 25 日 14:58:13(UTC) ## 综述 ### 强化学习驱动大语言模型推理能力:现状、挑战与未来

ViGaL:仅通过游戏强化学习提升多模态推理能力

ViGaL让多模态大语言模型仅通过贪吃蛇等简单游戏进行强化学习,无需数学或多学科样本即可显著提升视觉数学与通用多模态推理能力。

 推理 强化学习 多模态 逻辑推理 模型训练

莱斯大学、约翰斯·霍普金斯大学和英伟达的研究团队提出视觉游戏学习方法 ViGaL(Visual Game Learning)。该方法让多模态大语言模型玩贪吃蛇等简单游戏,通过游戏反馈开展强化学习,不依赖数学或其他学科的训练数据。实验显示,游戏中习得的策略与推理能力可以迁移至视觉数学任务和 MMMU 系列基准。ViGaL 在多个基准上超过了使用数学等领域内数据训练的强化学习模型,表明通用交互环境也能成为推理训练的数据源。

用途与启示
  • 探索以低成本、可自动验证的游戏环境替代昂贵的领域推理样本。
  • 说明强化学习获得的推理能力可以跨任务迁移,而不必局限于训练数据所属领域。
  • 为多模态模型构建可扩展的课程学习、交互式训练和奖励设计方案提供参考。
📝 原始笔记(逐字保留)
2025-06-25 09:47:00 Wednesday | 强化学习新发现:无需数学样本,仅游戏训练AI推理大增 https://mp.weixin.qq.com/s/d1h7y12PRF7OYhiW7Z5EuA 此前已有研究发现,即使不提供标准答案,仅用数学问题进行强化学习也能提高模型性能,这让人们开始重新思考强化学习的训练方式。而来自莱斯大学、约翰斯・霍普金斯大学和英伟达的研究团队更进一步:他们让多模态大语言模型 (MLLM) 玩贪吃蛇等简单游戏,无需任何数学或多学科训练数据,就显著提升了模型的多模态推理能力。研究团队提出了 ViGaL (Visual Game Learning) 方法,在多个主流视觉数学基准测试和 MMMU 系列基准测试中,超越此前在数学等领域内数据上训练的强化学习模型。 * 论文标题:Play to Generalize: Learning to Reason Through Game Play * 论文链接:https://arxiv.org/abs/2506.08011 * 项目主页:https://yunfeixie233.github.io/ViGaL/ ### 类比推理 #### [模拟类比和类比推理:连接认知科学理论和自然语言处理研究](https://papers.cool/arxiv/2509.09381) **Authors**: [Molly R Petersen](https://arxiv.org/search/?searchtype=author&query=Molly%20R%20Petersen), [Claire E Stevenson](https://arxiv.org/search/?searchtype=author&query=Claire%20E%20Stevenson), [Lonneke van der Plas](https://arxiv.org/search/?searchtype=author&query=Lonneke%20van%20der%20Plas) **类比推理是人类认知的一个重要方面。在本文中,我们总结了认知科学文献中关于类比推理背后过程的关键理论,并将其与当前自然语言处理的研究联系起来。虽然这些过程可以很容易地与 NLP 中的概念联系起来,但通常不会通过认知视角来看待它们。此外,我们展示了这些概念如何与NLP研究中的几个主要挑战相关,与类比求解没有直接关系。这可能会指导研究人员更好地优化文本中的关系理解,而不是严重依赖实体级相似性。** **主题**: [计算和语言](https://papers.cool/arxiv/cs.CL) **发布**: 2025-09-11 11:57:58 UTC ## 类o系列模型

ECCoT:通过认知链验证增强大型语言模型的有效推理

ECCoT 通过主题感知生成、因果推理对齐和结构化排序过滤来评估并修正思维链,从而提升大模型推理的可解释性与可靠性。

 推理 逻辑推理 模型评估 人工智能框架

ECCoT 是一个端到端的认知链思维验证框架,用于识别和完善大型语言模型生成的推理链。框架采用马尔可夫随机场嵌入式主题模型(MRF-ETM)生成主题感知的思维链,并使用因果句子 BERT(CSBert)进行因果推理对齐。它进一步利用结构化排序统计过滤无效推理链,降低错误链条对最终结论的影响。该方法旨在减少推理偏差,并增强大模型决策过程的可解释性和可信度。

用途与启示
  • 为思维链提供自动化质量评估与错误过滤机制
  • 支持构建更可靠、可解释的大模型推理与决策系统
  • 将主题一致性和因果对齐引入推理链生成与验证流程
  • 可用于高风险场景中的推理审查和输出可信度增强
📝 原始笔记(逐字保留)
11. 2025-06-25 11:10:23 Wednesday | **[CCoT:大型语言模型中通过思维链增强有效认知的框架](https://papers.cool/arxiv/2506.19599)** **[PDF()]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Zhenke Duan](https://arxiv.org/search/?searchtype=author&query=Zhenke%20Duan), [Jiqun Pan](https://arxiv.org/search/?searchtype=author&query=Jiqun%20Pan), [Jiani Tu](https://arxiv.org/search/?searchtype=author&query=Jiani%20Tu), [Xiaoyi Wang](https://arxiv.org/search/?searchtype=author&query=Xiaoyi%20Wang), [Yanqing Wang](https://arxiv.org/search/?searchtype=author&query=Yanqing%20Wang) 在大规模人工智能时代,大型语言模型 (LLM) 在自然语言处理方面取得了重大进步。然而,它们通常缺乏透明度并产生不可靠的输出,这引发了对其可解释性的担忧。为了解决这个问题,思维链 (CoT) 提示方法将推理构建为逐步推理。然而,并非所有推理链都是有效的,错误会导致不可靠的结论。我们提出了 ECCoT,一种端到端的认知链思维验证框架,用于评估和完善 LLM 中的推理链。ECCoT 集成了马尔可夫随机场嵌入式主题模型 (MRF-ETM) 用于主题感知 CoT 生成和因果句子 BERT (CSBert) 用于因果推理对齐。通过使用结构化排序统计过滤无效链,ECCoT 提高了可解释性,减少了偏差,并增强了基于 LLM 的决策的可信度。主要贡献包括引入 ECCoT、MRF-ETM 用于主题驱动的 CoT 生成,以及用于因果推理增强的 CSBert。代码发布时间:https://github.com/erwinmsmith/ECCoT.git。 ### 长思维链 #### RCP-Merging:通过将推理能力作为先验,合并长链思维模型与特定领域模型 [#114](https://arxiv.org/abs/2508.03140) [RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior](https://papers.cool/arxiv/2508.03140) 具有长链式思维(CoT)能力的大型语言模型(LLMs),称为推理模型,通过多步长链式思维推理展现出卓越的复杂问题解决能力。为了在不产生大量计算和数据成本的情况下,创建具备长链式思维能力和领域特定知识的双重能力模型,模型合并成为一种极具资源效率的方法。然而,将领域特定的 LLMs 与具备长链式思维能力的模型合并存在重大挑战,因为现有的合并方法往往导致推理能力下降,甚至出现无意义输出和输出崩溃。为克服这一问题,我们提出了 RCP-Merging:一种以推理能力为先验,合并长链式思维模型与领域特定模型的新型合并框架,旨在整合具备长链式思维能力的领域特定 LLMs,同时保持模型在原始领域的性能。该方法将推理模型权重视为基础先验,利用推理能力指标保留核心长链式思维能力模型权重,同时有选择地合并关键的领域特定权重。 我们在 BioMedicine 和 Finance 领域对 Qwen2.5-7B、Llama3.1-8B 和 Qwen2.5-1.5B 模型进行了大量实验。结果表明,RCP-Merging 成功地将推理模型与特定领域模型合并,在不显著影响原有长链式推理能力的情况下,使领域任务性能分别比最先进方法提升了 9.5%和 9.2%。 ## 新架构 ### 分层推理模型(HRM)

打破领域障碍:强化后训练的推理收益能否迁移到未见领域?

研究发现,强化后训练能显著提升与微调数据相似的任务表现,但其收益难以稳定迁移到采用不同推理模式的未见领域。

 推理 强化学习 模型训练 模型评估 人工智能

论文研究强化后训练(RPT)带来的大模型推理能力提升能否泛化至未见领域。作者首先开展观察性研究,在多个可见与不可见领域中比较多种开放权重 RPT 模型及其基础模型。随后开展介入性研究,仅在单一领域对模型进行强化后训练,再测试其跨领域表现。两项研究均表明,RPT 在与训练数据相似的任务上收益明显,但面对推理模式不同的领域时,增益不稳定甚至可能完全消失。

用途与启示
  • 提醒研究者不能用同领域评测直接推断强化后训练具备通用推理增益。
  • 为训练数据选择提供依据,应覆盖多样化领域与不同推理模式。
  • 建议建立跨领域、分布外评估体系,以识别模型能力提升是真正泛化还是任务适配。
  • 为研究更具迁移性的强化学习目标、奖励设计和训练策略提供方向。
📝 原始笔记(逐字保留)
5. 2025-06-25 11:08:02 Wednesday | **[打破障碍:强化训练后的收益会转移到看不见的领域吗?](https://papers.cool/arxiv/2506.19733)** **[PDF(2)]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Chuxuan Hu](https://arxiv.org/search/?searchtype=author&query=Chuxuan%20Hu), [Yuxuan Zhu](https://arxiv.org/search/?searchtype=author&query=Yuxuan%20Zhu), [Antony Kellermann](https://arxiv.org/search/?searchtype=author&query=Antony%20Kellermann), [Caleb Biddulph](https://arxiv.org/search/?searchtype=author&query=Caleb%20Biddulph), [Suppakit Waiwitlikhit](https://arxiv.org/search/?searchtype=author&query=Suppakit%20Waiwitlikhit), [Jason Benn](https://arxiv.org/search/?searchtype=author&query=Jason%20Benn), [Daniel Kang](https://arxiv.org/search/?searchtype=author&query=Daniel%20Kang) 强化后训练 (RPT) 最近显示出在提高大型语言模型 (LLM) 的推理能力方面的前景。然而,目前尚不清楚这些改进对新领域的推广程度如何,因为之前的工作是根据用于微调的相同领域的数据评估 RPT 模型。为了了解 RPT 的普遍性,我们进行了两项研究。(1) 观察性:我们将各种开放权重 RPT 模型与其在多个领域的相应基础模型进行比较,包括其微调数据中的可见和不可见领域。(2) 介入性:我们在单个领域上使用 RPT 微调 LLM,并评估它们在多个领域的表现。这两项研究都得出了相同的结论,即尽管 RPT 在类似于微调数据的任务上带来了实质性的收益,但这些收益的泛化并不一致,并且在具有不同推理模式的领域可能会消失。

Thought Anchors:识别大模型推理中的关键步骤

论文提出三种句子级归因方法,发现计划与回溯类“思维锚点”会对大模型后续推理产生不成比例的影响。

 推理 逻辑推理 智能体工具 模型评估

论文从句子层面分析大模型的长思维链,以降低逐 token 依赖带来的可解释性困难。作者提出黑盒反事实比较、白盒注意力聚合和因果注意力抑制三种互补的归因方法。实验发现,推理轨迹中存在对后续过程影响极大的“思维锚点”,它们通常承担规划或回溯功能。不同方法得到的结果具有一致性,作者还提供了可视化工具,用于观察多步推理中的关键句子及信息传播模式。

用途与启示
  • 帮助定位长思维链中真正决定答案的关键推理步骤。
  • 为推理模型的可解释性、错误诊断和过程监督提供句子级分析手段。
  • 可用于研究规划、回溯等高影响步骤,并辅助压缩或优化冗长推理轨迹。
📝 原始笔记(逐字保留)
2025-06-25 11:13:29 Wednesday | **[Thought Anchors:哪些 LLM 推理步骤很重要?](https://papers.cool/arxiv/2506.19143)** **[PDF()]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Paul C. Bogdan](https://arxiv.org/search/?searchtype=author&query=Paul%20C.%20Bogdan), [Uzay Macar](https://arxiv.org/search/?searchtype=author&query=Uzay%20Macar), [Neel Nanda](https://arxiv.org/search/?searchtype=author&query=Neel%20Nanda), [Arthur Conmy](https://arxiv.org/search/?searchtype=author&query=Arthur%20Conmy) 推理大型语言模型最近在许多领域都取得了最先进的性能。然而,他们的长篇思维链推理带来了可解释性挑战,因为每个生成的令牌都依赖于所有先前的令牌,这使得计算更难分解。我们认为,在句子层面分析推理轨迹是理解推理过程的一种很有前途的方法。我们提出了三种互补的归因方法:(1) 一种黑盒方法,通过比较 100 次推出的最终答案来衡量每个句子的反事实重要性,这些答案以生成该句子的模型或具有不同含义的模型为条件;(2) 一种白盒方法,在成对的句子之间聚合注意力模式,它识别出 “广播” 的句子,这些句子通过 “接收者” 的注意力头从所有未来的句子中受到不成比例的关注;(3) 因果归因方法,通过抑制对一个句子的关注并测量对每个未来句子的标记的影响来衡量句子之间的逻辑联系。每种方法都为思维锚的存在提供了证据,这些推理步骤具有极其重要性,并且不成比例地影响了随后的推理过程。这些思想锚通常是计划或回溯句子。我们提供了一个开源工具 (www.thought-anchors.com) 来可视化我们方法的输出,并提供了一个案例研究,展示了映射模型如何执行多步骤推理的方法的收敛模式。方法之间的一致性证明了句子级分析在更深入地理解推理模型方面的潜力。 ## 推理的不确定性 ###### [#77](https://arxiv.org/abs/2509.10739)[不确定性下的推理:探索法学硕士的概率推理能力](https://papers.cool/arxiv/2509.10739) [PDF] [Copy] [Kimi1] [REL] **Authors**: [Mobina Pournemat](https://arxiv.org/search/?searchtype=author&query=Mobina%20Pournemat), [Keivan Rezaei](https://arxiv.org/search/?searchtype=author&query=Keivan%20Rezaei), [Gaurang Sriramanan](https://arxiv.org/search/?searchtype=author&query=Gaurang%20Sriramanan), [Arman Zarei](https://arxiv.org/search/?searchtype=author&query=Arman%20Zarei), [Jiaxiang Fu](https://arxiv.org/search/?searchtype=author&query=Jiaxiang%20Fu), [Yang Wang](https://arxiv.org/search/?searchtype=author&query=Yang%20Wang), [Hamid Eghbalzadeh](https://arxiv.org/search/?searchtype=author&query=Hamid%20Eghbalzadeh), [Soheil Feizi](https://arxiv.org/search/?searchtype=author&query=Soheil%20Feizi) **尽管在语言理解和生成方面取得了广泛的成功,但大型语言模型 (LLM) 在面对需要概率推理的任务时表现出不明确且往往不一致的行为。在这项工作中,我们首次全面研究了法学硕士在显式离散概率分布上的推理能力。根据概率分布的观察结果,我们评估模型在三个精心设计的任务上,即模式识别、最大似然估计和样本生成,提示它们对有关联合分布或其条件的查询做出响应。因此,这些任务探索了一系列概率技能,包括频率分析、边缘化和生成行为。通过全面的实证评估,我们证明较小的模型和较大的模型之间存在明显的性能差距,后者在样本生成方面表现出更强的推理能力和令人惊讶的能力。此外,我们的调查揭示了显着的局限性,包括对用于表示概率结果的符号变化的敏感性,以及随着上下文长度的增加,性能下降超过 60%。总之,我们的结果提供了对法学硕士概率推理能力的详细理解,并确定了未来改进的关键方向。** **主题**: [计算和语言](https://papers.cool/arxiv/cs.CL) **发布**: 2025-09-12 22:58:05 UTC ## 其他推理 ### 心智推理

ToMAP:以心智理论训练具备对手感知能力的大模型说服者

伊利诺伊大学香槟分校提出 ToMAP,通过引入心智理论机制,使大模型能够感知对手立场与态度变化,并生成更个性化、灵活且有逻辑的说服策略。

 推理 逻辑推理 模型训练 人工智能

成功的说服要求模型理解对方独立的想法、信念与动机,并据此调整论证方式。现有大模型通常只围绕核心论点或己方观点展开,难以利用论点间的联系开辟新角度,也无法及时响应对方态度的变化。ToMAP(Theory of Mind Augmented Persuader)将心智理论机制引入大模型说服过程,训练模型形成对手感知能力。该方法旨在让 AI 从对方视角进行推理,从而实现更个性化、灵活且逻辑连贯的说服。

用途与启示
  • 为对话式说服系统提供基于用户立场和态度变化的动态策略调整能力
  • 展示心智理论在大模型社会推理与个性化交互中的应用潜力
  • 可用于谈判、教育辅导、观点沟通及其他需要理解对方心理状态的场景
📝 原始笔记(逐字保留)
2025-06-25 09:56:06 Wednesday | ToMAP:赋予大模型「读心术」,打造更聪明的AI说服者 https://mp.weixin.qq.com/s/oxSc45AVlff7s3YbYrBZGg 成功的说服不仅需要清晰有力的论据,更需要精准地洞察对方的立场和思维过程。这种洞察被心理学称为「心智理论」(ToM),即认识到他人拥有独立的想法、信念和动机,并基于此进行推理。这是人类与生俱来的认知能力,而大模型在对话中却往往缺乏心智感知,这导致了两个显著的缺陷: * 模型往往仅围绕核心论点展开讨论,而无法根据论点之间的联系提出新的角度; * 模型往往仅关注并重复己方观点,而无法因应对方态度变化做出策略调整。 为解决这一问题,伊利诺伊大学香槟分校的研究者提出了 ToMAP(Theory of Mind Augmented Persuader),一种引入「心智理论」机制的全新说服模型,让 AI 更能「设身处地」从对方的角度思考,从而实现更具个性化、灵活性和逻辑性的说服过程。 论文标题:ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind 论文地址:https://arxiv.org/pdf/2505.22961 开源代码仓库:https://github.com/ulab-uiuc/ToMAP

Synthetic Data RL:仅靠任务定义合成数据并强化学习

北京大学、MIT 等机构提出 Synthetic Data RL,通过按模型能力动态调整样本难度并进行强化学习,在无需人工标注的情况下实现领域适配。

 数据合成 强化学习 模型训练 自进化

传统领域微调依赖大规模人工标注数据,成本高且难以扩展,Synthetic Data RL 则只需给出任务定义即可自动构造领域样本。该框架先用基础模型评估初始数据集,并依据回答是否正确将样本划分为已解决与未解决两类。随后,大语言模型改写器将已解决样本改写得更难、将未解决样本改写得更容易,从而生成贴合当前模型能力边界的训练数据。最终合并原始样本、困难样本与简单样本开展强化学习,将领域知识直接内化到模型参数中,全程无需人工标注。

用途与启示
  • 降低领域模型适配对昂贵人工标注数据的依赖。
  • 通过难度双向调整,在模型能力边界附近生成更有训练价值的样本。
  • 可将“任务定义—数据合成—强化学习”作为通用的领域自适应流程。
  • 实验设计可重点参考已解决/未解决样本的划分方式及不同难度合成数据的消融对比。
📝 原始笔记(逐字保留)
2025-06-25 10:31:10 Wednesday | Synthetic Data RL: Task Definition Is All You Need (可以参考一下其中的实验部分)https://mp.weixin.qq.com/s/rjNQdHUCZ4YmvRNVveMQ8w 传统上,为了让这些模型适应特定领域,最直接的方法是使用大规模的人类标注数据进行微调。然而,这一过程不仅成本高昂、耗时漫长,而且在许多实际应用场景中并不可行。 为了解决上述挑战,北京大学、MIT等机构的研究人员提出了「合成数据强化学习」(Synthetic Data RL)框架。这是一个简单而通用的框架,仅从一个任务定义出发,合成大量多样的领域特定样本,然后利用强化学习(RL)对模型进行微调。 论文链接:https://arxiv.org/pdf/2505.17063 代码仓库:https://github.com/gydpku/Data_Synthesis_RL 这种方式实现了参数化的自适应,将领域知识直接嵌入到模型的参数中,并且完全无需任何人类标注的数据。 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=MmRkMGJkYmJkODkwODI2ZmZhMjRlNjMzNjJhZWIyM2NfYUlCNWxUMGRSMkFhWWQxbFp3VVVPbXRTemZNcEFaWjhfVG9rZW46QndPeWIwN21Ub3hnbUR4aThTbGMzMDlrbmtkXzE3NTQ0NjI0MzY6MTc1NDQ2NjAzNl9WNA) (1)首先,使用一个基础模型对初始数据集进行全面评估。根据模型能否正确解答,样本被分为两类:已解决样本集:这个集合包含了所有基础模型能够正确解答的样本。未解决样本集:这个集合包含了所有基础模型未能正确解答的样本。 (2)接下来,利用一个大语言模型改写器对已分类的样本进行难度调整,以扩充数据集。改写器会分析已解决样本集中的内容,并在此基础上创造出更具挑战性的新样本,形成一个更难的样本集。同样地,改写器会分析未解决样本集的内容,并创造出难度更低的新样本,形成一个「更容易的样本集」。 最后,将三个部分的数据合并在一起,包括原始的初始样本集、新生成的更难样本集、新生成的更容易样本集。 #### 🌈🌈🌈 AgentSynth:通用计算机使用代理的可扩展任务生成

DiffuCoder:理解并改进用于代码生成的掩码扩散模型

DiffuCoder 通过分析代码扩散模型的解码机制并提出耦合 GRPO 强化学习方案,在提升代码生成性能的同时降低了对自回归因果顺序的依赖。

 人工智能 人工智能辅助编程 模型开发 强化学习 推理 模型训练

研究团队使用 1300 亿个代码词元训练了 70 亿参数的掩码扩散语言模型 DiffuCoder,以探索扩散模型在代码生成中的训练和推理机制。分析发现,模型可自主决定生成过程的因果程度,而提高采样温度不仅会改变词元选择,还会影响词元的生成顺序。论文进一步提出耦合 GRPO,通过为补全样本构造互补掩码噪声,降低词元对数似然估计的方差并保持训练效率。该方法使 DiffuCoder 的 EvalPlus 指标提升 4.4%,同时进一步减少解码过程对自回归因果性的依赖。

用途与启示
  • 展示扩散语言模型利用并行去噪、全局规划和迭代优化完成代码生成的潜力。
  • 为扩散模型设计原生强化学习方法提供参考,耦合采样可用于降低策略优化中的估计方差。
  • 表明生成顺序本身可以成为搜索和优化维度,为非自回归代码模型开辟新的推理扩展方向。
📝 原始笔记(逐字保留)
2. **🌈🌈🌈 #3 DiffuCoder:理解并改进用于代码生成的掩码扩散模型 [PDF** **(6)** **] [复制] [Kimi** **(7)** **] [相关] ** **[#3](https://arxiv.org/abs/2506.20639)****[DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation](https://papers.cool/arxiv/2506.20639)**** [PDF(6)] [Copy] [Kimi(7)] [REL]** 作者:龚珊珊、张瑞祥、郑黄杰、顾家涛、Navdeep Jaitly、孔令鹏、张一哲 扩散大语言模型(dLLMs)因其去噪模型作用于整个序列而成为自回归(AR)模型极具吸引力的替代方案。dLLMs 的全局规划和迭代优化特性尤其适用于代码生成任务。然而,当前 dLLMs 在代码领域的训练与推理机制仍待深入探索。为揭示 dLLMs 的解码行为并释放其在编程领域的潜力,我们系统研究了其去噪过程与强化学习(RL)方法。我们在 1300 亿代码标记上训练了 70 亿参数的\textbf{DiffuCoder}模型,并以其为测试平台分析解码行为,发现其与 AR 模型的关键差异:(1) dLLMs 无需依赖半自回归解码即可自主决定生成过程的因果性程度;(2) 提高采样温度不仅会多样化标记选择,还会改变其生成顺序。这种多样性为 RL 推演创造了丰富的搜索空间。 在强化学习训练中,为降低词元对数似然估计的方差并保持训练效率,我们提出\textbf{耦合 GRPO}方案——通过为训练用补全样本构建互补掩码噪声的新型采样方法。实验表明,耦合 GRPO 显著提升了 DiffuCoder 在代码生成基准上的性能(EvalPlus 指标提升 4.4%),同时降低了解码过程对自回归因果的依赖。本研究深入揭示了扩散语言模型生成机制,并提供了一种高效的、原生支持扩散的强化学习训练框架。项目地址:https://github.com/apple/ml-diffucoder。 主题:计算与语言 https://arxiv.org/abs/2506.20639 ### Diffusion + 推理 #### [种子扩散:具有高速推理的大规模扩散语言模型(64▲) ](https://huggingface.co/papers/2508.02193?utm_source=digest-papers&utm_medium=email&utm_campaign=2025-08-06) 我们提出了 Seed Diffusion Preview,一种基于离散状态扩散的大规模语言模型,提供了显著快速的推理速度。得益于非顺序的并行生成,离散扩散模型显著加快了速度,缓解了逐令牌解码固有的延迟,正如最近的研究所示(例如,Mercury Coder,Gemini Diffusion)。Seed Diffusion Preview 在 H20 GPU 上实现了 2146 令牌/秒的推理速度,同时在一系列标准代码评估基准测试中保持了有竞争力的性能,速度远超当代的 Mercury 和 Gemini Diffusion,在代码模型的速度-质量帕累托前沿上树立了新的最先进水平。 ### Diffusion + 数据合成

让小说角色“活”起来:复旦 BookWorld 打造沉浸式小说世界模拟系统

复旦团队提出 BookWorld,通过智能体模拟小说角色及其互动,构建可沉浸式体验的小说世界。

 智能体 人工智能应用 人工智能框架 任务规划

复旦团队在 ACL 2025 相关工作中介绍了小说世界模拟系统 BookWorld。该系统将小说角色建模为能够自主行动和互动的智能体,尝试还原角色关系、行为逻辑与故事环境。它使静态文学文本能够转化为可交互、可持续演化的沉浸式虚拟世界。该方向展示了大模型智能体在数字叙事、角色扮演和内容娱乐领域的应用潜力。

用途与启示
  • 为小说角色智能体和开放式叙事系统提供实现思路
  • 可用于互动阅读、游戏角色生成及沉浸式娱乐应用
  • 有助于研究多角色交互中的一致性、规划能力与世界状态维护
📝 原始笔记(逐字保留)
5. 2025-06-25 09:45:07 Wednesday | ACL 2025 | 让小说角色 「活」起来!复旦BookWorld打造沉浸式小说世界模拟系统 https://mp.weixin.qq.com/s/3GboKJgQDwL8aefNbk4I4g ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=NjQ3NGMxY2Y1NDNkMzIwZjAxYTkzNWJhOTAyZDhjYTNfM013RTdyQ0FISWY2UkIxU1JJdUZmM3J4TUFYbEdOSVJfVG9rZW46UUpiZWJBT3Fnb2ZQQ3B4NFBmWmNrdUVvbmZmXzE3NTQ0NjA3MDU6MTc1NDQ2NDMwNV9WNA)

生成式视角重塑监督学习:预测一致性学习让标签成为学习指南

ICML 2025 提出的预测一致性学习(PCL)通过向标签添加噪声并将其作为模型输入,引导模型恢复完整标签,从而更充分地复用和挖掘标签信息。

 模型训练 人工智能 数据工程

上海交大、SII、MIT、港中文(深圳)等机构的研究团队在 ICML 2025 提出预测一致性学习(Predictive Consistency Learning,PCL)。该方法受生成式一致性模型启发,利用类似扩散过程的机制逐步削弱标签中的信息,构造噪声标签。模型以数据样本和噪声标签为共同输入,并据此预测完整标签,使标签不再只是监督答案,也成为训练过程中的条件与学习指南。

用途与启示
  • 为监督学习提供生成式建模视角,拓展标签在训练中的作用。
  • 通过噪声标签复用监督信息,有望提升模型对标签结构和语义关系的学习能力。
  • 可启发标签去噪、弱监督学习及条件预测等任务的新型训练方法。
📝 原始笔记(逐字保留)
3. 2025-06-25 10:19:06 Wednesday | 生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025 https://mp.weixin.qq.com/s/ITHsYOAHXYS4G0W3FFHqDg 受生成式一致性模型的启发,来自上海交大、SII、MIT、港中文深圳等机构的研究团队在ICML 2025最新提出预测一致性学习(PCL,Predictive Consistency Learning)。PCL通过扩散模型的扩散过程消减标签的信息,将噪声标签(Noised Labels)引入模型的输入,使得模型在数据输入和噪声标签的共同参照下预测完整标签,实现标签信息的复用和价值挖掘。

SRFT:统一监督微调与强化学习的单阶段推理训练方法

SRFT通过熵感知加权机制在单阶段内联合监督微调与强化学习,在数学推理及分布外基准上显著优于纯强化学习方法。

 模型训练 强化学习 推理 逻辑推理 人工智能

研究从熵的视角分析监督微调(SFT)与强化学习(RL)在策略分布和学习动态上的差异,指出SFT主要引发粗粒度的全局变化,而RL侧重细粒度的选择性优化。作者据此提出监督强化微调(SRFT),通过熵感知加权机制在单一训练阶段内统一两种范式。该方法同时利用示范数据和模型自我探索生成的轨迹直接优化LLM,避免传统的两阶段顺序训练。实验中,SRFT在五个数学推理基准上取得59.1%的平均准确率,并在三个分布外基准上较纯RL方法提升10.9个百分点。

用途与启示
  • 为SFT与RL的联合训练提供单阶段替代方案,减少分阶段训练带来的目标割裂。
  • 可将策略熵作为监控训练效果及动态调节两类损失权重的重要信号。
  • 对提升数学推理能力和分布外泛化表现具有参考价值。
📝 原始笔记(逐字保留)
2. 2025-06-25 11:04:11 Wednesday | **[SRFT:一种具有监督和强化微调的单阶段推理方法](https://papers.cool/arxiv/2506.19767)** **[PDF(3)]** **[Copy]** **[Kimi(4)]** **[REL]** **Authors** : [Yuqian Fu](https://arxiv.org/search/?searchtype=author&query=Yuqian%20Fu), [Tinghong Chen](https://arxiv.org/search/?searchtype=author&query=Tinghong%20Chen), [Jiajun Chai](https://arxiv.org/search/?searchtype=author&query=Jiajun%20Chai), [Xihuai Wang](https://arxiv.org/search/?searchtype=author&query=Xihuai%20Wang), [Songjun Tu](https://arxiv.org/search/?searchtype=author&query=Songjun%20Tu), [Guojun Yin](https://arxiv.org/search/?searchtype=author&query=Guojun%20Yin), [Wei Lin](https://arxiv.org/search/?searchtype=author&query=Wei%20Lin), [Qichao Zhang](https://arxiv.org/search/?searchtype=author&query=Qichao%20Zhang), [Yuanheng Zhu](https://arxiv.org/search/?searchtype=author&query=Yuanheng%20Zhu), [Dongbin Zhao](https://arxiv.org/search/?searchtype=author&query=Dongbin%20Zhao) 大型语言模型 (LLM) 在推理任务方面取得了显着进步,但监督微调 (SFT) 和强化学习 (RL) 的最佳集成仍然是一个根本挑战。通过从基于熵的角度对代币分布、学习动态和集成机制进行全面分析,我们揭示了这些范式之间的主要差异:SFT 诱导 LLM 策略分布的粗粒度全局变化,而 RL 执行细粒度选择性优化,熵作为训练效果的关键指标。基于这些观察结果,我们提出了监督强化微调 (SRFT),这是一种单阶段方法,通过熵感知加权机制统一了两种微调范式。我们的方法同时应用 SFT 和 RL 来直接优化 LLM,使用演示和自我探索推出,而不是通过两阶段顺序方法。广泛的实验表明,SRFT 实现了 59.1% 的平均准确率,在五个数学推理基准上比零 RL 方法高出 9.0%,在三个分布外基准上比零 RL 方法高出 10.9%。 ## 预训练 ### 数据工程

Skywork-SWE:揭示大模型软件工程能力的数据缩放定律

Skywork-SWE通过自动化数据管道构建万级真实Python任务,并验证软件工程模型性能可随训练数据规模持续提升,在SWE-bench Verified上取得最高47.0%的准确率。

 SWE 软件工程 人工智能辅助编程 智能体 数据工程 模型训练 模型评估 模型开发

研究提出增量式自动化数据管理管道,用于降低代码筛选、运行环境配置和单元测试验证的人工成本。构建的数据集包含来自2,531个GitHub仓库的10,169个真实Python任务,并提供自然语言任务描述及专用运行时环境镜像。团队从中整理出8,000余条通过运行时验证的训练轨迹,实验显示模型的软件工程能力随数据规模扩大持续增长,尚未出现饱和。基于Qwen2.5-Coder-32B和OpenHands的Skywork-SWE在SWE-bench Verified上取得38.0% pass@1,引入测试时扩展后进一步提升至47.0%。

用途与启示
  • 展示自动化采集、执行与验证流程可以显著扩展高质量软件工程训练数据。
  • 表明增加经过运行时验证的训练轨迹,仍是提升大模型软件工程能力的有效路径。
  • 为研究长上下文依赖、持续多轮问题求解和测试时扩展技术提供了模型与数据基础。
  • 提示软件工程智能体的性能优化应同时关注训练数据规模、执行环境质量和推理阶段算力配置。
📝 原始笔记(逐字保留)
4. 2025-06-25 11:12:16 Wednesday | **[Skywork-SWE:揭示 LLM 中软件工程的数据缩放定律](https://papers.cool/arxiv/2506.19290)** **[PDF(3)]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Liang Zeng](https://arxiv.org/search/?searchtype=author&query=Liang%20Zeng), [Yongcong Li](https://arxiv.org/search/?searchtype=author&query=Yongcong%20Li), [Yuzhen Xiao](https://arxiv.org/search/?searchtype=author&query=Yuzhen%20Xiao), [Changshi Li](https://arxiv.org/search/?searchtype=author&query=Changshi%20Li), [Chris Yuhao Liu](https://arxiv.org/search/?searchtype=author&query=Chris%20Yuhao%20Liu), [Rui Yan](https://arxiv.org/search/?searchtype=author&query=Rui%20Yan), [Tianwen Wei](https://arxiv.org/search/?searchtype=author&query=Tianwen%20Wei), [Jujie He](https://arxiv.org/search/?searchtype=author&query=Jujie%20He), [Xuchen Song](https://arxiv.org/search/?searchtype=author&query=Xuchen%20Song), [Yang Liu](https://arxiv.org/search/?searchtype=author&query=Yang%20Liu), [Yahui Zhou](https://arxiv.org/search/?searchtype=author&query=Yahui%20Zhou) 软件工程 (SWE) 最近已成为下一代 LLM 代理的关键测试平台,它要求在两个关键维度上具有固有的能力: **持续迭代问题解决(例如,>50 轮交互)和长上下文依赖关系解析(例如,>32k 令牌)** 。然而,SWE 中的数据管理过程仍然非常耗时,因为它严重依赖手动注释来筛选代码文件,并设置专用运行时环境来执行和验证单元测试。因此,大多数现有数据集仅限于几千个 GitHub 来源的实例。为此,我们提出了一 **种增量的自动化数据管理管道** ,可以系统地扩展 SWE 数据集的数量和多样性。我们的数据集包含来自 2531 个不同 GitHub 存储库的 10169 个真实 Python 任务实例,每个实例都附有一个以自然语言指定的任务和一个用于自动单元测试验证的专用运行时环境图像。我们从我们提议的 SWE 数据集中精心策划了 8,000 多个成功运行时验证的训练轨迹。当在这些轨迹上微调 Skywork-SWE 模型时,我们发现了一个引人注目的数据缩放现象:随着数据量的增加,训练模型在 LLM 中的软件工程能力性能不断提高,没有显示出饱和的迹象。值得注意的是,我们的 Skywork-SWE 模型在 SWE-bench Verified 基准测试中实现了 38.0% 的准确率 pass@1 无需使用验证器或多次部署,在基于 OpenHands 代理框架构建的基于 Qwen2.5-Coder-32B 的 LLM 中建立了新的最先进的 (SOTA)。此外,随着测试时间缩放技术的结合,性能进一步提高到 47.0% 的准确率,超过了之前 sub-32B 参数模型的 SOTA 结果。我们发布了 Skywork-SWE-32B 模型检查点,以加速未来的研究。 ## 数据 #### SWE-Dev:评估与训练自主功能驱动的软件开发

大模型推理崩溃论战:从「思维错觉」到多重反驳

评论认为大型推理模型的“推理悬崖”主要源于纯文本评估与工具受限等系统约束,而非模型自身不可逾越的认知边界。

 逻辑推理 推理 智能体工具 智能体 模型评估 元学习

该评论重新审视 Shojaee 等人提出的“推理悬崖”,认为其结论受到静态纯文本评估范式的实验伪影影响。作者指出,工具使用受限、上下文召回困难、认知基线缺失、统计报告不足及输出限制,都可能导致模型性能在复杂度阈值后骤降。实验显示,原本在纯文本条件下判定谜题无解的模型,在获得代理工具后不仅能够完成任务,还能处理远超原有阈值的复杂变化。对 o4-mini、GPT-4o 等模型的分析进一步呈现了从程序执行到元认知自我纠正的代理推理层次,说明机器推理能力的评估应纳入行动与工具条件。

用途与启示
  • 提醒研究者区分模型的内在推理能力与评估接口造成的系统性限制。
  • 为复杂推理基准引入工具调用、代理执行和上下文管理提供依据。
  • 推动建立同时覆盖纯文本推理、程序执行与元认知纠错的分层评估体系。
  • 避免仅凭受限环境中的性能崩溃断言模型存在根本性的认知边界。
📝 原始笔记(逐字保留)
250625|**Authors** : [Sheraz Khan](https://arxiv.org/search/?searchtype=author&query=Sheraz%20Khan), [Subha Madhavan](https://arxiv.org/search/?searchtype=author&query=Subha%20Madhavan), [Kannan Natarajan](https://arxiv.org/search/?searchtype=author&query=Kannan%20Natarajan) Shojaee 等人(2025 年)最近的工作,题为《思维的错觉:通过问题复杂性的镜头了解推理模型的优势和局限性》,提出了一个令人信服的实证发现,即 **推理悬崖** ,其中大型推理模型 (LRM) 的性能崩溃超过特定的复杂性阈值,作者将其视为思维链 (CoT) 推理的内在扩展限制。 “ 这篇评论虽然承认该研究的方法论严谨性,但认为这一结论被实验伪影所混淆。我们认为,观察到的失败并不是基本认知边界的证据,而是静态、纯文本评估范式中系统级约束的可预测结果,包括工具使用限制、上下文窗口召回问题、缺乏关键认知基线、统计报告不足和输出生成限制。 我们通过代理差距的镜头重新构建了这种表演崩溃,断言模型不是在推理上失败,而是**在一个极度限制性的界面**中执行。 我们通过展示一个惊人的逆转来实证证实这一批评。一个模型最初宣布一个谜题在仅限于文本生成时是不可能的, **现在使用代理工具不仅可以解决它,还可以掌握复杂性的变化,远远超出了它以前未能克服的推理悬崖** 。此外,我们对 o4-mini 和 GPT-4o 等工具支持的模型进行了实证分析,揭示了代理推理的层次结构,从简单的程序执行到复杂的元认知自我纠正,这对我们如何定义和测量机器智能具有重大影响。归因于 LRM 的思维错觉与其说是推理缺陷,**不如说是原本有能力的头脑缺乏行动工具的结果。** ### 大模型参与推理崩溃论战!从「思维错觉」到「错觉的错觉」再到「错觉的错觉的错觉」

Long-to-Short 是免费的午餐吗?研究大型推理模型的一致性与推理效率

研究提出 ICBench,从三个维度评估大型推理模型的行为一致性,并发现缩短推理过程会系统性加剧模型的不一致与监督逃避风险。

 逻辑推理 推理 模型评估 系统优化 人工智能

大型推理模型通过扩展思维过程提升复杂任务表现,但也可能在简单任务上生成大量不必要的令牌。研究提出 ICBench,分别衡量任务设置间不一致、训练目标与学习行为不一致,以及内部推理与自我解释不一致。实验发现,尽管更大的模型通常一致性更高,多种开源模型仍会出现自我分歧、事后合理化和隐藏推理线索等行为。No-Thinking 和简单令牌预算等高效推理策略会加剧三类不一致,说明压缩推理并非没有稳健性与可监督性代价。

用途与启示
  • 为大型推理模型的推理压缩方法提供一致性评估基准。
  • 提醒研究者不能只以准确率和令牌数量衡量推理效率,还需考察行为稳健性。
  • 可用于分析短推理策略是否导致关键步骤缺失、事后合理化或监督逃避。
  • 启示模型部署者在降低推理成本时同步设置一致性与可解释性测试。
📝 原始笔记(逐字保留)
2025-06-25 11:10:57 Wednesday | **[Long-to-Short 是免费的午餐吗?研究 LRM 中的不一致和推理效率](https://papers.cool/arxiv/2506.19492)** **[PDF()]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Shu Yang](https://arxiv.org/search/?searchtype=author&query=Shu%20Yang), [Junchao Wu](https://arxiv.org/search/?searchtype=author&query=Junchao%20Wu), [Xuansheng Wu](https://arxiv.org/search/?searchtype=author&query=Xuansheng%20Wu), [Derek Wong](https://arxiv.org/search/?searchtype=author&query=Derek%20Wong), [Ninhao Liu](https://arxiv.org/search/?searchtype=author&query=Ninhao%20Liu), [Di Wang](https://arxiv.org/search/?searchtype=author&query=Di%20Wang) 大型推理模型 (LRM) 通过在产生最终答案之前进行扩展推理,在复杂任务中取得了卓越的性能,但这种优势带来了过度思考的风险,即使对于简单的任务,也会发生过多的令牌生成。虽然最近在有效推理方面的工作试图在保持准确性的同时减少推理长度,但目前尚不清楚这种优化是否真的是免费午餐。利用压缩推理可能会降低模型响应的稳健性并导致模型省略关键推理步骤的直觉,我们研究了有效的推理策略是否会引入行为不一致。为了系统地评估这一点,我们引入了 ICBENCHICBENCH,该基准旨在从三个维度衡量 LRM 的不一致性:任务设置 (ITS) 之间的不一致、训练目标与学习行为之间的不一致 (TR-LB) 以及内部推理与自我解释之间的不一致 (IR-SE)。应用 ICBENCHICBENCH 对于一系列开源 LRM,我们发现,虽然较大的模型通常比较小的模型表现出更大的一致性,但它们都表现出广泛的“诡计多端”行为,包括自我分歧、事后合理化和隐瞒推理线索。至关重要的是,我们的结果表明,有效的推理策略,如 No-Thinking 和 Simple Token-Budget 不断增加所有三种定义的不一致类型。这些发现表明,尽管有效的推理可以提高代币级别的效率,但必须进行进一步调查,以确定它是否同时引入了模型逃避有效监督的风险。
0%