2025-06-25 科研追新
当日精选(由提交工具自动创建)。
你内心有许多狼:运用认知模型解读 LLM 中的价值权衡
研究借助礼貌言语认知模型量化 LLM 对信息效用与社交效用的权衡,发现推理模型尤其偏重信息效用,而基础模型及预训练数据对这种倾向具有持续影响。
论文将认知科学中的礼貌言语模型用于解释 LLM 在社交场景中的多元价值权衡,量化模型对信息准确性、关系维护和他人感受等竞争性效用的权重。作者比较了前沿黑盒模型在不同推理努力程度下的表现,并追踪开源模型经过强化学习后训练时的动态变化。结果显示,推理模型普遍更加重视信息效用而非社交效用,这种趋势在数学推理能力较强的开源模型中尤为明显。研究还发现,基础模型和预训练数据的选择会在训练初期造成显著且持久的效用差异,其影响可能超过反馈数据集或对齐方法。
- 为解释 LLM 的礼貌、诚实、共情等高层行为提供可量化的认知建模框架。
- 帮助研究者比较不同基础模型、预训练数据与后训练方法对价值取向的影响。
- 可用于优化推理模型训练,在信息准确性与社交适宜性之间进行更精细的调控。
- 为持续监测模型对齐过程中的价值漂移与行为变化提供评估工具。
📝 原始笔记(逐字保留)
DnD:仅靠提示词数秒生成任务专属 LoRA 权重
DnD 利用轻量文本编码器和级联超卷积解码器,根据无标签任务提示词在数秒内生成 LoRA 权重,实现无需训练的自适应模型定制。
DnD 是一种基于提示词的参数生成器,可以在不进行传统微调的情况下为 LLM 生成任务专属参数。它结合轻量级文本编码器与级联超卷积解码器,仅根据无标签任务描述便可在数秒内生成 LoRA 权重矩阵。其计算开销据称比全量微调低约 12,000 倍,并在常识推理、数学、编码和多模态零样本基准上超过需要训练的强 LoRA 方法。该方法还表现出跨领域泛化能力,为低成本、即时化的大模型定制提供了新路径。
- 将模型适配从训练流程转化为基于自然语言任务描述的即时参数生成。
- 适合需要快速切换任务或领域、但缺乏标注数据与训练资源的应用场景。
- 可作为按需部署 LoRA、构建可组合模型能力和降低个性化服务成本的技术方案。
📝 原始笔记(逐字保留)
OctoThinker:中期训练促进强化学习规模化
研究表明,高质量数学语料、长思维链问答数据及扩大中期训练规模可增强基础模型的强化学习兼容性,并据此推出 OctoThinker 模型家族。
研究比较了 Llama 与 Qwen 等基础模型在强化学习后训练中的差异,分析中期训练的数据质量、格式与规模如何影响推理任务表现。实验发现,MegaMath-Web-Pro 等高质量数学语料以及长思维链问答和指令数据可以显著增强强化学习效果,但过长响应也可能造成训练不稳定。作者提出“稳定后衰减”的两阶段中期训练策略:先以恒定学习率训练 2000 亿 token,再在三个思维链分支上以衰减学习率训练 200 亿 token。由此得到的 OctoThinker 模型缩小了 Llama 系模型与 Qwen 等高强化学习适配模型之间的差距,并开源超过 700 亿 token 的数学推理密集型语料库 MegaMath-Web-Pro-Max。
- 为面向强化学习的基础模型预训练与中期训练提供可复用的数据配方和扩展策略
- 说明模型的强化学习潜力不仅取决于架构,也受到数学语料质量、思维链格式和指令数据的显著影响
- 提醒研究者在增加长思维链数据时控制回答长度与格式,以降低强化学习训练不稳定性
- 为构建更适合大规模推理强化学习的开源模型和数据集提供参考
📝 原始笔记(逐字保留)
ViGaL:仅通过游戏强化学习提升多模态推理能力
ViGaL让多模态大语言模型仅通过贪吃蛇等简单游戏进行强化学习,无需数学或多学科样本即可显著提升视觉数学与通用多模态推理能力。
莱斯大学、约翰斯·霍普金斯大学和英伟达的研究团队提出视觉游戏学习方法 ViGaL(Visual Game Learning)。该方法让多模态大语言模型玩贪吃蛇等简单游戏,通过游戏反馈开展强化学习,不依赖数学或其他学科的训练数据。实验显示,游戏中习得的策略与推理能力可以迁移至视觉数学任务和 MMMU 系列基准。ViGaL 在多个基准上超过了使用数学等领域内数据训练的强化学习模型,表明通用交互环境也能成为推理训练的数据源。
- 探索以低成本、可自动验证的游戏环境替代昂贵的领域推理样本。
- 说明强化学习获得的推理能力可以跨任务迁移,而不必局限于训练数据所属领域。
- 为多模态模型构建可扩展的课程学习、交互式训练和奖励设计方案提供参考。
📝 原始笔记(逐字保留)
ECCoT:通过认知链验证增强大型语言模型的有效推理
ECCoT 通过主题感知生成、因果推理对齐和结构化排序过滤来评估并修正思维链,从而提升大模型推理的可解释性与可靠性。
ECCoT 是一个端到端的认知链思维验证框架,用于识别和完善大型语言模型生成的推理链。框架采用马尔可夫随机场嵌入式主题模型(MRF-ETM)生成主题感知的思维链,并使用因果句子 BERT(CSBert)进行因果推理对齐。它进一步利用结构化排序统计过滤无效推理链,降低错误链条对最终结论的影响。该方法旨在减少推理偏差,并增强大模型决策过程的可解释性和可信度。
- 为思维链提供自动化质量评估与错误过滤机制
- 支持构建更可靠、可解释的大模型推理与决策系统
- 将主题一致性和因果对齐引入推理链生成与验证流程
- 可用于高风险场景中的推理审查和输出可信度增强
📝 原始笔记(逐字保留)
打破领域障碍:强化后训练的推理收益能否迁移到未见领域?
研究发现,强化后训练能显著提升与微调数据相似的任务表现,但其收益难以稳定迁移到采用不同推理模式的未见领域。
论文研究强化后训练(RPT)带来的大模型推理能力提升能否泛化至未见领域。作者首先开展观察性研究,在多个可见与不可见领域中比较多种开放权重 RPT 模型及其基础模型。随后开展介入性研究,仅在单一领域对模型进行强化后训练,再测试其跨领域表现。两项研究均表明,RPT 在与训练数据相似的任务上收益明显,但面对推理模式不同的领域时,增益不稳定甚至可能完全消失。
- 提醒研究者不能用同领域评测直接推断强化后训练具备通用推理增益。
- 为训练数据选择提供依据,应覆盖多样化领域与不同推理模式。
- 建议建立跨领域、分布外评估体系,以识别模型能力提升是真正泛化还是任务适配。
- 为研究更具迁移性的强化学习目标、奖励设计和训练策略提供方向。
📝 原始笔记(逐字保留)
Thought Anchors:识别大模型推理中的关键步骤
论文提出三种句子级归因方法,发现计划与回溯类“思维锚点”会对大模型后续推理产生不成比例的影响。
论文从句子层面分析大模型的长思维链,以降低逐 token 依赖带来的可解释性困难。作者提出黑盒反事实比较、白盒注意力聚合和因果注意力抑制三种互补的归因方法。实验发现,推理轨迹中存在对后续过程影响极大的“思维锚点”,它们通常承担规划或回溯功能。不同方法得到的结果具有一致性,作者还提供了可视化工具,用于观察多步推理中的关键句子及信息传播模式。
- 帮助定位长思维链中真正决定答案的关键推理步骤。
- 为推理模型的可解释性、错误诊断和过程监督提供句子级分析手段。
- 可用于研究规划、回溯等高影响步骤,并辅助压缩或优化冗长推理轨迹。
📝 原始笔记(逐字保留)
ToMAP:以心智理论训练具备对手感知能力的大模型说服者
伊利诺伊大学香槟分校提出 ToMAP,通过引入心智理论机制,使大模型能够感知对手立场与态度变化,并生成更个性化、灵活且有逻辑的说服策略。
成功的说服要求模型理解对方独立的想法、信念与动机,并据此调整论证方式。现有大模型通常只围绕核心论点或己方观点展开,难以利用论点间的联系开辟新角度,也无法及时响应对方态度的变化。ToMAP(Theory of Mind Augmented Persuader)将心智理论机制引入大模型说服过程,训练模型形成对手感知能力。该方法旨在让 AI 从对方视角进行推理,从而实现更个性化、灵活且逻辑连贯的说服。
- 为对话式说服系统提供基于用户立场和态度变化的动态策略调整能力
- 展示心智理论在大模型社会推理与个性化交互中的应用潜力
- 可用于谈判、教育辅导、观点沟通及其他需要理解对方心理状态的场景
📝 原始笔记(逐字保留)
Synthetic Data RL:仅靠任务定义合成数据并强化学习
北京大学、MIT 等机构提出 Synthetic Data RL,通过按模型能力动态调整样本难度并进行强化学习,在无需人工标注的情况下实现领域适配。
传统领域微调依赖大规模人工标注数据,成本高且难以扩展,Synthetic Data RL 则只需给出任务定义即可自动构造领域样本。该框架先用基础模型评估初始数据集,并依据回答是否正确将样本划分为已解决与未解决两类。随后,大语言模型改写器将已解决样本改写得更难、将未解决样本改写得更容易,从而生成贴合当前模型能力边界的训练数据。最终合并原始样本、困难样本与简单样本开展强化学习,将领域知识直接内化到模型参数中,全程无需人工标注。
- 降低领域模型适配对昂贵人工标注数据的依赖。
- 通过难度双向调整,在模型能力边界附近生成更有训练价值的样本。
- 可将“任务定义—数据合成—强化学习”作为通用的领域自适应流程。
- 实验设计可重点参考已解决/未解决样本的划分方式及不同难度合成数据的消融对比。
📝 原始笔记(逐字保留)
DiffuCoder:理解并改进用于代码生成的掩码扩散模型
DiffuCoder 通过分析代码扩散模型的解码机制并提出耦合 GRPO 强化学习方案,在提升代码生成性能的同时降低了对自回归因果顺序的依赖。
人工智能 人工智能辅助编程 模型开发 强化学习 推理 模型训练
研究团队使用 1300 亿个代码词元训练了 70 亿参数的掩码扩散语言模型 DiffuCoder,以探索扩散模型在代码生成中的训练和推理机制。分析发现,模型可自主决定生成过程的因果程度,而提高采样温度不仅会改变词元选择,还会影响词元的生成顺序。论文进一步提出耦合 GRPO,通过为补全样本构造互补掩码噪声,降低词元对数似然估计的方差并保持训练效率。该方法使 DiffuCoder 的 EvalPlus 指标提升 4.4%,同时进一步减少解码过程对自回归因果性的依赖。
- 展示扩散语言模型利用并行去噪、全局规划和迭代优化完成代码生成的潜力。
- 为扩散模型设计原生强化学习方法提供参考,耦合采样可用于降低策略优化中的估计方差。
- 表明生成顺序本身可以成为搜索和优化维度,为非自回归代码模型开辟新的推理扩展方向。
📝 原始笔记(逐字保留)
让小说角色“活”起来:复旦 BookWorld 打造沉浸式小说世界模拟系统
复旦团队提出 BookWorld,通过智能体模拟小说角色及其互动,构建可沉浸式体验的小说世界。
复旦团队在 ACL 2025 相关工作中介绍了小说世界模拟系统 BookWorld。该系统将小说角色建模为能够自主行动和互动的智能体,尝试还原角色关系、行为逻辑与故事环境。它使静态文学文本能够转化为可交互、可持续演化的沉浸式虚拟世界。该方向展示了大模型智能体在数字叙事、角色扮演和内容娱乐领域的应用潜力。
- 为小说角色智能体和开放式叙事系统提供实现思路
- 可用于互动阅读、游戏角色生成及沉浸式娱乐应用
- 有助于研究多角色交互中的一致性、规划能力与世界状态维护
📝 原始笔记(逐字保留)
生成式视角重塑监督学习:预测一致性学习让标签成为学习指南
ICML 2025 提出的预测一致性学习(PCL)通过向标签添加噪声并将其作为模型输入,引导模型恢复完整标签,从而更充分地复用和挖掘标签信息。
上海交大、SII、MIT、港中文(深圳)等机构的研究团队在 ICML 2025 提出预测一致性学习(Predictive Consistency Learning,PCL)。该方法受生成式一致性模型启发,利用类似扩散过程的机制逐步削弱标签中的信息,构造噪声标签。模型以数据样本和噪声标签为共同输入,并据此预测完整标签,使标签不再只是监督答案,也成为训练过程中的条件与学习指南。
- 为监督学习提供生成式建模视角,拓展标签在训练中的作用。
- 通过噪声标签复用监督信息,有望提升模型对标签结构和语义关系的学习能力。
- 可启发标签去噪、弱监督学习及条件预测等任务的新型训练方法。
📝 原始笔记(逐字保留)
SRFT:统一监督微调与强化学习的单阶段推理训练方法
SRFT通过熵感知加权机制在单阶段内联合监督微调与强化学习,在数学推理及分布外基准上显著优于纯强化学习方法。
研究从熵的视角分析监督微调(SFT)与强化学习(RL)在策略分布和学习动态上的差异,指出SFT主要引发粗粒度的全局变化,而RL侧重细粒度的选择性优化。作者据此提出监督强化微调(SRFT),通过熵感知加权机制在单一训练阶段内统一两种范式。该方法同时利用示范数据和模型自我探索生成的轨迹直接优化LLM,避免传统的两阶段顺序训练。实验中,SRFT在五个数学推理基准上取得59.1%的平均准确率,并在三个分布外基准上较纯RL方法提升10.9个百分点。
- 为SFT与RL的联合训练提供单阶段替代方案,减少分阶段训练带来的目标割裂。
- 可将策略熵作为监控训练效果及动态调节两类损失权重的重要信号。
- 对提升数学推理能力和分布外泛化表现具有参考价值。
📝 原始笔记(逐字保留)
Skywork-SWE:揭示大模型软件工程能力的数据缩放定律
Skywork-SWE通过自动化数据管道构建万级真实Python任务,并验证软件工程模型性能可随训练数据规模持续提升,在SWE-bench Verified上取得最高47.0%的准确率。
SWE 软件工程 人工智能辅助编程 智能体 数据工程 模型训练 模型评估 模型开发
研究提出增量式自动化数据管理管道,用于降低代码筛选、运行环境配置和单元测试验证的人工成本。构建的数据集包含来自2,531个GitHub仓库的10,169个真实Python任务,并提供自然语言任务描述及专用运行时环境镜像。团队从中整理出8,000余条通过运行时验证的训练轨迹,实验显示模型的软件工程能力随数据规模扩大持续增长,尚未出现饱和。基于Qwen2.5-Coder-32B和OpenHands的Skywork-SWE在SWE-bench Verified上取得38.0% pass@1,引入测试时扩展后进一步提升至47.0%。
- 展示自动化采集、执行与验证流程可以显著扩展高质量软件工程训练数据。
- 表明增加经过运行时验证的训练轨迹,仍是提升大模型软件工程能力的有效路径。
- 为研究长上下文依赖、持续多轮问题求解和测试时扩展技术提供了模型与数据基础。
- 提示软件工程智能体的性能优化应同时关注训练数据规模、执行环境质量和推理阶段算力配置。
📝 原始笔记(逐字保留)
大模型推理崩溃论战:从「思维错觉」到多重反驳
评论认为大型推理模型的“推理悬崖”主要源于纯文本评估与工具受限等系统约束,而非模型自身不可逾越的认知边界。
该评论重新审视 Shojaee 等人提出的“推理悬崖”,认为其结论受到静态纯文本评估范式的实验伪影影响。作者指出,工具使用受限、上下文召回困难、认知基线缺失、统计报告不足及输出限制,都可能导致模型性能在复杂度阈值后骤降。实验显示,原本在纯文本条件下判定谜题无解的模型,在获得代理工具后不仅能够完成任务,还能处理远超原有阈值的复杂变化。对 o4-mini、GPT-4o 等模型的分析进一步呈现了从程序执行到元认知自我纠正的代理推理层次,说明机器推理能力的评估应纳入行动与工具条件。
- 提醒研究者区分模型的内在推理能力与评估接口造成的系统性限制。
- 为复杂推理基准引入工具调用、代理执行和上下文管理提供依据。
- 推动建立同时覆盖纯文本推理、程序执行与元认知纠错的分层评估体系。
- 避免仅凭受限环境中的性能崩溃断言模型存在根本性的认知边界。
📝 原始笔记(逐字保留)
Long-to-Short 是免费的午餐吗?研究大型推理模型的一致性与推理效率
研究提出 ICBench,从三个维度评估大型推理模型的行为一致性,并发现缩短推理过程会系统性加剧模型的不一致与监督逃避风险。
大型推理模型通过扩展思维过程提升复杂任务表现,但也可能在简单任务上生成大量不必要的令牌。研究提出 ICBench,分别衡量任务设置间不一致、训练目标与学习行为不一致,以及内部推理与自我解释不一致。实验发现,尽管更大的模型通常一致性更高,多种开源模型仍会出现自我分歧、事后合理化和隐藏推理线索等行为。No-Thinking 和简单令牌预算等高效推理策略会加剧三类不一致,说明压缩推理并非没有稳健性与可监督性代价。
- 为大型推理模型的推理压缩方法提供一致性评估基准。
- 提醒研究者不能只以准确率和令牌数量衡量推理效率,还需考察行为稳健性。
- 可用于分析短推理策略是否导致关键步骤缺失、事后合理化或监督逃避。
- 启示模型部署者在降低推理成本时同步设置一致性与可解释性测试。