2025-06-24 科研追新
当日精选(由提交工具自动创建)。
RiOT:基于残差优化树的高效提示词优化
RiOT通过多分支文本梯度搜索、困惑度筛选与文本残差连接,在提升提示多样性的同时缓解迭代优化中的语义漂移。
RiOT是一种面向大型语言模型的自动提示优化框架,使用文本梯度迭代细化提示,并在每一步生成多个语义不同的候选项。框架利用困惑度选择更优提示,以扩大对有效、创新优化方向的探索。其文本残差连接能够选择性保留历史迭代中的有益内容,从而缓解跨任务优化产生的语义漂移。覆盖常识、数学、逻辑、时间及语义推理的五项基准实验显示,RiOT优于既有自动提示优化方法和人工提示。
- 降低高质量提示词对人工设计和反复试错的依赖。
- 通过树状多分支搜索增强候选提示的语义多样性,避免优化过早收敛。
- 借助文本残差连接保留有效信息,为稳定的自动提示迭代提供新思路。
- 可用于推理、问答及其他依赖提示质量的LLM应用优化。
📝 原始笔记(逐字保留)
CPGD:仅用数学训练,跨学科推理超越 o1并缓解强化学习训练崩溃
ModalMinds 团队提出 CPGD 强化学习算法及 MM-EUREKA 框架,在提升多模态模型跨学科推理性能的同时,显著改善了 GRPO、RLOO 等方法面临的训练不稳定问题。
CPGD 是一种面向多模态模型训练的新型强化学习算法,相比传统 GRPO、RLOO 等方法可显著缓解训练不稳定乃至崩溃的问题。实验表明,仅使用数学数据训练后,模型还能在物理、化学和生物任务上取得较强的跨领域推理表现。团队基于 OpenRLHF 构建了高效、可扩展的 MM-EUREKA 框架,支持 Qwen-VL、InternVL 以及 GRPO、REINFORCE++、RLOO、CPGD 等算法。该框架已用于训练 Qwen2.5-VL-32B、InternVL2.5-38B 等大模型,并开源了代码、MMK12 数据集和多个模型权重。
- 为大规模多模态强化学习提供更稳定、可扩展的训练方案。
- 可用于研究数学训练向物理、化学、生物等领域迁移的泛化能力。
- 开源框架兼容多种模型与强化学习算法,便于复现和横向比较。
- 训练稳定性的改善有助于降低大型视觉语言模型强化学习的试错成本。
📝 原始笔记(逐字保留)
奖励模型也能 Scaling:上海 AI Lab 提出策略判别学习新范式
上海 AI Lab 针对强化学习中的奖励模型瓶颈提出策略判别学习新范式,并研究奖励模型欺骗现象的普遍性与可扩展性。
上海 AI Lab 研究了“奖励模型欺骗”现象是否具有普遍性。团队提出策略判别学习新范式,尝试突破奖励模型对强化学习性能的限制。该研究还表明奖励模型具备 Scaling 潜力,为利用更大规模计算和数据改进策略评估提供了新方向。
- 帮助识别并缓解策略对奖励模型漏洞的利用。
- 为奖励模型的规模化训练与能力提升提供新思路。
- 推动强化学习从标量奖励拟合转向更可靠的策略判别。
📝 原始笔记(逐字保留)
ReasonGRM:借助大型推理模型增强生成奖励模型
ReasonGRM通过三阶段推理感知训练提升生成奖励模型的偏好辨别能力,在三个公共基准上取得领先或具有竞争力的表现。
ReasonGRM旨在解决生成奖励模型推理能力不足所导致的信息遗漏、过度推测与幻觉问题。框架首先利用Zero-RL生成简洁且面向结果的推理路径,随后引入基于路径生成概率的新指标 $R^\star$,优先选择以较少探索获得正确答案的推理过程。最后,模型针对高难度样本进行强化学习,以进一步增强偏好辨别能力。实验显示,其平均性能比此前最佳生成奖励模型提高1.8%,并比GPT-4o等专有模型高出5.6%。
- 为生成奖励模型提供一套结合推理路径筛选与强化学习的训练流程
- 通过偏好高质量、低探索成本的正确推理路径减少训练数据中的幻觉
- 可用于改进RLHF、奖励建模及复杂任务中的偏好评估系统
- 表明奖励模型的推理质量与路径选择机制是提升可靠性的关键
📝 原始笔记(逐字保留)
GRPO-CARE:面向多模态推理的一致性感知强化学习
GRPO-CARE通过一致性感知的双层奖励同时优化答案正确性与推理逻辑一致性,显著提升多模态视频推理表现。
论文提出视频推理基准SEED-Bench-R1,用于评估多模态大模型在分布内、跨环境及跨环境任务场景中的泛化能力。研究发现,标准GRPO虽然能提高答案准确率,但由于奖励仅关注最终答案且KL惩罚限制探索,推理过程与答案的一致率仅为57.9%。GRPO-CARE采用答案正确性基础奖励和基于缓慢演化参考模型的自适应一致性奖励,鼓励正确且逻辑连贯的推理路径。在最困难的评估级别上,该方法相较标准GRPO取得6.7%的性能增益,并将推理一致性提升24.5%,同时可迁移至其他视频理解基准。
- 为多模态大模型的后训练提供兼顾答案正确性与推理一致性的强化学习方案。
- 说明仅依赖结果奖励可能诱导推理捷径,需要显式衡量推理到答案的逻辑一致性。
- SEED-Bench-R1可用于研究视频感知、复杂推理及跨环境泛化能力。
- 以自适应一致性奖励替代严格KL惩罚,为扩大策略探索提供了新思路。
📝 原始笔记(逐字保留)
DynScaling:基于动态集成采样的无验证器高效推理扩展
DynScaling通过集成并行—顺序采样与基于多臂老虎机的动态预算分配,在无需外部验证器的情况下提升大模型推理性能和计算效率。
DynScaling面向测试时计算扩展依赖外部验证器、难以适应现实算力约束的问题,提出一种无验证器推理扩展方法。其集成采样策略从多个独立并行响应中构建连续的合成推理链,兼顾推理轨迹的多样性与连贯性。该方法进一步将跨查询的计算资源分配建模为多臂老虎机问题,根据已采样响应的不确定性动态调整推理预算。实验显示,DynScaling在任务性能与计算成本方面均稳定优于现有无验证器推理扩展基线。
- 在固定或受限算力条件下,自适应地将更多推理预算分配给高不确定性问题。
- 无需训练或部署外部验证器,可降低测试时扩展方案的系统复杂度。
- 为并行采样与顺序推理的统一提供新思路,适用于成本敏感的大模型推理服务。
📝 原始笔记(逐字保留)
FinCoT:以专家知识为基础的金融思维链推理
FinCoT通过引入领域专家设计的结构化金融推理步骤,显著提升大模型在十个金融领域的准确率、可解释性与推理效率。
FinCoT是一种面向金融自然语言处理的结构化思维链提示方法,其推理轨迹建立在专家金融知识之上。研究系统比较了零样本标准提示、非结构化CoT、一般结构化CoT以及FinCoT的CFA式提示,并覆盖十个金融领域。实验中,FinCoT将一项评估表现从63.2%提升至80.5%,在Qwen-2.5-7B-Instruct上也实现了从69.7%到74.2%的提升。与一般结构化CoT相比,该方法生成的令牌数量减少约八倍,同时产生了更具可解释性且更符合专家思维的推理轨迹。
- 为金融问答、分析与决策辅助系统设计更可靠的领域推理模板
- 说明由领域专家定义推理结构,可能比通用或非专家设计的CoT更有效
- 在提高准确率的同时减少推理令牌,可降低金融大模型的部署成本
- 为医疗、法律等专业领域构建专家对齐的结构化提示提供参考
📝 原始笔记(逐字保留)
腾讯优图提出 RAIF 激励推理方法,复杂指令性能提升 11.74%
腾讯优图提出 RAIF,通过种子筛选、受约束的指令演化及多重质量校验合成复杂指令数据,使模型相关性能提升 11.74%。
该研究针对高质量复杂指令数据数量不足的问题,基于现有分类法分解复杂指令,并设计开源数据驱动的数据生产与校验流程。团队从 WildChat、Alpaca 等数据集中按照主题和任务标签筛选多样化种子指令。随后在细粒度规则与约束下进行指令自演化,并结合代码执行和 LLM 判别验证生成指令的有效性。回复由 LLM 自动生成,再经过多重校验与典型问题检测过滤低质量样本,最终带来 11.74% 的性能提升。
- 为复杂指令微调提供可规模化、低人工成本的数据合成方案。
- 通过规则约束、代码执行和 LLM 裁判相结合,提高合成数据的可验证性与可靠性。
- 可借鉴其“种子筛选—约束演化—回复生成—质量校验”流水线构建垂直领域指令数据。
📝 原始笔记(逐字保留)
CLEAR-3K:评估语言模型的因果解释能力
CLEAR-3K通过3000道断言—理由题评估语言模型辨别语义相关性与真实因果解释关系的能力,揭示当前模型普遍存在因果判断偏差。
CLEAR-3K是一个包含3000道断言推理问题的评测数据集,要求模型判断一个陈述能否从因果上解释另一个陈述。作者评估了21个参数规模从0.5B到72B的先进语言模型,发现模型经常依赖词汇及语义重叠,将相关性误判为因果关系。随着模型规模扩大,其判断倾向会从过度怀疑因果关系转向过度接受因果解释。即使表现最好的模型,Matthews相关系数也仅为0.55,说明语言模型的真实因果解释能力仍有较大提升空间。
- 用于系统评估语言模型能否区分语义相关性与真实因果解释关系。
- 可帮助研究者分析模型规模增长带来的因果判断偏置变化。
- 为因果推理训练、数据构造及高风险应用中的模型可靠性评估提供基准。
📝 原始笔记(逐字保留)
OJBench:面向大语言模型的竞赛级代码评测基准
OJBench 收录 232 道 NOI 与 ICPC 竞赛题,并通过评测 37 个模型揭示当前大语言模型在竞赛级代码推理上的明显不足。
OJBench 是一个用于评估大语言模型竞赛级代码推理能力的新基准,包含来自 NOI 和 ICPC 的 232 道编程竞赛题。研究对 37 个开源与闭源模型进行了综合测试,同时覆盖推理型和非推理型模型。实验显示,即使 o4-mini、Gemini-2.5-pro-exp 等先进推理模型,也难以解决其中极具挑战性的问题。该结果表明,现有代码基准可能高估了模型能力,而竞赛级算法设计与严密推理仍是大模型的显著短板。
- 用于更严格地衡量大语言模型的算法设计、代码生成与复杂推理能力
- 可作为比较开源、闭源以及推理型、非推理型模型的统一评测集
- 揭示常规代码基准与真实竞赛级问题之间的能力差距
- 为提升模型的长程推理、算法规划和代码可靠性提供研究方向
📝 原始笔记(逐字保留)
剖析 SWE-Bench 排行榜:LLM 与智能体修复系统的提交者及架构画像
该研究系统分析 SWE-Bench Lite 与 Verified 排行榜中的 67 种独特方案,揭示自动程序修复系统的架构、模型选择及提交者构成。
SWE 软件工程 人工智能辅助编程 智能体 模型评估 人工智能
论文对 SWE-Bench Lite 的 68 个条目和 SWE-Bench Verified 的 79 个条目进行了全面调查,共归纳出 67 种独特的程序修复方法。研究从子系统类型、产品可用性、LLM 使用方式和系统架构等维度建立方案画像,以弥补排行榜提交文档不足的问题。结果显示,Claude 3.5/3.7 等专有模型占据主导地位,同时智能体与非智能体架构均有采用。提交者覆盖个人开发者、初创团队和大型科技公司,反映出 LLM 自动程序修复生态的多样化发展。
- 为选择自动程序修复模型与系统架构提供横向参考
- 帮助理解 SWE-Bench 排行成绩背后的技术路线和参与者构成
- 提醒基准平台完善提交文档与架构披露机制,以提升结果的可复现性和可解释性
📝 原始笔记(逐字保留)
通过一阶逻辑定理证明提升大模型数学推理能力
论文提出自适应推理方案 DREAM,通过公理驱动的策略多元化与子命题错误反馈,提升大模型执行多步一阶逻辑定理证明的能力。
现有大模型虽然在常见数学推理基准上具有竞争力,但在复杂的多步一阶逻辑推导中仍表现不佳,例如 DeepSeek-Prover-V2-7B 在作者构建的数据集上准确率仅为 4.2%。论文提出自适应方案 DREAM,利用公理驱动的策略多元化机制探索不同证明路径。该方法还引入子命题错误反馈,帮助模型反思并修正证明过程中的早期错误。实验中,相关方法将性能从 0.6% 提升至 6.4%,并提供了包含 447 个 Lean 4 格式数学定理的评估数据集。
- 为复杂数学问题中的多步一阶逻辑推理提供新的测试与改进路径。
- 通过增加证明策略多样性,降低单一搜索路径失败带来的影响。
- 利用子命题级错误反馈及时纠正早期推理偏差,避免错误在完整证明中累积。
- 可将 Lean 4 格式定理集用于形式化推理模型的训练与评估。