2025-06-24 科研追新

当日精选(由提交工具自动创建)。

RiOT:基于残差优化树的高效提示词优化

RiOT通过多分支文本梯度搜索、困惑度筛选与文本残差连接,在提升提示多样性的同时缓解迭代优化中的语义漂移。

 人工智能应用 人工智能框架 推理 逻辑推理 系统优化

RiOT是一种面向大型语言模型的自动提示优化框架,使用文本梯度迭代细化提示,并在每一步生成多个语义不同的候选项。框架利用困惑度选择更优提示,以扩大对有效、创新优化方向的探索。其文本残差连接能够选择性保留历史迭代中的有益内容,从而缓解跨任务优化产生的语义漂移。覆盖常识、数学、逻辑、时间及语义推理的五项基准实验显示,RiOT优于既有自动提示优化方法和人工提示。

用途与启示
  • 降低高质量提示词对人工设计和反复试错的依赖。
  • 通过树状多分支搜索增强候选提示的语义多样性,避免优化过早收敛。
  • 借助文本残差连接保留有效信息,为稳定的自动提示迭代提供新思路。
  • 可用于推理、问答及其他依赖提示质量的LLM应用优化。
📝 原始笔记(逐字保留)
2025-06-24 13:38:50 Tuesday| RiOT: Efficient Prompt Refinement with Residual Optimization Tree **链接** :https://arxiv.org/abs/2506.16389 **作者** :ou, Zhengyan Shi, Yuan Yao, Lei Liang, Huajun Chen, Qiang Zhang **摘要** :大型语言模型(LLM)的最新进展突出了它们在各种任务中的潜力,但它们的性能仍然严重依赖于有效提示的设计。现有的自动提示优化方法面临两个挑战:缺乏多样性,限制了对有价值和创新方向的探索,以及语义漂移,其中对一个任务的优化可能会降低其他任务的性能。为了解决这些问题,我们提出了残差优化树(RiOT),一种新的自动提示优化框架。RiOT通过文本梯度迭代地细化提示,在每一步生成多个语义不同的候选项,并使用困惑度选择最佳提示。此外,RiOT结合了文本剩余连接,通过在优化迭代中选择性地保留有益内容来减轻语义漂移。树结构有效地管理优化过程,确保可扩展性和灵活性。在五个基准测试中进行了广泛的实验,涵盖常识,数学,逻辑,时间和语义推理,证明RiOT优于以前的提示优化方法和手动提示。

CPGD:仅用数学训练,跨学科推理超越 o1并缓解强化学习训练崩溃

ModalMinds 团队提出 CPGD 强化学习算法及 MM-EUREKA 框架,在提升多模态模型跨学科推理性能的同时,显著改善了 GRPO、RLOO 等方法面临的训练不稳定问题。

 强化学习 多模态 模型训练 人工智能框架 系统优化 推理

CPGD 是一种面向多模态模型训练的新型强化学习算法,相比传统 GRPO、RLOO 等方法可显著缓解训练不稳定乃至崩溃的问题。实验表明,仅使用数学数据训练后,模型还能在物理、化学和生物任务上取得较强的跨领域推理表现。团队基于 OpenRLHF 构建了高效、可扩展的 MM-EUREKA 框架,支持 Qwen-VL、InternVL 以及 GRPO、REINFORCE++、RLOO、CPGD 等算法。该框架已用于训练 Qwen2.5-VL-32B、InternVL2.5-38B 等大模型,并开源了代码、MMK12 数据集和多个模型权重。

用途与启示
  • 为大规模多模态强化学习提供更稳定、可扩展的训练方案。
  • 可用于研究数学训练向物理、化学、生物等领域迁移的泛化能力。
  • 开源框架兼容多种模型与强化学习算法,便于复现和横向比较。
  • 训练稳定性的改善有助于降低大型视觉语言模型强化学习的试错成本。
📝 原始笔记(逐字保留)
5. 2025-06-24 11:28:01 Tuesday | CPGD:只训练数学,却在物理化学生物战胜o1!新强化学习算法带来显著性能提升,还缓解训练崩溃问题 https://mp.weixin.qq.com/s/RDUPagBn8l00P7dNPHjBcA 相比于传统GRPO、RLOO等算法显著缓解了训练不稳定(甚至崩溃)的问题,并带来显著性能提升。 基于OpenRLHF,团队构建了一个高效、可扩展的多模态强化学习框架,支持Qwen-VL、InternVL等多种模型与RL算法,包括GRPO、REINFORCE++、RLOO,以及提出的新型RL算法CPGD,并已成功训练出Qwen2.5VL-32B、InternVL2.5-38B等大型模型。 该框架相较于已有方案(如R1-V),具备更强的可扩展性与稳定性,为大规模多模态强化学习提供了基础设施支撑。 *开源代码:* *https://github.com/ModalMinds/MM-EUREKA* *https://github.com/ModalMinds/MM-EUREKA/tree/mm-prm* *技术报告:* *https://arxiv.org/abs/2503.07365* *https://arxiv.org/abs/2505.12504* *https://arxiv.org/abs/2505.13427* *MMK12数据集:* *https://huggingface.co/datasets/FanqingM/MMK12* *模型权重:* *https://huggingface.co/FanqingM/MM-Eureka-Qwen-7B* *https://huggingface.co/FanqingM/MM-Eureka-Qwen-32B* *https://huggingface.co/Zkkkai/CPGD-7B*

奖励模型也能 Scaling:上海 AI Lab 提出策略判别学习新范式

上海 AI Lab 针对强化学习中的奖励模型瓶颈提出策略判别学习新范式,并研究奖励模型欺骗现象的普遍性与可扩展性。

 强化学习 模型训练 人工智能

上海 AI Lab 研究了“奖励模型欺骗”现象是否具有普遍性。团队提出策略判别学习新范式,尝试突破奖励模型对强化学习性能的限制。该研究还表明奖励模型具备 Scaling 潜力,为利用更大规模计算和数据改进策略评估提供了新方向。

用途与启示
  • 帮助识别并缓解策略对奖励模型漏洞的利用。
  • 为奖励模型的规模化训练与能力提升提供新思路。
  • 推动强化学习从标量奖励拟合转向更可靠的策略判别。
📝 原始笔记(逐字保留)
2025-06-24 11:20:29 Tuesday | 无损减少80%激活值内存,提升5倍训练序列长度,仅需两行代码 https://mp.weixin.qq.com/s/YqQYtKqzCVFKzr3Z7bYHsg 来自港中文(深圳)和上海交通大学的团队提出 **StreamBP** 算法。通过对链式法则进行线性分解和分步计算,StreamBP 将大语言模型训练所需的激活值内存(logits 和 layer activation)降低至梯度检查点(gradient checkpointing)的 20% 左右。 ## 奖励模型 研究“奖励模型欺骗”现象是否存在普遍性 **奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式**[https://mp.weixin.qq.com/s/hU3MKn82o1sMy4CK-CUUug](https://mp.weixin.qq.com/s/hU3MKn82o1sMy4CK-CUUug)

ReasonGRM:借助大型推理模型增强生成奖励模型

ReasonGRM通过三阶段推理感知训练提升生成奖励模型的偏好辨别能力,在三个公共基准上取得领先或具有竞争力的表现。

 强化学习 推理 模型训练 模型评估

ReasonGRM旨在解决生成奖励模型推理能力不足所导致的信息遗漏、过度推测与幻觉问题。框架首先利用Zero-RL生成简洁且面向结果的推理路径,随后引入基于路径生成概率的新指标 $R^\star$,优先选择以较少探索获得正确答案的推理过程。最后,模型针对高难度样本进行强化学习,以进一步增强偏好辨别能力。实验显示,其平均性能比此前最佳生成奖励模型提高1.8%,并比GPT-4o等专有模型高出5.6%。

用途与启示
  • 为生成奖励模型提供一套结合推理路径筛选与强化学习的训练流程
  • 通过偏好高质量、低探索成本的正确推理路径减少训练数据中的幻觉
  • 可用于改进RLHF、奖励建模及复杂任务中的偏好评估系统
  • 表明奖励模型的推理质量与路径选择机制是提升可靠性的关键
📝 原始笔记(逐字保留)
2025-06-24 13:02:03 Tuesday | ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models **链接** :https://arxiv.org/abs/2506.16712 **作者** : Xinzge Gao, Chuanrui Hu, Penghang Yu, Hua Zhang, Bing-Kun Bao **摘要** :生成奖励模型(GRM)在捕获人类偏好方面提供了比标量奖励模型更大的灵活性,但其有效性受到推理能力差的限制。这通常会导致不完整或过度推测的推理路径,导致幻觉或在复杂任务中丢失关键信息。我们用ReasonGRM来解决这个挑战,这是一个三阶段生成奖励建模框架。在第一阶段,Zero-RL用于生成简洁的、结果导向的推理路径,以减少关键遗漏的可能性。在第二阶段,我们引入了一种新的评价指标,$R^\star$,它的分数推理路径的生成可能性的基础上。这有利于以最少的探索获得正确答案的路径,有助于减少训练过程中容易产生幻觉的数据。在最后阶段,通过对具有挑战性的示例进行强化学习来进一步改进模型,以增强其偏好辨别能力。在三个公共基准测试上的实验表明,ReasonGRM实现了具有竞争力或最先进的性能,平均比之前最好的GRM高出1.8%,比GPT-4 o等专有模型高出5.6%。这些结果证明了推理感知训练的有效性,并强调了高质量的合理选择对可靠偏好建模的重要性。 ## RLVR 可验证奖励的强化学习

GRPO-CARE:面向多模态推理的一致性感知强化学习

GRPO-CARE通过一致性感知的双层奖励同时优化答案正确性与推理逻辑一致性,显著提升多模态视频推理表现。

 强化学习 多模态 推理 模型训练 模型评估 数据工程

论文提出视频推理基准SEED-Bench-R1,用于评估多模态大模型在分布内、跨环境及跨环境任务场景中的泛化能力。研究发现,标准GRPO虽然能提高答案准确率,但由于奖励仅关注最终答案且KL惩罚限制探索,推理过程与答案的一致率仅为57.9%。GRPO-CARE采用答案正确性基础奖励和基于缓慢演化参考模型的自适应一致性奖励,鼓励正确且逻辑连贯的推理路径。在最困难的评估级别上,该方法相较标准GRPO取得6.7%的性能增益,并将推理一致性提升24.5%,同时可迁移至其他视频理解基准。

用途与启示
  • 为多模态大模型的后训练提供兼顾答案正确性与推理一致性的强化学习方案。
  • 说明仅依赖结果奖励可能诱导推理捷径,需要显式衡量推理到答案的逻辑一致性。
  • SEED-Bench-R1可用于研究视频感知、复杂推理及跨环境泛化能力。
  • 以自适应一致性奖励替代严格KL惩罚,为扩大策略探索提供了新思路。
📝 原始笔记(逐字保留)
2. 2025-06-24 13:31:26 Tuesday | GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning **链接** :https://arxiv.org/abs/2506.16141 **作者** :Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu **备注** : Code released at: this https URL **摘要** :最近的强化学习方法,如结果监督GRPO,已经在大型语言模型(LLM)中推进了思想链推理,但它们对多模态LLM(MLLM)的适应尚未探索。为了解决MLLM后期训练方法缺乏严格评估的问题,我们引入了SEED-Bench-R1,这是一个需要平衡感知和推理的复杂现实视频基准。它提供了一个大型的训练集,并在三个不断升级的挑战中评估泛化:分布,跨环境和跨环境任务场景。使用SEED-Bench-R1,我们发现标准GRPO在提高答案准确性的同时,往往会降低推理步骤和答案之间的逻辑一致性,只有57.9%的一致率。这源于奖励信号只关注最终答案、鼓励捷径以及限制探索的严格KL惩罚。为了解决这个问题,我们提出了GRPO-CARE,这是一个一致性感知RL框架,在没有明确监督的情况下优化答案正确性和推理一致性。GRPO-CARE引入了两层奖励:(1)对答案正确性的基本奖励,以及(2)自适应一致性奖励,通过比较模型的推理到答案的可能性(通过一个缓慢进化的参考模型)与群体对等体来计算。这种双重机制放大了对正确和逻辑一致的推理路径的奖励。用这种自适应奖金取代KL惩罚,GRPO-CARE在SEED-Bench-R1上的表现优于标准GRPO,在最难的评估水平上实现了6.7%的性能增益,在一致性上提高了24.5%。它还显示出强大的可移植性,提高了不同视频理解基准的模型性能。我们的工作贡献了一个系统设计的基准和一个可推广的培训后框架,推进了更可解释和更强大的MLLM的发展。 ## 推理 #### 结构化探索框架:First Return, Entropy-Eliciting Explore(FR3E)

DynScaling:基于动态集成采样的无验证器高效推理扩展

DynScaling通过集成并行—顺序采样与基于多臂老虎机的动态预算分配,在无需外部验证器的情况下提升大模型推理性能和计算效率。

 推理 系统优化 强化学习

DynScaling面向测试时计算扩展依赖外部验证器、难以适应现实算力约束的问题,提出一种无验证器推理扩展方法。其集成采样策略从多个独立并行响应中构建连续的合成推理链,兼顾推理轨迹的多样性与连贯性。该方法进一步将跨查询的计算资源分配建模为多臂老虎机问题,根据已采样响应的不确定性动态调整推理预算。实验显示,DynScaling在任务性能与计算成本方面均稳定优于现有无验证器推理扩展基线。

用途与启示
  • 在固定或受限算力条件下,自适应地将更多推理预算分配给高不确定性问题。
  • 无需训练或部署外部验证器,可降低测试时扩展方案的系统复杂度。
  • 为并行采样与顺序推理的统一提供新思路,适用于成本敏感的大模型推理服务。
📝 原始笔记(逐字保留)
5. 2025-06-24 13:35:23 Tuesday | DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling **链接** :https://arxiv.org/abs/2506.16043 **作者** : Xingchen Wan, Ruoxi Sun, Jiefeng Chen, Sercan Ö. Arık **摘要** :推理时间缩放已被证明可以有效地通过增加测试时间计算来提高大型语言模型(LLM)的性能。然而,它的实际应用往往受到外部验证的依赖或缺乏现实的计算约束的优化。我们提出了DynScaling,它通过两个主要的创新来解决这些限制:一个集成的并行顺序采样策略和一个基于Bandit的动态预算分配框架。综合抽样策略通过从最初独立的并行响应构建合成顺序推理链,统一了并行和顺序抽样,促进了多样性和连贯性的推理轨迹。动态预算分配框架将计算资源的分配公式化为多臂强盗问题,基于先前采样响应的不确定性在查询之间自适应地分配推理预算,从而最大化计算效率。通过组合这些组件,DynScaling在实际资源限制下有效地提高了LLM性能,而无需外部验证器。实验结果表明,DynScaling始终超过现有的无验证推理缩放基线的任务性能和计算成本。 ### 推理成本优化

FinCoT:以专家知识为基础的金融思维链推理

FinCoT通过引入领域专家设计的结构化金融推理步骤,显著提升大模型在十个金融领域的准确率、可解释性与推理效率。

 推理 人工智能应用 逻辑推理

FinCoT是一种面向金融自然语言处理的结构化思维链提示方法,其推理轨迹建立在专家金融知识之上。研究系统比较了零样本标准提示、非结构化CoT、一般结构化CoT以及FinCoT的CFA式提示,并覆盖十个金融领域。实验中,FinCoT将一项评估表现从63.2%提升至80.5%,在Qwen-2.5-7B-Instruct上也实现了从69.7%到74.2%的提升。与一般结构化CoT相比,该方法生成的令牌数量减少约八倍,同时产生了更具可解释性且更符合专家思维的推理轨迹。

用途与启示
  • 为金融问答、分析与决策辅助系统设计更可靠的领域推理模板
  • 说明由领域专家定义推理结构,可能比通用或非专家设计的CoT更有效
  • 在提高准确率的同时减少推理令牌,可降低金融大模型的部署成本
  • 为医疗、法律等专业领域构建专家对齐的结构化提示提供参考
📝 原始笔记(逐字保留)
10. 2025-06-24 13:33:59 Tuesday | FinCoT: Grounding Chain-of-Thought in Expert Financial Reasoning **链接** :https://arxiv.org/abs/2506.16123 **作者** :Nitarach, Warit Sirichotedumrong, Panop Pitchayarthorn, Pittawat Taveekitworachai, Potsawee Manakul, Kunat Pipatanakul **摘要** :本文介绍了FinCoT,一种结构化的思想链(CoT)提示方法,它结合了特定领域的专家金融推理的见解,以指导大型语言模型的推理轨迹。我们调查了FinNLP中有三种主要的提示风格:(1)标准提示--zero-shot提示;(2)非结构化CoT--没有显式推理结构的CoT提示,例如使用标签;(3)结构化CoT提示--使用定义结构化推理步骤的显式指令或示例的CoT提示。以前,FinNLP主要专注于使用标准或非结构化CoT提示的提示工程。然而,结构化的CoT提示在以前的工作中受到了有限的关注。此外,结构化CoT提示中推理结构的设计通常基于非领域专家的推理。在这项研究中,我们调查了FinNLP中的每种提示方法。我们评估了三种主要的提示风格和FinCoT的CFA风格的问题跨越十个金融领域。我们观察到FinCoT将性能从63.2%提高到80.5%,Qwen-2.5- 7 B-Instruct从69.7%提高到74.2%,同时与结构化CoT提示相比,生成的令牌减少了八倍。我们的研究结果表明,领域对齐的结构化提示不仅提高了性能,降低了推理成本,但也产生更多的可解释性和专家对齐的推理痕迹。

腾讯优图提出 RAIF 激励推理方法,复杂指令性能提升 11.74%

腾讯优图提出 RAIF,通过种子筛选、受约束的指令演化及多重质量校验合成复杂指令数据,使模型相关性能提升 11.74%。

 数据合成 数据工程 推理 模型训练

该研究针对高质量复杂指令数据数量不足的问题,基于现有分类法分解复杂指令,并设计开源数据驱动的数据生产与校验流程。团队从 WildChat、Alpaca 等数据集中按照主题和任务标签筛选多样化种子指令。随后在细粒度规则与约束下进行指令自演化,并结合代码执行和 LLM 判别验证生成指令的有效性。回复由 LLM 自动生成,再经过多重校验与典型问题检测过滤低质量样本,最终带来 11.74% 的性能提升。

用途与启示
  • 为复杂指令微调提供可规模化、低人工成本的数据合成方案。
  • 通过规则约束、代码执行和 LLM 裁判相结合,提高合成数据的可验证性与可靠性。
  • 可借鉴其“种子筛选—约束演化—回复生成—质量校验”流水线构建垂直领域指令数据。
📝 原始笔记(逐字保留)
2025-06-24 11:40:18 Tuesday | 性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令 https://mp.weixin.qq.com/s/vHUZ3Dd0f24gdQ-JwiSk4A 论文地址:https://arxiv.org/pdf/2506.01413 项目地址:https://github.com/yuleiqin/RAIF 数据:https://huggingface.co/collections/yolay/raif-arxivorg-pdf-250601413-682b16e5c0c2fa9b73811369 针对复杂指令集的数量问题,研究团队基于现有分类法对复杂指令进行分解,提出了一种基于开源数据与已有约束结构的数据生产方法以及校验准则的方法。 **种子指令挑选** :团队从WildChat和Alpaca等数据集中多样化地筛选种子指令,并通过主题和任务标签进行细致挑选。 **带规则约束的指令发散** :团队在细粒度规则和约束下自演化指令,结合代码执行和LLM判别两种验证方式,确保生成指令的多样性和有效性。 **回复生产与质量校验** :团队利用LLM生成回复并通过多重验证筛除低质量样本,同时用LLM判别典型问题以保证指令和回复的合理性。 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=N2MzMzU0NzA1OWVjZTc2YTVmZWMxYTk5OTJiYjdkYmNfSVZ3MEt2a0tsWldMUFRVU0c1UHkwTFVuTUdIUnhmS2xfVG9rZW46SVdiamJPems1bzdLVWF4akRnaWNwdHBRblhlXzE3NTQ0NjI0MzY6MTc1NDQ2NjAzNl9WNA) ## 评估数据 🌈 2025-07-01 11:59:07 Tuesday | **[AutoEvoEval:用于发展封闭式 LLM 评估数据的自动化框架](https://papers.cool/arxiv/2506.23735)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [JiaRu Wu](https://arxiv.org/search/?searchtype=author&query=JiaRu%20Wu), [Mingwei Liu](https://arxiv.org/search/?searchtype=author&query=Mingwei%20Liu) 大型语言模型 (LLM) 在各种任务上都表现出了卓越的性能,但现有的评估基准通常是静态的,不足以充分评估它们在现实场景中的稳健性和泛化性。先前使用进化或对抗性数据增强的工作提高了评估多样性,但缺乏对扰动类型和多步骤复杂性的系统控制,限制了全面的稳健性分析。为了解决这些差距,我们提出了 AutoEvoEval,这是一个基于进化的评估框架,用于多项选择题回答等封闭式任务。AutoEvoEval 引入了 22 种可解释的原子演化作,并支持多轮合成,从而能够受控地生成多样化、具有挑战性和真实的测试样品。我们进行了广泛的实验,解决了广泛的开源和闭源 LLM 的四个研究问题。我们的结果表明,原子作导致平均准确率下降 7.283\%,其中结构破坏或误导性语义编辑导致的下降幅度最大。对于相同的扰动,模型灵敏度差异很大,并且结合多个进化步骤会放大高达 52.932\% 的对抗效应。这些发现表明,当前的基准可能高估了真正的模型泛化性,并强调了进化感知稳健性评估的必要性。代码和资源可在以下网址获得:https://github.com/SYSUSELab/AutoEvoEval。 ## 对话数据 #### LLMs 能生成高质量的特定任务对话吗? [#140](https://arxiv.org/abs/2508.02931) [Can LLMs Generate High-Quality Task-Specific Conversations?](https://papers.cool/arxiv/2508.02931) 本文介绍了一个用于控制大型语言模型中对话质量的参数化框架。我们探讨了涵盖六个维度的九个关键参数,这些参数能够精确指定对话属性。通过对最先进的 LLMs 进行实验,我们证明了基于参数的控制能够在生成的对话属性上产生统计学上显著的差异。我们的方法解决了对话生成中的诸多挑战,包括话题连贯性、知识进展、角色一致性以及控制粒度。该框架提供了一种标准化的对话质量控制方法,适用于教育、治疗、客户服务和娱乐等领域。未来的工作将侧重于通过架构修改实现更多参数,并开发用于评估的基准数据集。 发布:2025-08-04 22:07:08 UTC ## 深度搜索 ###### [终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek](https://mp.weixin.qq.com/s/hmxu9bW5zTbWiDotnKaoCw) 揭示了深度研究问题与层级约束满足问题(Hierarchical Constraint Satisfaction Problem)之间的数学等价关系,并由此提出了基于「扩散-回溯」过程的数据合成方法,实现了深度研究训练数据的大规模自动扩增。

CLEAR-3K:评估语言模型的因果解释能力

CLEAR-3K通过3000道断言—理由题评估语言模型辨别语义相关性与真实因果解释关系的能力,揭示当前模型普遍存在因果判断偏差。

 模型评估 逻辑推理 推理 数据工程

CLEAR-3K是一个包含3000道断言推理问题的评测数据集,要求模型判断一个陈述能否从因果上解释另一个陈述。作者评估了21个参数规模从0.5B到72B的先进语言模型,发现模型经常依赖词汇及语义重叠,将相关性误判为因果关系。随着模型规模扩大,其判断倾向会从过度怀疑因果关系转向过度接受因果解释。即使表现最好的模型,Matthews相关系数也仅为0.55,说明语言模型的真实因果解释能力仍有较大提升空间。

用途与启示
  • 用于系统评估语言模型能否区分语义相关性与真实因果解释关系。
  • 可帮助研究者分析模型规模增长带来的因果判断偏置变化。
  • 为因果推理训练、数据构造及高风险应用中的模型可靠性评估提供基准。
📝 原始笔记(逐字保留)
2. 2025-06-24 12:54:11 Tuesday | CLEAR-3K: Assessing Causal Explanatory Capabilities in Language Models **链接** :https://arxiv.org/abs/2506.17180 **作者** :iu, Richard Baraniuk, Shashank Sonkar **摘要** :我们介绍了CLEAR-3 K,这是一个包含3,000个断言推理问题的数据集,旨在评估语言模型是否可以确定一个语句是否因果地解释另一个语句。每个问题都提出了一个断言-理由对,并挑战语言模型来区分语义相关性和真正的因果解释关系。通过对21个最先进的语言模型(参数范围从0.5B到72 B)的综合评估,我们发现了两个基本的发现。首先,语言模型经常混淆语义相似性与因果关系,依赖于词汇和语义重叠,而不是推断实际的因果解释关系。其次,随着参数大小的增加,模型往往会从过度怀疑因果关系转变为过度宽容地接受它们。尽管发生了这种变化,但即使是性能最好的模型,通过Matthews相关系数测量的性能也只有0.55。因此,CLEAR-3 K为开发和评估语言模型中真正的因果推理提供了一个至关重要的基准,这对于需要准确评估因果关系的应用程序来说是一个必不可少的能力。 #### 逻辑 |[GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了](https://mp.weixin.qq.com/s/cyOJ_Id606REj97nCXYqhg)

OJBench:面向大语言模型的竞赛级代码评测基准

OJBench 收录 232 道 NOI 与 ICPC 竞赛题,并通过评测 37 个模型揭示当前大语言模型在竞赛级代码推理上的明显不足。

 模型评估 人工智能辅助编程 推理 数据工程

OJBench 是一个用于评估大语言模型竞赛级代码推理能力的新基准,包含来自 NOI 和 ICPC 的 232 道编程竞赛题。研究对 37 个开源与闭源模型进行了综合测试,同时覆盖推理型和非推理型模型。实验显示,即使 o4-mini、Gemini-2.5-pro-exp 等先进推理模型,也难以解决其中极具挑战性的问题。该结果表明,现有代码基准可能高估了模型能力,而竞赛级算法设计与严密推理仍是大模型的显著短板。

用途与启示
  • 用于更严格地衡量大语言模型的算法设计、代码生成与复杂推理能力
  • 可作为比较开源、闭源以及推理型、非推理型模型的统一评测集
  • 揭示常规代码基准与真实竞赛级问题之间的能力差距
  • 为提升模型的长程推理、算法规划和代码可靠性提供研究方向
📝 原始笔记(逐字保留)
3. 2025-06-24 13:00:08 Tuesday | OJBench: A Competition Level Code Benchmark For Large Language Models **链接** :https://arxiv.org/abs/2506.16395 **作者** :g, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu **备注** : 9 pages, 5 figures **摘要** :大型语言模型(LLM)的最新进展表明,数学和代码推理能力取得了显着进步。然而,现有的代码基准测试在评估这些功能的全方位能力方面受到限制,特别是在竞争层面。为了弥合这一差距,我们引入了OJBench,这是一个新颖且具有挑战性的基准测试,旨在评估LLM的竞争级代码推理能力。OJBench包含来自NOI和ICPC的232个编程竞赛问题,为模型的推理能力提供了更严格的测试。我们使用OJBench对37个模型进行了综合评估,包括闭源和开源模型,面向推理和非面向推理的模型。我们的研究结果表明,即使是最先进的面向推理的模型,如o 4-mini和Gemini-2.5-pro-exp,也难以解决极具挑战性的竞争级问题。这突出了模型在竞争级代码推理中面临的重大挑战。 ## 科学

剖析 SWE-Bench 排行榜:LLM 与智能体修复系统的提交者及架构画像

该研究系统分析 SWE-Bench Lite 与 Verified 排行榜中的 67 种独特方案,揭示自动程序修复系统的架构、模型选择及提交者构成。

 SWE 软件工程 人工智能辅助编程 智能体 模型评估 人工智能

论文对 SWE-Bench Lite 的 68 个条目和 SWE-Bench Verified 的 79 个条目进行了全面调查,共归纳出 67 种独特的程序修复方法。研究从子系统类型、产品可用性、LLM 使用方式和系统架构等维度建立方案画像,以弥补排行榜提交文档不足的问题。结果显示,Claude 3.5/3.7 等专有模型占据主导地位,同时智能体与非智能体架构均有采用。提交者覆盖个人开发者、初创团队和大型科技公司,反映出 LLM 自动程序修复生态的多样化发展。

用途与启示
  • 为选择自动程序修复模型与系统架构提供横向参考
  • 帮助理解 SWE-Bench 排行成绩背后的技术路线和参与者构成
  • 提醒基准平台完善提交文档与架构披露机制,以提升结果的可复现性和可解释性
📝 原始笔记(逐字保留)
3. 2025-06-24 12:52:59 Tuesday | Dissecting the SWE-Bench Leaderboards: Profiling Submitters and Architectures of LLM- and Agent-Based Repair Systems **链接** :https://arxiv.org/abs/2506.17208 **作者** :rtinez, Xavier Franch **摘要** :自动程序修复(APR)的快速发展是由人工智能的进步推动的,特别是大型语言模型(LLM)和基于代理的系统。SWE-Bench是最近的一个基准测试,旨在使用从12个流行的开源Python存储库中挖掘的真实问题和拉取请求来评估基于LLM的修复系统。其公共排行榜SWE-Bench Lite和SWE-Bench Verified已成为跟踪进度和比较解决方案的中心平台。然而,由于提交过程不需要详细的文件,许多解决方案的架构设计和起源仍然不清楚。在本文中,我们对SWE-Bench Lite(68个条目)和Verified(79个条目)排行榜的所有提交进行了首次全面研究,分析了67种独特的方法,包括子系统类型,产品可用性,LLM使用和系统架构。我们的研究结果揭示了专有LLM(特别是Claude 3.5/3.7)的主导地位,代理和非代理设计的存在,以及从个人开发人员到大型科技公司的贡献者基础。

通过一阶逻辑定理证明提升大模型数学推理能力

论文提出自适应推理方案 DREAM,通过公理驱动的策略多元化与子命题错误反馈,提升大模型执行多步一阶逻辑定理证明的能力。

 逻辑推理 推理 数据工程 模型评估

现有大模型虽然在常见数学推理基准上具有竞争力,但在复杂的多步一阶逻辑推导中仍表现不佳,例如 DeepSeek-Prover-V2-7B 在作者构建的数据集上准确率仅为 4.2%。论文提出自适应方案 DREAM,利用公理驱动的策略多元化机制探索不同证明路径。该方法还引入子命题错误反馈,帮助模型反思并修正证明过程中的早期错误。实验中,相关方法将性能从 0.6% 提升至 6.4%,并提供了包含 447 个 Lean 4 格式数学定理的评估数据集。

用途与启示
  • 为复杂数学问题中的多步一阶逻辑推理提供新的测试与改进路径。
  • 通过增加证明策略多样性,降低单一搜索路径失败带来的影响。
  • 利用子命题级错误反馈及时纠正早期推理偏差,避免错误在完整证明中累积。
  • 可将 Lean 4 格式定理集用于形式化推理模型的训练与评估。
📝 原始笔记(逐字保留)
2025-06-24 12:55:15 Tuesday | Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving **链接** :https://arxiv.org/abs/2506.17104 **作者** :o, Mengze Li, Juntao Dai, Jinluan Yang, Zijian Zhao, Shengyu Zhang, Weijie Shi, Chengzhong Liu, Sirui Han, Yike Guo **摘要** :大型语言模型(LLM)已经显示出有前途的一阶逻辑(FOL)推理能力,在各个领域的应用。然而,他们的有效性在复杂的数学推理,涉及多步FOL扣除仍然是研究不足。虽然LLM在已建立的数学推理基准上表现出竞争力,但它们在多步FOL任务中表现不佳,正如Deepseek-Prover-V2- 7 B在我们提出的定理证明数据集上的低准确度(4.2%)所证明的那样。这个问题源于对不同证明策略的有限探索以及早期推理错误破坏整个证明的可能性。为了解决这些问题,我们提出了梦想,一个自适应的解决方案,提高了LLM的生成策略的多样性和合理性。梦想结合了公理驱动的战略多元化机制,以促进不同的战略成果和子命题错误反馈,以帮助法学硕士反思和纠正他们的证据。我们的贡献包括通过FOL定理证明在LLM的数学推理方面取得了开创性的进步,引入了一种新的推理阶段解决方案,将性能提高了0.6%至6.4%,并以Lean 4格式提供了447个数学定理的精选数据集用于评估。 ## 模型训练 ### 常见方法
0%