2025-06-19 科研追新

当日精选(由提交工具自动创建)。

腾讯元宝推出 AI 编程模式,支持代码实时预览

腾讯元宝上线 AI 编程模式,可生成代码并实时展示运行或页面预览效果。

 智能体工具 人工智能辅助编程 人工智能应用 人工智能

腾讯元宝于 2025 年 6 月 19 日推出 AI 编程模式。该模式支持通过自然语言辅助生成代码,并提供实时预览功能。用户可在编写和调整代码的过程中直接查看效果,从而缩短开发与验证链路。

用途与启示
  • 降低代码生成、调试和效果验证的使用门槛
  • 通过实时预览提升原型开发与前端迭代效率
  • 展示通用 AI 助手向集成式编程工具演进的趋势
📝 原始笔记(逐字保留)
3. 2025-06-19 09:29:08 Thursday | 腾讯元宝推出AI编程模式,实现代码实时预览功能

LensLLM:以低成本预测微调表现的LLM选型框架

弗吉尼亚理工大学提出入选ICML 2025的LensLLM框架,通过少量微调数据预测不同大模型的最终性能与排名,并将选型成本降低近90%。

 人工智能应用 人工智能框架 模型评估 系统优化

弗吉尼亚理工大学研究人员推出了大模型选型框架 LensLLM,旨在减少模型微调与评测中的试错成本。该框架基于新的 PAC-Bayes 泛化界限,刻画LLM微调表现随数据规模变化的非线性规律。研究团队进一步构建了由神经切线核(NTK)增强的缩放律模型,仅需在少量数据上进行微调,便可拟合完整微调曲线、预测最终测试性能并对候选模型排序。实验显示,LensLLM在提升选型效果的同时可将成本降低近90%。

用途与启示
  • 为特定任务快速筛选最值得微调的大模型,减少全量实验开销。
  • 利用少量数据预测完整微调收益,为模型采购、部署和算力分配提供依据。
  • 展示PAC-Bayes理论、NTK与缩放律在实际LLM选型和性能预测中的结合方式。
📝 原始笔记(逐字保留)
3. 2025-06-19 20:07:43 Thursday | 告别玄学选LLM!弗吉尼亚理工选型框架入选ICML 2025 https://mp.weixin.qq.com/s/JTXjazJ8KRCURggbfTjNIA 来自弗吉尼亚理工大学的研究人员推出了个选型框架 **LensLLM** —— 大幅提升选型效果的同时,成本却降低近90%。 LensLLM的理论基础来自一项 **全新的PAC-Bayes泛化界限推导** ,首次从数学上揭示了LLM在不同数据规模下微调表现的 **非线性变化规律** , 研究团队构建了一个基于 **神经切线核(NTK)增强的缩放律模型** ,能够在只微调极少量数据的前提下: * 精确拟合整个微调曲线(如图2和表2所示) * 预测最终测试性能 * 排出最优模型排名 ## 时序

自适应引导加速推理模型的强化学习

Guide 通过自适应注入自然语言提示并校正离策略轨迹的重要性采样,在数学推理任务上提升了 RLVR 的学习效率与泛化能力。

 强化学习 推理 模型训练 逻辑推理

研究分析了可验证奖励强化学习(RLVR)如何提升推理模型性能,将其归纳为把 pass@k 压缩至 pass@1,以及学习解决原本无法完成的新问题所产生的“能力增益”。实验覆盖 0.5B 至 72B 参数模型和超过 50 万个数学、科学及代码推理问题,发现新能力的获得主要来自模型的自我提升。基于这些观察,作者提出 Guide 在线训练算法:对初始展开全部错误的问题自适应加入自然语言提示,同时要求模型自行推导完整解题链。Guide-GRPO 和 Guide-PPO 通过调整离策略轨迹的重要性采样,使模型在移除提示后仍能优化策略;其中 Guide-GRPO 在 7B 和 32B 模型的数学基准上取得最高约 4% 的宏平均增益。

用途与启示
  • 为 RLVR 训练提供一种按题目难度动态加入指导信息的方法,减少无效探索。
  • 说明推理性能提升不仅来自采样结果向 pass@1 集中,也来自模型获得新的解题能力。
  • 可用于改进数学、科学和代码推理模型的训练效率及跨任务泛化。
  • 为提示辅助的在线强化学习、离策略校正和课程学习设计提供参考。
📝 原始笔记(逐字保留)
7. 2025-06-19 20:43:53 Thursday | Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models **标题** : 自适应引导加速推理模型的强化学习 **链接** :https://arxiv.org/abs/2506.13923 **作者** : Vaskar Nath, Elaine Lau, Anisha Gunjal, Manasi Sharma, Nikhil Baharte, Sean Hendryx **摘要** :我们研究了通过可验证奖励强化学习(RLVR)训练的推理模型可以学习解决新问题的过程。我们发现RLVR通过两种主要方式驱动性能:(1)通过将pass@$k$压缩为pass@1;(2)通过“能力增益”,模型学习解决以前即使在高k$下也无法解决的新问题。我们发现,虽然能力增益存在于不同的模型规模,学习解决新问题主要是通过自我升华。我们在0.5B到72 B的模型规模上展示了这些发现,涉及超过500,000个推理问题,其中包括数学,科学和代码领域的提示和可验证的最终答案。我们进一步表明,我们可以通过利用自然语言指导模型在上下文中考虑,同时仍然需要模型从头开始推导解决方案链,来显着提高通过@$k$率。基于这些见解,我们得出$\text{Guide}$ -一类新的在线训练算法。$\text{Guide}$自适应地将提示合并到模型的上下文中,以解决所有展开最初都不正确的问题,并调整“偏离策略”轨迹的重要性采样率,以便优化提示不再存在的上下文中的策略。我们描述了GRPO和PPO的$\text{Guide}$的变体,并根据经验表明,7 B和32 B参数模型上的Guide-GRPO比普通模型提高了泛化能力,在数学基准测试中的宏观平均改善高达4$\%$。我们包括仔细的消融分析$\text{Guide}$的组件和理论分析指南的学习效率。

具有可验证奖励的强化学习可隐式激励基础大模型正确推理

论文提出更严格的 CoT-Pass@K 指标,并从理论与实验两方面表明,具有可验证奖励的强化学习能够真正提升基础大模型的正确推理能力,而非仅重新加权已有推理路径。

 强化学习 推理 模型评估 模型训练 逻辑推理

传统 Pass@K 只检查最终答案是否正确,可能将推理链不准确或不完整的样本误判为成功,因而无法可靠衡量模型的真实推理能力。作者提出 CoT-Pass@K,要求思维链与最终答案同时正确,以更精确地评估推理路径质量。理论分析指出,RLVR 不同于传统强化学习,其结构能够对逻辑完整性形成隐式激励。实验显示,在 CoT-Pass@K 下,RLVR 对所有 K 值均能促进正确推理的泛化,而且这种能力在训练早期便开始出现并平稳扩展。

用途与启示
  • 为 RLVR 推理模型提供比 Pass@K 更可靠的评估方法
  • 说明 RLVR 的收益并非只是牺牲多样性、重新加权已有推理路径
  • 启示训练与评估应同时验证最终答案和完整推理过程
  • 为研究可验证奖励如何促进逻辑完整性与推理泛化提供理论依据
📝 原始笔记(逐字保留)
2. 2025-06-19 20:36:57 Thursday | Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs **标题** : 具有可验证奖励的强化学习激励基本LLM中的正确推理 **链接** :https://arxiv.org/abs/2506.14245 **作者** : Xumeng Wen, Zihan Liu, Shun Zheng, Zhijian Xu, Shengyu Ye, Zhirong Wu, Xiao Liang, Yang Wang, Junjie Li, Ziming Miao, Jiang Bian, Mao Yang **备注** :Preprint **摘要** :具有可验证奖励的强化学习(RLVR)已经成为提高大型语言模型(LLM)推理能力的一种有前途的范例。然而,一个关键的悖论云其功效:RLVR调整的模型往往表现不佳的基础模型的$Pass@K$度量的解决方案的发现,导致假设RLVR只是重新加权现有的推理路径的推理多样性的成本。在这项工作中,我们通过确定问题的来源来解决这个矛盾:$Pass@K$度量本身是一个有缺陷的推理度量,因为它认为正确的最终答案可能来自不准确或不完整的思想链(CoTs)。为了解决这个问题,我们引入了一个更精确的评估指标,$CoT$-$Pass@K$,它要求推理路径和最终答案都是正确的。我们提供了一个新的理论基础,形式化的RLVR,不同于传统的RL,是独特的结构,以激励逻辑的完整性。我们的实证结果是支持的:使用$CoT$-$Pass@K$,我们观察到RLVR可以激励正确推理的泛化为所有值的$K$。此外,通过分析训练动态,我们发现这种增强的推理能力出现在训练过程的早期,并顺利推广。我们的工作为RLVR的作用提供了一个清晰的视角,为其评估提供了一种更可靠的方法,并证实了它真正推进机器推理的潜力。

LEMMA:用“错题本”反思学习提升大模型数学推理能力

上海AI Lab提出LEMMA,通过构建“错误-纠正”数据并训练模型反思错误,使Llama3-8B在数学任务上的准确率最高提升13.3%。

 推理 逻辑推理 数据合成 模型训练 自进化

LEMMA(Learning from Errors for Mathematical Advancement)旨在让大模型从数学推理错误中学习。研究者通过分析模型的错误过程,构建“错误-纠正”数据集,并利用反思机制引导模型从错误思路平滑过渡到正确答案。实验将该方法与RefAug、RFT、ISC、S3C-Math等八种主流基线进行比较。结果显示,LEMMA在常见数学任务上取得更高正确率,并使Llama3-8B的准确率最高提升13.3%。

用途与启示
  • 将模型生成的错误轨迹转化为可复用的高价值训练数据。
  • 通过显式反思与纠错过程增强数学推理能力,而非只学习标准答案。
  • 为构建具备持续纠错和自我改进能力的大模型提供训练思路。
📝 原始笔记(逐字保留)
3. 2025-06-19 20:03:27 Thursday | 大模型也需要自我反思,上海AI Lab合成“错题本”让大模型数学成绩提升13.3% https://mp.weixin.qq.com/s/qHATXYDZKzYlXwinlMUFuw 这种方法名为 **LEMMA** (Learning from Errors for Mathematical Advancement),专门教大模型如何从错误中学习。 作者通过深入分析模型犯下的错误,构建了“错误-纠正”数据集,并利用反思机制,引导模型从错误的思路平滑过渡到正确的答案。 作者对比了包括RefAug、RFT,ISC、S3C-Math在内的八种主流baseline方法。 结果表明,LEMMA在常见的数学任务上正确率更高,在Llama3-8B上准确率提升了最高达13.3%。 论文地址:https://arxiv.org/abs/2503.17439 代码仓库:https://github.com/pzs19/LEMMA

探索推理:一种熵的视角

研究发现语言模型推理中的高熵区域与关键逻辑决策、反思纠错及罕见行为密切相关,并通过熵增强优势函数提升推理探索能力和 Pass@K 表现。

 推理 强化学习 模型训练 逻辑推理

论文从熵的视角重新审视强化学习中探索与利用的平衡,分析其与语言模型探索性推理行为的关系。实验表明,高熵区域往往对应关键逻辑步骤、自我验证与纠错,以及基础模型较少探索的罕见行为。作者对标准强化学习进行极小改动,在优势函数中加入基于熵的项,以鼓励模型生成更长、更深的推理链。该方法不同于通过扩大不确定性进行探索的传统最大熵方法,并在较大 K 值下仍显著提升 Pass@K。

用途与启示
  • 可将 token 熵作为识别关键推理节点和反思行为的信号。
  • 为突破强化学习推理训练的性能平台提供低成本、易实现的改进方案。
  • 提示模型探索不必单纯依赖增加随机性,也可通过奖励深层推理路径来实现。
  • Pass@K 的持续提升表明该方法有望扩展语言模型推理能力的上限。
📝 原始笔记(逐字保留)
2. 2025-06-19 20:41:17 Thursday | Reasoning with Exploration: An Entropy Perspective **标题** : 探索推理:一种熵的视角 **链接** :https://arxiv.org/abs/2506.14758 **作者** : Daixuan Cheng, Shaohan Huang, Xuekai Zhu, Bo Dai, Wayne Xin Zhao, Zhenliang Zhang, Furu Wei **摘要** :平衡探索和利用是强化学习(RL)的核心目标。尽管最近在增强语言模型(LM)推理方面取得了进展,但大多数方法都倾向于开发,并且越来越多地遇到性能平台。在这项工作中,我们重新熵-在RL探索的信号-并检查其关系,探索性推理LM。通过实证分析,我们发现高熵区域与三种类型的探索性推理行为之间存在强正相关关系:(1)决定或连接逻辑步骤的关键标记,(2)自我验证和纠正等反思行为,以及(3)基础LM未充分探索的罕见行为。出于这一动机,我们仅用一行代码对标准RL进行了最小的修改:用基于熵的术语来增强优势函数。与传统的最大熵方法不同,它通过促进不确定性来鼓励探索,我们通过促进更长更深的推理链来鼓励探索。值得注意的是,我们的方法在Pass@K度量(LM推理能力的上限估计值)上取得了显着的收益,即使在使用非常大的K值进行评估时,也会推动LM推理的边界。 #### 教师模型引导 🌈🌈 2025-06-25 10:22:21 Wednesday | 7B小模型超越DeepSeek-R1:模仿人类教师,弱模型也能教出强推理LLM | Transformer作者团队 https://mp.weixin.qq.com/s/TQBWalcM4fdB--m2oR8CJQ Sanaka AI的新方法不再通过解决问题来教学,而是让新的强化学习教师(RLTs)“学会教学”:要求它们根据已知解决方案输出清晰的逐步解释,就像优秀的人类教师一样。 --- 刚刚,由“Transformer八子”之一 Llion Jones 联合创立的 AI 初创公司 Sakana AI 提出了一种新的 RL 范式——**“强化学习教师”**(Reinforcement Learned Teacher,**RLT**) 。 据介绍,RLT **通过学习如何教学而非直接解决问题,来教会大语言模型(LLM)如何进行推理**,有效解决了传统教师模型 RL 过程耗时长、成本高、应用领域窄等诸多难题。 https://mp.weixin.qq.com/s/sjTwx0FoSptpTxC8gzYz6g 相关研究论文以“ *Reinforcement Learning Teachers of Test Time Scaling* ”为题,已发表在预印本网站 arXiv 上。 论文链接: https://arxiv.org/abs/2506.08388 #### 形式化推理 ##### [#18](https://arxiv.org/abs/2509.09810) [Towards a Common Framework for Autoformalization](https://papers.cool/arxiv/2509.09810) #18 朝向自动形式化的通用框架 自动形式化(autoformalization)已成为指代形式化自动化的术语——具体来说,是使用交互式定理证明器(证明助手)对数学进行形式化。其快速发展由深度学习的进展推动,尤其是大型语言模型(LLMs)。最近,该术语的含义已超出数学范畴,用来描述将非正式输入翻译为形式逻辑表示的更广泛任务。与此同时,越来越多的研究探索使用 LLMs 将非正式语言翻译为用于推理、规划和知识表示的形式表示——通常并不明确将这一过程称为自动形式化。因此,尽管处理的任务相似,这些研究领域在很大程度上的独立发展限制了共享方法论、基准和理论框架的机会,而这些本可加速进展。本文的目标是回顾——无论明示或暗示——可被视为自动形式化的实例,并提出一个统一框架,鼓励不同领域之间的交叉交流,以推动下一代人工智能系统的发展。 发布:2025-09-11 19:28:56 协调世界时(UTC) ##### StepFun-Formalizer:通过知识推理融合释放 LLMs 的自动形式化潜力 [#17](https://arxiv.org/abs/2508.04440)[StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion ](https://papers.cool/arxiv/2508.04440) 自动形式化旨在将自然语言的数学陈述翻译成形式语言。虽然 LLMs 加速了该领域的进展,但现有方法仍存在准确率低的问题。我们确定了有效自动形式化的两个关键能力:对形式语言领域知识的全面掌握,以及自然语言问题理解和非正式-正式对齐的推理能力。缺乏前者,模型无法识别正确的形式对象;缺乏后者,模型难以解释现实世界的语境并将其精确映射为形式表达。为解决这些不足,我们引入了 ThinkingF,一种数据合成和训练流程,提升这两种能力。首先,我们构建了两个数据集:一个通过提炼和筛选大量富含形式知识的示例,另一个通过专家设计的模板指导生成非正式到正式的推理轨迹。随后,我们利用这些数据集进行 SFT 和 RLVR 训练,进一步融合和优化这两种能力。最终得到的 7B 和 32B 模型既具备全面的形式知识,又拥有强大的非正式到正式推理能力。 值得注意的是,StepFun-Formalizer-32B 在 FormalMATH-Lite 上取得了 40.5% 的 SOTA BEq@1 分数,在 ProverBench 上取得了 26.7%,超越了所有先前的通用和专用模型。 发布时间:2025-08-06 13:28:22 UTC ##### 普林斯顿团队领衔发布最强开源数学定理证明模型:32B性能大幅超越前代SOTA DeepSeek 671B

AgentSynth:面向通用计算机使用智能体的可扩展任务生成

AgentSynth通过组合易生成的原子子任务,低成本合成超过6000个难度可控的计算机使用任务及轨迹。

 数据合成 智能体 数据工程 模型评估

AgentSynth是一条面向通用计算机使用智能体的自动化数据合成管线,由角色引导的LLM任务提议器、执行并记录轨迹的智能体,以及负责汇总子任务的独立智能体组成。它利用信息不对称,将生成时简单、组合后更具挑战性的子任务串联为长期复合任务,并通过调整子任务数量控制难度。该方法生成了超过6000个多样且贴近现实的任务,平均每条轨迹成本约为0.60美元。实验中,先进LLM智能体的成功率从难度1的18%下降至难度6的4%,表明合成基准具有较强的难度和区分度。

用途与启示
  • 为计算机使用智能体低成本扩充高质量任务与交互轨迹,减少对人工标注的依赖。
  • 通过可控组合原子子任务,系统构造不同复杂度的长程任务。
  • 可用于智能体训练、能力评估和失败模式分析,并为课程学习式数据生成提供参考。
📝 原始笔记(逐字保留)
2025-06-19 20:39:39 Thursday | AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents **标题** : AgentSynth:通用计算机使用代理的可扩展任务生成 **链接** :https://arxiv.org/abs/2506.14205 **作者** : Jingxu Xie, Dylan Xu, Xuandong Zhao, Dawn Song **摘要** :我们介绍了AgentSynth,一个可扩展的和具有成本效益的管道,用于自动合成高质量的任务和轨迹数据集的通才计算机使用代理。利用信息不对称,AgentSynth构建子任务,这些子任务在生成过程中很简单,但在组成长期任务时更具挑战性,从而能够创建6,000多个多样化和现实的任务。我们的管道从基于LLM的任务提议者开始,由角色引导,然后是完成任务并记录轨迹的执行代理。这个过程反复重复,形成一系列子任务,然后由一个单独的代理汇总成一个可控难度的复合任务。AgentSynth的一个关键优势是它能够通过改变子任务的数量来精确地调节任务的复杂性。经验评估表明,最先进的LLM代理遭受了急剧的性能下降,从18%的成功在难度1级到只有4%在6级,突出了基准的难度和辨别力。此外,我们的管道实现了每个轨迹0.60美元的低平均成本,比人类注释便宜几个数量级。我们的代码和数据可在https://github.com/sunblaze-ucb/AgentSynth上公开获取 #### TaskCraft:AI任务自动化新突破 41k数据集开源 🔗 [链接](https://www.xiaohongshu.com/explore/6853e439000000000d026118?note_flow_source=wechat&xsec_token=CBKYJ7EEjv9ZnstP7m9MEUpBZcTw4ZgFE2t1NF7WMM87o=) 首个自动化生成和评估Agentic Tasks的方法。相关论文是TaskCraft,代码和数据也已开源。 在Agent RL、学习和优化领域,高质量的Agentic Task数据至关重要。但现有数据集如GAIA和BrowserComp都受限于人工标注。之前像self-instruct这样的方法无法生成真正复杂的多工具、多步骤任务。 这项工作的核心思路是从简单易验证的Atomic Tasks开始构建,然后通过结构化分层扩展逐步增加复杂度。 研究团队使用TaskCraft进行了两个关键实验: * 利用生成的Prompt Learning数据优化任务生产流程,采样成功率提升超过10%,同时减少了采样时间。 * 基于该数据集对Agent Foundation Model进行微调,在HotpotQA、Musique和Bamboogle等基准上取得了显著准确率提升 最终构建了一个包含41k个agentic tasks的大规模数据集,为AI agent的系统性调优和评估提供了坚实基础。 作者推推: Dingfeng Shi 参考地址: https://x.com/dingfeng_shi/status/1935603682156188044 #### 不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B

MiniMax 发布海螺 2.0,原生支持 1080P

MiniMax 发布海螺 2.0,强化极端物理场景的处理能力,并原生支持 1080P 输出。

 模型开发 多模态 人工智能

MiniMax 正式发布海螺 2.0。新版本重点提升了对极端物理情况的处理能力,有望改善复杂动态场景的生成效果。模型原生支持 1080P,可直接生成更高分辨率的内容。

用途与启示
  • 适用于复杂物理运动与高分辨率视频内容生成
  • 体现视频生成模型正持续增强物理规律理解与画质表现
📝 原始笔记(逐字保留)
11. 2025-06-19 20:05:29 Thursday | MiniMax刚刚发布海螺2.0版本,能处理极端物理情况,原生支持1080P。

Gemini 2.5 Pro 稳定版全面可用

Google 正式发布并全面开放 Gemini 2.5 Pro 稳定版,模型与 6 月 5 日推出的预览版保持一致,并展示了其完成宝可梦等长期复杂任务的能力。

 模型开发 人工智能 推理 智能体 任务规划

Google 于 2025 年 6 月 19 日宣布 Gemini 2.5 Pro 稳定版全面可用,其模型能力与 6 月 5 日发布的预览版相比没有变化。官方技术报告系统介绍了该模型的能力与评估结果。相关研究还展示了 Gemini 智能体游玩《宝可梦》的完整过程,模型能够执行长期复杂任务,并发现一处约 30 年前游戏代码中的 Bug。这一案例体现了模型在推理、规划和持续交互方面的潜力。

用途与启示
  • 为需要稳定版本的开发者和企业提供可用于生产环境的 Gemini 2.5 Pro。
  • 展示大模型在长周期游戏任务、环境交互和动态规划中的智能体能力。
  • 通过发现历史代码 Bug,说明模型可辅助复杂软件系统的调试与分析。
📝 原始笔记(逐字保留)
12. 2025-06-19 19:40:54 Thursday | Gemini 2.5 Pro 稳定版发布且已全面可用,其与 6 月 5 日的预览版相比无变化。 1. 报告地址:https://storage.googleapis.com/deepmind-media/gemini/gemini_v2_5_report.pdf 2. AI玩宝可梦找出30年前代码Bug!谷歌论文介绍AI通关全过程,复杂任务都能解 https://mp.weixin.qq.com/s/fOGbijWnqEloziC3TISz_w

Xolver:基于整体经验学习的多智能体推理框架

Xolver通过持久且持续演化的整体经验记忆,让多个智能体在推理时综合检索、工具、协作与反馈经验,无需训练即可显著提升数学和代码推理能力。

 智能体 推理 人工智能框架 智能体记忆 智能体工具 自进化

Xolver是一个无需额外训练的多智能体推理框架,为黑盒大语言模型引入持久且不断演化的整体经验记忆。它融合外部与自我检索、工具使用、智能体协作、代理评估和迭代改进,使模型能够复用策略、代码片段及抽象推理模式。该框架适用于开放权重和专有模型,轻量级骨干也能在多项任务上超过更大规模的先进模型。搭载o3-mini-high时,Xolver在GSM8K、AIME 2024/2025、Math-500和LiveCodeBench-V5上取得了领先结果。

用途与启示
  • 为构建可持续积累经验、避免每次从零推理的智能体系统提供参考。
  • 展示多智能体协作、经验检索与迭代评估可以在无需训练的情况下增强黑盒模型。
  • 可用于数学竞赛、代码生成及其他需要复杂推理和策略复用的任务。
  • 说明高质量记忆与经验编排可能比单纯扩大模型参数更具性价比。
📝 原始笔记(逐字保留)
3. 🌈 2025-06-19 20:41:50 Thursday | Xolver: Multi-Agent Reasoning with Holistic Experience Learning Just Like an Olympiad Team **标题** : Xolver:像奥林匹克运动队一样具有整体体验学习的多智能体推理 **链接** :https://arxiv.org/abs/2506.14234 **作者** : Md Tanzib Hosain, Salman Rahman, Md Kishor Morol, Md Rizwan Parvez **摘要** :尽管在复杂推理方面取得了令人印象深刻的进展,但当前的大型语言模型(LLM)通常是孤立地运行的-将每个问题视为独立的尝试,而不积累或整合经验知识。相比之下,专家级的问题解决者--如奥林匹克竞赛或编程竞赛团队--利用丰富的经验:从教练那里吸收指导,从过去的问题中发展直觉,利用工具使用和库功能的知识,根据同行的专业知识和经验调整策略,通过试验和错误不断完善他们的推理,甚至在竞争中从其他相关问题中学习。我们介绍 **Xolver,一个无需训练的多智能体推理框架,它为黑盒LLM提供了持久的,不断发展的整体体验记忆** 。Xolver集成了多种体验模式,包括外部和自我检索、工具使用、协作交互、代理驱动的评估和迭代改进。通过在推理时学习相关策略、代码片段和抽象推理模式,Xolver避免从头开始生成解决方案-标志着从孤立推理到经验感知语言代理的转变。Xolver建立在开放权重和专有模型之上,始终优于专业推理代理。即使具有轻量级骨干(例如,QWQ-32 B),它经常超越包括Qwen 3 - 235 B,Gemini 2.5 Pro,o3和o 4-mini-high在内的先进型号。通过o3-mini-high,它在GSM 8 K(98.1%)、AIME'24(94.4%)、AIME'25(93.7%)、Math-500(99.8%)和LiveCodeBench-V5(91.6%)上取得了新的最佳结果,突出了整体经验学习作为实现具有专家级推理能力的通才代理的关键一步。代码和数据可在https://kagnlp.github.io/xolver.github.io/上获得。 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=NWI5ODE5MGM2Y2I1MjliZjNkNjlhODJmZjZlMWQ1YjRfZHdyU2dOVnhMZENZcnZKZUQ4Q1ZhUldLNkpiNU10RTRfVG9rZW46SlExVGJmMThvb3J0aE14dDRtamN6WU85bmtnXzE3NTQ0NjA3MDU6MTc1NDQ2NDMwNV9WNA)

SageAttention3:FP4 量化加速注意力并探索 8 比特训练

清华团队提出 SageAttention3,通过微缩放 FP4 注意力实现最高约 5 倍推理加速,并首次探索对 8 比特训练的支持。

 模型训练 系统优化 推理 模型开发

SageAttention3 将微缩放 FP4 量化用于注意力计算,以降低推理阶段的计算与存储开销。该方法可实现最高约 5 倍的注意力加速,体现了低比特计算在大模型系统优化中的潜力。论文还探索了 8 比特训练支持,将 SageAttention 的应用范围从推理进一步扩展至训练。相关实现已在 GitHub 开源。

用途与启示
  • 为大模型注意力模块提供低比特、高吞吐的推理优化方案
  • 展示 FP4 微缩放量化在降低算力与显存成本方面的潜力
  • 为 8 比特训练及训练—推理一体化低精度计算提供参考
📝 原始笔记(逐字保留)
2025-06-19 19:52:13 Thursday | 清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练 https://mp.weixin.qq.com/s/aVlYM_cMrpTKeH3ao-UJuA 论文标题:SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-bit Training 论文链接:https://arxiv.org/abs/2505.11594 开源代码:https://github.com/thu-ml/SageAttention ## 算力集群

LiveCodeBench Pro:奥赛级竞技编程基准揭示顶尖 LLM 的推理短板

LiveCodeBench Pro 以持续更新的 584 道顶级竞赛题评估大模型,发现模型擅长模板化知识与逻辑问题,却在观察推导、边界处理和交互式任务上显著落后。

 模型评估 人工智能辅助编程 推理 逻辑推理 数据工程

纽约大学、普林斯顿大学等 8 家机构提出 LiveCodeBench Pro,用于检验大语言模型是否具备接近奥赛选手的真实竞技编程能力。基准收录截至 2025 年 4 月 25 日的 584 道 Codeforces、ICPC 和 IOI 等赛事题目,并通过持续更新降低数据污染风险。评测显示,模型在数据结构、图论、组合数学和动态规划等可复用模板或思维模式的问题上表现较好,但在博弈、贪心、构造和 ad-hoc 等依赖新颖观察的问题上评分明显下降。模型还普遍难以完成分类讨论、识别边界情况和解决交互式问题,表明高分并不等同于稳定、全面的算法推理能力。

用途与启示
  • 用于更严格地区分模型的代码模板记忆、工具使用与真实算法推理能力。
  • 为竞技编程模型评测提供持续更新、较低污染风险的高难度题库。
  • 提示训练与研究应加强新颖观察、分类讨论、边界条件处理及交互式推理能力。
  • 可用于分析不同模型在知识密集型、逻辑密集型和观察密集型任务上的能力差异。
📝 原始笔记(逐字保留)
2. 2025-06-19 19:56:13 Thursday | 谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分 https://mp.weixin.qq.com/s/TAhNaPBl8bDE_IeWpHDrWg LLMs 真的具备与顶级人类选手相当的推理能力吗?模型的高分究竟有多少来自真实的推理能力,又有多少是依赖外部工具的结果? 为了解答上述问题,来自纽约大学、普林斯顿大学等 8 家机构的研究者提出了 LiveCodeBench Pro,这是一个极具挑战性的竞技编程基准测试。 LiveCodeBench Pro 收录了 584 道截至 2025 年 4 月 25 日的高质量题目,这些题目均来自 Codeforces 、ICPC 系列赛和 IOI 系列赛等顶级赛事。并且这些问题会不断更新以降低可能的数据污染。 论文标题:LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming? 论文地址:https://arxiv.org/pdf/2506.11928 项目主页:https://livecodebenchpro.com/ GitHub:https://github.com/GavinZhengOI/LiveCodeBench-Pro 文中展示了 6 个模型在各类编程问题中的表现。研究发现,人类在不同问题标签上的表现更为一致,而模型的评分则因标签不同而显示出更大的差异。主要发现总结如下: **知识密集型问题是大语言模型的舒适区。** 带有如线段树、图论、树和数据结构等标签的问题,在大多数模型上都表现出很高的性能。这些问题通常可以通过拼接众所周知的模板(例如,树状数组、迪杰斯特拉算法、欧拉路径)来解决。这正是大语言模型的优势所在,因为所需的模式会以字面形式出现在其训练数据中,并且生成语法正确的模板对于大语言模型来说比对人类容易得多。 **逻辑密集型问题也取得了同样好的结果。** 大语言模型在逻辑密集型类别中也表现出色,例如组合数学、数学、动态规划和二分搜索。这些类别需要更有模式的思维方式(例如,在组合数学中应用组合恒等式,在动态规划中构建状态空间并推导转移函数),并且可以从记忆化的脚手架代码中受益。 **在观察密集型问题上表现不佳。** 对于博弈论、特定问题特定分析(ad-hoc)、贪心算法和构造性问题,大多数模型的评分骤降至 1500 以下,明显低于其在知识密集型和逻辑密集型类别中的表现。解决这些问题通常取决于发现新颖的见解,而这是无法仅靠记忆化的代码片段来获得的。 **大语言模型在分类讨论上遇到困难。** 有趣的是,所有模型都在分类讨论上表现不佳。除了 o4-mini-high 之外,每个模型的评分都低于 1500 分,即便是 o4-mini-high,其表现在此类别中也远逊于其他问题类别。人工检查显示,无法识别和处理边界情况是所有模型的一个突出失败模式。 **交互式问题暴露了模型的显著弱点。 **在交互式问题上,o4-mini-high 的评分骤降至 1500 左右,其他模型也表现挣扎。论文附录中讨论了这种糟糕表现背后的可能原因,并指出了 o3-mini-high 在解决交互式问题时出现的异常行为。

使用多语言数字谜题研究语言模型中语言与数学推理的相互作用

研究通过多语言数字谜题发现,大语言模型难以从语言表达中隐式推断数字的组合结构,通常需要显式数学符号才能稳定求解。

 逻辑推理 推理 模型评估

论文利用多语言数字谜题,考察语言模型如何协调语言理解与数学推理。实验显示,模型无法稳定解决依赖跨语言数字系统的问题,除非使用 +× 等已知符号明确标注数学运算。进一步的消融实验分析了数字结构及组合参数对模型表现的影响。与能够根据语言知识推断隐含数字组成规则的人类相比,当前模型仍缺乏稳健的隐式组合结构理解能力。

用途与启示
  • 可用于评估模型能否将语言形式映射为抽象数学结构,而非仅依赖熟悉的运算符模式。
  • 提示训练和数据设计应加强跨语言数字表达、组合规则归纳及符号接地能力。
  • 为区分语言理解失败与数学计算失败提供了可控的实验框架。
📝 原始笔记(逐字保留)
7. 2025-06-19 20:38:48 Thursday | Investigating the interaction of linguistic and mathematical reasoning in language models using multilingual number puzzles **标题** : 使用多语言数字谜题研究语言模型中语言和数学推理的相互作用 **链接** :https://arxiv.org/abs/2506.13886 **作者** : Antara Raaghavi Bhattacharya, Isabel Papadimitriou, Kathryn Davidson, David Alvarez-Melis **摘要** :在不同的语言中,数字系统在构建和组合数字的方式上有很大的不同。虽然人类一直在学习驾驭这种多样性,但大型语言模型(LLM)仍在努力解决涉及跨语言数字系统的语言数学难题,人类可以学习成功解决这些难题。我们调查为什么这个任务是困难的LLM通过一系列的实验,解开语言中的数字的语言和数学方面。我们的实验表明,模型不能一致地解决这些问题,除非问题中的数学运算使用已知的符号($+$,$\times$等,如“20 + 3”)显式标记。在进一步的消融研究中,我们探讨了数字结构和组合的单个参数如何影响性能。虽然人类使用他们对数字的语言理解来推断数字的隐含组成结构,但LLM似乎缺乏这种隐含数字结构的概念。我们的结论是,从人类规模的数据中的隐式模式灵活地推断组成规则的能力仍然是当前推理模型的一个公开挑战。

S⁴C:利用语法与语义一致性加速大模型推理

S⁴C通过多头起草与连续验证树增强推测采样,在保持语法和语义一致性的同时实现2.26至2.60倍的大模型推理加速。

 逻辑推理 推理 系统优化 人工智能框架

大型语言模型的自回归生成机制带来较高推理延迟,而现有推测采样方法往往未充分利用生成文本的内在一致性。S⁴C框架同时建模语法与语义一致性,通过多头起草机制快速生成候选令牌。它使用连续验证树进行并行候选验证和计算功能复用,从而以更少资源接受更多有效令牌。在 Spec-Bench 上,该方法取得2.26至2.60倍加速,并优于当时的主流基线。

用途与启示
  • 为大模型实时应用提供低延迟推理方案。
  • 表明语法和语义一致性可用于提高推测解码的候选接受率。
  • 连续验证树与功能复用机制可为后续并行解码和推理系统优化提供参考。
📝 原始笔记(逐字保留)
4. 2025-06-19 20:37:59 Thursday | S$^4$C: Speculative Sampling with Syntactic and Semantic Coherence for Efficient Inference of Large Language Models **标题** : S $' 4$C:具有语法和语义一致性的推测抽样,用于高效推理大型语言模型 **链接** :https://arxiv.org/abs/2506.14158 **作者** : Tao He, Guang Huang, Yu Yang, Tianshi Xu, Sicheng Zhao, Guiguang Ding, Pengyang Wang, Feng Tian **摘要** :大型语言模型(LLM)在不同的下游任务中表现出卓越的推理能力。然而,它们的自回归性质导致大量的推理延迟,给实时应用带来了挑战。推测性采样通过引入起草阶段和并行验证阶段来缓解这个问题,从而实现更快的令牌生成和验证。然而,现有的方法忽略了文本生成的内在一致性,限制了它们的效率。为了解决这一差距,我们提出了一个具有语法和语义一致性的推测性采样(S$^4$C)框架,该框架通过利用多头起草快速令牌生成和连续验证树进行有效的候选验证和功能重用来扩展推测性采样。实验结果表明,S$^4$C超越了主流任务的基线方法,提供了更高的效率,并行性和以更少的计算资源生成更多有效令牌的能力。在Spec-bench基准测试中,S$^4$C实现了2.26x-2.60x的加速比,优于最先进的方法。 ## 智能体研究 [#9](https://arxiv.org/abs/2509.11943)[用于自主诊断的具有模态逻辑的神经符号代理](https://papers.cool/arxiv/2509.11943) Authors: [Antonin Sulc](https://arxiv.org/search/?searchtype=author&query=Antonin%20Sulc), [Thorsten Hellert](https://arxiv.org/search/?searchtype=author&query=Thorsten%20Hellert) 智能代理的发展,特别是那些由语言模型 (LM) 驱动的智能代理,已经显示出在需要智能和自主决策的各种环境中的关键作用。环境不是被动的试验场,它们代表了代理学习和展示非常具有挑战性的条件所需的数据,这些条件需要适应性、复杂和自主的能力来做出决策。虽然扩展模型和数据集的范式带来了显着的新兴能力,但我们认为,在这些环境中扩展代理推理的结构、保真度和逻辑一致性是人工智能研究的一个至关重要但未被充分探索的维度。本文介绍了一种神经符号多智能体架构,其中单个智能体的信念状态被正式表示为克里普克模型。这种基本选择使他们能够使用模态逻辑的形式语言对已知的 \emph{possibility} 和 \emph{necessity} 概念进行推理。在这项工作中,我们使用不可变的、特定于领域的知识来制作推断信息,这些信息被编码为正确诊断所必需的逻辑约束。在所提出的模型中,我们展示了主动指导 LM 假设生成的约束,有效地阻止它们得出物理或逻辑上站不住脚的结论。在高保真模拟粒子加速器环境中,我们的系统通过将 LM 强大的语义直觉与模态逻辑和事实世界模型的严格、可验证的验证相结合,成功诊断了复杂的级联故障,并展示了一条通往更强大、可靠和可验证的自主代理的可行路径。 科目: [人工智能](https://papers.cool/arxiv/cs.AI), [机器学习](https://papers.cool/arxiv/cs.LG), [计算机科学中的逻辑](https://papers.cool/arxiv/cs.LO), [多智能体系统](https://papers.cool/arxiv/cs.MA) 发布: 2025-09-15 14:03:06 UTC ## 游戏研究 #### [Arxiv:](https://arxiv.org/abs/2509.09867) [LLMs as Agentic Cooperative Players in Multiplayer UNO](https://papers.cool/arxiv/2509.09867) LLMs 不只是通过回答问题来协助人类,还可以在广泛的任务中提供有用的指导。但这种辅助能走多远?基于大型语言模型的代理能否作为积极参与者真正帮助他人实现目标?我们通过让 LLM 参与回合制纸牌游戏 UNO 来检验这个问题,要求其不是取胜,而是帮助另一名玩家获胜。我们构建了一个工具,使仅解码器架构的 LLM 能作为代理在 RLCard 游戏环境中参与。这些模型获得完整的游戏状态信息,并在两种不同的提示策略下使用简单文本提示作出回应。我们评估了从小型(1B 参数)到大型(70B 参数)的模型,并探讨模型规模如何影响性能。我们发现,虽然所有模型在玩 UNO 时都能成功超越随机基线,但很少有模型能显著地帮助另一名玩家。 发布:2025-09-11 21:42:33 UTC #### 🌈🌈🌈 沉迷贪吃蛇,7B小模型竟变身「数学天才」!几何推理碾压GPT-4o
0%