2025-06-23 科研追新

当日精选(由提交工具自动创建)。

首篇稀疏自编码器系统综述:解析大模型内部机制

首篇 SAE 系统综述全面梳理稀疏自编码器在大语言模型机制可解释性研究中的技术演化、应用方法与未来挑战。

 元学习 人工智能

稀疏自编码器(SAE)正成为大模型机制可解释性领域的重要技术路线。它通过学习稀疏特征表示,帮助研究者分析大语言模型内部激活及其潜在语义。综述论文《A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models》系统总结了 SAE 的核心技术、发展脉络与应用进展,并讨论了该方向面临的挑战。该工作可为关注大模型透明性、可控性以及心智理论和意识等问题的研究者提供参考。

用途与启示
  • 系统了解 SAE 在大模型机制可解释性中的技术框架与研究进展
  • 为分析模型内部特征、行为成因和“思考”机制提供方法参考
  • 辅助开展大模型透明性、可控性及安全性研究
  • 帮助识别 SAE 路线尚未解决的问题与未来研究机会
📝 原始笔记(逐字保留)
2025-06-23 12:11:35 Monday | 大模型到底是怎么「思考」的?第一篇系统性综述SAE的文章来了 https://mp.weixin.qq.com/s/DNg4O4pirbiT56PP_6VtAQ 一种叫做 Sparse Autoencoder(简称 SAE) 的新兴技术正迅速崛起,成为当前最热门的 mechanistic interpretability(机制可解释性) 路线之一。最近,我们撰写并发布了第一篇系统性的 SAE 综述文章,对该领域的技术、演化和未来挑战做了全面梳理,供关注大模型透明性、可控性和解释性的研究者参考。 论文题目: A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models 论文地址: https://arxiv.org/pdf/2503.05613 ## 心智理论ToM / 意识

CVPR 2025 Award Candidate:Difix3D+ 用单步扩散模型修复 3D 重建伪影

英伟达等团队提出 Difix3D+,利用单步扩散模型修复 3D 渲染伪影,从而提升新视角图像的质量与一致性。

 多模态 模型开发 系统优化 人工智能

英伟达联合研究团队提出 Difix3D+,以单步扩散模型对 3D 重建后的渲染图像进行修复。该方法重点消除新视角合成中的伪影,并改善跨视角的视觉一致性。由于只需单步扩散处理,该方案兼顾生成质量与推理效率,并成为 CVPR 2025 Award Candidate。

用途与启示
  • 为 3D 重建和新视角合成提供高效的后处理方案
  • 展示扩散模型在三维视觉伪影修复中的应用潜力
  • 为兼顾渲染质量、跨视角一致性和推理速度提供思路
📝 原始笔记(逐字保留)
7. CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影 机器之心 2025年06月23日 12:05 https://mp.weixin.qq.com/s/C9XQZDuI1D9mQmyiSsOTvg 来自英伟达的研究团队联合提出了一种创新方案 —— Difix3D+,通过单步扩散模型对 3D 渲染结果进行 “图像修复”,显著提升新视角图像的质量和一致性 ## 综述

OpenUni:1.1B 参数统一多模态模型媲美 BLIP3-o-8B

南洋理工大学与商汤科技推出统一视觉理解和图像生成模型 OpenUni,以 1.1B 参数实现媲美 BLIP3-o-8B 的性能,并全面开源代码、权重和数据。

 多模态 模型开发 模型训练 数据工程 智能体工具

OpenUni 是南洋理工大学 S-Lab 与商汤科技新加坡研究院联合推出的统一多模态理解与生成模型,可视为 MetaQuery 的开源实现。该模型仅有 1.1B 参数,却取得了可与 BLIP3-o-8B 相媲美的性能,展示了小参数模型在统一视觉任务上的潜力。项目采用开放路线,代码、模型权重和数据均已开源,为复现和后续研究提供了完整基础。其技术报告题为《OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation》。

用途与启示
  • 为统一视觉理解与图像生成研究提供轻量、可复现的开源基线
  • 适合研究小参数模型如何逼近大规模统一多模态模型的性能
  • 完整开放代码、权重和数据,可用于二次训练、能力评估及工程部署
📝 原始笔记(逐字保留)
4. 2025-06-23 12:06:35 Monday | 开源版MetaQuery来了!OpenUni用1.1B参数媲美BLIP3-o-8B,数据代码完全开源 https://mp.weixin.qq.com/s/AsKAqA8NJE-S132cfM44kg 随着 GPT-4o 展现出令人印象深刻的多模态能力,将视觉理解和图像生成统一到单一模型中已成为 AI 领域的研究趋势(如MetaQuery 和 BLIP3-o )。 南洋理工大学 S-Lab 和商汤科技的研究团队推出 OpenUni,一个开源版 MetaQuery,仅用 1.1B 参数达到 8B 模型性能,更将代码、权重、数据全部开源! 技术报告: OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation 机构: 南洋理工大学 S-Lab、商汤科技新加坡研究院 作者: Size Wu*, Zhonghua Wu*, Zerui Gong* (* 同等贡献), Qingyi Tao, Sheng Jin, Qinyue Li, Wei Li, Chen Change Loy 开源代码: https://github.com/wusize/OpenUni 联系方式: size001@e.ntu.edu.sg ## 视频

月之暗面推出 Kimi-Researcher,自主 Agent 在“人类最后一场考试”取得 SOTA

月之暗面推出自主智能体 Kimi-Researcher,并在高难度基准“人类最后一场考试”上取得当时最新 SOTA 成绩。

 智能体工具 智能体 推理 任务规划 模型开发 人工智能

月之暗面发布了自主 Agent Kimi-Researcher,强调其面向复杂研究任务的自主执行能力。该智能体能够围绕目标开展信息检索、推理分析与任务规划,并整合结果生成回答。消息称,Kimi-Researcher 在高难度评测“人类最后一场考试”(Humanity’s Last Exam)中刷新了 SOTA。

用途与启示
  • 可用于复杂问题调研、资料检索与研究报告生成
  • 展示了自主规划和工具调用对提升高难度任务表现的价值
  • 可作为评估通用研究型 Agent 能力与工程路线的参考
📝 原始笔记(逐字保留)
2025-06-23 12:00:44 Monday | 月之暗面「调教」出最强Agent,在「人类最后一场考试」拿下最新 SOTA【 Kimi-Researcher 的自主 Agent】

AI 运维工具 Chaterm

Chaterm 是一款面向 AI 运维场景、涉及代码生成能力的工具。

 智能体工具 人工智能辅助编程 人工智能应用

Chaterm 是一款面向 AI 运维场景的工具。其能力涉及代码生成,可辅助完成运维相关的脚本或命令编写。原文于 2025 年 6 月 23 日发布在微信公众号。

用途与启示
  • 借助代码生成降低运维脚本的编写门槛
  • 提升日常系统管理与故障处理效率
  • 探索 AI 编程能力在运维工作流中的落地
📝 原始笔记(逐字保留)
2025-06-23 12:54:19 Monday | AI运维:Chaterm https://mp.weixin.qq.com/s/Ul34ADcuCpC5u65KT5kWRw ### 代码生成

清华发布首个万亿级时间点预训练生成式时序大模型「日晷」

清华团队发布生成式时序大模型「日晷」,通过万亿级时间点预训练提升通用时序建模能力,相关成果入选 ICML Oral。

 人工智能应用 模型开发 模型训练 人工智能

清华团队发布生成式时序大模型「日晷」,其核心特点是在万亿级时间点数据上开展预训练。该模型面向通用时序数据的生成与建模,探索将大规模预训练范式应用于时间序列任务。相关研究成果获 ICML Oral,体现了通用时序基础模型方向的研究价值。

用途与启示
  • 为预测、异常检测及时间序列生成等应用提供通用基础模型思路
  • 表明扩大时序预训练的数据规模可能提升模型的迁移与泛化能力
  • 为金融、能源、气象和工业监测等领域的时序智能应用提供参考
📝 原始笔记(逐字保留)
5. 2025-06-23 12:50:53 Monday | 首个「万亿级时间点」预训练,清华发布生成式时序大模型日晷 | ICML Oral https://mp.weixin.qq.com/s/y3sc2e2lmW1sqfnoK-ZdDA ## 提示工程

ReasonGRM:通过大型推理模型增强生成式奖励模型

ReasonGRM利用大型推理模型增强生成式奖励模型,以提升复杂任务中的奖励判断与反馈能力。

 强化学习 推理 模型训练 模型评估

ReasonGRM研究如何借助大型推理模型增强生成式奖励模型。其核心方向是将推理能力引入奖励评估过程,使模型能够对复杂输出进行更深入的分析与判断。该方法可为强化学习中的奖励建模和策略优化提供更具解释性与可靠性的监督信号。

用途与启示
  • 改进强化学习中的奖励建模质量,为策略训练提供更可靠的反馈。
  • 探索大型推理模型在复杂回答评估与偏好判断中的应用。
  • 为构建具备推理能力、可解释性更强的生成式评估器提供参考。
📝 原始笔记(逐字保留)
11. 2025-06-23 11:32:17 Monday | **[arXiv:2506.16712 ](https://arxiv.org/abs/2506.16712)** [ **[pdf](https://arxiv.org/pdf/2506.16712)** , **[html](https://arxiv.org/html/2506.16712v1)** , **[other](https://arxiv.org/format/2506.16712)** ] **ReasonGRM:通过大型推理模型增强生成式奖励模型** 陈斌,高新泽,胡传瑞,于鹏航,张华,鲍冰昆 学科分类:计算与语言(cs.CL);人工智能(cs.AI)

从通用奖励到定向奖励:在开放式长文本生成任务中超越 GPT-4

论文研究从通用奖励转向面向特定目标的定向奖励,以提升开放式长文本生成质量,并报告了超越 GPT-4 的实验结果。

 强化学习 模型训练 推理 人工智能

该研究关注开放式长文本生成中的奖励设计问题。作者提出从通用奖励转向针对具体生成目标的定向奖励,以提供更精准的优化信号。论文在开放式长文本任务上验证了该方法,并报告其表现超过 GPT-4。该工作归属于计算与语言及人工智能方向。

用途与启示
  • 为长文本生成的强化学习训练提供更具针对性的奖励设计思路
  • 说明通用奖励模型未必适合所有开放式生成目标
  • 可用于改进故事、文章及其他长篇内容的质量对齐
📝 原始笔记(逐字保留)
12. 2025-06-23 11:33:01 Monday | arXiv:2506.16024 [pdf 版,html 版,其他格式] **从通用奖励到定向奖励:在开放式长文本生成任务中超越 GPT-4** 郭志涵、吴杰乐、崔文倩、张一飞、胡敏达、王雨菲、金国庆 学科分类:计算与语言(cs.CL);人工智能(cs.AI) ### 理论研究

SPARE:基于参考引导评估的单次过程标注框架

SPARE 通过参考答案步骤对齐实现高效的单次过程标注,可用于离线强化学习和过程奖励模型训练,并以更低成本达到接近树搜索标注的效果。

 强化学习 推理 模型训练 模型评估 数据工程

SPARE 将模型解题过程中的每一步与参考解答中的一个或多个步骤对齐,并结合明确依据完成单次逐步骤标注。实验覆盖数学推理、多跳组合问答和空间推理等四个跨领域数据集,验证了参考引导评估对过程监督的有效性。生成的标注既可用于离线强化学习微调、改善贪婪解码,也可训练过程奖励模型,对多个 LLM 输出进行排序或聚合。在高难度数学任务上,SPARE 的表现可媲美基于树搜索的自动标注方法,但仅需其 38% 的运行时间,效率提高 2.6 倍。

用途与启示
  • 以参考解答对齐替代昂贵的树搜索,降低自动化过程监督的计算成本。
  • 为离线强化学习提供细粒度步骤反馈,提升模型多步推理能力。
  • 用于训练过程奖励模型,对候选答案进行排序、筛选与聚合。
  • 为数学、组合问答及空间推理等领域构建可扩展的过程标注流水线。
📝 原始笔记(逐字保留)
2. 2025-06-23 11:07:56 Monday | https://arxiv.org/abs/2506.15498 SPARE:基于参考引导评估的单次标注框架——面向自动化过程监督与奖励建模 Md Imbesat Hassan Rizvi, Xiaodan Zhu, Iryna Gurevych 过程式或分步监督在提升大语言模型(LLMs)的复杂多步推理能力方面发挥着关键作用。然而,如何实现高效、高质量的**自动化过程标注**仍面临重大挑战。为此,我们提出基于参考引导评估的单次标注框架(SPARE),该创新性结构化框架通过将每个解题步骤与参考解决方案中的一个或多个步骤对齐,并辅以明确的评估依据,实现了单次逐步骤标注。实验表明,参考引导的步骤级评估能有效促进四个跨领域数据集(涵盖数学推理、多跳组合问答和空间推理三大领域)的过程监督。相较于基线方法,SPARE 在以下场景显著提升推理性能:(1)在离线强化学习设置中微调模型以实现推理阶段的贪婪解码;(2)训练奖励模型以对多个 LLM 生成输出进行排序/聚合。 此外,SPARE 在具有挑战性的数学数据集上展现出与基于树搜索的自动标注方法相媲美的性能,同时效率提升 2.6 倍,仅需 38%的运行时间。我们公开了代码库及训练好的 SPARE-PRM 模型,以促进后续研究和结果复现。 ### 生成奖励模型

基于可验证奖励训练接地大模型的经验总结

研究通过 GRPO、可验证结果奖励和两阶段训练优化答案准确性、引用充分性及拒答质量,显著提升接地大模型在长文本问答中的可靠性。

 强化学习 模型训练 推理 模型评估

该研究使用组相对策略优化(GRPO)训练接地大模型,并以答案准确性、引用充分性和拒答质量作为可验证的结果型奖励,无需黄金推理轨迹或昂贵人工标注。实验覆盖 ASQA、QAMPARI、ELI5 和 ExpertQA,推理增强模型在不可回答问题处理及高质量引用生成方面明显优于纯指令调优模型。研究提出先优化答案与引用行为、再训练拒答机制的两阶段方案,以获得更稳定的学习信号。此外,GPT-4 蒸馏与 GRPO 结合后,可进一步改善长文本生成式问答表现。

用途与启示
  • 为构建答案可核验、引用可信的 RAG 与问答系统提供强化学习训练方案。
  • 表明复杂可靠性目标可拆分为答案引用优化和拒答优化两个阶段,以提高训练稳定性。
  • 说明结果型奖励能够减少对人工标注及完整推理轨迹的依赖。
  • 可用于改善模型面对证据不足或问题不可回答时的拒答决策。
📝 原始笔记(逐字保留)
3. 2025-06-23 10:46:10 Monday | 基于可验证奖励训练接地 LLMs 的经验总结 生成可靠且可信的响应仍然是大型语言模型(LLMs)面临的关键挑战。虽然基于引用的检索增强生成(RAG)技术展现出潜力,但经过指令调优的模型即使在简单场景中也常出现失误:遗漏明确陈述的答案、错误引用或在证据可用时拒绝回答。本研究探索了如何通过强化学习(RL)和内部推理机制来增强 LLMs 的可靠性。我们采用 GRPO(组相对策略优化)方法,利用可验证的结果型奖励机制训练模型,该机制针对答案准确性、引用充分性和拒绝质量进行优化,且无需黄金推理轨迹或昂贵的人工标注。通过在 ASQA、QAMPARI、ELI5 和 ExpertQA 数据集上的全面实验表明,推理增强模型显著优于纯指令调优版本,尤其在处理不可回答问题与生成高引用质量响应方面表现突出。采用两阶段训练方案——先优化答案和引用行为,再优化拒绝机制——通过稳定学习信号进一步提升了模型的可靠性。 此外,我们通过 GPT-4 蒸馏方法重新审视指令调优,发现将其与 GRPO 结合能提升长文本生成式问答任务的性能。总体而言,我们的研究结果凸显了推理能力、分阶段优化以及结果导向的强化学习对于构建更具可验证性和可靠性的 LLMs 的重要价值。 https://arxiv.org/abs/2506.15522

ViLaSR-7B:通过“边画边想”学习人类式空间推理

ViLaSR-7B采用冷启动、反思拒绝采样和强化学习三阶段训练框架,学习在推理过程中主动操作图像,并在5个空间推理基准上平均提升18.4%。

 推理 多模态 强化学习 模型开发 模型训练 逻辑推理

ViLaSR-7B旨在让大模型掌握类似人类“边画边想”的空间推理能力,在文本推理过程中主动裁剪、缩放或旋转图像。其训练分为三个阶段:先通过冷启动建立基础视觉操作能力,再利用反思拒绝采样筛选高质量推理轨迹,最后通过强化学习直接优化任务目标。该方法借鉴了OpenAI o3和o4-mini所采用的“Thinking with Images”范式,使处理后的图像能够重新进入模型并支持后续推理。实验显示,ViLaSR-7B在5个空间推理基准上取得平均18.4%的提升。

用途与启示
  • 为需要空间关系理解、视觉操作和多步推断的任务提供可复用训练方案
  • 展示将图像操作嵌入推理轨迹、而非仅进行静态视觉问答的技术路径
  • 说明拒绝采样与强化学习可协同提升多模态推理轨迹的质量和任务表现
📝 原始笔记(逐字保留)
2025-06-23 12:35:10 Monday |ViLaSR-7B link:大模型掌握人类空间思考能力!三阶段训练框架学会“边画边想”,5个基准平均提升18.4% https://mp.weixin.qq.com/s/RguUL7iFlxuRk9WUXDnZUw *论文地址:* *https://arxiv.org/abs/2506.09965* *代码仓库:* *https://github.com/AntResearchNLP/ViLaSR* 他们设计了三阶段训练框架,来训练这种推理能力—— 首先通过冷启动训练建立基础的视觉操作能力,继而利用反思拒绝采样筛选高质量的推理路径,最后通过强化学习直接优化任务目标。 【背景】今年4月,OpenAI发布的o3和o4-mini模型在视觉推理领域取得重大突破。这两个模型采用“Thinking with Images”的推理范式,能够在文本形式的推理过程中主动进行图像操作(如裁剪、缩放、旋转等),并将操作后的图像重新输入模型进行下一步推理。 ### 游戏推理

AlphaOne:大模型先慢后快的测试时推理调控框架

UIUC 与 UC Berkeley 提出的 AlphaOne 通过统一的 α-moment 在测试时动态切换慢思考与快推理,以缓解大模型过度思考和思考不足的问题。

 推理 逻辑推理 人工智能 系统优化

AlphaOne 质疑模仿人类“先快后慢”思维节奏的默认范式,提出让推理模型在测试时先慢速思考、再快速完成推理。该框架引入统一调控点 α-moment,在该节点之前通过 Bernoulli 过程插入慢思考标记,之后使用终止标记切换至快速推理。整个方法无需额外训练,可连续调节模型的推理节奏。其目标是在保证推理质量的同时,减少冗长无效的过度思考,并避免模型过早结束推理。

用途与启示
  • 为测试时计算提供无需训练的推理节奏控制方法
  • 缓解长推理模型中的过度思考与思考不足问题
  • 启发研究者探索更符合模型自身特性的推理范式,而非机械模仿人类认知流程
  • 可用于平衡推理准确率、输出长度与计算成本
📝 原始笔记(逐字保留)
4. 2025-06-24 11:12:43 Tuesday | AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」https://mp.weixin.qq.com/s/FxMSNJqEHImzGbmW8BXReg 机器之心 2025年06月23日 15:44 北京 26人 星标 我们习惯让 AI 模仿人类思维方式:先依赖直觉快速反应(System 1),再慢慢进入逻辑推理(System 2);答题时先给出初步判断,再自我反思逐步修正……模仿人类的推理节奏,已经成为语言模型推理策略的默认路径。 最近,一项来自 UIUC 与 UC Berkeley 的新研究提出:也许模型不该再走这条「人类范式」的老路。 他们提出了一种新的测试时推理调控框架——AlphaOne,主张让模型反其道而行:先慢速思考,再快速推理。 论文标题: AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time 项目主页:https://alphaone-project.github.io/ 论文地址:https://arxiv.org/pdf/2505.24863 代码地址:https://github.com/ASTRAL-Group/AlphaOne 相比之下,现有模型往往要么陷入过度思考(overthinking),生成冗长无用的推理链;要么思考不足(underthinking),在问题真正展开前就草率收场。 这背后的根源在于:模型缺乏对推理节奏的主动调控能力,无法准确找到「该慢下来」的最佳时机。 AlphaOne 的核心,是引入统一的调控点 α-moment:α-moment 之前通过 Bernoulli 过程插入「慢思考」标记,之后用终止标记切换为快思考,实现无需训练的连续推理调控。 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=NWMwZGYwNTYyMzU4OTFmMmJiMDgzNzU0NjJiYzI1ZDNfNjh4SDFib241WjFBTlRrV3JxWllBblFQWTI2dVBVOWxfVG9rZW46T1lwZ2JZc0tKb0hBQkR4bXdPdGNpVG5wbjRmXzE3NTQ0NjQ5MTQ6MTc1NDQ2ODUxNF9WNA)

ProtoReasoning:以推理原型提升大模型跨领域泛化能力

ProtoReasoning 利用 Prolog 和 PDDL 构建可验证、可合成的抽象推理原型,以增强大语言模型在逻辑、规划及通用任务上的泛化能力。

 推理 逻辑推理 任务规划 模型训练 数据合成 人工智能框架

论文提出跨领域泛化源于不同任务共享的抽象推理原型,这些原型能够消除表层表达差异并保留核心推理结构。ProtoReasoning 将逻辑问题表示为 Prolog、将规划问题表示为 PDDL,并通过对应解释器提供可靠的自动验证反馈。该框架还支持在原型空间中规模化合成问题,同时保证生成样本的正确性。实验显示,该方法在 Enigmata-Eval、规划任务、MMLU 和 AIME24 上分别较基线提升 4.7%、6.3%、4.0% 和 1.0%,且对结构相似问题具有更强的迁移能力。

用途与启示
  • 将自然语言问题映射为可执行的形式化原型,可为推理训练提供更可靠的监督信号。
  • 借助 Prolog/PDDL 解释器自动验证合成数据,有助于降低推理数据中的答案与过程错误。
  • 在原型空间而非表面文本空间进行训练,为提升模型跨领域迁移和组合泛化提供了新路径。
  • 可用于构建逻辑推理、任务规划及数学推理等领域的可扩展训练数据。
📝 原始笔记(逐字保留)
4. 🌈 2025-06-23 11:16:41 Monday |https://arxiv.org/abs/2506.15211 ProtoReasoning:原型作为 LLMs 可泛化推理的基础 采用长链思维推理(Long CoT)训练的大型推理模型(LRMs)近期展现出卓越的跨领域泛化能力,但其背后的迁移机制仍不明确。我们提出假设: **跨领域泛化源于共享的抽象推理原型——这些基础推理模式能捕捉不同领域问题的本质** 。这些原型最小化了表征的细微差异,揭示出表面迥异的任务实则植根于共通的推理结构。 基于该假设,我们提出 ProtoReasoning 框架, **通过可扩展且可验证的原型表征(逻辑推理用 Prolog 语言,规划用 PDDL 语言)增强 LLMs 的推理能力** 。ProtoReasoning 具备三大特性: (1)自动化原型构建流程,将问题转化为对应原型表征; (2)通过 Prolog/PDDL 解释器提供可靠反馈的全面验证系统; (3)在原型空间内任意合成问题并确保正确性的可扩展性。 大量实验表明,ProtoReasoning 方法在逻辑推理(Enigmata-Eval)上比基线模型提升 4.7%,在规划任务上提升 6.3%,在通用推理(MMLU)上提升 4.0%,在数学能力(AIME24)上提升 1.0%。值得注意的是,消融研究证实,与仅基于自然语言表征的训练相比,在原型空间中进行学习还能对结构相似问题展现出更强的泛化能力,这验证了我们的假设——推理原型是大型语言模型中可泛化推理的基础。

RE-IMAGINE:用于推理评估的符号化基准合成

RE-IMAGINE 通过自动生成关联、干预和反事实层级的问题变体,评估大模型的推理表现究竟源于真实能力还是统计记忆。

 数据合成 推理 模型评估 逻辑推理 数据工程

RE-IMAGINE 是一个受因果阶梯理论启发的自动化符号基准合成框架,可生成关联、干预和反事实三个层级的问题变体。它通过改变问题的中间符号表示,构造难以仅凭训练数据记忆作答的新样本,并能扩展到数学、代码和逻辑等领域。作者在四个常用推理基准上进行验证,发现模型面对这些变体时性能显著下降。结果表明,现有基准中的高分可能在一定程度上依赖统计记忆,该框架可用于更细粒度地刻画模型的推理能力层次。

用途与启示
  • 自动合成数量可扩展、难以通过记忆直接解决的推理评测样本。
  • 区分模型的统计模式记忆与真正的推理、干预及反事实能力。
  • 为数学、代码和逻辑推理基准提供分层压力测试方法。
  • 帮助研究者定位不同推理层级的能力短板并改进训练与评估。
📝 原始笔记(逐字保留)
2025-06-23 11:11:03 Monday | https://arxiv.org/abs/2506.15455 RE-IMAGINE:用于推理评估的符号化基准合成 徐新诺 、 瑞秋·劳伦斯 、 克什提吉·杜贝 、 阿萨瓦·潘迪 、 上野理纱 、 法比安·法尔克 、 阿迪亚·V·诺里 、 拉胡尔·夏尔马 、 阿米特·夏尔马 、 哈维尔·冈萨雷斯 近期的大型语言模型(LLMs)在推理基准测试中报告了高准确率。然而,这些观察结果究竟源于真正的推理能力,还是来自训练集的统计记忆,目前仍不明确。受 **因果阶梯理论(Pearl, 2009)及其三个层级(关联、干预和反事实)的启发** ,本文提出 RE-IMAGINE 框架——该框架通过自动化流程生成不同层级的问题变体,用以刻画 LLMs 的推理能力层次结构。通过改变中间符号表示的问题形式,RE-IMAGINE 能生成任意数量无法仅靠记忆解决的问题。该框架具有通用性,可应用于数学、代码和逻辑等多个推理领域。我们在四个广泛使用的基准测试上验证该框架,发现当模型面对问题变体时性能显著下降。这些评估揭示了过往表现对统计记忆的依赖程度,并为针对推理层次结构中各项技能的深入研究开辟了新路径。 ## 数学数据

华为发布盘古大模型 5.5 系列

华为在 HDC 2025 上发布盘古大模型 5.5,并公布 Ultra MoE、Pro MoE、Embedding 及开放域信息获取智能体 DeepDiver 等模型与技术成果。

 模型开发 智能体 推理

华为在开发者大会 HDC 2025 上正式发布盘古大模型 5.5。该系列包含盘古 Ultra MoE 与盘古 Pro MoE,相关技术报告和项目资源已对外公布。华为还推出了小模型盘古 Embedding,用于文本表示与语义检索等任务。同期发布的盘古 DeepDiver 是面向开放域信息获取任务的智能体。

用途与启示
  • 展示华为在 MoE 大模型、向量表示模型和信息获取智能体方面的完整布局。
  • Pro MoE 开放项目可用于研究昇腾生态下的大模型训练与部署方案。
  • Embedding 与 DeepDiver 可为企业知识检索、开放域研究和智能问答系统提供技术参考。
📝 原始笔记(逐字保留)
10. 2025-06-23 11:46:54 Monday| 在华为开发者大会 2025(HDC 2025)上,华为重磅发布了盘古大模型 5.5 https://mp.weixin.qq.com/s/Ie824EYirtd3gqpog786Nw 1. 盘古 Ultra MoE 的技术 报告地址:https://arxiv.org/pdf/2505.04519 2. 盘古 Pro MoE 的技术报告 项目地址:https://gitcode.com/ascend-tribe/pangu-pro-moe 3. 小模型**盘古 Embedding **报告地址:https://arxiv.org/pdf/2505.22375 4. 华为发布了开放域信息获取 Agent—— **盘古 DeepDiver **报告地址:https://arxiv.org/pdf/2505.24332

ML-Agent:7B智能体仅用9个任务训练实现自主机器学习工程

上海交大团队提出ML-Agent,通过在线强化学习让7B智能体从少量机器学习任务的执行轨迹中持续学习,并在相关能力上超越R1。

 智能体 强化学习 自进化 模型训练 SWE 软件工程

论文提出基于学习的自主机器学习智能体ML-Agent,使智能体能够直接从机器学习任务的执行轨迹中学习。系统利用在线强化学习主动探索策略,在不同任务间积累知识并逐步优化决策。研究显示,7B规模智能体仅通过9个任务训练,便能取得超过R1的相关任务表现。这一方法将机器学习工程从依赖固定提示与人工流程,推进到可由经验驱动、持续自我提升的AI-for-AI范式。

用途与启示
  • 用于自动完成模型设计、实验执行与机器学习工程优化。
  • 说明少量高质量任务轨迹结合在线强化学习,可显著增强小型智能体的工程能力。
  • 为构建能够跨任务积累经验并持续自我进化的AI研发系统提供参考。
📝 原始笔记(逐字保留)
1. 2025-06-23 11:50:03 Monday | 7B智能体仅凭9个任务训练即超越R1!上交大打造AI-for-AI新范式 https://mp.weixin.qq.com/s/SXq5EZo5pGM2gAGzxIzULw 论文标题: ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering 论文地址: https://arxiv.org/pdf/2505.23723 代码地址: https://github.com/MASWorks/ML-Agent 为解决这一关键限制,该研究首次探索了基于学习的智能体自主机器学习范式,其中智能体可以通过在线强化学习从机器学习任务的执行轨迹中进行学习。这种方式使得智能体能够主动探索不同的策略,跨任务积累知识,逐步优化决策,持续从自身经验中学习,并通过训练不断提升其设计优化 AI 的能力。 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=MjI5YmQ3MmYzMzI3ODVjMjljNGQ1YWZkOWY2NjcwN2RfMGNqcG1CcHFjekNrdnlkTFBKazUzVTlJdTdPdmxCT1dfVG9rZW46SzQ3Q2I5UDY3b2NaVll4UzhYYmNMTUZCbmRoXzE3NTQ0NjA3MDU6MTc1NDQ2NDMwNV9WNA) ## 世界模型 DeepMind揭惊人答案:智能体就是世界模型!跟Ilya 2年前预言竟不谋而合 https://mp.weixin.qq.com/s/8y8DmrxxBLSbxCpf9reNoA ## AI+Math 陶哲轩再爆:一个月三破18年未解难题!AlphaEvolve彻底改写数学研究规则

DrSR:基于数据与经验双重推理的科学方程发现框架

中科院自动化所提出 DrSR,通过数据洞察与经验归纳双重推理,让多个大模型智能体协作完成科学方程发现。

 智能体 推理 人工智能框架 自进化 数据工程

DrSR(Dual Reasoning Symbolic Regression)是一个面向科学方程发现的大模型智能体框架,通过数据分析和经验归纳共同驱动符号回归。框架设置数据科学家、理论科学家和实验科学家三类角色,分别负责洞察变量关系、总结成败经验以及提出并优化假设。其关键机制包括数据感知的洞察提取(Data-aware Insight Extraction)和经验驱动的归纳式想法学习(Inductive Idea Learning)。LLM 在每轮探索中持续查看数据、吸收历史经验并调整后续策略,从而模拟科学家的迭代研究过程。

用途与启示
  • 为利用多智能体开展自动化科学发现和符号回归提供参考框架
  • 展示如何结合原始数据与历史试验经验,提升大模型的假设生成和迭代优化能力
  • 可用于探索可解释公式、辅助科学建模及构建闭环式研究智能体
📝 原始笔记(逐字保留)
4. 2025-06-23 11:58:41 Monday| https://mp.weixin.qq.com/s/HWT986zchK9AWH-OJKwugQ 近日,中国科学院自动化研究所的研究人员提出了一种创新性框架 ——DrSR (Dual Reasoning Symbolic Regression):通过数据分析与经验归纳 “双轮驱动”,赋予大模型像科学家一样 “分析数据、反思成败、优化模型” 的能力。 在 DrSR 中,三位 “虚拟科学家” 协同工作: 一个善于洞察变量关系的 “数据科学家”;一个擅长总结失败教训与成功经验的 “理论科学家”;一个勇于尝试假设、不断优化模型的 “实验科学家”。 论文地址:https://arxiv.org/abs/2506.04282 论文标题:DrSR: LLM based Scientific Equation Discovery with Dual Reasoning from Data and Experience DrSR 的两大关键机制包括: * 数据驱动的洞察生成(Data-aware Insight Extraction) * 经验驱动的策略总结(Inductive Idea Learning) DrSR 的流程并不复杂,关键在于:让 LLM 在每一轮尝试中都 “看数据、学经验、再出手” ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=ZTAyNzg2NmE3NWU5NTNiY2E1ZjNkZTkyZDI5ZmZiMDlfQzd4QVE4R2FKUlRlbkdSNXpYM3hWenZpRDk1VW9wclFfVG9rZW46VGp4cmJNS2Rkb2hrS2h4VXhHMWNHN2JxbkxnXzE3NTQ0NjA3MDU6MTc1NDQ2NDMwNV9WNA)

NFT:利用隐式负向策略提升数学推理能力

清华大学、英伟达与斯坦福提出负向感知微调 NFT,通过隐式负向策略利用错误答案训练模型,使监督微调取得接近强化学习的数学推理性能。

 模型训练 强化学习 推理 数据工程

清华大学、英伟达与斯坦福联合提出 Negative-aware FineTuning(NFT),在拒绝微调 RFT 的基础上进一步利用负向样本。该方法根据模型已产生的错误结果构造“隐式负向策略”,并以此指导正向模型训练,而非直接把低质量数据作为学习目标。NFT 让监督学习具备从错误中反思和改进的能力,在数学任务上实现显著提升。实验表明,该方案可缩小监督学习与强化学习之间的性能差距。

用途与启示
  • 在无需完整强化学习流程的情况下,利用错误答案增强数学推理训练。
  • 为负向数据的安全利用提供新的监督微调范式。
  • 可作为 RFT 的扩展方案,降低获得强化学习级性能的训练复杂度与成本。
📝 原始笔记(逐字保留)
3. 2025-06-23 12:41:02 Monday | NFT 监督学习也能从错误中学习反思?!清华英伟达联合提出隐式负向策略爆炸提升数学能力 https://mp.weixin.qq.com/s/E9qGWKCCg-xx0XVl5g7ubA 清华大学与英伟达、斯坦福联合提出新的监督学习方案—— **NFT(Negative-aware FineTuning)** ,在RFT(Rejection FineTuning)算法基础上通过构造一个“隐式负向模型” 来额外利用负向数据进行训练。 这并不意味着使用“差数据”进行训练,而是在已知的模型计算结果前提下,通过负向数据训练正向模型,即 **“隐式负向策略(Implicit Negative Policy)”** 。 这一策略弥合了监督学习和强化学习的差距,使得两者性能基本持平。 项目网页: https://research.nvidia.com/labs/dir/Negative-aware-Fine-Tuning/ 论文链接: https://arxiv.org/pdf/2505.18116 项目代码: https://github.com/NVlabs/NFT

Amazon Q Developer

Amazon Q Developer 是面向软件开发场景的生成式 AI 助手,可辅助编码及相关工程任务。

 SWE 软件工程 人工智能辅助编程 智能体工具

Amazon Q Developer 是亚马逊推出的生成式 AI 开发助手,服务于软件研发流程。其定位涵盖代码生成、理解与开发任务辅助,旨在提高工程效率。原文发布于微信公众号,具体功能与使用方式可参阅链接。

用途与启示
  • 用于辅助代码编写、理解和软件开发任务
  • 可作为评估 AI 编程工具工程效能的参考
  • 为研发团队引入生成式 AI 助手提供产品选型线索
📝 原始笔记(逐字保留)
2025-06-23 11:46:23 Monday | Amazon Q Developer https://mp.weixin.qq.com/s/8JfR11MUxZneJBDnLDCX_g

剖析 SWE-Bench 排行榜:基于 LLM 和智能体的软件修复系统提交者与架构分析

该论文分析 SWE-Bench 排行榜中的提交者及系统架构,以梳理基于大语言模型和智能体的自动软件修复方案。

 SWE 软件工程 人工智能辅助编程 智能体 模型评估

论文以 SWE-Bench 排行榜为研究对象,考察基于大语言模型与智能体的软件修复系统。研究重点包括排行榜提交者的构成,以及不同参赛方案采用的系统架构。通过对现有提交进行结构化分析,论文为理解自动软件修复技术的实现路线和评估生态提供参考。

用途与启示
  • 了解 SWE-Bench 排行榜背后的主要提交者与技术方案
  • 对比 LLM 与智能体软件修复系统的架构设计
  • 为自动软件修复工具选型和基准评估提供参考
📝 原始笔记(逐字保留)
2. 2025-06-23 11:33:42 Monday | arXiv:2506.17208(交叉列表自 cs.SE)[pdf,html,其他] **剖析 SWE-Bench 排行榜:基于 LLM 和智能体修复系统的提交者与架构分析** 马蒂亚斯·马丁内斯,泽维尔·弗兰奇 学科分类: 软件工程(cs.SE); 人工智能(cs.AI); 计算与语言(cs.CL)

CaughtCheating:多模态大模型能否成为优秀的作弊侦探?

论文提出 CaughtCheating 挑战,用照片中的细微可疑线索检验多模态大模型联合视觉感知、情境分析与逻辑推理的能力。

 逻辑推理 多模态 推理 模型评估 数据工程

GPT-o3 等多模态大模型在既有基准上已接近性能上限,但在需要从照片中发现微小异常并构建情境解释的任务上仍存在明显短板。研究者据社交媒体中的真实请求设计了 CaughtCheating,要求模型识别伴侣照片里的可疑线索并进行连贯推理。实验显示,GPT-o3 在这类常见场景中的表现可能下降至接近零,暴露出视觉感知与逻辑推理协同不足的问题。该任务可作为评估 MLLM 人类级侦探能力的新型高难度测试。

用途与启示
  • 为多模态模型提供比传统视觉问答更具挑战性的细粒度推理评估。
  • 用于分析模型在微小线索识别、线索关联和情境解释方面的失败模式。
  • 推动视觉感知与逻辑推理能力的联合训练和真实场景应用研究。
📝 原始笔记(逐字保留)
20250702|**[CaughtCheating:您的 MLLM 是一个好的作弊侦探吗?探索视觉感知和推理的边界](https://papers.cool/arxiv/2507.00045)** **Authors** : [Ming Li](https://arxiv.org/search/?searchtype=author&query=Ming%20Li), [Chenguang Wang](https://arxiv.org/search/?searchtype=author&query=Chenguang%20Wang), [Yijun Liang](https://arxiv.org/search/?searchtype=author&query=Yijun%20Liang), [Xiyao Wang](https://arxiv.org/search/?searchtype=author&query=Xiyao%20Wang), [Yuhang Zhou](https://arxiv.org/search/?searchtype=author&query=Yuhang%20Zhou), [Xiyang Wu](https://arxiv.org/search/?searchtype=author&query=Xiyang%20Wu), [Yuqing Zhang](https://arxiv.org/search/?searchtype=author&query=Yuqing%20Zhang), [Ruiyi Zhang](https://arxiv.org/search/?searchtype=author&query=Ruiyi%20Zhang), [Tianyi Zhou](https://arxiv.org/search/?searchtype=author&query=Tianyi%20Zhou) 最近的代理多模态大型语言模型 (MLLM),例如 GPT-o3,在各种现有基准上取得了接近上限的分数,激发了对更具挑战性的测试任务的需求。据报道,这些 MLLM 在人类的一些专家级任务中表现出色,例如 GeoGuesser,这反映了他们作为侦探的潜力,可以注意到图像中的微小线索并将它们编织成连贯的情境解释,从而得出可靠的答案。但他们能与优秀的人类侦探的表现相媲美吗?为了回答这个问题,我们调查了一些 GPT-o3 仍然可以处理的困难场景,并找到了一个 o3 的性能下降到几乎为零的常见场景,我们将其命名为 CaughtCheating。它的灵感来自社交媒体请求,这些请求要求其他人从发帖人的伴侣分享的照片中发现可疑线索。我们进行了广泛的实验和分析,以了解为什么现有的 MLLM 缺乏足够的能力来解决此类任务。CaughtCheating 提供了一类具有挑战性的视觉感知和推理任务,具有很高的价值和实际用途。这些任务的成功为 MLLM 获得人类水平的侦探感知和推理能力铺平了道路。 **科目** : **[计算机视觉和模式识别](https://papers.cool/arxiv/cs.CV)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-06-23 22:05:21 UTC

SLR:可扩展逻辑推理的自动化综合框架

SLR 可自动合成难度可控的归纳推理任务、真实规则与符号验证器,用于系统评估和低成本提升大语言模型的逻辑推理能力。

 逻辑推理 推理 人工智能框架 模型评估 数据合成 模型训练

SLR 是一个面向大语言模型逻辑推理评估与训练的端到端自动化框架,可按照用户需求生成难度精确可控的归纳推理任务。它为每项任务同步合成潜在真实规则、可执行的符号验证器和指令提示,从而免除人工标注并实现确定性检验。基于该框架构建的 SLR-Bench 包含 20 个课程级别和超过 1.9 万条提示,逐步增加关系、算术及递归复杂度。实验发现,当前模型即使能生成语法正确的规则,仍经常出现逻辑错误;使用 SLR 微调后,Llama-3-8B 的基准准确率翻倍,并以较低计算成本达到 Gemini-Flash-Thinking 的同等水平。

用途与启示
  • 自动构建难度可控且具有新颖性的逻辑推理训练与评测数据。
  • 通过符号验证器对模型输出进行确定性检查,减少人工评审成本。
  • 用渐进式课程评估模型在关系、算术和递归推理上的能力边界。
  • 为小型模型的低成本逻辑微调提供可扩展方案。
📝 原始笔记(逐字保留)
3. 🌈🌈🌈🌈 🌈2025-06-23 11:34:22 Monday | https://arxiv.org/abs/2506.15787 arXiv:2506.15787(交叉列表自 cs.AI)[pdf, html, 其他] **SLR:一种可扩展逻辑推理的自动化综合框架** 卢卡斯·赫尔夫、艾哈迈德·奥马尔、费利克斯·弗里德里希、沃尔夫冈·斯塔默、安东尼娅·维斯特、蒂姆·沃伊特、鲁珀特·米切尔、帕特里克·施拉莫夫斯基、克里斯蒂安·克斯廷 学科分类:人工智能(cs.AI);计算与语言(cs.CL);机器学习(cs.LG 摘要:我们提出 SLR 这一端到端框架,通过可扩展逻辑推理对大型语言模型(LLMs)进行系统性评估与训练。该框架能根据用户任务需求,自动生成难度精确可控的归纳推理任务。针对每个任务,SLR 可合成:(i)潜在的真实规则;(ii)符号验证器用于确定性检验模型输出的可执行验证程序;(iii)推理任务的指令提示。基于 SLR 构建的 SLR-Bench 基准测试包含 20 个课程级别、超 1.9 万条提示,其关系复杂度、算术复杂度和递归复杂度呈渐进式提升。大规模评估表明,当前 LLMs 虽能生成语法有效的规则,却常出现逻辑推理错误。最新推理型 LLMs 表现略优,但测试时计算量激增,有时超过 1.5 万补全标记。最终,通过 SLR 进行逻辑微调使 Llama-3-8B 在 SLR-Bench 上的准确率翻倍,仅需极低计算成本即可达到 Gemini-Flash-Thinking 同等水平。 SLR 实现了全自动化流程,无需人工标注,确保数据集新颖性,并为探索和提升 LLMs 的推理能力提供了可扩展环境。 ![](https://gitee.com/dujh22/pic/raw/master/logicReason/SLR.png) ## 逻辑编程语言 ### **Prolog** link:https://blog.csdn.net/qq_33017507/article/details/109502720 prolog 是 Programming in LOGic 的缩写,意思就是使用逻辑的语言编写程序。 prolog 不是很高深的语言,相反,比较起其他的一些程序语言,例如 c 、 basic 等等语言, prolog 是更加容易理解的语言。 ## 高阶逻辑推理
0%