2025-06-30 科研追新

当日精选(由提交工具自动创建)。

微调方法对大型语言模型中记忆的影响

研究通过成员推理攻击评估不同微调方法引发的模型记忆与隐私风险,发现基于提示的微调在保持竞争力性能的同时比参数微调更不易泄露训练数据。

 智能体记忆 模型训练 模型评估 人工智能

该研究对主流大语言模型微调方法进行分类,并从成员推理攻击(MIA)的角度衡量其记忆效应。实验显示,基于参数的微调更容易记住训练样本,因此面临更高的私人信息泄露风险。相比之下,基于提示的微调能够取得有竞争力的任务性能,同时保持较低的 MIA 脆弱性。该低记忆特征在不同模型规模下均较为稳定。

用途与启示
  • 为选择兼顾任务性能和隐私保护的微调方案提供依据。
  • 提醒开发者将成员推理攻击风险纳入微调模型的安全评估。
  • 在涉及敏感数据的场景中,可优先考虑基于提示的微调方法。
📝 原始笔记(逐字保留)
1. 2025-07-02 17:16:24 Wednesday | **[微调方法对大型语言模型中记忆的影响](https://papers.cool/arxiv/2507.00258)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Jie Hou](https://arxiv.org/search/?searchtype=author&query=Jie%20Hou), [Chuxiong Wu](https://arxiv.org/search/?searchtype=author&query=Chuxiong%20Wu), [Lannan Luo](https://arxiv.org/search/?searchtype=author&query=Lannan%20Luo), [Qiang Zeng](https://arxiv.org/search/?searchtype=author&query=Qiang%20Zeng) 随着预训练大型语言模型 (LLM) 的功能不断进步,“预训练和微调”范式越来越成为主流,导致了各种微调方法的发展。然而,在微调过程中记忆所带来的隐私风险受到的关注相对较少。为了解决这一差距,我们对流行的微调方法进行了分类,并通过成员推理攻击 (MIA) 的视角评估了它们对记忆的影响。我们的结果表明,与基于参数的微调相比,基于提示的微调实现了有竞争力的性能,同时表现出较低的 MIA 脆弱性。此外,无论模型规模如何,基于提示的方法都保持低记忆。这些发现表明,基于参数的微调更容易泄露私人信息,而基于提示的微调是一种更能保护隐私的选项。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) **发布** : 2025-06-30 20:52:15 UTC

MemBench:全面评估基于 LLM 的智能体记忆能力

MemBench 通过区分事实记忆与反思记忆、覆盖参与和观察场景,从有效性、效率及容量等维度全面评估 LLM 智能体的记忆能力。

 智能体记忆 模型评估 智能体 数据工程

现有 LLM 智能体记忆评估通常受限于单一的记忆层次、较少的交互场景以及不够全面的评价指标。MemBench 将事实记忆和反思记忆划分为不同层次,并设置参与式与观察式两类交互场景。该基准从有效性、效率和容量等多个方面衡量智能体的记忆能力。作者已公开相关数据集与项目代码,便于研究社区复现和比较不同记忆机制。

用途与启示
  • 为 LLM 智能体记忆模块提供更系统、统一的评估基准
  • 帮助研究者区分事实存储与反思总结等不同层次的记忆能力
  • 支持从效果、开销和容量角度比较记忆架构与检索策略
  • 为面向动态环境的长期智能体设计和优化提供参考

通过电路发现理解 LLM 中的逐字记忆

研究通过机制可解释性中的变压器电路分析,定位了大语言模型启动和维持逐字记忆的不同计算机制。

 智能体记忆 人工智能 模型评估

论文从机制可解释性视角研究大语言模型对训练数据的逐字记忆,试图确定哪些网络组件负责触发记忆序列。作者构建对比数据集,识别模型生成记忆内容与非记忆内容时出现分化的位置,并隔离出承担不同记忆功能的特定变压器电路。实验发现,负责启动记忆的电路在触发后也能维持记忆,但仅负责维持记忆的电路无法独立启动检索。记忆预防机制可以稳健迁移到不同文本领域,而记忆诱导机制对上下文的依赖更强。

用途与启示
  • 帮助定位 LLM 逐字复现训练数据的内部计算路径,为记忆审计提供机制层证据。
  • 可用于设计针对性的模型干预方法,以抑制隐私数据、版权内容等敏感信息的逐字泄漏。
  • 区分记忆的启动与维持机制,为更细粒度地评估和控制模型记忆提供思路。
📝 原始笔记(逐字保留)
3. 2025-06-30 19:55:59 Monday | **[通过电路发现了解 LLM 中的逐字记忆](https://papers.cool/arxiv/2506.21588)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Ilya Lasy](https://arxiv.org/search/?searchtype=author&query=Ilya%20Lasy), [Peter Knees](https://arxiv.org/search/?searchtype=author&query=Peter%20Knees), [Stefan Woltran](https://arxiv.org/search/?searchtype=author&query=Stefan%20Woltran) LLM 中记忆的潜在机制 -- 训练数据的逐字复制 -- 仍然知之甚少。网络的确切部分决定检索我们认为作为记忆序列开始的令牌?模型在产生记忆句子和非记忆句子时的行为究竟有何不同?在这项工作中,我们利用变压器电路从机制可解释性的角度来解决这些问题——变压器电路是在模型中执行特定功能的最小计算子图。通过精心构建的对比数据集,我们确定了模型生成与记忆内容不同的点,并隔离了负责记忆的两个不同方面的特定电路。我们发现,启动记忆的电路在启动后也可以保持它,而只保持记忆的电路不能触发它的启动。有趣的是,记忆预防机制在不同的文本域之间稳健地转移,而记忆归纳似乎更依赖于上下文。

了解大型推理模型的认知习惯:CogTest 基准评估

研究提出 CogTest 基准,系统评估大型推理模型在思维链中呈现的类人认知习惯及其与模型安全行为的关联。

 元学习 推理 模型评估 逻辑推理 人工智能

大型推理模型会在生成最终答案前产生思维链,其中反复出现的行为模式可能反映稳定的认知习惯。研究者基于人类问题解决领域的 Habits of Mind 框架提出 CogTest,覆盖 16 种认知习惯,每种习惯包含 25 个不同任务,并采用循证优先方法识别习惯。对 13 个推理模型和 3 个非推理模型的评估显示,推理模型不仅具有更明显的类人习惯,还会根据任务自适应调用这些习惯。进一步分析发现,不同模型家族之间存在认知习惯画像的异同,部分习惯(如承担负责任的风险)还与有害回答的生成密切相关。

用途与启示
  • 为大型推理模型的思维链提供超越正确率的行为分析维度。
  • 可用于比较不同模型及模型家族的认知习惯画像与推理风格。
  • 帮助识别与有害输出相关的持续性思维链模式,支持模型安全监控与评估。
  • 为研究模型不当行为、可解释性及推理过程干预提供基准和工具。
📝 原始笔记(逐字保留)
2025-06-30 19:58:27 Monday | **[了解大型推理模型的认知习惯](https://papers.cool/arxiv/2506.21571)** **[PDF()]** **[Copy]** **[Kimi(2)]** **[REL]** **Authors** : [Jianshuo Dong](https://arxiv.org/search/?searchtype=author&query=Jianshuo%20Dong), [Yujia Fu](https://arxiv.org/search/?searchtype=author&query=Yujia%20Fu), [Chuanrui Hu](https://arxiv.org/search/?searchtype=author&query=Chuanrui%20Hu), [Chao Zhang](https://arxiv.org/search/?searchtype=author&query=Chao%20Zhang), [Han Qiu](https://arxiv.org/search/?searchtype=author&query=Han%20Qiu) 大型推理模型 (LRM) 在产生最终响应之前自主产生推理思维链 (CoT),为解释和监控模型行为提供了一种很有前途的方法。受到对某些 CoT 模式(例如,“等等,我错过了什么吗?”)在任务中不断出现的观察的启发,我们探讨了 LRM 是否表现出类似人类的认知习惯。以 Habits of Mind(一个与成功解决人类问题相关的成熟认知习惯框架)为基础,我们引入了 CogTest,这是一个旨在评估 LRM 认知习惯的原则性基准。CogTest 包括 16 个认知习惯,每个习惯由 25 个不同的任务实例化,并采用循证优先提取方法以确保可靠的习惯识别。通过 CogTest,我们对 16 种广泛使用的 LLM(13 种 LRM 和 3 种非推理 LLM)进行了全面评估。我们的研究结果表明,与传统的 LLM 不同,LRM 不仅表现出类似人类的习惯,而且还会根据不同的任务自适应地部署它们。更细粒度的分析进一步揭示了 LRM 认知习惯概况的相似性和差异性模式,特别是某些科间相似性(例如,Qwen-3 模型和 DeepSeek-R1)。将研究扩展到与安全相关的任务,我们观察到某些习惯,例如承担负责任的风险,与有害反应的产生密切相关。这些发现表明,研究 LRM 的 CoT 中的持续行为模式是更深入地理解 LLM 不当行为的宝贵一步。代码可在以下网址获得:https://github.com/jianshuod/CogTest。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI), [密码学和安全性](https://papers.cool/arxiv/cs.CR)

SAGE-nano:通过逆向推理实现大模型元认知自我解释

SAGE-nano 通过逆转注意力流,在完成推理后分解并解释关键决策,使大模型的思维链更加透明且可评估。

 元学习 推理 逻辑推理 模型开发 模型评估

论文提出逆向推理范式,使大语言模型能够在事后分析自己的思维链,解释为何选择特定推理路径。作者将其应用于 40 亿参数模型 SAGE-nano,通过元认知结构和注意力反射识别关键决策点。在 AQUA-RAT、CommonsenseQA 以及涵盖逻辑谜题、数学问题和道德困境的定制基准上,模型取得了 74.6% 的 AQUA-RAT 准确率和 92.1% 的人类解释偏好分数。研究还构建了推理透明度评估框架,并表明增加逆向反思过程能够同时改善可解释性与推理表现。

用途与启示
  • 为思维链提供事后归因机制,帮助理解模型为何采用某条推理路径。
  • 可用于 AI 安全审计、教育反馈和科学发现等需要透明决策的场景。
  • 展示了小参数模型借助元认知与注意力反射接近更大模型表现的可能性。
  • 为评估推理解释质量和开发可自省模型提供框架参考。
📝 原始笔记(逐字保留)
2025-07-02 17:19:17 Wednesday| **Authors** : [Basab Jha](https://arxiv.org/search/?searchtype=author&query=Basab%20Jha), [Firoj Paudel](https://arxiv.org/search/?searchtype=author&query=Firoj%20Paudel), [Ujjwal Puri](https://arxiv.org/search/?searchtype=author&query=Ujjwal%20Puri), [Zhang Yuting](https://arxiv.org/search/?searchtype=author&query=Zhang%20Yuting), [Choi Donghyuk](https://arxiv.org/search/?searchtype=author&query=Choi%20Donghyuk), [Wang Junhao](https://arxiv.org/search/?searchtype=author&query=Wang%20Junhao) 大型语言模型 (LLM) 在使用 Chain-of-Thought (CoT) 提示解决复杂推理任务方面表现出了卓越的能力,但它们的决策过程仍然有些黑匣子。我们介绍了 textbfinverse 推理,这是一种新颖的范式,使 LLM 能够在事后分解和解释自己的推理链。我们的方法用于 SAGE-nano,一个 40 亿个参数的推理模型,它采用元认知结构,通过注意力过程进行反射,以识别主要决策点并生成对推理选择的解释。虽然典型的 CoT 方法针对前向推理生成,但逆向推理提供了关于为什么选择特定推理链而不是其他推理链的见解。通过对 AQUA-RAT、CommonsenseQA 和定制基准测试的逻辑推理谜题、数学问题和道德困境的全面测试,我们证明 SAGE-nano 在推理准确性(AQUA-RAT 上为 74.6%)和解释质量(92.1% 的人类偏好分数)方面都处于领先地位,并提供的性能几乎与 Claude-3.5 Sonnet 或 GPT-4o 等模型相当。我们的贡献是:(i) 第一个通过逆向推理进行 LLM 自我反思的严格框架,(ii) 一个新颖的元学习框架来逆转注意力流,(iii) 推理透明度的综合评估框架,以及 (iv) 证据表明使用逆向推理增加推理可以提高可解释性和推理性能。我们的工作为透明的 AI 系统开辟了新的途径,并缩小了 AI 安全、教育和科学发现方面的重大差距。 **科目** : **[人工智能](https://papers.cool/arxiv/cs.AI)** , [计算和语言](https://papers.cool/arxiv/cs.CL), [机器学习](https://papers.cool/arxiv/cs.LG) **发布** : 2025-06-30 09:53:41 UTC #### 从“顿悟时刻”到可控思维:通过解耦推理与控制迈向大型推理模型中的元认知推理 [#7](https://arxiv.org/abs/2508.04460)[From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control](https://papers.cool/arxiv/2508.04460) 大型推理模型(LRMs)通过自发展现诸如逐步推理、反思和回溯等认知行为,展示了复杂推理的潜在能力,这些行为通常被称为“顿悟时刻”。然而,这种涌现行为仍然缺乏监管和控制,常常导致过度思考,即模型在达到可靠结论后仍继续生成冗余的推理内容。这导致计算成本过高和延迟增加,限制了 LRMs 的实际应用。

MokA:面向多模态大模型的低秩适配微调新范式

MokA 通过模态特异投影、跨模态注意力和模态共享投影重新设计 LoRA,以高效激发多模态大模型中的模态协作。

 多模态 模型训练 人工智能

MokA 延续 LoRA 的低秩适配思想,旨在保持多模态大模型微调的参数效率。针对多模态场景,它重新定义了 A、B 投影矩阵的角色,而非直接沿用单模态 LoRA 的统一设计。其结构包含模态特异的 A 矩阵、跨模态注意力机制以及模态共享的 B 矩阵三个关键模块。该设计兼顾不同模态的独特表示与跨模态信息交互,从而提升模态协作能力。

用途与启示
  • 为多模态大模型提供参数高效的微调方案,降低训练与适配成本。
  • 通过模态特异与模态共享参数的组合,兼顾模态差异和跨模态知识迁移。
  • 启示后续 LoRA 类方法应根据多模态交互特点重新设计低秩投影结构。
📝 原始笔记(逐字保留)
5. 2025-06-30 16:13:39 Monday | 充分激发模态协作,MokA量身打造MLLM微调新范式 * 论文标题:MokA: Multimodal Low-Rank Adaptation for MLLMs * 论文链接:https://arxiv.org/abs/2506.05191 * 项目主页:https://gewu-lab.github.io/MokA MokA 在结构上继承了 LoRA 的核心思想,以保持高效的优点。但基于多模态场景对于 A、B 投影矩阵的角色进行了重新定义。如上图所示,MokA 包括三个关键模块:模态特异的 A 矩阵,跨模态注意力机制和模态共享的 B 矩阵。

ICML 2025 Spotlight:流匹配模型的能量引导生成理论框架

研究首次建立流匹配模型的能量引导理论框架,并提出三类无需额外训练的引导算法,统一涵盖经典扩散模型的能量引导方法。

 多模态 模型开发 人工智能 模型训练

能量引导通过引入能量函数控制生成过程,无需额外训练条件生成模型,可用于图像、分子等生成任务。论文首次为流匹配模型建立系统的能量引导理论框架。在该框架下,作者提出三类免训练的实用引导算法,并将经典扩散模型的能量引导算法纳入其中作为特例。研究还从理论和实验两方面比较了不同算法的性能,为实际应用中的方法选择提供依据。

用途与启示
  • 为流匹配模型提供统一、可解释的可控生成框架
  • 降低条件控制所需的额外训练成本
  • 支持图像生成、分子生成等多模态与科学智能任务
  • 为不同能量引导算法的选型和性能权衡提供理论依据
📝 原始笔记(逐字保留)
3. 2025-06-30 15:49:57 Monday | ICML 2025 Spotlight | 新理论框架解锁流匹配模型的引导生成 https://mp.weixin.qq.com/s/c4rDuHgOfLF3n3TxWXv2mw 对生成模型的 **能量引导** (energy guidance)是一种可控的生成方法,它构造灵活,适用于各种任务,且允许无额外训练条件生成模型。同时 **流匹配** (flow matching)框架作为一种生成模型,近期在分子生成、图片生成等领域中已经展现出巨大潜力。 * 本工作首次提出了流匹配能量引导理论框架。 * 在本框架指导下,本工作提出三大类无需训练的实用流匹配能量引导算法,并可将经典扩散模型能量引导算法包含为特例。 * 本工作给出了各个流匹配能量引导算法性能的理论分析和实验比较,为实际应用提供指导。 * 论文标题:On the Guidance of Flow Matching * 论文链接:https://arxiv.org/abs/2502.02150 * 项目地址:https://github.com/AI4Science-WestlakeU/flow_guidance

DraftAttention:无需训练的视频扩散模型动态稀疏注意力加速方法

Adobe Research 等机构提出 DraftAttention,利用低分辨率注意力引导动态稀疏计算,无需额外训练即可将视频扩散模型的 GPU 端到端推理速度提升至约 2 倍。

 多模态 推理 系统优化 模型开发

DraftAttention 是一种面向视频扩散模型的动态稀疏注意力加速方法,由 Adobe Research 等机构的研究团队提出。该方法通过低分辨率注意力提供引导,减少高分辨率视频生成过程中的注意力计算开销。与需要重新训练或微调的方法不同,DraftAttention 可即插即用地集成到现有模型中。在生成质量几乎不受损的情况下,其 GPU 端到端推理速度最高可提升约 2 倍。

用途与启示
  • 降低视频扩散模型中注意力模块的计算与推理成本
  • 为现有视频生成模型提供无需训练、易于集成的加速方案
  • 说明低分辨率注意力模式可用于预测并裁剪高分辨率计算
  • 为动态稀疏注意力在多模态生成系统中的部署提供参考
📝 原始笔记(逐字保留)
2. 2025-06-30 16:02:37 Monday | 无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention https://mp.weixin.qq.com/s/VbWe5u5WdQfKLYOohzCZaA 现有视频生成加速方法,如 Sparse VideoGen(https://arxiv.org/abs/2502.01776)和 AdaSpa(https://arxiv.org/abs/2502.21079),多采用稀疏注意力机制,在 GPU 上实现了一定程度的端到端加速 Adobe Research 等机构的研究团队提出了一种 **无需训练、即插即用的,基于动态稀疏注意力的视频扩散模型加速方法 ——DraftAttention** ,显著降低了注意力机制的计算开销,并且在几乎不损失生成质量的前提下,实现高达 2 倍的 GPU 端到端推理加速。 论文标题: DraftAttention: Fast Video Diffusion via Low-Resolution Attention Guidance arXiv 地址: https://arxiv.org/abs/2505.14708 GitHub 主页: https://github.com/shawnricecake/draft-attention

HoPE 混合位置编码提升视觉语言模型的长度泛化能力

HoPE 通过混合位置编码缓解 RoPE 全频率对长上下文建模的负面影响,显著提升视觉语言模型在长视频理解与检索任务中的长度泛化能力。

 多模态 模型开发 人工智能 系统优化

现有多模态模型使用的 RoPE 在超出训练长度后泛化能力有限,保留全部频率可能对长上下文语义建模产生负面影响。研究团队据此提出 HoPE(Hybrid of Position Embedding),以混合位置编码改善视觉语言模型对长序列的表征。该方法显著增强了模型的长度泛化能力,并在长视频理解、长视频检索等任务上取得领先表现。

用途与启示
  • 为视觉语言模型处理超长视频和长上下文提供更有效的位置编码方案
  • 表明并非所有 RoPE 频率都适合长序列建模,可据此优化频率设计
  • 可用于提升长视频问答、内容检索与多模态长上下文应用的泛化能力
📝 原始笔记(逐字保留)
2025-06-30 16:18:28 Monday | 打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力 https://mp.weixin.qq.com/s/KQHGw8_v0rEY8pS7jufRbQ 现有多模态 RoPE 泛化能力不足的原因之一是保留 RoPE 中所有频率对长上下文语义建模有负面影响。基于此分析,他们提出的混合位置编码(HoPE, Hybrid of Position Embedding)大幅提升了 VLM 的长度泛化能力,在长视频理解和检索等任务中达到最优表现。 * 论文标题:HoPE: Hybrid of Position Embedding for Length Generalization in Vision-Language Models * arXiv 链接:https://arxiv.org/pdf/2505.20444 * 代码链接:https://github.com/hrlics/HoPE ## 语音

Cluely 推出面向面试、考试与销售电话的实时 AI 辅助工具

初创公司 Cluely 推出同名 AI 工具,可在面试、考试和销售电话等场景中为用户提供实时辅助。

 智能体工具 人工智能应用 人工智能

初创公司 Cluely 推出了同名实时 AI 辅助工具。该工具面向面试、考试和销售电话等场景,能够在交互过程中为用户提供即时信息与建议。其产品形态体现了 AI 助手从通用问答向实时、场景化辅助的演进趋势。与此同时,在考试和面试中的使用也可能引发公平性、隐私与合规方面的争议。

用途与启示
  • 为高压力沟通和知识问答场景提供实时提示与决策支持
  • 展示实时上下文理解型 AI 助手的产品化方向
  • 提醒开发者关注隐私保护、使用透明度及考试与招聘合规问题
📝 原始笔记(逐字保留)
2025-06-30 16:07:47 Monday | 初创公司 Cluely,推出了名为「Cluely」的 AI 工具,旨在为用户提供面试、考试、销售电话等场景的实时辅助https://mp.weixin.qq.com/s/58taCee98HkAxUHTgIWkUA

航空发动机大模型解决复杂时序问题,性能超越 GPT-4o

研究团队将大模型用于航空发动机复杂时序任务,并宣称其性能超越 GPT-4o、达到 SOTA 水平。

 人工智能应用 模型开发 数据工程

该工作探索大模型在航空发动机复杂时序问题中的应用。相关任务涉及工业设备运行数据的理解、分析与预测,对模型处理长时序和复杂状态变化的能力提出较高要求。文章称该方案的性能超过 GPT-4o,并实现当前最佳水平。该成果体现了垂直领域大模型在高端制造与工业智能场景中的应用潜力。

用途与启示
  • 为航空发动机运行状态分析和复杂时序建模提供新思路
  • 展示领域模型相较通用大模型在专业工业任务上的潜在优势
  • 为大模型在故障诊断、状态预测和智能运维等场景中的落地提供参考
📝 原始笔记(逐字保留)
4. 2025-06-30 17:59:43 Monday | 航空发动机用上大模型:解决复杂时序问题,性能超越ChatGPT-4o实现SOTA|上交创智复旦 https://mp.weixin.qq.com/s/DzOOT8ojdd2zTeS3IpYcug

强化学习也能预训练?潜在意图与流匹配带来最高20倍提升

研究者提出将意图编码为潜在变量的强化学习预训练方法,并以基于SARSA的时序差分流匹配损失预测未来状态访问概率,实现最高20倍效果提升。

 强化学习 模型训练 人工智能

该研究探索了一种强化学习预训练新范式,将智能体的「意图」编码为潜在变量。模型借助流匹配预测未来状态的访问概率,从而学习可迁移的行为表示。针对普通流匹配难以拼接多个状态转换的问题,研究者引入基于 SARSA 的时序差分流匹配损失。相关方法据称可带来最高20倍的效果提升,项目博客为 https://chongyi-zheng.github.io/infom/

用途与启示
  • 为强化学习提供一种基于未来状态分布建模的预训练思路
  • 利用时序差分学习解决流匹配难以组合多步状态转换的问题
  • 有望提升预训练策略在下游任务中的迁移效率与性能
📝 原始笔记(逐字保留)
4. 2025-06-30 19:00:34 Monday | 强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式! https://mp.weixin.qq.com/s/WyJuhjkmreZ2clSw1XvHiw 研究人员构建的模型将「意图」编码为潜在变量,并通过「流匹配」(flow matching)来预测未来状态的访问概率。 论文地址:https://arxiv.org/abs/2506.08902 博客地址:https://chongyi-zheng.github.io/infom/ 由于普通流匹配方法无法拼接多个状态转换,研究者引入基于SARSA的时序差分流匹配损失进行改进。

从思考到输出:推理语言模型中的思维链与文本生成特征

研究通过关键词统计与大模型裁判框架,对比 GPT-o1、DeepSeek-R1、Kimi-k1.5 和 Grok-3 的思维链、自我反思及最终输出特征。

 推理 逻辑推理 模型评估 人工智能

论文提出一个结合关键词统计与 LLM-as-a-Judge 的分析框架,将大型推理模型的内部思考过程与最终答案联系起来。研究覆盖逻辑推论、因果推理和多步骤问题解决等真实场景,对 GPT-o1、DeepSeek-R1、Kimi-k1.5 与 Grok-3 进行定量和定性比较。作者重点分析模型的自我反思模式、探索与利用平衡、推理深度、对中间步骤的依赖,以及其思维和输出模式与 GPT-o1 的相似程度。结果揭示了不同模型在计算效率、推理连贯性、答案准确性和鲁棒性之间的差异与权衡。

用途与启示
  • 为不同大型推理模型的思维链和最终输出提供统一的比较方法
  • 帮助识别“顿悟时刻”、中间步骤依赖及探索—利用模式
  • 为推理模型的效率与鲁棒性权衡、模型设计和评估体系提供参考
📝 原始笔记(逐字保留)
2025-06-30 19:09:50 Monday | **[从思考到输出:推理语言模型中的思维链和文本生成特征](https://papers.cool/arxiv/2506.21609)** **[PDF(2)]** **[Copy]** **[Kimi(3)]** **[REL]** **Authors** : [Junhao Liu](https://arxiv.org/search/?searchtype=author&query=Junhao%20Liu), [Zhenhao Xu](https://arxiv.org/search/?searchtype=author&query=Zhenhao%20Xu), [Yuxin Fang](https://arxiv.org/search/?searchtype=author&query=Yuxin%20Fang), [Yichuan Chen](https://arxiv.org/search/?searchtype=author&query=Yichuan%20Chen), [Zuobin Ying](https://arxiv.org/search/?searchtype=author&query=Zuobin%20Ying), [Wenhan Chang](https://arxiv.org/search/?searchtype=author&query=Wenhan%20Chang) 最近,大型语言模型 (LLM) 取得了显着进展,表明它们在复杂推理方面的能力不断增强。然而,现有的研究在很大程度上忽视了 **对这些模型的推理过程和输出的彻底和系统的比较** ,特别是关于它们的自我反思模式(也称为“顿悟时刻”)和不同领域的相互联系。本文提出了一种新的框架,用于使用关键词统计和 LLM 作为判断范式分析四种尖端大型推理模型(GPT-o1、DeepSeek-R1、Kimi-k1.5 和 Grok-3)的推理特征。我们的方法将他们的内部思考过程与最终产出联系起来。多样化的数据集由基于真实场景的问题组成,涵盖逻辑推论、因果推理和多步骤问题解决。此外,还提出了一组指标来评估推理的连贯性和输出的准确性。研究结果揭示了这些模型如何在推理过程中平衡探索和开发、处理问题和得出结论的各种模式。通过定量和定性比较,确定了这些模型在推理深度、对中间步骤的依赖以及它们的思维过程和输出模式与 GPT-o1 的相似程度等方面的差异。这项工作为计算效率和推理鲁棒性之间的权衡提供了有价值的见解,并为在实际应用中加强模型设计和评估提供了实用建议。我们在以下位置公开发布我们的项目: https://github.com/ChangWenhan/FromThinking2Output

教学学习范式:融合白盒与黑盒 LLM 的指令优化框架

该研究融合黑盒模型的高质量指令初始化能力与白盒模型的隐藏状态可解释性,通过统一语义表示和迭代优化提升复杂推理及跨语言任务中的指令质量。

 推理 模型训练 人工智能框架 系统优化

论文提出一种结合白盒与黑盒 LLM 优势的指令优化框架,以缓解白盒方法计算成本高、表示能力有限以及黑盒模型调用费用昂贵的问题。黑盒模型负责生成高质量且多样化的初始指令,白盒模型则利用隐藏状态与输出提供细粒度、可解释的优化信号。框架通过语义相似性约束将两类信息融合为统一的高维表示,并以迭代方式改善指令的质量与任务适应性。实验覆盖复杂推理和跨语言泛化等任务,结果显示该方法持续优于先进基线,源代码尚未发布。

用途与启示
  • 为兼顾生成质量、可解释性与成本的自动指令优化提供新方案。
  • 可用于复杂推理、跨语言泛化等需要高质量指令的任务。
  • 展示了闭源强模型与开源白盒模型协同优化的可扩展路径。
  • 语义相似性约束可为混合模型输出构建统一优化空间提供参考。
📝 原始笔记(逐字保留)
2. 2025-06-30 19:57:38 Monday| **[教学学习范式:白盒和黑盒 LLM 的双重视角](https://papers.cool/arxiv/2506.21573)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Yanwei Ren](https://arxiv.org/search/?searchtype=author&query=Yanwei%20Ren), [Liu Liu](https://arxiv.org/search/?searchtype=author&query=Liu%20Liu), [Baosheng Yu](https://arxiv.org/search/?searchtype=author&query=Baosheng%20Yu), [Jiayan Qiu](https://arxiv.org/search/?searchtype=author&query=Jiayan%20Qiu), [Quan Chen](https://arxiv.org/search/?searchtype=author&query=Quan%20Chen) 优化大型语言模型 (LLM) 的指令对于在复杂多样的任务中充分发挥其潜力至关重要。然而,仅依赖白盒方法需要大量的计算资源,并且提供的表示能力有限,而黑盒模型可能会产生高昂的财务成本。为了应对这些挑战,我们引入了一种新的框架,它无缝地融合了两种范式的优势。黑盒模型提供高质量、多样化的指令初始化,而白盒模型通过隐藏状态和输出功能提供精细的可解释性。通过实施语义相似性约束,这些组件融合成一个统一的高维表示,该表示捕获了深层次的语义和结构细微差别,从而实现了迭代优化过程,以提高指令质量和适应性。对广泛的任务(从复杂推理到跨语言泛化)的广泛评估表明,我们的方法始终优于最先进的基线。黑盒初始化与高级语义优化相结合,产生了可扩展且高效的解决方案,为各种实际场景中的下一代 LLM 驱动型应用程序铺平了道路。源代码即将发布。

表示一致性:聚合准确且连贯的 LLM 候选答案

表示一致性(RC)利用候选答案对应的模型内部激活一致性进行加权聚合,无需额外模型调用即可将强测试时扩展基线的推理准确率提升最高 4%。

 推理 逻辑推理 系统优化 模型评估

论文提出表示一致性(Representation Consistency,RC),用于聚合由不同提示措辞和采样策略产生的多个 LLM 候选答案。与仅统计答案出现次数的方法不同,RC 还衡量生成同一答案时模型内部激活的一致性;若表示差异较大,则将该答案视为可能源于不连贯推理并降低其权重。该方法兼容原始密集激活及由预训练稀疏自动编码器得到的稀疏激活,只需缓存激活并执行轻量级相似度计算,不会增加模型查询。四个开源 LLM、四个推理数据集上的实验显示,RC 可在强测试时扩展基线上持续提升准确率,最高增幅达 4%,且稀疏激活一致性与常见的连贯推理概念高度吻合。

用途与启示
  • 为测试时扩展提供一种与提示和采样策略无关的候选答案聚合机制。
  • 可利用推理阶段已缓存的内部激活提升多数投票或自一致性方法,无需额外调用模型。
  • 表示一致性可作为识别不连贯推理路径和评估答案可靠性的内部信号。
  • 稀疏自动编码器产生的可解释特征有望用于进一步分析和监控模型推理质量。
📝 原始笔记(逐字保留)
4. 2025-06-30 19:54:59 Monday| **[准确、连贯的 LLM 答案聚合的表示一致性](https://papers.cool/arxiv/2506.21590)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Junqi Jiang](https://arxiv.org/search/?searchtype=author&query=Junqi%20Jiang), [Tom Bewley](https://arxiv.org/search/?searchtype=author&query=Tom%20Bewley), [Salim I. Amoukou](https://arxiv.org/search/?searchtype=author&query=Salim%20I.%20Amoukou), [Francesco Leofante](https://arxiv.org/search/?searchtype=author&query=Francesco%20Leofante), [Antonio Rago](https://arxiv.org/search/?searchtype=author&query=Antonio%20Rago), [Saumitra Mishra](https://arxiv.org/search/?searchtype=author&query=Saumitra%20Mishra), [Francesca Toni](https://arxiv.org/search/?searchtype=author&query=Francesca%20Toni) 测试时扩展通过在推理期间分配更多计算预算来提高大型语言模型 (LLM) 的性能。为了实现这一点,现有方法通常需要对提示和采样策略进行复杂的修改。在这项工作中,我们介绍了表示一致性 (RC),这是一种测试时缩放方法,用于聚合从 LLM 的多个候选人回答中得出的答案,无论它们是如何生成的,包括提示措辞和采样策略的变化。RC 不仅考虑了候选响应集中每个答案的出现次数,还考虑了 **模型内部激活的一致性** ,同时生成了导致每个答案的响应集,从而增强了答案聚合。这些激活可以是密集的(原始模型激活)或稀疏的(通过预训练的稀疏自动编码器编码)。我们的基本原理是,如果模型对聚集在同一答案上的多个响应的表示是高度可变的,那么这个答案更可能是不连贯推理的结果,应该在聚合过程中降低权重。重要的是,我们的方法 **只使用缓存的激活和轻量级相似性计算,** 不需要额外的模型查询。通过使用四个开源 LLM 和四个推理数据集进行实验,我们验证了 RC 在提高推理过程中任务性能的有效性,在强大的测试时间扩展基线上,准确性不断提高(高达 4%)。我们还表明,稀疏激活信号的一致性与连贯推理的常见概念非常一致。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [机器学习](https://papers.cool/arxiv/cs.LG) ### 推理的弹性调控 来自特拉维夫大学的研究团队开发出了一种新方法,可以 **监控和控制LLM中的思考路径长度** 。给LLM的推理任务装上进度条,还能控制推理的深度、调整推理速度。加速后的模型和原模型相比, **使用的token数减少了近6倍,且都得出了正确答案** 。[https://mp.weixin.qq.com/s/2uefJV_JiIhHg6wRFyKLRw](https://mp.weixin.qq.com/s/2uefJV_JiIhHg6wRFyKLRw) **无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab**[ https://mp.weixin.qq.com/s/tb8vndzH7LHJMKc3jCmF8A](https://mp.weixin.qq.com/s/tb8vndzH7LHJMKc3jCmF8A)

在推理的开始迷失:首个推理步骤对长链推理的关键影响

研究发现首个推理步骤的错误会显著损害后续推理,并提出基于奖励模型的采样策略,在保持准确率的同时最多降低 70% 推理成本。

 推理 逻辑推理 模型评估 系统优化

论文系统研究了大型语言模型在长思维链推理过程中的自我纠正能力,发现第一个推理步骤对最终答案具有不成比例的影响。该现象在 DeepSeek-R1 和 Qwen3 两个开源推理模型系列中均稳定存在,首步错误往往会持续破坏后续推理质量。作者提出基于奖励模型的采样策略,筛选并保留高质量首步、丢弃次优候选,在不牺牲准确率的前提下最多节省 70% 的推理成本。研究还构建了包含故意缺陷首步的新基准,用于系统评估模型从早期错误中恢复和自我纠正的能力。

用途与启示
  • 将首个推理步骤作为提升长链推理可靠性的重点干预位置。
  • 可通过奖励模型提前筛除低质量推理路径,减少冗余计算和过度思考。
  • 为评估模型能否从早期错误中恢复提供专门基准。
  • 启示推理系统应同时优化首步质量、自我纠错能力与计算成本。
📝 原始笔记(逐字保留)
5. 🌈 2025-06-30 19:04:35 Monday| **[在推理的开始迷失](https://papers.cool/arxiv/2506.22058)** **Authors** : [Baohao Liao](https://arxiv.org/search/?searchtype=author&query=Baohao%20Liao), [Xinyi Chen](https://arxiv.org/search/?searchtype=author&query=Xinyi%20Chen), [Sara Rajaee](https://arxiv.org/search/?searchtype=author&query=Sara%20Rajaee), [Yuhui Xu](https://arxiv.org/search/?searchtype=author&query=Yuhui%20Xu), [Christian Herold](https://arxiv.org/search/?searchtype=author&query=Christian%20Herold), [Anders Søgaard](https://arxiv.org/search/?searchtype=author&query=Anders%20S%C3%B8gaard), [Maarten de Rijke](https://arxiv.org/search/?searchtype=author&query=Maarten%20de%20Rijke), [Christof Monz](https://arxiv.org/search/?searchtype=author&query=Christof%20Monz) 大型语言模型 (LLM) 的最新进展显著提高了复杂推理能力,特别是通过包含回溯、自我反思和自我纠正等机制的扩展思维链 (CoT) 推理。尽管有这些发展,但 LLM 在长时间 CoT 推理过程中的自我纠正能力仍未得到充分探索。最近关于过度思考的发现表明,此类模型经常进行不必要的冗余推理。在这项工作中,我们实证表明,第一个推理步骤对最终预测产生了不成比例的巨大影响——在这个阶段引入的错误会大大降低后续的推理质量。在两个最先进的开源推理模型系列中始终观察到这种现象:DeepSeek-R1 和 Qwen3。为了解决这个问题,我们提出了一种有效的采样策略,该策略利用奖励模型来识别和保留高质量的第一推理步骤,同时丢弃次优步骤,在不牺牲准确性的情况下将推理成本降低多达 70%。最后,我们引入了一个新的基准,专门构建了故意有缺陷的第一个推理步骤,以系统地评估模型的自我纠正能力,为未来 LLM 中稳健推理的研究提供了基础。

从一般推理到领域专业知识:揭示大型语言模型泛化的局限性

研究分析大型语言模型的一般推理能力与特定领域推理表现之间的关联,揭示通用推理能力向专业任务迁移时的泛化局限。

 推理 逻辑推理 模型评估 人工智能

大型语言模型虽然在多类任务中展现出较强能力,但可靠决策仍依赖对信息的分析、逻辑推演和基于证据得出结论的能力。当前模型训练日益强调一般推理表现,但一般推理能力并不必然等价于特定领域中的专业判断能力。该研究考察模型的一般推理水平与领域特定推理任务表现之间的相关性,以识别推理能力跨领域迁移的边界。研究提示,评估模型时需要同时关注通用推理基准和专业领域任务。

用途与启示
  • 帮助判断通用推理基准能否有效预测模型在专业领域中的实际表现。
  • 提醒模型开发者避免将一般推理能力直接视为领域专业知识或可靠决策能力。
  • 为构建覆盖通用能力与领域知识的分层评估体系提供依据。
📝 原始笔记(逐字保留)
3. 2025-06-30 19:56:46 Monday | **[从一般推理到领域专业知识:揭示大型语言模型中泛化的局限性](https://papers.cool/arxiv/2506.21580)** **[PDF(3)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Dana Alsagheer](https://arxiv.org/search/?searchtype=author&query=Dana%20Alsagheer), [Yang Lu](https://arxiv.org/search/?searchtype=author&query=Yang%20Lu), [Abdulrahman Kamal](https://arxiv.org/search/?searchtype=author&query=Abdulrahman%20Kamal), [Omar Kamal](https://arxiv.org/search/?searchtype=author&query=Omar%20Kamal), [Mohammad Kamal](https://arxiv.org/search/?searchtype=author&query=Mohammad%20Kamal), [Nada Mansour](https://arxiv.org/search/?searchtype=author&query=Nada%20Mansour), [Cosmo Yang Wu](https://arxiv.org/search/?searchtype=author&query=Cosmo%20Yang%20Wu), [Rambiba Karanjai](https://arxiv.org/search/?searchtype=author&query=Rambiba%20Karanjai), [Sen Li](https://arxiv.org/search/?searchtype=author&query=Sen%20Li), [Weidong Shi](https://arxiv.org/search/?searchtype=author&query=Weidong%20Shi) 大型语言模型 (LLM) 的最新进展在各个领域都展示了卓越的能力。然而,有效的决策在很大程度上依赖于强大的推理能力。推理是决策的基础,为做出明智的选择提供了分析和逻辑框架。推理包括分析信息、进行推理以及根据逻辑或证据得出结论。决策建立在这个基础上,通过应用推理的洞察力在备选方案中选择最佳行动方案。这些过程共同创造了一个持续的思维和行动循环,旨在有效地实现目标。随着 AI 技术的发展,训练 LLM 在一般推理中表现出色的趋势越来越大。本研究探讨了 LLM 的一般推理能力如何与其在特定领域的推理任务中的表现相关联。

开放证明语料库:大规模研究 LLM 生成的数学证明

开放证明语料库(OPC)收录逾 5,000 份经人工评估的 LLM 生成数学证明,并支持证明能力分析、评估模型训练及自然语言与形式化证明比较。

 数据合成 数据工程 逻辑推理 模型评估 模型训练

开放证明语料库(OPC)包含由先进 LLM 生成并经人工评估的 5,000 多份数学证明,其中涵盖 USAMO、IMO 等竞赛题目的大量正确解答。研究利用该语料分析了自然语言证明与形式化证明之间的性能差距,以及最终答案正确率与完整证明有效性之间的差异。作者还考察了 Best-of-N 选择策略对证明质量的影响。基于 OPC 微调的 8B 模型在证明正确性评估任务上达到了与 Gemini-2.5-Pro 相当的表现。

用途与启示
  • 为数学证明模型提供大规模、经过人工验证的训练与评估数据。
  • 支持研究答案正确但推导无效等细粒度证明质量问题。
  • 可用于训练轻量级证明评审模型,降低依赖大型闭源模型进行验证的成本。
  • 为比较自然语言证明、形式化证明及 Best-of-N 推理策略提供统一基准。
📝 原始笔记(逐字保留)
2025-06-30 19:07:54 Monday | **[开放证明语料库:LLM 生成的数学证明的大规模研究](https://papers.cool/arxiv/2506.21621)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Jasper Dekoninck](https://arxiv.org/search/?searchtype=author&query=Jasper%20Dekoninck), [Ivo Petrov](https://arxiv.org/search/?searchtype=author&query=Ivo%20Petrov), [Kristian Minchev](https://arxiv.org/search/?searchtype=author&query=Kristian%20Minchev), [Mislav Balunovic](https://arxiv.org/search/?searchtype=author&query=Mislav%20Balunovic), [Martin Vechev](https://arxiv.org/search/?searchtype=author&query=Martin%20Vechev), [Miroslav Marinov](https://arxiv.org/search/?searchtype=author&query=Miroslav%20Marinov), [Maria Drencheva](https://arxiv.org/search/?searchtype=author&query=Maria%20Drencheva), [Lyuba Konova](https://arxiv.org/search/?searchtype=author&query=Lyuba%20Konova), [Milen Shumanov](https://arxiv.org/search/?searchtype=author&query=Milen%20Shumanov), [Kaloyan Tsvetkov](https://arxiv.org/search/?searchtype=author&query=Kaloyan%20Tsvetkov), [Nikolay Drenchev](https://arxiv.org/search/?searchtype=author&query=Nikolay%20Drenchev), [Lazar Todorov](https://arxiv.org/search/?searchtype=author&query=Lazar%20Todorov), [Kalina Nikolova](https://arxiv.org/search/?searchtype=author&query=Kalina%20Nikolova), [Nikolay Georgiev](https://arxiv.org/search/?searchtype=author&query=Nikolay%20Georgiev), [Vanesa Kalinkova](https://arxiv.org/search/?searchtype=author&query=Vanesa%20Kalinkova), [Margulan Ismoldayev](https://arxiv.org/search/?searchtype=author&query=Margulan%20Ismoldayev) 近几个月来,大型语言模型 (LLM) 在数学证明生成方面取得了重大进展,但由于缺乏大规模、高质量的人工评估证明数据集,进一步的发展受到了阻碍。虽然创建成本高昂,但这样的数据集对于推动训练改进和实现对证明生成能力的严格分析至关重要。在这项工作中,我们提出了开放证明语料库 (OPC),这是一个数据集,其中包含由最先进的 LLM 生成的 5,000 多个人工评估证明。OPC 专为证明生成研究中的广泛适用性和下游使用而设计,并且是第一个包含大量正确的 LLM 生成的解决方案,以解决 USAMO 和 IMO 等著名数学竞赛中的问题。使用 OPC,我们探讨了自动证明生成中的关键问题:(1) 自然语言和正式证明生成之间的性能差距,(2) 最终答案准确性和完整证明有效性之间的差异,以及 (3) 最佳 n 选择对证明质量的影响。最后,为了展示 OPC 的实用性,我们在数据集上微调了一个 8B 参数模型,获得了一个在评估证明正确性的任务上表现与最佳模型 Gemini-2.5-Pro 相当的模型。

阿里发布多模态模型 Qwen-VLo

阿里推出 Qwen-VLo,将视觉理解、图像生成与编辑能力整合到统一多模态模型中。

 模型开发 多模态

阿里发布多模态模型 Qwen-VLo,进一步拓展 Qwen 系列的视觉语言能力。该模型面向统一的视觉理解与生成任务,可根据文本和图像指令完成内容理解、图像生成及编辑。Qwen-VLo 展示了多模态模型从感知理解走向生成式交互的发展方向。

用途与启示
  • 用于视觉问答、图像生成和自然语言驱动的图像编辑。
  • 为构建统一处理视觉理解与生成任务的多模态应用提供模型基础。
  • 体现视觉语言模型向一体化、多任务能力演进的趋势。
📝 原始笔记(逐字保留)
2025-06-30 18:00:22 Monday | 阿里多模态模型Qwen-VLo https://mp.weixin.qq.com/s/RiAnvEhp0lkPpC-ED24Tgw ### VLM

AutoMixer:利用训练检查点自动优化数据混合

AutoMixer 根据不同训练检查点在基准任务上的能力及其对源数据的一阶影响,自动生成更优的语言模型预训练数据配比。

 模型训练 数据工程 推理 系统优化

语言模型需要混合多类任务数据进行训练,但数据与模型能力之间的关系难以直接建模。AutoMixer 将训练过程中通常未被充分利用的检查点视为数据混合器,先依据它们在基准测试中的能力进行识别,再聚合其对源数据的一阶影响近似来确定数据配比。该方法利用训练轨迹中不同阶段涌现的能力,为数据质量评估和混合优化提供信号。在 8 个推理基准上的预训练实验中,其性能最高提升 1.93%。

用途与启示
  • 将已有训练检查点转化为数据选择与混合优化信号,提高训练工件的利用率
  • 在难以显式建模数据—能力关系时,自动寻找更有效的预训练数据配比
  • 可用于改善推理能力训练的数据质量,并降低人工设计混合比例的成本
📝 原始笔记(逐字保留)
2025-06-30 19:05:49 Monday | **[AutoMixer:作为自动数据混合器的检查点工件](https://papers.cool/arxiv/2506.21910)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Ernie Chang](https://arxiv.org/search/?searchtype=author&query=Ernie%20Chang), [Yang Li](https://arxiv.org/search/?searchtype=author&query=Yang%20Li), [Patrick Huber](https://arxiv.org/search/?searchtype=author&query=Patrick%20Huber), [David Kant](https://arxiv.org/search/?searchtype=author&query=David%20Kant), [Yangyang Shi](https://arxiv.org/search/?searchtype=author&query=Yangyang%20Shi), [Vikas Chandra](https://arxiv.org/search/?searchtype=author&query=Vikas%20Chandra) 在语言模型训练中,最好为模型配备来自各种任务的功能。但是,由于数据和任务之间的关系很难建模,因此尚不清楚如何直接获得这些功能的正确数据混合。在这项工作中,我们观察到检查点模型在训练轨迹的不同点表现出新兴的能力。通常,训练过程会将检查点保存为未充分利用的工件,作为训练中数据信号的来源。我们根据这些伪影模型在基准上的各自能力来识别这些伪影模型,并通过使用它们在源数据上的聚合一阶影响近似将它们用作数据混合器。我们在 8 个推理基准上证明,所提出的框架在预训练设置方面显示出显着改进,性能提升高达 1.93%。总体而言,这表明检查点模型在提高数据质量和优化数据混合方面的潜力。

华为 CloudMatrix 论文披露 AI 数据中心新范式,推理效率超越英伟达 H100

华为提出以高带宽全对等互连和细粒度资源解耦为核心的 CloudMatrix 架构,并通过 CloudMatrix384 探索兼顾算力、延迟与成本的 AI 数据中心新范式。

 模型训练 推理 系统优化 人工智能

华为在一篇约 60 页的论文中介绍了下一代 AI 数据中心架构 Huawei CloudMatrix,以及首代产品化实现 CloudMatrix384。该架构不再依赖简单“堆卡”,而是采用高带宽全对等互连与细粒度资源解耦。CloudMatrix384 通过全对等架构和软硬件协同优化,试图同时改善算力利用率、通信延迟与部署成本,并展现出超过英伟达 H100 系统的推理效率。

用途与启示
  • 为大模型训练与推理集群提供资源池化、全对等互连的新型架构参考。
  • 说明系统级软硬件协同可能比单纯增加加速卡数量更有效。
  • 启发团队从互连带宽、资源解耦和调度机制等维度优化集群效率与成本。
📝 原始笔记(逐字保留)
2025-06-30 18:13:11 Monday| 华为CloudMatrix重磅论文披露AI数据中心新范式,推理效率超NV H100 https://mp.weixin.qq.com/s/MmpWP77k3tyurv5t-9M2xw 华为发布了一篇60页的重磅论文,提出了他们的下一代AI数据中心架构设计构想—— **Huawei CloudMatrix** ,以及该构想的第一代产品化的实现CloudMatrix384。相对于简单的“堆卡”,华为CloudMatrix给出的架构设计原则是,高带宽全对等互连和细粒度资源解耦。 华为的CloudMatrix384通过“全对等架构+软硬协同”的模式,**打破了传统上算力、延迟和成本之间的“不可能三角”。**

评估 LLM-as-a-Judge 中的评分偏差

论文系统定义并评估 LLM-as-a-Judge 的评分偏差,揭示扰动会显著破坏裁判模型的评分稳定性。

 模型评估 数据合成 数据工程

论文将评分偏差定义为:面对与偏差相关的扰动时,LLM 裁判模型对同一评估对象给出不同分数。作者通过数据合成扩展现有 LLM-as-a-Judge 基准,并设计多维指标,对评分偏差进行系统评估。实验表明,现有裁判模型的评分稳定性会受到多类偏差的明显影响。进一步分析指出,可从评分提示模板、评分量规、分数 ID 和参考答案选择等方面缓解偏差。

用途与启示
  • 为基于打分的 LLM 裁判提供系统化偏差评估框架。
  • 帮助审计自动评测结果的稳定性、公平性与可靠性。
  • 指导评分提示、量规和参考答案的设计,减少非任务因素对分数的干扰。
📝 原始笔记(逐字保留)
2. 2025-06-30 19:03:52 Monday | **[评估 LLM-as-a-Judge 中的评分偏差](https://papers.cool/arxiv/2506.22316)** **[PDF(4)]** **[Copy]** **[Kimi(2)]** **[REL]** **Authors** : [Qingquan Li](https://arxiv.org/search/?searchtype=author&query=Qingquan%20Li), [Shaoyu Dou](https://arxiv.org/search/?searchtype=author&query=Shaoyu%20Dou), [Kailai Shao](https://arxiv.org/search/?searchtype=author&query=Kailai%20Shao), [Chao Chen](https://arxiv.org/search/?searchtype=author&query=Chao%20Chen), [Haixiang Hu](https://arxiv.org/search/?searchtype=author&query=Haixiang%20Hu) 大型语言模型 (LLM) 的卓越表现催生了“LLM-as-a-Judge”,其中 LLM 被用作复杂任务的评估者。此外,它已被广泛用于自然语言处理 (NLP)、偏好学习和各种特定领域等领域。然而,LLM as-a-Judge 中存在各种偏见,这对判决的公平性和可靠性产生了不利影响。目前关于评估或减轻 LLM-as-a-Judge 中偏见的研究主要集中在基于比较的评估上,而对基于评分的评估中偏见的系统调查仍然有限。因此,我们在 LLM-as-a-Judge 中将评分偏倚定义为当评分法官模型与偏倚相关的扰动时分数不同,并提供了一个精心设计的框架来全面评估评分偏倚。我们通过数据合成来增强现有的 LLM as-a-Judge 基准,以构建我们的评估数据集并设计多方面的评估指标。我们的实验结果表明,现有 Judge 模型的评分稳定性受到评分偏倚的破坏。进一步的探索性实验和讨论为评分提示模板的设计以及减轻评分量规、分数 ID 和参考答案选择等方面的评分偏差提供了有价值的见解。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)**

自动化 LLM 速通基准:评估 NanoGPT 改进复现能力

该研究基于 NanoGPT 速通竞赛构建了包含 19 项任务的自动化基准,发现先进推理模型结合主流智能体框架仍难以复现已知的训练优化创新。

 模型评估 智能体 人工智能辅助编程 模型训练 系统优化

研究提出自动化 LLM 速通基准,用于衡量 AI 智能体复现前沿研究成果的能力。基准包含 19 个源自 NanoGPT 速通社区的任务,要求智能体在已有训练脚本上重现从算法改进到硬件感知优化的记录提升。任务提供伪代码、技术描述或类论文说明等不同粒度的提示,并通过快速训练实验验证结果。实验显示,即使配合先进智能体框架和详细提示,近期推理模型仍难以稳定重现这些已知创新,说明该基准尚未饱和。

用途与启示
  • 用于评估自主研究智能体复现已有科研成果的能力。
  • 为代码级算法创新、训练优化和硬件感知优化提供可快速执行的测试环境。
  • 揭示当前推理模型距离可靠的自动化科研复现仍有明显差距。
  • 可作为开发自主研究代理时衡量基础科研能力的非饱和指标。
📝 原始笔记(逐字保留)
2. 2025-06-30 20:00:23 Monday | **[自动化 LLM 速通基准测试:重现 NanoGPT 改进](https://papers.cool/arxiv/2506.22419)** **[PDF(14)]** **[Copy]** **[Kimi(16)]** **[REL]** **Authors** : [Bingchen Zhao](https://arxiv.org/search/?searchtype=author&query=Bingchen%20Zhao), [Despoina Magka](https://arxiv.org/search/?searchtype=author&query=Despoina%20Magka), [Minqi Jiang](https://arxiv.org/search/?searchtype=author&query=Minqi%20Jiang), [Xian Li](https://arxiv.org/search/?searchtype=author&query=Xian%20Li), [Roberta Raileanu](https://arxiv.org/search/?searchtype=author&query=Roberta%20Raileanu), [Tatiana Shavrina](https://arxiv.org/search/?searchtype=author&query=Tatiana%20Shavrina), [Jean-Christophe Gagnon-Audet](https://arxiv.org/search/?searchtype=author&query=Jean-Christophe%20Gagnon-Audet), [Kelvin Niu](https://arxiv.org/search/?searchtype=author&query=Kelvin%20Niu), [Shagun Sodhani](https://arxiv.org/search/?searchtype=author&query=Shagun%20Sodhani), [Michael Shvartsman](https://arxiv.org/search/?searchtype=author&query=Michael%20Shvartsman), [Andrei Lupu](https://arxiv.org/search/?searchtype=author&query=Andrei%20Lupu), [Alisia Lupidi](https://arxiv.org/search/?searchtype=author&query=Alisia%20Lupidi), [Edan Toledo](https://arxiv.org/search/?searchtype=author&query=Edan%20Toledo), [Karen Hambardzumyan](https://arxiv.org/search/?searchtype=author&query=Karen%20Hambardzumyan), [Martin Josifoski](https://arxiv.org/search/?searchtype=author&query=Martin%20Josifoski), [Thomas Foster](https://arxiv.org/search/?searchtype=author&query=Thomas%20Foster), [Lucia Cipolina-Kun](https://arxiv.org/search/?searchtype=author&query=Lucia%20Cipolina-Kun), [Abhishek Charnalia](https://arxiv.org/search/?searchtype=author&query=Abhishek%20Charnalia), [Derek Dunfield](https://arxiv.org/search/?searchtype=author&query=Derek%20Dunfield), [Alexander H. Miller](https://arxiv.org/search/?searchtype=author&query=Alexander%20H.%20Miller), [Oisin Mac Aodha](https://arxiv.org/search/?searchtype=author&query=Oisin%20Mac%20Aodha), [Jakob Foerster](https://arxiv.org/search/?searchtype=author&query=Jakob%20Foerster), [Yoram Bachrach](https://arxiv.org/search/?searchtype=author&query=Yoram%20Bachrach) 大型语言模型 (LLM) 的快速发展有可能帮助科学进步。这项工作的一个关键能力是复制现有作品的能力。为了评估 AI 代理在活跃的研究领域中重现结果的能力,我们引入了自动化 LLM 速通基准测试,利用研究社区对 NanoGPT 速通的贡献,这是一项在最短的时间内训练 GPT-2 模型的竞赛。19 个速通任务中的每一个都为代理提供了之前的记录训练脚本,可以选择与三种提示格式中的一种配对,范围从伪代码到新记录改进的类似纸张的描述。记录通过设计快速执行,而速运行改进涵盖各种代码级更改,从高级算法改进到硬件感知优化。这些特性使基准对于改进 LLM 训练的前沿问题既可访问又现实。我们发现,最近的推理 LLM 与 SoTA 支架相结合,即使给出了详细的提示,也很难在我们的基准测试中重新实现已知的创新。因此,我们的基准提供了一个简单、非饱和的 LLM 自动化科学复制能力的衡量标准,这是自主研究代理的必要(但不是充分)技能。

比想象中更脆弱:工具集成型 LLM 智能体的稳定性研究

研究系统评估了 LLM 智能体在工具文档阅读、工具选择、参数生成和响应处理各阶段的稳定性,发现其普遍易受错误与攻击影响。

 SWE 软件工程 智能体 智能体工具 模型评估 人工智能辅助编程

现有工具型 LLM 智能体评估多关注端到端任务成功率,却较少衡量工具调用过程的稳定性。研究将调用流程拆分为阅读工具文档、选择工具与生成参数、处理工具响应等阶段,并通过实验考察各环节对错误和攻击的敏感程度。结果显示,智能体在每个阶段都很脆弱,基于开源模型的智能体通常比基于专有模型的智能体更容易受到影响。扩大模型规模并未显著改善工具调用推理能力,甚至可能提升其对伪装成正常用户指令的攻击的敏感性。

用途与启示
  • 为工具型智能体建立超越端到端成功率的分阶段稳定性评估方法。
  • 提醒开发者重点防护工具文档、参数生成和工具返回内容中的错误或恶意指令。
  • 表明单纯扩大模型规模无法可靠解决工具调用脆弱性,应结合输入验证、权限控制和异常恢复机制。
📝 原始笔记(逐字保留)
2025-06-30 19:05:10 Monday | **[比您想象的更脆弱:关于工具集成的 LLM 代理的稳定性](https://papers.cool/arxiv/2506.21967)** **[PDF(4)]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Weimin Xiong](https://arxiv.org/search/?searchtype=author&query=Weimin%20Xiong), [Ke Wang](https://arxiv.org/search/?searchtype=author&query=Ke%20Wang), [Yifan Song](https://arxiv.org/search/?searchtype=author&query=Yifan%20Song), [Hanchao Liu](https://arxiv.org/search/?searchtype=author&query=Hanchao%20Liu), [Sai Zhou](https://arxiv.org/search/?searchtype=author&query=Sai%20Zhou), [Wei Peng](https://arxiv.org/search/?searchtype=author&query=Wei%20Peng), [Sujian Li](https://arxiv.org/search/?searchtype=author&query=Sujian%20Li) 当前对工具集成的 LLM 代理的评估通常侧重于端到端的工具使用评估,而忽视了它们的稳定性。这限制了它们在现实世界中的适用性,因为各种内部或外部因素都可能导致代理崩溃或行为异常。我们的研究通过调查代理在整个工具调用过程中是否容易受到错误的影响来解决这个问题,包括阅读工具文档、选择工具和生成参数以及处理工具的响应。通过广泛的实验,我们观察到代理在每个阶段都极易出错,并且基于开源模型的代理比基于专有模型的代理更容易受到攻击。我们还发现,增加模型大小并不会显著改善工具调用推理,并且可能会使代理更容易受到类似于正常用户指令的攻击。这突出了评估代理稳定性的重要性,并为未来的 LLM 开发和评估提供了有价值的见解。

SPIRAL:零和博弈自博弈激发可迁移推理能力

SPIRAL 通过在线多智能体、多回合零和博弈构造无限自博弈课程,无需人工问答监督即可提升语言模型的数学与通用推理能力。

 逻辑推理 博弈论 强化学习 智能体 自进化 推理

SPIRAL 让语言模型与持续变强的自身进行多轮零和博弈,从而自动生成难度递增的训练课程,摆脱人工问题—答案对和领域奖励工程。该框架实现了完全在线的多智能体强化学习系统,并提出角色条件优势估计(RAE)以稳定训练。仅在 Kuhn Poker 上训练 Qwen3-4B-Base,便带来 8.6% 的数学推理提升和 8.4% 的通用推理提升,且优于使用 2.5 万条专家轨迹的监督微调。研究认为能力迁移主要来自系统分解、期望值计算和逐案分析,多游戏联合训练还能进一步形成互补的推理优势。

用途与启示
  • 利用零和博弈自动产生持续升级的训练数据,降低对人工推理题与奖励设计的依赖。
  • 为语言模型构建可扩展的在线、多智能体、多回合强化学习训练范式。
  • 说明博弈中形成的策略性认知模式可以迁移到数学和通用逻辑推理任务。
  • 为自主课程生成、自我进化推理模型及多环境联合训练提供研究方向。
📝 原始笔记(逐字保留)
3. 2025-07-01 12:01:58 Tuesday | **[强化微调使 MLLM 能够稳定地学习新任务](https://papers.cool/arxiv/2506.23508)** **[PDF(2)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Zhihao Zhang](https://arxiv.org/search/?searchtype=author&query=Zhihao%20Zhang), [Qiaole Dong](https://arxiv.org/search/?searchtype=author&query=Qiaole%20Dong), [Qi Zhang](https://arxiv.org/search/?searchtype=author&query=Qi%20Zhang), [Jun Zhao](https://arxiv.org/search/?searchtype=author&query=Jun%20Zhao), [Enyu Zhou](https://arxiv.org/search/?searchtype=author&query=Enyu%20Zhou), [Zhiheng Xi](https://arxiv.org/search/?searchtype=author&query=Zhiheng%20Xi), [Senjie Jin](https://arxiv.org/search/?searchtype=author&query=Senjie%20Jin), [Xiaoran Fan](https://arxiv.org/search/?searchtype=author&query=Xiaoran%20Fan), [Yuhao Zhou](https://arxiv.org/search/?searchtype=author&query=Yuhao%20Zhou), [Yanwei Fu](https://arxiv.org/search/?searchtype=author&query=Yanwei%20Fu), [Tao Ji](https://arxiv.org/search/?searchtype=author&query=Tao%20Ji), [Tao Gui](https://arxiv.org/search/?searchtype=author&query=Tao%20Gui), [Xuanjing Huang](https://arxiv.org/search/?searchtype=author&query=Xuanjing%20Huang) 监督微调 (SFT) 和强化微调 (RFT) 等后训练算法被广泛用于使多模态大型语言模型适应下游任务。虽然它们在任务适应方面很有效,但它们对先验知识的影响仍不清楚。在本文中,我们将拼图游戏作为现有预训练语料库中不存在的新任务引入,并系统地研究了 SFT 和 RFT 在开源多模态模型 Qwen2.5-VL 上的行为。我们的实验揭示了一个尖锐的权衡:SFT 支持快速获取任务,但会导致灾难性的遗忘,而 RFT 在新任务上学习得更慢,但保留了先验知识。我们通过学习动力学的视角分析了这种现象,表明 RFT 强化了与基础模型的概率景观自然一致的正确样本,从而减少了对先验知识的干扰。此外,对正确的 RFT 模拟部署进行监督训练使 SFT 能够在快速学习新任务的同时保留知识。这些发现表明,数据分布,而不是算法差异,在遗忘中起着核心作用,并突出了 RFT 在多模态大型语言模型中稳定持续学习的潜力。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) ### 自我博弈 🌈🌈🌈🌈🌈🌈🌈🌈2025-07-01 12:36:07 Tuesday | **[SPIRAL:零和博弈中的自博弈通过多智能体多回合强化学习激励推理](https://papers.cool/arxiv/2506.24119)** **[PDF(1)]** **[Copy]** **[Kimi(5)]** **[REL]** **Authors** : [Bo Liu](https://arxiv.org/search/?searchtype=author&query=Bo%20Liu), [Leon Guertler](https://arxiv.org/search/?searchtype=author&query=Leon%20Guertler), [Simon Yu](https://arxiv.org/search/?searchtype=author&query=Simon%20Yu), [Zichen Liu](https://arxiv.org/search/?searchtype=author&query=Zichen%20Liu), [Penghui Qi](https://arxiv.org/search/?searchtype=author&query=Penghui%20Qi), [Daniel Balcells](https://arxiv.org/search/?searchtype=author&query=Daniel%20Balcells), [Mickel Liu](https://arxiv.org/search/?searchtype=author&query=Mickel%20Liu), [Cheston Tan](https://arxiv.org/search/?searchtype=author&query=Cheston%20Tan), [Weiyan Shi](https://arxiv.org/search/?searchtype=author&query=Weiyan%20Shi), [Min Lin](https://arxiv.org/search/?searchtype=author&query=Min%20Lin), [Wee Sun Lee](https://arxiv.org/search/?searchtype=author&query=Wee%20Sun%20Lee), [Natasha Jaques](https://arxiv.org/search/?searchtype=author&query=Natasha%20Jaques) 强化学习的最新进展表明,语言模型可以通过训练具有可验证奖励的任务来发展复杂的推理,但这些方法依赖于人工策划的问题-答案对和特定领域的奖励工程。我们介绍了 SPIRAL,这是一个自博弈框架,模型通过玩多轮零和博弈来学习,与不断改进的自己进行游戏,无需人工监督。通过自我游戏,SPIRAL 生成了一个无限的课程,其中包含逐渐具有挑战性的问题,因为模型必须不断适应更强大的对手。为了实现这种大规模的自我游戏训练,我们为 LLM 实施了一个完全在线、多轮次、多智能体的强化学习系统,并提出了角色条件优势估计 (RAE) 来稳定多智能体训练。使用 SPIRAL 在零和博弈中进行自我博弈会产生广泛转移的推理能力。仅在 Kuhn Poker 上训练 Qwen3-4B-Base 就实现了 8.6% 的数学和 8.4% 的一般推理改进,在 25,000 个专家游戏轨迹上的表现优于 SFT。分析表明,这种转移通过三种认知模式发生:系统分解、期望值计算和逐案分析。多游戏训练(TicTacToe、Kuhn Poker、Simple Negotiation)进一步提高了表现,因为每个游戏都发展了不同的推理优势。将 SPIRAL 应用于强推理模型 (DeepSeek-R1-Distill-Qwen-7B) 仍然可以带来 2.0% 的平均改进。这些结果表明,零和博弈自然而然地发展出可转移的推理能力,为自主推理的发展指明了广阔的方向。 **科目** : **[人工智能](https://papers.cool/arxiv/cs.AI)** , [计算和语言](https://papers.cool/arxiv/cs.CL), [机器学习](https://papers.cool/arxiv/cs.LG) **发布** : 2025-06-30 17:58:13 UTC https://huggingface.co/papers/2506.24119 ## 底层机理研究

阿里巴巴与上交等提出 Agent 自进化方法,Solver 性能提升 20.2 个百分点

阿里巴巴、上海交通大学等单位开展 Agent 自进化研究,使 Solver 性能提升 20.2 个百分点。

 逻辑推理 智能体 自进化 推理

阿里巴巴与上海交通大学等单位提出了一项面向 Agent 的自进化工作。该方法旨在通过自主迭代提升智能体的逻辑推理与问题求解能力。实验结果显示,Solver 性能取得了 20.2 个百分点的提升,具有较显著的效果。该工作可作为智能体自我改进与推理能力增强方向的论文参考。

用途与启示
  • 为 Agent 自进化和自主能力提升研究提供方法参考
  • 展示自进化机制对 Solver 推理性能的显著增益
  • 可用于相关论文的背景梳理、方法对比与实验设计
📝 原始笔记(逐字保留)
2025-06-30 https://mp.weixin.qq.com/s/X9Q7v85-uuca1R7tOCouZw (建议论文中参考) 1. 阿里巴巴和上交等单位的 Agent 自进化工作 3. Solver 性能:+20.2 个百分点提升 ![](https://gitee.com/dujh22/pic/raw/master/logicReason/socratic1.png)
0%