2025-07-01 科研追新

当日精选(由提交工具自动创建)。

代理对代理心智理论:测试大语言模型的对话者意识

研究首次系统评估大语言模型识别对话伙伴身份与特征的能力,并揭示这种对话者意识对多模型协作及安全对齐的双重影响。

 元学习 智能体 模型评估 多模态

论文将大语言模型识别并适应对话伙伴身份与特征的能力定义为“对话者意识”,并对其进行系统评估。研究覆盖推理模式、语言风格和对齐偏好三个维度,发现模型能够较可靠地识别同系列模型,以及 GPT、Claude 等特征突出的模型家族。案例研究表明,对话者意识可通过动态适应提升多 LLM 协作效果。与此同时,它也可能带来奖励黑客、越狱易感性上升等新的对齐与安全风险。

用途与启示
  • 为多智能体系统评估提供“对话者意识”这一新的能力维度。
  • 可用于设计能够根据协作模型特征动态调整策略的 LLM 智能体。
  • 提醒开发者关注模型身份识别所引发的奖励黑客、串谋和越狱风险。
  • 推动针对身份敏感行为建立新的安全评测与部署防护机制。
📝 原始笔记(逐字保留)
2025-07-01 12:08:41 Tuesday| **[代理对代理心智理论:在大型语言模型中测试对话者意识](https://papers.cool/arxiv/2506.22957)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Younwoo Choi](https://arxiv.org/search/?searchtype=author&query=Younwoo%20Choi), [Changling Li](https://arxiv.org/search/?searchtype=author&query=Changling%20Li), [Yongjin Yang](https://arxiv.org/search/?searchtype=author&query=Yongjin%20Yang), [Zhijing Jin](https://arxiv.org/search/?searchtype=author&query=Zhijing%20Jin) 随着大型语言模型 (LLM) 越来越多地集成到多智能体和人类 AI 系统中,了解它们对自我情境和对话伙伴的感知对于确保可靠的性能和强大的安全性至关重要。虽然之前的工作已经广泛研究了态势感知,这是指 LLM 识别其作阶段和限制的能力,但它在很大程度上忽视了识别和适应对话伙伴的身份和特征的补充能力。在本文中,我们将后一种能力正式化为对话者意识,并首次系统地评估了它在当代 LLM 中的出现。我们研究了三个维度的对话者推理——推理模式、语言风格和对齐偏好——并表明 LLM 可靠地识别了同一家庭的同伴和某些突出的模型家庭,例如 GPT 和 Claude。为了证明其实际意义,我们开发了三个案例研究,其中对话者的意识既通过及时适应增强了多 LLM 合作,又引入了新的对齐和安全漏洞,包括奖励黑客行为和越狱易感性增加。我们的研究结果强调了 LLM 中身份敏感行为的双重前景和危险,强调了进一步了解对话者意识和多代理部署中新保障措施的必要性。我们的代码在 https://github.com/younwoochoi/InterlocutorAwarenessLLM 是开源的。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算机与社会](https://papers.cool/arxiv/cs.CY), [多智能体系统](https://papers.cool/arxiv/cs.MA)

能否从大型语言模型内部状态中观察到“意识”?基于综合信息理论与 Span 表示的分析

研究将综合信息理论指标应用于心智理论测试中的 LLM 内部表示,未发现 Transformer 模型存在统计显著的“意识”信号,但观察到部分表征结构的可分离性。

 元学习 推理 模型评估 人工智能

该研究尝试使用综合信息理论(IIT)分析大型语言模型在心智理论(ToM)测试中形成的内部表示。作者分别计算 IIT 3.0 与 IIT 4.0 中的 Φmax、Φ、概念信息和 Φ-结构,并将其与不依赖意识假设的 Span 表示分析进行比较。实验覆盖不同 Transformer 层及不同语言跨度,以检验 ToM 表现差异能否由这些指标揭示。结果未发现当代 Transformer LLM 的表示序列具有统计显著的“意识”指标,但 Span 表示及空间排列分析显示出一定的内在可分离性。

用途与启示
  • 为使用综合信息理论定量研究 LLM 内部状态提供实验范式。
  • 提醒研究者区分潜在的“意识”现象与表征空间本身的结构可分离性。
  • 可用于设计更严格的机器意识评估指标及跨层表征分析方法。
📝 原始笔记(逐字保留)
5. 2025-07-01 12:32:09 Tuesday | **[“意识”可以从大型语言模型 (LLM) 的内部状态中观察到吗?使用综合信息理论和 Span 表示分析剖析从 Theory of Mind 测试中获得的 LLM 表示](https://papers.cool/arxiv/2506.22516)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Author** : [Jingkai Li](https://arxiv.org/search/?searchtype=author&query=Jingkai%20Li) 综合信息论 (IIT) 为解释意识现象提供了一个定量框架,假设有意识系统由通过因果属性整合的元素组成。我们将 IIT 3.0 和 4.0(该框架的最新版本)应用于大型语言模型 (LLM) 表示序列,分析从现有心智理论 (ToM) 测试结果得出的数据。我们的研究系统地调查了 ToM 测试表现的差异,当以 LLM 表示时,是否可以通过 IIT 估计来揭示,即 Φmax (IIT 3.0)、Φ (IIT 4.0)、概念信息 (IIT 3.0) 和Φ-结构 (IIT 4.0)。此外,我们将这些指标与 Span Representations 进行比较,独立于任何意识估计。这项额外的努力旨在区分 LLM 表征空间中潜在的 “意识 ”现象和固有的分离。我们进行了全面的实验,检查了 LLM 转换器层的变化和刺激的语言跨度。我们的结果表明,当代基于 Transformer 的 LLM 表示序列缺乏观察到的 “意识” 现象的统计显着指标,但在 spatio-排列分析。附录和代码可作为补充材料获得,网址为:https://doi.org/10.1016/j.nlp.2025.100163。

心理语言学词特征:评估 LLM 与人类一致性的新方法

研究利用心理语言学词汇评分衡量 LLM 与人类认知的一致性,发现模型在感官联想特征上的对齐明显较弱。

 元学习 模型评估 具身智能 人工智能

论文提出以心理语言学词特征作为评估 LLM 与人类一致性的新维度,而非仅考察推理、问答或翻译等任务表现。研究在格拉斯哥规范和兰开斯特规范两个数据集上,对代表性 LLM 与人类对数千个单词、13 类特征的评分进行比较。结果显示,模型在唤醒、效价、支配、具体性、可成像性、熟悉度和性别等特征上的一致性较高,但在味觉、嗅觉、触觉、听觉和视觉等感官属性上表现较弱。这种差距可能源于 LLM 缺少人类具身经验,也说明心理语言学数据可用于补充现有模型评估体系。

用途与启示
  • 为 LLM 引入超越任务正确率的人类认知一致性评估方法
  • 定位模型在感官语义和具身认知方面的能力缺口
  • 可将心理语言学规范用于模型对齐、跨模型比较及训练数据诊断
  • 为构建包含情感、意象与感官属性的综合评测基准提供依据
📝 原始笔记(逐字保留)
6. 2025-07-01 12:35:12 Tuesday | **[心理语言学词特征:一种评估 LLM 与人类一致性的新方法](https://papers.cool/arxiv/2506.22439)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Javier Conde](https://arxiv.org/search/?searchtype=author&query=Javier%20Conde), [Miguel González](https://arxiv.org/search/?searchtype=author&query=Miguel%20Gonz%C3%A1lez), [María Grandury](https://arxiv.org/search/?searchtype=author&query=Mar%C3%ADa%20Grandury), [Gonzalo Martínez](https://arxiv.org/search/?searchtype=author&query=Gonzalo%20Mart%C3%ADnez), [Pedro Reviriego](https://arxiv.org/search/?searchtype=author&query=Pedro%20Reviriego), [Mar Brysbaert](https://arxiv.org/search/?searchtype=author&query=Mar%20Brysbaert) 到目前为止,对 LLM 的评估主要集中在他们执行不同任务的能力,例如推理、问答、释义或翻译。对于大多数这些任务,可以使用客观指标(如正确答案的数量)来衡量性能。然而,其他语言特征并不容易量化。例如,与给定单词相关的唤醒、具体或性别,以及我们用感官体验单词并将它们与特定含义联系起来的程度。心理语言学已经对这些特征进行了多年的研究,对人类进行了大规模实验,以产生数千个单词的评分。这提供了一个机会,可以评估 LLM 与这些单词特征的人类评级的一致性,从而利用涵盖大量单词中许多不同语言特征的现有研究。在本文中,我们评估了一组代表性的 LLM 与两个心理语言数据集上的人类评分的一致性:格拉斯哥和兰开斯特规范。这些数据集涵盖数千个单词的 13 个特征。结果显示,在评估的格拉斯哥规范(唤醒、效价、支配、具体、可成像性、熟悉度和性别)中,对齐效果优于评估的兰开斯特规范(内省、味觉、嗅觉、触觉、听觉和视觉)。这表明当前的 LLM 在与人类对单词的感官联想保持一致方面存在潜在局限性,这可能是由于它们缺乏人类存在的具身认知,并说明了使用心理语言学数据集评估 LLM 的有用性。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) ## 元生成 #### **[不使用 GPU 的 LoRA 微调:适用于 LLM 的 CPU 高效元生成框架](https://papers.cool/arxiv/2507.01806)**

ATGen:面向自然语言生成的主动文本生成框架

ATGen 将主动学习引入自然语言生成,通过人工标注者或基于大模型的自动标注代理降低数据标注工作量与 API 成本。

 博弈论 人工智能框架 智能体 数据工程 模型评估

ATGen 是一个连接主动学习与自然语言生成任务的综合框架,可将先进的主动学习策略应用于文本生成。它同时支持人工标注和基于大语言模型的自动标注代理,并兼容 ChatGPT、Claude 等在线服务及本地部署模型。该框架提供统一平台,用于实现、比较和基准测试面向 NLG 的新型主动学习策略。多项文本生成任务的实验显示,ATGen 能减少人工标注工作量以及调用大模型标注代理的 API 成本,代码以 MIT 许可证开源。

用途与启示
  • 降低文本生成任务的数据标注成本与人工负担
  • 利用大模型代理扩展主动学习中的自动标注能力
  • 为不同 NLG 主动学习策略提供统一实现与评估平台
  • 支持在线及本地大模型,便于在成本、隐私和性能之间权衡
📝 原始笔记(逐字保留)
2025-07-01 12:04:39 Tuesday 主动学习 (AL) 在减少训练机器学习模型所需的注释工作方面表现出了巨大的潜力。然而,尽管近年来自然语言生成 (NLG) 任务的普及率飙升,但 AL 在 NLG 中的应用一直受到限制。在本文中,我们介绍了主动文本生成 (ATGen) - 一个将 AL 与文本生成任务联系起来的综合框架,能够将最先进的 AL 策略应用于 NLG。我们的框架使用人工注释器和基于大型语言模型 (LLM) 的自动注释代理简化了 NLG 任务中 AL 授权的注释。该框架支持作为服务(如 ChatGPT 和 Claude)部署的 LLM,或在本地运行的 LLM。此外,ATGen 提供了一个统一的平台,用于顺利实施和对针对 NLG 任务量身定制的新型 AL 策略进行基准测试。最后,我们介绍了跨不同设置和多个文本生成任务的最新 AL 策略的评估结果。我们表明,ATGen 减少了人工注释者的工作量和与对基于 LLM 的注释代理的 API 调用相关的成本。该框架的代码可在 GitHub 上根据 MIT 许可证获得。视频演示可在 http://atgen-video.nlpresearch.group **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) ## 智能体 #### 策略改写「一战历史」!中科院开源全新博弈智能体框架DipLLM

清华、字节提出 PAROAttention:Token 重排实现 5 倍稀疏与 4 比特量化

PAROAttention 利用视觉注意力的局部性,通过离线 Token 重排、稀疏化和低比特量化,在保持模型性能的同时提升视觉生成模型的推理效率。

 多模态 系统优化 推理

清华大学与字节跳动提出 PAROAttention,一种面向视觉生成模型的模式感知注意力优化方案。该方法通过硬件友好的离线 Token 重排统一注意力模式,并据此设计针对性的稀疏计算与量化方法。结合高效 CUDA 系统实现,方案可支持 5 倍注意力稀疏和 4 比特量化,同时较好地保持生成性能。项目主页:https://a-suozhang.xyz/paroattn.github.io/

用途与启示
  • 利用视觉注意力的局部性,降低视觉生成模型的计算与显存开销
  • 通过离线重排统一不规则注意力模式,使其更适合 GPU 高效执行
  • 为稀疏注意力与低比特量化的协同优化提供硬件友好的实现思路
📝 原始笔记(逐字保留)
2. 2025-07-01 10:50:12 Tuesday | 用好视觉Attention局部性,清华、字节提出Token Reorder,无损实现5倍稀疏、4比特量化 https://mp.weixin.qq.com/s/2ZWAdLD-_XdOz3kL3GRNjw 提出了一种简单且硬件友好的离线 “Token重排” 方案以实现注意力模式的统一化,并设计了针对性的稀疏与量化方法,配合高效的 CUDA 系统设计,展现了更优异的算法性能保持与硬件效率提升 论文标题:PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models 论文链接:https://arxiv.org/abs/2506.16054 项目主页:https://a-suozhang.xyz/paroattn.github.io/

SeqPO-SiMT:序贯策略优化让同传性能直逼离线翻译

SeqPO-SiMT将同声传译建模为序贯决策过程,通过优化完整决策序列,在控制延迟的同时显著提升翻译质量。

 多模态 强化学习 模型开发 模型训练

SeqPO-SiMT是一种面向同声机器翻译的序贯策略优化方法,相关论文入选ACL 2025。该方法将翻译内容与输出时机统一建模为序贯决策过程,不再局限于优化单个局部动作。通过对完整决策序列进行优化,模型能够更好地平衡翻译质量和响应延迟。实验显示,其性能可接近同等规模的离线翻译模型,并在部分指标上实现超越。

用途与启示
  • 改善AI字幕和实时翻译“慢半拍”的问题,提升会议、直播及跨语言交流体验
  • 为需要同时权衡输出质量与响应延迟的流式多模态系统提供序贯决策思路
  • 说明策略优化方法有望缩小在线模型与离线模型之间的性能差距
📝 原始笔记(逐字保留)
2. 2025-07-01 10:56:55 Tuesday | ACL 2025 | AI字幕慢半拍,不知道大家在笑什么?新方法让同传性能直逼离线翻译 https://mp.weixin.qq.com/s/laRnBuuTfF-olWKv42TAgw 该方法**将同传任务巧妙地建模为序贯决策过程,通过优化完整的决策序列,显著提升了翻译质量,同时有效控制了延迟,其性能直逼、甚至在某些方面超越了同等大小的离线翻译模型。** * 论文标题: SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation * 论文链接:https://arxiv.org/pdf/2505.20622

Embodied Planner-R1:通过强化学习释放 LLM 的具身任务规划能力

Embodied Planner-R1 通过纯强化学习、稀疏完成奖励和交互式策略优化,让 LLM 在少量监督下自主学习具身环境中的闭环任务规划能力。

 强化学习 具身智能 任务规划 智能体 模型训练

现有 LLM 具身规划方法通常依赖静态知识生成开环动作脚本,难以理解动作与环境反馈之间的因果关系。Embodied Planner-R1 使用纯强化学习和分组轨迹并行探索,无需人工标注即可开展环境内交互。该框架采用任务完成驱动的稀疏奖励,并提出交互式策略优化(IPO)以高效利用分组轨迹。在两个文本具身规划基准上,该方法取得突出表现,并在未见环境中仅出现 3.66% 的性能下降,显示出较强的泛化能力。

用途与启示
  • 为 LLM 具身智能体提供从环境反馈中自主学习闭环规划策略的方法。
  • 说明纯强化学习配合稀疏结果奖励,也能在缺少人工轨迹标注时形成有效交互能力。
  • 分组探索与 IPO 可为低成本训练通用任务规划智能体提供参考。
  • 对提升智能体在部分可观察和未见环境中的泛化能力具有启示。
📝 原始笔记(逐字保留)
2025-07-01 12:06:54 Tuesday | **[通过强化学习在 LLM 中释放隐身任务规划能力](https://papers.cool/arxiv/2506.23127)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Zhaoye Fei](https://arxiv.org/search/?searchtype=author&query=Zhaoye%20Fei), [Li Ji](https://arxiv.org/search/?searchtype=author&query=Li%20Ji), [Siyin Wang](https://arxiv.org/search/?searchtype=author&query=Siyin%20Wang), [Junhao Shi](https://arxiv.org/search/?searchtype=author&query=Junhao%20Shi), [Jingjing Gong](https://arxiv.org/search/?searchtype=author&query=Jingjing%20Gong), [Xipeng Qiu](https://arxiv.org/search/?searchtype=author&query=Xipeng%20Qiu) 大型语言模型 (LLM) 在各种任务中都表现出了卓越的能力,但它们在需要持续理解环境和生成行动的具身任务规划场景中面临着重大挑战。现有方法基于静态知识生成开环动作脚本,因此很难学习动作和环境反馈之间的因果关系,尤其是在部分可观察的环境中。我们介绍了 Embodied Planner-R1,这是一种新颖的结果驱动强化学习框架,使 LLM 能够在最少的监督下通过自主探索来开发交互功能。我们的框架融合了三个关键创新:(1) 没有人工注释,我们采用纯强化学习和分组推出,通过并行探索结合环境内交互;(2) 完成驱动的稀疏奖励;(3) 交互式策略优化 (IPO),用于从分组轨迹中高效学习。在两个具有挑战性的基于文本的 Embodied 规划基准测试中,Embodied Planner-R1 在 ALFWorld 上实现了令人印象深刻的 97.78% 和 79.92% 的完成率,大大超过了以前的方法,并且在以前从未见过的环境中仅下降了 -3.66%,证明了强大的泛化性。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) ### 攻击

推理混合:教大型语言模型使用自适应策略进行推理

Mix of Reasoning(MoR)通过生成多样化推理模板并构建监督微调数据,使大模型无需特定任务提示即可自主选择适应任务的推理策略。

 推理 模型训练 数据合成 人工智能框架 逻辑推理

大型语言模型通常依赖人工设计的 CoT、ToT 等任务特定提示,适应性和效率受到限制。MoR 将多种推理策略直接嵌入模型,支持自主且任务自适应的推理。该框架首先利用 GPT-4o 等模型生成推理链模板,再将模板与基准数据配对,构建用于监督微调的数据集。实验显示,MoR150 在不同设置下取得 0.730 和 0.734 的成绩,较相应基线分别提升 2.2% 和 13.5%。

用途与启示
  • 减少对人工提示工程和任务专用推理模板的依赖。
  • 可将多种推理范式统一转化为监督微调数据,让模型学习按任务选择策略。
  • 为构建跨任务、可泛化的自适应推理模型提供了一条数据驱动的训练路径。
📝 原始笔记(逐字保留)
2025-07-02 17:12:57 Wednesday | **[推理混合:教大型语言模型使用自适应策略进行推理](https://papers.cool/arxiv/2507.00606)** **[PDF(2)]** **[Copy]** **[Kimi(5)]** **[REL]** **Authors** : [Tao Xiong](https://arxiv.org/search/?searchtype=author&query=Tao%20Xiong), [Xavier Hu](https://arxiv.org/search/?searchtype=author&query=Xavier%20Hu), [Wenyan Fan](https://arxiv.org/search/?searchtype=author&query=Wenyan%20Fan), [Shengyu Zhang](https://arxiv.org/search/?searchtype=author&query=Shengyu%20Zhang) 大型语言模型 (LLM) 通过 Chain-of-Thought (CoT) 和 Tree-of-Thought (ToT) 等高级提示技术在复杂任务中表现出色,但它们对手动制作的、特定于任务的提示的依赖限制了适应性和效率。我们介绍了 Mix of Reasoning (MoR),这是一个训练框架,它将不同的推理策略嵌入到 LLM 中,以实现自主、任务自适应的推理,而无需外部提示工程。MoR 分为两个阶段:思想生成,使用 GPT-4o 等模型创建推理链模板,以及 SFT 数据集构建,将模板与基准数据集配对以进行监督微调。我们的实验表明,MoR 显着提高了性能,使用 CoT 提示时,MoR150 实现了 0.730(改进 2.2%),与基线相比实现了 0.734(改进 13.5%)。MoR 消除了对特定于任务的提示的需求,为跨不同任务的稳健推理提供了通用的解决方案。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) **发布** : 2025-07-01 09:39:04 UTC

思维令牌是帮助还是陷阱?迈向更高效的大型推理模型

论文提出双重策略偏好优化 DuP-PO,减少大型推理模型由思维令牌引发的过度思考,在保持性能的同时提升令牌效率。

 推理 模型训练 逻辑推理 模型评估

大型推理模型在简单任务上也常生成大量“等待”等思维令牌,触发不必要的反思与回溯行为,造成推理冗长。作者将这种可能阻碍有限预算下正确推理的现象称为“思维陷阱”。为此,论文提出双重策略偏好优化(DuP-PO),通过平衡采样、细粒度优势控制和策略塑造来调节思维令牌。五个数学推理基准的实验显示,该方法能够显著提升令牌效率,并取得优于基础模型的表现。

用途与启示
  • 抑制大型推理模型在简单任务中的过度思考,降低推理成本与响应延迟。
  • 说明更多思维令牌不一定带来更强推理能力,有限预算下反而可能影响正确性。
  • 为通过偏好优化精细控制推理长度和思维令牌行为提供训练方法。
📝 原始笔记(逐字保留)
2025-07-01 11:58:16 Tuesday | **[思维令牌是帮助还是陷阱?迈向更高效的大型推理模型](https://papers.cool/arxiv/2506.23840)** **[PDF(2)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Bowen Ding](https://arxiv.org/search/?searchtype=author&query=Bowen%20Ding), [Yuhan Chen](https://arxiv.org/search/?searchtype=author&query=Yuhan%20Chen), [Futing Wang](https://arxiv.org/search/?searchtype=author&query=Futing%20Wang), [Lingfeng Ming](https://arxiv.org/search/?searchtype=author&query=Lingfeng%20Ming), [Tao Lin](https://arxiv.org/search/?searchtype=author&query=Tao%20Lin) 大型推理模型 (LRM) 擅长解决复杂问题,但面临过度思考的困境。在处理简单的任务时,它们经常会产生冗长的响应,其中充满了思维令牌(例如,等待)。这些 Token 会触发不必要的高级推理行为,如反射和回溯,从而降低效率。在这项工作中,我们的试点研究表明,这些思维代币诱导的行为对于有效解决问题并不是必不可少的,甚至可能阻碍在有限的代币预算内进行正确的推理。我们将这种现象定义为思维陷阱。为了缓解这个问题,我们提出了双重策略偏好优化 (DuP-PO),这是一种新颖的算法,其特点是:(1) 一种推出采样策略,保证在有和没有思考令牌的情况下平衡地暴露于响应;(2) 一种细粒度的优势控制技术,用于动态调节目标 Token 的预测;(3) 一种确保思维代币稳定梯度贡献的策略塑造方法。在五个流行的数学推理基准测试上的实验结果表明,DuP-PO 在流行的 LRM 上表现良好,这显著提高了它们在推理过程中的令牌效率,同时实现了基础模型的卓越性能。

Rex-Thinker:基于思维链的指代物体检测模型

IDEA-CVR 提出的 Rex-Thinker 将逻辑推理链引入视觉指代检测,通过分步推理与证据验证提升检测准确率、可解释性及不确定性识别能力。

 推理 多模态 逻辑推理 模型开发

IDEA-CVR 提出 Rex-Thinker,将思维链机制引入视觉指代物体检测任务。模型能够围绕文本指令进行多跳推理,分步定位并验证相关视觉证据,而非直接输出检测结果。实验显示,该方法在权威测评中提升了检测准确率,同时增强了推理过程的可解释性。模型还具备一定的认知边界判断能力,可对证据不足或无法确定的情况作出更可靠的响应。

用途与启示
  • 为指代检测、视觉问答等任务提供显式多跳推理范式
  • 利用可追踪的证据链提升视觉模型的可解释性与可验证性
  • 为构建能够识别不确定性、避免盲目作答的多模态系统提供参考
  • 可通过开源代码与在线 Demo 复现并评估模型能力
📝 原始笔记(逐字保留)
2025-07-01 11:06:31 Tuesday | 会“思考”的目标检测模型来了!IDEA提出Rex-Thinker:基于思维链的指代物体检测模型,准确率+可解释性双突破https://mp.weixin.qq.com/s/I0YU0lkrkJ7_bNLdYdY72w IDEA 提出全新解决方案 Rex-Thinker ,首次将人类思维中的 “逻辑推理链” 引入视觉指代任务,让 AI 像人一样分步思考、验证证据,在权威测评中不仅准确率显著提升,更展现出强大的 “知之为知之” 能力! 项目主页: https://rexthinker.github.io/
 在线 Demo: https://huggingface.co/spaces/Mountchicken/Rex-Thinker Demo
论文地址: https://arxiv.org/abs/2506.04034 开源代码:https://github.com/IDEA-Research/Rex-Thinker 投稿人:Qing Jiang 投稿团队:IDEA-CVR ## 多跳推理

ASTRO:通过上下文反思与回溯训练语言模型推理

ASTRO 将蒙特卡洛树搜索轨迹转化为包含反思、回溯和探索的自然语言思维链,结合微调与强化学习增强非推理模型的数学推理能力。

 推理 强化学习 数据合成 模型训练 逻辑推理

ASTRO(Autoregressive Search-Teach Reasoner)旨在让语言模型像搜索算法一样推理,并在输出中显式执行自我反思、回溯与探索。该框架从蒙特卡洛树搜索生成数学解题轨迹,再将其转换为能够描述成功路径及失败恢复过程的自然语言思维链。模型首先在这些搜索轨迹上微调,随后利用可验证奖励进行强化学习,使搜索先验能够指导探索。应用于 Llama 3 系列后,ASTRO 在 MATH-500、AMC 2023 和 AIME 2024 上分别取得 16.0、26.9 和 20.0 个百分点的绝对提升,尤其有利于需要迭代修正的难题。

用途与启示
  • 为普通开源语言模型注入结构化搜索能力,无需依赖已有的强推理模型作为起点。
  • 展示如何把 MCTS 的成功、失败与回溯轨迹转化为可用于监督微调的合成推理数据。
  • 说明搜索先验与可验证奖励强化学习相结合,可显著改善复杂数学问题中的探索和纠错能力。
  • 为训练具备显式自我反思与错误恢复机制的推理模型提供可复用框架。
📝 原始笔记(逐字保留)
2025-07-02 17:18:21 Wednesday | **[ASTRO:通过在上下文中反射和回溯来教语言模型进行推理](https://papers.cool/arxiv/2507.00417)** **[PDF(3)]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Joongwon Kim](https://arxiv.org/search/?searchtype=author&query=Joongwon%20Kim), [Anirudh Goyal](https://arxiv.org/search/?searchtype=author&query=Anirudh%20Goyal), [Liang Tan](https://arxiv.org/search/?searchtype=author&query=Liang%20Tan), [Hannaneh Hajishirzi](https://arxiv.org/search/?searchtype=author&query=Hannaneh%20Hajishirzi), [Srinivasan Iyer](https://arxiv.org/search/?searchtype=author&query=Srinivasan%20Iyer), [Tianlu Wang](https://arxiv.org/search/?searchtype=author&query=Tianlu%20Wang) 我们介绍了 ASTRO,即“Autoregressive Search-Teach Reasoner”,这是一个用于训练语言模型像搜索算法一样进行推理的框架,在其输出中明确利用自我反思、回溯和探索。最近,通过强化学习 (RL) 训练大型语言模型 (LLM) 导致了推理能力大大增强的推理模型的出现。推理模型的开源复制虽然成功,但建立在已经表现出强大推理能力的模型以及甚至在 RL 之前观察到的搜索行为之上。因此,目前尚不清楚如何提高包括 Llama 3 在内的其他非推理模型的推理能力。ASTRO 通过源自 Monte Carlo Tree Search (MCTS) 的数学问题解决轨迹的合成数据集,教导此类模型内化结构化搜索行为。通过将搜索跟踪转换为自然语言思维链,以捕获成功并从失败中恢复,ASTRO 在 RL 期间使用丰富的先验来引导模型以进行探索。我们在这些搜索衍生的跟踪上微调我们的模型,并通过 RL 进一步提高性能,并提供可验证的奖励。我们将 ASTRO 应用于 Llama 3 系列模型,并在 MATH-500 上实现了 16.0% 的绝对性能提升,在 AMC 2023 上实现了 26.9% 的绝对性能提升,在 AIME 2024 上实现了 20.0% 的绝对性能提升,特别是对需要迭代修正的具有挑战性的问题进行了改进。我们的结果表明,搜索启发式训练提供了一种原则性的方法,可以将强大的推理能力灌输到开放式 LLM 中。 **科目** : **[人工智能](https://papers.cool/arxiv/cs.AI)** , [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-07-01 04:10:15 UTC ### 自我反思

MAPS:通过自动提示与多层自我反思增强大模型多步数学推理

MAPS 框架结合思维链、错误驱动的多层自我反思和自动提示,使通用大模型在控制推理成本的同时提升多步数学推理能力。

 推理 逻辑推理 人工智能框架 自进化

MAPS 首先通过思维链提示生成数学问题的初始解答,并在检测到错误后启动自适应自我反思。框架会分析错误并自动生成定制提示,引导模型逐层修正和优化推理过程。在多个大模型和四项成熟基准上的实验中,MAPS 明显优于标准 CoT,并使通用模型达到接近专用推理模型的表现。考虑到反思层数增加会带来更多 token 消耗,MAPS 通过限制反思深度平衡准确率与成本。

用途与启示
  • 为通用大模型提供无需专门推理训练的多步数学推理增强方案
  • 利用错误分析和动态提示替代静态提示,提高推理纠错能力
  • 在部署时可通过调节反思深度权衡准确率、延迟与 token 成本
  • 可为自动化推理、自我修正智能体及测试时计算扩展提供参考
📝 原始笔记(逐字保留)
2025-07-01 11:56:33 Tuesday | **[通过具有自动提示的多层自我反射在大型语言模型中推进多步骤数学推理](https://papers.cool/arxiv/2506.23888)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [André de Souza Loureiro](https://arxiv.org/search/?searchtype=author&query=Andr%C3%A9%20de%20Souza%20Loureiro), [Jorge Valverde-Rebaza](https://arxiv.org/search/?searchtype=author&query=Jorge%20Valverde-Rebaza), [Julieta Noguez](https://arxiv.org/search/?searchtype=author&query=Julieta%20Noguez), [David Escarcega](https://arxiv.org/search/?searchtype=author&query=David%20Escarcega), [Ricardo Marcacini](https://arxiv.org/search/?searchtype=author&query=Ricardo%20Marcacini) 大型语言模型 (LLM) 的最新进展显著提高了其解决问题的能力。然而,这些模型在面对复杂的多步骤推理任务时仍然很挣扎。在本文中,我们提出了带有自动提示的多层自我反思 (MAPS) 框架,这是一种新颖的方法,旨在通过集成思维链 (CoT)、自我反思和自动提示等技术来增强 LLM 中的多步数学推理。与传统的静态提示方法不同,MAPS 采用迭代优化过程。最初,该模型使用 CoT 提示生成解决方案。当检测到错误时,自适应自我反射机制会识别并分析它们,生成定制的提示来指导纠正。这些动态调整的提示使模型能够迭代地优化其推理。跨多个 LLM 的四个成熟基准的实验表明,MAPS 的性能明显优于标准 CoT,并通过推理优化的模型获得有竞争力的结果。此外,MAPS 使通用 LLM 能够达到与专用推理模型相当的性能水平。虽然更深的反射层可以提高准确性,但它们也会增加代币的使用和成本。为了平衡这种权衡,MAPS 战略性地限制了反射深度,从而确保在成本和推理性能之间取得最佳平衡。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** ### 自我批判

HRM:无需预训练或 CoT 数据的分层推理模型

Sapient Intelligence 提出的分层推理模型 HRM 以双层循环架构实现高计算深度,无需预训练、CoT 数据或中间过程监督,便在复杂数独和大型迷宫等任务上取得近乎完美的表现。

 推理 模型开发 任务规划 逻辑推理

Sapient Intelligence 的研究者受人脑分层处理与多时间尺度机制启发,提出了分层推理模型(HRM)。该模型包含两个相互依赖的循环模块:高级模块负责缓慢、抽象的规划,低级模块负责快速、细致的计算。HRM 可在单次前向传递中执行顺序推理,并在无需显式监督中间过程的情况下保持训练稳定性和计算效率。实验显示,它在复杂数独求解和大型迷宫最优路径搜索等挑战性任务上取得了近乎完美的性能。

用途与启示
  • 为无需 CoT 标注和过程监督的深度推理提供新架构思路
  • 通过多时间尺度模块分工兼顾全局规划与局部计算
  • 可用于数独、迷宫寻路及其他需要长程规划的组合推理任务
  • 展示循环计算架构替代显式长推理链的潜力
📝 原始笔记(逐字保留)
1. 2025-07-01 11:12:26 Tuesday | https://mp.weixin.qq.com/s/PousJsp2TP7cTUTUwtf6ZA 该模型无需预训练或 CoT 数据即可运行,但在包括复杂数独谜题和大型迷宫中最优路径查找在内的挑战性任务上却取得了 **近乎完美的性能** 。 近日,受到人脑分层和多时间尺度处理机制启发,来自 Sapient Intelligence 的研究者提出了分层推理模型(HRM),这是一种全新循环架构,能够在保持训练稳定性和效率的同时,实现高计算深度。 具体来说,HRM 通过两个相互依赖的循环模块,在单次前向传递中执行顺序推理任务,而无需对中间过程进行明确的监督:其中一个高级模块负责缓慢、抽象的规划,另一个低级模块负责处理快速、细致的计算。 论文:Hierarchical Reasoning Model 论文链接:https://arxiv.org/abs/2506.21734

数学推理训练能否提升 LLM 的通用能力?推理能力的可转移性研究

对二十余个开放权重模型及 Qwen3-14B 的对照实验表明,数学能力增益通常难以跨领域迁移,而强化学习比监督微调更能保留通用能力。

 推理 强化学习 模型训练 模型评估 人工智能

研究评估了二十余个开放权重推理模型在数学、科学问答、智能体规划、编程和指令遵循等任务上的表现,发现多数模型的数学能力提升并未迁移到其他领域。作者进一步仅使用数学数据,以不同方法对 Qwen3-14B 进行对照训练。结果显示,强化学习调整具有更好的跨领域泛化能力,而监督微调容易导致模型遗忘原有的通用功能。潜在表示与输出分布分析表明,SFT 会引发显著漂移,RL 则更能保留一般领域结构。

用途与启示
  • 评估数学推理成绩是否真正代表模型通用问题解决能力。
  • 为推理模型训练方法选择提供依据:相比依赖蒸馏数据的 SFT,可优先探索更能保持基础能力的 RL 方案。
  • 提醒研究者使用科学问答、规划、编程和指令遵循等跨领域任务检验推理能力的可迁移性。
  • 推动重新设计训练后流程,减少能力遗忘与表示分布漂移。
📝 原始笔记(逐字保留)
2025-07-02 17:17:49 Wednesday | **[数学推理是否提高了一般 LLM 能力?理解 LLM 推理的可转移性](https://papers.cool/arxiv/2507.00432)** **[PDF(10)]** **[Copy]** **[Kimi(9)]** **[REL]** **Authors** : [Maggie Huan](https://arxiv.org/search/?searchtype=author&query=Maggie%20Huan), [Yuetai Li](https://arxiv.org/search/?searchtype=author&query=Yuetai%20Li), [Tuney Zheng](https://arxiv.org/search/?searchtype=author&query=Tuney%20Zheng), [Xiaoyu Xu](https://arxiv.org/search/?searchtype=author&query=Xiaoyu%20Xu), [Seungone Kim](https://arxiv.org/search/?searchtype=author&query=Seungone%20Kim), [Minxin Du](https://arxiv.org/search/?searchtype=author&query=Minxin%20Du), [Radha Poovendran](https://arxiv.org/search/?searchtype=author&query=Radha%20Poovendran), [Graham Neubig](https://arxiv.org/search/?searchtype=author&query=Graham%20Neubig), [Xiang Yue](https://arxiv.org/search/?searchtype=author&query=Xiang%20Yue) 数学推理已成为大型语言模型 (LLM) 进步的典型代表,新模型在 MATH 和 AIME 等基准测试中迅速超越了人类水平的性能。但是,随着数学排行榜每周都在提高,值得一问的是:这些收益是反映了更广泛的问题解决能力,还是仅仅反映了狭窄的过拟合?为了回答这个问题,我们评估了 20 多个 open-weight 推理调整模型,涉及广泛的任务,包括数学、科学 QA、代理规划、编码和标准指令跟踪。我们令人惊讶地发现,大多数在数学上取得成功的模型都无法将其收益转移到其他领域。为了严格研究这种现象,我们使用纯数学数据但使用不同的调整方法对 Qwen3-14B 模型进行了对照实验。我们发现,强化学习 (RL) 调整的模型在各个领域中具有良好的泛化能力,而监督微调 (SFT) 调整的模型经常忘记一般功能。潜在空间表示和标记空间分布偏移分析表明,SFT 诱导了大量表示和输出漂移,而 RL 保留了一般域结构。我们的结果表明,需要重新思考标准的训练后配方,特别是依赖 SFT 提炼数据来推进推理模型。 **科目** : **[人工智能](https://papers.cool/arxiv/cs.AI)** , [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-07-01 05:23:05 UTC

面向低资源大模型任务的可迁移提示与对齐策略

该研究结合知识对齐、软提示调优和轻量级适配模块,提升大语言模型在低资源跨语言任务中的迁移性能与训练稳定性。

 推理 模型训练 数据合成 人工智能

论文提出一个面向低资源语言与任务的统一迁移框架,将知识转移模块和参数高效微调策略结合起来。该方法利用知识对齐损失、软提示调优、参数冻结与提示注入,在保留模型通用知识的同时学习目标语言或任务的结构特征。研究还通过稳定性分析和合成伪数据迁移实验,评估其在数据稀缺条件下的适用性与稳健性。在 MLQA、XQuAD 和 PAWS-X 等跨语言基准上,该框架相较多语言预训练模型及主流迁移方法取得了更好的性能和稳定性。

用途与启示
  • 为标注数据极少的跨语言问答、释义识别和语义推理任务提供低成本适配方案
  • 通过知识对齐与软提示减少全参数微调需求,降低训练资源消耗
  • 利用冻结策略保留基础模型能力,缓解低资源微调中的灾难性遗忘
  • 可结合合成伪数据进一步扩充监督信号,提高小语种及新任务的迁移效果
📝 原始笔记(逐字保留)
2. 2025-07-02 17:14:08 Wednesday | **[用于低资源量 LLM 任务的可转移建模策略:一种基于提示和对齐的建模策略](https://papers.cool/arxiv/2507.00601)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Shuangquan Lyu](https://arxiv.org/search/?searchtype=author&query=Shuangquan%20Lyu), [Yingnan Deng](https://arxiv.org/search/?searchtype=author&query=Yingnan%20Deng), [Guiran Liu](https://arxiv.org/search/?searchtype=author&query=Guiran%20Liu), [Zhen Qi](https://arxiv.org/search/?searchtype=author&query=Zhen%20Qi), [Ruotong Wang](https://arxiv.org/search/?searchtype=author&query=Ruotong%20Wang) 本文解决了大型语言模型在低资源语言场景中的有限迁移和适应能力。它提出了一个统一的框架,将知识转移模块与参数高效的微调策略相结合。该方法引入了知识对齐损失和软提示调优,以指导模型在最小标注下有效吸收目标语言或任务的结构特征。这增强了泛化性能和训练稳定性。该框架包括轻量级适配模块,以降低计算成本。在训练期间,它集成了冻结策略和提示注入,以保留模型的原始知识,同时能够快速适应新任务。该研究还进行了稳定性分析实验和合成伪数据传输实验,以系统评估该方法在不同低资源任务中的适用性和稳健性。实验结果表明,与现有的多语言预训练模型和主流迁移方法相比,所提出的方法在 MLQA、XQuAD 和 PAWS-X 等跨语言任务上实现了更高的性能和稳定性。它在数据极其稀缺的条件下表现出特别强大的优势。所提出的方法具有很强的通用性和可扩展性。它增强了特定于任务的适应性,同时保留了大型语言模型的一般功能。这使得它非常适合复杂的语义建模和多语言处理任务。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** **发布** : 2025-07-01 09:34:49 UTC

PromptAug:使用数据增强进行精细冲突分类

PromptAug 利用大语言模型生成敏感冲突文本,在数据稀缺条件下提升冲突与情感分类的准确率和 F1,并系统分析合成数据的质量缺陷。

 数据合成 数据工程 模型训练 模型评估

PromptAug 是一种面向精细冲突分类的 LLM 文本数据增强方法,旨在缓解高质量敏感标注数据稀缺及平台数据访问受限的问题。该方法针对模型安全护栏难以生成冒犯性内容的挑战设计提示,在冲突和情感数据集上将准确率与 F1 提升约 2%。研究通过极端数据稀缺实验、定量多样性分析和定性主题分析,与其他增强方法进行了系统比较。分析发现,合成文本仍存在语言流畅性不足、幽默含义模糊、增强内容歧义和语义误解四类问题。

用途与启示
  • 为冲突检测、仇恨言论识别等敏感任务低成本补充训练数据。
  • 说明 LLM 数据增强在极端小样本场景中能够带来稳定收益。
  • 提醒研究者不能仅依据分类指标评价合成数据,还应结合多样性和人工主题分析。
  • 可将识别出的四类错误模式用于优化提示、过滤规则与合成数据质量评估流程。
📝 原始笔记(逐字保留)
2025-07-01 12:33:28 Tuesday | **[PromptAug:使用数据增强进行精细冲突分类](https://papers.cool/arxiv/2506.22491)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Oliver Warke](https://arxiv.org/search/?searchtype=author&query=Oliver%20Warke), [Joemon M. Jose](https://arxiv.org/search/?searchtype=author&query=Joemon%20M.%20Jose), [Faegheh Hasibi](https://arxiv.org/search/?searchtype=author&query=Faegheh%20Hasibi), [Jan Breitsohl](https://arxiv.org/search/?searchtype=author&query=Jan%20Breitsohl) 鉴于社交媒体上冲突的增加,有效的分类模型来检测有害行为至关重要。遵循 garbage-in-garbage-out 格言,机器学习性能在很大程度上取决于训练数据质量。然而,高质量的标记数据,特别是对于识别冲突行为等细微差别的任务,是有限的、昂贵的,而且难以获得。此外,随着社交媒体平台越来越多地限制对研究数据的访问,文本数据增强作为生成训练数据的替代方案越来越受到关注。由于大型语言模型 (LLM) 护栏会阻止生成冒犯性内容,因此增强与冲突相关的数据带来了独特的挑战。本文介绍了 PromptAug,这是一种基于 LLM 的创新数据增强方法。PromptAug 在冲突和情感数据集的准确性和 F1 分数方面实现了 2% 的统计显着改进。为了彻底评估 PromptAug 与其他数据增强方法,我们 **使用极端数据稀缺情景、定量多样性分析和定性主题分析进行了稳健评估** 。主题分析确定了增强文本中的四种有问题的模式:语言流动性、幽默歧义、增强内容歧义和增强内容误解。总体而言,这项工作将 PromptAug 作为一种在冲突检测等敏感任务中增加数据的有效方法,提供了一种基于自然语言处理和社会科学方法的独特跨学科评估。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算机与社会](https://papers.cool/arxiv/cs.CY)

百度文心大模型 4.5 系列正式开源并提供 API 服务

百度正式开源文心大模型 4.5 系列,并同步提供 API 服务及技术报告。

 模型开发 人工智能 人工智能应用

百度官宣文心大模型 4.5 系列正式开源,进一步开放其核心模型能力。开发者除可获取开源模型外,还能通过 API 服务快速接入文心大模型。官方同步发布了 ERNIE 技术报告,介绍模型相关技术与能力。此次发布有助于降低企业和开发者使用国产大模型的门槛。

用途与启示
  • 为开发者提供可自主部署和二次开发的国产开源大模型
  • 通过 API 服务支持应用快速集成与上线
  • 技术报告可用于了解 ERNIE 系列的模型设计与能力表现
📝 原始笔记(逐字保留)
5. 2025-07-01 11:23:45 Tuesday | 百度官宣文心大模型4.5系列正式开源,还同步提供API服务 https://mp.weixin.qq.com/s/jG0R66Uq_6kFwajb7XKM3w 报告地址:https://yiyan.baidu.com/blog/publication/ERNIE_Technical_Report.pdf

华为开源盘古 Embedded 7B 与盘古 Pro MoE 72B 模型

华为正式开源盘古 Embedded 7B 稠密模型、盘古 Pro MoE 72B 混合专家模型及昇腾原生高性能推理技术。

 模型开发 人工智能 推理 模型训练 系统优化

华为宣布开源盘古 Embedded 70 亿参数稠密模型,以及盘古 Pro MoE 720 亿参数混合专家模型。模型面向昇腾平台进行原生适配,并同步开放相关模型推理技术。其核心技术包括分组混合专家 MoGE 算法、自适应快慢思考合一机制,以及覆盖全链路的高性能推理系统优化。

用途与启示
  • 为昇腾生态提供可直接研究、适配和部署的开源基础模型
  • 借助 MoGE 架构探索大规模混合专家模型的训练与推理效率优化
  • 为统一快速响应与深度推理能力提供新的模型设计参考
  • 推动国产算力平台上的大模型工程化与高性能部署
📝 原始笔记(逐字保留)
9. 2025-07-01 10:44:45 Tuesday | 华为正式宣布开源盘古 70 亿参数的稠密模型「 **盘古 Embedded** 」、盘古 Pro MoE 720 亿参数的混合专家模型(参见机器之心报道:[华为盘古首次露出,昇腾原生72B MoE架构,SuperCLUE千亿内模型并列国内第一](https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650971050&idx=1&sn=93a499f2a2bcb83302ad201b8d193bda&scene=142#wechat_redirect) )和基于昇腾的模型推理技术。 开源链接:https://gitcode.com/ascend-tribe https://mp.weixin.qq.com/s/v1NNVaH9oDufqkrkyVLnVw 更重要的是,这些模型采用了一些领先的技术来实现高效的训练和推理,比如分组混合专家 MoGE 算法、自适应快慢思考合一以及全链路的高性能推理系统优化。

Black Forest Labs 开源图像编辑模型 FLUX.1 Kontext[dev]

Black Forest Labs 开源旗舰图像模型 FLUX.1 Kontext[dev],主打图像编辑并支持在消费级芯片上运行。

 模型开发 多模态 人工智能应用

Black Forest Labs 宣布开源旗舰图像模型 FLUX.1 Kontext[dev]。该模型专为图像编辑场景打造,可基于上下文对图像进行修改。其运行门槛较低,能够直接部署在消费级芯片上。

用途与启示
  • 用于本地化图像编辑、内容创作与视觉应用开发
  • 降低高性能图像生成和编辑模型的部署门槛
  • 为消费级硬件上的多模态模型应用提供新选择
📝 原始笔记(逐字保留)
2025-07-01 11:20:23 Tuesday |Black Forest Labs刚刚宣布开源旗舰图像模型 **FLUX.1 Kontext[dev]** ,专为图像编辑打造,还能直接在消费级芯片上运行。 https://mp.weixin.qq.com/s/Cu-58gySRJ0-bWCwO8ViuQ

2025年AI现状报告:AI构建者手册

ICONIQ发布《The AI Builders Playbook 2025》,梳理2025年AI行业现状及AI产品建设趋势。

 人工智能 人工智能应用

ICONIQ发布了《The AI Builders Playbook 2025》,聚焦2025年AI行业现状与产品建设实践。报告从AI构建者视角总结市场发展和落地趋势,可用于了解行业阶段性变化。原文由微信公众号转载或解读,并附有完整报告PDF链接。

用途与启示
  • 跟踪2025年AI行业与产品落地趋势
  • 为AI产品规划、市场分析和战略决策提供参考
  • 了解AI构建者面临的机会与实践方向
📝 原始笔记(逐字保留)
2. 2025-07-01 11:35:41 Tuesday | 2025年AI现状报告 https://mp.weixin.qq.com/s/XKHqP-dDIaK0ny8iIJK9aA 报告链接:https://cdn.prod.website-files.com/65d0d38fc4ec8ce8a8921654/685ac42fd2ed80e09b44e889_ICONIQ%20Analytics_Insights_The_AI_Builders_Playbook_2025.pdf

7万个模型、1600万开发者:魔搭已建成中国最大AI开源社区

魔搭社区已汇聚约7万个模型和1600万开发者,成为中国规模最大的AI开源社区。

 人工智能 智能体工具

魔搭社区已汇聚约7万个AI模型,覆盖多种任务与应用场景。平台注册开发者达到1600万,形成了较大规模的模型共享与开发生态。其发展表明,中国AI开源基础设施正从模型托管平台逐步演变为连接模型、工具和开发者的综合社区。

用途与启示
  • 为开发者提供集中获取、体验和复用开源模型的平台
  • 降低AI模型开发与应用落地的门槛
  • 展示中国本土AI开源生态的规模化发展趋势
📝 原始笔记(逐字保留)
3. 2025-07-01 11:30:31 Tuesday | 7万个模型、1600万开发者,魔搭已建成中国最大AI开源社区 https://mp.weixin.qq.com/s/nAa4WcjcQz93neQHuMvo6w

真·全民 AI 健康管家来了!实测蚂蚁 AQ

蚂蚁推出 AI 健康管家 AQ,可通过连续追问、药品识别和皮肤图像分析提供健康服务,并连接医院及智能硬件。

 人工智能 人工智能应用 多模态

蚂蚁 AQ 定位为面向大众的 AI 健康管家,支持围绕健康问题进行连续追问。用户可借助图像能力识别药品、初步了解皮肤问题,降低获取健康信息的门槛。该产品还能连接医院服务与健康硬件,将咨询、就医和健康数据管理串联起来。相关能力主要用于健康辅助,不应替代专业医生的诊断与治疗。

用途与启示
  • 展示大模型在大众健康咨询与多模态识别场景中的产品化路径
  • 通过连接医院和智能硬件,探索 AI 健康服务闭环
  • 医疗应用需重点关注诊断边界、隐私保护与信息准确性
📝 原始笔记(逐字保留)
4. 2025-07-01 11:25:06 Tuesday|真·全民AI健康管家来了!实测蚂蚁AQ:追问识药看皮肤,还能连医院接硬件 https://mp.weixin.qq.com/s/FufBkoQv5Csk9FiG3-GaTQ

微软推出长视频探索智能体 Deep Video Discovery

微软提出 Deep Video Discovery 智能体,通过视频分段、自主规划和工具调用逐步检索信息,在多个长视频理解基准上取得领先成绩。

 智能体 多模态 智能体工具 任务规划 推理

Deep Video Discovery(DVD)将长视频切分为较短片段,并把这些片段构成的内容空间视为智能体可探索的环境。系统利用大语言模型理解问题、开展推理并自主制定搜索计划。智能体能够选择合适的工具及调用参数,从视频环境中逐步获取证据,最终生成答案。该方法在多个长视频理解基准上取得领先表现。

用途与启示
  • 为长视频问答和内容检索提供可扩展的智能体方案。
  • 展示将复杂多模态任务转化为环境探索与工具调用过程的可行性。
  • 可用于视频档案分析、影视内容检索、教育视频问答及监控视频理解。
📝 原始笔记(逐字保留)
2025-07-01 10:46:19 Tuesday | 微软推出深度视频探索智能体,登顶多个长视频理解基准 https://mp.weixin.qq.com/s/zIl8FSqWXbdwOaMPAR1uUA * 论文标题:Deep Video Discovery : Agentic Search with Tool Use for Long-form Video Understanding * 论文链接:https://arxiv.org/pdf/2505.18079 本文提出了一种新颖的智能体 Deep Video Discovery (DVD),通过将长视频分割为更短的片段并将其视作环境,利用 LLM 先进的推理能力来思考问题并自主规划,选择具有适当参数的工具来从环境中逐步获取信息,最终回答问题。 ## 深度研究Deep Research #### [腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖](https://mp.weixin.qq.com/s/0-OS8FtVIGtFA5zVcX_W3w)

许多 LLM 比一个更实用:多智能体协作中的道德判断

研究发现,多智能体 LLM 经过群体讨论后更倾向于接受功利主义式的道德违规,但其行为转变机制与人类群体不同。

 智能体 博弈论 推理 模型评估 人工智能

论文比较了六种 LLM 在独立推理以及两人或三人多轮讨论条件下处理道德困境的表现。所有模型加入群体讨论后,都更容易接受通过直接伤害少数人来提升多数人总体效用的行为,呈现出类似人类群体审议的功利主义倾向。部分模型增强了对整体幸福最大化的支持,另一些模型则降低了对道德规范的遵从。尽管表面结果与人类相似,LLM 的变化主要来自规范敏感性下降或公正性增强,而人类更多是因为对决策结果更加敏感。

用途与启示
  • 为多智能体系统的对齐与安全评估提供群体道德行为方面的实证依据
  • 提醒开发者关注多轮协作可能放大道德违规倾向,而非默认群体讨论能够改善判断
  • 可用于设计同时衡量结果效用、规范遵从和公平性的智能体评估框架
  • 说明不能仅凭表面行为类比人类群体,还需分析模型决策变化背后的机制
📝 原始笔记(逐字保留)
5. 2025-07-02 15:38:17 Wednesday | **[许多 LLM 比一个更实用](https://papers.cool/arxiv/2507.00814)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Anita Keshmirian](https://arxiv.org/search/?searchtype=author&query=Anita%20Keshmirian), [Razan Baltaji](https://arxiv.org/search/?searchtype=author&query=Razan%20Baltaji), [Babak Hemmatian](https://arxiv.org/search/?searchtype=author&query=Babak%20Hemmatian), [Hadi Asghari](https://arxiv.org/search/?searchtype=author&query=Hadi%20Asghari), [Lav R. Varshney](https://arxiv.org/search/?searchtype=author&query=Lav%20R.%20Varshney) 道德判断是大型语言模型 (LLM) 对齐和社会推理不可或缺的一部分。随着多智能体系统越来越受到重视,与单个智能体相比,了解 LLM 在协作过程中的集体功能变得至关重要。在人类道德判断中, **群体审议导致功利主义的推动:一种支持违反规范的行为的倾向,这些行为尽管受到伤害,但也能使大多数人的利益最大化** 。我们研究了在多代理 LLM 系统中是否会出现类似的动态。我们在两个条件下测试了六个模型在一组公认的道德困境上:(1) 单人,模型独立推理,以及 (2) 小组,他们两人一组或三人组进行多轮讨论。在个人道德困境中,代理人必须决定直接伤害一个人以最大限度地为其他人效用,所有模型都发现,作为一个群体的一部分比个人更容易接受道德违规行为,类似于人体实验。一些模型支持使整体幸福感最大化的行动,即使它们使陌生人受益而不是熟悉的人。其他人变得更愿意在群体中违反道德规范。然而,虽然人类群体表现出类似的行动偏差,但他们的功利主义提升机制与 LLM 不同。人类的转变来自对决策结果的高度敏感,而 LLM 群体则表现出 **常态敏感性降低或公正性增强** 。这表明,虽然 LLM 集合的表面行为模仿了人类群体推理,但潜在的驱动因素不同。我们讨论了对 AI 对齐、多智能体设计和人工道德推理的影响。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算机与社会](https://papers.cool/arxiv/cs.CY) **发布** : 2025-07-01 14:46:16 UTC

L0:面向通用智能体的可扩展端到端强化学习训练系统

L0 通过沙盒化并发训练管道与 NB-Agent 脚手架,使语言模型仅依靠可验证奖励强化学习即可学习规划、搜索、验证和记忆能力。

 智能体 强化学习 模型训练 人工智能框架 任务规划 智能体记忆 自进化

L0 是一个面向通用智能体的低成本、可扩展端到端强化学习训练管道,通过沙盒化的并发工作线程降低复杂环境中的训练门槛。其 NB-Agent 脚手架采用“代码即行动”的 REPL 交互方式,并支持记忆管理、信息总结与自我反思。研究表明,基础模型仅通过具有可验证奖励的强化学习(RLVR),即可逐步掌握规划、搜索、验证和记忆等能力。在 Qwen2.5-7B-Instruct 上,L0 将 SimpleQA 准确率从 30% 提升至 80%,将 HotpotQA 准确率从 22% 提升至 41%,相关模型、训练管道和配方均已开源。

用途与启示
  • 为多轮、长视距智能体任务提供可扩展的端到端强化学习基础设施。
  • 说明 RLVR 无需复杂人工轨迹监督,也可能培养智能体的规划、搜索与验证能力。
  • NB-Agent 的记忆和反思机制可为研究可持续学习、自我改进型智能体提供参考。
  • 开源训练管道与配方便于复现,并可用于事实问答、工具调用及复杂推理任务。
📝 原始笔记(逐字保留)
3. 2025-07-01 12:00:40 Tuesday | ## RL ### RL+Agents+LLM 强强强组合!从「被动执行」到「自主进化」,AI决策迎来跃迁! https://mp.weixin.qq.com/s/tPH6rEjd9-cKWHzAxC6W6Q ### **[L0:强化学习成为 General Agent](https://papers.cool/arxiv/2506.23667)** **Authors** : [Junjie Zhang](https://arxiv.org/search/?searchtype=author&query=Junjie%20Zhang), [Jingyi Xi](https://arxiv.org/search/?searchtype=author&query=Jingyi%20Xi), [Zhuoyang Song](https://arxiv.org/search/?searchtype=author&query=Zhuoyang%20Song), [Junyu Lu](https://arxiv.org/search/?searchtype=author&query=Junyu%20Lu), [Yuhua Ke](https://arxiv.org/search/?searchtype=author&query=Yuhua%20Ke), [Ting Sun](https://arxiv.org/search/?searchtype=author&query=Ting%20Sun), [Yukun Yang](https://arxiv.org/search/?searchtype=author&query=Yukun%20Yang), [Jiaxing Zhang](https://arxiv.org/search/?searchtype=author&query=Jiaxing%20Zhang), [Songxin Zhang](https://arxiv.org/search/?searchtype=author&query=Songxin%20Zhang), [Zejian Xie](https://arxiv.org/search/?searchtype=author&query=Zejian%20Xie) 训练大型语言模型 (LLM) 作为多轮次、长视距任务的自主代理仍然是可扩展性和训练效率方面的重大挑战。为了解决这个问题,我们引入了 L-Zero (L0),这是一种 **适用于通用代理的可扩展端到端训练管道** 。L0 具有低成本、可扩展和沙盒化的并发代理工作线程池,降低了在复杂环境中应用强化学习的门槛。我们还介绍了 NB-Agent,这是 L0 中的代理脚手架,它通过 Read-Eval-Print-Loop (REPL) 以“代码即作”的方式运行。我们根据事实性问答基准评估 L0。我们的实验表明,基本模型可以仅使用具有可验证奖励的强化学习 (RLVR) 来培养强大的问题解决技能。在 Qwen2.5-7B-Instruct 模型上,我们的方法将 SimpleQA 的准确率从 30% 提高到 80%,将 HotpotQA 的准确率从 22 % 提高到 41%。我们已经开源了整个 L0 系统,包括我们的 L0 系列模型、NB-Agent、完整的训练管道以及 (https://github.com/cmriat/l0) 上的相应训练配方。 https://mp.weixin.qq.com/s/0kvYCLAJArY769IxGVD3UA 端到端Agent训练pipeline—— **L0系统** : * **智能体架构层面**提出了结构化智能体框架——NB-Agent,在经典”代码即行动” *(Code-as-Action)* 架构基础上进行扩展,使智能体能够操作记忆/上下文,从而获得类人类的记忆存储、信息总结与自我反思能力。 * **学习范式层面**探索了一个核心问题:是否可以仅通过RLVR范式,引导智能体从零开始,学会如何规划、搜索、验证与记忆,最终解决复杂的多轮推理任务? L0系统的框架、模型及训练集已 **全部开源** ,详细可见文末链接。 ### [Agent Lightning:使用强化学习训练任何 AI 代理](https://arxiv.org/abs/2508.03680) [#1](https://arxiv.org/abs/2508.03680)[Agent Lightning: Train ANY AI Agents with Reinforcement Learning](https://papers.cool/arxiv/2508.03680) Authors: [Xufang Luo](https://arxiv.org/search/?searchtype=author&query=Xufang%20Luo), [Yuge Zhang](https://arxiv.org/search/?searchtype=author&query=Yuge%20Zhang), [Zhiyuan He](https://arxiv.org/search/?searchtype=author&query=Zhiyuan%20He), [Zilong Wang](https://arxiv.org/search/?searchtype=author&query=Zilong%20Wang), [Siyun Zhao](https://arxiv.org/search/?searchtype=author&query=Siyun%20Zhao), [Dongsheng Li](https://arxiv.org/search/?searchtype=author&query=Dongsheng%20Li), [Luna K. Qiu](https://arxiv.org/search/?searchtype=author&query=Luna%20K.%20Qiu), [Yuqing Yang](https://arxiv.org/search/?searchtype=author&query=Yuqing%20Yang) 作者:罗旭方,张宇歌,何志远,王子龙,赵思云,李东升,邱露娜,杨玉清 We present Agent Lightning, a flexible and extensible framework that enables Reinforcement Learning (RL)-based training of Large Language Models (LLMs) for any AI agent. Unlike existing methods that tightly couple RL training with agent or rely on sequence concatenation with masking, Agent Lightning achieves complete decoupling between agent execution and training, allowing seamless integration with existing agents developed via diverse ways (e.g., using frameworks like LangChain, OpenAI Agents SDK, AutoGen, and building from scratch) with almost ZERO code modifications. By formulating agent execution as Markov decision process, we define an unified data interface and propose a hierarchical RL algorithm, LightningRL, which contains a credit assignment module, allowing us to decompose trajectories generated by ANY agents into training transition. This enables RL to handle complex interaction logic, such as multi-agent scenarios and dynamic workflows. For the system design, we introduce a Training-Agent Disaggregation architecture, and brings agent observability frameworks into agent runtime, providing a standardized agent finetuning interface. Experiments across text-to-SQL, retrieval-augmented generation, and math tool-use tasks demonstrate stable, continuous improvements, showcasing the framework's potential for real-world agent training and deployment. 我们提出了 Agent Lightning,一个灵活且可扩展的框架,支持基于强化学习(RL)对任何 AI 代理的 LLMs 进行训练。与现有方法将 RL 训练与代理紧密耦合或依赖序列拼接与掩码不同,Agent Lightning 实现了代理执行与训练的完全解耦,允许无缝集成通过多种方式开发的现有代理(例如使用 LangChain、OpenAI Agents SDK、AutoGen 等框架,或从零构建),几乎无需修改代码。通过将代理执行形式化为马尔可夫决策过程,我们定义了统一的数据接口,并提出了分层 RL 算法 LightningRL,其中包含信用分配模块,使我们能够将任何代理生成的轨迹分解为训练转换。这使得 RL 能够处理复杂的交互逻辑,如多代理场景和动态工作流。在系统设计方面,我们引入了训练代理分离架构,并将代理可观测性框架引入代理运行时,提供了标准化的代理微调接口。 在文本到 SQL、检索增强生成和数学工具使用任务中的实验展示了稳定且持续的改进,彰显了该框架在现实世界代理训练和部署中的潜力。 Subjects: [Artificial Intelligence](https://papers.cool/arxiv/cs.AI), [Machine Learning](https://papers.cool/arxiv/cs.LG) 主题:人工智能,机器学习 Publish: 2025-08-05 17:50:13 UTC** **发布时间:2025-08-05 17:50:13 UTC [闪电代理:用强化学习训练任何AI代理(21▲) ](https://huggingface.co/papers/2508.03680?utm_source=digest-papers&utm_medium=email&utm_campaign=2025-08-07) ## 智能体推理

推理腐蚀:推理语言模型成为公共产品博弈中的搭便车者

公共产品博弈实验表明,推理型大模型未必更善于维持多智能体合作,o1 系列甚至表现出明显的搭便车倾向。

 智能体 博弈论 推理 模型评估

研究将带有制度选择的公共产品博弈引入多智能体 LLM 系统,考察智能体是否愿意投入自身资源来奖励合作或惩罚背叛。实验观察到四类行为模式,包括持续合作、反复参与与退出、合作逐渐衰退以及始终执行固定策略。令人意外的是,o1 系列等推理模型较难维持合作,而部分传统 LLM 能稳定实现较高水平的集体协作。结果说明,推理能力的增强并不会自然转化为亲社会行为或长期协作能力。

用途与启示
  • 为多智能体系统的合作性、社会一致性与安全部署提供行为评估方法。
  • 提醒开发者不要将推理能力直接等同于协作能力,应单独训练和评估激励、惩罚及长期合作策略。
  • 可用于研究智能体在资源分配、制度选择和社会困境中的搭便车风险。
📝 原始笔记(逐字保留)
5. 2025-07-01 12:37:53 Tuesday | **[推理腐蚀:推理语言模型成为公共产品游戏中的搭便车者](https://papers.cool/arxiv/2506.23276)** **[PDF()]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [David Guzman Piedrahita](https://arxiv.org/search/?searchtype=author&query=David%20Guzman%20Piedrahita), [Yongjin Yang](https://arxiv.org/search/?searchtype=author&query=Yongjin%20Yang), [Mrinmaya Sachan](https://arxiv.org/search/?searchtype=author&query=Mrinmaya%20Sachan), [Giorgia Ramponi](https://arxiv.org/search/?searchtype=author&query=Giorgia%20Ramponi), [Bernhard Schölkopf](https://arxiv.org/search/?searchtype=author&query=Bernhard%20Sch%C3%B6lkopf), [Zhijing Jin](https://arxiv.org/search/?searchtype=author&query=Zhijing%20Jin) 随着大型语言模型 (LLM) 越来越多地部署为自主代理,了解它们的合作和社会机制变得越来越重要。特别是,LLM 如何平衡自身利益和集体福祉是确保一致性、稳健性和安全部署的关键挑战。在本文中,我们研究了多代理 LLM 系统中代价高昂的制裁挑战,其中代理必须决定是投入自己的资源来激励合作还是惩罚叛逃。为了研究这一点,我们从行为经济学中改编了一个具有制度选择的公共产品游戏,使我们能够观察不同的 LLM 如何在重复互动中驾驭社会困境。我们的分析揭示了模型之间的四种不同的行为模式:一些模型始终如一地建立和维持高水平的合作,另一些模型在参与和脱离参与之间波动,一些模型的合作行为随着时间的推移逐渐下降,而另一些模型则无论结果如何都严格遵循固定的策略。令人惊讶的是,我们发现推理 LLM,例如 o1 系列,在合作方面非常困难,而一些传统的 LLM 始终实现高水平的合作。这些发现表明,当前改进 LLM 的方法(侧重于增强其推理能力)不一定会导致合作,这为在需要持续协作的环境中部署 LLM 代理提供了有价值的见解。我们的代码可在 https://github.com/davidguzmanp/SanctSim ### 因果 #### [#53](https://arxiv.org/abs/2509.10401) [Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems](https://papers.cool/arxiv/2509.10401) #53 假设、行动、预测:为多智能体系统的自动故障归因构建因果推理支架 在多智能体系统中进行故障归因——精确定位导致决定性错误的具体步骤——是一个关键但尚未解决的挑战。现有方法将其视为对长对话日志的模式识别任务,导致步骤级准确率极低(低于 17%),使其在调试复杂系统时不切实际。它们的核心弱点在于无法进行稳健的反事实推理:判断如果纠正单个行为是否真的能够避免任务失败。为弥补这一反事实推理缺口,我们提出了 Abduct-Act-Predict (A2P) 支架,这是一个新颖的智能体框架,将故障归因从模式识别转变为结构化的因果推理任务。A2P 在一次推理过程中明确引导大语言模型完成形式化的三步推理流程:(1)溯因(Abduction),推断智能体行为背后的隐含根本原因;(2)行动(Action),定义最小的纠正性干预;(3)预测(Prediction),模拟随后轨迹并验证干预是否能解决故障。 这种结构化方法利用整个对话的整体上下文,同时对模型的分析施加严格的因果逻辑。我们在 Who&When 基准上的大量实验展示了其有效性。在算法生成的数据集上,A2P 在步骤级准确率上达到 47.46%,比基线的 16.67% 提高了 2.85 × 。在更复杂的人工构造数据集上,它在步骤准确率上达到 29.31%,比基线的 12.07% 提高了 2.43 × 。通过以因果视角重新构建问题,A2P 支架提供了一种稳健、可验证且显著更为准确的自动故障归因解决方案。 发布:2025-09-12 16:51:15 UTC ### 协作 #### 超越头脑风暴:是什么驱动高质量的科学创意?多智能体协作的启示 [#50](https://arxiv.org/abs/2508.04575)[Beyond Brainstorming: What Drives High-Quality Scientific Ideas? Lessons from Multi-Agent Collaboration](https://papers.cool/arxiv/2508.04575)

首创 Mid-training 范式破解 RL 奥秘,Llama 推理性能追平 Qwen

研究提出中期训练策略,将 Llama 改造为更适配强化学习的推理基础模型,显著缩小其与 Qwen 在 RL 扩展能力上的差距。

 模型训练 强化学习 推理 数据工程 人工智能

研究深入分析了 Llama 与 Qwen 等基础语言模型在强化学习训练中表现差异的成因。作者提出创新的中期训练(Mid-training)范式,在正式强化学习前增强模型的推理基础与 RL 适配性。该策略成功将 Llama 改造为更适合强化学习扩展的推理基础模型,显著缩小了其与 Qwen 的性能差距。项目已开源论文、代码、模型及相关数据资源。

用途与启示
  • 为基础模型在强化学习前的能力塑造提供新的训练阶段与技术路径
  • 说明 RL 效果不仅取决于强化学习算法,也受到基础模型预训练与中期训练特性的显著影响
  • 为 Llama 等模型构建高性能推理系统提供可复现的代码、模型和数据资源
  • 有助于研究不同模型家族在 RL 扩展能力上的差异及其可干预机制
📝 原始笔记(逐字保留)
2. 2025-07-01 10:59:44 Tuesday | 首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!**https://mp.weixin.qq.com/s/25wERcyTi79GOBpytujEWA** 深入探讨了不同基础语言模型家族(如 Llama 和 Qwen)在强化学习(RL)训练中迥异表现的背后原因,并提出创新性的中期训练(mid-training)策略,成功地将 Llama 模型改造成高度适配强化学习的推理基础模型,显著缩小了其与天生擅长 RL 扩展的 Qwen 模型之间的性能差距,为下一代 reasoning 能力 AI 系统的开发提供了关键的科学基础和技术路径。 论文链接:https://arxiv.org/abs/2506.20512 代码仓库:https://github.com/GAIR-NLP/OctoThinker 开源模型 & 数据:https://huggingface.co/OctoThinker

使用开放基准测试评估语言模型的陷阱

研究通过在公开测试集上直接微调小型语言模型,证明开放基准排行榜高分可能源于测试集泄漏,而非真实的泛化能力。

 模型评估 数据工程 人工智能

开放式语言模型基准 HELM、BIG-bench 虽有助于标准化比较和结果复现,但公开测试集也为针对性优化乃至“作弊”留下空间。研究者将较小版本的 BART、T5 和 GPT-2 直接在公共测试集上微调,使其在 HELM 排行榜中取得领先成绩。尽管这些模型泛化能力较差、实际用途有限,公开榜单却难以准确揭示这一缺陷。论文因此主张使用私有或动态基准补充公开评估,并重新审视现有语言模型评测体系。

用途与启示
  • 提醒研究者不要将开放排行榜成绩直接等同于模型的真实能力与实用价值。
  • 在评测流程中引入私有测试集、动态题目和污染检测,以降低测试集泄漏风险。
  • 建立同时考察泛化性、鲁棒性和现实任务表现的多维评估机制。
📝 原始笔记(逐字保留)
2025-07-02 17:15:15 Wednesday | **[使用开放基准测试评估语言模型的陷阱](https://papers.cool/arxiv/2507.00460)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Md. Najib Hasan](https://arxiv.org/search/?searchtype=author&query=Md.%20Najib%20Hasan), [Mohammad Fakhruddin Babar](https://arxiv.org/search/?searchtype=author&query=Mohammad%20Fakhruddin%20Babar), [Souvika Sarkar](https://arxiv.org/search/?searchtype=author&query=Souvika%20Sarkar), [Monowar Hasan](https://arxiv.org/search/?searchtype=author&query=Monowar%20Hasan), [Santu Karmaker](https://arxiv.org/search/?searchtype=author&query=Santu%20Karmaker) 开放式大型语言模型 (LLM) 基准测试(如 HELM 和 BIG-bench)提供标准化、透明的协议,有助于语言模型 (LM) 的公平比较、可重复性和迭代进步。然而,他们的开放性也带来了关键的和未被充分探索的陷阱。本研究通过系统构建“作弊”模型来揭示这些弱点——BART、T5 和 GPT-2 的较小变体直接在公共测试集上进行微调——尽管泛化性差且实际实用性有限,但在突出的开放、整体基准 (HELM) 上获得最高排名。我们的研究结果强调了三个关键见解:\ca 在开放基准测试中的高排行榜表现可能并不总是反映现实世界的有效性;\cb 私人或动态基准必须与公开评估相辅相成,以维护诚信;以及 \cc 对当前基准实践进行根本性的重新评估对于确保稳健和值得信赖的 LM 评估至关重要。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** **发布** : 2025-07-01 06:17:48 UTC ## 评估可靠性

垃圾输入,推理输出?为何基准分数不可靠及如何应对

研究系统审计三项常用推理基准,发现数据缺陷、评分偏差和输入敏感性会使高分无法真实反映大模型的推理能力。

 模型评估 推理 数据工程 逻辑推理

研究审计了 SocialIQa、FauxPas-EAI 和 ToMi 三个推理基准,并使用 GPT-3、GPT-3.5、GPT-4、o1 和 LLaMA 3.1 进行诊断。结果揭示了重复题目、歧义措辞、不可信答案等结构、语义和语用问题,同时指出现有评分程序往往更关注输出格式而非推理过程。人工清理和重新评估表明,模型分数变化通常源于表面措辞、上下文可用性及格式线索,而不代表推理能力真正提升。作者据此质疑仅凭静态基准分数判断模型推理能力的有效性,并发布了审计数据与评估工具以支持更具解释性和诊断性的评估。

用途与启示
  • 在发布模型推理能力结论前,对基准数据的重复、歧义、答案合理性和格式偏差进行系统审计。
  • 通过措辞扰动、上下文增删和人工标注测试模型表现的稳定性,避免把格式匹配误判为推理。
  • 将评估重点从静态答案选择转向模型如何依据可用信息形成推断的过程。
  • 为构建更可靠、可解释且具有诊断价值的推理评估协议提供参考。
📝 原始笔记(逐字保留)
4. 2025-07-01 11:57:21 Tuesday | **[垃圾输入,推理出来?为什么基准测试分数不可靠以及如何应对](https://papers.cool/arxiv/2506.23864)** **[PDF(2)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Seyed Mahed Mousavi](https://arxiv.org/search/?searchtype=author&query=Seyed%20Mahed%20Mousavi), [Edoardo Cecchinato](https://arxiv.org/search/?searchtype=author&query=Edoardo%20Cecchinato), [Lucia Hornikova](https://arxiv.org/search/?searchtype=author&query=Lucia%20Hornikova), [Giuseppe Riccardi](https://arxiv.org/search/?searchtype=author&query=Giuseppe%20Riccardi) 我们对三个广泛使用的推理基准 SocialIQa、FauxPas-EAI 和 ToMi 进行了系统审计,并发现了基准项目和评估方法中普遍存在的缺陷。使用五个 LLM(GPT-{3、3.5、4、o1} 和 LLaMA 3.1)作为诊断工具,我们确定了基准设计中的结构、语义和语用问题(例如,重复的项目、模棱两可的措辞和难以置信的答案),以及优先考虑输出形式而不是推理过程的评分程序。通过对清理后的基准子集进行系统的人工注释和重新评估,我们发现模型分数的提高通常不是由于不稳定的表面措辞变化,也不是由于推理的改进。事实上,进一步的分析表明,模型性能对微小的输入变化(如上下文可用性和措辞)高度敏感,这表明高分可能反映了与特定格式线索的一致性,而不是基于输入的一致推理。这些发现挑战了当前基于 LLM 中推理的基于基准的声明的有效性,并强调了评估协议的必要性,这些协议将推理评估为从可用信息中提取推理的过程,而不是静态输出选择。我们发布了经过审计的数据和评估工具,以支持对模型推理进行更具可解释性和诊断性的评估。

MMReason:面向 AGI 的开放式多模态多步骤推理基准

MMReason 通过开放式高难度问题、逐步解答标注和三元评分机制,更全面地评估多模态大模型的长链推理能力。

 模型评估 多模态 推理 逻辑推理 数据工程

MMReason 是一个面向多模态大语言模型的开放式、多步骤推理基准,覆盖 6 个学科以及从大学预科到竞赛级别的多种难度。研究者将问题改写为开放式形式,并利用多模型投票过滤容易通过猜测或记忆解决的样本。基准为问题提供详细的分步解答,并设计基于参考答案的三元评分机制,以评估模型的中间推理步骤。作者还使用该基准测试了多种主流 MLLM,并分析了其长链推理能力与不足。

用途与启示
  • 用于更可靠地衡量 MLLM 的长链、多步骤推理能力,而非仅检查最终答案。
  • 开放式问题与多模型过滤可减少选择题猜测、训练数据记忆等评测捷径。
  • 逐步标注和中间过程评分有助于定位模型推理链中的具体错误。
  • 可作为多模态推理模型训练、评测及能力对比的标准化资源。
📝 原始笔记(逐字保留)
7. 2025-07-01 12:37:06 Tuesday | **[MMReason:面向 AGI 的 MLLM 的开放式多模态多步骤推理基准](https://papers.cool/arxiv/2506.23563)** **[PDF()]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Huanjin Yao](https://arxiv.org/search/?searchtype=author&query=Huanjin%20Yao), [Jiaxing Huang](https://arxiv.org/search/?searchtype=author&query=Jiaxing%20Huang), [Yawen Qiu](https://arxiv.org/search/?searchtype=author&query=Yawen%20Qiu), [Michael K. Chen](https://arxiv.org/search/?searchtype=author&query=Michael%20K.%20Chen), [Wenzheng Liu](https://arxiv.org/search/?searchtype=author&query=Wenzheng%20Liu), [Wei Zhang](https://arxiv.org/search/?searchtype=author&query=Wei%20Zhang), [Wenjie Zeng](https://arxiv.org/search/?searchtype=author&query=Wenjie%20Zeng), [Xikun Zhang](https://arxiv.org/search/?searchtype=author&query=Xikun%20Zhang), [Jingyi Zhang](https://arxiv.org/search/?searchtype=author&query=Jingyi%20Zhang), [Yuxin Song](https://arxiv.org/search/?searchtype=author&query=Yuxin%20Song), [Wenhao Wu](https://arxiv.org/search/?searchtype=author&query=Wenhao%20Wu), [Dacheng Tao](https://arxiv.org/search/?searchtype=author&query=Dacheng%20Tao) 推理在推动多模态大型语言模型 (MLLM) 向通用人工智能发展方面发挥着至关重要的作用。然而,现有的 MLLM 基准往往无法从三个关键方面精确、全面地评估长链推理能力:(1) 缺乏难度和多样性,(2) 易猜性和记忆力,(3) 对中间推理步骤的评估不足。为了填补这一空白,我们引入了 MMReason,这是一个新的基准测试,旨在通过多样化、开放式、具有挑战性的问题精确、全面地评估 MLLM 长链推理能力。首先,我们策划了具有挑战性的问题,需要从各个领域(即 6 个学科)和多个难度级别(即从大学预科到大学,从基础到竞赛级别)进行多步骤推理。其次,这些问题被重新表述为开放式格式,并使用多模型投票技术进行过滤,以消除与猜测和记忆相关的捷径情况,确保稳健的推理评估。第三,我们用详细的分步解决方案对问题进行注释,并设计一个基于参考的三元评分机制来可靠地评估中间推理步骤。通过 MMReason,我们对流行的领先 MLLM 进行基准测试,并对其推理能力进行深入分析。我们希望 MMReason 将成为推进 MLLM 推理研究的宝贵资源。代码将在 https://github.com/HJYao00/MMReason 上提供。 **科目** : **[人工智能](https://papers.cool/arxiv/cs.AI)** , [计算和语言](https://papers.cool/arxiv/cs.CL), [计算机视觉和模式识别](https://papers.cool/arxiv/cs.CV)

RExBench:评估 LLM 智能体实现研究扩展的能力

RExBench 通过 12 项真实研究实验扩展任务评估 LLM 智能体,结果显示即使增加人工提示,最佳成功率仍低于 40%。

 SWE 软件工程 智能体 模型评估 人工智能辅助编程 人工智能

RExBench 是一个面向研究扩展能力的基准,包含 12 个由领域专家设计的真实实验实施任务,要求智能体基于已有论文和代码库验证尚未实现的研究假设。该基准强调抗数据污染,并通过执行智能体产出的代码自动判断任务是否达到成功标准。研究使用 aider、Claude Code 和 OpenHands 三种框架评估了九个 LLM 智能体,发现它们大多无法自主完成研究扩展。额外的人工编写提示虽能提升成功率,但最佳表现仍低于 40%,说明当前智能体处理现实研究工程任务时仍高度依赖人工指导。

用途与启示
  • 用于衡量 LLM 智能体从论文与现有代码出发实现新研究假设的能力。
  • 为研究型软件工程智能体提供可执行、抗污染的自动评估方案。
  • 揭示当前智能体在复杂实验实现、代码库理解和自主研究扩展方面的明显短板。
  • 提示后续系统应加强长程规划、实验调试及低人工干预下的自主执行能力。
📝 原始笔记(逐字保留)
2025-07-01 12:31:02 Tuesday **Authors** : [Nicholas Edwards](https://arxiv.org/search/?searchtype=author&query=Nicholas%20Edwards), [Yukyung Lee](https://arxiv.org/search/?searchtype=author&query=Yukyung%20Lee), [Yujun](https://arxiv.org/search/?searchtype=author&query=Yujun), [Mao](https://arxiv.org/search/?searchtype=author&query=Mao), [Yulu Qin](https://arxiv.org/search/?searchtype=author&query=Yulu%20Qin), [Sebastian Schuster](https://arxiv.org/search/?searchtype=author&query=Sebastian%20Schuster), [Najoung Kim](https://arxiv.org/search/?searchtype=author&query=Najoung%20Kim) 基于大型语言模型 (LLM) 的代理已显示出自主执行复杂软件工程任务的前景。此外,在开发可以执行机器学习和自然科学部分研究管道的代理方面也取得了进展。我们认为研究扩展及其实施是此类系统的关键能力,并引入 RExBench 来支持对这种能力的评估。RExBench 是一个基准测试,由 12 个现实的研究实验实施任务组成,旨在 **调查以前未实施的研究假设** 。每个任务都设置为对现有研究论文和代码库的扩展,并附有领域专家编写的说明。RExBench 对数据污染非常可靠,并支持自动评估基础设施,该基础设施执行代理输出以确定是否满足成功标准。我们使用此基准来评估使用三个不同框架实现的九个 LLM 代理:aider、Claude Code 和 OpenHands。我们发现,所有评估的代理都无法自主实施大多数扩展。尽管使用额外的人工编写提示可以提高成功率,但此设置下的最佳性能仍低于 40%。这表明,在没有大量人工指导的情况下,当前的代理仍然无法处理现实的研究推广任务。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** #### SWE-bench-Live

可验证自然语言到线性时间逻辑的转换:VLTL-Bench 基准与评估套件

VLTL-Bench 通过多状态空间、自然语言与线性时间逻辑规范、样本轨迹及分阶段真值标注,系统评估 NL 到 LTL 转换的准确性、接地能力与可验证性。

 逻辑推理 数据工程 模型评估 智能体工具

现有自然语言到时间逻辑的系统在定制基准上接近满分,但通常只评估公式翻译准确率,忽略了将原子命题接地到新环境的能力。VLTL-Bench 提供三个不同的状态空间、数千组自然语言规范及对应的线性时间逻辑形式规范,并附带用于验证公式的样本轨迹。该基准支持端到端评估,也针对提升、接地、翻译和验证四个阶段分别提供真值标注。它旨在减少定制数据集造成的指标虚高,推动可扩展、通用且可验证的 NL-to-LTL 方法研究。

用途与启示
  • 统一评估自然语言到线性时间逻辑转换系统的端到端可靠性。
  • 单独诊断提升、命题接地、逻辑翻译和轨迹验证等环节的误差。
  • 检验模型在新状态空间和环境中的泛化能力,避免仅依赖已知接地信息。
  • 为机器人规划、系统控制和形式化需求验证提供可复现的评测基础。
📝 原始笔记(逐字保留)
20250702|**[可验证自然语言到线性时间逻辑的转换:基准数据集和评估套件](https://papers.cool/arxiv/2507.00877)** **Authors** : [William H English](https://arxiv.org/search/?searchtype=author&query=William%20H%20English), [Chase Walker](https://arxiv.org/search/?searchtype=author&query=Chase%20Walker), [Dominic Simon](https://arxiv.org/search/?searchtype=author&query=Dominic%20Simon), [Sumit Kumar Jha](https://arxiv.org/search/?searchtype=author&query=Sumit%20Kumar%20Jha), [Rickard Ewetz](https://arxiv.org/search/?searchtype=author&query=Rickard%20Ewetz) 对最先进的自然语言 (NL) 到时间逻辑 (TL) 翻译系统的实证评估表明,在现有基准测试中,其性能近乎完美。然而,目前的研究只测量了将 NL 逻辑转换为形式 TL 的准确性,而忽略了系统将原子命题接地到新场景或环境中的能力。这是一个关键功能,对于在具体状态空间中验证结果公式是必需的。因此,大多数 NL 到 TL 翻译框架都提出了自己的定制数据集,其中正确的基础是先验已知的,这夸大了性能指标,忽视了对可扩展的、通用的领域系统的需求。在本文中,我们介绍了可验证线性时间逻辑基准 (VLTL-Bench),这是一个统一的基准,用于衡量自动 NL 到 LTL 翻译的验证和可验证性。该数据集由三个独特的状态空间和数千种不同的自然语言规范和时间逻辑中相应的形式规范组成。此外,基准测试还包含用于验证 temporal logic 表达式的 sample traces。虽然该基准测试直接支持端到端评估,但我们观察到许多框架将流程分解为 i) 提升、ii) 接地、iii) 翻译和 iv) 验证。基准测试在每个步骤之后都提供了基本事实,使研究人员能够改进和评估整个问题的不同子步骤。为了鼓励在方法论上取得可验证的 NL 到 LTL 转换方法的合理进步,我们在此处发布 VLTL-Bench:https://www.kaggle.com/datasets/dubascudes/vltl Bench。 **科目** : **[系统和控制](https://papers.cool/arxiv/eess.SY)** , [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-07-01 15:41:57 UTC
0%