2025-06-27 科研追新

当日精选(由提交工具自动创建)。

BridgeVLA:基于2D热图的高效3D机器人操作学习模型

中科院自动化所提出BridgeVLA,将3D输入投影为2D图像并通过2D热图预测动作,以少量轨迹实现高效且具泛化能力的机器人操作学习。

 具身智能 多模态 模型开发 数据工程

中科院自动化所提出BridgeVLA模型,用于高效、可泛化的3D机器人操作学习。该模型将3D输入投影至2D图像空间,并利用2D热图完成动作预测,从而降低3D操作建模的复杂度。实验显示,BridgeVLA在仿真与真实场景中均取得了优秀表现。其数据效率突出,在基础任务中仅使用3条轨迹便达到96.8%的成功率。

用途与启示
  • 为3D机器人操作提供一种借助成熟2D视觉表示降低学习难度的技术路线
  • 展示少样本轨迹训练在具身操作任务中的潜力,可减少真实机器人数据采集成本
  • 可作为研究视觉—语言—动作模型跨场景泛化与高效动作预测的参考
📝 原始笔记(逐字保留)
2025-06-27 14:06:04 Friday | 中科院自动化所提出BridgeVLA模型,通过将3D输入投影为2D图像并利用2D热图进行动作预测,实现了高效且泛化的3D机器人操作学习。实验表明,BridgeVLA在仿真和真实场景中均展现出卓越的性能和数据效率,仅需3条轨迹即可在基础任务中达到96.8%的成功率。 https://mp.weixin.qq.com/s/PKA5T4ybjYwc46WH6QmcDg ## 世界模型

MindCube:从有限视图构建空间心智模型

MindCube 基准揭示现有视觉语言模型难以从有限视图理解不可见空间,而“先建图、再推理”结合强化学习可将准确率从 37.8% 提升至 70.7%。

 元学习 多模态 推理 强化学习 模型评估

MindCube 用 3,268 张图像和 21,154 个问题,评估视觉语言模型从有限视图构建空间心智模型的能力。任务覆盖位置认知映射、视角转换以及假设运动的心理模拟,现有 VLM 在该基准上接近随机表现。研究比较了生成不可见中间视图、自然语言推理链和认知地图三种辅助方法,其中“map-then-reason”通过先生成认知地图再进行推理,将准确率从 37.8% 提升至 60.8%。进一步加入强化学习后,准确率达到 70.7%,表明结构化内部空间表示能显著增强模型对不可观察空间的理解。

用途与启示
  • 用于评估 VLM 是否具备从少量视图推断完整空间布局、方向与动态变化的能力
  • 为具身智能、机器人导航和三维场景理解提供空间推理基准
  • 启示模型先显式构建认知地图,再围绕内部表示推理,比单纯语言思维链更有效
  • 可结合强化学习进一步训练模型生成并利用结构化空间表征
📝 原始笔记(逐字保留)
4. 2025-06-27 14:28:17 Friday **[来自有限视图的空间心智建模](https://papers.cool/arxiv/2506.21458)** **[PDF(6)]** **[Copy]** **[Kimi(2)]** **[REL]** 作者:殷柏乔、王启能、张平月、张建树、王康瑞、王子涵、张洁玉、Keshigeyan Chandrasegaran、刘涵、Ranjay Krishna、谢赛宁、李曼玲、吴佳俊、李飞飞 视觉语言模型 (VLM) 能否像人类一样仅从几个视图中想象整个场景?人类形成空间心智模型,即看不见空间的内部表征,以推理布局、视角和运动。我们新的 MindCube 基准测试在 3,268 张图像中提出了 21,154 个问题,揭示了这一关键差距,即现有 VLM 表现出近乎随机的性能。使用 MindCube,我们系统地评估了 VLM 通过表示位置(认知映射)、方向(换位思考)和动力学(“假设”运动的心理模拟)来构建强大的空间心智模型的能力。然后,我们探索了三种方法来帮助 VLM 近似空间心智模型,包括看不见的中间视图、自然语言推理链和认知地图。显著的改进来自一种协同方法,即 “map-then-reason”,该方法联合训练模型首先生成认知地图,然后对其进行推理。通过训练模型对这些内部映射进行推理,我们将准确率从 37.8% 提高到 60.8% (+23.0%)。添加强化学习将性能进一步推高至 70.7% (+32.9%)。我们的主要见解是,这种空间心智模型的脚手架,积极构建和利用具有灵活推理过程的内部结构化空间表示,显着提高了对不可观察空间的理解。

EasyDoc:将文档转换为 AI 友好格式的实用工具

EasyDoc 可将常见文档转换为更便于 AI 模型读取、解析和处理的格式。

 智能体工具 人工智能应用 数据工程

EasyDoc 是一款面向 AI 工作流的文档格式转换工具。它旨在把原始文档整理为更适合大模型读取、解析和后续加工的格式,降低文档接入 AI 应用的门槛。该工具可用于知识库构建、内容分析、检索增强生成等文档处理场景。

用途与启示
  • 将现有文档快速转换为适合大模型处理的格式
  • 简化知识库与 RAG 系统的数据预处理流程
  • 提升文档内容的可解析性和 AI 应用接入效率
📝 原始笔记(逐字保留)
2025-06-27 13:59:38 Friday | EasyDoc:将你的文档变为 AI 友好格式的万能神器 https://mp.weixin.qq.com/s/V7y2Ew4AwoHriJV5iAgumA

港大开源 RAG-Anything:全模态 RAG 统一理解复杂文档

香港大学黄超教授团队开源 RAG-Anything,通过结构化知识网络统一处理文档中的文本、图表、表格和公式等多模态内容。

 人工智能应用 多模态 智能体工具 人工智能框架

传统 RAG 主要围绕文本进行检索与生成,难以完整理解包含图表、表格和公式的复杂文档。香港大学黄超教授团队推出并开源多模态智能处理系统 RAG-Anything,实现跨模态内容的一体化解析与理解。该系统将文档中的碎片化信息组织为结构化知识网络,以支持更全面的检索和问答。其技术路径可用于科研资料、财务报告及企业知识库等复杂文档场景。

用途与启示
  • 构建能够统一检索文本、图表、表格和公式的多模态知识库
  • 提升复杂文档问答与信息抽取的完整性和准确性
  • 为科研、金融及企业文档分析提供全模态 RAG 实现思路
📝 原始笔记(逐字保留)
6. 2025-06-27 13:34:29 Friday | 全模态RAG突破文本局限,港大构建跨模态一体化系统 https://mp.weixin.qq.com/s/lFKyKvm0luZTpx8_nGyWEw https://mp.weixin.qq.com/s/VuowC1hvE3P4RxIfYDZlLA 突破传统检索增强生成(RAG)技术的单一文本局限,实现对文档中文字、图表、表格、公式等复杂内容的统一智能理解。 香港大学黄超教授团队开源多模态智能处理系统RAG-Anything,将碎片化的信息孤岛转化为结构化的知识网络,为智能多模态文档分析开辟了全新技术路径。 ## 情感&情绪

北大发布学术搜索评测 ScholarSearch:挑战主流 Deep Research 系统

北京大学发布学术搜索评测 ScholarSearch,以高难度开放式信息检索任务检验主流 Deep Research 系统的深度搜索能力。

 人工智能应用 模型评估 智能体

北京大学发布学术搜索评测 ScholarSearch,将学术信息检索设计为具有挑战性的“开卷考试”。该评测面向以深度搜索为核心的研究型智能体,考察其处理高难度信息检索任务的能力。涉及的代表性系统包括 OpenAI Deep Research、Grok DeepSearch、Gemini Deep Research 和 Kimi-Researcher。ScholarSearch 可用于比较不同系统在搜索、筛选与整合学术信息方面的实际表现。

用途与启示
  • 为 Deep Research 类系统提供统一的学术搜索评测场景
  • 衡量智能体检索、筛选和整合复杂信息的能力
  • 帮助开发者发现研究型智能体在高难度开放检索任务中的不足
📝 原始笔记(逐字保留)
2. 2025-06-27 13:40:46 Friday | 北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试” https://mp.weixin.qq.com/s/avGM6aB5aQcn6w5sKnZdKA OpenAI的Deep Research、Grok的DeepSearch、Gemini的Deep Research以及月之暗面的Kimi-Researcher等,以“深度搜索”功能为核心,为攻克高难度信息检索任务提供了新的范式。

DeepMind 发布突破性生物模型 AlphaGenome

谷歌 DeepMind 发布基因组 AI 模型 AlphaGenome及其详细技术报告,用于理解基因序列及其变异的生物学影响。

 人工智能应用 模型开发 智能体工具 人工智能

谷歌 DeepMind 发布了面向基因组研究的 AI 模型 AlphaGenome。该模型旨在帮助研究人员理解基因序列,并分析遗传变异可能造成的生物学影响。DeepMind 同时公开了一份长达 103 页的技术报告,介绍模型设计与研究结果。AlphaGenome 展示了大模型在生物学和精准医疗等领域的应用潜力。

用途与启示
  • 辅助解析基因序列及遗传变异的功能影响
  • 为疾病机制研究和潜在治疗靶点发现提供工具
  • 展示 AI 基础模型向基因组学与精准医疗迁移的应用方向
📝 原始笔记(逐字保留)
1. 2025-06-27 13:42:36 Friday | Deepmind突破性生物模型**AlphaGenome **https://mp.weixin.qq.com/s/fhsKbgoPFuJ_2IInt_Q-tQ 谷歌DeepMind重磅发布AlphaGenome——一款革命性的AI工具,以及103页的详细技术报告。 论文地址:https://deepmind.google/discover/blog/alphagenome-ai-for-better-understanding-the-genome/

RewardAnything:用自然语言定义通用奖励原则

北京大学知识计算实验室等机构提出 RewardAnything,使奖励模型能够理解自然语言描述的评判原则,提升其跨任务泛化能力。

 强化学习 模型训练 模型开发 人工智能

北京大学知识计算实验室联合腾讯微信模式识别中心、William & Mary、西湖大学等机构提出 RewardAnything。该方法让奖励模型直接理解以自然语言描述的评判原则,而非仅依赖固定任务和标注模式。其目标是推动奖励建模从对既有偏好的“死记硬背”,转向对评价标准的理解与灵活迁移。这一范式有望增强强化学习奖励模型在不同任务和场景中的通用性。

用途与启示
  • 通过自然语言灵活定义评价原则,降低为不同任务单独设计奖励函数的成本。
  • 提升奖励模型对新任务、新标准和复杂偏好的泛化能力。
  • 为可扩展监督、智能体训练及强化学习对齐提供更通用的奖励建模思路。
📝 原始笔记(逐字保留)
7. 🌈 🌈 2025-06-27 12:57:34 Friday | 北京大学知识计算实验室联合腾讯微信模式识别中心、William&Mary、西湖大学等机构提出的**RewardAnything**突破了这一瓶颈——通过让奖励模型直接理解自然语言描述的评判原则,实现了从”死记硬背”到”融会贯通”的范式跃迁。https://mp.weixin.qq.com/s/sJI0TpYnuLQKtwaJdo2t6w

桥接大语言模型的离线与在线强化学习

研究系统比较离线、半在线与在线强化学习微调大语言模型的效果,发现在线和半在线方法表现相近且均显著优于离线方法。

 强化学习 模型训练 人工智能

该研究考察了大语言模型从离线、半在线到完全在线强化学习的训练效果,覆盖可验证的数学任务与不可验证的教学任务。实验广泛比较了在线及半在线的直接偏好优化(DPO)和群组奖励策略优化(GRPO)目标。结果显示,在线与半在线变体在性能和收敛性上较为接近,但都明显优于纯离线方法。研究还分析了训练动力学与超参数选择,并发现联合使用可验证和不可验证奖励进行多任务训练,可同时提升两类任务的性能。

用途与启示
  • 为大语言模型选择离线、半在线或在线强化学习方案提供实证依据
  • 表明半在线训练可能以较低交互成本取得接近完全在线训练的效果
  • 支持将可验证奖励与不可验证奖励结合开展多任务强化学习
  • 为 DPO、GRPO 的训练动力学分析和超参数配置提供参考
📝 原始笔记(逐字保留)
2025-06-27 14:21:00 Friday | **[桥接 LLM 的离线和在线强化学习](https://papers.cool/arxiv/2506.21495)** **[PDF(7)]** **[Copy]** **[Kimi(2)]** **[REL]** [#6](https://arxiv.org/abs/2506.21495) **[Bridging Offline and Online Reinforcement Learning for LLMs](https://papers.cool/arxiv/2506.21495)** **[PDF(7)]** **[Copy]** **[Kimi(2)]** **[REL]** 作者:杰克·兰钱汀、安吉莉卡·陈、贾尼斯·兰、李贤、斯瓦纳迪普·萨哈、王天璐、徐静、余平、袁伟哲、杰森·E·韦斯顿、赛因巴亚尔·苏赫巴托尔、伊利亚·库利科夫 我们研究了强化学习方法在从离线过渡到半在线再到完全在线状态时对大型语言模型进行微调的有效性,以完成可验证和不可验证的任务。我们的实验涵盖可验证数学和不可验证教学的训练,然后对两者进行了一组基准评估。在这些设置中,我们广泛比较了在线和半在线 Direct Preference Optimization 和 Group Reward Policy Optimization 目标,并令人惊讶地发现这些变体之间的性能和收敛性相似,它们都明显优于离线方法。我们提供了对训练动力学和超参数选择策略的详细分析,以实现最佳结果。最后,我们表明,具有可验证和不可验证奖励的多任务处理共同提高了两种任务类型的性能。

推理时扩展的概率最优性:OptScale 动态确定最佳采样数

论文建立推理时并行采样的概率最优性框架,并提出 OptScale 动态计算满足性能与置信度要求的最小采样数量。

 推理 逻辑推理 系统优化 模型评估

论文在并行样本独立同分布的假设下,为推理时扩展及 Best-of-N 选择策略建立概率分析框架。作者推导了达到目标性能水平所需样本数量的理论下限,为分配推理计算预算提供原则性依据。在此基础上,OptScale 使用语言模型预测器估计概率先验参数,动态确定满足预设性能阈值和置信度的最小采样数。MATH-500、GSM8K、AIME 和 AMC 上的实验显示,该方法能够显著降低采样开销,同时保持或改善推理表现。

用途与启示
  • 为推理时扩展提供理论化的计算预算分配依据,减少对固定采样数和启发式策略的依赖。
  • 可用于按题目难度动态调整 Best-of-N 的 N,在性能、置信度与推理成本之间取得平衡。
  • 为复杂推理模型的低成本部署和在线推理系统优化提供可落地方案。
📝 原始笔记(逐字保留)
2025-06-30 20:00:48 Monday | **[推理时扩展的概率最优性](https://papers.cool/arxiv/2506.22376)** **[PDF(2)]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Youkang Wang](https://arxiv.org/search/?searchtype=author&query=Youkang%20Wang), [Jian Wang](https://arxiv.org/search/?searchtype=author&query=Jian%20Wang), [Rubing Chen](https://arxiv.org/search/?searchtype=author&query=Rubing%20Chen), [Xiao-Yong Wei](https://arxiv.org/search/?searchtype=author&query=Xiao-Yong%20Wei), [Qing Li](https://arxiv.org/search/?searchtype=author&query=Qing%20Li) 推理时间缩放已成为提高大型语言模型 (LLM) 推理性能的强大技术。然而,现有的方法往往依赖于启发式策略进行并行采样,缺乏原则性的基础。为了解决这一差距,我们提出了一个概率框架,该框架在假设并行样本独立且相同分布 (i.i.d.) 的情况下正式确定了推理时间缩放的最优性,并且 N 个最佳选择策略遵循可以估计的概率分布。在这个框架内,我们得出了达到目标性能水平所需样本数量的理论下限,为计算高效扩展提供了第一个原则性指导。利用这一见解,我们开发了 \textsc{OptScale},这是一种实用的算法,可以动态确定采样响应的最佳数量。\textsc{OptScale} 使用基于语言模型的预测器来估计概率先验参数,从而能够决定满足预定义性能阈值和置信度所需的最小样本数。对数学推理基准(包括 MATH-500、GSM8K、AIME 和 AMC)的广泛实验表明,\textsc{OptScale} 显着减少了采样开销,同时保持更好或与最先进的推理性能相当。我们的工作为原则推理时间扩展提供了理论基础和实用解决方案,解决了有效部署 LLM 以进行复杂推理的关键差距。 **科目** : **[机器学习](https://papers.cool/arxiv/cs.LG)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-06-27 16:44:11 UTC

Double-Checker:通过自我批判微调增强慢思维大模型推理

Double-Checker 利用精选的自我批判样本微调长思维链模型,使其能够迭代检查并改进答案,将 AIME 的 pass@1 从 4.4% 提升至 18.2%。

 推理 模型训练 自进化 逻辑推理 模型评估

Double-Checker 是一个面向慢思维、长思维链大模型的自我批判微调框架,旨在弥补模型难以生成有效批评并修正既有解答的问题。研究者精选了 1,730 个自我批判实例进行微调,使模型能够在推理过程中反复批评和优化输出,直至其依据自生成批评判断答案正确。综合推理基准实验显示,结构化的迭代自我批判可以显著增强 long-CoT 模型的推理能力。其在 AIME 上将原始模型的 pass@1 从 4.4% 提升至 18.2%,表明显式训练纠错行为是提升复杂推理可靠性的有效路径。

用途与启示
  • 为长思维链模型提供可训练的自检与迭代纠错机制。
  • 说明少量高质量自我批判数据也可能显著改善复杂数学推理表现。
  • 可用于构建更可靠的推理智能体、答案复核器及多轮求解系统。
  • 启示后续研究同时评估批评质量、纠错收益与迭代推理成本。
📝 原始笔记(逐字保留)
2025-06-27 14:22:42 Friday **[Double-Checker:通过自我批判微调增强慢思维 LLM 的推理](https://papers.cool/arxiv/2506.21285)** **[PDF(3)]** **[Copy]** **[Kimi(1)]** **[REL] ** **[#15](https://arxiv.org/abs/2506.21285)****[Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning](https://papers.cool/arxiv/2506.21285)**** [PDF(3)] [Copy] [Kimi(2)] [REL]** 作者:徐鑫、陈天昊、张帆、刘万龙、李鹏翔、阿贾伊·库马尔·贾斯瓦尔、闫雨辰、胡继善、王洋、陈浩、刘世伟、刁世哲、杨灿、尹璐 虽然思维缓慢的大型语言模型 (LLM) 表现出类似反射的推理,通常被称为“顿悟时刻”,但它们产生信息性批评和完善先前解决方案的能力仍然有限。在本文中,我们介绍了 Double-Checker,这是一个原则性框架,旨在通过培养明确的自我批判和对先前解决方案的迭代改进来增强思维缓慢的 LLM 的推理能力。通过对我们精选的 1,730 个自我批评实例进行微调,Double-Checker 使 long-CoT LLM 能够在推理过程中迭代批评和优化其输出,直到他们在自我生成的批评下评估其解决方案是正确的。我们在一套全面的推理基准中验证了 Double-Checker 的有效性,证明迭代自我批评显着增强了 long-CoT LLM 的推理能力。值得注意的是,与原始的 long-CoT LLM 相比,我们的 Double-Checker 将具有挑战性的 AIME 基准测试的pass@1性能从 4.4% 提高到 18.2%。这些结果为开发更值得信赖和有效的能够进行结构化自我批评的 LLM 提供了一个有前途的方向。 ### 思维模式 #### [大语言模型心如铁石:揭秘大型推理模型的软性思维能力](https://papers.cool/arxiv/2508.03440) [#79](https://arxiv.org/abs/2508.03440) [LLMs Have a Heart of Stone: Demystifying the Soft Thinking Ability of Large Reasoning Models](https://papers.cool/arxiv/2508.03440) 人类认知自然地处理抽象且流动的概念,而现有的推理模型通常依赖于生成离散的标记,这可能限制了它们的表达能力。近期的进展旨在通过使大型语言模型(LLMs)生成软性、抽象的标记,从而促进在连续概念空间中的推理,来解决这一限制。本文通过一系列探测技术,考察了各种 LLMs 的“软思维”能力,分析模型的内部行为。与普遍认为软思维能够同时探索多条推理路径的观点相反,我们的研究发现,LLMs 在后续解码步骤中主要依赖软输入中最具影响力的成分。这种依赖阻碍了不同推理路径的探索,使得普通的软思维退化为一种贪婪解码,掩盖了通过软标记传递更多信息的优势。为了解决这一问题,我们探索了引入\emph{随机性}的采样策略,采用了 Dirichlet 重采样和 Gumbel-Softmax 技巧等方法。 我们的实验表明,加入随机性可以缓解传统方法的局限性,释放软思维的潜力。值得注意的是,Gumbel-Softmax 技巧在保持平滑性的同时提供了足够的随机性,在八个推理基准测试中表现出色。 发布时间:2025-08-05 13:38:33 UTC ## COT [250926|SIM-CoT:监督隐式思维链(28▲) ](https://huggingface.co/papers/2509.20317?utm_source=digest-papers&utm_medium=email&utm_campaign=2025-09-25) 🌈 **首篇潜空间推理综述!模型思考不必依赖Token,带宽暴增2700+倍**[https://mp.weixin.qq.com/s/no5Jwyob3TjbqMNcdGaneQ](https://mp.weixin.qq.com/s/no5Jwyob3TjbqMNcdGaneQ) 大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮[https://mp.weixin.qq.com/s/3LzMP_sDDALh6q91fXeQzQ](https://mp.weixin.qq.com/s/3LzMP_sDDALh6q91fXeQzQ) 当推理链从3步延伸到50+步,幻觉率暴增10倍;反思节点也束手无策。

快手开源视频理解大模型 Keye-VL

快手发布并开源多模态大模型 Keye-VL,重点提升对短视频内容的理解能力。

 模型开发 多模态 人工智能

快手推出面向视频理解的多模态大模型 Keye-VL,可用于快速解析短视频中的视觉与语义信息。该模型强调对复杂视频内容的综合理解能力,并公开了相关技术细节。项目采用开源方式发布,便于研究者和开发者进一步验证、复现与应用。

用途与启示
  • 为短视频检索、内容审核、自动摘要和智能推荐提供模型基础
  • 可作为开源视频多模态模型的研究与复现对象
  • 有助于探索视觉语言模型在大规模短视频场景中的落地
📝 原始笔记(逐字保留)
7. 2025-06-27 14:04:27 Friday |AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源 https://mp.weixin.qq.com/s/hFO2TQNcn3IK3E1F1QQObw

Cosmos:用于文本扩散建模的压缩平滑潜在空间

Cosmos 通过在语义对齐的压缩平滑潜在空间中执行文本扩散,在保持生成质量的同时实现超过 2 倍的推理加速。

 人工智能 模型开发 模型训练 推理

Cosmos 不直接在高维 token 表示上进行扩散,而是使用自动编码器学习面向扩散建模的压缩、平滑潜在空间。自动编码器同时接受 token 级重建训练,并与预训练语言编码器的冻结激活对齐,从而获得稳定的语义基础。实验表明,文本表示可被显著压缩,同时保持与 token 级扩散模型相当的生成质量;增加潜在序列长度后,效果还能超过多种扩散及自回归基线。该方法在故事生成、问题生成、摘要和文本解毒任务上取得相当或更优的质量,并带来超过 2 倍的推理加速。

用途与启示
  • 为解决 token 级文本扩散的高维表示与计算开销问题提供新的潜在空间方案。
  • 展示语义对齐、重建学习与扰动增强相结合的完整训练思路,可供后续扩散语言模型借鉴。
  • 说明潜在表示压缩有望兼顾并行生成、全局连贯性与推理效率。
📝 原始笔记(逐字保留)
2. 2025-06-27 14:24:28 Friday [#21](https://arxiv.org/abs/2506.21170) **[用于文本扩散建模的压缩和平滑潜在空间](https://papers.cool/arxiv/2506.21170)** **[PDF(1)]** **[Copy]** **[Kimi(1)]** **[REL]** 作者:维亚切斯拉夫·梅沙尼诺夫、叶戈尔·奇姆布拉托夫、亚历山大·沙巴林、亚历山大·阿布拉莫夫、德米特里·维特罗夫 自回归语言模型在现代文本生成中占主导地位,但它们的顺序性引入了基本限制:解码速度很慢,保持全局连贯性仍然具有挑战性。扩散模型通过实现并行生成和灵活控制提供了一种有前途的替代方案;然而,它们应用于文本生成的原因是 token-level 表示的高维性。我们介绍了 Cosmos,这是一种新颖的文本生成方法,它完全在专为扩散量身定制的压缩、平滑的潜在空间中运行。这个空间是使用自动编码器学习的,该自动编码器同时训练用于令牌级重建和与来自预训练语言编码器的冻结激活对齐,提供强大的语义基础并实现有效的基于扰动的增强。根据经验,我们证明了文本表示可以通过以下方式压缩 8×8× 同时保持与 Token 级扩散模型相当的生成质量。此外,增加潜在序列长度使 Cosmos 能够超越基于扩散和自回归的基线。我们在四个不同的生成任务上评估 Cosmos,包括故事生成、问题生成、总结和解毒,并将其与各种生成范式进行比较。Cosmos 实现了相当或卓越的发电质量,同时提供超过2×2× 更快的推理。 ### Diffusion + RL 🌈🌈🌈🌈🌈(可以借鉴这个里面的训练全流程工作)2025-06-28 18:36:21 Saturday | 苹果与港大出手!改进GRPO,让dLLM也能高效强化学习 https://mp.weixin.qq.com/s/akWoBx1F8sEvi_IxMQpJbg 此前的 Mercury Coder 和 Gemini Diffusion 已经表明:基于扩散的代码生成器可以与顶尖自回归代码模型相媲美。 首先研究了 dLLM 的解码行为,然后建立了一种用于扩散 LLM 的原生强化学习 (RL) 方法。这是该研究一作、香港大学博士生 Shansan Gong 在苹果实习期间的研究成果。 论文标题:DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation 论文地址:https://arxiv.org/pdf/2506.20639 项目地址:https://github.com/apple/ml-diffucoder

地平线与极佳提出几何一致视频世界模型,增强机器人策略学习

地平线与极佳提出几何一致的视频世界模型,通过提升生成视频的空间与几何一致性来增强机器人策略学习。

 人工智能 具身智能 模型开发 多模态 模型训练

地平线与极佳在具身智能方向提出一种几何一致的视频世界模型。该模型重点改善预测视频中的空间结构与几何关系一致性,使模拟出的环境变化更适合机器人理解和决策。研究尝试利用世界模型生成的动态信息增强机器人策略学习,为降低真实环境交互成本提供新路径。

用途与启示
  • 利用几何一致的视频预测,为机器人策略训练提供更可靠的环境表征。
  • 探索以世界模型减少真实机器人数据采集与交互成本。
  • 为视频生成模型与具身智能策略学习的结合提供研究方向。
📝 原始笔记(逐字保留)
2025-06-27 12:08:15 Friday |具身世界模型新突破,地平线 & 极佳提出几何一致视频世界模型增强机器人策略学习 https://mp.weixin.qq.com/s/Hj2h3nxO8XxPeqd3OhctKA

阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o

阿里发布并开源信息检索智能体 WebDancer,通过四阶段训练范式与 ReAct 代理框架提升网络检索和复杂任务泛化能力,在 GAIA 基准上超越 GPT-4o。

 智能体 智能体工具 人工智能框架 模型训练 强化学习 数据工程 人工智能应用

WebDancer 是阿里推出的信息检索智能体,可自主上网搜索资料并完成复杂信息任务,其模型与相关数据已开源。系统采用四阶段训练范式,依次包括浏览数据构建、轨迹采样、用于有效冷启动的监督微调,以及提升泛化能力的强化学习。其代理框架基于 ReAct,通过多个“思维—动作—观察”轮次持续调用网络工具并修正检索路径。公开结果显示,WebDancer 在 GAIA 智能体基准上的表现超过 GPT-4o。

用途与启示
  • 为构建可自主浏览网页、检索资料和综合信息的研究型智能体提供训练范式参考
  • 展示监督微调与强化学习结合改善智能体冷启动和任务泛化的实践路径
  • 可借鉴 ReAct 的多轮交互机制设计搜索、问答与深度研究类应用
  • 开源模型与数据有助于复现和评估信息检索智能体
📝 原始笔记(逐字保留)
2. 2025-06-27 13:48:24 Friday | 阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源 https://mp.weixin.qq.com/s/LETDaeU96OV-beuoCuJHHQ 知乎相关参考:https://zhuanlan.zhihu.com/p/1911727252162474660 它的“秘密武器”是一种 **四阶段训练范式** ,包括浏览数据构建、轨迹采样、针对有效冷启动的监督微调以及用于改进泛化能力的强化学习。 WebDancer的代理框架基于 **ReAct** ,这是语言代理最流行的方法,一个ReAct轨迹由多个思维-动作-观察轮次组成。 ReAct论文解读:https://zhuanlan.zhihu.com/p/624003116

Mind2Web 2:基于 Agent-as-a-Judge 的智能体搜索评估

Mind2Web 2 提供包含130个真实长期任务的智能体搜索基准,并以 Agent-as-a-Judge 框架自动评估答案正确性与来源归因。

 智能体 模型评估 人工智能框架 人工智能

Mind2Web 2 面向 Deep Research 等智能体搜索系统,收录了 130 个需要实时网页浏览和广泛信息综合的高质量长期任务,累计投入超过 1,000 小时人工构建。针对答案随时间变化、内容复杂且需要引文支持的问题,研究提出 Agent-as-a-Judge 框架,利用树状评分量规构建任务专属的评判智能体。作者系统评估了 9 个前沿智能体搜索系统及人类表现,并分析了主要错误类型。实验显示,表现最佳的 OpenAI Deep Research 能以约一半的耗时达到人类水平的 50%~70%。

用途与启示
  • 为长周期、开放式的网页搜索智能体提供更贴近真实场景的评估基准。
  • 使用任务专属评判智能体,降低复杂答案正确性与引文归因评估的人工成本。
  • 可用于定位智能体搜索系统在浏览、信息综合和来源引用环节的不足。
  • 为下一代 Deep Research 类系统的开发、对比和迭代提供统一依据。
📝 原始笔记(逐字保留)
2025-06-27 14:27:37 Friday **Mind2Web 2:基于 Agent-as-a-Judge 的代理搜索评估 [PDF** **(6)** **] [复制] [Kimi** **(6)** **] [相关]** **[#40](https://arxiv.org/abs/2506.21506)****[Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge](https://papers.cool/arxiv/2506.21506)**** [PDF(6)] [Copy] [Kimi(6)] [REL]** 作者:苟博宇、黄赞明、宁雨婷、谷雨、Michael Lin、齐伟健、Andrei Kopanev、于博韬、Bernal Jiménez Gutiérrez、舒毅恒、Chan Hee Song、吴佳蔓、陈世杰、Hanane Nour Moussa、张天舒、谢健、李逸飞、薛天慈、廖泽一、张凯、郑博元、蔡兆伟、Viktor Rozgic、Morteza Ziyadi、孙欢、苏钰 代理搜索(如 Deep Research 系统)代表了用户与 Web 规模信息交互方式的重大转变,其中大型语言模型自主浏览 Web、综合信息并返回全面的引文支持答案。虽然承诺更高的效率和认知卸载,但代理搜索日益增长的复杂性和开放性已经超过了现有的评估基准和方法,这些基准和方法在很大程度上假设搜索范围较短且答案静态。在本文中,我们介绍了 Mind2Web 2,这是一个由 130 个现实、高质量和长期任务组成的基准,这些任务需要实时 Web 浏览和广泛的信息合成,由 1,000 多个小时的人力构建而成。为了解决评估时变和复杂答案的挑战,我们提出了一种新的 Agent-as-a-Judge 框架。我们的方法基于树状结构的评分量规设计构建特定于任务的判断代理,以自动评估答案的正确性和来源归因。我们对 9 个前沿代理搜索系统和人类表现进行了全面评估,并进行了详细的错误分析,以得出对未来发展的见解。性能最好的系统 OpenAI Deep Research 已经可以达到人类性能的 50-70%,而花费的时间只有一半,显示出巨大的潜力。总而言之,Mind2Web 2 为开发和基准测试下一代代理搜索系统提供了严格的基础。

Agent-RewardBench:面向现实世界多模态智能体的统一奖励建模基准

Agent-RewardBench 从感知、规划和安全三个维度评估多模态模型在真实智能体场景中的奖励建模能力,揭示现有先进模型仍需专门训练。

 智能体 多模态 模型评估 任务规划 模型训练 具身智能

Agent-RewardBench 是一个面向现实世界多模态智能体的奖励建模基准,旨在解决奖励模型选择与外部反馈能力缺乏统一评价的问题。基准覆盖 7 类真实场景,并从感知、规划和安全三个维度展开评估。它支持阶梯式奖励评价,可在任务执行的不同步骤考察智能体表现,从而提供更细粒度的规划能力分析。数据由 10 个模型的输出经过难度控制与人工验证构建,实验显示当前先进多模态模型在该基准上的表现仍然有限。

用途与启示
  • 为多模态智能体选择和比较奖励模型提供统一标准
  • 支持逐步骤诊断感知、规划及安全环节中的奖励判断缺陷
  • 为智能体奖励模型的专项训练、外部反馈设计和自我纠正研究提供数据依据
📝 原始笔记(逐字保留)
3. 2025-06-27 14:23:35 Friday | **[Agent-RewardBench: 在现实世界的多模式智能体中,为感知、规划和安全提供统一的奖励建模基准](https://papers.cool/arxiv/2506.21252)** **[PDF(3)]** **[Copy]** **[Kimi(2)]** **[REL] ** **[#17](https://arxiv.org/abs/2506.21252)****[Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents](https://papers.cool/arxiv/2506.21252)**** [PDF(3)] [Copy] [Kimi(2)] [REL]** 作者:门天艺、金卓然、曹鹏飞、陈宇博、刘康、赵军 随着多模态大型语言模型 (MLLM) 的进步,多模态代理在 Web 导航和具体智能等实际任务中显示出前景。然而,由于缺乏外部反馈的限制,这些代理在自我纠正和泛化方面遇到了困难。一个很有前途的方法是使用奖励模型作为外部反馈,但目前尚不清楚如何为代理选择奖励模型。因此,迫切需要建立一个针对代理的奖励基准。为了应对这些挑战,我们提出了 Agent-RewardBench,这是一个旨在评估 MLM 中奖励建模能力的基准。该基准测试具有三个关键特征:(1) 多个维度和真实世界的智能体场景评估。它涵盖 7 种场景的感知、规划和安全;(2) 阶梯级奖励评估。它允许在任务的各个步骤中评估代理能力,从而在规划过程中提供更精细的绩效视图;(3) 适当的难度和高质量。我们从 10 个不同的模型中仔细抽样,控制难度以维持任务挑战,并手动验证以确保数据的完整性。实验表明,即使是最先进的多模态模型也显示出有限的性能,这凸显了在智能体奖励建模中进行专门训练的必要性。代码可在 github 上获得。

语言模型训练的数据效能:DELT 数据组织范式

论文提出 DELT 范式,通过数据评分、选择与排序优化训练数据组织,在不增加数据规模和模型参数量的情况下提升语言模型性能。

 模型训练 数据工程 系统优化

论文将“数据效能”定义为通过优化训练数据的组织方式来最大化模型性能,以补充侧重于筛选最小或最佳数据子集的数据效率研究。作者提出通用范式 DELT,包含数据评分、数据选择和数据排序三个组件。其核心方法包括基于梯度一致性衡量样本可学习性与质量的可学习性-质量评分(LQS),以及用于缓解模型遗忘和数据分布偏差的折叠排序(FO)。实验表明,LQS 与折叠排序的组合提升最为显著,并且结合数据选择后可同时改善数据效能与数据效率。

用途与启示
  • 将训练数据的顺序与组织方式视为独立于数据规模、模型规模的性能优化维度。
  • 可在固定训练预算下联合使用 LQS 评分和折叠排序,提高语言模型训练收益。
  • 为课程学习、数据混合和持续预训练中的遗忘与分布偏差问题提供新的方法框架。
📝 原始笔记(逐字保留)
2. 2025-06-27 14:18:53 Friday **[语言模型训练的数据效能](https://papers.cool/arxiv/2506.21545)** **[PDF(9)]** **[Copy]** **[Kimi(1)]** **[REL] ** **[#1](https://arxiv.org/abs/2506.21545)****[Data Efficacy for Language Model Training](https://papers.cool/arxiv/2506.21545)**** [PDF(10)] [Copy] [Kimi(1)] [REL]** 作者:戴亚伦、黄扬宇、张鑫、吴文山、李冲、卢文辉、曹世杰、董力、李思嘉 数据是语言模型 (LM) 训练的基础。最近的研究致力于数据效率,旨在通过选择训练数据的最小或最佳子集来最大限度地提高性能。数据过滤、采样和选择等技术在这一领域起着至关重要的作用。为了补充它,我们定义了数据效能,它侧重于通过优化训练数据的组织来最大限度地提高性能,并且仍然相对未得到充分开发。这项工作介绍了一种通用范式 DELT,用于在 LM 训练中考虑数据功效,这突出了训练数据组织的重要性。DELT 包括三个组件:数据评分、数据选择和数据排序。在这些组件中,我们设计了可学习性-质量评分 (LQS),作为数据评分的新实例,它从梯度一致性的角度考虑了每个数据样本的可学习性和质量。我们还设计了折叠排序 (FO),作为数据排序的一个新实例,它解决了模型遗忘和数据分布偏差等问题。综合实验验证了 LM 训练中的数据效能,它证明了以下内容:首先,所提出的 DELT 的各种实例在不同程度上提高了 LM 性能,而无需增加数据规模和模型大小。其次,在这些实例中,我们提出的用于数据评分的 LQS 和用于数据排序的 Folding 相结合实现了最显着的改进。最后,通过应用数据选择,可以实现数据效率和数据效率。因此,我们相信数据有效性是 LM 训练中一个有前途的基础领域。

为下游任务优化语言模型:训练后视角

该论文从训练后视角提出持续预训练、参数高效微调和改进监督微调等方法,以提升语言模型适配下游任务时的效率、稳健性与泛化能力。

 模型训练 数据工程 系统优化 模型评估

论文研究语言模型在标注数据有限、未标注数据利用不足及微调成本高昂条件下的下游任务适配问题。作者提出新的持续预训练技术,从未标注数据中提取任务相关知识,并取得优于先进半监督方法的效果。论文还设计了参数高效微调与改进的监督微调方法,在降低内存和计算开销的同时增强模型的指令遵循能力。研究进一步引入多跳空间推理等评估任务,实验表明这些方法能够提升模型在多类 NLP 任务及开放式生成中的稳健性和泛化表现。

用途与启示
  • 为标注数据稀缺的下游任务提供更有效的训练后适配方案
  • 利用任务相关的未标注数据缓解小规模监督数据上的过拟合
  • 通过参数高效微调降低模型适配的显存与计算成本
  • 借助多跳推理等基准更全面地评估模型的适应能力
📝 原始笔记(逐字保留)
2025-06-27 14:25:51 Friday **[为下游任务优化语言模型:训练后视角](https://papers.cool/arxiv/2506.20917)** **[PDF(2)]** **[Copy]** **[Kimi()]** **[REL]** 作者:石正严 语言模型 (LM) 在 NLP 中表现出了卓越的功能,但要有效、稳健地适应特定任务仍然具有挑战性。随着其规模和复杂性的增长,对标记数据进行微调 LM 往往没有充分利用可用的未标记数据,导致小任务特定集的过度拟合,并带来巨大的计算成本。这些限制阻碍了它们在现实世界语言任务的开放式环境中的应用。本论文提出了一系列方法,以更好地使 LM 适应下游应用。首先,我们探索了从未标记数据中提取任务相关知识的策略,引入了一种新的持续预训练技术,该技术优于最先进的半监督方法。接下来,我们提出了一种参数高效的微调方法,该方法可显著降低内存和计算成本,同时保持有竞争力的性能。我们还引入了改进的监督微调方法,使 LM 能够更好地遵循指令,尤其是在标记数据稀缺的情况下,从而提高它们在一系列 NLP 任务(包括开放式生成)中的性能。最后,我们开发了新的评估方法和基准,例如多跳空间推理任务,以更全面地评估 LM 能力和适应能力。通过对不同 NLP 任务的广泛实证研究,我们的结果表明,这些方法大大提高了 LM 的稳健性、效率和泛化性,使其更能适应广泛的应用。这些进步标志着朝着更强大、更高效的 LM 迈出了重要一步,使我们更接近通用人工智能的目标。

Progtuning:基于 Transformer 语言模型的渐进式微调框架

Progtuning 根据 Transformer 块的贡献渐进式减少参与更新的模块,在保持竞争性性能的同时将更新参数量降低约 25%。

 模型训练 系统优化 人工智能框架

随着语言模型规模增长,全参数微调的计算成本不断增加,而现有参数高效微调方法通常未充分考虑不同 Transformer 块的贡献差异。Progtuning 将渐进式学习引入微调过程,根据各模块的贡献逐步减少需要更新的 Transformer 块数量。该方法优化了训练资源分配,将更新参数量减少约 25%,同时保持具有竞争力的下游任务性能。Progtuning 还可与参数高效微调方法结合,并在多种模型适配场景中展现出良好的适应性。

用途与启示
  • 降低大规模 Transformer 模型微调时的参数更新量与计算成本
  • 根据模块贡献动态分配训练资源,避免对低贡献模块进行冗余更新
  • 可与现有参数高效微调方法结合,为不同下游适配场景提供渐进式训练方案
📝 原始笔记(逐字保留)
2. 2025-06-27 14:25:00 Friday [#22](https://arxiv.org/abs/2506.21119) **[Progtuning:基于 Transformer 的语言模型的渐进式微调框架](https://papers.cool/arxiv/2506.21119)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** 作者:纪晓霜,赵振东,陈晓军,赵鑫,刘泽尧 微调是一种很有前途的技术,可用于在下游任务中利用基于 Transformer 的语言模型。随着模型大小的不断增长,更新所有模型参数的成本越来越高。参数高效的微调方法通过选择性地更新一小部分参数来有效地解决此问题。然而,微调和大多数现有的参数高效微调方法需要更新与初始大小相同数量的参数,忽略了 Transformer 块之间的不平等贡献,并导致计算资源分配效率极低。在本文中,我们提出了 Progtuning,这是一种新颖的微调框架,结合了基于 Transformer 的语言模型的渐进式学习。具体来说,Progtuning 会根据贡献逐步减少更新的 transformer 块的数量。值得注意的是,Progtuning 优化了资源分配,并将更新参数的数量减少了大约 25\%,同时仍然保持有竞争力的性能。它还通过参数高效的微调方法表现出高适应性,在各种适应场景中表现出优异的性能。

大型语言模型中的波将金式理解

论文提出“波将金式理解”概念与量化方法,揭示大语言模型在多种任务和领域中可能以内部不连贯的答案制造理解幻觉。

 模型评估 推理 人工智能

论文探讨了能否根据大语言模型在精选基准问题上的表现,可靠推断其对概念的真实理解。作者提出一个正式框架,主张只有当模型的错误能够像人类误解一样呈现一致、可解释的模式时,人类考试类基准才具有理解评估效度。研究设计了覆盖三个领域的专用基准,并提出一种可估计该现象流行率下限的通用程序。实验发现“波将金式理解”广泛存在于不同模型、任务和领域中,且反映了概念表示层面更深层的内部不连贯性。

用途与启示
  • 提醒研究者不要把基准高分直接等同于模型真正理解。
  • 可用于设计关注错误一致性、概念迁移和内部连贯性的评估方法。
  • 为识别模型的表面能力与稳健概念表示之间的差距提供量化框架。
📝 原始笔记(逐字保留)
1. 2025-06-27 14:20:08 Friday **#3 大型语言模型中的波将金式理解 [PDF** **(1)** **] [复制] [Kimi** **(2)** **] [相关] ** **[#3](https://arxiv.org/abs/2506.21521)****[Potemkin Understanding in Large Language Models](https://papers.cool/arxiv/2506.21521)**** [PDF(1)] [Copy] [Kimi(2)] [REL]** 作者:玛丽娜·曼科里迪斯、贝卡·威克斯、凯永·瓦法、森迪尔·穆莱纳坦 大型语言模型 (LLM) 定期使用基准数据集进行评估。但是,有什么理由根据 LLM 对一系列精选问题的回答来推断 LLM 的能力呢?本文首先介绍了一个正式的框架来解决这个问题。关键是要注意,用于测试 LLM 的基准(例如 AP 考试)也是用于测试人的基准。然而,这提出了一个含义:只有当 LLM 以反映人类误解的方式误解概念时,这些基准才是有效的测试。否则,基准测试的成功只能证明波将金理解:由与任何人解释概念的方式不可调和的答案驱动的理解幻觉。我们提出了两个量化 potemkins 存在的程序:一个在三个领域使用专门设计的基准,另一个使用提供其流行率下限的通用程序。我们发现 potemkins 在模型、任务和领域中无处不在。我们还发现,这些失败不仅反映了不正确的理解,还反映了概念表示中更深层次的内部不连贯性。

构思与执行差距:LLM 与人类研究理念的执行结果比较

研究通过让43名专家实际执行随机分配的人类或LLM研究构想,发现LLM构想从初评到落地后的评分下降更明显,揭示其新颖性印象与真实研究价值之间存在差距。

 模型评估 人工智能

研究招募43名专家研究人员,随机分配由人类专家或LLM生成的研究想法,并要求每人投入100多个小时完成实验及4页研究报告。随后,专业NLP研究人员对全部成果进行盲审,比较构想执行前后的新颖性、兴奋性、有效性和整体评分。结果显示,LLM生成的想法在落地后各项指标的降幅显著大于专家构想,部分汇总指标甚至由LLM领先反转为人类领先。研究表明,仅凭构想阶段的文字评价可能高估LLM的科研创新能力,实际执行结果是评估研究想法质量的关键依据。

用途与启示
  • 为评估AI生成研究构想提供“实际执行后再审查”的实验范式
  • 提醒科研智能体不能只优化构想的新颖感,还需衡量可行性、有效性和最终成果质量
  • 支持构建覆盖构思、实验实施与结果复核的端到端科研能力基准
  • 说明在缺少执行证据时,人工或自动评审都可能高估LLM研究想法
📝 原始笔记(逐字保留)
3. 2025-06-27 14:26:54 Friday **[构思与执行差距:LLM 生成的与人类研究理念的执行结果](https://papers.cool/arxiv/2506.20803)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** 作者:陈乐磊、桥本达规、杨迪一 大型语言模型 (LLM) 在加速科学研究管道方面显示出前景。这个过程的一个关键能力是产生新颖研究想法的能力,以前的研究发现,LLM 产生的研究想法被认为比人类专家的想法更新颖。然而,一个好主意不应该简单地看起来新颖,它还应该在执行后导致更好的研究。为了测试 AI 生成的想法是否会带来更好的研究结果,我们通过招募 43 名专家研究人员来执行随机分配的想法,这些想法要么由专家撰写,要么由 LLM 生成。每位专家都花了 100 多个小时来实施这个想法,并写了一篇 4 页的短文来记录实验。然后,所有已执行的项目都由专业的 NLP 研究人员盲目审查。比较执行前后相同想法的审查分数,LLM 生成的想法在所有评估指标(新颖性、兴奋性、有效性和整体性;p < 0.05)上的下降幅度明显大于专家编写的想法,缩小了 LLM 与在构思阶段观察到的人类想法之间的差距。在比较执行研究的汇总评论分数时,我们甚至观察到,对于许多指标,人类想法得分高于 LLM 想法的排名发生了翻转。这种构思-执行差距凸显了当前 LLM 在产生真正有效的研究思想方面的局限性,以及在没有执行结果的情况下评估研究思想的挑战。

ScienceBoard:面向真实科学工作流的多模态智能体评测环境

ScienceBoard 提供面向科学任务的真实计算机交互环境与自动评估机制,用于衡量多模态智能体完成科学工作流的能力。

 模型评估 多模态 智能体 智能体工具

ScienceBoard 是首个面向科学任务、真实交互和自动评估的多模态智能体评测环境。不同于 WebArena、OSWorld 等侧重日常场景和通用软件的基准,它聚焦智能体操作计算机完成真实科学工作流的能力。该项目通过多轮交叉验证确保任务指令清晰、操作流程合理,并支持自动化评估。项目由香港大学、上海人工智能实验室、复旦大学、北京大学和耶鲁大学联合开展,项目主页为 https://qiushisun.github.io/ScienceBoard-Home/

用途与启示
  • 评估多模态智能体在真实科学软件与工作流中的工具使用能力
  • 为科学智能体提供可复现、可自动评分的实验环境
  • 推动智能体评测从日常计算机任务扩展到专业科研场景
  • 为科学工作流自动化系统的训练、对比和迭代提供基准
📝 原始笔记(逐字保留)
4. 2025-06-27 11:41:48 Friday | 首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了 https://mp.weixin.qq.com/s/naVskQ9btJFkoUyyQVr7zA 电脑智能体(Computer-Using Agents,也称 CUA)的出现,这一角色正在发生根本性转变。相比于传统的语言模型助手,这类智能体能够像人类一样操作计算机。 社区已提出多项 CUA 智能体评测(如 WebArena、OSWorld 等),但这些工作大多集中在日常场景和通用软件上 在这样的背景下,我们提出了 ScienceBoard:首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,目标是从根本上推动 “会自动完成科学工作流的 AI” 的研究进展。 * 论文题目:ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows * 项目地址:https://qiushisun.github.io/ScienceBoard-Home/ * 研究机构:香港大学,上海人工智能实验室,复旦大学,北京大学,耶鲁大学 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=MGFkYTViNGNkYzAxM2JhNmJlMWZhODNiNzI3Nzc4N2RfMFRZVnpWSUpvU0NNRWo1bVZaa0lHSldYUkNrNjQwMVFfVG9rZW46WDJqcWJkelFIb0pTeDl4Z3FFMGNBSk1RbndoXzE3NTUyNjAzOTY6MTc1NTI2Mzk5Nl9WNA) 通过多轮交叉验证确保指令清晰、操作合理 ## 工具使用

GenEscape:分层多智能体生成密室逃脱谜题

GenEscape通过分层多智能体协作,将密室逃脱图像生成拆解为功能设计、场景图推理、布局合成和局部编辑,以提升谜题的视觉质量与逻辑可解性。

 逻辑推理 多模态 智能体 任务规划 人工智能框架

GenEscape旨在生成兼具视觉吸引力、逻辑严密性和智力挑战性的密室逃脱谜题图像。针对基础文本到图像模型难以处理空间关系与可供性推理的问题,该方法采用分层多智能体框架,将任务划分为功能设计、符号场景图推理、布局合成和局部图像编辑等阶段。不同专业智能体通过迭代反馈协作,保证场景视觉连贯且谜题能够被正确解开。实验显示,该框架在维持视觉质量的同时,改善了可解性、捷径规避能力和交互线索清晰度。

用途与启示
  • 为需要严格空间约束和因果链条的视觉谜题生成提供结构化方案。
  • 展示多智能体分工与迭代审查对提升生成内容逻辑一致性的价值。
  • 可用于游戏关卡设计、交互式叙事以及视觉推理基准的数据合成。
📝 原始笔记(逐字保留)
2025-06-30 20:01:33 Monday | **[GenEscape:分层多代理生成密室逃脱谜题](https://papers.cool/arxiv/2506.21839)** **Authors** : [Mengyi Shan](https://arxiv.org/search/?searchtype=author&query=Mengyi%20Shan), [Brian Curless](https://arxiv.org/search/?searchtype=author&query=Brian%20Curless), [Ira Kemelmacher-Shlizerman](https://arxiv.org/search/?searchtype=author&query=Ira%20Kemelmacher-Shlizerman), [Steve Seitz](https://arxiv.org/search/?searchtype=author&query=Steve%20Seitz) 我们挑战文本到图像模型,生成视觉上吸引人、逻辑扎实且具有智力刺激性的密室逃脱拼图图像。虽然基础图像模型在空间关系和可供性推理方面苦苦挣扎,但我们提出了一个分层多智能体框架,将这项任务分解为结构化阶段:功能设计、符号场景图推理、布局合成和局部图像编辑。专业代理通过迭代反馈进行协作,以确保场景在视觉上连贯且功能上可解算。实验表明,代理协作在保持视觉质量的同时,在可解性、捷径避免和可供性清晰度方面提高了输出质量。 **科目** : **[计算机视觉和模式识别](https://papers.cool/arxiv/cs.CV)** , [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-06-27 01:08:37 UTC

揭示大型语言模型中的因果推理:现实还是海市蜃楼?

研究认为现有大语言模型主要依赖参数中已有知识进行浅层因果推理,并通过新基准 CausalProbe-2024 与 G²-Reasoner 方法探索向类人因果推理迈进的路径。

 逻辑推理 推理 模型评估 数据工程 人工智能

论文从 Transformer 自回归机制出发,指出其生成过程本身不等同于真正的因果推理,并将现有 LLM 的能力主要归为浅层的 1 级因果推理。作者提出新鲜语料因果问答基准 CausalProbe-2024,以降低训练数据记忆和污染对评估的影响,模型在该基准上的性能显著下降。为缩小与类人 2 级因果推理之间的差距,研究提出 G²-Reasoner,将常识知识与目标导向提示引入推理过程。实验显示,该方法尤其能改善模型在新鲜及反事实情境中的因果推理表现。

用途与启示
  • 用新鲜语料检验 LLM 的因果推理究竟源于真实推断还是训练知识记忆。
  • 为区分浅层因果关联与类人因果推理提供新的评估基准。
  • 启示研究者通过常识注入和目标导向提示增强反事实及陌生场景下的推理能力。
  • 提醒因果推理评估关注数据污染、语料时效性和模型记忆效应。
📝 原始笔记(逐字保留)
2025-06-27 14:29:15 Friday **[揭示大型语言模型中的因果推理:现实还是海市蜃楼?](https://papers.cool/arxiv/2506.21215)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** 作者:池浩昂、李贺、杨文静、刘峰、兰龙、任晓光、刘同亮、韩博 因果推理能力对于推动大型语言模型 (LLM) 向强大的人工智能发展至关重要。虽然多功能的 LLM 似乎已经展示了理解上下文因果关系和提供遵守因果定律的响应的能力,但目前尚不清楚它们是否执行类似于人类的真正因果推理。然而,目前的证据表明恰恰相反。具体来说,LLM 只能进行浅层(1 级)因果推理,这主要归因于其参数中嵌入的因果知识,但它们缺乏真正的类人(2 级)因果推理的能力。为了支持这一假设,从方法论上讲,我们深入研究了基于 transformer 的 LLM 的自回归机制,揭示了它本身并不是因果关系。从实证上讲,我们引入了一个名为 CausalProbe-2024 的新因果问答基准,其语料库是新鲜的,对于所研究的 LLM 来说几乎是看不见的。与早期的基准测试相比,LLM 在 CausalProbe-2024 上表现出显着的性能下降,这表明它们主要从事 1 级因果推理。为了弥合通往 2 级因果推理的差距,我们从人类推理通常由一般知识和预期目标促进这一事实中汲取灵感。我们提出了 G^2-Reasoner,这是一种将常识和面向目标的提示纳入 LLM 的因果推理过程的方法。实验表明,G^2-Reasoner 显着增强了 LLM 的因果推理能力,尤其是在新鲜和反事实的上下文中。这项工作为法学硕士迈向真正的因果推理开辟了一条新的道路,超越了 1 级,向 2 级迈进。 ## 一致性研究
0%