2025-06-26 科研追新

当日精选(由提交工具自动创建)。

MuJoCo Playground:面向机器人学习与仿真到现实迁移的开源框架

UC 伯克利与 Google DeepMind 等机构推出 MuJoCo Playground,以单 GPU 分钟级训练和简化的仿真到现实迁移降低机器人策略开发门槛。

 具身智能 人工智能框架 强化学习 智能体工具 模型训练

MuJoCo Playground 是一个基于 MJX 构建的完全开源机器人学习框架,由 UC 伯克利、Google DeepMind、多伦多大学和剑桥大学的研究者共同开发。它统一并简化了仿真环境搭建、策略训练以及仿真到现实迁移的完整流程。用户可通过 pip install playground 快速安装,并在单张 GPU 上于数分钟内完成策略训练。该框架旨在降低具身智能和机器人强化学习的实验成本,加速策略从模拟环境走向真实机器人。

用途与启示
  • 为机器人强化学习提供易安装、可复现的开源实验基础设施
  • 利用 GPU 加速实现分钟级策略训练,缩短具身智能研究迭代周期
  • 简化仿真到现实迁移流程,帮助研究者快速验证真实机器人控制策略
  • 可作为机器人环境、训练算法与部署方案的统一开发平台
📝 原始笔记(逐字保留)
2. 2025-06-26 13:57:58 Thursday * 论文链接:https://www.roboticsproceedings.org/rss21/p020.pdf * 论文主页:https://playground.mujoco.org/ * 机构:UC 伯克利、Google DeepMind、多伦多大学、剑桥大学 * 作者:Kevin Zakka, Baruch Tabanpour, Qiayuan Liao, Mustafa Haiderbhai, Samuel Holt, Jing Yuan Luo, Arthur Allshire, Erik Frey, Koushil Sreenath, Lueder Alexander Kahrs, Carmelo Sferrazza, Yuval Tassa, Pieter Abbeel **论文摘要:** 该研究提出了 MuJoCo Playground—— 这是一个基于 MJX 构建的完全开源机器人学习框架,其核心设计目标是大幅简化仿真环境搭建、模型训练以及仿真到现实场景的迁移全流程。研究人员仅需执行简单的「pip install playground」安装命令,即可在单 GPU 硬件上完成分钟级策略训练。

VLN-R1:基于第一人称视觉的连续具身导航

香港大学与上海AI Lab联合提出VLN-R1,可将自然语言指令直接转化为第一人称视角下的连续导航动作,并在无离散地图条件下完成复杂环境导航。

 具身智能 多模态 智能体 任务规划 模型开发

香港大学与上海AI Lab联合提出具身导航模型 VLN-R1。该模型能够理解自然语言指令,并直接生成第一人称视角下的连续导航动作。与依赖离散地图或预定义节点的方法不同,VLN-R1可在复杂环境中持续进行视觉感知、决策与行动,展现出更接近人类的导航能力。

用途与启示
  • 推动视觉—语言导航从离散动作空间转向连续真实环境。
  • 为无需预建地图的具身智能体提供端到端导航方案。
  • 可用于家庭机器人、服务机器人及复杂场景中的自主移动。
📝 原始笔记(逐字保留)
3. 2025-06-26 14:05:00 Thursday 由香港大学与上海AI Lab联合提出的 **VLN-R1** ,具备将自然语言指令直接转化为第一人称视角下的连续导航动作的能力,无需依赖离散地图,能在复杂环境中灵活感知、决策与行动,实现类人级别的具身智能导航。 https://mp.weixin.qq.com/s/XhcnUxYUXi2jvX51u3zpsw

Google DeepMind 发布端侧 VLA 模型 Gemini Robotics On-Device

Google DeepMind 发布首个可完全在机器人本地运行的视觉-语言-动作模型 Gemini Robotics On-Device。

 具身智能 多模态 模型开发 人工智能

Google DeepMind 团队发布了 Gemini Robotics On-Device。该模型属于视觉-语言-动作(VLA)模型,可完全在机器人本地运行。端侧部署有助于机器人在不依赖持续云端连接的情况下完成感知、语言理解与动作控制。

用途与启示
  • 推动 VLA 模型从云端服务转向机器人本地部署
  • 为低延迟、弱网络或离线环境中的具身智能应用提供参考
  • 展示端侧多模态感知与动作控制一体化的发展方向
📝 原始笔记(逐字保留)
4. 2025-06-26 14:06:50 Thursday **Google DeepMind**团队首个可以完全在机器人本地运行的视觉-语言-动作(VLA)模型**Gemini Robotics On-Device**发布。https://mp.weixin.qq.com/s/oyT1CRRdbUxfF9cvApePRg

人类创造力的核心机制,AI 已开始掌握:IEI 分层评估框架

北大团队受概念融合理论启发,提出 IEI 框架,从识别、解释和引申三个层次评估 AI 的组合创造力。

 元学习 模型评估 推理 人工智能

研究团队受 Margaret Boden 的创造力理论和概念融合理论启发,提出面向 AI 系统的 IEI 分层评估框架。该框架将组合创造力拆分为识别、解释与引申三个递进层次。识别关注模型能否分解输入概念的基本元素,解释考察其发现概念间潜在关联的能力,引申则衡量其理解并生成超越原始输入语义内涵的能力。该工作入选 CogSci 2025 Oral,为分析 AI 是否真正具备类人创造性认知提供了结构化方法。

用途与启示
  • 为大模型组合创造力提供可解释、分层次的评估标准
  • 区分概念识别、关联解释与语义引申能力,避免以单一结果衡量创造力
  • 可用于比较不同模型的创造性推理水平,并指导训练与评测设计
📝 原始笔记(逐字保留)
2025-06-26 14:07:46 Thursday | 人类创造力的核心机制,AI已经开始掌握了 | 北大CogSci 2025(Oral) https://mp.weixin.qq.com/s/ZkkVx3TXUIiwe-XNyyWj3Q 论文地址:https://ppyyqq.github.io/aicc/ 这种从 **“识别”→“解释”→“引申”的三层认知过程** ,正是人类创造力的核心机制。而现在,AI也开始掌握这种能力了。 对此,受认知科学家Margaret Boden和认知科学中的“概念融合理论”(Conceptual Blending Theory)的启发,研究团队首次提出了一个面向AI系统的分层评估框架——IEI框架 *(Identification–Explanation–Implication)* 。 该框架将组合创造力分解为三个层次: * **识别(Identification)** :能否正确分解输入概念的基本元素; * **解释(Explanation)** :能否发现概念间的潜在关联; * **引申(Implication)** :能否理解超越原始输入的语义内涵。 ## 元学习 #### 使用元学习在维基百科上检测袜子

Decrypto:多智能体推理与心智理论基准测试

Decrypto 通过交互式博弈评估大模型的多智能体推理与心智理论能力,发现前沿模型仍落后于人类和简单基线,部分推理模型甚至不及其早期版本。

 元学习 智能体 推理 博弈论 模型评估

Decrypto 是一个受认知科学、计算语用学和多智能体强化学习启发的游戏化基准,旨在隔离并评估大模型的多智能体推理与心智理论能力。它针对现有基准范围狭窄、数据泄露、任务饱和和缺乏交互性等问题,提供了可设计交互式心智理论实验的平台。综合评测、鲁棒性研究和人机对抗实验显示,前沿 LLM 的游戏表现落后于人类及简单的词嵌入基线。研究还复现了经典认知科学实验的变体,发现部分先进推理模型在三项关键心智理论任务上显著逊于早期版本。

用途与启示
  • 为多智能体系统提供交互式、低混杂的心智理论评估环境
  • 揭示通用推理能力提升并不必然带来更强的他者状态建模能力
  • 可用于比较模型版本、开展人机对抗实验及研究多智能体协作与竞争
  • 为训练具备更强社会推理和策略适应能力的智能体提供评估依据
📝 原始笔记(逐字保留)
3. 2025-06-26 14:41:04 Thursday | **#37 多智能体推理与心智理论解密基准测试 [PDF** **(3)** **] [复制] [Kimi** **(7)** **] [相关]** **[#37](https://arxiv.org/abs/2506.20664)****[The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind](https://papers.cool/arxiv/2506.20664)**** [PDF(3)] [Copy] [Kimi(7)] [REL]** 作者:安德烈·卢普、蒂蒙·威利、雅各布·福斯特 随着大型语言模型(LLMs)获得自主行为能力,它们将需要应对复杂的多智能体场景,在合作与竞争环境中与人类用户及其他智能体进行交互。这需要新的推理技能,其中最关键的是心智理论(ToM)——即对其他智能体"心理"状态进行推理的能力。然而目前对 LLMs 的心智理论及其他多智能体能力认知甚少,现有基准测试存在范围狭窄、数据泄露、饱和度高及缺乏交互性等问题。为此我们提出 Decrypto——一个基于游戏的基准测试框架,其设计灵感源自认知科学、计算语用学和多智能体强化学习。该框架在其他所有维度都尽可能简化,消除了常见于其他基准测试的混杂因素。据我们所知,这也是首个支持设计交互式心智理论实验的平台。我们通过对前沿 LLMs 的综合实证评估、鲁棒性研究以及人机对抗实验验证了该基准设计。研究发现,LLMs 的游戏表现落后于人类及简单的词嵌入基线模型。 我们随后在 Decrypto 中复现了两个经典认知科学实验的变体,用以评估三项关键心智理论能力。令人惊讶的是,当前最先进的推理模型在这些任务上的表现竟显著逊色于早期版本。这一发现表明 Decrypto 填补了当前推理与心智理论评估的关键空白,为开发更优秀的人工智能体开辟了新路径。 主题:人工智能、计算与语言、人机交互、多智能体系统

Gemini CLI 开源并免费提供

Google 推出并开源 Gemini CLI,开发者可在命令行中免费使用 Gemini 辅助编程与处理开发任务。

 智能体工具 人工智能辅助编程 智能体 人工智能

Gemini CLI 已开源并提供免费使用方案,将 Gemini 的能力直接带入终端环境。开发者可以通过自然语言在命令行中完成代码理解、生成及相关开发任务。其开源与免费策略降低了 AI 编程工具的使用门槛,也为社区扩展和二次开发提供了基础。

用途与启示
  • 在终端中使用 Gemini 辅助代码生成、理解与开发工作
  • 为构建命令行智能体和自动化开发流程提供开源基础
  • 降低个人开发者试用 AI 编程助手的成本
📝 原始笔记(逐字保留)
2025-06-26 14:25:53 Thursday| Gemini CLI 开源+免费https://mp.weixin.qq.com/s/370Vt6Ly_2kLuyBUJ7vfIw

GoT-R1:强化学习解锁多模态视觉生成推理新范式

港大等团队开源GoT与GoT-R1,通过强化学习提升多模态大模型在视觉生成中的语义和空间推理能力。

 强化学习 多模态 推理 模型训练 模型开发

GoT-R1将强化学习引入多模态视觉生成流程,让模型能够在生成图像前开展更充分的语义与空间推理。该方法减少了对预定义推理模板的依赖,使模型可以自主探索并学习更优的生成策略。实验表明,这一框架能够显著增强多模态大模型处理复杂视觉生成任务的能力。GoT与GoT-R1的论文和代码均已公开。

用途与启示
  • 为需要复杂构图和空间关系理解的视觉生成任务提供新的训练方案
  • 展示强化学习在提升多模态模型自主推理能力方面的潜力
  • 可作为研究视觉生成奖励设计、推理轨迹优化和模型自我探索的开源基线
📝 原始笔记(逐字保留)
2025-06-26 13:36:30 Thursday |让多模态大模型「想明白再画」!港大等开源GoT-R1:强化学习解锁视觉生成推理新范式 https://mp.weixin.qq.com/s/sPdhPeNMkdBLjtLzI5urwg 该新框架通过引入强化学习,显著增强了多模态大模型在视觉生成任务中的语义 - 空间推理能力,使其能够超越预定义模板,自主探索和学习更优的推理策略。GoT 和 GoT-R1 已全面开源。 * GoT arxiv:https://arxiv.org/pdf/2503.10639 * GoT github:https://github.com/rongyaofang/GoT * GoT-R1 arxiv: https://arxiv.org/pdf/2505.17022 * GoT-R1 github:https://github.com/gogoduan/GoT-R1

推理越多,幻觉越重?多模态推理模型的「幻觉悖论」

文章探讨多模态模型中延长推理过程可能反而加剧幻觉的悖论现象。

 推理 多模态 人工智能

文章关注多模态推理模型中的「幻觉悖论」:增加推理步骤并不一定提升答案的事实可靠性。更长的推理链可能持续放大早期的视觉误判或错误假设,使模型生成看似连贯但缺乏证据支撑的结论。这表明推理能力与幻觉抑制并非天然一致,评估模型时需要同时考察推理质量、视觉依据和事实准确性。

用途与启示
  • 提醒研究者不要将更长的推理过程直接等同于更高的可靠性
  • 启发多模态模型引入视觉证据校验、推理中止和错误回溯机制
  • 为评估体系补充幻觉率、证据一致性与推理长度之间的关联分析
📝 原始笔记(逐字保留)
2025-06-26 14:21:42 Thursday | 推理越多,幻觉越重?多模态推理模型的「幻觉悖论」 https://mp.weixin.qq.com/s/QTW8gr1qPNqQzFlFjVi_FQ

Gemini Robotics On-Device:可直接部署于机器人的 VLA 模型

谷歌 DeepMind 发布首个可直接在机器人本地部署的 Gemini Robotics On-Device 视觉-语言-动作模型。

 模型开发 具身智能 多模态 人工智能应用

谷歌 DeepMind 推出 Gemini Robotics On-Device,这是一款面向机器人的视觉-语言-动作(VLA)模型。该模型能够直接部署在机器人设备上,将视觉感知、语言理解与动作控制结合起来。本地运行有助于降低对云端连接的依赖,并改善机器人执行任务时的响应速度与可用性。

用途与启示
  • 为机器人端侧部署多模态具身模型提供参考
  • 推动低延迟、弱联网环境下的机器人自主执行
  • 展示 VLA 模型从云端能力向实体设备迁移的趋势
📝 原始笔记(逐字保留)
8. 2025-06-26 12:06:05 Thursday | Gemini Robotics On-Device,谷歌 DeepMind 首个可以直接部署在机器人上的视觉-语言-动作(VLA)模型https://mp.weixin.qq.com/s/mjZAAvVtPevYDD5HfexN6g

华为发布 CloudRobo 具身智能平台

华为在开发者大会 2025(HDC 2025)上发布 CloudRobo 具身智能平台。

 人工智能 具身智能 智能体工具 人工智能应用

2025 年 6 月 26 日,华为在开发者大会 2025(HDC 2025)上发布 CloudRobo 具身智能平台。该平台面向具身智能相关的开发与应用,为机器人智能化提供平台支持。CloudRobo 的发布体现了华为在具身智能基础设施与产业生态方面的布局。

用途与启示
  • 关注 CloudRobo 对具身智能开发流程和落地效率的提升。
  • 评估其在机器人训练、部署及行业应用中的平台价值。
  • 跟踪华为在具身智能基础设施与开发者生态方面的后续进展。
📝 原始笔记(逐字保留)
5. 2025-06-26 12:07:09 Thursday | 华为开发者大会 2025(HDC 2025)上发布了 CloudRobo 具身智能平台https://mp.weixin.qq.com/s/rtBnAnEvsJr0TIOQzzm30w

MMSearch-R1:激励大型多模态模型自主搜索

MMSearch-R1通过端到端强化学习训练大型多模态模型按需调用图像与文本搜索工具,在保持性能的同时减少30%以上的搜索次数。

 智能体 多模态 强化学习 智能体工具 任务规划 模型训练

MMSearch-R1 是一个面向大型多模态模型的端到端强化学习框架,使模型能够在真实互联网环境中自主决定何时搜索、使用何种工具以及是否继续多轮搜索。框架整合图像与文本搜索工具,并结合结果奖励与搜索惩罚,抑制低效或过度搜索行为。研究团队还通过半自动流程构建了覆盖视觉和文本知识需求的多模态搜索 VQA 数据,并发现同时包含需搜索与无需搜索样本的平衡子集对训练至关重要。实验显示,该方法优于同规模 RAG 基线,并能以减少30%以上搜索调用的代价达到更大规模 RAG 模型的性能。

用途与启示
  • 为多模态智能体提供可学习的按需搜索策略,替代固定的 RAG 检索流程。
  • 表明搜索成本惩罚与结果奖励结合,可同时优化任务效果和工具调用效率。
  • 提示训练搜索智能体时应平衡“需要搜索”与“无需搜索”的样本,避免模型形成无差别检索倾向。
  • 可用于知识密集型视觉问答、实时信息查询和具备互联网访问能力的多模态助手。
📝 原始笔记(逐字保留)
3. 2025-06-26 14:39:11 Thursday | **#36 MMSearch-R1:激励大型多模态模型进行搜索 [PDF** **(11)** **] [复制] [Kimi** **(4)** **] [相关]** **[#36](https://arxiv.org/abs/2506.20670)****[MMSearch-R1: Incentivizing LMMs to Search](https://papers.cool/arxiv/2506.20670)**** [PDF(11)] [Copy] [Kimi(4)] [REL]** 作者:吴金明、邓子豪、李伟、刘一丁、游波、李波、马泽军、刘子维 在现实场景中稳健部署大型多模态模型(LMMs)需要接入外部知识源,这源于现实世界信息的复杂性和动态性。现有方法如检索增强生成(RAG)和提示工程搜索代理依赖于固定流程,常导致低效或过度搜索行为。我们提出 MMSearch-R1——首个端到端强化学习框架,使 LMMs 能在真实互联网环境中执行按需多轮搜索。该框架整合了图像与文本搜索工具,通过基于结果的奖励机制配合搜索惩罚项,引导模型自主决策搜索时机与方式。为支持训练,我们通过半自动化流程收集了涵盖多样化视觉与文本知识需求的多模态搜索 VQA 数据集,并筛选出包含需搜索样本与非搜索样本的搜索平衡子集,这被证实对塑造高效按需搜索行为至关重要。 在知识密集型和信息检索型视觉问答任务上的大量实验表明,我们的模型不仅优于同等规模的基于检索增强生成(RAG)的基线模型,还能在减少 30%以上搜索调用次数的同时,达到更大规模 RAG 模型的性能水平。我们进一步分析了关键实证发现,为推进多模态搜索研究提供了可操作的见解。 #### Agentic Web,一个由 AI 智能体组成的、目标导向型的互联网系统

MemBench:面向大语言模型智能体记忆能力的综合评估

MemBench 提出面向大语言模型智能体的综合基准,用于更系统地评估智能体的记忆能力。

 智能体记忆 模型评估 智能体

论文提出 MemBench,旨在解决现有评测对大语言模型智能体记忆能力覆盖不足的问题。该基准从更全面的角度考察智能体对历史信息的存储、检索与利用能力。它可用于比较不同智能体及记忆机制的实际表现,并帮助定位记忆系统中的能力短板。MemBench 为智能体长期交互和记忆模块的标准化评估提供了参考。

用途与启示
  • 系统评估 LLM 智能体的记忆能力
  • 比较不同记忆架构、检索策略与上下文管理方法
  • 为长期交互智能体的记忆模块优化提供评测依据
📝 原始笔记(逐字保留)
3. 论文标题: MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents 1. 论文链接: [https://arxiv.org/abs/2506.21605](https://arxiv.org/abs/2506.21605)

通过结构化推理增强大语言模型

该研究通过显式标注推理步骤、监督微调与融合 MAX-Flow 和 LCS 的 GRPO 方法,提升大语言模型在逻辑演绎和系统规划任务中的结构化推理能力。

 逻辑推理 推理 模型训练 强化学习 数据合成

大语言模型依赖隐式统计关系,在复杂逻辑演绎和系统规划任务中仍缺乏稳定的结构化知识表征。作者受认知科学和神经符号人工智能启发,通过显式标注推理步骤,将非结构化数据转换为结构化训练数据,并据此开展监督微调。研究进一步采用群体相对策略优化(GRPO),结合 MAX-Flow 与最长公共子序列(LCS)算法,以提高推理效率并降低计算复杂度。在 DeepSeek-R1-Distill-Qwen-1.5B 上的实验显示,该方法能够带来更简洁、稳健且跨场景适用的推理表现。

用途与启示
  • 为提升大模型的逻辑演绎与系统规划能力提供显式结构化训练方案。
  • 展示 SFT 与 GRPO 结合在结构化推理能力培养上的潜力。
  • MAX-Flow 和 LCS 可用于设计更高效、对推理结构更敏感的强化学习优化信号。
  • 为小参数模型获得简洁、稳健且可迁移的推理能力提供实践参考。
📝 原始笔记(逐字保留)
2025-06-26 14:36:33 Thursday | **#17 通过结构化推理增强大语言模型 [PDF** **(5)** **] [复制] [Kimi** **(5)** **] [相关]** **[#17](https://arxiv.org/abs/2506.20241)****[Enhancing Large Language Models through Structured Reasoning](https://papers.cool/arxiv/2506.20241)**** [PDF(5)] [Copy] [Kimi(5)] [REL]** 作者:董雨博,范和和 当前大语言模型(LLMs)在自然语言处理和自动化决策领域取得了显著进展。然而,这些模型在执行涉及逻辑演绎和系统规划的复杂推理任务时仍存在困难,主要源于其对隐式统计关系的依赖而缺乏结构化知识表征。受认知科学和神经符号人工智能的启发,我们提出了一种通过显式结构化推理增强 LLMs 的新方法。首先,我们通过显式标注推理步骤将非结构化数据转换为结构化格式。随后利用该结构化数据集通过监督微调(SFT)训练 LLMs。此外,我们采用群体相对策略优化(GRPO)增强 LLMs 的结构化推理能力,其中融合了 MAX-Flow 和最长公共子序列(LCS)两种创新算法,显著提升了推理效能并降低了计算复杂度。 对 DeepSeek-R1-Distill-Qwen-1.5B 模型进行微调的实验结果表明,该模型具备简洁的推理能力、跨场景的稳健性能,以及与优化技术更好的兼容性,验证了结构化推理集成在 LLMs 中的有效性。
0%