2025-06-26 科研追新
当日精选(由提交工具自动创建)。
MuJoCo Playground:面向机器人学习与仿真到现实迁移的开源框架
UC 伯克利与 Google DeepMind 等机构推出 MuJoCo Playground,以单 GPU 分钟级训练和简化的仿真到现实迁移降低机器人策略开发门槛。
MuJoCo Playground 是一个基于 MJX 构建的完全开源机器人学习框架,由 UC 伯克利、Google DeepMind、多伦多大学和剑桥大学的研究者共同开发。它统一并简化了仿真环境搭建、策略训练以及仿真到现实迁移的完整流程。用户可通过 pip install playground 快速安装,并在单张 GPU 上于数分钟内完成策略训练。该框架旨在降低具身智能和机器人强化学习的实验成本,加速策略从模拟环境走向真实机器人。
- 为机器人强化学习提供易安装、可复现的开源实验基础设施
- 利用 GPU 加速实现分钟级策略训练,缩短具身智能研究迭代周期
- 简化仿真到现实迁移流程,帮助研究者快速验证真实机器人控制策略
- 可作为机器人环境、训练算法与部署方案的统一开发平台
📝 原始笔记(逐字保留)
VLN-R1:基于第一人称视觉的连续具身导航
香港大学与上海AI Lab联合提出VLN-R1,可将自然语言指令直接转化为第一人称视角下的连续导航动作,并在无离散地图条件下完成复杂环境导航。
香港大学与上海AI Lab联合提出具身导航模型 VLN-R1。该模型能够理解自然语言指令,并直接生成第一人称视角下的连续导航动作。与依赖离散地图或预定义节点的方法不同,VLN-R1可在复杂环境中持续进行视觉感知、决策与行动,展现出更接近人类的导航能力。
- 推动视觉—语言导航从离散动作空间转向连续真实环境。
- 为无需预建地图的具身智能体提供端到端导航方案。
- 可用于家庭机器人、服务机器人及复杂场景中的自主移动。
📝 原始笔记(逐字保留)
Google DeepMind 发布端侧 VLA 模型 Gemini Robotics On-Device
Google DeepMind 发布首个可完全在机器人本地运行的视觉-语言-动作模型 Gemini Robotics On-Device。
Google DeepMind 团队发布了 Gemini Robotics On-Device。该模型属于视觉-语言-动作(VLA)模型,可完全在机器人本地运行。端侧部署有助于机器人在不依赖持续云端连接的情况下完成感知、语言理解与动作控制。
- 推动 VLA 模型从云端服务转向机器人本地部署
- 为低延迟、弱网络或离线环境中的具身智能应用提供参考
- 展示端侧多模态感知与动作控制一体化的发展方向
📝 原始笔记(逐字保留)
人类创造力的核心机制,AI 已开始掌握:IEI 分层评估框架
北大团队受概念融合理论启发,提出 IEI 框架,从识别、解释和引申三个层次评估 AI 的组合创造力。
研究团队受 Margaret Boden 的创造力理论和概念融合理论启发,提出面向 AI 系统的 IEI 分层评估框架。该框架将组合创造力拆分为识别、解释与引申三个递进层次。识别关注模型能否分解输入概念的基本元素,解释考察其发现概念间潜在关联的能力,引申则衡量其理解并生成超越原始输入语义内涵的能力。该工作入选 CogSci 2025 Oral,为分析 AI 是否真正具备类人创造性认知提供了结构化方法。
- 为大模型组合创造力提供可解释、分层次的评估标准
- 区分概念识别、关联解释与语义引申能力,避免以单一结果衡量创造力
- 可用于比较不同模型的创造性推理水平,并指导训练与评测设计
📝 原始笔记(逐字保留)
Decrypto:多智能体推理与心智理论基准测试
Decrypto 通过交互式博弈评估大模型的多智能体推理与心智理论能力,发现前沿模型仍落后于人类和简单基线,部分推理模型甚至不及其早期版本。
Decrypto 是一个受认知科学、计算语用学和多智能体强化学习启发的游戏化基准,旨在隔离并评估大模型的多智能体推理与心智理论能力。它针对现有基准范围狭窄、数据泄露、任务饱和和缺乏交互性等问题,提供了可设计交互式心智理论实验的平台。综合评测、鲁棒性研究和人机对抗实验显示,前沿 LLM 的游戏表现落后于人类及简单的词嵌入基线。研究还复现了经典认知科学实验的变体,发现部分先进推理模型在三项关键心智理论任务上显著逊于早期版本。
- 为多智能体系统提供交互式、低混杂的心智理论评估环境
- 揭示通用推理能力提升并不必然带来更强的他者状态建模能力
- 可用于比较模型版本、开展人机对抗实验及研究多智能体协作与竞争
- 为训练具备更强社会推理和策略适应能力的智能体提供评估依据
📝 原始笔记(逐字保留)
Gemini CLI 开源并免费提供
Google 推出并开源 Gemini CLI,开发者可在命令行中免费使用 Gemini 辅助编程与处理开发任务。
Gemini CLI 已开源并提供免费使用方案,将 Gemini 的能力直接带入终端环境。开发者可以通过自然语言在命令行中完成代码理解、生成及相关开发任务。其开源与免费策略降低了 AI 编程工具的使用门槛,也为社区扩展和二次开发提供了基础。
- 在终端中使用 Gemini 辅助代码生成、理解与开发工作
- 为构建命令行智能体和自动化开发流程提供开源基础
- 降低个人开发者试用 AI 编程助手的成本
📝 原始笔记(逐字保留)
GoT-R1:强化学习解锁多模态视觉生成推理新范式
港大等团队开源GoT与GoT-R1,通过强化学习提升多模态大模型在视觉生成中的语义和空间推理能力。
GoT-R1将强化学习引入多模态视觉生成流程,让模型能够在生成图像前开展更充分的语义与空间推理。该方法减少了对预定义推理模板的依赖,使模型可以自主探索并学习更优的生成策略。实验表明,这一框架能够显著增强多模态大模型处理复杂视觉生成任务的能力。GoT与GoT-R1的论文和代码均已公开。
- 为需要复杂构图和空间关系理解的视觉生成任务提供新的训练方案
- 展示强化学习在提升多模态模型自主推理能力方面的潜力
- 可作为研究视觉生成奖励设计、推理轨迹优化和模型自我探索的开源基线
📝 原始笔记(逐字保留)
推理越多,幻觉越重?多模态推理模型的「幻觉悖论」
文章探讨多模态模型中延长推理过程可能反而加剧幻觉的悖论现象。
文章关注多模态推理模型中的「幻觉悖论」:增加推理步骤并不一定提升答案的事实可靠性。更长的推理链可能持续放大早期的视觉误判或错误假设,使模型生成看似连贯但缺乏证据支撑的结论。这表明推理能力与幻觉抑制并非天然一致,评估模型时需要同时考察推理质量、视觉依据和事实准确性。
- 提醒研究者不要将更长的推理过程直接等同于更高的可靠性
- 启发多模态模型引入视觉证据校验、推理中止和错误回溯机制
- 为评估体系补充幻觉率、证据一致性与推理长度之间的关联分析
📝 原始笔记(逐字保留)
Gemini Robotics On-Device:可直接部署于机器人的 VLA 模型
谷歌 DeepMind 发布首个可直接在机器人本地部署的 Gemini Robotics On-Device 视觉-语言-动作模型。
谷歌 DeepMind 推出 Gemini Robotics On-Device,这是一款面向机器人的视觉-语言-动作(VLA)模型。该模型能够直接部署在机器人设备上,将视觉感知、语言理解与动作控制结合起来。本地运行有助于降低对云端连接的依赖,并改善机器人执行任务时的响应速度与可用性。
- 为机器人端侧部署多模态具身模型提供参考
- 推动低延迟、弱联网环境下的机器人自主执行
- 展示 VLA 模型从云端能力向实体设备迁移的趋势
📝 原始笔记(逐字保留)
华为发布 CloudRobo 具身智能平台
华为在开发者大会 2025(HDC 2025)上发布 CloudRobo 具身智能平台。
2025 年 6 月 26 日,华为在开发者大会 2025(HDC 2025)上发布 CloudRobo 具身智能平台。该平台面向具身智能相关的开发与应用,为机器人智能化提供平台支持。CloudRobo 的发布体现了华为在具身智能基础设施与产业生态方面的布局。
- 关注 CloudRobo 对具身智能开发流程和落地效率的提升。
- 评估其在机器人训练、部署及行业应用中的平台价值。
- 跟踪华为在具身智能基础设施与开发者生态方面的后续进展。
📝 原始笔记(逐字保留)
MMSearch-R1:激励大型多模态模型自主搜索
MMSearch-R1通过端到端强化学习训练大型多模态模型按需调用图像与文本搜索工具,在保持性能的同时减少30%以上的搜索次数。
MMSearch-R1 是一个面向大型多模态模型的端到端强化学习框架,使模型能够在真实互联网环境中自主决定何时搜索、使用何种工具以及是否继续多轮搜索。框架整合图像与文本搜索工具,并结合结果奖励与搜索惩罚,抑制低效或过度搜索行为。研究团队还通过半自动流程构建了覆盖视觉和文本知识需求的多模态搜索 VQA 数据,并发现同时包含需搜索与无需搜索样本的平衡子集对训练至关重要。实验显示,该方法优于同规模 RAG 基线,并能以减少30%以上搜索调用的代价达到更大规模 RAG 模型的性能。
- 为多模态智能体提供可学习的按需搜索策略,替代固定的 RAG 检索流程。
- 表明搜索成本惩罚与结果奖励结合,可同时优化任务效果和工具调用效率。
- 提示训练搜索智能体时应平衡“需要搜索”与“无需搜索”的样本,避免模型形成无差别检索倾向。
- 可用于知识密集型视觉问答、实时信息查询和具备互联网访问能力的多模态助手。
📝 原始笔记(逐字保留)
MemBench:面向大语言模型智能体记忆能力的综合评估
MemBench 提出面向大语言模型智能体的综合基准,用于更系统地评估智能体的记忆能力。
论文提出 MemBench,旨在解决现有评测对大语言模型智能体记忆能力覆盖不足的问题。该基准从更全面的角度考察智能体对历史信息的存储、检索与利用能力。它可用于比较不同智能体及记忆机制的实际表现,并帮助定位记忆系统中的能力短板。MemBench 为智能体长期交互和记忆模块的标准化评估提供了参考。
- 系统评估 LLM 智能体的记忆能力
- 比较不同记忆架构、检索策略与上下文管理方法
- 为长期交互智能体的记忆模块优化提供评测依据
📝 原始笔记(逐字保留)
通过结构化推理增强大语言模型
该研究通过显式标注推理步骤、监督微调与融合 MAX-Flow 和 LCS 的 GRPO 方法,提升大语言模型在逻辑演绎和系统规划任务中的结构化推理能力。
大语言模型依赖隐式统计关系,在复杂逻辑演绎和系统规划任务中仍缺乏稳定的结构化知识表征。作者受认知科学和神经符号人工智能启发,通过显式标注推理步骤,将非结构化数据转换为结构化训练数据,并据此开展监督微调。研究进一步采用群体相对策略优化(GRPO),结合 MAX-Flow 与最长公共子序列(LCS)算法,以提高推理效率并降低计算复杂度。在 DeepSeek-R1-Distill-Qwen-1.5B 上的实验显示,该方法能够带来更简洁、稳健且跨场景适用的推理表现。
- 为提升大模型的逻辑演绎与系统规划能力提供显式结构化训练方案。
- 展示 SFT 与 GRPO 结合在结构化推理能力培养上的潜力。
- MAX-Flow 和 LCS 可用于设计更高效、对推理结构更敏感的强化学习优化信号。
- 为小参数模型获得简洁、稳健且可迁移的推理能力提供实践参考。