2025-06-27 科研追新
当日精选(由提交工具自动创建)。
BridgeVLA:基于2D热图的高效3D机器人操作学习模型
中科院自动化所提出BridgeVLA,将3D输入投影为2D图像并通过2D热图预测动作,以少量轨迹实现高效且具泛化能力的机器人操作学习。
中科院自动化所提出BridgeVLA模型,用于高效、可泛化的3D机器人操作学习。该模型将3D输入投影至2D图像空间,并利用2D热图完成动作预测,从而降低3D操作建模的复杂度。实验显示,BridgeVLA在仿真与真实场景中均取得了优秀表现。其数据效率突出,在基础任务中仅使用3条轨迹便达到96.8%的成功率。
- 为3D机器人操作提供一种借助成熟2D视觉表示降低学习难度的技术路线
- 展示少样本轨迹训练在具身操作任务中的潜力,可减少真实机器人数据采集成本
- 可作为研究视觉—语言—动作模型跨场景泛化与高效动作预测的参考
📝 原始笔记(逐字保留)
MindCube:从有限视图构建空间心智模型
MindCube 基准揭示现有视觉语言模型难以从有限视图理解不可见空间,而“先建图、再推理”结合强化学习可将准确率从 37.8% 提升至 70.7%。
MindCube 用 3,268 张图像和 21,154 个问题,评估视觉语言模型从有限视图构建空间心智模型的能力。任务覆盖位置认知映射、视角转换以及假设运动的心理模拟,现有 VLM 在该基准上接近随机表现。研究比较了生成不可见中间视图、自然语言推理链和认知地图三种辅助方法,其中“map-then-reason”通过先生成认知地图再进行推理,将准确率从 37.8% 提升至 60.8%。进一步加入强化学习后,准确率达到 70.7%,表明结构化内部空间表示能显著增强模型对不可观察空间的理解。
- 用于评估 VLM 是否具备从少量视图推断完整空间布局、方向与动态变化的能力
- 为具身智能、机器人导航和三维场景理解提供空间推理基准
- 启示模型先显式构建认知地图,再围绕内部表示推理,比单纯语言思维链更有效
- 可结合强化学习进一步训练模型生成并利用结构化空间表征
📝 原始笔记(逐字保留)
EasyDoc:将文档转换为 AI 友好格式的实用工具
EasyDoc 可将常见文档转换为更便于 AI 模型读取、解析和处理的格式。
EasyDoc 是一款面向 AI 工作流的文档格式转换工具。它旨在把原始文档整理为更适合大模型读取、解析和后续加工的格式,降低文档接入 AI 应用的门槛。该工具可用于知识库构建、内容分析、检索增强生成等文档处理场景。
- 将现有文档快速转换为适合大模型处理的格式
- 简化知识库与 RAG 系统的数据预处理流程
- 提升文档内容的可解析性和 AI 应用接入效率
📝 原始笔记(逐字保留)
港大开源 RAG-Anything:全模态 RAG 统一理解复杂文档
香港大学黄超教授团队开源 RAG-Anything,通过结构化知识网络统一处理文档中的文本、图表、表格和公式等多模态内容。
传统 RAG 主要围绕文本进行检索与生成,难以完整理解包含图表、表格和公式的复杂文档。香港大学黄超教授团队推出并开源多模态智能处理系统 RAG-Anything,实现跨模态内容的一体化解析与理解。该系统将文档中的碎片化信息组织为结构化知识网络,以支持更全面的检索和问答。其技术路径可用于科研资料、财务报告及企业知识库等复杂文档场景。
- 构建能够统一检索文本、图表、表格和公式的多模态知识库
- 提升复杂文档问答与信息抽取的完整性和准确性
- 为科研、金融及企业文档分析提供全模态 RAG 实现思路
📝 原始笔记(逐字保留)
北大发布学术搜索评测 ScholarSearch:挑战主流 Deep Research 系统
北京大学发布学术搜索评测 ScholarSearch,以高难度开放式信息检索任务检验主流 Deep Research 系统的深度搜索能力。
北京大学发布学术搜索评测 ScholarSearch,将学术信息检索设计为具有挑战性的“开卷考试”。该评测面向以深度搜索为核心的研究型智能体,考察其处理高难度信息检索任务的能力。涉及的代表性系统包括 OpenAI Deep Research、Grok DeepSearch、Gemini Deep Research 和 Kimi-Researcher。ScholarSearch 可用于比较不同系统在搜索、筛选与整合学术信息方面的实际表现。
- 为 Deep Research 类系统提供统一的学术搜索评测场景
- 衡量智能体检索、筛选和整合复杂信息的能力
- 帮助开发者发现研究型智能体在高难度开放检索任务中的不足
📝 原始笔记(逐字保留)
DeepMind 发布突破性生物模型 AlphaGenome
谷歌 DeepMind 发布基因组 AI 模型 AlphaGenome及其详细技术报告,用于理解基因序列及其变异的生物学影响。
谷歌 DeepMind 发布了面向基因组研究的 AI 模型 AlphaGenome。该模型旨在帮助研究人员理解基因序列,并分析遗传变异可能造成的生物学影响。DeepMind 同时公开了一份长达 103 页的技术报告,介绍模型设计与研究结果。AlphaGenome 展示了大模型在生物学和精准医疗等领域的应用潜力。
- 辅助解析基因序列及遗传变异的功能影响
- 为疾病机制研究和潜在治疗靶点发现提供工具
- 展示 AI 基础模型向基因组学与精准医疗迁移的应用方向
📝 原始笔记(逐字保留)
RewardAnything:用自然语言定义通用奖励原则
北京大学知识计算实验室等机构提出 RewardAnything,使奖励模型能够理解自然语言描述的评判原则,提升其跨任务泛化能力。
北京大学知识计算实验室联合腾讯微信模式识别中心、William & Mary、西湖大学等机构提出 RewardAnything。该方法让奖励模型直接理解以自然语言描述的评判原则,而非仅依赖固定任务和标注模式。其目标是推动奖励建模从对既有偏好的“死记硬背”,转向对评价标准的理解与灵活迁移。这一范式有望增强强化学习奖励模型在不同任务和场景中的通用性。
- 通过自然语言灵活定义评价原则,降低为不同任务单独设计奖励函数的成本。
- 提升奖励模型对新任务、新标准和复杂偏好的泛化能力。
- 为可扩展监督、智能体训练及强化学习对齐提供更通用的奖励建模思路。
📝 原始笔记(逐字保留)
桥接大语言模型的离线与在线强化学习
研究系统比较离线、半在线与在线强化学习微调大语言模型的效果,发现在线和半在线方法表现相近且均显著优于离线方法。
该研究考察了大语言模型从离线、半在线到完全在线强化学习的训练效果,覆盖可验证的数学任务与不可验证的教学任务。实验广泛比较了在线及半在线的直接偏好优化(DPO)和群组奖励策略优化(GRPO)目标。结果显示,在线与半在线变体在性能和收敛性上较为接近,但都明显优于纯离线方法。研究还分析了训练动力学与超参数选择,并发现联合使用可验证和不可验证奖励进行多任务训练,可同时提升两类任务的性能。
- 为大语言模型选择离线、半在线或在线强化学习方案提供实证依据
- 表明半在线训练可能以较低交互成本取得接近完全在线训练的效果
- 支持将可验证奖励与不可验证奖励结合开展多任务强化学习
- 为 DPO、GRPO 的训练动力学分析和超参数配置提供参考
📝 原始笔记(逐字保留)
推理时扩展的概率最优性:OptScale 动态确定最佳采样数
论文建立推理时并行采样的概率最优性框架,并提出 OptScale 动态计算满足性能与置信度要求的最小采样数量。
论文在并行样本独立同分布的假设下,为推理时扩展及 Best-of-N 选择策略建立概率分析框架。作者推导了达到目标性能水平所需样本数量的理论下限,为分配推理计算预算提供原则性依据。在此基础上,OptScale 使用语言模型预测器估计概率先验参数,动态确定满足预设性能阈值和置信度的最小采样数。MATH-500、GSM8K、AIME 和 AMC 上的实验显示,该方法能够显著降低采样开销,同时保持或改善推理表现。
- 为推理时扩展提供理论化的计算预算分配依据,减少对固定采样数和启发式策略的依赖。
- 可用于按题目难度动态调整 Best-of-N 的 N,在性能、置信度与推理成本之间取得平衡。
- 为复杂推理模型的低成本部署和在线推理系统优化提供可落地方案。
📝 原始笔记(逐字保留)
Double-Checker:通过自我批判微调增强慢思维大模型推理
Double-Checker 利用精选的自我批判样本微调长思维链模型,使其能够迭代检查并改进答案,将 AIME 的 pass@1 从 4.4% 提升至 18.2%。
Double-Checker 是一个面向慢思维、长思维链大模型的自我批判微调框架,旨在弥补模型难以生成有效批评并修正既有解答的问题。研究者精选了 1,730 个自我批判实例进行微调,使模型能够在推理过程中反复批评和优化输出,直至其依据自生成批评判断答案正确。综合推理基准实验显示,结构化的迭代自我批判可以显著增强 long-CoT 模型的推理能力。其在 AIME 上将原始模型的 pass@1 从 4.4% 提升至 18.2%,表明显式训练纠错行为是提升复杂推理可靠性的有效路径。
- 为长思维链模型提供可训练的自检与迭代纠错机制。
- 说明少量高质量自我批判数据也可能显著改善复杂数学推理表现。
- 可用于构建更可靠的推理智能体、答案复核器及多轮求解系统。
- 启示后续研究同时评估批评质量、纠错收益与迭代推理成本。
📝 原始笔记(逐字保留)
快手开源视频理解大模型 Keye-VL
快手发布并开源多模态大模型 Keye-VL,重点提升对短视频内容的理解能力。
快手推出面向视频理解的多模态大模型 Keye-VL,可用于快速解析短视频中的视觉与语义信息。该模型强调对复杂视频内容的综合理解能力,并公开了相关技术细节。项目采用开源方式发布,便于研究者和开发者进一步验证、复现与应用。
- 为短视频检索、内容审核、自动摘要和智能推荐提供模型基础
- 可作为开源视频多模态模型的研究与复现对象
- 有助于探索视觉语言模型在大规模短视频场景中的落地
📝 原始笔记(逐字保留)
Cosmos:用于文本扩散建模的压缩平滑潜在空间
Cosmos 通过在语义对齐的压缩平滑潜在空间中执行文本扩散,在保持生成质量的同时实现超过 2 倍的推理加速。
Cosmos 不直接在高维 token 表示上进行扩散,而是使用自动编码器学习面向扩散建模的压缩、平滑潜在空间。自动编码器同时接受 token 级重建训练,并与预训练语言编码器的冻结激活对齐,从而获得稳定的语义基础。实验表明,文本表示可被显著压缩,同时保持与 token 级扩散模型相当的生成质量;增加潜在序列长度后,效果还能超过多种扩散及自回归基线。该方法在故事生成、问题生成、摘要和文本解毒任务上取得相当或更优的质量,并带来超过 2 倍的推理加速。
- 为解决 token 级文本扩散的高维表示与计算开销问题提供新的潜在空间方案。
- 展示语义对齐、重建学习与扰动增强相结合的完整训练思路,可供后续扩散语言模型借鉴。
- 说明潜在表示压缩有望兼顾并行生成、全局连贯性与推理效率。
📝 原始笔记(逐字保留)
地平线与极佳提出几何一致视频世界模型,增强机器人策略学习
地平线与极佳提出几何一致的视频世界模型,通过提升生成视频的空间与几何一致性来增强机器人策略学习。
地平线与极佳在具身智能方向提出一种几何一致的视频世界模型。该模型重点改善预测视频中的空间结构与几何关系一致性,使模拟出的环境变化更适合机器人理解和决策。研究尝试利用世界模型生成的动态信息增强机器人策略学习,为降低真实环境交互成本提供新路径。
- 利用几何一致的视频预测,为机器人策略训练提供更可靠的环境表征。
- 探索以世界模型减少真实机器人数据采集与交互成本。
- 为视频生成模型与具身智能策略学习的结合提供研究方向。
📝 原始笔记(逐字保留)
阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o
阿里发布并开源信息检索智能体 WebDancer,通过四阶段训练范式与 ReAct 代理框架提升网络检索和复杂任务泛化能力,在 GAIA 基准上超越 GPT-4o。
智能体 智能体工具 人工智能框架 模型训练 强化学习 数据工程 人工智能应用
WebDancer 是阿里推出的信息检索智能体,可自主上网搜索资料并完成复杂信息任务,其模型与相关数据已开源。系统采用四阶段训练范式,依次包括浏览数据构建、轨迹采样、用于有效冷启动的监督微调,以及提升泛化能力的强化学习。其代理框架基于 ReAct,通过多个“思维—动作—观察”轮次持续调用网络工具并修正检索路径。公开结果显示,WebDancer 在 GAIA 智能体基准上的表现超过 GPT-4o。
- 为构建可自主浏览网页、检索资料和综合信息的研究型智能体提供训练范式参考
- 展示监督微调与强化学习结合改善智能体冷启动和任务泛化的实践路径
- 可借鉴 ReAct 的多轮交互机制设计搜索、问答与深度研究类应用
- 开源模型与数据有助于复现和评估信息检索智能体
📝 原始笔记(逐字保留)
Mind2Web 2:基于 Agent-as-a-Judge 的智能体搜索评估
Mind2Web 2 提供包含130个真实长期任务的智能体搜索基准,并以 Agent-as-a-Judge 框架自动评估答案正确性与来源归因。
Mind2Web 2 面向 Deep Research 等智能体搜索系统,收录了 130 个需要实时网页浏览和广泛信息综合的高质量长期任务,累计投入超过 1,000 小时人工构建。针对答案随时间变化、内容复杂且需要引文支持的问题,研究提出 Agent-as-a-Judge 框架,利用树状评分量规构建任务专属的评判智能体。作者系统评估了 9 个前沿智能体搜索系统及人类表现,并分析了主要错误类型。实验显示,表现最佳的 OpenAI Deep Research 能以约一半的耗时达到人类水平的 50%~70%。
- 为长周期、开放式的网页搜索智能体提供更贴近真实场景的评估基准。
- 使用任务专属评判智能体,降低复杂答案正确性与引文归因评估的人工成本。
- 可用于定位智能体搜索系统在浏览、信息综合和来源引用环节的不足。
- 为下一代 Deep Research 类系统的开发、对比和迭代提供统一依据。
📝 原始笔记(逐字保留)
Agent-RewardBench:面向现实世界多模态智能体的统一奖励建模基准
Agent-RewardBench 从感知、规划和安全三个维度评估多模态模型在真实智能体场景中的奖励建模能力,揭示现有先进模型仍需专门训练。
Agent-RewardBench 是一个面向现实世界多模态智能体的奖励建模基准,旨在解决奖励模型选择与外部反馈能力缺乏统一评价的问题。基准覆盖 7 类真实场景,并从感知、规划和安全三个维度展开评估。它支持阶梯式奖励评价,可在任务执行的不同步骤考察智能体表现,从而提供更细粒度的规划能力分析。数据由 10 个模型的输出经过难度控制与人工验证构建,实验显示当前先进多模态模型在该基准上的表现仍然有限。
- 为多模态智能体选择和比较奖励模型提供统一标准
- 支持逐步骤诊断感知、规划及安全环节中的奖励判断缺陷
- 为智能体奖励模型的专项训练、外部反馈设计和自我纠正研究提供数据依据
📝 原始笔记(逐字保留)
语言模型训练的数据效能:DELT 数据组织范式
论文提出 DELT 范式,通过数据评分、选择与排序优化训练数据组织,在不增加数据规模和模型参数量的情况下提升语言模型性能。
论文将“数据效能”定义为通过优化训练数据的组织方式来最大化模型性能,以补充侧重于筛选最小或最佳数据子集的数据效率研究。作者提出通用范式 DELT,包含数据评分、数据选择和数据排序三个组件。其核心方法包括基于梯度一致性衡量样本可学习性与质量的可学习性-质量评分(LQS),以及用于缓解模型遗忘和数据分布偏差的折叠排序(FO)。实验表明,LQS 与折叠排序的组合提升最为显著,并且结合数据选择后可同时改善数据效能与数据效率。
- 将训练数据的顺序与组织方式视为独立于数据规模、模型规模的性能优化维度。
- 可在固定训练预算下联合使用 LQS 评分和折叠排序,提高语言模型训练收益。
- 为课程学习、数据混合和持续预训练中的遗忘与分布偏差问题提供新的方法框架。
📝 原始笔记(逐字保留)
为下游任务优化语言模型:训练后视角
该论文从训练后视角提出持续预训练、参数高效微调和改进监督微调等方法,以提升语言模型适配下游任务时的效率、稳健性与泛化能力。
论文研究语言模型在标注数据有限、未标注数据利用不足及微调成本高昂条件下的下游任务适配问题。作者提出新的持续预训练技术,从未标注数据中提取任务相关知识,并取得优于先进半监督方法的效果。论文还设计了参数高效微调与改进的监督微调方法,在降低内存和计算开销的同时增强模型的指令遵循能力。研究进一步引入多跳空间推理等评估任务,实验表明这些方法能够提升模型在多类 NLP 任务及开放式生成中的稳健性和泛化表现。
- 为标注数据稀缺的下游任务提供更有效的训练后适配方案
- 利用任务相关的未标注数据缓解小规模监督数据上的过拟合
- 通过参数高效微调降低模型适配的显存与计算成本
- 借助多跳推理等基准更全面地评估模型的适应能力
📝 原始笔记(逐字保留)
Progtuning:基于 Transformer 语言模型的渐进式微调框架
Progtuning 根据 Transformer 块的贡献渐进式减少参与更新的模块,在保持竞争性性能的同时将更新参数量降低约 25%。
随着语言模型规模增长,全参数微调的计算成本不断增加,而现有参数高效微调方法通常未充分考虑不同 Transformer 块的贡献差异。Progtuning 将渐进式学习引入微调过程,根据各模块的贡献逐步减少需要更新的 Transformer 块数量。该方法优化了训练资源分配,将更新参数量减少约 25%,同时保持具有竞争力的下游任务性能。Progtuning 还可与参数高效微调方法结合,并在多种模型适配场景中展现出良好的适应性。
- 降低大规模 Transformer 模型微调时的参数更新量与计算成本
- 根据模块贡献动态分配训练资源,避免对低贡献模块进行冗余更新
- 可与现有参数高效微调方法结合,为不同下游适配场景提供渐进式训练方案
📝 原始笔记(逐字保留)
大型语言模型中的波将金式理解
论文提出“波将金式理解”概念与量化方法,揭示大语言模型在多种任务和领域中可能以内部不连贯的答案制造理解幻觉。
论文探讨了能否根据大语言模型在精选基准问题上的表现,可靠推断其对概念的真实理解。作者提出一个正式框架,主张只有当模型的错误能够像人类误解一样呈现一致、可解释的模式时,人类考试类基准才具有理解评估效度。研究设计了覆盖三个领域的专用基准,并提出一种可估计该现象流行率下限的通用程序。实验发现“波将金式理解”广泛存在于不同模型、任务和领域中,且反映了概念表示层面更深层的内部不连贯性。
- 提醒研究者不要把基准高分直接等同于模型真正理解。
- 可用于设计关注错误一致性、概念迁移和内部连贯性的评估方法。
- 为识别模型的表面能力与稳健概念表示之间的差距提供量化框架。
📝 原始笔记(逐字保留)
构思与执行差距:LLM 与人类研究理念的执行结果比较
研究通过让43名专家实际执行随机分配的人类或LLM研究构想,发现LLM构想从初评到落地后的评分下降更明显,揭示其新颖性印象与真实研究价值之间存在差距。
研究招募43名专家研究人员,随机分配由人类专家或LLM生成的研究想法,并要求每人投入100多个小时完成实验及4页研究报告。随后,专业NLP研究人员对全部成果进行盲审,比较构想执行前后的新颖性、兴奋性、有效性和整体评分。结果显示,LLM生成的想法在落地后各项指标的降幅显著大于专家构想,部分汇总指标甚至由LLM领先反转为人类领先。研究表明,仅凭构想阶段的文字评价可能高估LLM的科研创新能力,实际执行结果是评估研究想法质量的关键依据。
- 为评估AI生成研究构想提供“实际执行后再审查”的实验范式
- 提醒科研智能体不能只优化构想的新颖感,还需衡量可行性、有效性和最终成果质量
- 支持构建覆盖构思、实验实施与结果复核的端到端科研能力基准
- 说明在缺少执行证据时,人工或自动评审都可能高估LLM研究想法
📝 原始笔记(逐字保留)
ScienceBoard:面向真实科学工作流的多模态智能体评测环境
ScienceBoard 提供面向科学任务的真实计算机交互环境与自动评估机制,用于衡量多模态智能体完成科学工作流的能力。
ScienceBoard 是首个面向科学任务、真实交互和自动评估的多模态智能体评测环境。不同于 WebArena、OSWorld 等侧重日常场景和通用软件的基准,它聚焦智能体操作计算机完成真实科学工作流的能力。该项目通过多轮交叉验证确保任务指令清晰、操作流程合理,并支持自动化评估。项目由香港大学、上海人工智能实验室、复旦大学、北京大学和耶鲁大学联合开展,项目主页为 https://qiushisun.github.io/ScienceBoard-Home/ 。
- 评估多模态智能体在真实科学软件与工作流中的工具使用能力
- 为科学智能体提供可复现、可自动评分的实验环境
- 推动智能体评测从日常计算机任务扩展到专业科研场景
- 为科学工作流自动化系统的训练、对比和迭代提供基准
📝 原始笔记(逐字保留)
GenEscape:分层多智能体生成密室逃脱谜题
GenEscape通过分层多智能体协作,将密室逃脱图像生成拆解为功能设计、场景图推理、布局合成和局部编辑,以提升谜题的视觉质量与逻辑可解性。
GenEscape旨在生成兼具视觉吸引力、逻辑严密性和智力挑战性的密室逃脱谜题图像。针对基础文本到图像模型难以处理空间关系与可供性推理的问题,该方法采用分层多智能体框架,将任务划分为功能设计、符号场景图推理、布局合成和局部图像编辑等阶段。不同专业智能体通过迭代反馈协作,保证场景视觉连贯且谜题能够被正确解开。实验显示,该框架在维持视觉质量的同时,改善了可解性、捷径规避能力和交互线索清晰度。
- 为需要严格空间约束和因果链条的视觉谜题生成提供结构化方案。
- 展示多智能体分工与迭代审查对提升生成内容逻辑一致性的价值。
- 可用于游戏关卡设计、交互式叙事以及视觉推理基准的数据合成。
📝 原始笔记(逐字保留)
揭示大型语言模型中的因果推理:现实还是海市蜃楼?
研究认为现有大语言模型主要依赖参数中已有知识进行浅层因果推理,并通过新基准 CausalProbe-2024 与 G²-Reasoner 方法探索向类人因果推理迈进的路径。
论文从 Transformer 自回归机制出发,指出其生成过程本身不等同于真正的因果推理,并将现有 LLM 的能力主要归为浅层的 1 级因果推理。作者提出新鲜语料因果问答基准 CausalProbe-2024,以降低训练数据记忆和污染对评估的影响,模型在该基准上的性能显著下降。为缩小与类人 2 级因果推理之间的差距,研究提出 G²-Reasoner,将常识知识与目标导向提示引入推理过程。实验显示,该方法尤其能改善模型在新鲜及反事实情境中的因果推理表现。
- 用新鲜语料检验 LLM 的因果推理究竟源于真实推断还是训练知识记忆。
- 为区分浅层因果关联与类人因果推理提供新的评估基准。
- 启示研究者通过常识注入和目标导向提示增强反事实及陌生场景下的推理能力。
- 提醒因果推理评估关注数据污染、语料时效性和模型记忆效应。