2025-07-02 科研追新
当日精选(由提交工具自动创建)。
PEVA:基于全身动作条件的第一视角视频预测世界模型
伯克利与 Meta 提出的 PEVA 将完整 3D 人体姿态和历史视频帧联合建模,以预测全身动作将如何改变智能体未来的第一视角视觉观测。
论文提出全身动作条件第一视角视频预测模型 PEVA,用于学习具身智能体的动作与视觉变化之间的关系。不同于仅以速度和方向为条件的传统方法,PEVA 输入包括关节位置与旋转在内的完整 3D 人体姿态,并结合历史视频帧预测未来观测。该方法使模型能够理解身体动作如何重新组织第一视角中的可见世界,为具身世界模型提供更细粒度的动作表征。
- 为具身智能体提供基于完整身体姿态的未来视觉预测能力
- 支持机器人或虚拟智能体在执行动作前预演其视觉后果
- 启示世界模型从粗粒度运动控制转向关节级、全身动作条件建模
📝 原始笔记(逐字保留)
DipLLM:以少量数据微调大模型的外交博弈智能体框架
中科院团队开源DipLLM,通过自回归任务分解和均衡策略目标微调大语言模型,仅使用Cicero约1.5%的训练数据便在复杂策略游戏Diplomacy中实现更优表现。
DipLLM是面向七人策略游戏Diplomacy的大语言模型博弈智能体框架,该游戏同时包含合作与竞争,单轮动作空间可达10^64。框架通过自回归分解,将复杂联合决策转化为一系列可学习的序列化子任务,并使用具有理论支持的均衡策略目标进行高效微调。实验显示,DipLLM仅使用Meta Cicero约1.5%的训练数据即可取得超越后者的表现,体现出较高的样本效率。相较依赖大规模均衡搜索和重资源训练的方案,该方法为博弈智能体的扩展与迁移提供了更轻量的路径。
- 为复杂多智能体博弈提供低数据成本的LLM微调方案。
- 展示自回归任务分解在超大动作空间决策中的应用价值。
- 为减少均衡搜索与算力依赖、提升博弈智能体的迁移能力提供新思路。
- 可用于研究协作与竞争并存场景下的策略学习和多智能体决策。
📝 原始笔记(逐字保留)
小红书开源首个多模态大模型 dots.vlm1,性能直追 SOTA
小红书开源首个多模态大模型 dots.vlm1,公开信息称其综合性能已接近业界 SOTA 水平。
小红书发布并开源了首个多模态大模型 dots.vlm1。该模型面向视觉与语言信息的联合理解,公开信息称其性能已接近当前 SOTA 水平。此举体现了小红书在多模态基础模型及开源生态上的进一步布局。原始摘要未提供具体评测数据、模型规模与代码仓库地址,详细技术信息需参阅原文。
- 可用于跟踪国产开源多模态模型的最新进展。
- 为视觉语言理解、内容分析等应用提供新的模型选项。
- 可进一步关注其评测基准、训练数据、部署成本及开源许可。
📝 原始笔记(逐字保留)
AI4Research:人工智能赋能科学研究综述
该综述建立统一分类框架,系统梳理人工智能自主参与科学研究的五类主流任务、跨学科应用、数据与工具,并指出自动化实验严谨性、可扩展性和社会影响等未来方向。
人工智能应用 人工智能 智能体 智能体工具 数据工程 逻辑推理
论文针对 AI4Research 领域缺少全面综述的问题,梳理人工智能在科学创新与自主研究流程中的最新进展。作者提出统一的系统分类法,将现有工作归纳为五类主流任务,并覆盖多学科应用、数据语料库和研究工具。综述重点分析了自动化实验在严谨性与可扩展性方面的不足,同时讨论相关技术可能产生的社会影响。该工作为研究者快速了解 AI4Research 全貌、获取资源及探索后续方向提供了入口。
- 为构建自动化或半自动化科研智能体提供任务分类与系统设计参考。
- 帮助研究者快速定位 AI4Research 相关应用、数据语料库和工具资源。
- 提示后续研究重点关注实验结果的可复现性、严谨性与规模化能力。
- 为评估自主科研系统的社会影响、安全边界和治理问题提供研究线索。
📝 原始笔记(逐字保留)
Chai-2实现零样本抗体发现,AI设计药物有望进入临床
Chai-2展示了零样本设计新抗体的能力,预示AI药物设计正加速迈向临床试验阶段。
Chai-2的发布引发医药行业关注,其核心亮点是利用AI进行零样本新抗体发现。该进展表明,蛋白质与抗体设计正在进入类似大语言模型基座化的发展阶段。相关报道预计,AI设计药物有望在2025年年底进入临床试验。延伸阅读:蛋白质基座的GPT时代来了?!。
- 展示AI在抗体发现与药物设计中的实际应用潜力
- 降低候选抗体筛选对既有样本和传统实验流程的依赖
- 关注AI生成药物从计算设计走向临床验证的关键进展
📝 原始笔记(逐字保留)
Skywork-Reward-V2:通过人机协同扩展高质量偏好数据管理
Skywork-Reward-V2通过人机协同管线构建4000万偏好对,并以其中2600万对训练8个开放奖励模型,在七项主流基准上取得领先表现。
研究认为,现有开放奖励模型的性能瓶颈主要来自偏好数据覆盖狭窄、合成标注不可靠和质量控制不足。团队设计了两阶段人机协同数据管理管线,由人工提供经过验证的标注和规则,再由大语言模型执行可扩展的自动管理,最终形成包含4000万偏好对的 SynPref-40M。Skywork-Reward-V2 包含8个参数规模从0.6B到8B的奖励模型,使用其中精选的2600万偏好对进行训练。该系列在偏好对齐、客观正确性、安全性、抗风格偏差和 Best-of-N 扩展等能力上表现突出,并在七个主要奖励模型基准中达到领先水平。
- 为 RLHF、偏好优化和 Best-of-N 推理提供高质量开放奖励模型。
- 表明奖励模型的提升不仅依赖数据规模,更依赖严格的数据筛选与质量管理。
- 为大规模偏好数据建设提供“人工制定标准、AI 扩展执行”的人机协同范式。
- 可用于研究奖励模型对安全性、正确性及风格偏差的综合评估能力。
📝 原始笔记(逐字保留)
AdvDistill:通过奖励引导的数据集蒸馏增强小语言模型推理能力
AdvDistill 利用规则验证器为教师模型的多次回答分配奖励并加权训练学生模型,从而提升小语言模型的数学与复杂推理能力。
该研究提出奖励导向的数据集蒸馏框架 AdvDistill,旨在将大型语言模型的推理能力更有效地迁移至小语言模型。框架针对每个提示生成多个教师回答,再使用基于规则的验证器为回答分配不同奖励。训练时以这些奖励作为样本权重,使学生模型不再局限于简单模仿教师的分布内回答。实验与行为分析显示,该方法能够显著改善学生模型在数学和复杂推理任务上的表现。
- 以可验证奖励筛选和加权教师数据,提高知识蒸馏的数据利用效率
- 为小语言模型迁移数学及复杂推理能力提供低成本方案
- 表明强化学习式奖励信号可在不进行完整在线策略优化的情况下用于蒸馏训练
📝 原始笔记(逐字保留)
SPRO:使用掩码步骤优势进行自我引导的过程奖励优化
SPRO通过策略模型自生成过程奖励与掩码步骤优势实现无额外奖励模型的过程强化学习,相比GRPO显著提升训练效率和测试准确率。
论文提出自我引导过程奖励优化框架 SPRO,用于增强大型语言模型的过程级强化学习。作者从理论上证明过程奖励可由策略模型自身导出,并设计累积过程奖励与掩码步骤优势(MSA),在共享提示采样组内进行逐步优势估计。实验显示,SPRO 相比标准 GRPO 将训练效率提高 3.4 倍、测试准确率提高 17.5%,同时将平均响应长度缩短约三分之一。该方法还能维持较高的策略熵、抑制奖励黑客,并且不引入额外的过程奖励模型计算开销。
- 为大语言模型提供无需独立过程奖励模型的过程强化学习方案
- 通过 MSA 获得更严格、细粒度的逐步动作优势估计
- 提升推理训练效率与准确率,同时减少冗长响应和奖励黑客风险
- 降低过程监督强化学习的部署成本,适合工业训练场景
📝 原始笔记(逐字保留)
浙大开源UltraVideo超高清视频数据集,推动原生4K视频生成
浙江大学APRIL实验室联合多所高校推出UltraVideo,以高质量4K/8K视频和丰富结构化字幕支持超高清视频生成研究。
浙江大学APRIL实验室联合多所高校推出开源文本到视频数据集UltraVideo,旨在突破AI视频生成的清晰度瓶颈。数据集以原生UHD-4K视频为主,其中22.4%的内容达到8K分辨率,并覆盖超过100种主题。每个视频配有9条结构化字幕和1条总结性字幕,字幕平均长度为824词,可为细粒度视频语义建模提供丰富监督。
- 为原生4K及更高分辨率的文本到视频模型提供高质量训练数据
- 利用多层次结构化字幕增强视频内容理解与文本对齐
- 推动超高清视频生成模型的训练、评估和清晰度提升
📝 原始笔记(逐字保留)
SuperCLUE推理榜惊现黑马:中兴AI模型表现亮眼
中兴旗下AI模型在SuperCLUE推理榜中取得亮眼成绩,成为榜单黑马并引发行业关注。
中兴旗下AI模型在SuperCLUE推理榜中展现出较强竞争力,成为此次榜单中的黑马。该结果反映出中兴正在加大人工智能模型研发投入,并已在推理能力评测方面取得阶段性成果。榜单表现也显示,传统通信设备厂商正进一步拓展其在大模型领域的技术布局。
- 关注中兴在大模型研发和推理能力优化方面的进展
- 通过SuperCLUE榜单横向比较不同模型的综合推理表现
- 观察传统通信厂商向AI基础模型领域延伸的行业趋势
📝 原始笔记(逐字保留)
阿里通义开源首个 CoT 泛音频生成模型 ThinkSound
阿里通义语音团队开源 ThinkSound,通过思维链推理为视频画面逐帧生成匹配音效,实现更精准的音画同步。
阿里通义语音团队开源泛音频生成模型 ThinkSound,主要用于根据视频内容自动生成配套音效。该模型引入 CoT 推理机制,力求让每一帧画面获得语义与节奏匹配的声音,提升音画同步效果。此前,团队还发布了支持多语言语音生成和零样本语音复刻的 CosyVoice 3.0,以及端到端音频多模态模型 MinMo。这些模型共同展现了通义在语音、音效生成及音频多模态方向上的持续布局。
- 可用于影视、短视频、游戏等内容的自动配音与音效生成。
- CoT 推理有望增强模型对画面事件、时序关系及声音需求的理解。
- 展示了音频生成模型从语音合成向泛音频、多模态内容创作扩展的趋势。
📝 原始笔记(逐字保留)
Claude Code 推出 Hooks 功能,让 AI 编程走向可控工程化
Claude Code 发布基于 Shell 的 Hooks 功能,可在编程会话的关键节点自动执行预设操作,提升 AI 编程流程的确定性与可控性。
Claude Code 推出 Hooks 功能,通过基于 Shell 的钩子系统在编程会话的关键节点自动运行命令。开发者可以精确规定每次会话中必须执行的检查、脚本或流程,减少模型行为不稳定带来的影响。该功能使 AI 编程从依赖模型临场表现,进一步转向可编排、可复现的工程化工作流。
- 将代码检查、测试、格式化等操作固化为自动流程
- 增强 AI 编程会话的确定性、可控性与可复现性
- 为 Claude Code 接入现有软件工程和自动化工具链提供基础
📝 原始笔记(逐字保留)
上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench
上海交通大学 Agents 团队提出 ML-Master,通过智能记忆、嵌入式推理与协同进化机制自动完成机器学习探索,并在 OpenAI MLE-bench 上取得领先成绩。
智能体 自进化 智能体记忆 推理 任务规划 模型评估 人工智能辅助编程
上海交通大学人工智能学院 Agents 团队提出面向机器学习任务的 AI 专家智能体 ML-Master,旨在自动化问题建模、实验设计、算法探索与结果验证。系统的探索模块会收集执行结果、代码片段和性能指标,并选择性整合父节点及并行节点的信息,以构建高价值记忆。相关记忆被直接嵌入模型的推理过程,使后续决策能够利用历史反馈和多路径探索经验。推理结果与探索经验形成双向反馈,从而推动智能体持续优化实验路径,并在 OpenAI MLE-bench 中取得领先表现。
- 为端到端自动化机器学习实验与竞赛任务提供智能体方案
- 展示结构化记忆与执行反馈对智能体长期探索能力的提升作用
- 为 AI4AI、自主算法优化和可自主演进的 AI 系统提供研究参考
- 可用于研究机器学习工程中的自动规划、代码生成、实验迭代与评估
📝 原始笔记(逐字保留)
ICML 2025 Spotlight|清华朱军组与 NVIDIA 提出 DDO,革新扩散与自回归模型训练
DDO 在最大似然训练中融入反向 KL 散度的优化思想,无需额外判别器即可提升扩散与自回归模型的生成保真度,并刷新图像生成 SOTA。
最大似然估计(MLE)倾向于覆盖数据分布,但在模型容量有限时可能将概率质量分配到错误区域,影响生成质量。DDO 借鉴 GAN 式判别思想,在训练目标中引入反向 KL 散度成分,强化真实数据附近的密度并抑制错误区域。该方法促使模型从强调分布覆盖转向强调密度集中,从而改善生成保真度。相比直接采用 GAN 损失,DDO 避免了额外判别器及其带来的工程优化复杂性,更适合需要迭代生成的扩散和自回归模型。
- 为扩散模型和自回归模型提供区别于纯 MLE 的训练新范式。
- 在有限模型容量下平衡分布覆盖与样本保真度。
- 降低引入 GAN 式目标时对额外判别器及复杂联合优化的依赖。
- 可用于图像生成模型训练及特定领域微调。
📝 原始笔记(逐字保留)
SciArena:面向科学文献任务的开放式基础模型评估平台
SciArena 通过研究社区成对投票评估基础模型在开放式科学文献任务中的表现,并发布基于人类偏好数据的自动评价元基准 SciArena-Eval。
SciArena 是一个面向科学文献理解与综合任务的开放协作评估平台,采用类似 Chatbot Arena 的成对比较和社区投票机制。平台支持 23 个开源及专有基础模型,并已从不同科学领域的研究人员处收集超过 13,000 张选票。数据分析显示,用户问题能够覆盖多样且真实的文献需求,评估者具有较强的自洽性与标注一致性。团队还发布了 SciArena-Eval,以人工偏好为参照衡量模型自动判断答案质量的准确性,实验表明可靠的自动评价仍具挑战。
- 为开放式、长篇科学文献问答提供更贴近真实研究需求的社区评估方式
- 可利用 SciArena-Eval 检验大模型作为自动裁判时与领域专家偏好的一致程度
- 为科学助手的模型选型、排行榜构建及自动评价方法研究提供数据基础
- 提醒研究者关注模型裁判在专业科学任务中的可靠性与偏差问题
📝 原始笔记(逐字保留)
LitBench:可靠评估创意写作的基准与数据集
LitBench 通过大规模人类偏好数据和保留测试集,为大模型创意写作提供可靠的自动评估基准,并验证了训练奖励模型相较现成 LLM 评委的优势。
LitBench 是面向创意写作评估的标准化基准和配对数据集,包含 2,480 个经过偏差处理和人工标注的 Reddit 故事比较,以及 43,827 对人类偏好训练数据。研究基于该基准测试了零样本 LLM 评委,并训练 Bradley-Terry 与生成式奖励模型。Claude-3.7-Sonnet 是表现最强的现成评委,与人类偏好的一致率为 73%,而两类训练奖励模型的准确率均达到 78%。在线人类研究进一步表明,这些奖励模型在新生成故事上的排序也能稳定匹配人类偏好。
- 为开放式创意写作建立可复现、标准化的自动评估流程。
- 可利用配对偏好数据训练奖励模型,替代可靠性不足的零样本 LLM 裁判。
- 为创意写作模型的训练、筛选、排序和偏好优化提供评估资源。
- 提示评估开放式生成任务时,应通过独立的人类研究验证自动评委的泛化能力。
📝 原始笔记(逐字保留)
LMGame-Bench:用经典游戏评测大模型感知、记忆与推理能力
UCSD等机构提出LMGame-Bench,以六款经典游戏分模块评估大模型的感知、记忆、空间推理与长期决策能力,测试中o3系列在俄罗斯方块等项目表现突出。
UCSD等机构推出LMGame-Bench,将推箱子、超级马里奥兄弟、俄罗斯方块、2048、糖果消除和逆转裁判纳入统一的大模型评测框架。各游戏分别考察空间规划、物理直觉、上下文理解、长期记忆和持续决策等能力,并采用累计得分、移动距离或正确操作次数等指标。实验显示,不同模型在各类游戏中的表现差异明显,其中o3-pro在俄罗斯方块中能够持续清除多行并维持游戏进程。该基准表明,交互式游戏可用于揭示传统静态问答评测难以覆盖的长期推理与环境适应能力。
- 为大模型的感知、记忆、规划和逻辑推理能力提供统一的交互式评估方案
- 利用不同游戏机制定位模型在空间推理、物理直觉和上下文理解方面的能力短板
- 通过2048等长时程任务检验模型在超长交互中的记忆保持与决策稳定性
- 为游戏智能体及通用智能模型的训练、对比和迭代提供可量化依据