2025-07-02 科研追新

当日精选(由提交工具自动创建)。

PEVA:基于全身动作条件的第一视角视频预测世界模型

伯克利与 Meta 提出的 PEVA 将完整 3D 人体姿态和历史视频帧联合建模,以预测全身动作将如何改变智能体未来的第一视角视觉观测。

 具身智能 多模态 模型开发 推理 任务规划

论文提出全身动作条件第一视角视频预测模型 PEVA,用于学习具身智能体的动作与视觉变化之间的关系。不同于仅以速度和方向为条件的传统方法,PEVA 输入包括关节位置与旋转在内的完整 3D 人体姿态,并结合历史视频帧预测未来观测。该方法使模型能够理解身体动作如何重新组织第一视角中的可见世界,为具身世界模型提供更细粒度的动作表征。

用途与启示
  • 为具身智能体提供基于完整身体姿态的未来视觉预测能力
  • 支持机器人或虚拟智能体在执行动作前预演其视觉后果
  • 启示世界模型从粗粒度运动控制转向关节级、全身动作条件建模
📝 原始笔记(逐字保留)
2025-07-02 13:11:27 Wednesday | 伯克利&Meta面向具身智能的世界模型:让AI通过全身动作「看见」未来 https://mp.weixin.qq.com/s/id_ISbf7wVvk3pl2GCIgWA 论文标题:Whole-Body Conditioned Egocentric Video Prediction 论文地址:https://arxiv.org/pdf/2506.21552 项目地址:https://dannytran123.github.io/PEVA/ 参考阅读链接:https://x.com/YutongBAI1002/status/1938442251866411281 相比传统模型只用「速度 + 方向」做预测,PEVA 把整个人的 3D 姿态(包括关节位置和旋转)一并喂进模型,和历史的视频帧一起输入,从而让 AI 学会:身体的动作,会如何重新组织我们能看到的世界。

DipLLM:以少量数据微调大模型的外交博弈智能体框架

中科院团队开源DipLLM,通过自回归任务分解和均衡策略目标微调大语言模型,仅使用Cicero约1.5%的训练数据便在复杂策略游戏Diplomacy中实现更优表现。

 博弈论 智能体 强化学习 模型训练 人工智能框架

DipLLM是面向七人策略游戏Diplomacy的大语言模型博弈智能体框架,该游戏同时包含合作与竞争,单轮动作空间可达10^64。框架通过自回归分解,将复杂联合决策转化为一系列可学习的序列化子任务,并使用具有理论支持的均衡策略目标进行高效微调。实验显示,DipLLM仅使用Meta Cicero约1.5%的训练数据即可取得超越后者的表现,体现出较高的样本效率。相较依赖大规模均衡搜索和重资源训练的方案,该方法为博弈智能体的扩展与迁移提供了更轻量的路径。

用途与启示
  • 为复杂多智能体博弈提供低数据成本的LLM微调方案。
  • 展示自回归任务分解在超大动作空间决策中的应用价值。
  • 为减少均衡搜索与算力依赖、提升博弈智能体的迁移能力提供新思路。
  • 可用于研究协作与竞争并存场景下的策略学习和多智能体决策。
📝 原始笔记(逐字保留)
2025-07-02 15:08:59 Wednesday| 策略改写「一战历史」!中科院开源全新博弈智能体框架DipLLM https://mp.weixin.qq.com/s/Hg7vHB_2ujfKSyvAcNjn6g 首个在复杂策略游戏Diplomacy中基于大语言模型微调的智能体框架,仅用Cicero 1.5%的训练数据就实现超越,展现出卓越的策略能力和样本效率。该框架通过自回归分解将复杂决策任务转化为序列化子任务,结合理论支持的均衡策略目标对LLM 进行高效微调,为构建更通用、高效的博弈智能体提供了新范式。 围棋、德州扑克曾是AI崛起的试炼场,从AlphaGo到Libratus,人工智能不断刷新策略上限。 Diplomacy:一款融合协作与竞争的七人博弈游戏,单轮动作空间高达10的64次方,其策略建模复杂度前所未有! 为此,Meta曾推出智能体Cicero[Meta, Science 2022],结合人类数据与策略搜索,在该领域实现突破,但其方法高度依赖超大规模均衡搜索与重资源训练,难以扩展与迁移。 论文地址:https://arxiv.org/pdf/2506.09655 开源代码:https://github.com/KaiXIIM/dipllm #### 多智能体强化学习研究:通过自我对弈让AI发现新的技能,无需专门为这些技能设计奖励。 https://openai.com/index/competitive-self-play/

小红书开源首个多模态大模型 dots.vlm1,性能直追 SOTA

小红书开源首个多模态大模型 dots.vlm1,公开信息称其综合性能已接近业界 SOTA 水平。

 多模态 模型开发 人工智能

小红书发布并开源了首个多模态大模型 dots.vlm1。该模型面向视觉与语言信息的联合理解,公开信息称其性能已接近当前 SOTA 水平。此举体现了小红书在多模态基础模型及开源生态上的进一步布局。原始摘要未提供具体评测数据、模型规模与代码仓库地址,详细技术信息需参阅原文。

用途与启示
  • 可用于跟踪国产开源多模态模型的最新进展。
  • 为视觉语言理解、内容分析等应用提供新的模型选项。
  • 可进一步关注其评测基准、训练数据、部署成本及开源许可。
📝 原始笔记(逐字保留)
2025-07-02 13:03:30 Wednesday | UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述 https://mp.weixin.qq.com/s/smDyNhlGS-SpM2Wt34J-ng ## 模型 #### [小红书开源首个多模态大模型dots.vlm1,性能直追SOTA!](https://mp.weixin.qq.com/s/aftyEJCZleUGAp0s5NBk3w)

AI4Research:人工智能赋能科学研究综述

该综述建立统一分类框架,系统梳理人工智能自主参与科学研究的五类主流任务、跨学科应用、数据与工具,并指出自动化实验严谨性、可扩展性和社会影响等未来方向。

 人工智能应用 人工智能 智能体 智能体工具 数据工程 逻辑推理

论文针对 AI4Research 领域缺少全面综述的问题,梳理人工智能在科学创新与自主研究流程中的最新进展。作者提出统一的系统分类法,将现有工作归纳为五类主流任务,并覆盖多学科应用、数据语料库和研究工具。综述重点分析了自动化实验在严谨性与可扩展性方面的不足,同时讨论相关技术可能产生的社会影响。该工作为研究者快速了解 AI4Research 全貌、获取资源及探索后续方向提供了入口。

用途与启示
  • 为构建自动化或半自动化科研智能体提供任务分类与系统设计参考。
  • 帮助研究者快速定位 AI4Research 相关应用、数据语料库和工具资源。
  • 提示后续研究重点关注实验结果的可复现性、严谨性与规模化能力。
  • 为评估自主科研系统的社会影响、安全边界和治理问题提供研究线索。
📝 原始笔记(逐字保留)
2025-07-03 11:40:31 Thursday | **[AI4Research:人工智能对科学研究的调查](https://papers.cool/arxiv/2507.01903)** **[PDF(3)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Qiguang Chen](https://arxiv.org/search/?searchtype=author&query=Qiguang%20Chen), [Mingda Yang](https://arxiv.org/search/?searchtype=author&query=Mingda%20Yang), [Libo Qin](https://arxiv.org/search/?searchtype=author&query=Libo%20Qin), [Jinhao Liu](https://arxiv.org/search/?searchtype=author&query=Jinhao%20Liu), [Zheng Yan](https://arxiv.org/search/?searchtype=author&query=Zheng%20Yan), [Jiannan Guan](https://arxiv.org/search/?searchtype=author&query=Jiannan%20Guan), [Dengyun Peng](https://arxiv.org/search/?searchtype=author&query=Dengyun%20Peng), [Yiyan Ji](https://arxiv.org/search/?searchtype=author&query=Yiyan%20Ji), [Hanjing Li](https://arxiv.org/search/?searchtype=author&query=Hanjing%20Li), [Mengkang Hu](https://arxiv.org/search/?searchtype=author&query=Mengkang%20Hu), [Yimeng Zhang](https://arxiv.org/search/?searchtype=author&query=Yimeng%20Zhang), [Yihao Liang](https://arxiv.org/search/?searchtype=author&query=Yihao%20Liang), [Yuhang Zhou](https://arxiv.org/search/?searchtype=author&query=Yuhang%20Zhou), [Jiaqi Wang](https://arxiv.org/search/?searchtype=author&query=Jiaqi%20Wang), [Zhi Chen](https://arxiv.org/search/?searchtype=author&query=Zhi%20Chen), [Wanxiang Che](https://arxiv.org/search/?searchtype=author&query=Wanxiang%20Che) 人工智能 (AI) 的最新进展,特别是在 OpenAI-o1 和 DeepSeek-R1 等大型语言模型 (LLM) 方面,在逻辑推理和实验编码等复杂领域展示了卓越的能力。在这些进步的推动下,许多研究探索了人工智能在创新过程中的应用,特别是在科学研究的背景下。这些 AI 技术的主要目的是开发能够在广泛的科学学科中自主进行研究过程的系统。尽管取得了这些重大进展,但仍然缺乏对人工智能研究 (AI4Research) 的全面调查,这阻碍了我们的理解并阻碍了该领域的进一步发展。为了解决这一差距,我们提出了一项全面的调查,并提供了关于 AI4Research 的统一观点。具体来说,我们工作的主要贡献如下:(1) 系统分类法:我们首先引入了系统分类法,对 AI4Research 中的五个主流任务进行分类。(2) 新前沿:然后,我们确定关键的研究差距并突出有希望的未来方向,重点关注自动化实验的严谨性和可扩展性,以及社会影响。(3) 丰富的应用程序和资源:最后,我们编译了丰富的资源,包括相关的多学科应用程序、数据语料库和工具。我们希望我们的工作能够为研究界提供快速访问这些资源的途径,并激发 AI4Research 的创新突破。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) **发布** : 2025-07-02 17:19:20 UTC

Chai-2实现零样本抗体发现,AI设计药物有望进入临床

Chai-2展示了零样本设计新抗体的能力,预示AI药物设计正加速迈向临床试验阶段。

 人工智能应用 多模态 模型开发 人工智能

Chai-2的发布引发医药行业关注,其核心亮点是利用AI进行零样本新抗体发现。该进展表明,蛋白质与抗体设计正在进入类似大语言模型基座化的发展阶段。相关报道预计,AI设计药物有望在2025年年底进入临床试验。延伸阅读:蛋白质基座的GPT时代来了?!

用途与启示
  • 展示AI在抗体发现与药物设计中的实际应用潜力
  • 降低候选抗体筛选对既有样本和传统实验流程的依赖
  • 关注AI生成药物从计算设计走向临床验证的关键进展
📝 原始笔记(逐字保留)
2. 2025-07-02 15:21:56 Wednesday | 诺奖得主Hassabis预言成真!AI零样本发现新抗体,轰动整个医药圈 https://mp.weixin.qq.com/s/yOd6_Qn6mlVqfRDkdS_eyw Chai-2的重磅发布,意味着:在今年年底,AI设计药物有望进入临床试验。 #### [蛋白质基座的GPT时代来了?!](https://mp.weixin.qq.com/s/WmGTYPO9gTm2XJ-Rjqvm-Q)

Skywork-Reward-V2:通过人机协同扩展高质量偏好数据管理

Skywork-Reward-V2通过人机协同管线构建4000万偏好对,并以其中2600万对训练8个开放奖励模型,在七项主流基准上取得领先表现。

 强化学习 模型训练 数据工程 模型评估 模型开发

研究认为,现有开放奖励模型的性能瓶颈主要来自偏好数据覆盖狭窄、合成标注不可靠和质量控制不足。团队设计了两阶段人机协同数据管理管线,由人工提供经过验证的标注和规则,再由大语言模型执行可扩展的自动管理,最终形成包含4000万偏好对的 SynPref-40M。Skywork-Reward-V2 包含8个参数规模从0.6B到8B的奖励模型,使用其中精选的2600万偏好对进行训练。该系列在偏好对齐、客观正确性、安全性、抗风格偏差和 Best-of-N 扩展等能力上表现突出,并在七个主要奖励模型基准中达到领先水平。

用途与启示
  • 为 RLHF、偏好优化和 Best-of-N 推理提供高质量开放奖励模型。
  • 表明奖励模型的提升不仅依赖数据规模,更依赖严格的数据筛选与质量管理。
  • 为大规模偏好数据建设提供“人工制定标准、AI 扩展执行”的人机协同范式。
  • 可用于研究奖励模型对安全性、正确性及风格偏差的综合评估能力。
📝 原始笔记(逐字保留)
2025-07-03 11:43:11 Thursday | **[Skywork-Reward-V2:通过 Human-AI Synergy 扩展首选项数据管理](https://papers.cool/arxiv/2507.01352)** **[PDF(4)]** **[Copy]** **[Kimi(2)]** **[REL]** **Authors** : [Chris Yuhao Liu](https://arxiv.org/search/?searchtype=author&query=Chris%20Yuhao%20Liu), [Liang Zeng](https://arxiv.org/search/?searchtype=author&query=Liang%20Zeng), [Yuzhen Xiao](https://arxiv.org/search/?searchtype=author&query=Yuzhen%20Xiao), [Jujie He](https://arxiv.org/search/?searchtype=author&query=Jujie%20He), [Jiacai Liu](https://arxiv.org/search/?searchtype=author&query=Jiacai%20Liu), [Chaojie Wang](https://arxiv.org/search/?searchtype=author&query=Chaojie%20Wang), [Rui Yan](https://arxiv.org/search/?searchtype=author&query=Rui%20Yan), [Wei Shen](https://arxiv.org/search/?searchtype=author&query=Wei%20Shen), [Fuxiang Zhang](https://arxiv.org/search/?searchtype=author&query=Fuxiang%20Zhang), [Jiacheng Xu](https://arxiv.org/search/?searchtype=author&query=Jiacheng%20Xu), [Yang Liu](https://arxiv.org/search/?searchtype=author&query=Yang%20Liu), [Yahui Zhou](https://arxiv.org/search/?searchtype=author&query=Yahui%20Zhou) 尽管奖励模型 (RM) 在人类反馈强化学习 (RLHF) 中发挥着关键作用,但当前最先进的开放式 RM 在大多数现有评估基准上表现不佳,未能捕捉到细微而复杂的人类偏好。即使是采用高级训练技术的方法也没有产生有意义的性能改进。我们假设这种脆弱性主要源于偏好数据集的局限性,这些数据集通常范围狭窄、综合标记或缺乏严格的质量控制。为了应对这些挑战,我们提出了一个包含 4000 万个偏好对的大规模偏好数据集,名为 SynPref-40M。为了实现大规模的数据管理,我们设计了一个人类-AI 协同的两阶段管道,该管道利用了人工注释质量和 AI 可扩展性的互补优势。在此管道中,人工提供经过验证的注释,而大型语言模型根据人工指导执行自动管理。在这种偏好混合物上进行训练,我们引入了 Skywork-Reward-V2,这是一套由 8 个奖励模型组成的套件,范围从 0.6B 到 8B 参数,在 SynPref-40M 中精心策划的 2600 万个偏好对子集上进行训练。我们证明 Skywork-Reward-V2 在广泛的功能中具有多功能性,包括与人类偏好保持一致、客观正确性、安全性、抗风格偏见和 N 最佳扩展,在七个主要奖励模型基准中实现最先进的性能。消融研究证实,我们方法的有效性不仅源于数据规模,还源于高质量的策展。Skywork-Reward-V2 系列代表了开放奖励模型的重大进展,突出了现有偏好数据集尚未开发的潜力,并展示了人类与 AI 的管理协同作用如何显著提高数据质量。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI), [机器学习](https://papers.cool/arxiv/cs.LG) **发布** : 2025-07-02 04:40:29 UTC

AdvDistill:通过奖励引导的数据集蒸馏增强小语言模型推理能力

AdvDistill 利用规则验证器为教师模型的多次回答分配奖励并加权训练学生模型,从而提升小语言模型的数学与复杂推理能力。

 强化学习 推理 数据合成 模型训练 模型开发

该研究提出奖励导向的数据集蒸馏框架 AdvDistill,旨在将大型语言模型的推理能力更有效地迁移至小语言模型。框架针对每个提示生成多个教师回答,再使用基于规则的验证器为回答分配不同奖励。训练时以这些奖励作为样本权重,使学生模型不再局限于简单模仿教师的分布内回答。实验与行为分析显示,该方法能够显著改善学生模型在数学和复杂推理任务上的表现。

用途与启示
  • 以可验证奖励筛选和加权教师数据,提高知识蒸馏的数据利用效率
  • 为小语言模型迁移数学及复杂推理能力提供低成本方案
  • 表明强化学习式奖励信号可在不进行完整在线策略优化的情况下用于蒸馏训练
📝 原始笔记(逐字保留)
5. 2025-07-02 17:20:00 Wednesday | **[通过奖励引导数据集蒸馏增强 SLM 中的推理能力](https://papers.cool/arxiv/2507.00054)** **[PDF(2)]** **[Copy]** **[Kimi(3)]** **[REL]** **Author** : [Shreyansh Padarha](https://arxiv.org/search/?searchtype=author&query=Shreyansh%20Padarha) 将大型语言模型 (LLM) 的熟练程度压缩并传授为更易于部署和更高效的小语言模型 (SLM) 的推动得益于知识蒸馏 (KD) 技术的改进。这些技术允许较小的学生模型从更有能力和更大的教师模型的回答中学习。然而,提炼通常围绕学生模型展开,仅复制教师的分布内反应,限制了其普遍性。这种限制在推理任务中被放大,并且计算成本可能很高。在这项研究中,我们提出了 AdvDistill,一个奖励导向的数据集蒸馏框架。我们为每个提示使用老师的多代(回复),并根据基于规则的验证者分配奖励。这些变化且正态分布的奖励在训练学生模型时用作权重。我们的方法及其随后的行为分析表明,学生模型在数学和复杂推理任务中的表现有了显着提高,展示了在数据集蒸馏过程中纳入奖励机制的有效性和好处。 **科目** : **[人工智能](https://papers.cool/arxiv/cs.AI)** , [计算和语言](https://papers.cool/arxiv/cs.CL), [机器学习](https://papers.cool/arxiv/cs.LG) **发布** : 2025-06-25 20:07:47 UTC

SPRO:使用掩码步骤优势进行自我引导的过程奖励优化

SPRO通过策略模型自生成过程奖励与掩码步骤优势实现无额外奖励模型的过程强化学习,相比GRPO显著提升训练效率和测试准确率。

 强化学习 推理 模型训练 人工智能

论文提出自我引导过程奖励优化框架 SPRO,用于增强大型语言模型的过程级强化学习。作者从理论上证明过程奖励可由策略模型自身导出,并设计累积过程奖励与掩码步骤优势(MSA),在共享提示采样组内进行逐步优势估计。实验显示,SPRO 相比标准 GRPO 将训练效率提高 3.4 倍、测试准确率提高 17.5%,同时将平均响应长度缩短约三分之一。该方法还能维持较高的策略熵、抑制奖励黑客,并且不引入额外的过程奖励模型计算开销。

用途与启示
  • 为大语言模型提供无需独立过程奖励模型的过程强化学习方案
  • 通过 MSA 获得更严格、细粒度的逐步动作优势估计
  • 提升推理训练效率与准确率,同时减少冗长响应和奖励黑客风险
  • 降低过程监督强化学习的部署成本,适合工业训练场景
📝 原始笔记(逐字保留)
2025-07-03 11:45:44 Thursday | **[使用 Masked Step Advantage 进行自我引导的过程奖励优化,用于过程强化学习](https://papers.cool/arxiv/2507.01551)** **[PDF(5)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Wu Fei](https://arxiv.org/search/?searchtype=author&query=Wu%20Fei), [Hao Kong](https://arxiv.org/search/?searchtype=author&query=Hao%20Kong), [Shuxian Liang](https://arxiv.org/search/?searchtype=author&query=Shuxian%20Liang), [Yang Lin](https://arxiv.org/search/?searchtype=author&query=Yang%20Lin), [Yibo Yang](https://arxiv.org/search/?searchtype=author&query=Yibo%20Yang), [Jing Tang](https://arxiv.org/search/?searchtype=author&query=Jing%20Tang), [Lei Chen](https://arxiv.org/search/?searchtype=author&query=Lei%20Chen), [Xiansheng Hua](https://arxiv.org/search/?searchtype=author&query=Xiansheng%20Hua) 过程强化学习~(PRL) 在增强大型语言模型~(LLM)的推理能力方面已经显示出相当大的潜力。然而,引入额外的流程奖励模型会产生大量的计算开销,并且没有统一的流程级优势估计理论框架。为了弥合这一差距,我们提出了 \textbf{S}elf-Guided \textbf{P}rocess \textbf{R}eward \textbf{O}ptimization~(\textbf{SPRO}),这是一个新颖的框架,通过两个关键创新实现了过程感知 RL: **(1) 我们首先从理论上证明了过程奖励可以从策略模型本身本质上得出,以及 (2) 我们引入了定义明确的累积过程奖励和 \textbf{M}asked \textbf{S}tep \textbf{A}dvantage (\textbf{MSA}), 这有助于在共享提示采样组中进行严格的逐步行动优势估计** 。我们的实验结果表明, **SPRO 的性能优于 vaniila GRPO,训练效率提高了 3.4 倍,测试准确率提高了 17.5%** 。此外,SPRO 在整个训练过程中保持稳定且较高的策略熵,同时将平均响应长度减少约 1/3,证明对奖励黑客行为进行了充分的探索和预防。值得注意的是,与结果监督的 RL 方法(如 GRPO)相比,SPRO 不会产生额外的计算开销,这有利于工业实施。 **科目** : **[机器学习](https://papers.cool/arxiv/cs.LG)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-07-02 10:05:14 UTC

浙大开源UltraVideo超高清视频数据集,推动原生4K视频生成

浙江大学APRIL实验室联合多所高校推出UltraVideo,以高质量4K/8K视频和丰富结构化字幕支持超高清视频生成研究。

 数据工程 多模态 人工智能

浙江大学APRIL实验室联合多所高校推出开源文本到视频数据集UltraVideo,旨在突破AI视频生成的清晰度瓶颈。数据集以原生UHD-4K视频为主,其中22.4%的内容达到8K分辨率,并覆盖超过100种主题。每个视频配有9条结构化字幕和1条总结性字幕,字幕平均长度为824词,可为细粒度视频语义建模提供丰富监督。

用途与启示
  • 为原生4K及更高分辨率的文本到视频模型提供高质量训练数据
  • 利用多层次结构化字幕增强视频内容理解与文本对齐
  • 推动超高清视频生成模型的训练、评估和清晰度提升
📝 原始笔记(逐字保留)
1. 2025-07-02 14:22:34 Wednesday| 1080p飞升4k,浙大开源原生超高清视频生成方案,突破AI视频生成清晰度上限 https://mp.weixin.qq.com/s/wVLTTmbvTToW70Qqw7p80g 浙江大学APRIL实验室联合多家高校推出的 **高质量开源UHD-4K(其中22.4%为8K)文本到视频数据集——UltraVideo** ,破解了这一困局。 该数据集涵盖广泛主题(超过100种),每个视频配备9个结构化字幕及一个总结性字幕(平均824词)。

SuperCLUE推理榜惊现黑马:中兴AI模型表现亮眼

中兴旗下AI模型在SuperCLUE推理榜中取得亮眼成绩,成为榜单黑马并引发行业关注。

 模型开发 推理 模型评估 人工智能

中兴旗下AI模型在SuperCLUE推理榜中展现出较强竞争力,成为此次榜单中的黑马。该结果反映出中兴正在加大人工智能模型研发投入,并已在推理能力评测方面取得阶段性成果。榜单表现也显示,传统通信设备厂商正进一步拓展其在大模型领域的技术布局。

用途与启示
  • 关注中兴在大模型研发和推理能力优化方面的进展
  • 通过SuperCLUE榜单横向比较不同模型的综合推理表现
  • 观察传统通信厂商向AI基础模型领域延伸的行业趋势
📝 原始笔记(逐字保留)
4. 2025-07-02 14:09:31 Wednesday |SuperCLUE推理榜惊现黑马:原来中兴是一家AI公司? https://mp.weixin.qq.com/s/H2urbOlVVcFR5b-GA7Rnhw

阿里通义开源首个 CoT 泛音频生成模型 ThinkSound

阿里通义语音团队开源 ThinkSound,通过思维链推理为视频画面逐帧生成匹配音效,实现更精准的音画同步。

 模型开发 多模态 推理 人工智能应用

阿里通义语音团队开源泛音频生成模型 ThinkSound,主要用于根据视频内容自动生成配套音效。该模型引入 CoT 推理机制,力求让每一帧画面获得语义与节奏匹配的声音,提升音画同步效果。此前,团队还发布了支持多语言语音生成和零样本语音复刻的 CosyVoice 3.0,以及端到端音频多模态模型 MinMo。这些模型共同展现了通义在语音、音效生成及音频多模态方向上的持续布局。

用途与启示
  • 可用于影视、短视频、游戏等内容的自动配音与音效生成。
  • CoT 推理有望增强模型对画面事件、时序关系及声音需求的理解。
  • 展示了音频生成模型从语音合成向泛音频、多模态内容创作扩展的趋势。
📝 原始笔记(逐字保留)
2025-07-02 14:54:01 Wednesday | 阿里通义开源首个CoT音频模型,音·画同步被狠狠拿捏了 https://mp.weixin.qq.com/s/NPb2iQvAiTJb0LZG8CSdXg 没错,这就是阿里通义语音团队最新开源的 **泛音频生成模型ThinkSound** ,主要用于视频配音,主打 **让每一帧画面都有专属匹配音效** 。 就在上个月,团队发布了语音生成大模型 **Cosyvoice 3.0** ,通过大规模数据预训练和特殊设计的强化学习后训练,它能提供多语言语音生成、零样本语音复刻等功能。 更早之前,团队还推出了基于模态对齐实现的端到端音频多模态大模型 **MinMo** 。 ### 智能体模型

Claude Code 推出 Hooks 功能,让 AI 编程走向可控工程化

Claude Code 发布基于 Shell 的 Hooks 功能,可在编程会话的关键节点自动执行预设操作,提升 AI 编程流程的确定性与可控性。

 人工智能 人工智能辅助编程 智能体工具 SWE 软件工程

Claude Code 推出 Hooks 功能,通过基于 Shell 的钩子系统在编程会话的关键节点自动运行命令。开发者可以精确规定每次会话中必须执行的检查、脚本或流程,减少模型行为不稳定带来的影响。该功能使 AI 编程从依赖模型临场表现,进一步转向可编排、可复现的工程化工作流。

用途与启示
  • 将代码检查、测试、格式化等操作固化为自动流程
  • 增强 AI 编程会话的确定性、可控性与可复现性
  • 为 Claude Code 接入现有软件工程和自动化工具链提供基础
📝 原始笔记(逐字保留)
1. 2025-07-02 15:30:17 Wednesday | 刚刚,Claude Code推出Hooks功能,让AI 编程从「看心情」到「真工程」 https://mp.weixin.qq.com/s/7t1sJlLnA_ardC2cK_EEfg 这个基于Shell的钩子系统能在关键时刻自动运行,让你能够精确地编排每次编程会话中必须发生的事情。

上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench

上海交通大学 Agents 团队提出 ML-Master,通过智能记忆、嵌入式推理与协同进化机制自动完成机器学习探索,并在 OpenAI MLE-bench 上取得领先成绩。

 智能体 自进化 智能体记忆 推理 任务规划 模型评估 人工智能辅助编程

上海交通大学人工智能学院 Agents 团队提出面向机器学习任务的 AI 专家智能体 ML-Master,旨在自动化问题建模、实验设计、算法探索与结果验证。系统的探索模块会收集执行结果、代码片段和性能指标,并选择性整合父节点及并行节点的信息,以构建高价值记忆。相关记忆被直接嵌入模型的推理过程,使后续决策能够利用历史反馈和多路径探索经验。推理结果与探索经验形成双向反馈,从而推动智能体持续优化实验路径,并在 OpenAI MLE-bench 中取得领先表现。

用途与启示
  • 为端到端自动化机器学习实验与竞赛任务提供智能体方案
  • 展示结构化记忆与执行反馈对智能体长期探索能力的提升作用
  • 为 AI4AI、自主算法优化和可自主演进的 AI 系统提供研究参考
  • 可用于研究机器学习工程中的自动规划、代码生成、实验迭代与评估
📝 原始笔记(逐字保留)
2025-07-02 15:17:52 Wednesday| 超越微软,全球第一!上交AI智能体炼成「Kaggle特级大师」,登顶OpenAI MLE-bench https://mp.weixin.qq.com/s/8Dn7Hvpmp59-0xDD28nQkw 随着人工智能(AI)能力在多个任务中逐步逼近甚至超过人类水平,AI-for-AI(AI4AI)正成为重要发展方向—— **利用AI技术自动化和优化AI系统自身的设计、训练和部署。** AI4AI的终极形态是实现具备**自主演进**能力的AI系统,能够独立完成从问题建模、实验设计到算法探索与验证的全过程。 类似于AlphaGo向AlphaZero的演进路径,该过程经历了从人类辅助训练到完全自主优化的阶段,体现出AI系统在自我演进上的潜力和可行性。 为助力AI4AI发展,上海交通大学人工智能学院Agents团队提出了面向机器学习(Machine Learning)的AI专家智能体「ML-Master」。 项目主页: https://sjtu-sai-agents.github.io/ML-Master 代码地址: https://github.com/sjtu-sai-agents/ML-Master 论文地址: https://arxiv.org/pdf/2506.16499 MLE-bench主页: https://github.com/openai/MLE-bench **智能记忆构建** :探索模块自动收集执行结果、代码片段和性能指标,同时选择性整合来自父节点和并行兄弟节点的关键信息,避免信息过载。 **嵌入推理决策** :记忆信息直接嵌入到推理模型的「think」部分中,让每次推理都基于具体的历史执行反馈和多样化探索的经验进行精准决策。 **协同进化机制** :推理结果指导后续探索方向,探索经验持续丰富推理过程,真正实现了探索驱动推理进化,推理反哺探索路径的良性循环。 ## 诊断决策

ICML 2025 Spotlight|清华朱军组与 NVIDIA 提出 DDO,革新扩散与自回归模型训练

DDO 在最大似然训练中融入反向 KL 散度的优化思想,无需额外判别器即可提升扩散与自回归模型的生成保真度,并刷新图像生成 SOTA。

 模型训练 模型开发 多模态 人工智能

最大似然估计(MLE)倾向于覆盖数据分布,但在模型容量有限时可能将概率质量分配到错误区域,影响生成质量。DDO 借鉴 GAN 式判别思想,在训练目标中引入反向 KL 散度成分,强化真实数据附近的密度并抑制错误区域。该方法促使模型从强调分布覆盖转向强调密度集中,从而改善生成保真度。相比直接采用 GAN 损失,DDO 避免了额外判别器及其带来的工程优化复杂性,更适合需要迭代生成的扩散和自回归模型。

用途与启示
  • 为扩散模型和自回归模型提供区别于纯 MLE 的训练新范式。
  • 在有限模型容量下平衡分布覆盖与样本保真度。
  • 降低引入 GAN 式目标时对额外判别器及复杂联合优化的依赖。
  • 可用于图像生成模型训练及特定领域微调。
📝 原始笔记(逐字保留)
2025-07-02 14:10:32 Wednesday | ICML 2025 Spotlight | 清华朱军组&NVIDIA提出DDO:扩散/自回归模型训练新范式,刷新图像生成SOTAhttps://mp.weixin.qq.com/s/tiytMxR8QJN2fFSry1mQ1w 为解决 MLE 的局限性,文章考虑使用 **GAN 式判别**的思想,在训练目标中引入**反向 KL 散度**的成分,强化模型在真实数据附近的密度,同时抑制错误区域,将模型分布由图(a):强调密度覆盖,微调为图(b):强调密度集中,从而提高生成保真度与有限模型容量下的生成质量。然而, **直接使用 GAN 损失会引入额外的判别器网络与工程优化上的复杂性** ,尤其对于扩散/自回归模型这类需要迭代式多步生成的模型。 ### 领域微调

SciArena:面向科学文献任务的开放式基础模型评估平台

SciArena 通过研究社区成对投票评估基础模型在开放式科学文献任务中的表现,并发布基于人类偏好数据的自动评价元基准 SciArena-Eval。

 模型评估 智能体工具 数据工程 多模态

SciArena 是一个面向科学文献理解与综合任务的开放协作评估平台,采用类似 Chatbot Arena 的成对比较和社区投票机制。平台支持 23 个开源及专有基础模型,并已从不同科学领域的研究人员处收集超过 13,000 张选票。数据分析显示,用户问题能够覆盖多样且真实的文献需求,评估者具有较强的自洽性与标注一致性。团队还发布了 SciArena-Eval,以人工偏好为参照衡量模型自动判断答案质量的准确性,实验表明可靠的自动评价仍具挑战。

用途与启示
  • 为开放式、长篇科学文献问答提供更贴近真实研究需求的社区评估方式
  • 可利用 SciArena-Eval 检验大模型作为自动裁判时与领域专家偏好的一致程度
  • 为科学助手的模型选型、排行榜构建及自动评价方法研究提供数据基础
  • 提醒研究者关注模型裁判在专业科学任务中的可靠性与偏差问题
📝 原始笔记(逐字保留)
10. 2025-07-02 15:35:33 Wednesday | **[SciArena:科学文献任务中基础模型的开放评估平台](https://papers.cool/arxiv/2507.01001)** **[PDF(6)]** **[Copy]** **[Kimi(2)]** **[REL]** **Authors** : [Yilun Zhao](https://arxiv.org/search/?searchtype=author&query=Yilun%20Zhao), [Kaiyan Zhang](https://arxiv.org/search/?searchtype=author&query=Kaiyan%20Zhang), [Tiansheng Hu](https://arxiv.org/search/?searchtype=author&query=Tiansheng%20Hu), [Sihong Wu](https://arxiv.org/search/?searchtype=author&query=Sihong%20Wu), [Ronan Le Bras](https://arxiv.org/search/?searchtype=author&query=Ronan%20Le%20Bras), [Taira Anderson](https://arxiv.org/search/?searchtype=author&query=Taira%20Anderson), [Jonathan Bragg](https://arxiv.org/search/?searchtype=author&query=Jonathan%20Bragg), [Joseph Chee Chang](https://arxiv.org/search/?searchtype=author&query=Joseph%20Chee%20Chang), [Jesse Dodge](https://arxiv.org/search/?searchtype=author&query=Jesse%20Dodge), [Matt Latzke](https://arxiv.org/search/?searchtype=author&query=Matt%20Latzke), [Yixin Liu](https://arxiv.org/search/?searchtype=author&query=Yixin%20Liu), [Charles McGrady](https://arxiv.org/search/?searchtype=author&query=Charles%20McGrady), [Xiangru Tang](https://arxiv.org/search/?searchtype=author&query=Xiangru%20Tang), [Zihang Wang](https://arxiv.org/search/?searchtype=author&query=Zihang%20Wang), [Chen Zhao](https://arxiv.org/search/?searchtype=author&query=Chen%20Zhao), [Hannaneh Hajishirzi](https://arxiv.org/search/?searchtype=author&query=Hannaneh%20Hajishirzi), [Doug Downey](https://arxiv.org/search/?searchtype=author&query=Doug%20Downey), [Arman Cohan](https://arxiv.org/search/?searchtype=author&query=Arman%20Cohan) 我们介绍了 SciArena,这是一个开放的协作平台,用于评估科学文献任务的基础模型。与科学文献理解和综合的传统基准不同,SciArena 遵循社区对模型比较进行投票的 Chatbot Arena 评估方法, **直接与研究社区互动** 。通过利用集体智慧,SciArena 提供了社区驱动的模型在 **开放式科学任务中的性能评估** ,这些任务需要基于文献的长篇回答。该平台目前支持 23 个开源和专有的基础模型,并已从不同科学领域的受信任研究人员那里收集了超过 13,000 张选票。我们分析了迄今为止收集的数据,并确认提交的问题是多样化的,符合现实世界的文献需求,并且参与的研究人员在他们的评估中表现出强烈的自洽性和注释者之间的一致性。我们根据模型排名排行榜讨论结果和见解。为了进一步促进为文献任务构建基于模型的自动评价系统的研究,我们发布了 ** SciArena-Eval** ,这是一个基于我们收集的偏好数据的元评价基准。该基准测试通过将模型的成对评估与人工投票进行比较来衡量模型判断答案质量的准确性。我们的实验突出了基准测试的挑战,并强调了对更可靠的自动评估方法的需求。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI)

LitBench:可靠评估创意写作的基准与数据集

LitBench 通过大规模人类偏好数据和保留测试集,为大模型创意写作提供可靠的自动评估基准,并验证了训练奖励模型相较现成 LLM 评委的优势。

 模型评估 数据工程 模型训练

LitBench 是面向创意写作评估的标准化基准和配对数据集,包含 2,480 个经过偏差处理和人工标注的 Reddit 故事比较,以及 43,827 对人类偏好训练数据。研究基于该基准测试了零样本 LLM 评委,并训练 Bradley-Terry 与生成式奖励模型。Claude-3.7-Sonnet 是表现最强的现成评委,与人类偏好的一致率为 73%,而两类训练奖励模型的准确率均达到 78%。在线人类研究进一步表明,这些奖励模型在新生成故事上的排序也能稳定匹配人类偏好。

用途与启示
  • 为开放式创意写作建立可复现、标准化的自动评估流程。
  • 可利用配对偏好数据训练奖励模型,替代可靠性不足的零样本 LLM 裁判。
  • 为创意写作模型的训练、筛选、排序和偏好优化提供评估资源。
  • 提示评估开放式生成任务时,应通过独立的人类研究验证自动评委的泛化能力。
📝 原始笔记(逐字保留)
12. 2025-07-02 17:12:16 Wednesday| **[LitBench:可靠评估创意写作的基准和数据集](https://papers.cool/arxiv/2507.00769)** **[PDF(5)]** **[Copy]** **[Kimi(3)]** **[REL]** **Authors** : [Daniel Fein](https://arxiv.org/search/?searchtype=author&query=Daniel%20Fein), [Sebastian Russo](https://arxiv.org/search/?searchtype=author&query=Sebastian%20Russo), [Violet Xiang](https://arxiv.org/search/?searchtype=author&query=Violet%20Xiang), [Kabir Jolly](https://arxiv.org/search/?searchtype=author&query=Kabir%20Jolly), [Rafael Rafailov](https://arxiv.org/search/?searchtype=author&query=Rafael%20Rafailov), [Nick Haber](https://arxiv.org/search/?searchtype=author&query=Nick%20Haber) 评估大型语言模型 (LLM) 生成的创意写作仍然具有挑战性,因为开放式叙述缺乏基本事实。如果没有高性能的自动评估方法,现成的 (OTS) 语言模型被用作零镜头评判,但在这种情况下,它们的可靠性尚不清楚。为了追求对创意写作的稳健评估,我们引入了 LitBench,这是第一个用于创意写作验证的标准化基准和配对数据集,包括一个保留的测试集,其中包含 2,480 个来自 Reddit 的去偏见、人类标记的故事比较和一个 43,827 对人类偏好标签的训练语料库。使用 LitBench,我们 (i) 对零镜头 LLM 评委进行基准测试,(ii) 训练 Bradley Terry 和生成奖励模型,以及 (iii) 进行在线人体研究,以验证新 LLM 生成的故事的奖励模型排名。我们的基准将 Claude-3.7-Sonnet 确定为最强的现成评委,与人类偏好的一致性达到 73%;在经过训练的奖励模型中,Bradley-Terry 和 Generative reward 模型的准确率均达到 78%,优于所有现成的裁判。一项在线人类研究进一步证实,我们训练有素的奖励模型始终与人类在新颖的 LLM 生成的故事中的偏好保持一致。我们在 https://huggingface.co/collections/SAA-Lab/litbench-68267b5da3aafe58f9e43461 上发布 LitBench 和奖励模型,为创意写作系统的可靠、自动评估和优化提供经过审查的资源。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) **发布** : 2025-07-01 14:10:36 UTC

LMGame-Bench:用经典游戏评测大模型感知、记忆与推理能力

UCSD等机构提出LMGame-Bench,以六款经典游戏分模块评估大模型的感知、记忆、空间推理与长期决策能力,测试中o3系列在俄罗斯方块等项目表现突出。

 逻辑推理 模型评估 推理 智能体记忆 任务规划

UCSD等机构推出LMGame-Bench,将推箱子、超级马里奥兄弟、俄罗斯方块、2048、糖果消除和逆转裁判纳入统一的大模型评测框架。各游戏分别考察空间规划、物理直觉、上下文理解、长期记忆和持续决策等能力,并采用累计得分、移动距离或正确操作次数等指标。实验显示,不同模型在各类游戏中的表现差异明显,其中o3-pro在俄罗斯方块中能够持续清除多行并维持游戏进程。该基准表明,交互式游戏可用于揭示传统静态问答评测难以覆盖的长期推理与环境适应能力。

用途与启示
  • 为大模型的感知、记忆、规划和逻辑推理能力提供统一的交互式评估方案
  • 利用不同游戏机制定位模型在空间推理、物理直觉和上下文理解方面的能力短板
  • 通过2048等长时程任务检验模型在超长交互中的记忆保持与决策稳定性
  • 为游戏智能体及通用智能模型的训练、对比和迭代提供可量化依据
📝 原始笔记(逐字保留)
20250702 | o3通关「俄罗斯方块」,碾压Gemini夺冠!UCSD新基准击碎宝可梦 https://mp.weixin.qq.com/s/y1AbevqwdfIJnx7ffkaKUw UCSD等推出Lmgame Bench标准框架,结合多款经典游戏,分模块测评模型的 **感知** 、记忆与推理表现。结果显示,不同模型在各游戏中表现迥异,凸显游戏作为AI评估工具的独特价值。 论文地址:https://arxiv.org/pdf/2505.15146 **推箱子** :得分计算方式为所有关卡中推到目标位置的箱子总数,统计范围从非常简单的关卡一直到Sokoban 1989中最难的关卡,直到出现第一个死局为止。 **超级马里奥兄弟** :分数是马里奥在所有关卡中累计的横向移动距离(游戏单位),直到失去全部三条生命或完成最终关卡为止。具备更强物理直觉和空间推理能力的模型通常能够获得更高的分数。 **俄罗斯方块** :分数是已注册的总方块数加上消除的总行数(乘以10倍系数),计算至游戏结束为止。不同的模型持续游戏的时间各不相同,这取决于它们高效处理下落方块的能力。例如,o3-pro能够有效清除超过10行,从而持续保持游戏进行。 **2048** :合并方块值的总和(例如,合并两个2会获得+4),记录直到棋盘停滞(连续十次回合没有合并或改变棋盘的移动)。然后我们会报告它们的总得分。由于游戏可以持续超过10万步,这为区分模型在较长时间范围内的能力提供了强有力的依据。 **糖果消除** :在固定的50步会话中消除的糖果总数。尽管游戏相对简单,但它能有效区分模型在优化移动步骤和清除糖果方面的能力。 **逆转裁判** :在所有案件关卡中正确操作(提交证据、对话选择等)的总次数,直到用尽五次错误决定机会(生命值)。此游戏用于评估模型的上下文理解和推理能力。
0%