2025-06-20 科研追新

当日精选(由提交工具自动创建)。

向量化时间步:极低成本微调大规模预训练视频扩散模型

FVDM 通过向量化时间步重新设计视频扩散模型的时序建模,并结合 Pusa 工具以较低成本微调大规模预训练视频模型。

 多模态 模型训练 系统优化 模型开发

论文《Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach》提出向量化时间步方法,用于改进视频扩散模型的时序建模。该思路允许在视频序列内部采用更灵活的时间步表示,为预训练视频模型的高效适配提供新路径。Pusa-VidGen 项目公开了相关主页与代码,可用于探索低成本视频生成模型微调。该方向也与 FastWan 系视频生成模型所关注的高效生成和训练优化密切相关。

用途与启示
  • 降低大规模预训练视频扩散模型的微调成本
  • 改善视频生成过程中的时序建模与帧间一致性
  • 为资源有限的团队复现和适配视频生成模型提供开源工具
  • 启发从时间步表示层面优化扩散模型训练与推理
📝 原始笔记(逐字保留)
3. 2025-06-20 11:24:24 Friday | 极低成本微调大规模预训练视频模型https://mp.weixin.qq.com/s/MCOrbgJvqWwFnYmavSde6w 论文标题:Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach FVDM 论文:https://arxiv.org/abs/2410.03160 Pusa 主页 / 代码库: https://github.com/Yaofang-Liu/Pusa-VidGen #### FastWan系视频生成模型

DPO 与 GRPO 在自回归图像生成中的系统性对比

港中文、北大等机构首次系统比较 DPO 与 GRPO 在思维链自回归图像生成中的域内外表现,并分析奖励模型和扩展策略的影响。

 强化学习 多模态 模型训练 模型评估

研究围绕带有思维链的自回归图像生成,全面比较 DPO 与 GRPO 两种强化学习方法。实验同时评估了二者在域内和域外任务上的性能与泛化能力。作者进一步考察不同奖励模型以及扩展策略对训练效果的影响,为图像生成模型选择后训练算法提供了系统依据。论文题为《Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO》,相关代码已开源。

用途与启示
  • 为自回归图像生成模型选择 DPO 或 GRPO 提供实验依据
  • 帮助评估强化学习算法在域外场景中的泛化能力
  • 指导奖励模型设计与训练扩展策略的选择
  • 为多模态生成模型的强化学习后训练研究提供基准
📝 原始笔记(逐字保留)
3. 2025-06-20 11:39:57 Friday | DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究 https://mp.weixin.qq.com/s/bv6biTQUCr49gvu7PmECTg **该研究首次对 GRPO 和 DPO 算法在自回归图像生成中的应用进行了全面深入的比较** ,不仅评估了它们在域内(in-domain)和域外(out-of-domain)的性能,还细致探究了不同奖励模型及扩展策略对其能力的影响。 论文标题:Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO 论文链接:https://arxiv.org/abs/2505.17017 代码链接:https://github.com/ZiyuGuo99/Image-Generation-CoT #### Qwen3 模型提出GSPO 算法

田渊栋团队:连续思维链通过“叠加态”实现多路径并行推理

田渊栋团队从理论上解释了连续思维链的优势,指出连续隐向量可叠加编码多条推理路径,从而实现高效并行搜索。

 推理 逻辑推理 人工智能

连续思维链使用连续隐向量而非离散 token 承载中间推理状态,已有实验显示其能够显著提升推理性能。田渊栋领衔的 UC 伯克利与 UCSD 团队利用连续空间中的“叠加态”解释这一现象:单个隐状态可以同时编码多条候选路径。模型因此能够进行类似并行搜索的推理,而不必逐条生成并验证离散步骤。该方法在图可达性等任务中取得明显提升,为连续思维链的有效性提供了理论支持。

用途与启示
  • 为连续思维链优于离散思维链提供理论解释
  • 启发利用隐空间叠加表示实现多路径并行搜索
  • 有望减少逐 token 展开推理带来的时间与计算开销
  • 可用于图搜索、可达性判断等需要探索多条候选路径的任务
📝 原始笔记(逐字保留)
9. 2025-06-20 12:40:27 Friday| 田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索 https://mp.weixin.qq.com/s/y0AxT-nUivq2oPSf5RktmQ 近期研究发现,用连续隐向量(非离散token)进行推理能显著提升性能,但缺乏理论解释。 田渊栋领衔来自UC伯克利、UCSD的科学家们利用连续空间中的 “叠加态”,让大模型进行并行推理,大幅提升了模型在图可达性等任务中的表现,给上述连续思维链提供了理论支持。

昆仑万维发布软件工程智能体模型 Skywork-SWE-32B

昆仑万维基于经过执行验证的 8,209 条高质量代码修复轨迹,训练并发布了 32B 参数的软件工程智能体模型 Skywork-SWE-32B。

 SWE 软件工程 人工智能辅助编程 智能体 数据工程 模型训练 模型开发

昆仑万维从 15 万个开源仓库中采集并筛选 PR 任务,通过安装验证获得 23,389 个有效样本,同时排除 SWE-bench Verified 涉及的仓库以防止数据泄漏。团队进一步统一执行命令、构建 Docker 环境并运行单元测试,以验证问题及其修复的有效性。随后,他们基于 OpenHands 框架调用 Claude、DeepSeek 等模型执行最多 100 轮交互,并进行 Patch 级验证。最终形成包含 8,209 条高质量、长上下文、多轮交互轨迹的 Skywork-SWE 数据集,并据此训练出 Skywork-SWE-32B 自主代码智能体模型。

用途与启示
  • 为仓库级缺陷定位、代码修改和自动化测试提供自主代码智能体。
  • 展示从 GitHub 任务采集、可执行环境构建到轨迹验证的完整软件工程数据生产流程。
  • 通过 Docker、单元测试和 Patch 级验证提高训练数据的可执行性与可靠性。
  • 为构建长上下文、多轮交互的软件工程智能体训练集提供参考。
📝 原始笔记(逐字保留)
250620 https://mp.weixin.qq.com/s/RTLZAir7R-o5fp0CLL-cJA 📖 技术报告:https://huggingface.co/Skywork/Skywork-SWE-32B/resolve/main/assets/Report.pdf 📰 技术博客:https://quixotic-sting-239.notion.site/eb17f379610040ceb54da5d5d24065bd 🤗 模型权重:https://huggingface.co/Skywork/Skywork-SWE-32B 数据构建: ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=M2I0NDljNzM0YWYwY2FhNTg1OGQ2YjAwMjkzZjVlYjNfdmVhRFpnbE1pOWVCazVwQk13aEk2bWJNOVhOcjhEcGNfVG9rZW46R0Y2cWJ1MjFVbzlkWDV4Zk9rQmNTVGIwblFoXzE3NTQ0NjI4MzQ6MTc1NDQ2NjQzNF9WNA) 具体来说,阶段 A 的工作是数据采集与预筛选,其中又细分为 GitHub 元数据抓取、PR(Pull Request)收集与任务初筛和安装验证 3 个步骤。第一阶段的处理下来,昆仑万维团队从 15 万个开源仓库中得到了 23,389 个有效任务样本。为了防止数据泄漏,排除 SWE-bench Verified(测试数据集)已包含的仓库。 而阶段 B 则是环境设置和基于执行的验证。同样,这一阶段也分为三个步骤:统一命令生成、Docker 环境构建和单元测试验证。很容易看出来,这一步的目标是确保问题的修复是有效的,进而进一步保证数据的质量。 最后,还需要针对每个任务生成正确的智能体轨迹。这也正是阶段 C 的任务目标。同样地,三个步骤:首先,昆仑万维团队基于开源的 OpenHands 代码智能体框架,选用代码能力突出的商用大模型(如 Claude,DeepSeek 等)作为智能体基座,对每个任务执行最多 100 轮交互,完整记录智能体在问题求解过程中的交互轨迹。然后,他们进行了 Patch 级的验证,以确保智能体行为严格对齐仓库级代码修复目标。最后,构建训练样本库,得到了 8,209 条高质量、长上下文、多轮交互的经过验证的轨迹。 走完全流程后,昆仑万维团队得到了一个当前规模最大、质量最高且可验证的软件工程任务数据集:Skywork-SWE。是的,正是基于该数据集,昆仑万维训练出了同名的自主代码智能体模型:Skywork-SWE-32B!(注:32B 是指模型参数量。) ## 模型 #### SWE-Swiss:一把修复代码Bug的「瑞士军刀」

微软发布 SWE-bench-Live:Agent 全自动搭建代码环境并实时更新评测

微软推出代码修复评测基准 SWE-bench-Live,并通过 REPOLAUNCH 智能体自动构建、测试和更新真实 GitHub Issue 的运行环境,以降低评测过拟合与数据污染风险。

 SWE 软件工程 人工智能辅助编程 智能体 模型评估 自动化部署 数据工程

微软发布代码修复评测基准 SWE-bench-Live,持续引入 GitHub 上的最新 Issue,提升代码模型评估的时效性与真实性。其核心框架 REPOLAUNCH 可根据真实 Issue 自动搭建 Docker 运行环境,并执行测试验证,全流程无需人工干预。该基准按月自动更新,以持续提供新鲜且具有代表性的评测数据。相较静态基准,这种动态评测机制有助于减少数据泄露、训练数据污染和模型针对固定测试集过拟合的问题。

用途与启示
  • 为代码修复模型与编程智能体提供更接近真实软件开发场景的动态评测。
  • 自动化复现仓库环境,可显著降低构建代码评测集的人工成本。
  • 按月引入最新 Issue,有助于识别模型因数据污染或记忆基准答案造成的虚高表现。
  • REPOLAUNCH 的环境构建与验证流程可用于持续集成、自动化测试和软件维护智能体的设计。
📝 原始笔记(逐字保留)
20250620 Agent全自动搭建代码运行环境,实时更新解决评测过拟合/数据污染问题|微软 https://mp.weixin.qq.com/s/mWWlI-AEhtbFt-xzOYlyjQ 微软发布全新代码修复评测基准 **SWE-bench-Live** ,不仅引入了来自GitHub最新的Issue,显著提升了对模型评估的实时性与准确性,还实现代码运行环境的全自动化构建与自动更新,打破了传统静态评测基准的局限。 SWE-bench-Live开创性地采用了基于Agent的智能化框架 **REPOLAUNCH** ,彻底解决了这些问题。 REPOLAUNCH可以根据Github中真实的Issue,自动搭建其Docker环境并执行测试验证,整个流程完全无人干预,并且每月自动更新,持续提供最新鲜、最具代表性的评测数据。这种自动化的实时更新模式,消除了数据泄露与模型过拟合风险。 #### NoCode-bench:自然语言驱动功能添加

IneqMath:29个大模型奥数级不等式证明成功率不足50%

斯坦福、加州大学伯克利分校和MIT等机构的研究发现,大语言模型在奥数级不等式证明中常出现答案正确但逻辑链不可靠的问题,整体成功率不足50%。

 逻辑推理 推理 模型评估 数据工程

研究论文《Solving Inequality Proofs with Large Language Models》系统评估了29个主流大模型解决奥数级不等式证明的能力。结果表明,模型即使得到正确结论,证明过程也可能包含猜测、逻辑跳步或无法成立的推导。多数模型在该任务上的证明成功率低于50%,暴露出答案正确率无法充分反映真实推理能力的问题。项目同时发布了 IneqMath 数据集、代码、可视化工具和公开排行榜,以支持细粒度的数学推理评测。

用途与启示
  • 用于评估大模型在高难度数学证明中的真实逻辑推理能力。
  • 提醒研究者区分“答案正确”与“证明过程有效”,避免仅以最终答案衡量模型。
  • 可作为数学推理训练、错误分析、过程监督和验证器研究的基准。
  • 为构建更可靠、可检查的形式化或半形式化证明系统提供数据与工具。
📝 原始笔记(逐字保留)
8. 🌈 🌈 2025-06-20 12:37:16 Friday | AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT https://mp.weixin.qq.com/s/4ihjYVg-O1mOUJTt_Z6pQA https://mp.weixin.qq.com/s/e9dU9WaZOa7BNP6iJxr_cQ 大语言模型解决不等式证明问题时,**可以给出正确答案,但大多数时候是靠猜。推理过程经不起推敲,逻辑完全崩溃。** 斯坦福大学、UC伯克利、MIT等机构联合发布研究论文《Solving Inequality Proofs with Large Language Models》,首次系统评估了**29个顶级大模型在奥数级不等式证明任务上的能力。** 完整项目主页:🌐 https://ineqmath.github.io 📜 论文:https://arxiv.org/abs/2506.07927 🛠️ 代码库:https://github.com/lupantech/ineqmath 📊 数据集:https://huggingface.co/datasets/AI4Math/IneqMath 🏆 排行榜:https://huggingface.co/spaces/AI4Math/IneqMath-Leaderboard 🔍 数据集可视化展示:https://ineqmath.github.io/#visualization 𝕏 推特:https://x.com/lupantech/status/1932866286427779586 ## 最新讨论 ### [AI能不能不仅发明新策略,而是「发明一款像围棋那样优雅、耐玩、审美上同样动人的游戏」?答案目前是否定的。这正是距「通用」的短板:真正的AGI,也该能做到这种层面的创造](https://mp.weixin.qq.com/s/QS5HzdbY5z1mURtVcm7uwQ) (2025-09)

苹果《思考的错觉》再遭质疑:Claude与人类共著论文指出三大测试缺陷

研究者指出苹果《思考的错觉》关于大模型遇到难题后推理崩溃的结论,可能受到 token 预算、评估误判和谜题不可解性三类测试缺陷影响,但长推理链仍是模型的真实弱点。

 逻辑推理 推理 模型评估 人工智能

苹果原研究认为,当问题难度超过某个临界点后,大模型的推理能力会出现系统性崩溃。后续由 Claude 参与共著的论文指出,该实验存在三项关键缺陷:限制 token 预算、将部分正确答案误判为错误,以及使用数学上不可解的谜题。这些问题意味着实验观察到的“推理崩溃”未必完全源于模型能力不足。不过,另一项分析认为,大模型难以稳定维持超长推理链仍是真实存在的弱点。

用途与启示
  • 提醒研究者区分模型能力上限与测试设置造成的表面失败。
  • 设计推理基准时,应检查任务是否可解,并提供与难度匹配的 token 预算。
  • 评估复杂推理不能只依赖严格字符串匹配,应核验中间过程及等价答案。
  • 长链推理的稳定性仍值得通过更严谨、可复现的实验继续研究。
📝 原始笔记(逐字保留)
250620 🔗:https://mp.weixin.qq.com/s/o6UkRmLa4Pq_VSWBxVGKoA 原研究的观点是:当题目难度超过临界点时,大模型推理会崩溃。 第二篇认为这里面有三个测试瑕疵, **token预算限制** 、 **评估误判** 、以及谜题设计的 **数学不可解性** 。 第三篇/这位作者认为大模型在维持非常长的推理链方面仍然存在真正的弱点。 ### 苹果《思考的错觉》再挨批,Claude与人类共著论文指出其三大关键缺陷
0%