2025-06-20 科研追新
当日精选(由提交工具自动创建)。
向量化时间步:极低成本微调大规模预训练视频扩散模型
FVDM 通过向量化时间步重新设计视频扩散模型的时序建模,并结合 Pusa 工具以较低成本微调大规模预训练视频模型。
论文《Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach》提出向量化时间步方法,用于改进视频扩散模型的时序建模。该思路允许在视频序列内部采用更灵活的时间步表示,为预训练视频模型的高效适配提供新路径。Pusa-VidGen 项目公开了相关主页与代码,可用于探索低成本视频生成模型微调。该方向也与 FastWan 系视频生成模型所关注的高效生成和训练优化密切相关。
- 降低大规模预训练视频扩散模型的微调成本
- 改善视频生成过程中的时序建模与帧间一致性
- 为资源有限的团队复现和适配视频生成模型提供开源工具
- 启发从时间步表示层面优化扩散模型训练与推理
📝 原始笔记(逐字保留)
DPO 与 GRPO 在自回归图像生成中的系统性对比
港中文、北大等机构首次系统比较 DPO 与 GRPO 在思维链自回归图像生成中的域内外表现,并分析奖励模型和扩展策略的影响。
研究围绕带有思维链的自回归图像生成,全面比较 DPO 与 GRPO 两种强化学习方法。实验同时评估了二者在域内和域外任务上的性能与泛化能力。作者进一步考察不同奖励模型以及扩展策略对训练效果的影响,为图像生成模型选择后训练算法提供了系统依据。论文题为《Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO》,相关代码已开源。
- 为自回归图像生成模型选择 DPO 或 GRPO 提供实验依据
- 帮助评估强化学习算法在域外场景中的泛化能力
- 指导奖励模型设计与训练扩展策略的选择
- 为多模态生成模型的强化学习后训练研究提供基准
📝 原始笔记(逐字保留)
田渊栋团队:连续思维链通过“叠加态”实现多路径并行推理
田渊栋团队从理论上解释了连续思维链的优势,指出连续隐向量可叠加编码多条推理路径,从而实现高效并行搜索。
连续思维链使用连续隐向量而非离散 token 承载中间推理状态,已有实验显示其能够显著提升推理性能。田渊栋领衔的 UC 伯克利与 UCSD 团队利用连续空间中的“叠加态”解释这一现象:单个隐状态可以同时编码多条候选路径。模型因此能够进行类似并行搜索的推理,而不必逐条生成并验证离散步骤。该方法在图可达性等任务中取得明显提升,为连续思维链的有效性提供了理论支持。
- 为连续思维链优于离散思维链提供理论解释
- 启发利用隐空间叠加表示实现多路径并行搜索
- 有望减少逐 token 展开推理带来的时间与计算开销
- 可用于图搜索、可达性判断等需要探索多条候选路径的任务
📝 原始笔记(逐字保留)
昆仑万维发布软件工程智能体模型 Skywork-SWE-32B
昆仑万维基于经过执行验证的 8,209 条高质量代码修复轨迹,训练并发布了 32B 参数的软件工程智能体模型 Skywork-SWE-32B。
SWE 软件工程 人工智能辅助编程 智能体 数据工程 模型训练 模型开发
昆仑万维从 15 万个开源仓库中采集并筛选 PR 任务,通过安装验证获得 23,389 个有效样本,同时排除 SWE-bench Verified 涉及的仓库以防止数据泄漏。团队进一步统一执行命令、构建 Docker 环境并运行单元测试,以验证问题及其修复的有效性。随后,他们基于 OpenHands 框架调用 Claude、DeepSeek 等模型执行最多 100 轮交互,并进行 Patch 级验证。最终形成包含 8,209 条高质量、长上下文、多轮交互轨迹的 Skywork-SWE 数据集,并据此训练出 Skywork-SWE-32B 自主代码智能体模型。
- 为仓库级缺陷定位、代码修改和自动化测试提供自主代码智能体。
- 展示从 GitHub 任务采集、可执行环境构建到轨迹验证的完整软件工程数据生产流程。
- 通过 Docker、单元测试和 Patch 级验证提高训练数据的可执行性与可靠性。
- 为构建长上下文、多轮交互的软件工程智能体训练集提供参考。
📝 原始笔记(逐字保留)
微软发布 SWE-bench-Live:Agent 全自动搭建代码环境并实时更新评测
微软推出代码修复评测基准 SWE-bench-Live,并通过 REPOLAUNCH 智能体自动构建、测试和更新真实 GitHub Issue 的运行环境,以降低评测过拟合与数据污染风险。
SWE 软件工程 人工智能辅助编程 智能体 模型评估 自动化部署 数据工程
微软发布代码修复评测基准 SWE-bench-Live,持续引入 GitHub 上的最新 Issue,提升代码模型评估的时效性与真实性。其核心框架 REPOLAUNCH 可根据真实 Issue 自动搭建 Docker 运行环境,并执行测试验证,全流程无需人工干预。该基准按月自动更新,以持续提供新鲜且具有代表性的评测数据。相较静态基准,这种动态评测机制有助于减少数据泄露、训练数据污染和模型针对固定测试集过拟合的问题。
- 为代码修复模型与编程智能体提供更接近真实软件开发场景的动态评测。
- 自动化复现仓库环境,可显著降低构建代码评测集的人工成本。
- 按月引入最新 Issue,有助于识别模型因数据污染或记忆基准答案造成的虚高表现。
- REPOLAUNCH 的环境构建与验证流程可用于持续集成、自动化测试和软件维护智能体的设计。
📝 原始笔记(逐字保留)
IneqMath:29个大模型奥数级不等式证明成功率不足50%
斯坦福、加州大学伯克利分校和MIT等机构的研究发现,大语言模型在奥数级不等式证明中常出现答案正确但逻辑链不可靠的问题,整体成功率不足50%。
研究论文《Solving Inequality Proofs with Large Language Models》系统评估了29个主流大模型解决奥数级不等式证明的能力。结果表明,模型即使得到正确结论,证明过程也可能包含猜测、逻辑跳步或无法成立的推导。多数模型在该任务上的证明成功率低于50%,暴露出答案正确率无法充分反映真实推理能力的问题。项目同时发布了 IneqMath 数据集、代码、可视化工具和公开排行榜,以支持细粒度的数学推理评测。
- 用于评估大模型在高难度数学证明中的真实逻辑推理能力。
- 提醒研究者区分“答案正确”与“证明过程有效”,避免仅以最终答案衡量模型。
- 可作为数学推理训练、错误分析、过程监督和验证器研究的基准。
- 为构建更可靠、可检查的形式化或半形式化证明系统提供数据与工具。
📝 原始笔记(逐字保留)
苹果《思考的错觉》再遭质疑:Claude与人类共著论文指出三大测试缺陷
研究者指出苹果《思考的错觉》关于大模型遇到难题后推理崩溃的结论,可能受到 token 预算、评估误判和谜题不可解性三类测试缺陷影响,但长推理链仍是模型的真实弱点。
苹果原研究认为,当问题难度超过某个临界点后,大模型的推理能力会出现系统性崩溃。后续由 Claude 参与共著的论文指出,该实验存在三项关键缺陷:限制 token 预算、将部分正确答案误判为错误,以及使用数学上不可解的谜题。这些问题意味着实验观察到的“推理崩溃”未必完全源于模型能力不足。不过,另一项分析认为,大模型难以稳定维持超长推理链仍是真实存在的弱点。
- 提醒研究者区分模型能力上限与测试设置造成的表面失败。
- 设计推理基准时,应检查任务是否可解,并提供与难度匹配的 token 预算。
- 评估复杂推理不能只依赖严格字符串匹配,应核验中间过程及等价答案。
- 长链推理的稳定性仍值得通过更严谨、可复现的实验继续研究。