2025-06-19 科研追新
当日精选(由提交工具自动创建)。
腾讯元宝推出 AI 编程模式,支持代码实时预览
腾讯元宝上线 AI 编程模式,可生成代码并实时展示运行或页面预览效果。
腾讯元宝于 2025 年 6 月 19 日推出 AI 编程模式。该模式支持通过自然语言辅助生成代码,并提供实时预览功能。用户可在编写和调整代码的过程中直接查看效果,从而缩短开发与验证链路。
- 降低代码生成、调试和效果验证的使用门槛
- 通过实时预览提升原型开发与前端迭代效率
- 展示通用 AI 助手向集成式编程工具演进的趋势
📝 原始笔记(逐字保留)
LensLLM:以低成本预测微调表现的LLM选型框架
弗吉尼亚理工大学提出入选ICML 2025的LensLLM框架,通过少量微调数据预测不同大模型的最终性能与排名,并将选型成本降低近90%。
弗吉尼亚理工大学研究人员推出了大模型选型框架 LensLLM,旨在减少模型微调与评测中的试错成本。该框架基于新的 PAC-Bayes 泛化界限,刻画LLM微调表现随数据规模变化的非线性规律。研究团队进一步构建了由神经切线核(NTK)增强的缩放律模型,仅需在少量数据上进行微调,便可拟合完整微调曲线、预测最终测试性能并对候选模型排序。实验显示,LensLLM在提升选型效果的同时可将成本降低近90%。
- 为特定任务快速筛选最值得微调的大模型,减少全量实验开销。
- 利用少量数据预测完整微调收益,为模型采购、部署和算力分配提供依据。
- 展示PAC-Bayes理论、NTK与缩放律在实际LLM选型和性能预测中的结合方式。
📝 原始笔记(逐字保留)
自适应引导加速推理模型的强化学习
Guide 通过自适应注入自然语言提示并校正离策略轨迹的重要性采样,在数学推理任务上提升了 RLVR 的学习效率与泛化能力。
研究分析了可验证奖励强化学习(RLVR)如何提升推理模型性能,将其归纳为把 pass@k 压缩至 pass@1,以及学习解决原本无法完成的新问题所产生的“能力增益”。实验覆盖 0.5B 至 72B 参数模型和超过 50 万个数学、科学及代码推理问题,发现新能力的获得主要来自模型的自我提升。基于这些观察,作者提出 Guide 在线训练算法:对初始展开全部错误的问题自适应加入自然语言提示,同时要求模型自行推导完整解题链。Guide-GRPO 和 Guide-PPO 通过调整离策略轨迹的重要性采样,使模型在移除提示后仍能优化策略;其中 Guide-GRPO 在 7B 和 32B 模型的数学基准上取得最高约 4% 的宏平均增益。
- 为 RLVR 训练提供一种按题目难度动态加入指导信息的方法,减少无效探索。
- 说明推理性能提升不仅来自采样结果向 pass@1 集中,也来自模型获得新的解题能力。
- 可用于改进数学、科学和代码推理模型的训练效率及跨任务泛化。
- 为提示辅助的在线强化学习、离策略校正和课程学习设计提供参考。
📝 原始笔记(逐字保留)
具有可验证奖励的强化学习可隐式激励基础大模型正确推理
论文提出更严格的 CoT-Pass@K 指标,并从理论与实验两方面表明,具有可验证奖励的强化学习能够真正提升基础大模型的正确推理能力,而非仅重新加权已有推理路径。
传统 Pass@K 只检查最终答案是否正确,可能将推理链不准确或不完整的样本误判为成功,因而无法可靠衡量模型的真实推理能力。作者提出 CoT-Pass@K,要求思维链与最终答案同时正确,以更精确地评估推理路径质量。理论分析指出,RLVR 不同于传统强化学习,其结构能够对逻辑完整性形成隐式激励。实验显示,在 CoT-Pass@K 下,RLVR 对所有 K 值均能促进正确推理的泛化,而且这种能力在训练早期便开始出现并平稳扩展。
- 为 RLVR 推理模型提供比 Pass@K 更可靠的评估方法
- 说明 RLVR 的收益并非只是牺牲多样性、重新加权已有推理路径
- 启示训练与评估应同时验证最终答案和完整推理过程
- 为研究可验证奖励如何促进逻辑完整性与推理泛化提供理论依据
📝 原始笔记(逐字保留)
LEMMA:用“错题本”反思学习提升大模型数学推理能力
上海AI Lab提出LEMMA,通过构建“错误-纠正”数据并训练模型反思错误,使Llama3-8B在数学任务上的准确率最高提升13.3%。
LEMMA(Learning from Errors for Mathematical Advancement)旨在让大模型从数学推理错误中学习。研究者通过分析模型的错误过程,构建“错误-纠正”数据集,并利用反思机制引导模型从错误思路平滑过渡到正确答案。实验将该方法与RefAug、RFT、ISC、S3C-Math等八种主流基线进行比较。结果显示,LEMMA在常见数学任务上取得更高正确率,并使Llama3-8B的准确率最高提升13.3%。
- 将模型生成的错误轨迹转化为可复用的高价值训练数据。
- 通过显式反思与纠错过程增强数学推理能力,而非只学习标准答案。
- 为构建具备持续纠错和自我改进能力的大模型提供训练思路。
📝 原始笔记(逐字保留)
探索推理:一种熵的视角
研究发现语言模型推理中的高熵区域与关键逻辑决策、反思纠错及罕见行为密切相关,并通过熵增强优势函数提升推理探索能力和 Pass@K 表现。
论文从熵的视角重新审视强化学习中探索与利用的平衡,分析其与语言模型探索性推理行为的关系。实验表明,高熵区域往往对应关键逻辑步骤、自我验证与纠错,以及基础模型较少探索的罕见行为。作者对标准强化学习进行极小改动,在优势函数中加入基于熵的项,以鼓励模型生成更长、更深的推理链。该方法不同于通过扩大不确定性进行探索的传统最大熵方法,并在较大 K 值下仍显著提升 Pass@K。
- 可将 token 熵作为识别关键推理节点和反思行为的信号。
- 为突破强化学习推理训练的性能平台提供低成本、易实现的改进方案。
- 提示模型探索不必单纯依赖增加随机性,也可通过奖励深层推理路径来实现。
- Pass@K 的持续提升表明该方法有望扩展语言模型推理能力的上限。
📝 原始笔记(逐字保留)
AgentSynth:面向通用计算机使用智能体的可扩展任务生成
AgentSynth通过组合易生成的原子子任务,低成本合成超过6000个难度可控的计算机使用任务及轨迹。
AgentSynth是一条面向通用计算机使用智能体的自动化数据合成管线,由角色引导的LLM任务提议器、执行并记录轨迹的智能体,以及负责汇总子任务的独立智能体组成。它利用信息不对称,将生成时简单、组合后更具挑战性的子任务串联为长期复合任务,并通过调整子任务数量控制难度。该方法生成了超过6000个多样且贴近现实的任务,平均每条轨迹成本约为0.60美元。实验中,先进LLM智能体的成功率从难度1的18%下降至难度6的4%,表明合成基准具有较强的难度和区分度。
- 为计算机使用智能体低成本扩充高质量任务与交互轨迹,减少对人工标注的依赖。
- 通过可控组合原子子任务,系统构造不同复杂度的长程任务。
- 可用于智能体训练、能力评估和失败模式分析,并为课程学习式数据生成提供参考。
📝 原始笔记(逐字保留)
MiniMax 发布海螺 2.0,原生支持 1080P
MiniMax 发布海螺 2.0,强化极端物理场景的处理能力,并原生支持 1080P 输出。
MiniMax 正式发布海螺 2.0。新版本重点提升了对极端物理情况的处理能力,有望改善复杂动态场景的生成效果。模型原生支持 1080P,可直接生成更高分辨率的内容。
- 适用于复杂物理运动与高分辨率视频内容生成
- 体现视频生成模型正持续增强物理规律理解与画质表现
📝 原始笔记(逐字保留)
Gemini 2.5 Pro 稳定版全面可用
Google 正式发布并全面开放 Gemini 2.5 Pro 稳定版,模型与 6 月 5 日推出的预览版保持一致,并展示了其完成宝可梦等长期复杂任务的能力。
Google 于 2025 年 6 月 19 日宣布 Gemini 2.5 Pro 稳定版全面可用,其模型能力与 6 月 5 日发布的预览版相比没有变化。官方技术报告系统介绍了该模型的能力与评估结果。相关研究还展示了 Gemini 智能体游玩《宝可梦》的完整过程,模型能够执行长期复杂任务,并发现一处约 30 年前游戏代码中的 Bug。这一案例体现了模型在推理、规划和持续交互方面的潜力。
- 为需要稳定版本的开发者和企业提供可用于生产环境的 Gemini 2.5 Pro。
- 展示大模型在长周期游戏任务、环境交互和动态规划中的智能体能力。
- 通过发现历史代码 Bug,说明模型可辅助复杂软件系统的调试与分析。
📝 原始笔记(逐字保留)
Xolver:基于整体经验学习的多智能体推理框架
Xolver通过持久且持续演化的整体经验记忆,让多个智能体在推理时综合检索、工具、协作与反馈经验,无需训练即可显著提升数学和代码推理能力。
Xolver是一个无需额外训练的多智能体推理框架,为黑盒大语言模型引入持久且不断演化的整体经验记忆。它融合外部与自我检索、工具使用、智能体协作、代理评估和迭代改进,使模型能够复用策略、代码片段及抽象推理模式。该框架适用于开放权重和专有模型,轻量级骨干也能在多项任务上超过更大规模的先进模型。搭载o3-mini-high时,Xolver在GSM8K、AIME 2024/2025、Math-500和LiveCodeBench-V5上取得了领先结果。
- 为构建可持续积累经验、避免每次从零推理的智能体系统提供参考。
- 展示多智能体协作、经验检索与迭代评估可以在无需训练的情况下增强黑盒模型。
- 可用于数学竞赛、代码生成及其他需要复杂推理和策略复用的任务。
- 说明高质量记忆与经验编排可能比单纯扩大模型参数更具性价比。
📝 原始笔记(逐字保留)
SageAttention3:FP4 量化加速注意力并探索 8 比特训练
清华团队提出 SageAttention3,通过微缩放 FP4 注意力实现最高约 5 倍推理加速,并首次探索对 8 比特训练的支持。
SageAttention3 将微缩放 FP4 量化用于注意力计算,以降低推理阶段的计算与存储开销。该方法可实现最高约 5 倍的注意力加速,体现了低比特计算在大模型系统优化中的潜力。论文还探索了 8 比特训练支持,将 SageAttention 的应用范围从推理进一步扩展至训练。相关实现已在 GitHub 开源。
- 为大模型注意力模块提供低比特、高吞吐的推理优化方案
- 展示 FP4 微缩放量化在降低算力与显存成本方面的潜力
- 为 8 比特训练及训练—推理一体化低精度计算提供参考
📝 原始笔记(逐字保留)
LiveCodeBench Pro:奥赛级竞技编程基准揭示顶尖 LLM 的推理短板
LiveCodeBench Pro 以持续更新的 584 道顶级竞赛题评估大模型,发现模型擅长模板化知识与逻辑问题,却在观察推导、边界处理和交互式任务上显著落后。
纽约大学、普林斯顿大学等 8 家机构提出 LiveCodeBench Pro,用于检验大语言模型是否具备接近奥赛选手的真实竞技编程能力。基准收录截至 2025 年 4 月 25 日的 584 道 Codeforces、ICPC 和 IOI 等赛事题目,并通过持续更新降低数据污染风险。评测显示,模型在数据结构、图论、组合数学和动态规划等可复用模板或思维模式的问题上表现较好,但在博弈、贪心、构造和 ad-hoc 等依赖新颖观察的问题上评分明显下降。模型还普遍难以完成分类讨论、识别边界情况和解决交互式问题,表明高分并不等同于稳定、全面的算法推理能力。
- 用于更严格地区分模型的代码模板记忆、工具使用与真实算法推理能力。
- 为竞技编程模型评测提供持续更新、较低污染风险的高难度题库。
- 提示训练与研究应加强新颖观察、分类讨论、边界条件处理及交互式推理能力。
- 可用于分析不同模型在知识密集型、逻辑密集型和观察密集型任务上的能力差异。
📝 原始笔记(逐字保留)
使用多语言数字谜题研究语言模型中语言与数学推理的相互作用
研究通过多语言数字谜题发现,大语言模型难以从语言表达中隐式推断数字的组合结构,通常需要显式数学符号才能稳定求解。
论文利用多语言数字谜题,考察语言模型如何协调语言理解与数学推理。实验显示,模型无法稳定解决依赖跨语言数字系统的问题,除非使用 +、× 等已知符号明确标注数学运算。进一步的消融实验分析了数字结构及组合参数对模型表现的影响。与能够根据语言知识推断隐含数字组成规则的人类相比,当前模型仍缺乏稳健的隐式组合结构理解能力。
- 可用于评估模型能否将语言形式映射为抽象数学结构,而非仅依赖熟悉的运算符模式。
- 提示训练和数据设计应加强跨语言数字表达、组合规则归纳及符号接地能力。
- 为区分语言理解失败与数学计算失败提供了可控的实验框架。
📝 原始笔记(逐字保留)
S⁴C:利用语法与语义一致性加速大模型推理
S⁴C通过多头起草与连续验证树增强推测采样,在保持语法和语义一致性的同时实现2.26至2.60倍的大模型推理加速。
大型语言模型的自回归生成机制带来较高推理延迟,而现有推测采样方法往往未充分利用生成文本的内在一致性。S⁴C框架同时建模语法与语义一致性,通过多头起草机制快速生成候选令牌。它使用连续验证树进行并行候选验证和计算功能复用,从而以更少资源接受更多有效令牌。在 Spec-Bench 上,该方法取得2.26至2.60倍加速,并优于当时的主流基线。
- 为大模型实时应用提供低延迟推理方案。
- 表明语法和语义一致性可用于提高推测解码的候选接受率。
- 连续验证树与功能复用机制可为后续并行解码和推理系统优化提供参考。