2025-06-13 科研追新

当日精选(由提交工具自动创建)。

科学家的第一次考试:通过感知、理解与推理评测多模态大模型的科学认知能力

论文提出SFE科学多模态评测基准,从信号感知、属性理解和比较推理三个层次揭示当前顶尖MLLM在科学认知方面的明显不足。

 元学习 多模态 模型评估 推理 逻辑推理

科学家的第一次考试(SFE)是一个面向科学多模态大模型的认知能力评测基准,重点弥补现有基准偏重知识理解、忽视感知与推理的问题。它从科学信号感知、科学属性理解和科学比较推理三个相互关联的层次开展评估。SFE覆盖五个高价值学科、66项多模态任务,包含830个经专家验证的视觉问答对。实验中,GPT-o3和InternVL-3的准确率分别仅为34.08%和26.52%,表明现有模型距离可靠支持科学发现仍有较大差距。

用途与启示
  • 用于系统评估多模态大模型在真实科学数据上的感知、理解与推理能力
  • 为科学领域MLLM的训练、能力诊断和模型选型提供更细粒度的评价依据
  • 提示研究者不能仅以知识问答成绩衡量科学智能,还需重点提升信号识别与跨样本比较推理能力
📝 原始笔记(逐字保留)
2. 2025-06-13 18:43:14 Friday| Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning **标题** : 科学家的第一次考试:通过感知,理解和推理探索MLLM的认知能力 **链接** :https://arxiv.org/abs/2506.10521 **作者** : Yuhao Zhou, Yiheng Wang, Xuming He, Ruoyao Xiao, Zhiwei Li, Qiantai Feng, Zijie Guo, Yuejin Yang, Hao Wu, Wenxuan Huang, Jiaqi Wei, Dan Si, Xiuqi Yao, Jia Bu, Haiwen Huang, Tianfan Fu, Shixiang Tang, Ben Fei, Dongzhan Zhou, Fenghua Ling, Yan Lu, Siqi Sun, Chenhui Li, Guanjie Zheng, Jiancheng Lv, Wenlong Zhang, Lei Bai **备注** :82 pages **摘要** :科学发现越来越依赖于基于信息密集型科学数据和特定领域专业知识的复杂多模态推理。在专家级科学基准的支持下,科学多模态大型语言模型(MLLM)有可能在现实的工作流程中显着增强这一发现过程。然而,目前的科学基准大多侧重于评估的知识理解能力的MLLM,导致其感知和推理能力的评估不足。为了解决这一差距,我们提出了科学家的第一次考试(SFE)基准,旨在通过三个相互关联的水平来评估MLLM的科学认知能力:科学信号感知,科学属性理解,科学比较推理。具体而言,SFE包括三种问题类型的830个专家验证的VQA对,跨越五个高价值学科的66个多模态任务。大量的实验表明,目前最先进的GPT-o3和InternVL-3在SFE上仅达到34.08%和26.52%,这突出了MLLM在科学领域的改进空间。我们希望在SFE中获得的见解将促进人工智能增强的科学发现的进一步发展。

使用元学习检测维基百科傀儡账号

研究利用元学习快速适应不同维基百科傀儡账号群体的写作风格,在文本样本有限时显著提升检测精度。

 元学习 模型训练 数据工程 人工智能应用

维基百科中的恶意傀儡账号会操纵内容并助长虚假信息传播,而以往依赖风格和元数据特征的方法难以适应特定账号群体。作者通过跨多个任务进行元训练,使模型能够用少量文本快速学习新傀儡群体的写作行为。实验结果显示,该方法的预测精度显著优于常规预训练模型,尤其适用于数据稀缺场景。论文已被 ACL 2025 接收,并发布了新的傀儡账号调查数据集以支持后续研究。

用途与启示
  • 展示元学习在少样本作者识别和异常账号检测中的应用价值
  • 为开放编辑平台建立可快速适应新型协同行为的检测系统
  • 新数据集可推动傀儡账号识别、写作风格分析与元学习研究
📝 原始笔记(逐字保留)
2025-06-13 18:45:13 Friday| Detecting Sockpuppetry on Wikipedia Using Meta-Learning **标题** : 使用元学习在维基百科上检测袜子 **链接** :https://arxiv.org/abs/2506.10314 **作者** : Luc Raszewski, Christine De Kock **备注** :Accepted to ACL 2025 **摘要** :维基百科上的恶意sockpuppet检测对于保护互联网上可靠信息的访问和防止虚假信息的传播至关重要。以前的机器学习方法依赖于风格和元数据特征,但没有优先考虑对作者特定行为的适应性。因此,他们很难有效地建模特定sockpuppet-group的行为,特别是当文本数据有限时。为了解决这个问题,我们提出了元学习的应用,这是一种机器学习技术,旨在 **通过跨多个任务训练模型来提高数据稀缺环境中的性能** 。元学习优化了快速适应新sockpuppet-group写作风格的模型。我们的研究结果表明,与预先训练的模型相比, **元学习显著提高了预测的精度** ,标志着在开放编辑平台上打击sockpuppetry的进步。我们发布了一个新的sockpuppet调查数据集,以促进sockpuppetry和元学习领域的未来研究。 #### 🌈 75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据 2025-06-19 20:29:54 Thursday | https://mp.weixin.qq.com/s/lMsivtY3aBiDq3eknSVZug Google DeepMind团队开发的DataRater可以全自动评估数据质量,通过元学习自动筛选有价值的数据,提升模型训练效率。DataRater使用元梯度优化,能有效减少训练计算量,提高模型性能,尤其在低质量数据集上效果显著,且能跨不同模型规模进行泛化。 最近,Google DeepMind的研究人员发布了一个数据质量评估框架DataRater,可用于估计任意数据对最终训练效果的价值,即数据质量。 论文链接:https://arxiv.org/pdf/2505.17895 DataRater的核心思路是使用「元学习」来自动学习筛选或混合数据流的标准,以一种数据驱动的方式,让数据展现出本身的价值。 #### 多一步:超越单次反向传播的元学习模型编辑 [#49](https://arxiv.org/abs/2508.04012)[Step More: Going Beyond Single Backpropagation in Meta Learning Based Model Editing](https://papers.cool/arxiv/2508.04012)

何恺明改进 REPA:大幅简化方法并保持强劲性能

何恺明团队对谢赛宁提出的 REPA 表征对齐方法进行了显著简化,同时在生成性能上保持了较强竞争力。

 多模态 模型开发 模型训练 系统优化

该工作针对 REPA 方法进行改进,重点减少原有方案的复杂设计与训练负担。简化后的方法依然保持强劲性能,说明表征对齐可能无需过于复杂的机制即可有效辅助生成模型训练。其结果为扩散模型或视觉生成模型的高效训练提供了更简洁的技术路径。

用途与启示
  • 为表征对齐方法提供更易实现、易复现的简化方案
  • 降低视觉生成模型的训练复杂度与工程成本
  • 启示研究者重新评估复杂模块对最终性能的真实贡献
📝 原始笔记(逐字保留)
6. 2025-06-13 18:17:54 Friday | 何恺明改进了谢赛宁的REPA:极大简化但性能依旧强悍https://mp.weixin.qq.com/s/t-fjuuLsCO0kywKrflve9w

SurveyForge:自动生成高质量学术综述的创新框架

上海人工智能实验室联合复旦大学、上海交通大学等机构提出SurveyForge,可自动生成高质量学术综述论文,相关研究已被ACL 2025主会议接收。

 智能体工具 人工智能框架 智能体 人工智能应用

上海人工智能实验室联合复旦大学、上海交通大学等多家单位提出了自动化学术综述生成框架SurveyForge。该框架面向高质量综述论文的自动生成,旨在降低文献搜集、组织与写作成本。相关研究已被ACL 2025主会议接收,体现了大模型在科研辅助与知识整合场景中的应用潜力。

用途与启示
  • 自动完成学术文献梳理与综述写作,提升科研调研效率
  • 为大模型驱动的科研助手和知识整合工具提供框架参考
  • 探索自动生成综述在覆盖度、结构性与内容质量方面的评估方法
📝 原始笔记(逐字保留)
2025-06-13 18:18:18 Friday | 上海人工智能实验室联合复旦大学、上海交通大学等多家单位,提出了SurveyForge——一个自动化生成高质量学术综述论文的创新框架,该研究已被ACL 2025主会议接收。https://mp.weixin.qq.com/s/GJtPAf0hI9rfksJy7AduLQ

PAG:以策略作为生成式验证器的多轮强化学习自我纠错

PAG通过让同一大模型在多轮强化学习中交替承担生成策略与验证器角色,实现先验证、后选择性修订的自我纠错。

 强化学习 推理 模型训练 自进化

PAG提出一种统一的多轮强化学习框架,使大语言模型交替扮演答案生成策略和生成式验证器。模型先检查自身输出,仅在检测到错误时才进行修订,避免无论答案对错都重复生成。该机制无需额外的独立验证器或复杂的多阶段自校正训练流程,并有助于缓解模型崩溃。多项推理基准实验显示,PAG同时提升了直接生成、自我纠错和自验证能力,其验证效果优于自一致性方法。

用途与启示
  • 为大模型提供无需独立验证器的可扩展自我纠错方案
  • 将推理与验证能力纳入同一强化学习流程进行联合训练
  • 通过选择性修订减少不必要的答案改写及性能退化
  • 可用于提升数学、逻辑等复杂推理任务的可靠性
📝 原始笔记(逐字保留)
10. 2025-06-13 18:30:02 Friday | PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier **标题** : PAC:以政策作为生成验证者的多轮强化LLM自我纠正 **链接** :https://arxiv.org/abs/2506.10406 **作者** : Yuhua Jiang, Yuwen Xiong, Yufeng Yuan, Chao Xin, Wenyuan Xu, Yu Yue, Qianchuan Zhao, Lin Yan **摘要** :大型语言模型(LLM)在复杂的推理任务中表现出了令人印象深刻的能力,但它们仍然难以可靠地验证自己输出的正确性。针对这一验证挑战的现有解决方案通常依赖于单独的验证器模型或需要多级自校正训练管道,这限制了可扩展性。在本文中,我们提出了作为生成验证器(PAG)的策略,这是一个简单而有效的框架,可以通过在统一的多轮强化学习(RL)范式中交替策略和验证器角色,使LLM能够自我纠正。不同于以往的方法,总是产生第二次尝试,无论模型的信心,PAG引入了一个选择性的修订机制:模型修改其答案,只有当自己的生成验证步骤检测到错误。这种先验证再修改的工作流程不仅可以缓解模型崩溃,还可以共同增强推理和验证能力。在不同的推理基准上进行的大量实验突出了PAG的双重进步:作为一种策略,它提高了直接生成和自校正的准确性;作为一种验证器,它的自验证优于自一致性。

可证明地从语言反馈中学习:HELiX 算法与理论框架

论文形式化“从语言反馈中学习”(LLF)问题,并提出具有可证明无遗憾保证的 HELiX 算法,表明丰富语言反馈可显著提升交互式学习效率。

 强化学习 智能体 模型训练 人工智能

论文针对智能体通过环境观察和自然语言反馈进行交互式学习的场景,建立了“从语言反馈中学习”(LLF)的原则性框架。作者提出“迁移逃逸维度”(transfer eluder dimension),用于刻画语言反馈所含信息如何改变学习问题的复杂度。基于该度量,论文设计了无遗憾算法 HELiX,其性能保证随问题的迁移逃逸维度变化。实验显示,即使反复调用的 LLM 反馈并不完全可靠,HELiX 仍能取得良好表现,并在部分场景中比仅从奖励信号学习更快。

用途与启示
  • 为利用自然语言反馈训练智能体提供可分析、可证明的理论基础。
  • 说明语言反馈能够携带比标量奖励更丰富的信息,从而降低交互学习的样本复杂度。
  • HELiX 可为人类反馈学习、LLM 智能体在线优化及稀疏奖励任务提供算法设计参考。
  • 迁移逃逸维度可用于评估不同反馈形式对强化学习难度和收敛速度的影响。
📝 原始笔记(逐字保留)
10. 2025-06-13 18:49:19 Friday | Provably Learning from Language Feedback **标题** : 可证明从语言反馈中学习 **链接** :https://arxiv.org/abs/2506.10341 **作者** : Wanqiao Xu, Allen Nie, Ruijie Zheng, Aditya Modi, Adith Swaminathan, Ching-An Cheng **摘要** :通过观察和语言反馈进行交互式学习是一个越来越多的研究领域,这是由大型语言模型(LLM)代理的出现所驱动的。虽然令人印象深刻的经验证明已经显示,到目前为止,这些决策问题的原则框架仍然缺乏。在本文中,我们形式化的学习语言反馈(LLF)问题,断言足够的假设,使学习尽管潜在的奖励,并引入$\textit{transfer eluder dimension}$作为一个复杂的措施来表征LLF问题的难度。我们发现,转移逃避维度捕捉的直觉,在反馈中的信息改变学习的LLF问题的复杂性。我们展示了从丰富的语言反馈中学习比从奖励中学习快得多的案例。我们开发了一个无遗憾的算法,称为$\texttt{HELiX}$,可证明解决LLF问题,通过顺序的相互作用,与性能保证,规模与转移逃避维度的问题。在几个经验领域,我们表明,$\texttt{HELiX}$表现良好,即使反复提示LLM不可靠的工作。我们的贡献标志着根据通用语言反馈设计有原则的交互式学习算法的第一步。

推理模型如何识别无益想法并从中恢复?

研究发现,推理模型虽然通常能识别无益想法,但在思维链被注入这些想法后难以摆脱其影响,暴露出自我重评与元认知能力的不足。

 推理 元学习 模型评估 人工智能 逻辑推理

论文考察推理模型识别并摆脱四类无益想法的能力,包括无信息的漫谈、与问题无关的内容、将原问题误导为相近问题的思路,以及会导向错误答案的想法。实验显示,模型通常能够判断这些想法没有帮助,但当它们被注入推理过程后,模型往往会继续沿着错误或无关路径推演,导致性能显著下降。研究还观察到反向规模趋势:较大的模型有时比较小的模型更难从短期无关想法中恢复,即使已被明确要求重新评估推理。越狱实验进一步表明,无关想法可能诱导有害响应,而最小模型反而最不容易受到干扰。

用途与启示
  • 将“识别错误”与“从错误中恢复”作为两项独立能力进行评估,避免仅凭反思措辞判断模型具有元认知。
  • 可利用无益想法注入构建推理鲁棒性和安全性测试,衡量模型纠偏、回溯及路线切换能力。
  • 模型规模增大不一定改善自我重评能力,训练与推理系统需专门强化对无关思路的中止和恢复机制。
📝 原始笔记(逐字保留)
10. 2025-06-13 18:33:11 Friday | How Well Can Reasoning Models Identify and Recover from Unhelpful Thoughts? **标题** : 推理模型如何识别无益的想法并从中恢复? **链接** :https://arxiv.org/abs/2506.10979 **作者** : Sohee Yang, Sang-Woo Lee, Nora Kassner, Daniela Gottesman, Sebastian Riedel, Mor Geva **摘要** :最近的推理模型显示了反思、回溯和自我验证推理的能力,这对于发现错误和获得准确的解决方案至关重要。一个自然出现的问题是,模型如何有效地进行这种自我重新评估。我们通过研究推理模型如何识别和恢复四种类型的无用想法来解决这个问题:无信息的漫无边际的想法,与问题无关的想法,将问题误导为稍微不同的问题的想法,以及导致错误答案的想法。我们表明,模型在识别大多数无益的想法方面是有效的,但当这些想法被注入到他们的思维过程中时,他们很难从相同的想法中恢复过来,从而导致显着的性能下降。模型倾向于天真地延续注入的无关思想的推理路线,这表明他们的自我再评价能力远远没有达到一般的 **“元认知”** 意识。此外,我们观察到非/逆尺度趋势,其中较大的模型比较小的模型更难从短期不相关的想法中恢复,即使被指示重新评估其推理。我们通过一个使用无关思想注入的越狱实验证明了这些发现的意义,表明最小的模型最不容易被有害反应触发的思想所分心。总的来说,我们的研究结果要求改进推理模型的自我重新评估,以开发更好的推理和更安全的系统。

PREMISE:面向大模型高效数学推理的可扩展战略提示优化

PREMISE通过黑盒提示优化,在保持数学推理准确率的同时将推理令牌减少87.5%、成本降低69%至82%。

 推理 逻辑推理 系统优化 人工智能框架

大型推理模型依赖冗长的思维链获得较强的数学能力,但也带来了较高的令牌成本与响应延迟。PREMISE是一种仅优化提示、不修改模型权重的框架,将推理轨迹诊断与梯度启发式提示优化结合,通过多目标文本搜索兼顾答案正确性与表达简洁性。该方法可通过单通道黑盒接口直接用于Claude、Gemini等商业模型。在GSM8K、SVAMP和MATH-500上的实验显示,其能够匹配或超过基准准确率,同时减少87.5%的推理令牌并降低69%至82%的成本。

用途与启示
  • 为API受限或延迟敏感场景提供无需微调的大模型推理压缩方案
  • 说明提示级搜索可以在保持数学准确率的同时显著削减冗余思维链
  • 可作为商业闭源模型推理成本、延迟与正确率联合优化的实践框架
📝 原始笔记(逐字保留)
3. 2025-06-13 18:34:34 Friday | PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models **标题** : PREMISE:可扩展且战略性的即时优化,以实现大型模型中的高效数学推理 **链接** :https://arxiv.org/abs/2506.10716 **作者** : Ye Yu, Yaoning Yu, Haohan Wang **摘要** :大型推理模型(LRM),如Claude 3.7 Sonnet和OpenAI o 1,使用冗长的思想链(CoT)推理在数学基准测试中实现了强大的性能,但产生的跟踪通常是不必要的冗长。这增加了令牌的使用和成本,限制了延迟敏感或API受限设置中的部署。我们介绍了PREMISE(PRompt为基础的有效的数学推理与战略评估),一个只允许的框架,减少推理开销,而不修改模型的权重。PREMISE将跟踪级诊断与梯度启发的即时优化相结合,以最大限度地减少冗余计算,同时保持答案的准确性。该方法通过平衡令牌长度和答案有效性的多目标文本搜索来联合优化简洁性和正确性。与以前的工作不同,PREMISE运行在一个单通道黑盒接口中,因此它可以直接应用于商业LLM。在GSM 8 K、SVAMP和Math 500上,我们匹配或超过了基准精度(Claude为96\%\rightarrow96\%$,Gemini为91\%\rightarrow92\%$),同时将推理令牌减少了87.5\%$,并将成本降低了69 - 82\%$。这些结果表明,在不影响推理质量的情况下,并行级优化是一种实用且可扩展的高效LRM推理路径。

简单问题快速答,困难问题深入想:基于幂次长度惩罚的高效推理

论文提出幂次长度惩罚机制,使大语言模型在简单问题上缩短回答、在困难问题上保留充分推理,从而兼顾效率与准确率。

 推理 强化学习 系统优化 模型训练

现有推理模型常生成冗长的思维链,增加计算成本与响应延迟,而统一的长度惩罚又难以适配不同难度的问题。论文通过划分奖励函数并引入新的幂次输出长度惩罚,鼓励模型针对简单问题简洁作答,同时允许困难问题使用更充分的推理过程。该方法在 GSM8K、MATH500 和 AIME2024 上进行了评估。在 GSM8K 与 MATH500 上,模型缩短了输出并保持或提升准确率;在更困难的 AIME2024 上则进一步提高了准确率。

用途与启示
  • 为推理模型提供一种按问题难度自适应分配计算量的训练思路。
  • 降低简单任务中的冗余推理与推理延迟,同时避免过度压缩复杂问题的解题过程。
  • 可用于优化强化学习奖励设计,在准确率、输出长度和部署成本之间取得更好平衡。
📝 原始笔记(逐字保留)
4. 2025-06-13 18:44:01 Friday| Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty **标题** : 快速在简单上,深入在困难上:通过强力长度惩罚进行高效推理 **链接** :https://arxiv.org/abs/2506.10446 **作者** : Zehui Ling, Deshu Chen, Hongwei Zhang, Yifeng Jiao, Xin Guo, Yuan Cheng **摘要** :大型语言模型(LLM)在推理能力方面已经取得了显著的进步,在各种具有挑战性的基准测试中表现良好。像思想链提示这样的技术已经被引入,以进一步提高推理能力。然而,这些方法经常生成较长的输出,这反过来又增加了计算延迟。虽然一些方法使用强化学习来缩短推理,但它们通常应用统一的惩罚,而不考虑问题的复杂性,导致次优结果。在这项研究中,我们试图 **提高LLM推理的效率** ,促进简洁性为简单的问题,同时保留足够的推理更复杂的准确性,从而提高模型的整体性能。具体来说,我们通过划分奖励函数并包括一个新的输出长度惩罚来管理模型的推理效率。我们的方法在三个数据集的基准评估中取得了令人印象深刻的结果:GSM8K,MATH500和AIME2024。对于相对简单的数据集GSM8K和MATH500,我们的方法有效地缩短了输出长度,同时保持或提高了准确性。在要求更高的AIME2024数据集上,我们的方法提高了准确性。

TaskCraft:自动生成代理式任务与执行轨迹

TaskCraft通过深度与广度扩展自动合成约3.6万个多工具、可验证且带执行轨迹的复杂代理任务,用于智能体训练与评估。

 数据合成 智能体 智能体工具 模型训练 模型评估

TaskCraft 是一个自动生成复杂代理任务及其执行轨迹的工作流,旨在减少智能体基准对昂贵人工标注的依赖。它从原子任务出发,通过基于深度和广度的扩展构造具有结构与层次复杂性的多步、多工具任务,并确保结果可验证。实验显示,这批合成任务能够改善提示优化中的生成工作流,并增强经监督微调的智能体基础模型。作者还构建了约 3.6 万个不同难度的合成任务,为后续智能体训练和评估提供数据支持。

用途与启示
  • 低成本、规模化生成包含工具交互和执行轨迹的智能体训练数据
  • 通过可验证任务降低数据噪声,提高训练与评估的可靠性
  • 利用深度和广度扩展控制任务复杂度,构建分层难度体系
  • 为智能体的监督微调、提示优化和能力评测提供统一数据基础
📝 原始笔记(逐字保留)
9. 2025-06-13 18:32:04 Friday| TaskCraft: Automated Generation of Agentic Tasks **标题** : TaskCraft:自动生成抽象任务 **链接** :https://arxiv.org/abs/2506.10055 **作者** : Dingfeng Shi, Jingyi Cao, Qianben Chen, Weichen Sun, Weizhen Li, Hongxuan Lu, Fangchen Dong, Tianrui Qin, King Zhu, Minghao Yang, Jian Yang, Ge Zhang, Jiaheng Liu, Changwang Zhang, Jun Wang, Yuchen Eleanor Jiang, Wangchunshu Zhou **摘要** :人工智能任务需要通过自主、工具使用和自适应推理来解决多步问题,这对NLP和AI的发展越来越重要。然而,现有的指令数据缺乏工具交互,目前的代理基准依赖于昂贵的人工注释,限制了它们的可扩展性。我们介绍\textsc{TaskCraft},一个自动化的工作流程,用于生成具有执行轨迹的困难可扩展,多工具和可验证的代理任务。TaskCraft使用基于深度和基于宽度的扩展来扩展原子任务,以创建结构和层次结构复杂的挑战。实证结果表明,这些任务提高了即时优化的生成工作流程,并加强监督微调的代理基础模型。我们提出了一个大规模的合成数据集,约36,000个不同难度的任务,以支持未来的研究代理调整和评估。

AutoMind:用于自动化数据科学的自适应知识智能体

AutoMind通过专家知识库、知识引导的树搜索和自适应编码策略,提升了LLM智能体自动完成复杂数据科学任务的能力。

 智能体 人工智能框架 人工智能应用 任务规划 人工智能辅助编程

AutoMind是一个面向自动化数据科学的自适应LLM智能体框架,旨在突破固定工作流和僵化编码策略的限制。框架引入经过策划的专家知识库,使智能体能够利用领域经验处理复杂和创新性任务。它结合知识引导的树搜索来探索候选方案,并通过自适应编码策略动态调整代码生成任务的复杂度。在两个自动化数据科学基准上的实验中,AutoMind优于现有先进基线,并在效率与方案质量方面表现良好。

用途与启示
  • 为端到端自动化机器学习与数据科学流程提供更灵活的智能体架构
  • 展示专家知识与树搜索结合对复杂任务规划和方案探索的价值
  • 自适应调整代码生成粒度,可用于提升数据科学智能体的执行效率与鲁棒性
  • 为构建具备领域知识、规划能力和代码执行能力的专业智能体提供参考
📝 原始笔记(逐字保留)
2. 2025-06-13 18:47:09 Friday | AutoMind: Adaptive Knowledgeable Agent for Automated Data Science **标题** : AutoMind:用于自动化数据科学的自适应知识代理 **链接** :https://arxiv.org/abs/2506.10974 **作者** : Yixin Ou, Yujie Luo, Jingsheng Zheng, Lanning Wei, Shuofei Qiao, Jintian Zhang, Da Zheng, Huajun Chen, Ningyu Zhang **备注** :Ongoing work. Code is at this https URL **摘要** :大型语言模型(LLM)代理在解决现实世界的数据科学问题方面表现出巨大的潜力。LLM驱动的数据科学代理承诺自动化整个机器学习管道,但其现实世界的有效性仍然有限。现有的框架依赖于严格的、预定义的工作流程和不灵活的编码策略;因此,它们只擅长于相对简单的经典问题,而无法捕捉人类从业者为复杂的创新任务带来的经验专业知识。在这项工作中,我们介绍了AutoMind,一个自适应的,知识渊博的LLM-agent框架,通过三个关键的进步克服了这些缺陷:(1)一个精心策划的专家知识库,使代理基于领域专家知识,(2)一个代理知识渊博的树搜索算法,战略性地探索可能的解决方案,以及(3)一个自适应的编码策略,动态地定制代码生成任务的复杂性。对两个自动化数据科学基准的评估表明,AutoMind提供了优于最先进基准的性能。其他分析证实了良好的有效性,效率和定性解决方案质量,突出了AutoMind作为迈向全自动数据科学的有效和强大的一步。 ## 编程 **Karpathy最新脑洞「细菌编程」:优秀的代码应该具备细菌的三大特质**[https://mp.weixin.qq.com/s/a2HnRa2cqsustIUxxBwzzQ](https://mp.weixin.qq.com/s/a2HnRa2cqsustIUxxBwzzQ)

MetaAgent:无需参数更新的自我进化智能体范式

MetaAgent 从最小化工作流出发,借助反思验证、动态上下文工程与内部工具构建,使智能体在不更新模型参数的情况下持续改进复杂任务的推理和工具使用能力。

 自进化 智能体 智能体工具 推理 任务规划

MetaAgent 面向需要多步推理、信息整合和动态工具调用的复杂任务,提出一种可持续自我进化的智能体范式。不同于依赖专家预设流程的工作流系统或需要大量任务数据的端到端训练方法,它从最小化工作流开始,通过任务执行过程中积累的数据自然演化。其核心机制包括自我反思、反思验证、动态上下文工程以及内部工具构建,可逐步优化推理与工具使用策略。整个过程无需修改底层模型参数,也不依赖大规模后续训练,强调智能体基于经验的持续适应能力。

用途与启示
  • 为复杂查询中的多步规划和动态工具编排提供更灵活的实现思路
  • 探索无需参数更新即可持续改进智能体性能的自我进化路径
  • 降低人工设计固定工作流及收集任务专用训练数据的成本
  • 可用于搜索、代码执行、计算与多源信息整合等复合型任务
📝 原始笔记(逐字保留)
2. 这篇论文提出了一个名为 MetaAgent 的新型代理(agent)范式,旨在解决大型语言模型(LLMs)在处理复杂任务时面临的挑战,特别是在需要多步推理和动态工具使用的情境下。具体来说,它试图解决以下几个关键问题: 1. 复杂任务的动态工具使用: 当前的 LLMs 在处理需要跨多步推理和整合多个信息源的任务时表现不佳,尤其是在需要与外部工具(如搜索引擎、代码执行器等)交互时。例如,对于需要先搜索信息、再进行计算和比较的复杂查询,标准的 LLMs 往往无法有效地管理这种顺序推理和工具使用。 2. 缺乏灵活性和适应性: 现有的代理系统主要分为两类:基于工作流的方法和端到端训练的方法。基于工作流的方法依赖于人类专家预定义的任务规划和工具使用策略,缺乏灵活性;而端到端训练的方法则需要大量的任务特定数据,并且在训练后对其他任务的泛化能力有限。 3. 持续自我改进的能力: 人类通过不断积累经验从新手成长为专家,但现有的代理系统缺乏这种自我进化的能力。一旦模型被训练或设计完成,其性能很难在没有额外训练的情况下得到提升。 4. 为了解决这些问题,MetaAgent 采用了一种从最小化工作流程开始,并通过数据驱动的任务完成自然进化的范式。它通过自我反思、验证反思、动态上下文工程和内部工具构建等机制,逐步提升其推理和工具使用策略,而无需改变模型参数或依赖大规模的后续训练。 #### 11. AI界重磅突破!LLM终于学会”自我进化”了 【AI界重磅突破!LLM终于学会”自我进化”了 - 宇宙幻想Oscar | 小红书 - 你的生活兴趣社区】 😆 wGVuZrvWH7PEygf 😆 https://www.xiaohongshu.com/discovery/item/684bd83f000000000f03ab1e?source=webshare&xhsshare=pc_web&xsec_token=CBUG1vzUlF1rW0Z8oNl-MMg_V0nvFE_VO9qqDogj4vhhc=&xsec_source=pc_share

Magistral:Mistral 首个推理模型与可扩展强化学习管线

Mistral 发布首个推理模型 Magistral,并展示一套基于自有模型与基础设施构建的可扩展纯强化学习训练管线。

 模型训练 强化学习 推理 模型开发 多模态

Magistral 是 Mistral 推出的首个推理模型,同时配套了一套完全基于自有模型与基础设施的可扩展强化学习管线。研究探索了大语言模型纯强化学习训练的边界,并提出一种约束模型推理语言的简单方法。实验表明,仅使用文本数据进行强化学习,仍能保留初始检查点的大部分能力,并维持或提升多模态理解、指令遵循和函数调用表现。Magistral Medium 基于 Mistral Medium 3 通过强化学习完成推理训练,Magistral Small 则以 Apache 2.0 协议开源,并引入来自 Medium 的冷启动数据。

用途与启示
  • 为从零搭建可扩展的大模型强化学习训练栈提供参考。
  • 说明文本强化学习未必会损害多模态、指令遵循和工具调用等基础能力。
  • 展示“冷启动数据 + 纯强化学习”训练开源推理模型的可行路径。
  • 可用于研究推理语言约束、强化学习扩展规律及跨能力保持问题。
📝 原始笔记(逐字保留)
1. 2025-06-13 18:50:11 Friday | Magistral **标题** : Magistral **链接** :https://arxiv.org/abs/2506.10910 **作者** : Mistral-AI: Abhinav Rastogi, Albert Q. Jiang, Andy Lo, Gabrielle Berrada, Guillaume Lample, Jason Rute, Joep Barmentlo, Karmesh Yadav, Kartik Khandelwal, Khyathi Raghavi Chandu, Léonard Blier, Lucile Saulnier, Matthieu Dinot, Maxime Darrin, Neha Gupta, Roman Soletskyi, Sagar Vaze, Teven Le Scao, Yihan Wang, Adam Yang, Alexander H. Liu, Alexandre Sablayrolles, Amélie Héliou, Amélie Martin, Andy Ehrenberg, Anmol Agarwal, Antoine Roux, Arthur Darcet, Arthur Mensch, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clémence Lanfranchi, Darius Dabert, Devon Mizelle, Diego de las Casas, Elliot Chane-Sane, Emilien Fugier, Emma Bou Hanna, Gauthier Delerce, Gauthier Guinet, Georgii Novikov, Guillaume Martin, et al. (53 additional authors not shown) **摘要** :我们介绍了Magistral,Mistral的第一个推理模型和我们自己的可扩展强化学习(RL)管道。我们不依赖于现有的实现和从先前模型中提取的RL跟踪,而是遵循一种自上而下的方法,完全依赖于我们自己的模型和基础设施。值得注意的是,我们展示了一个堆栈,使我们能够探索LLM的纯RL训练的限制,提出了一种简单的方法来强制模型的推理语言,并表明仅对文本数据的RL保持了大部分初始检查点的功能。我们发现,RL的文本保持或提高多模态理解,指令遵循和函数调用。我们提出了Magistral Medium,在Mistral Medium 3的基础上单独使用RL进行推理训练,我们开源了Magistral Small(Apache 2.0),其中进一步包括来自Magistral Medium的冷启动数据。 ## 训练范式 ###### [从少样本到千样本!MachineLearningLM给大模型上下文学习装上「机器学习引擎」](https://mp.weixin.qq.com/s/ad4tvAD7pi-jJ91RiEP4Ng) **这项名为 MachineLearningLM 的新研究突破了这一瓶颈。**该研究提出了一种轻量且可移植的「继续预训练」框架,无需下游微调即可直接通过上下文学习上千条示例,在金融、健康、生物信息、物理等等多个领域的二分类 / 多分类任务中的准确率显著超越基准模型(Qwen-2.5-7B-Instruct)以及最新发布的 GPT-5-mini。

清华刘知远团队:高质量 LLM 训练数据获取

清华大学刘知远团队分享高质量大语言模型训练数据的获取方法与相关思路。

 模型训练 数据工程

该文章聚焦大语言模型训练中的高质量数据获取问题。内容来自清华大学刘知远团队,围绕训练数据这一决定模型能力的重要环节展开。文章可为 LLM 数据收集、筛选与质量建设提供参考。

用途与启示
  • 了解高质量 LLM 训练数据的获取思路
  • 为训练语料的收集、筛选和质量控制提供参考
  • 辅助规划大模型数据工程与训练流程
📝 原始笔记(逐字保留)
3. 2025-06-13 18:18:45 Friday | 清华刘知远团队:高质量 LLM 训练数据获取https://mp.weixin.qq.com/s/1vDxmomJvoML-RF4HEIgIw

Domain2Vec:向量化数据集,无需训练寻找最优数据混合

Domain2Vec 将数据集表示为向量,用低成本方式筛选有利于目标任务的训练数据混合方案。

 模型训练 数据工程 系统优化

Domain2Vec 探索将不同数据集映射为向量表示,以刻画其领域特征及相互关系。基于这些表示,研究者可以在不实际训练候选模型的情况下比较不同数据组合。该方法旨在降低数据配比搜索所需的计算成本,为大模型训练前的数据选择与混合优化提供依据。

用途与启示
  • 在正式训练前快速筛选更合适的数据来源与配比
  • 减少反复训练模型以验证数据混合方案的算力成本
  • 为数据集检索、领域匹配和训练数据治理提供向量化工具
📝 原始笔记(逐字保留)
4. 2025-06-13 18:49:44 Friday |Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training **标题** : Domain 2Vec:对数据集进行数据集进行数据量化,无需训练即可找到最佳数据混合 **链接** :https://arxiv.org/abs/2506.10952

在不损害能力的前提下精简大语言模型

研究通过HellaSwag、GSM8K和MMLU-CS评估LoRA与QLoRA,表明参数高效微调可低成本提升特定任务表现,但效果高度依赖训练数据与目标任务的匹配程度。

 模型训练 系统优化 推理 模型评估

论文研究LoRA和QLoRA等参数高效微调方法对大语言模型能力与计算效率的影响。作者分别使用HellaSwag、GSM8K和MMLU-CS评估常识推理、数学推理及多领域知识能力。实验显示,LoRA类方法能够在控制资源消耗的同时提升特定任务性能。与此同时,微调收益很大程度上取决于微调数据集和下游评测任务之间的对齐程度。

用途与启示
  • 为计算资源有限的开发者提供高效适配大语言模型的实践依据
  • 在选择微调数据时,应优先考虑其与目标任务及评测分布的匹配程度
  • 可通过跨任务基准测试监控参数高效微调是否造成通用能力损失
📝 原始笔记(逐字保留)
4. 2025-06-13 18:28:14 Friday| Slimming Down LLMs Without Losing Their Minds **标题** : 在不失去理智的情况下减肥LLM **链接** :https://arxiv.org/abs/2506.10885 **作者** : Qingda (Michael)Mai **备注** :10 pages **摘要** :本文研究并验证了微调对大型语言模型性能的影响,重点是参数有效的方法(LoRA和QLoRA)。我们在三个关键领域评估模型能力:(1)常识推理(HellaSwag),(2)数学推理(GSM 8 K)和(3)多领域知识(MMLU-CS)。 我们的研究结果表明:(1)基于LoRA的方法有效地提高了特定于任务的性能,同时保持了计算效率,(2)性能在很大程度上取决于微调数据集和基准任务之间的对齐。该研究为开发人员在有限的资源下实现高效的LLM适应提供了理论见解和实践指导。 ### 图像生成

MMMG:面向文本到图像推理的大规模多学科多层级生成基准

MMMG通过跨学科、跨教育层级的知识图像生成任务与知识图谱驱动指标,系统揭示了当前文本到图像模型在实体、关系和视觉清晰度方面的推理缺陷。

 模型评估 多模态 推理 数据工程 模型开发

论文提出知识图像生成任务,并构建包含4456个专家验证提示—图像对的MMMG基准,覆盖10个学科、6个教育层级以及图表、思维导图等多种知识表达形式。该基准使用统一的知识图谱表示目标图像中的核心实体及其依赖关系,以降低复杂图像评估中的歧义。MMMG-Score结合知识图谱编辑距离衡量的事实保真度与视觉清晰度,对生成结果进行综合评价。对16个先进文本到图像模型的测试显示,现有模型普遍存在实体失真、关系表达薄弱和布局混乱等问题;论文还发布了结合推理大模型与扩散模型、使用1.6万组数据训练的开放基线FLUX-Reason。

用途与启示
  • 用于评估文本到图像模型能否将世界知识转化为事实准确、结构清晰的解释性视觉内容。
  • 知识图谱可作为复杂生成任务的中间表示,并为自动化评估提供可比较的结构化目标。
  • 现有强模型在知识图像生成上仍有明显推理短板,实体与关系保真度可作为后续模型优化重点。
  • MMMG可用于研究推理大模型与扩散模型协同生成知识型图像的方法。
📝 原始笔记(逐字保留)
6. 2025-06-13 18:25:44 Friday| MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning **标题** : MMMG:用于文本到图像推理的大规模、多学科、多层生成基准 **链接** :https://arxiv.org/abs/2506.10963 **作者** : Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian **摘要** :本文将知识图像生成作为一项新任务引入,并结合大规模多学科多层知识图像生成基准(MMMG)来探讨图像生成模型的推理能力。知识图像一直是人类文明和人类学习机制的核心-双重编码理论和图片优势效应强调了这一事实。生成这样的图像具有挑战性,需要多模态推理,将世界知识与像素级基础融合到清晰的解释性视觉效果中。为了实现全面的评估,MMMG提供了4,456个专家验证的(知识)图像提示对,涵盖10个学科,6个教育级别和多种知识格式,如图表,图表和思维导图。为了消除评估过程中的混淆复杂性,我们采用了统一的知识图(KG)表示。每个KG明确地描绘了目标图像的核心实体及其依赖关系。我们进一步引入MMMG-Score来评估生成的知识图像。该指标结合了事实保真度,通过KG之间的图形编辑距离测量,与视觉清晰度评估。对16个最先进的文本到图像生成模型的综合评估暴露出严重的推理缺陷-低实体保真度,弱关系和混乱-GPT-4 o的MMMG得分仅为50.20,强调了基准测试的难度。为了推动进一步的进展,我们发布了FLUX-Reason(MMMG得分为34.45),这是一个有效的开放基线,将推理LLM与扩散模型相结合,并在16,000个策划的知识图像提示对上进行训练。 ## 推理

超越黄金标准:用于形式数学推理评估的LLM法官认识论集成

论文提出基于认识论与形式基础集成(EFG)的LLM法官框架,通过四项细粒度标准提升自动形式化评估的可解释性及其与人类判断的一致性。

 模型评估 推理 逻辑推理 人工智能框架

自动形式化将自然语言数学陈述转换为形式语言,但在高级数学场景中,人工评估需要大量时间和专业知识。论文提出认识论与形式基础集成(EFG),利用多个LLM法官,从逻辑保持(LP)、数学一致性(MC)、形式有效性(FV)和形式质量(FQ)四个原子维度进行评估。该方法以细粒度标准替代传统的通用粗粒度评价,使判断过程更加透明。实验显示,EFG集成结果比粗粒度模型更贴近人类评价,尤其能够更准确地衡量形式质量。

用途与启示
  • 为自动形式化和形式数学推理提供可扩展的自动评估方案
  • 将复杂质量标准拆分为原子属性,提高LLM法官的可靠性与可解释性
  • 启示评估系统采用多法官集成和形式化标准,减少单一模型及粗粒度评分带来的偏差
📝 原始笔记(逐字保留)
8. 2025-06-13 18:27:09 Friday| Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning **标题** : 超越黄金标准:LLM形式数学推理法官的认识融合 **链接** :https://arxiv.org/abs/2506.10903 **作者** : Lan Zhang, Marco Valentino, Andre Freitas **摘要** :自动形式化在形式化数学推理中起着至关重要的作用,它可以将自然语言语句自动翻译成形式语言。虽然使用大型语言模型(LLM)的最新进展已经显示出有希望的结果,但自动评估自动形式化的方法仍然没有得到充分的探索。当一个人移动到更复杂的领域(例如,高级数学),人类评估需要大量的时间和领域专业知识,特别是当基础陈述和背景知识的复杂性增加时。法学硕士作为一个法官提出了一个很有前途的方法自动化这样的评价。然而,现有的方法通常采用粗粒度和通用的评估标准,这限制了它们对高级形式数学推理的有效性,其中质量取决于细微的,多粒度的维度。在这项工作中,我们采取了一个步骤,通过引入一个系统的,自动的方法来评估自动化任务,以解决这个差距。所提出的方法是基于认识和正式接地合奏(EFG)的LLM法官,定义的标准,包括**逻辑保存(LP),数学一致性(MC),形式有效性(FV),和形式质量(FQ)**,导致一个透明的评估,占不同的贡献因素。我们验证所提出的框架,作为一个代理的自动形式化评估领域内的形式数学。总的来说,我们的实验表明,LLM法官的EFG合奏是一个合适的新兴代理评估,更强烈地与人类的评估比粗粒度的模型,特别是在评估正式的质量。这些研究结果表明,法学硕士作为法官,特别是在一组定义良好的原子属性的指导下,可以提供一个可扩展的,可解释的,可靠的支持,评估正式的数学推理。

文本、视觉和语音生成自动评估方法综述

该综述统一梳理文本、视觉与语音生成的自动评估方法,并将现有技术归纳为五种基本范式。

 模型评估 多模态 人工智能

生成式 AI 在文本、图像和音频领域快速发展,但如何自动、可靠地评估生成质量仍是持续挑战。论文提出统一分类框架,将三种模态的现有自动评估方法归纳为五种基本范式。作者首先分析技术相对成熟的文本生成评估,再将该框架扩展至视觉和语音生成。综述还讨论了跨模态评估方法的局限及未来研究方向。

用途与启示
  • 为跨文本、视觉和语音的生成质量评估提供统一知识框架
  • 帮助研究者比较不同评估范式的适用范围与局限
  • 为设计通用、可靠的跨模态自动评估指标提供研究线索
📝 原始笔记(逐字保留)
2. 2025-06-13 18:48:05 Friday | A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations **标题** : 文本、视觉和语音生成自动评估方法综述 **链接** :https://arxiv.org/abs/2506.10019 **作者** : Tian Lan, Yang-Hao Zhou, Zi-Ao Ma, Fanshu Sun, Rui-Qing Sun, Junyu Luo, Rong-Cheng Tu, Heyan Huang, Chen Xu, Zhijing Wu, Xian-Ling Mao **摘要** :深度学习的最新进展显着增强了文本、图像和音频的生成AI功能。然而,自动评估这些生成的输出的质量带来了持续的挑战。虽然存在许多自动评估方法,但目前的研究缺乏一个系统的框架,该框架将这些方法全面组织在文本,视觉和音频模式中。为了解决这个问题,我们提出了一个全面的审查和统一的分类自动生成的内容在所有三种模式的评价方法,我们确定了五个基本的范式,现有的评价方法在这些领域的特点。我们的分析首先检查评估方法的文本生成,其中技术是最成熟的。然后,我们将此框架扩展到图像和音频生成,展示了其广泛的适用性。最后,我们讨论了跨模态评估方法的未来研究方向。 ## 代码
0%