2025-06-13 科研追新
当日精选(由提交工具自动创建)。
科学家的第一次考试:通过感知、理解与推理评测多模态大模型的科学认知能力
论文提出SFE科学多模态评测基准,从信号感知、属性理解和比较推理三个层次揭示当前顶尖MLLM在科学认知方面的明显不足。
科学家的第一次考试(SFE)是一个面向科学多模态大模型的认知能力评测基准,重点弥补现有基准偏重知识理解、忽视感知与推理的问题。它从科学信号感知、科学属性理解和科学比较推理三个相互关联的层次开展评估。SFE覆盖五个高价值学科、66项多模态任务,包含830个经专家验证的视觉问答对。实验中,GPT-o3和InternVL-3的准确率分别仅为34.08%和26.52%,表明现有模型距离可靠支持科学发现仍有较大差距。
- 用于系统评估多模态大模型在真实科学数据上的感知、理解与推理能力
- 为科学领域MLLM的训练、能力诊断和模型选型提供更细粒度的评价依据
- 提示研究者不能仅以知识问答成绩衡量科学智能,还需重点提升信号识别与跨样本比较推理能力
📝 原始笔记(逐字保留)
使用元学习检测维基百科傀儡账号
研究利用元学习快速适应不同维基百科傀儡账号群体的写作风格,在文本样本有限时显著提升检测精度。
维基百科中的恶意傀儡账号会操纵内容并助长虚假信息传播,而以往依赖风格和元数据特征的方法难以适应特定账号群体。作者通过跨多个任务进行元训练,使模型能够用少量文本快速学习新傀儡群体的写作行为。实验结果显示,该方法的预测精度显著优于常规预训练模型,尤其适用于数据稀缺场景。论文已被 ACL 2025 接收,并发布了新的傀儡账号调查数据集以支持后续研究。
- 展示元学习在少样本作者识别和异常账号检测中的应用价值
- 为开放编辑平台建立可快速适应新型协同行为的检测系统
- 新数据集可推动傀儡账号识别、写作风格分析与元学习研究
📝 原始笔记(逐字保留)
何恺明改进 REPA:大幅简化方法并保持强劲性能
何恺明团队对谢赛宁提出的 REPA 表征对齐方法进行了显著简化,同时在生成性能上保持了较强竞争力。
该工作针对 REPA 方法进行改进,重点减少原有方案的复杂设计与训练负担。简化后的方法依然保持强劲性能,说明表征对齐可能无需过于复杂的机制即可有效辅助生成模型训练。其结果为扩散模型或视觉生成模型的高效训练提供了更简洁的技术路径。
- 为表征对齐方法提供更易实现、易复现的简化方案
- 降低视觉生成模型的训练复杂度与工程成本
- 启示研究者重新评估复杂模块对最终性能的真实贡献
📝 原始笔记(逐字保留)
SurveyForge:自动生成高质量学术综述的创新框架
上海人工智能实验室联合复旦大学、上海交通大学等机构提出SurveyForge,可自动生成高质量学术综述论文,相关研究已被ACL 2025主会议接收。
上海人工智能实验室联合复旦大学、上海交通大学等多家单位提出了自动化学术综述生成框架SurveyForge。该框架面向高质量综述论文的自动生成,旨在降低文献搜集、组织与写作成本。相关研究已被ACL 2025主会议接收,体现了大模型在科研辅助与知识整合场景中的应用潜力。
- 自动完成学术文献梳理与综述写作,提升科研调研效率
- 为大模型驱动的科研助手和知识整合工具提供框架参考
- 探索自动生成综述在覆盖度、结构性与内容质量方面的评估方法
📝 原始笔记(逐字保留)
PAG:以策略作为生成式验证器的多轮强化学习自我纠错
PAG通过让同一大模型在多轮强化学习中交替承担生成策略与验证器角色,实现先验证、后选择性修订的自我纠错。
PAG提出一种统一的多轮强化学习框架,使大语言模型交替扮演答案生成策略和生成式验证器。模型先检查自身输出,仅在检测到错误时才进行修订,避免无论答案对错都重复生成。该机制无需额外的独立验证器或复杂的多阶段自校正训练流程,并有助于缓解模型崩溃。多项推理基准实验显示,PAG同时提升了直接生成、自我纠错和自验证能力,其验证效果优于自一致性方法。
- 为大模型提供无需独立验证器的可扩展自我纠错方案
- 将推理与验证能力纳入同一强化学习流程进行联合训练
- 通过选择性修订减少不必要的答案改写及性能退化
- 可用于提升数学、逻辑等复杂推理任务的可靠性
📝 原始笔记(逐字保留)
可证明地从语言反馈中学习:HELiX 算法与理论框架
论文形式化“从语言反馈中学习”(LLF)问题,并提出具有可证明无遗憾保证的 HELiX 算法,表明丰富语言反馈可显著提升交互式学习效率。
论文针对智能体通过环境观察和自然语言反馈进行交互式学习的场景,建立了“从语言反馈中学习”(LLF)的原则性框架。作者提出“迁移逃逸维度”(transfer eluder dimension),用于刻画语言反馈所含信息如何改变学习问题的复杂度。基于该度量,论文设计了无遗憾算法 HELiX,其性能保证随问题的迁移逃逸维度变化。实验显示,即使反复调用的 LLM 反馈并不完全可靠,HELiX 仍能取得良好表现,并在部分场景中比仅从奖励信号学习更快。
- 为利用自然语言反馈训练智能体提供可分析、可证明的理论基础。
- 说明语言反馈能够携带比标量奖励更丰富的信息,从而降低交互学习的样本复杂度。
- HELiX 可为人类反馈学习、LLM 智能体在线优化及稀疏奖励任务提供算法设计参考。
- 迁移逃逸维度可用于评估不同反馈形式对强化学习难度和收敛速度的影响。
📝 原始笔记(逐字保留)
推理模型如何识别无益想法并从中恢复?
研究发现,推理模型虽然通常能识别无益想法,但在思维链被注入这些想法后难以摆脱其影响,暴露出自我重评与元认知能力的不足。
论文考察推理模型识别并摆脱四类无益想法的能力,包括无信息的漫谈、与问题无关的内容、将原问题误导为相近问题的思路,以及会导向错误答案的想法。实验显示,模型通常能够判断这些想法没有帮助,但当它们被注入推理过程后,模型往往会继续沿着错误或无关路径推演,导致性能显著下降。研究还观察到反向规模趋势:较大的模型有时比较小的模型更难从短期无关想法中恢复,即使已被明确要求重新评估推理。越狱实验进一步表明,无关想法可能诱导有害响应,而最小模型反而最不容易受到干扰。
- 将“识别错误”与“从错误中恢复”作为两项独立能力进行评估,避免仅凭反思措辞判断模型具有元认知。
- 可利用无益想法注入构建推理鲁棒性和安全性测试,衡量模型纠偏、回溯及路线切换能力。
- 模型规模增大不一定改善自我重评能力,训练与推理系统需专门强化对无关思路的中止和恢复机制。
📝 原始笔记(逐字保留)
PREMISE:面向大模型高效数学推理的可扩展战略提示优化
PREMISE通过黑盒提示优化,在保持数学推理准确率的同时将推理令牌减少87.5%、成本降低69%至82%。
大型推理模型依赖冗长的思维链获得较强的数学能力,但也带来了较高的令牌成本与响应延迟。PREMISE是一种仅优化提示、不修改模型权重的框架,将推理轨迹诊断与梯度启发式提示优化结合,通过多目标文本搜索兼顾答案正确性与表达简洁性。该方法可通过单通道黑盒接口直接用于Claude、Gemini等商业模型。在GSM8K、SVAMP和MATH-500上的实验显示,其能够匹配或超过基准准确率,同时减少87.5%的推理令牌并降低69%至82%的成本。
- 为API受限或延迟敏感场景提供无需微调的大模型推理压缩方案
- 说明提示级搜索可以在保持数学准确率的同时显著削减冗余思维链
- 可作为商业闭源模型推理成本、延迟与正确率联合优化的实践框架
📝 原始笔记(逐字保留)
简单问题快速答,困难问题深入想:基于幂次长度惩罚的高效推理
论文提出幂次长度惩罚机制,使大语言模型在简单问题上缩短回答、在困难问题上保留充分推理,从而兼顾效率与准确率。
现有推理模型常生成冗长的思维链,增加计算成本与响应延迟,而统一的长度惩罚又难以适配不同难度的问题。论文通过划分奖励函数并引入新的幂次输出长度惩罚,鼓励模型针对简单问题简洁作答,同时允许困难问题使用更充分的推理过程。该方法在 GSM8K、MATH500 和 AIME2024 上进行了评估。在 GSM8K 与 MATH500 上,模型缩短了输出并保持或提升准确率;在更困难的 AIME2024 上则进一步提高了准确率。
- 为推理模型提供一种按问题难度自适应分配计算量的训练思路。
- 降低简单任务中的冗余推理与推理延迟,同时避免过度压缩复杂问题的解题过程。
- 可用于优化强化学习奖励设计,在准确率、输出长度和部署成本之间取得更好平衡。
📝 原始笔记(逐字保留)
TaskCraft:自动生成代理式任务与执行轨迹
TaskCraft通过深度与广度扩展自动合成约3.6万个多工具、可验证且带执行轨迹的复杂代理任务,用于智能体训练与评估。
TaskCraft 是一个自动生成复杂代理任务及其执行轨迹的工作流,旨在减少智能体基准对昂贵人工标注的依赖。它从原子任务出发,通过基于深度和广度的扩展构造具有结构与层次复杂性的多步、多工具任务,并确保结果可验证。实验显示,这批合成任务能够改善提示优化中的生成工作流,并增强经监督微调的智能体基础模型。作者还构建了约 3.6 万个不同难度的合成任务,为后续智能体训练和评估提供数据支持。
- 低成本、规模化生成包含工具交互和执行轨迹的智能体训练数据
- 通过可验证任务降低数据噪声,提高训练与评估的可靠性
- 利用深度和广度扩展控制任务复杂度,构建分层难度体系
- 为智能体的监督微调、提示优化和能力评测提供统一数据基础
📝 原始笔记(逐字保留)
AutoMind:用于自动化数据科学的自适应知识智能体
AutoMind通过专家知识库、知识引导的树搜索和自适应编码策略,提升了LLM智能体自动完成复杂数据科学任务的能力。
智能体 人工智能框架 人工智能应用 任务规划 人工智能辅助编程
AutoMind是一个面向自动化数据科学的自适应LLM智能体框架,旨在突破固定工作流和僵化编码策略的限制。框架引入经过策划的专家知识库,使智能体能够利用领域经验处理复杂和创新性任务。它结合知识引导的树搜索来探索候选方案,并通过自适应编码策略动态调整代码生成任务的复杂度。在两个自动化数据科学基准上的实验中,AutoMind优于现有先进基线,并在效率与方案质量方面表现良好。
- 为端到端自动化机器学习与数据科学流程提供更灵活的智能体架构
- 展示专家知识与树搜索结合对复杂任务规划和方案探索的价值
- 自适应调整代码生成粒度,可用于提升数据科学智能体的执行效率与鲁棒性
- 为构建具备领域知识、规划能力和代码执行能力的专业智能体提供参考
📝 原始笔记(逐字保留)
MetaAgent:无需参数更新的自我进化智能体范式
MetaAgent 从最小化工作流出发,借助反思验证、动态上下文工程与内部工具构建,使智能体在不更新模型参数的情况下持续改进复杂任务的推理和工具使用能力。
MetaAgent 面向需要多步推理、信息整合和动态工具调用的复杂任务,提出一种可持续自我进化的智能体范式。不同于依赖专家预设流程的工作流系统或需要大量任务数据的端到端训练方法,它从最小化工作流开始,通过任务执行过程中积累的数据自然演化。其核心机制包括自我反思、反思验证、动态上下文工程以及内部工具构建,可逐步优化推理与工具使用策略。整个过程无需修改底层模型参数,也不依赖大规模后续训练,强调智能体基于经验的持续适应能力。
- 为复杂查询中的多步规划和动态工具编排提供更灵活的实现思路
- 探索无需参数更新即可持续改进智能体性能的自我进化路径
- 降低人工设计固定工作流及收集任务专用训练数据的成本
- 可用于搜索、代码执行、计算与多源信息整合等复合型任务
📝 原始笔记(逐字保留)
Magistral:Mistral 首个推理模型与可扩展强化学习管线
Mistral 发布首个推理模型 Magistral,并展示一套基于自有模型与基础设施构建的可扩展纯强化学习训练管线。
Magistral 是 Mistral 推出的首个推理模型,同时配套了一套完全基于自有模型与基础设施的可扩展强化学习管线。研究探索了大语言模型纯强化学习训练的边界,并提出一种约束模型推理语言的简单方法。实验表明,仅使用文本数据进行强化学习,仍能保留初始检查点的大部分能力,并维持或提升多模态理解、指令遵循和函数调用表现。Magistral Medium 基于 Mistral Medium 3 通过强化学习完成推理训练,Magistral Small 则以 Apache 2.0 协议开源,并引入来自 Medium 的冷启动数据。
- 为从零搭建可扩展的大模型强化学习训练栈提供参考。
- 说明文本强化学习未必会损害多模态、指令遵循和工具调用等基础能力。
- 展示“冷启动数据 + 纯强化学习”训练开源推理模型的可行路径。
- 可用于研究推理语言约束、强化学习扩展规律及跨能力保持问题。
📝 原始笔记(逐字保留)
清华刘知远团队:高质量 LLM 训练数据获取
清华大学刘知远团队分享高质量大语言模型训练数据的获取方法与相关思路。
该文章聚焦大语言模型训练中的高质量数据获取问题。内容来自清华大学刘知远团队,围绕训练数据这一决定模型能力的重要环节展开。文章可为 LLM 数据收集、筛选与质量建设提供参考。
- 了解高质量 LLM 训练数据的获取思路
- 为训练语料的收集、筛选和质量控制提供参考
- 辅助规划大模型数据工程与训练流程
📝 原始笔记(逐字保留)
Domain2Vec:向量化数据集,无需训练寻找最优数据混合
Domain2Vec 将数据集表示为向量,用低成本方式筛选有利于目标任务的训练数据混合方案。
Domain2Vec 探索将不同数据集映射为向量表示,以刻画其领域特征及相互关系。基于这些表示,研究者可以在不实际训练候选模型的情况下比较不同数据组合。该方法旨在降低数据配比搜索所需的计算成本,为大模型训练前的数据选择与混合优化提供依据。
- 在正式训练前快速筛选更合适的数据来源与配比
- 减少反复训练模型以验证数据混合方案的算力成本
- 为数据集检索、领域匹配和训练数据治理提供向量化工具
📝 原始笔记(逐字保留)
在不损害能力的前提下精简大语言模型
研究通过HellaSwag、GSM8K和MMLU-CS评估LoRA与QLoRA,表明参数高效微调可低成本提升特定任务表现,但效果高度依赖训练数据与目标任务的匹配程度。
论文研究LoRA和QLoRA等参数高效微调方法对大语言模型能力与计算效率的影响。作者分别使用HellaSwag、GSM8K和MMLU-CS评估常识推理、数学推理及多领域知识能力。实验显示,LoRA类方法能够在控制资源消耗的同时提升特定任务性能。与此同时,微调收益很大程度上取决于微调数据集和下游评测任务之间的对齐程度。
- 为计算资源有限的开发者提供高效适配大语言模型的实践依据
- 在选择微调数据时,应优先考虑其与目标任务及评测分布的匹配程度
- 可通过跨任务基准测试监控参数高效微调是否造成通用能力损失
📝 原始笔记(逐字保留)
MMMG:面向文本到图像推理的大规模多学科多层级生成基准
MMMG通过跨学科、跨教育层级的知识图像生成任务与知识图谱驱动指标,系统揭示了当前文本到图像模型在实体、关系和视觉清晰度方面的推理缺陷。
论文提出知识图像生成任务,并构建包含4456个专家验证提示—图像对的MMMG基准,覆盖10个学科、6个教育层级以及图表、思维导图等多种知识表达形式。该基准使用统一的知识图谱表示目标图像中的核心实体及其依赖关系,以降低复杂图像评估中的歧义。MMMG-Score结合知识图谱编辑距离衡量的事实保真度与视觉清晰度,对生成结果进行综合评价。对16个先进文本到图像模型的测试显示,现有模型普遍存在实体失真、关系表达薄弱和布局混乱等问题;论文还发布了结合推理大模型与扩散模型、使用1.6万组数据训练的开放基线FLUX-Reason。
- 用于评估文本到图像模型能否将世界知识转化为事实准确、结构清晰的解释性视觉内容。
- 知识图谱可作为复杂生成任务的中间表示,并为自动化评估提供可比较的结构化目标。
- 现有强模型在知识图像生成上仍有明显推理短板,实体与关系保真度可作为后续模型优化重点。
- MMMG可用于研究推理大模型与扩散模型协同生成知识型图像的方法。
📝 原始笔记(逐字保留)
超越黄金标准:用于形式数学推理评估的LLM法官认识论集成
论文提出基于认识论与形式基础集成(EFG)的LLM法官框架,通过四项细粒度标准提升自动形式化评估的可解释性及其与人类判断的一致性。
自动形式化将自然语言数学陈述转换为形式语言,但在高级数学场景中,人工评估需要大量时间和专业知识。论文提出认识论与形式基础集成(EFG),利用多个LLM法官,从逻辑保持(LP)、数学一致性(MC)、形式有效性(FV)和形式质量(FQ)四个原子维度进行评估。该方法以细粒度标准替代传统的通用粗粒度评价,使判断过程更加透明。实验显示,EFG集成结果比粗粒度模型更贴近人类评价,尤其能够更准确地衡量形式质量。
- 为自动形式化和形式数学推理提供可扩展的自动评估方案
- 将复杂质量标准拆分为原子属性,提高LLM法官的可靠性与可解释性
- 启示评估系统采用多法官集成和形式化标准,减少单一模型及粗粒度评分带来的偏差
📝 原始笔记(逐字保留)
文本、视觉和语音生成自动评估方法综述
该综述统一梳理文本、视觉与语音生成的自动评估方法,并将现有技术归纳为五种基本范式。
生成式 AI 在文本、图像和音频领域快速发展,但如何自动、可靠地评估生成质量仍是持续挑战。论文提出统一分类框架,将三种模态的现有自动评估方法归纳为五种基本范式。作者首先分析技术相对成熟的文本生成评估,再将该框架扩展至视觉和语音生成。综述还讨论了跨模态评估方法的局限及未来研究方向。
- 为跨文本、视觉和语音的生成质量评估提供统一知识框架
- 帮助研究者比较不同评估范式的适用范围与局限
- 为设计通用、可靠的跨模态自动评估指标提供研究线索