2025-06-16 科研追新
当日精选(由提交工具自动创建)。
DeepResearch Bench:深度研究智能体综合评测基准
DeepResearch Bench以100个跨越22个领域的博士级任务及两套自动评估方法,系统衡量深度研究智能体的报告生成、信息检索与引用能力。
深度研究智能体能够自动执行多步骤网络探索、定向检索和信息综合,在较短时间内生成引用丰富的研究报告,但此前缺乏系统性的综合基准。DeepResearch Bench收录了100个由领域专家设计的博士级研究任务,覆盖22个不同领域。研究提出基于参考答案和自适应标准的报告质量评估方法,使自动评分与人类判断保持较强一致性。另一套框架通过有效引用数量和整体引用准确率,评估智能体的信息检索、资料收集及引用能力。
- 为不同深度研究智能体提供统一、跨领域的能力比较标准
- 支持评估研究报告的内容质量、有效引用数量与引用准确性
- 可用于定位智能体在网络检索、资料整合和高阶综合环节的短板
- 开源基准与评估组件有助于加速实用型深度研究应用的开发
📝 原始笔记(逐字保留)
Infinity Instruct:扩展指令选择与合成以增强语言模型
Infinity-Instruct 通过大规模数据筛选、指令进化与诊断过滤构建高质量基础及聊天指令集,显著提升多个开源大模型的基础能力和指令遵循表现。
Infinity-Instruct 是一个兼顾基础能力与聊天能力的大规模高质量指令数据集。研究团队首先采用混合数据选择技术,从超过 1 亿个样本中筛选出 740 万条基础指令 InfInstruct-F-7.4M,随后通过指令选择、进化和诊断过滤合成 150 万条聊天指令 InfInstruct-G-1.5M。实验覆盖 Mistral、LLaMA、Qwen 和 Yi 等开源模型,结果显示其在基础能力和指令遵循基准上均取得明显提升。使用该数据训练的 LLaMA 3.1 70B 在指令遵循任务上比 GPT-4-0314 高出 8.6%,同时保持相当的基础性能。
- 展示从超大规模候选池中筛选并合成高质量指令数据的可扩展流程。
- 说明基础指令训练与聊天指令训练具有协同作用,不应只优化单一类型的数据。
- 可作为开源模型指令微调、数据配比研究及合成数据质量过滤的实践参考。
- 公开的数据集与代码便于复现并扩展到其他模型和领域。
📝 原始笔记(逐字保留)
使用规则引导的合成数据进行可配置偏好调优
CPT 通过细粒度规则生成合成偏好数据,使语言模型能够依据系统提示在推理时动态调整写作风格等偏好属性,而无须重新训练。
论文提出可配置偏好调优(CPT),旨在突破传统偏好模型被固化在单一静态偏好集中的局限。该方法根据结构化、细粒度且人类可解释的规则生成合成偏好数据,并将相应规则写入系统提示作为训练条件。经过规则引导的偏好微调后,模型可以在推理阶段响应不同系统提示,动态改变写作风格等输出属性,而不需要再次训练。作者同时发布了训练代码、生成数据集和微调模型,论文被 ICML 2025 人类反馈模型与 AI 对齐研讨会接收。
- 利用规则驱动的数据合成,低成本构造具有明确属性标签的偏好训练数据。
- 让单个模型在推理时按系统提示切换偏好,减少为不同用户或场景分别微调模型的需求。
- 为细粒度、上下文相关的人类反馈建模提供一种可解释且可扩展的实现路径。
📝 原始笔记(逐字保留)
ScIRGen:为科学研究合成真实的大规模 RAG 数据集
ScIRGen 通过数据集导向的信息提取、认知分类问题生成和自动答案过滤,构建了包含 6.1 万条问答的科学 RAG 数据集 ScIRGen-Geo。
ScIRGen 是一个面向科学问答与检索的数据生成框架,旨在合成更贴近专业研究人员真实信息需求的复杂问题。该框架利用学术论文增强数据集表示,并基于认知分类体系生成具有不同认知难度的问题。研究还提出了基于困惑度变化的自动答案过滤方法,其有效性判断与人工评估高度一致。最终构建的 ScIRGen-Geo 包含约 6.1 万条问答,基准实验显示现有问答和检索方法在复杂问题推理上仍有明显不足。
- 为科学检索与 RAG 系统提供更真实、更大规模的训练及评测数据。
- 展示如何结合领域信息提取与认知分类提升合成问题的质量和难度覆盖。
- 利用自动答案过滤降低人工审核成本,为大规模高质量数据合成提供参考。
- 揭示现有科学问答与检索方法在复杂推理任务上的能力缺口。
📝 原始笔记(逐字保留)
LLM评审:面向IT自动化的无参考Bash代码验证与改进
研究以双向功能匹配和逻辑表示增强LLM-as-a-Judge,实现自然语言到Bash代码的无参考验证,并通过反思智能体将代码改进准确率提升24%。
智能体 人工智能辅助编程 模型评估 自进化 SWE 软件工程
该研究面向IT自动化中的事件补救任务,探索如何在缺少参考答案时验证自然语言生成的Bash代码。作者利用双向功能匹配和逻辑表示增强LLM-as-a-Judge,并以基于执行的评估结果作为基准真值。实验中,该评审指标与执行评估具有较高一致性,准确率较基线最高提升超过8%。在此基础上构建的Reflection代码智能体能够根据评审反馈自动细化代码,使准确率进一步提升24%。
- 为缺少标准答案或完整测试用例的Bash代码生成任务提供自动化评估方案
- 可用于IT运维事件补救场景中的模型选择、代码验证与风险控制
- 展示“LLM评审反馈—智能体反思—代码细化”的闭环自我改进路径
📝 原始笔记(逐字保留)
Agent-RLVR:通过指导与环境奖励训练软件工程智能体
Agent-RLVR利用智能体指导和环境奖励缓解复杂软件工程任务中的奖励稀疏问题,将Qwen-2.5-72B-Instruct在SWE-Bench Verified上的通过率从9.4%提升至22.4%。
智能体 人工智能辅助编程 强化学习 模型训练 SWE 软件工程 人工智能框架 自进化
Agent-RLVR是一个面向复杂智能体环境的可验证奖励强化学习框架,首期聚焦软件工程任务。它借鉴人类教学方法,通过战略计划、错误反馈和环境交互信息等线索,引导智能体探索更可能成功的轨迹。训练时,智能体先生成初始轨迹并接受单元测试验证,再结合指导重新尝试,随后使用指导轨迹的奖励更新策略。在SWE-Bench Verified上,该方法将Qwen-2.5-72B-Instruct的通过率由9.4%提高至22.4%,配合测试时奖励模型后,pass@1进一步达到27.8%。
- 为奖励稀疏、失败率高的多步智能体任务提供更有效的强化学习训练方案
- 展示教学式指导与环境反馈结合后对软件工程智能体能力的显著提升
- 指导增强轨迹还可用于训练测试时奖励模型,支持进一步的性能扩展
- 为RLVR应用于复杂真实世界智能体环境提供可复用的框架思路
📝 原始笔记(逐字保留)
基于LLM的人工智能代理评估的进化视角:全面综述
该综述从进化视角区分传统LLM聊天机器人与AI智能体,并系统梳理智能体评估基准、评价属性及未来发展方向。
论文指出,现有评估框架常混淆LLM聊天机器人与AI智能体,导致基准选择和评估结果解释出现偏差。作者提出分析框架,从复杂环境、多源指令、动态反馈、多模态感知和高级功能五个方面辨别二者。综述进一步按照外部环境驱动力及其催生的内部能力,对现有智能体评估基准和评价属性进行分类。最后,论文从环境、智能体、评估者和指标四个维度总结趋势,并讨论未来评估体系的发展方向。
- 帮助研究人员根据智能体的能力边界和任务环境选择合适的评估基准
- 为构建区别于传统聊天机器人的智能体评价体系提供分类框架
- 启发从环境、智能体、评估者与指标四个维度设计更全面的评测方案
- 适合作为智能体训练、基准建设及能力诊断工作的参考
📝 原始笔记(逐字保留)
大型语言模型与涌现:复杂系统视角
论文从复杂系统理论出发,探讨如何量化大型语言模型的涌现能力,以及这些能力能否被视为真正的涌现智能。
涌现描述多体系统如何形成新的高层属性,并允许研究者用低维有效变量和理论替代对高维机制的逐项描述。论文以“更多即是不同”为切入点,审视大型语言模型是否会随规模增长而产生不可由局部机制直接解释的新能力。作者梳理并评议了多种量化涌现的方法,进一步区分性能跃迁、测量效应与真正的系统级涌现。文章最终追问,LLM 展现出的涌现能力是否足以构成涌现智能。
- 为研究 LLM 能力随规模变化的规律提供复杂系统理论框架
- 帮助区分真实涌现、连续性能增长与评测指标造成的表观突变
- 为设计更可靠的涌现能力量化方法和智能评估标准提供启示
📝 原始笔记(逐字保留)
LLM作为模糊评判:微调大模型用于临床评估
研究通过多维模糊集标注与监督微调,将大语言模型训练为可解释且符合医生偏好的临床沟通技能评判器。
论文提出 LLM-as-a-Fuzzy-Judge,将模糊逻辑与大语言模型结合,用于自动评估医学生与 AI 患者对话中的临床沟通表现。研究者从医学教育系统收集数据,并依据语言表达、医学相关性、道德行为和上下文干扰四个模糊集进行人工标注。随后通过提示工程和监督微调,使预训练模型学习带有细微差异的医生主观判断。实验中该方法取得超过 80% 的整体准确率,并在主要标准项目上超过 90%,展示了可解释、人类对齐临床评估的可行性。
- 为大规模医学教育提供自动化、可扩展的临床沟通技能评估方案。
- 利用模糊标签表达专家判断中的不确定性与程度差异,避免将复杂评价简化为刚性类别。
- 为训练符合领域专家偏好的 LLM 评判器提供“多维标注 + SFT”的实现路径。
- 可推广至其他具有主观性、模糊性和多评价维度的专业评估任务。
📝 原始笔记(逐字保留)
AssertBench:评估大型语言模型自我断言能力的基准
AssertBench通过矛盾的用户断言测试大语言模型能否坚持基于证据的事实判断,而非迎合用户立场。
AssertBench从事实验证数据集FEVEROUS中抽取有证据支持的事实,并为每项事实构造两种相反的用户框架:声称其正确或声称其错误。基准记录模型在两种框架下的判断一致性及推理过程,考察模型是否会因用户立场变化而改变事实评估。它还依据模型在中立提示下对同一主张的准确率进行分层,以区分框架诱发的波动与模型自身事实知识不足。该基准旨在衡量大语言模型面对矛盾用户断言时坚持正确判断的能力。
- 评估模型在用户施压或诱导下维持事实一致性的能力
- 识别模型迎合用户立场而改变判断的倾向
- 将提示框架敏感性与底层事实知识缺陷分离,为模型对齐和鲁棒性改进提供依据
📝 原始笔记(逐字保留)
更强大的语言模型会产生更多类似人类的错误
研究指出,能力更强的语言模型在推理过程中可能表现出更多与人类相似的系统性错误。
更强大的语言模型并不一定会消除所有推理错误,反而可能呈现更多类似人类的偏差与失误模式。这一现象表明,模型能力提升可能伴随着对人类语言和思维规律更深层的模仿。评估先进模型时,除了关注准确率,还应分析其错误类型、稳定性及与人类认知偏差的关联。
- 为语言模型的逻辑推理与错误模式评估提供新视角
- 提醒研究者区分能力提升与推理可靠性提升
- 可用于设计针对系统性偏差和类人错误的评测基准
📝 原始笔记(逐字保留)
句子简化的LLM:混合多智能体提示方法
研究提出混合多智能体提示方法,在保持语义与逻辑完整性的同时简化复杂句子,并将任务成功率由单智能体的48%提升至70%。
论文研究如何借助大型语言模型将复杂句子转换为更清晰的逻辑序列,同时保留原有语义与逻辑完整性。作者提出一种结合高级提示策略和多智能体架构的混合方法,以改善句子简化效果。在视频游戏设计应用所生成的复杂句子上,该方法取得70%的简化成功率,明显高于单智能体方法的48%。文中将该逻辑辅助方案称为FLARE,并称相关论文将发表于EMNLP 2025。
- 为需求文档、游戏设计说明等复杂文本提供逻辑一致的自动简化方案
- 展示多智能体协作提示相较单智能体在语言推理任务中的优势
- 为兼顾文本可读性、语义保真和逻辑完整性的系统设计提供参考