2025-06-16 科研追新

当日精选(由提交工具自动创建)。

DeepResearch Bench:深度研究智能体综合评测基准

DeepResearch Bench以100个跨越22个领域的博士级任务及两套自动评估方法,系统衡量深度研究智能体的报告生成、信息检索与引用能力。

 人工智能应用 智能体 模型评估 数据工程

深度研究智能体能够自动执行多步骤网络探索、定向检索和信息综合,在较短时间内生成引用丰富的研究报告,但此前缺乏系统性的综合基准。DeepResearch Bench收录了100个由领域专家设计的博士级研究任务,覆盖22个不同领域。研究提出基于参考答案和自适应标准的报告质量评估方法,使自动评分与人类判断保持较强一致性。另一套框架通过有效引用数量和整体引用准确率,评估智能体的信息检索、资料收集及引用能力。

用途与启示
  • 为不同深度研究智能体提供统一、跨领域的能力比较标准
  • 支持评估研究报告的内容质量、有效引用数量与引用准确性
  • 可用于定位智能体在网络检索、资料整合和高阶综合环节的短板
  • 开源基准与评估组件有助于加速实用型深度研究应用的开发
📝 原始笔记(逐字保留)
3. 2025-06-16 12:10:08 Monday | DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents **标题** : 深度研究平台:深度研究代理的全面基准 **链接** :https://arxiv.org/abs/2506.11763 **作者** : Mingxuan Du, Benfeng Xu, Chiwei Zhu, Xiaorui Wang, Zhendong Mao **备注** :31 pages, 5 figures **摘要** :深度研究代理是基于LLM的代理的突出类别。通过自动编排多步骤的网络探索、目标检索和高阶综合,他们将大量的在线信息转化为分析师级的、引用丰富的报告--将数小时的手动桌面研究压缩为几分钟。然而,仍然没有一个全面的基准来系统地评价这些代理人的能力。为了弥合这一差距,我们提出了DeepResearch Bench,这是一个由100个博士级研究任务组成的基准,每个任务都由22个不同领域的领域专家精心制作。评估DRA本质上是复杂和劳动密集型的。因此,我们提出了两种新的方法,实现与人类判断的强烈一致。第一种是基于参考文献的方法,采用自适应标准来评估生成的研究报告的质量。另一个框架是通过评估其有效引用计数和整体引用准确性来评估图书馆的信息检索和收集能力。我们在https://github.com/Ayanami0730/deep_research_bench上拥有开源的DeepResearch Bench和这些框架的关键组件,以加速实用的基于法学硕士的代理的开发。 #### [季峰陈天桥联手AGI首秀炸场!最强开源深度研究模型,GAIA测试82.4分超OpenAI](https://mp.weixin.qq.com/s/VHR2vxmuHlTc6H4xzTxH_A)

Infinity Instruct:扩展指令选择与合成以增强语言模型

Infinity-Instruct 通过大规模数据筛选、指令进化与诊断过滤构建高质量基础及聊天指令集,显著提升多个开源大模型的基础能力和指令遵循表现。

 数据合成 数据工程 模型训练 模型评估 人工智能

Infinity-Instruct 是一个兼顾基础能力与聊天能力的大规模高质量指令数据集。研究团队首先采用混合数据选择技术,从超过 1 亿个样本中筛选出 740 万条基础指令 InfInstruct-F-7.4M,随后通过指令选择、进化和诊断过滤合成 150 万条聊天指令 InfInstruct-G-1.5M。实验覆盖 Mistral、LLaMA、Qwen 和 Yi 等开源模型,结果显示其在基础能力和指令遵循基准上均取得明显提升。使用该数据训练的 LLaMA 3.1 70B 在指令遵循任务上比 GPT-4-0314 高出 8.6%,同时保持相当的基础性能。

用途与启示
  • 展示从超大规模候选池中筛选并合成高质量指令数据的可扩展流程。
  • 说明基础指令训练与聊天指令训练具有协同作用,不应只优化单一类型的数据。
  • 可作为开源模型指令微调、数据配比研究及合成数据质量过滤的实践参考。
  • 公开的数据集与代码便于复现并扩展到其他模型和领域。
📝 原始笔记(逐字保留)
10. 2025-06-16 12:04:21 Monday | Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models **标题** : 无限指令:扩展指令选择和合成以增强语言模型 **链接** :https://arxiv.org/abs/2506.11116 **作者** : Jijie Li, Li Du, Hanyu Zhao, Bo-wen Zhang, Liangdong Wang, Boyan Gao, Guang Liu, Yonghua Lin **摘要** :大型语言模型(LLM)在现实世界的应用中表现出强大的性能,但现有的开源指令数据集通常集中在狭窄的领域,如数学或编码,限制了泛化并扩大了与专有模型的差距。为了弥合这一差距,我们引入了Infinity-Instruct,这是一个高质量的指令数据集,旨在通过两阶段流水线增强LLM的基础和聊天功能。在第一阶段,我们使用**混合数据选择技术**从超过1亿个样本中筛选出740万条高质量的基础指令(InfInstruct-F-7.4M)。在第二阶段,我们通过涉及**指令选择、进化和诊断过滤**的两阶段过程合成1.5M高质量聊天指令(InfInstruct-G-1.5M)。我们通过微调几个开源模型(包括Mistral,LLaMA,Qwen和Yi)来实证评估Infinity-Instruct,并观察到基础和指令遵循基准的实质性性能提升,始终超过官方的调试调整的同行。值得注意的是,InfInstruct-LLaMA 3.1- 70 B在指令遵循任务上比GPT-4-0314高8.6%,同时实现了相当的基础性能。这些结果强调了基础和聊天培训之间的协同作用,并为整体LLM开发提供了新的见解。我们的数据集\footnote{https://huggingface.co/baseets/BAAI/Infinity-Instruct}和代码\footnote{https://gitee.com/li-touch/infinity-instruct}已经公开发布。

使用规则引导的合成数据进行可配置偏好调优

CPT 通过细粒度规则生成合成偏好数据,使语言模型能够依据系统提示在推理时动态调整写作风格等偏好属性,而无须重新训练。

 数据合成 模型训练 数据工程 人工智能

论文提出可配置偏好调优(CPT),旨在突破传统偏好模型被固化在单一静态偏好集中的局限。该方法根据结构化、细粒度且人类可解释的规则生成合成偏好数据,并将相应规则写入系统提示作为训练条件。经过规则引导的偏好微调后,模型可以在推理阶段响应不同系统提示,动态改变写作风格等输出属性,而不需要再次训练。作者同时发布了训练代码、生成数据集和微调模型,论文被 ICML 2025 人类反馈模型与 AI 对齐研讨会接收。

用途与启示
  • 利用规则驱动的数据合成,低成本构造具有明确属性标签的偏好训练数据。
  • 让单个模型在推理时按系统提示切换偏好,减少为不同用户或场景分别微调模型的需求。
  • 为细粒度、上下文相关的人类反馈建模提供一种可解释且可扩展的实现路径。
📝 原始笔记(逐字保留)
11. 2025-06-16 12:10:47 Monday Configurable Preference Tuning with Rubric-Guided Synthetic Data **标题** : 使用条目引导的合成数据进行可配置的偏好调整 **链接** :https://arxiv.org/abs/2506.11702 **作者** : Víctor Gallego **备注** :Accepted to ICML 2025 Workshop on Models of Human Feedback for AI Alignment **摘要** :用于AI对齐的人类反馈模型,例如支持直接偏好优化(DPO)的模型,通常会在单一的静态偏好集中进行烘焙,从而限制了适应性。本文通过引入 **可配置偏好调整** (CPT),一种新的框架赋予语言模型的能力,动态调整其行为的基础上明确的,人类可解释的指令的单一偏好的假设提出了挑战。CPT利用合成生成的偏好数据,以来自结构化的细粒度规则的系统提示为条件,这些规则定义了所需的属性,如写作风格。通过对这些规则引导的偏好进行微调,LLM学会在推理时调整其输出以响应系统提示,而无需重新训练。这种方法不仅提供了细粒度的控制,而且还提供了一种对更细致入微且依赖于上下文的人类反馈进行建模的机制。几个实验性的工件,如训练代码,生成的数据集和微调模型,发布在https://github.com/vicgalle/configurable-preference-tuning ## 思维链数据 ### [SynAdapt:通过合成连续思维链学习大型语言模型中的自适应推理](https://papers.cool/arxiv/2508.00574)

ScIRGen:为科学研究合成真实的大规模 RAG 数据集

ScIRGen 通过数据集导向的信息提取、认知分类问题生成和自动答案过滤,构建了包含 6.1 万条问答的科学 RAG 数据集 ScIRGen-Geo。

 数据合成 数据工程 人工智能框架 模型评估 推理

ScIRGen 是一个面向科学问答与检索的数据生成框架,旨在合成更贴近专业研究人员真实信息需求的复杂问题。该框架利用学术论文增强数据集表示,并基于认知分类体系生成具有不同认知难度的问题。研究还提出了基于困惑度变化的自动答案过滤方法,其有效性判断与人工评估高度一致。最终构建的 ScIRGen-Geo 包含约 6.1 万条问答,基准实验显示现有问答和检索方法在复杂问题推理上仍有明显不足。

用途与启示
  • 为科学检索与 RAG 系统提供更真实、更大规模的训练及评测数据。
  • 展示如何结合领域信息提取与认知分类提升合成问题的质量和难度覆盖。
  • 利用自动答案过滤降低人工审核成本,为大规模高质量数据合成提供参考。
  • 揭示现有科学问答与检索方法在复杂推理任务上的能力缺口。
📝 原始笔记(逐字保留)
2. 2025-06-16 12:13:49 Monday | ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research **标题** : ScIRGen:为科学研究合成真实的大规模RAG数据集 **链接** :https://arxiv.org/abs/2506.11117 **作者** : Junyong Lin, Lu Dai, Ruiqian Han, Yijie Sui, Ruilin Wang, Xingliang Sun, Qinglin Wu, Min Feng, Hao Liu, Hui Xiong **备注** :KDD 2025 Accepted **摘要** :科学研究人员需要有关数据集的大量信息,以有效地评估和开发理论和方法。关于数据集的信息需求隐含在特定的研究任务中,而不是在搜索查询中明确表达。然而,现有的科学检索和问答(QA)数据集通常解决简单的问题,这与现实世界的研究调查的分布不一致。为了弥合这一差距,我们开发了ScIRGen,这是一个用于科学QA \&检索的数据集生成框架,更准确地反映了专业科学研究人员的信息需求,并使用它创建了一个大规模的科学检索增强生成(RAG)数据集,其中包含真实的查询,数据集和论文。从技术上讲,我们设计了一种 **面向数据集的信息提取方法** ,利用学术论文来增强数据集表示。然后,我们提出了一个 **问题生成框架** ,采用 **认知分类** ,以确保合成问题的质量。我们还设计了一种方法来 **自动过滤合成答案的LLM** ,这是高度符合人类的答案的有效性判断的困惑移位的基础上。总的来说,这些方法最终创建了61 k QA数据集ScIRGen-Geo。我们在ScIRGen-Geo数据集上对代表性方法的问答和检索能力进行了基准测试,发现目前的方法仍然存在复杂问题的推理问题。这项工作推动了更复杂工具的开发,以支持科学界复杂的信息需求。 # 数据增强

LLM评审:面向IT自动化的无参考Bash代码验证与改进

研究以双向功能匹配和逻辑表示增强LLM-as-a-Judge,实现自然语言到Bash代码的无参考验证,并通过反思智能体将代码改进准确率提升24%。

 智能体 人工智能辅助编程 模型评估 自进化 SWE 软件工程

该研究面向IT自动化中的事件补救任务,探索如何在缺少参考答案时验证自然语言生成的Bash代码。作者利用双向功能匹配和逻辑表示增强LLM-as-a-Judge,并以基于执行的评估结果作为基准真值。实验中,该评审指标与执行评估具有较高一致性,准确率较基线最高提升超过8%。在此基础上构建的Reflection代码智能体能够根据评审反馈自动细化代码,使准确率进一步提升24%。

用途与启示
  • 为缺少标准答案或完整测试用例的Bash代码生成任务提供自动化评估方案
  • 可用于IT运维事件补救场景中的模型选择、代码验证与风险控制
  • 展示“LLM评审反馈—智能体反思—代码细化”的闭环自我改进路径
📝 原始笔记(逐字保留)
2025-06-16 12:00:56 Monday| LLM-as-a-Judge for Reference-less Automatic Code Validation and Refinement for Natural Language to Bash in IT Automation **标题** : LLM作为IT自动化中自然语言的无参考自动代码验证和细化的评委 **链接** :https://arxiv.org/abs/2506.11237 **作者** : Ngoc Phuoc An Vo, Brent Paulovicks, Vadim Sheinin **备注** :10 pages **摘要** :为了在 **IT自动化中自动评估和选择最佳模型并提高自动事件补救的代码质量** ,验证为补救操作生成的代码在语法和语义上是否正确以及是否可以按预期正确执行至关重要。有三种方法:1)常规方法使用 **表面形式相似性度量(标记匹配、精确匹配等)** 。其具有许多限制,2)基于执行的评估更多地关注基于给定测试用例的通过/失败判断的代码功能,以及3)LLM作为判断者采用LLM用于自动评估,以基于预定义的度量来判断它是否是给定问题的正确答案。在这项工作中,我们专注于使用双向功能匹配和逻辑表示来增强LLM-as-a-Judge,用于Bash代码生成的无参考自动验证和细化,以选择IT自动化中自动事件补救的最佳模型。我们使用基于执行的评估作为基础事实来评估我们的LLM作为法官指标。结果显示出高准确性和协议与执行为基础的评估(和高达8%以上的基线)。最后,我们构建了Reflection代码代理,以利用来自我们的评估指标的判断和反馈,从而实现了自动代码细化的显着改进(准确性提高了24%)。

Agent-RLVR:通过指导与环境奖励训练软件工程智能体

Agent-RLVR利用智能体指导和环境奖励缓解复杂软件工程任务中的奖励稀疏问题,将Qwen-2.5-72B-Instruct在SWE-Bench Verified上的通过率从9.4%提升至22.4%。

 智能体 人工智能辅助编程 强化学习 模型训练 SWE 软件工程 人工智能框架 自进化

Agent-RLVR是一个面向复杂智能体环境的可验证奖励强化学习框架,首期聚焦软件工程任务。它借鉴人类教学方法,通过战略计划、错误反馈和环境交互信息等线索,引导智能体探索更可能成功的轨迹。训练时,智能体先生成初始轨迹并接受单元测试验证,再结合指导重新尝试,随后使用指导轨迹的奖励更新策略。在SWE-Bench Verified上,该方法将Qwen-2.5-72B-Instruct的通过率由9.4%提高至22.4%,配合测试时奖励模型后,pass@1进一步达到27.8%。

用途与启示
  • 为奖励稀疏、失败率高的多步智能体任务提供更有效的强化学习训练方案
  • 展示教学式指导与环境反馈结合后对软件工程智能体能力的显著提升
  • 指导增强轨迹还可用于训练测试时奖励模型,支持进一步的性能扩展
  • 为RLVR应用于复杂真实世界智能体环境提供可复用的框架思路
📝 原始笔记(逐字保留)
3. 2025-06-16 12:11:42 Monday | Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards **标题** : Agent-WLVR:通过指导和环境奖励训练软件工程代理 **链接** :https://arxiv.org/abs/2506.11425 **作者** : Jeff Da, Clinton Wang, Xiang Deng, Yuntao Ma, Nikhil Barhate, Sean Hendryx **摘要** :来自 **可验证奖励的强化学习(RLVR)** 已被广泛采用,作为增强大型语言模型推理能力的实际方法,并在数学和竞争性编程任务等可验证领域取得了显着的成功。然而,RLVR的功效显着降低时,适用于agentic环境。这些设置以多步骤、复杂的问题解决为特征,即使对于前沿LLM,也会导致高失败率,因为奖励环境对于通过传统RLVR进行有效的模型训练来说过于稀疏。在这项工作中,我们引入了Agent-RLVR,这是一个使RLVR在具有挑战性的代理环境中有效的框架,最初的重点是软件工程任务。 **受人类教学法的启发,Agent-RLVR引入了代理指导,这是一种通过利用各种信息线索积极引导代理走向成功轨迹的机制。** 这些线索,从高层次的战略计划,对代理的错误和环境的相互作用的动态反馈,模仿教师的指导,使代理导航困难的解决方案空间,并通过额外的环境探索促进积极的自我改进。在Agent-RLVR训练循环中,代理首先尝试解决任务以产生初始轨迹,然后通过单元测试进行验证并补充代理指导。然后代理重新尝试指导,并根据这些指导轨迹的奖励使用RLVR更新代理策略。在SWE-Bench Verified上,Agent-RLVR将Qwen-2.5- 72 B-Instruct的通过率从9.4%提高到22.4%。我们发现,我们的指导增强RLVR数据对于测试时奖励模型训练也很有用,通过进一步将pass@1提高到27.8%。Agent-RLVR为在复杂的真实世界环境中使用RLVR训练代理奠定了基础,传统的RL方法在这些环境中挣扎。

基于LLM的人工智能代理评估的进化视角:全面综述

该综述从进化视角区分传统LLM聊天机器人与AI智能体,并系统梳理智能体评估基准、评价属性及未来发展方向。

 智能体 模型评估 人工智能 多模态

论文指出,现有评估框架常混淆LLM聊天机器人与AI智能体,导致基准选择和评估结果解释出现偏差。作者提出分析框架,从复杂环境、多源指令、动态反馈、多模态感知和高级功能五个方面辨别二者。综述进一步按照外部环境驱动力及其催生的内部能力,对现有智能体评估基准和评价属性进行分类。最后,论文从环境、智能体、评估者和指标四个维度总结趋势,并讨论未来评估体系的发展方向。

用途与启示
  • 帮助研究人员根据智能体的能力边界和任务环境选择合适的评估基准
  • 为构建区别于传统聊天机器人的智能体评价体系提供分类框架
  • 启发从环境、智能体、评估者与指标四个维度设计更全面的评测方案
  • 适合作为智能体训练、基准建设及能力诊断工作的参考
📝 原始笔记(逐字保留)
4. 2025-06-16 12:08:16 Monday| Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey **标题** : 基于LLM的人工智能代理评估的进化观点:全面调查 **链接** :https://arxiv.org/abs/2506.11102 **作者** : Jiachen Zhu, Menghui Zhu, Renting Rui, Rong Shan, Congmin Zheng, Bo Chen, Yunjia Xi, Jianghao Lin, Weiwen Liu, Ruiming Tang, Yong Yu, Weinan Zhang **摘要** :GPT、Gemini和DeepSeek等大型语言模型(LLM)的出现显着推进了自然语言处理,催生了能够执行多种语言相关任务的复杂聊天机器人。从这些传统的LLM聊天机器人到更先进的AI代理的过渡代表了关键的进化步骤。然而,现有的评估框架往往模糊了LLM聊天机器人和AI代理之间的区别,导致研究人员在选择适当的基准时感到困惑。为了弥合这一差距,本文介绍了一个系统的分析,目前的评估方法,接地在进化的角度来看。我们提供了一个详细的分析框架,可以从五个关键方面将AI代理与LLM聊天机器人区分开来:复杂环境,多源讲师,动态反馈,多模态感知和高级功能。此外,我们还根据外部环境驱动力以及由此产生的高级内部能力对现有评估基准进行分类。对于每一个类别,我们描绘了相关的评价属性,在实际参考表中全面介绍。最后,我们综合目前的趋势,并通过四个关键镜头概述未来的评估方法:环境,代理,评估员和指标。我们的研究结果为研究人员提供了可操作的指导,促进了AI代理评估中基准的明智选择和应用,从而促进了这一快速发展的研究领域的持续进步。 # 智能体训练

大型语言模型与涌现:复杂系统视角

论文从复杂系统理论出发,探讨如何量化大型语言模型的涌现能力,以及这些能力能否被视为真正的涌现智能。

 人工智能 模型评估 推理

涌现描述多体系统如何形成新的高层属性,并允许研究者用低维有效变量和理论替代对高维机制的逐项描述。论文以“更多即是不同”为切入点,审视大型语言模型是否会随规模增长而产生不可由局部机制直接解释的新能力。作者梳理并评议了多种量化涌现的方法,进一步区分性能跃迁、测量效应与真正的系统级涌现。文章最终追问,LLM 展现出的涌现能力是否足以构成涌现智能。

用途与启示
  • 为研究 LLM 能力随规模变化的规律提供复杂系统理论框架
  • 帮助区分真实涌现、连续性能增长与评测指标造成的表观突变
  • 为设计更可靠的涌现能力量化方法和智能评估标准提供启示
📝 原始笔记(逐字保留)
2025-06-16 12:03:18 Monday Large Language Models and Emergence: A Complex Systems Perspective **标题** : 大型语言模型和涌现:复杂系统的视角 **链接** :https://arxiv.org/abs/2506.11135 **作者** : David C. Krakauer, John W. Krakauer, Melanie Mitchell **摘要** : **涌现是复杂性科学中的一个概念** ,描述了多体系统如何表现出新的更高层次的属性,这些属性可以通过用低维有效变量和理论取代高维机制来描述。这一点被“ **更多即是不同** ”的理念所捕捉。智能是一种完美的突现属性,它表现出越来越高效、更便宜、更快地利用突现能力来解决问题。这是由“ **少即是多** ”的理念所体现的。在本文中,我们首先研究声称,大型语言模型表现出涌现能力,审查几种方法来量化涌现,其次问LLM是否具有涌现智能。

LLM作为模糊评判:微调大模型用于临床评估

研究通过多维模糊集标注与监督微调,将大语言模型训练为可解释且符合医生偏好的临床沟通技能评判器。

 模型训练 模型评估 人工智能应用 数据工程

论文提出 LLM-as-a-Fuzzy-Judge,将模糊逻辑与大语言模型结合,用于自动评估医学生与 AI 患者对话中的临床沟通表现。研究者从医学教育系统收集数据,并依据语言表达、医学相关性、道德行为和上下文干扰四个模糊集进行人工标注。随后通过提示工程和监督微调,使预训练模型学习带有细微差异的医生主观判断。实验中该方法取得超过 80% 的整体准确率,并在主要标准项目上超过 90%,展示了可解释、人类对齐临床评估的可行性。

用途与启示
  • 为大规模医学教育提供自动化、可扩展的临床沟通技能评估方案。
  • 利用模糊标签表达专家判断中的不确定性与程度差异,避免将复杂评价简化为刚性类别。
  • 为训练符合领域专家偏好的 LLM 评判器提供“多维标注 + SFT”的实现路径。
  • 可推广至其他具有主观性、模糊性和多评价维度的专业评估任务。
📝 原始笔记(逐字保留)
2025-06-16 12:02:10 Monday LLM-as-a-Fuzzy-Judge: Fine-Tuning Large Language Models as a Clinical Evaluation Judge with Fuzzy Logic **标题** : LLM作为模糊法官:使用模糊逻辑对大型语言模型进行微调,作为临床评估法官 **链接** :https://arxiv.org/abs/2506.11221 **作者** : Weibing Zheng, Laurah Turner, Jess Kropczynski, Murat Ozer, Tri Nguyen, Shane Halse **备注** :12 pages, 1 figure, 2025 IFSA World Congress NAFIPS Annual Meeting **摘要** :临床沟通技能在医学教育中至关重要,大规模地实践和评估临床沟通技能具有挑战性。虽然LLM驱动的临床情景模拟在增强医学生的临床实践方面显示出了希望,但提供遵循细微差别的医生判断的自动化和可扩展的临床评估是困难的。本文结合**模糊逻辑**和大语言模型(LLM),提出LLM作为模糊评判,以解决医学生临床技能自动评价与医生主观偏好相结合的难题。LLM作为模糊判断是一种方法,LLM经过微调,根据来自四个模糊集的人类注释来评估医学生在学生-AI患者对话脚本中的话语,包括语言学,医学相关性,道德行为和上下文干扰。本文的方法从LLM-powered医学教育系统的数据收集开始,基于多维模糊集的数据注释,然后是提示工程和使用这些人类注释的预训练LLMs的监督微调(SFT)。结果表明,LLM作为一个模糊判断达到80%以上的准确性,与主要标准项目超过90%, **有效地利用模糊逻辑和LLM作为一个解决方案,提供可解释的,人类对齐的评估** 。这项工作表明了 **利用模糊逻辑和LLM与人类偏好保持一致的可行性** ,推进了医学教育的自动化评估,并支持更强大的评估和判断实践。该工作的GitHub存储库可在https://github.com/2sigmaEdTech/LLMAsAJudge上获得 ## 训练加速

AssertBench:评估大型语言模型自我断言能力的基准

AssertBench通过矛盾的用户断言测试大语言模型能否坚持基于证据的事实判断,而非迎合用户立场。

 模型评估 数据工程 推理

AssertBench从事实验证数据集FEVEROUS中抽取有证据支持的事实,并为每项事实构造两种相反的用户框架:声称其正确或声称其错误。基准记录模型在两种框架下的判断一致性及推理过程,考察模型是否会因用户立场变化而改变事实评估。它还依据模型在中立提示下对同一主张的准确率进行分层,以区分框架诱发的波动与模型自身事实知识不足。该基准旨在衡量大语言模型面对矛盾用户断言时坚持正确判断的能力。

用途与启示
  • 评估模型在用户施压或诱导下维持事实一致性的能力
  • 识别模型迎合用户立场而改变判断的倾向
  • 将提示框架敏感性与底层事实知识缺陷分离,为模型对齐和鲁棒性改进提供依据
📝 原始笔记(逐字保留)
4. 2025-06-16 12:06:32 Monday | AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models **标题** : AssertBench:评估大型语言模型中自我断言的基准 **链接** :https://arxiv.org/abs/2506.11110 **作者** : Jaeho Lee, Atharv Chowdhary **备注** :15 pages, 4 figures, appendix contains 2 additional figures and 2 tables **摘要** :最近的基准已经探索了大语言模型(LLM)中的事实一致性和修辞鲁棒性。然而,关于事实上真实的陈述的方向框架如何影响模型协议,LLM用户的常见情况,存在知识差距。AssertBench通过从FEVEROUS(一个事实验证数据集)中抽取证据支持的事实来解决这个问题。对于每个(证据支持的)事实,我们构建两个框架提示:一个是用户声称陈述事实上是正确的,另一个是用户声称它是不正确的。然后,我们记录模型的一致性和推理。期望的结果是模型断言自己,在两个框架中保持一致的真实评估,而不是切换其评估以与用户达成一致。AssertBench通过基于中立呈现时模型对相同主张的准确性对结果进行分层,将框架引起的变异性与模型的底层事实知识隔离开来。在这样做的过程中,这个基准测试的目的是衡量一个LLM的能力,“坚持自己的枪”时,提出了矛盾的用户断言相同的事实。完整的源代码可以在https://github.com/achowd32/assert-bench上找到。

更强大的语言模型会产生更多类似人类的错误

研究指出,能力更强的语言模型在推理过程中可能表现出更多与人类相似的系统性错误。

 逻辑推理 模型评估 人工智能

更强大的语言模型并不一定会消除所有推理错误,反而可能呈现更多类似人类的偏差与失误模式。这一现象表明,模型能力提升可能伴随着对人类语言和思维规律更深层的模仿。评估先进模型时,除了关注准确率,还应分析其错误类型、稳定性及与人类认知偏差的关联。

用途与启示
  • 为语言模型的逻辑推理与错误模式评估提供新视角
  • 提醒研究者区分能力提升与推理可靠性提升
  • 可用于设计针对系统性偏差和类人错误的评测基准
📝 原始笔记(逐字保留)
3. 20250616|更强大的语言模型会产生更多类似人类的错误

句子简化的LLM:混合多智能体提示方法

研究提出混合多智能体提示方法,在保持语义与逻辑完整性的同时简化复杂句子,并将任务成功率由单智能体的48%提升至70%。

 逻辑推理 智能体 推理 人工智能应用

论文研究如何借助大型语言模型将复杂句子转换为更清晰的逻辑序列,同时保留原有语义与逻辑完整性。作者提出一种结合高级提示策略和多智能体架构的混合方法,以改善句子简化效果。在视频游戏设计应用所生成的复杂句子上,该方法取得70%的简化成功率,明显高于单智能体方法的48%。文中将该逻辑辅助方案称为FLARE,并称相关论文将发表于EMNLP 2025。

用途与启示
  • 为需求文档、游戏设计说明等复杂文本提供逻辑一致的自动简化方案
  • 展示多智能体协作提示相较单智能体在语言推理任务中的优势
  • 为兼顾文本可读性、语义保真和逻辑完整性的系统设计提供参考
📝 原始笔记(逐字保留)
2025-06-16 12:35:50 Monday | LLMs for Sentence Simplification: A Hybrid Multi-Agent prompting Approach **标题** : 句子简化的LLM:混合多代理提示方法 **链接** :https://arxiv.org/abs/2506.11681 **作者** : Pratibha Zunjare, Michael Hsiao **摘要** :本文解决了 **将复杂句子转换为逻辑序列的挑战** ,简化句子,同时保持语义和逻辑的完整性与大型语言模型的帮助。我们提出了一种混合的方法,结合先进的提示与多智能体架构,以提高句子简化过程。实验结果表明,我们的方法能够成功地简化70%的视频游戏设计应用程序编写的复杂句子。相比之下,单代理方法在相同任务上的成功率为48%。 FLARE方法结合逻辑辅助提高推理能力,团队公布论文将发表于EMNLP 2025
0%