2026-08-20 科研追新

当日精选(由提交工具自动创建)。

Claude自主设计蛋白质结合剂,14个靶标实验命中

Claude自主编排多种开源蛋白质工具完成结合剂设计,15个靶标中命中14个,1320项送测设计有354项经独立实验室验证有效。

 自动化科学研究 科学发现 生物信息学 智能体 智能体编排 工具调用 蛋白质设计

Anthropic让Claude Mythos Preview和Opus 4.8自主执行蛋白质结合剂设计,包括选择表位、安装工具、生成结构、筛选优化与结果排序,人类不参与设计决策。Claude编排RFdiffusion、ProteinMPNN和ESMFold2等现有工具,共采用10种结构生成方法和24种工具组合,在24至48小时内完成任务。15个靶标中有14个获得有效结合剂,1320项送测设计中354项通过两家独立实验室验证,总成功率为26.8%,高于行业常见的10%至15%。实验仍存在MBP靶标全部失败、预测结构未经实验解析等局限,且结合剂距离实际药物还需经历毒理和临床验证。Anthropic已公开提示词、数据及设计模型,同时因双重用途风险限制公开版Claude的相关生物设计能力。

用途与启示
  • 展示通用大模型通过工具编排承担端到端科研流程的可行性,为自动科研智能体提供实证案例。
  • 说明将专家知识编码进长提示词,并结合专业生成、预测与筛选工具,可显著压缩蛋白质设计周期。
  • 独立实验室验证证明,科研智能体的评估应从计算指标扩展到真实实验闭环。
  • 蛋白质设计具有明显双重用途风险,能力开放需配套权限控制、生物安全审查与持续监测。
📝 原始笔记(逐字保留)
Evolve应用|Claude开始自主设计新蛋白质,效率超越人类专家数十倍!https://mp.weixin.qq.com/s/QHS-Fp19XoulMkdyDwDgjg

自改进智能体的脆弱性:方差、任务顺序与规格不足

研究自改进智能体如何受到运行方差、任务执行顺序和目标规格不足的影响,揭示其改进结果可能不稳定。

 自进化 智能体 评估方差 顺序效应 欠规范性

该工作聚焦自改进智能体的脆弱性,考察改进过程能否稳定复现。研究重点包括随机方差对结果可靠性的影响,以及任务顺序变化可能造成的路径依赖。标题还指出,目标或评测规格不足可能使智能体沿非预期方向进行优化。现有链接未提供论文、代码或数据集地址。

用途与启示
  • 评估自改进智能体时,应采用多次重复实验并报告结果方差。
  • 需要打乱或系统控制任务顺序,以识别路径依赖和顺序效应。
  • 在启动递归改进前,应明确目标、约束和评测标准,降低规格不足导致的错误优化。
  • 可为 LogicEvolve 等自进化系统设计更稳健的实验协议与停止条件。
📝 原始笔记(逐字保留)
LogicEvolve|On the Fragility of Self-Improving Agents:Variance, Task Order, and Underspecification https://h5.lingowhale.com/s/S0vk1sy

DeepSeek Harness 发布后,Agent 商业格局生变

文章讨论 DeepSeek Harness 发布对 Agent 技术栈、产品竞争和商业模式可能带来的重塑。

 智能体 智能体脚手架 智能体编排 服务经济 智能体商业化

文章聚焦 DeepSeek Harness 发布后 Agent 行业竞争逻辑的变化。Harness 作为连接模型、工具与任务执行流程的关键层,可能使竞争重点从单一模型能力转向工程编排和实际交付。其发布也可能降低 Agent 产品的开发与部署门槛,促使厂商重新评估技术壁垒和价值分配。由于链接正文未能正常读取,具体产品功能与商业判断仍需以原文为准。

用途与启示
  • 跟踪 Agent 基础设施从封闭产品向标准化 Harness 演进的趋势。
  • 评估模型厂商进入执行框架层后,对现有 Agent 创业公司的竞争影响。
  • 研究 Harness 的开放程度、工具兼容性与部署成本能否形成新的生态壁垒。
📝 原始笔记(逐字保留)
HarnessEvolve|DeepSeek Harness 发布后,Agent 这门生意变了https://m.huxiu.com/article/4884156.html

J-Space Skill 提升 DeepSeek V4 Pro 的评测争议

J-Space 宣称其 Skill 能显著提升 DeepSeek V4 Pro 的智能体与编程基准表现,但社区复测未能复现增益,反而发现 Token 开销增加及评测过程不透明等问题。

 智能体脚手架 实验验证 评估方差 技能安全 原始证据 可复现性 评估透明度

  • J-Space Cognition Suite V3.6 以 Skill 形式接入 Agent 环境,通过外部账本、工作集限制、诊断恢复和结果验证来抑制表征漂移、无效重试与过早完成。
  • 项目报告宣称其可将 DeepSeek V4 Pro 在 Terminal Bench、NL2Repo 和 DeepSWE 等基准上的成绩大幅提高,部分结果超过 Fable 5,同时改善速度与 Token 效率。
  • 社区针对 V4 Flash 的多轮 A/B 测试和 H20 部署复测均未复现所称增益,其中一项测试仅取得 77.5%,明显低于报告中的 87.1%,且部分实验显示资源消耗反而增加。
  • 质疑者要求公开完整环境、运行日志、测试流程及样本输出,并指称相关 Issue 曾被删除,使争议从脚手架效果问题升级为评测可信度与治理问题。
用途与启示
  • 评估 Harness 或 Skill 的能力增益时,应固定模型版本、工具配置、推理模式和采样条件,并进行足量重复实验。
  • 除最终分数外,还应披露运行日志、失败样本、Token 消耗、耗时和统计方差,避免仅凭汇总表判断提升。
  • 对外部脚手架带来的增益,应区分真实能力提升、任务路由收益、提示锚定效应和偶然波动。
  • HarnessEvolve 可将可复现评测、证据留存和第三方复核机制纳入脚手架演化的基本准入标准。
📝 原始笔记(逐字保留)
HarnessEvolve|一个Skill让DeepSeek V4 Pro超越Fable 5?热门插件被锤了 https://mp.weixin.qq.com/s/_lCFC9a-FJqD6jdl0K220Q

Agent 失控的四类常见模式

Harness Evolve 作者将 Agent 失控归纳为工作集过载、表征漂移、无效重试和过早完成四类典型问题。

 智能体 故障归因 执行诊断 过程验证 长程任务 失控模式 工作负荷

工作集过载是指任务一次性引入过多目标、约束与工具信息,导致关键信息被稀释。表征漂移表现为名称、数值或任务目标在多轮推理及跨文件处理中逐渐变化。无效重试源于工具调用失败后未保留诊断信息,模型只是重复原有执行路径。过早完成则是模型被流畅的中间答案误导,在未验证结果可用性时便宣布任务结束。

用途与启示
  • 可作为 Agent 运行时监控与失效诊断的基础分类框架。
  • 应控制工作集规模,并持续校验跨轮次、跨文件的关键表征。
  • 工具调用失败后需保存错误、环境状态和诊断信息,避免无效重试。
  • 将结果验证与完成判定绑定,防止模型仅凭回答流畅度提前终止任务。
📝 原始笔记(逐字保留)
Harness Evolve|项目作者将 Agent 常见的失控归纳为四种情况。 第一种是工作集过载。任务同时塞进太多目标、限制和工具信息,真正重要的内容反而被淹没。 第二种是表征漂移。一个名称、数值或者任务目标,在多轮推理和多个文件之间逐渐发生变化。 第三种是无效重试。工具调用失败后,模型没有保留诊断信息,只是沿着原来的路线再跑一遍。 第四种是过早完成。模型生成了一段看起来很流畅的回答,便误以为任务已经结束,却没有验证结果是否真的可用。

腾讯混元两项工作:Harness Handbook 与 RST 递归任务合成

腾讯混元分别从可持续维护的 Agent harness 和递归生成的长程终端任务数据入手,提升智能体工程迭代效率与训练数据的规模、难度及可迁移性。

 智能体脚手架 代码演化 数据合成 任务生成 长程任务 递归自我改进 SWE 软件工程 强化学习 行为定位 递归合成 终端任务

  • Harness Handbook 结合静态程序分析与 LLM 归纳,自动构建按行为组织、带源码定位符的 L1–L3 手册及跨阶段状态表,用于解决 harness 修改中的行为定位问题。
  • BGPD 工作流从系统与组件层逐步下钻至源码,并通过调用图扩展和仓库验证提高定位准确率;实验中任务胜率提升、Token 消耗下降,弱规划器也能接近强模型的规划质量。
  • RST 将已验证任务作为下一代种子,依次扩展参考解法、同步指令与验证器,并在新沙箱中验证,15 轮递归生成了 37,484 个长程终端任务,平均成本约 0.05 美元。
  • 递归过程中任务的命令数、工具数、控制流和断言数量持续增长而多样性未明显坍缩;基于这些任务开展 SFT 与 PPO,可稳定提升 Qwen3.5 系列模型在独立终端基准上的表现。
用途与启示
  • 为 Agent harness 建立可自动生成和持续同步的行为级工程文档,降低代码定位、变更规划与维护成本。
  • 将静态分析提供的确定性事实与 LLM 的语义组织能力结合,可避免完全依赖代码检索或超长上下文。
  • 通过“已验证任务再播种”构建低成本、自扩展的数据生产闭环,并以沙箱和验证器保证指令、环境、解法之间的一致性。
  • 多样性约束、可执行难度指标和独立基准评测可作为递归数据演化系统防止模式坍缩与虚假增难的关键机制。
  • 两项工作共同表明,模型能力进化需要 harness、训练数据和验证基础设施同步演化。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/Gou37-HCCff6viQI-5gQ7g?scene=1

现代智能体自我改进:从模型更新到脚手架演化

综述以“基础模型 + 操作脚手架”为统一框架,系统梳理智能体通过参数更新与提示词、记忆、工具及控制逻辑演化实现持续能力提升的方法、评测与风险。

 智能体 自进化 智能体脚手架 持续学习 信用分配 演化评估 自我改进

现代智能体被形式化为基础模型与操作脚手架的组合,自我改进是利用执行轨迹、评价反馈或环境经验,对系统配置进行可持续更新。参数级改进可将能力固化到模型权重中,但训练成本高,并面临错误放大、模型坍缩和灾难性遗忘等风险。脚手架改进无需改变模型权重,可快速优化 prompt、memory、tool 及完整控制逻辑,具有成本低、易回滚和任务适配快的特点。可靠的自我改进需要解决信用分配、反馈验证、资源约束、开放世界适应和安全审计问题,并通过学习曲线、消融、分布外泛化及失败模式进行综合评测。

用途与启示
  • 为自我改进智能体研究提供“模型慢循环、脚手架快循环”的统一分类框架。
  • 指导系统根据失败归因选择更新提示词、记忆、工具、控制逻辑或模型参数。
  • 强调以测试、外部锚点、版本管理和回滚机制约束自动演化,避免错误累积与奖励投机。
  • 为持续学习型 Agent 的评测设计提供参考,应同时考察增益来源、泛化能力、成本和安全性。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/49PhPHlhxdZbqLxiYdQWbQ?scene=1

AI4AI:AI训练、优化与评测AI的新范式

文章系统介绍AI主导数据合成、训练对齐与自动评测的AI4AI闭环,并分析合成退化、奖励作弊和策略坍缩等风险及其治理方案。

 自进化 数据合成 自博弈 奖励建模 评估智能体 自动化科学研究 人在回路 闭环评估

AI4AI旨在让高阶模型或模型自身参与下一代AI的完整生命周期,以突破人类数据枯竭、监督能力不足及标注成本过高等瓶颈。其体系分为AI-for-Data、AI-for-Training和AI-for-Eval三个维度,分别承担合成数据生成与过滤、RLAIF或自对弈训练、智能体自动评测与诊断。典型闭环从少量人工种子出发,经受控变异、拒绝采样和编译器、Python或Z3等硬验证生成训练材料,再把评测发现的错误回流至数据阶段。纯AI闭环可能出现合成数据分布收缩、奖励篡改和自对弈模式坍缩,需要真实数据锚点、物理沙箱、裁判轮换、多样性惩罚及历史策略池加以约束。人类角色由逐条标注者转向种子设计者和系统审查官,形成Human-Guided AI4AI架构。

用途与启示
  • 可用于设计覆盖数据生成、模型训练、自动评测和错误回流的模型自进化流水线。
  • 在数学与代码任务中优先引入编译器、解释器或约束求解器,降低AI裁判被欺骗的风险。
  • 合成训练数据应持续混入真实世界数据,并监测多样性与分布收缩,避免递归训练退化。
  • 将人工投入集中到种子质量、规范制定、异常审计和高风险决策,而非大规模重复标注。
  • 自动评测系统应采用多裁判轮换、沙箱否决和历史策略回放,抑制奖励作弊与局部最优。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/IAEMrU8MP3Cx0iERWf_Q0A?scene=1

磐石上线“创新评价”AI评审智能体

中科闻歌基于磐石科学基础大模型推出“创新评价”智能体,依托大规模科研数据、专家评价标准和多智能体流程,为项目书与论文提供提交前预评审。

 科研智能体 同行评审分析 多智能体系统 专家反馈 证据推理 人在回路 数据安全 创新评估 科研预评估

磐石“创新评价”智能体接入3200万个科研项目、70万份产业研发年报以及2.7亿篇论文和专利,可检索全球相近研究并形成证据链。系统针对科研项目评估战略价值、前沿性、创新潜力、方案可行性和资源配置,针对论文覆盖贡献、新颖性、严谨性、研究价值、表达质量与可复现性。平台将资深专家的检索方法、评价维度和判断逻辑转化为标准化流程,并通过多个智能体协作完成数据检索、领域理解、趋势分析和创新研判。目前尚缺少大规模实测结果,其专家意见一致率、建议采纳率、前沿突破识别能力及未公开科研材料的数据安全仍待验证。

用途与启示
  • 将正式评审反馈前置到项目申报和论文投稿之前,帮助研究者尽早补充证据、调整技术路线和完善实验。
  • 展示了“专业数据池+专家标准+证据链+多智能体编排”的垂直科研智能体产品路径。
  • 可用于筛查重复研究、识别论证缺口,并生成针对不同基金类别或学术会议的可执行修改建议。
  • 实际部署应保留人类专家最终决策,并重点评估突破性研究误判、数据留存、知识产权保护和私有化部署能力。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/rYAIhKxmTR8JDKCAy0DLCg

NeurIPS、AAAI 失利后的 2027 顶会转投时间表

文章梳理 NeurIPS 2026、AAAI 2027 结果公布后转投 ICLR、WWW、CVPR、ACL、ICML 与 KDD 2027 的可行窗口及关键限制。

 投稿策略 人工智能 会议日程管理

NeurIPS 2026 最终结果与 AAAI 2027 第一阶段结果均于 9 月 24 日公布,而 ICLR 2027 次日即截止全文,转投者须在 9 月 18 日前注册真实摘要。转投 WWW 2027 的时间相对充足,结果公布后距摘要和全文截止分别约有 17 天和 24 天。AAAI 第二阶段评审或 ICLR 出分后,可视情况撤稿并转投 CVPR、ACL、ICML;其中 CVPR 窗口最紧。AAAI 或 ICLR 最终拒稿后通常仍可转投 ACL、ICML 和 KDD 2027 第二轮,但已基本错过 CVPR。所有路线均须遵守双投政策,尚未确定的会议日期应以官网最终公告为准。

用途与启示
  • 为 NeurIPS、AAAI 和 ICLR 投稿者制定拒稿后的备选会议与修改计划。
  • 提醒计划转投 ICLR 的作者提前注册有效摘要,避免因等待录用结果错过资格。
  • 根据转投窗口预留论文改写、格式调整和补充实验时间。
  • 转投前应完成撤稿并核对各会议双投、作者变更及摘要注册政策。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/J95arq1Gl_2ptGY-hkGbZg

智能体技能为何有效,又为何失效

研究通过受控实验与轨迹分析发现,智能体技能主要通过程序锚定稳定执行,而非注入知识,但会受检索瓶颈、脆弱假设和上下文不兼容影响。

 智能体 智能体技能库 技能归因 经验检索 人工智能可靠性 程序锚定 技能检索 技能失效

研究跨多个基准、智能体框架和大模型,分析技能表示、结果标注、检索难度及跨框架鲁棒性,并归一化了 8,135 条试验记录。对 240 条开放编码记录的配对轨迹分析归纳出三大类、十二种技能使用模式,发现 65.7% 的案例属于“程序锚定”,显式知识注入仅占 4.5%。在匹配比较中,技能比 Workflow Memory 提高 6.06 个百分点,说明其主要作用是将噪声轨迹转化为稳定的执行流程。检索成为独立瓶颈:技能池从 5 个扩大到 100 个时,实际使用精度由 29.6% 降至 3.3%,但精确调用标准答案技能既非成功的充分条件,也非必要条件。技能通常在依赖脆弱假设、遭遇不兼容上下文或缺乏适应能力时失效。

用途与启示
  • 将智能体技能评测从总体任务成功率扩展到技能何时生效、作用机制及失效边界。
  • 设计技能系统时应优先提炼可执行程序与稳定动作序列,而不是仅封装事实知识。
  • 大规模技能库需要改进检索、去混淆和路由机制,避免技能池扩张导致实际使用精度骤降。
  • 自进化智能体应检测上下文兼容性与隐含假设,并允许技能在调用后动态适配,而非机械复用。
📝 原始笔记(逐字保留)
[揭秘智能体技能:它们为何有效——直到失效为止(137 ▲)](https://huggingface.co/papers/2608.14036?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-19)

Agentic ESOpt:低显存微调长时程 LLM 智能体

Agentic ESOpt 以演化策略替代反向传播式强化学习,通过轨迹级黑箱反馈和参数—上下文协同演化,以推理级显存完成大模型全参数智能体微调。

 智能体 长程任务 后训练 黑箱训练 协同演化 信用分配 成本优化 进化策略 参数协同演化 长程微调

Agentic ESOpt 面向分支多、奖励稀疏的长时程智能体任务,避免 Agentic RL 在显存开销和跨长轨迹信用分配上的瓶颈。框架围绕当前 LLM 参数采样扰动,根据完整轨迹奖励执行在线加权更新,并以余弦衰减逐步缩小扰动尺度,平衡探索与适应。其黑箱反馈接口可与技能优化、测试时计算等提示空间演化方法组合,实现参数与上下文协同演化。在 WebArena-Lite 上,全参数优化 Qwen-3.5-27B 相比无技能基线提升 6.69%;在测试时自动启发式设计中,36 组设置里有 28 组超过对应基线。

用途与启示
  • 为长时程、稀疏奖励智能体提供无需反向传播的全参数微调路径,显著降低 GPU 显存门槛。
  • 通过轨迹级参数归因绕开逐步奖励分解,可缓解长轨迹强化学习中的信用分配难题。
  • 黑箱优化接口便于将模型参数更新与提示、技能及测试时计算联合演化。
  • 适合探索大模型智能体的低成本在线适应,以及参数空间与上下文空间协同优化。
📝 原始笔记(逐字保留)
[Agentic ESOpt:以最低 GPU 要求微调长时程 LLM 智能体(91 ▲)](https://huggingface.co/papers/2608.17310?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-19)

Spellcaster:15分钟生成并验证可玩游戏

国产平台 Spellcaster 通过六类专用 Agent 将游戏设计、生成、模拟试玩与定向修复组成闭环,可在约15分钟内产出可交互的游戏版本。

 游戏生成 多智能体系统 可玩性 可玩性评估 自动化设计 世界模型

Spellcaster 不直接从自然语言生成代码,而是先构建包含玩法、角色能力、关卡目标、胜负条件和敌人行为的结构化游戏设计中间层。平台由规则设计、关卡生成、素材调度、可玩性验证、模拟测试和问题修复六类 Agent 协同工作,重点检查关键路径、必死局与难度曲线。Repair Agent 会定位规则冲突、数值失衡、关卡不可达或代码实现等不同层次的问题,并进行定向修复,使评价目标从“能运行”转向“能玩”。团队未来计划引入世界模型直接预测玩家操作后的画面与反馈,逐步绕过传统代码及游戏引擎渲染管线。

用途与启示
  • 为自然语言游戏生成提供“设计中间层—实现—试玩—诊断—修复”的闭环范式。
  • 说明多智能体分工可以弥补通用 LLM 难以原生感知和试玩其生成内容的不足。
  • 可将可玩性、路径可达性和难度曲线纳入自动化评测,而不只检查代码是否运行。
  • 展示世界模型从辅助游戏开发走向实时生成交互世界的潜在工程路径。
📝 原始笔记(逐字保留)
LogicEvolve|Karpathy头疼的“AI游戏困境”,被这款15分钟出包的国产神器破解了https://mp.weixin.qq.com/s/Uh58vRDDfajZjdsw8_pDIA

MCTS-KBQA:基于信息增益奖励的知识库问答

该研究将蒙特卡洛树搜索引入知识库问答,并利用信息增益奖励引导推理路径探索。

 知识图谱 开放式搜索 推理 树搜索 知识问答 信息增益

研究提出 MCTS-KBQA,将蒙特卡洛树搜索用于知识库问答中的推理路径探索。方法以信息增益构造奖励信号,使搜索更倾向于选择能够缩小答案空间、补充有效证据的路径。该思路旨在改善复杂问题下知识图谱多跳推理的搜索效率与答案质量。链接页面未提供论文地址、代码或实验细节。

用途与启示
  • 为知识图谱多跳问答提供基于搜索的推理框架。
  • 展示信息增益奖励在引导推理路径探索方面的潜力。
  • 可启发将 MCTS 与检索增强、智能体规划及证据选择机制结合。
📝 原始笔记(逐字保留)
有趣研究|《MCTS-KBQA: Monte Carlo Tree Search with Information GainRewardsforKnowledge Base Question Answering》https://h5.lingowhale.com/s/Jc3hzaS

智谱唐杰:大模型只看参数的时代结束了

唐杰认为大模型竞争已从单纯扩张参数量,转向综合权衡数据、训练算力、激活参数、推理成本及长程任务能力。

 计算规模扩展 模型训练 推理 混合专家模型 长程任务 人工智能 缩放定律 参数高效微调 生命周期管理

早期 Kaplan Scaling Law 强调参数规模增长,而 Chinchilla Scaling Law 表明固定算力下需要重新平衡参数量与训练数据,单看参数已难以判断模型能力。MoE 模型还需区分总参数量与激活参数量:前者影响知识容量,后者更直接关联单次推理深度和成本。随着模型被高频、长期调用,推理成本、部署成本和全生命周期效率也成为 Scaling 的关键变量。智谱在 GLM-5.3 中保留 GLM-5.2 的基础架构与参数规模,将新增算力投入长程任务环境和强化学习,在 Terminal-Bench 3.0、DeepSWE、Agents’ Last Exam 等评测上取得明显提升。

用途与启示
  • 评估大模型时不应只比较总参数量,还应同时考察激活参数、训练数据、预训练算力、推理成本和任务完成能力。
  • 固定资源下,数据与参数的配比、训练与推理的算力分配,可能比继续扩大模型规模更重要。
  • 对智能体和软件工程等长程任务,应将后训练算力重点投入真实任务环境、强化学习和持续执行能力。
  • 模型选型可引入全生命周期成本指标,避免以参数规模替代实际效果与部署效率。
📝 原始笔记(逐字保留)
有趣研究|智谱唐杰:大模型只看参数的时代,结束了https://mp.weixin.qq.com/s/s9JyVXHDmTQnj2vF6vJ6tA

ASI-Bench:评测 AI 自主科研与创新探索能力

ASI-Bench 通过跨领域项目级任务与四级信息梯度评测 AI 的创新探索和自主科研能力,结果表明当前系统仍高度依赖人类提供研究方法,主要瓶颈在科学决策而非数值执行。

 科学研究基准 自动化科学研究 科学智能 开放式任务 模型评估 超级智能评估 创新评估 智能体评估 信息梯度

ASI-Bench 联合评估创新探索与自主科学执行能力,包含数学、物理、化学、生物、医学、计算机和机器人等 11 个领域的 60 项项目级研究任务。基准设置 B1 至 B4 四级信息梯度,从提供完整方法与步骤,逐步过渡到仅给研究目标、原始数据和约束,并加入正确但无关的干扰信息,以检验 AI 能否自主选择方法、执行研究并产出可验证结果。任务由 40 余名专家投入超过 3.1 万小时构建,并经过专家审查、AI 辅助审计、沙箱执行和评分器验证;在 18 种智能体—模型配置上,平均得分从完整方法指导下的 50.91 降至仅指定方法时的 29.10,并在完全自主确定方法时进一步降至 26.62。失败分析显示,62% 的问题集中于科学建模、方法选择和鲁棒性判断等科学决策环节,说明当前 AI 更擅长执行既定方法,尚不具备可靠的端到端自主科研能力。

用途与启示
  • 为基础模型、推理模型及 AI Scientist 系统提供跨学科、项目级且尚未饱和的科学自主性评测标尺。
  • 通过分层撤除人类指导,区分方法实现、方法选择、实验执行与开放式创新能力,并量化系统对科研脚手架的依赖。
  • 支持在相同任务上比较不同模型、Agent Harness 和工具链架构,定位科学决策与鲁棒性等关键瓶颈。
  • 将沙箱执行、可验证结果和评分器验证纳入评测,为自动科研系统的训练、迭代及社区任务共建提供可复现基础设施。
📝 原始笔记(逐字保留)
[ASI-Bench:在人工超级智能的黎明时分(51 ▲)](https://huggingface.co/papers/2608.17271?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-19) [合并自 2026-08-27 asi-bench-ai] EvalEvolve|AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺https://mp.weixin.qq.com/s/-zwyUrNrHJ6rrNxOWw0oyQ

Embodied-Navigator:定位、思考、记忆与对齐的高效具身导航

TAMP-Nav 通过像素到三维动作映射、选择性推理与锚点轨迹记忆,以及结合结果和过程奖励的两级对齐,实现高效且高性能的具身导航。

 具身智能 空间智能 智能体记忆 任务规划 强化学习 轨迹控制 具身导航 像素级动作 锚点记忆

论文提出统一具身导航框架 TAMP-Nav,让视觉语言模型选择二维图像像素,再将其投影为三维坐标并交由底层 SLAM 控制器执行,从而使动作空间与 VLM 的二维视觉先验保持一致。框架按需触发思维链推理,仅在关键节点保存高保真锚点记忆,并将冗余轨迹压缩为空间—时间指示信息。训练阶段采用基于 GRPO 的两级对齐机制,将全局任务结果奖励与细粒度过程奖励结合,使认知规划更贴合物理环境反馈。实验中,该方法仅使用 9 万条训练轨迹便在 R2R-CE 上取得 66.2% 的成功率,并表现出较高的运行和样本效率。

用途与启示
  • 将 VLM 的二维指点能力转换为可执行的三维导航目标,可减少预训练视觉先验与机器人动作空间之间的错配。
  • 选择性推理可避免每一步都运行思维链,适合对延迟和算力敏感的具身系统。
  • 锚点轨迹记忆为长程导航提供了一种保留关键历史、压缩冗余观测的记忆设计。
  • 结果奖励与过程奖励联合优化,可用于提升导航规划和真实环境反馈之间的对齐程度。
📝 原始笔记(逐字保留)
[具身导航器:通过定位、思考、记忆与对齐实现高效导航(44 ▲)](https://huggingface.co/papers/2608.17512?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-19)

SPADE:自适应可执行环境中的自博弈

SPADE 让同一 LLM 分别扮演环境设计者与推理智能体,通过生成可执行的长程环境并围绕能力边界开展自博弈强化学习,实现开放式持续改进。

 自博弈 强化学习 环境演化 任务生成 自我改进 开放式演化 环境设计 智能体 遗憾最小化

SPADE 将环境设计纳入学习过程,由环境设计者生成带有 reset()/step() 接口、状态转移、奖励函数和验证代码的完整可执行环境,推理智能体则在其中学习行动。框架以智能体获得特权提示前后的奖励差估计遗憾,据此生成位于其能力边缘且仍可完成的任务。实验表明,利用大规模预训练语料文档约束环境生成,并为设计者维护累积环境记忆,是提升训练效果的关键。扩展至 30B 参数模型后,SPADE 在八项数学、科学、代码和推理基准上平均领先最强固定环境基线 5.3 分,并在 BFCL-v4 多轮工具调用和 ACEBench-Agent 上分别提升 5.7 分与 13.9 分。

用途与启示
  • 将任务与训练环境本身设为可学习对象,减少人工整理或静态合成环境导致的目标分布固化,并持续生成难度自适应的新目标。
  • 通过特权提示前后的奖励差刻画遗憾,自动定位能力边界,减少任务过易或不可解的问题。
  • 以统一的可执行环境接口承载推理题、长程任务、游戏和多步工具调用,为通用自博弈智能体训练提供基础。
  • 环境记忆与文档接地的有效性表明,开放式自我改进既依赖环境多样性,也需要知识约束、可验证性与历史经验复用。
📝 原始笔记(逐字保留)
标题:SPADE: Self-Play in Adaptive Synthetic Executable Environments 来源:arXiv 链接:https://arxiv.org/abs/2608.19197 摘要:Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) keep the goal distribution fixed as the learner scales. We introduce SPADE (Self-Play in Adaptive Synthetic Executable Environments), a self-play RL framework in which a single LLM plays two roles: an Environment Designer that writes complete, long-horizon training environments as executable code with an OpenAI Gym-style reset()/step() interface, and a Reasoning Agent that learns to act in them. Each is a stateful, multi-turn environment (state transitions, reward functions, and verification code), so one interface spans reasoning problems and multi-step agentic tool use. T [合并自 2026-08-21 spade] [SPADE:在自适应合成可执行环境中的自博弈(42 ▲)](https://huggingface.co/papers/2608.19197?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-20)

单个预训练样本的影响:学会后又遗忘

通过24组严格配对的反事实预训练实验,研究发现单个样本可被模型短暂学会并显著改变权重位置,但其可检测的内容记忆最终消退,且模型仍停留在同一损失盆地内。

 数据归因 反事实实验 训练轨迹 参数轨迹 单例效应 学习衰减

研究者从头训练32个124M参数的GPT-2模型,在4种条件和8个随机种子下直接测量单个训练样本的因果贡献。训练第200步时,他们将256行批次中的一行替换为194 token的固定文本,分别测试真实主题文本、梯度匹配的虚构主题文本、随机键盘字符及未注入对照。一次暴露后,模型在50步内对注入文本的交叉熵显著降低,但训练结束时两种流畅文本的优势均不再可检测。尽管注入造成的权重位移达到种子间欧氏距离的44.1%,损失屏障仅达到种子间差异的3.0%,CKA和留出集损失也未显示稳定分离,说明样本主要是在同一损失盆地内重新定位模型。

用途与启示
  • 为训练数据归因方法提供少见的实测反事实基线,可用于检验基于梯度、影响函数或近似遗忘指标的准确性。
  • 表明短期可观测的单样本学习不等于最终模型中的持久记忆,数据影响评估应覆盖完整训练周期。
  • 权重距离可能显著放大样本影响,而函数表现和损失几何变化很小,因此不能仅凭参数位移判断记忆或行为改变。
  • 实验设计可扩展到隐私泄露、数据删除和机器遗忘研究,用于区分内容记忆消退与参数轨迹残留。
📝 原始笔记(逐字保留)
标题:Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training 来源:arXiv 链接:https://arxiv.org/abs/2608.19168 摘要:A single training example's contribution to a finished model is normally estimated rather than measured, because measuring it takes two expensive full pre-training runs that differ in one row of one batch. We ran that counterfactual 24 times at a small scale. We trained 32 GPT-2 models at 124M parameters from scratch on OpenWebText, over four conditions and eight seeds. At step 200 of 9,536, at peak learning rate, we replaced one row of a 256-row batch with a fixed context injection carrying a 194-token passage. The three injected conditions are: 1. fluent prose with a corpus-attested subject, 2. fluent prose with a fabricated subject matched to it within 0.14% on full-batch gradient delta, and 3. random keyboard characters. The fourth condition is an uninjected twin. The passage is learne

调校随机机器:人机工程的系统运维模型

论文将专家纠正无法跨会话持续生效的问题重新定义为运维治理缺失,并提出以错误闭环为核心的七原则人机工程体系。

 专家反馈 持续学习 闭环治理 版本契约 事件溯源 过程验证 纠错治理 规则退役 复发监测

作者把 LLM 技术栈类比为传统计算机系统中的固定硅片、固件、可加载模块、持久配置与易失内存,以定位专家纠正应被保存的位置。该类比的关键失效点在于生成具有随机性、配置只能以概率方式约束行为,且系统默认缺少通用的规则退役与验证阶段。论文据此提出一套以错误闭环为核心的七原则运维纪律,涵盖带来源的版本管理、错误复发监测、反向指标以及过时规则退役。三个实践案例展示了治理缺失的风险,其中一项控制措施在长期运行后悄然演变为其原本试图阻止的危害,并由此引出相应的测量框架与待验证实验。

用途与启示
  • 将一次性专家纠错转化为可追踪、可复用并可持续验证的系统资产。
  • 为 LLM 助手的持久配置建立版本、来源、监测和退役机制,避免规则长期累积后产生副作用。
  • 提醒工程团队同时设置目标指标与反向指标,以发现控制措施是否正在制造新的伤害。
  • 可作为人机协作系统、智能体脚手架及持续改进平台的运维治理蓝图。
📝 原始笔记(逐字保留)
标题:Tuning the Stochastic Machine: A Systems Engineer's Operating Model for Human-AI Engineering 来源:arXiv 链接:https://arxiv.org/abs/2608.19125 摘要:When an expert corrects an LLM assistant's error, the correction usually dies with the session, and the error class returns. I argue this is an operations problem, not a tooling problem: mechanisms for persisting corrections exist and are shipping, but the discipline for governing them -- versioning with provenance, recurrence monitoring, counter-metrics, retirement of stale rules -- does not. Writing as a systems engineer of thirty years, I map the LLM stack onto the machines my profession already operates (frozen silicon, firmware, loadable modules, persistent configuration, volatile memory), identify where the mapping fails (stochastic generation, configuration that binds only probabilistically, no general-purpose retirement (verification) stage by default), and derive from the failures

AI 后训练缺少什么:智能体策略重估能力的实证分析

实证研究发现,LLM 智能体虽能端到端执行后训练流程,却会过早锁定初始训练策略,缺乏依据实验反馈主动重估高层策略的机制。

 后训练 智能体 策略优化 执行反馈 自我改进 策略重估 策略固化

研究将 AI 后训练能力区分为执行层能力与策略层能力:前者是在既定训练方案内迭代,后者是根据实验结果重新判断并修正训练方向。对大量公开后训练轨迹的分析表明,智能体通常在流程开始时便锁定策略,随后将预算主要用于局部参数、实现或流程调整。经验驱动脚手架可显著提升执行表现,在 GSM8K 和 HumanEval 上分别提高 12.6 和 40.8 分,但未能促使策略变化;人工指导虽能改变初始方向,却无法阻止智能体在训练中重新陷入局部调整循环。增加推理算力只对较简单任务有效,在最困难任务上几乎没有收益,说明核心缺口是执行期间依据新证据自主重估策略的机制。

用途与启示
  • 评估自主后训练系统时,应区分执行优化能力与策略重估能力,并将“是否依据新证据改变训练路线”纳入 AI-for-AI 和自我改进系统的核心指标。
  • 可在训练闭环中引入策略级反馈、变点检测、反事实实验、备选假设维护、主动回滚与策略级停止条件,促使智能体重新审视高层方案。
  • 可用于设计衡量 AI-for-AI 自主研发能力的长程后训练基准与轨迹分析指标,避免仅以最终性能掩盖策略僵化。
  • 表明增加经验库、人工提示或推理预算并不必然解决策略固化问题,研究重点应转向训中反思与闭环元决策机制。
📝 原始笔记(逐字保留)
标题:What is Missing from AI Post-Training AI: An Empirical Analysis 来源:arXiv 链接:https://arxiv.org/abs/2608.19072 摘要:Large language model (LLM) agents can now post-train an LLM end-to-end. They can write code, launch training, evaluate checkpoints, and improve downstream performance, raising the prospect of AI-for-AI. We argue that this picture conflates two distinct capabilities: execution-level capability, iterating within a selected training strategy; and strategy-level capability, revising the high-level judgment as experimental evidence accumulates. Analyzing a large corpus of publicly released post-training trajectories, we find that across different tasks, the agent's training strategy is locked in at the very beginning, and the entire remaining budget is spent on local adjustments within the selected strategy. We then examine three natural explanations--missing experience, missing guidance, and i [合并自 2026-08-21 item-23] EvolveLRM|《WHAT IS MISSING FROM AI POST-TRAININNG AI:AN EMPIRICAL ANALYSIS》 https://h5.lingowhale.com/s/Sjwo4Dj https://arxiv.org/abs/2608.19072

多智能体离策略深度强化学习优化智慧校园覆盖

研究将非凸校园环境中的毫米波基站部署建模为 MDP,并表明多智能体 DDPG 在高密度用户场景下能够兼顾覆盖、公平性与计算收敛效率。

 多智能体系统 强化学习 资源调度 任务规划 基站部署 无线网络覆盖 毫米波通信

论文研究真实非凸校园拓扑中的毫米波基站最优部署,以最大最小公平性为目标,该问题具有 NP-hard、非凸和非光滑等特征。作者将基站放置建模为马尔可夫决策过程,系统比较单智能体 DQN、空间分区多智能体 DQN、单智能体 DDPG及地理分区多智能体 DDPG。数值实验显示,多智能体 DDPG 在高密度场景中显著优于单智能体方案,并实现完全覆盖和 0.94 的 Jain 公平指数。该方法在包含 400 名用户的密集场景中也表现出较高的计算收敛效率。

用途与启示
  • 为复杂非凸无线网络部署问题提供基于深度强化学习的实时优化方案。
  • 展示按地理区域拆分决策空间可提升多智能体系统在密集场景中的可扩展性与收敛效率。
  • 为智慧校园、园区网络及毫米波基础设施规划中的覆盖与公平性权衡提供参考。
📝 原始笔记(逐字保留)
标题:Multi-Agent Off-Policy Deep Reinforcement Learning for Smart Campus Coverage 来源:arXiv 链接:https://arxiv.org/abs/2608.19049 摘要:Deep reinforcement learning (DRL) has recently gained a great attention due to its real-time adaptation and effectiveness in complex optimization problems. This paper investigates the optimal deployment of millimeter-wave (mmWave) base stations (BSs) in a realistic, non-convex campus topology. The optimization problem is NP-hard, due to the non-convex, non-smooth nature of the max-min fairness objective. To overcome these constraints, we formulate the BS placement as a Markov Decision Process (MDP) and systematically benchmark four DRL schemes: a discrete single-agent Deep Q-Network (DQN), a spatially partitioned Multi-Agent DQN, a continuous single-agent Deep Deterministic Policy Gradient (DDPG), and a geographically partitioned multi-agent DDPG framework. Numerical evaluations reveal tha

Eureka:面向科学发现的任务条件元代理编排

Eureka 将长程科研任务编译为带明确验收语义的动态义务图,并按任务认知结构动态组建、验证和演化宏代理架构。

 智能体编排 科学发现 自动化科学研究 长程任务 任务规划 形式化验证 架构演化 义务图谱 宏智能体 验收语义

Eureka 是一种任务条件 Meta-Agent 架构,将长程任务编译为动态义务图,并为各项义务设置明确的验收语义。系统通过滚动时域规划、架构提升和最小充分编译,动态形成具有专用状态、记忆、算子、工具、验证器及局部拓扑的 Macro-Agent。面对反复出现的瓶颈,它会在约束下依据成本收益门控机制演化局部架构,并从遗憾、规划失效、摊销、子树接口、可串行化及验证等方面给出理论结果。实验中,Eureka 完成全部 170 个递归任务,生成 3,948 份证书且无错误验收;同时将活跃上下文的中位输入由 9,490 压缩至 4,005 tokens,并在 12,000 个任务上避免 65.38% 的重复计算。该元代理还被实例化为理论发现与数学猜想代理,产出量子过程、时空理论及黎曼猜想相关的研究进展。

用途与启示
  • 为长程科研代理提供一种从任务结构出发动态编译代理架构的方法,而非依赖固定工作流。
  • 通过显式义务、验收语义和验证证书降低科研代理错误接受中间结论的风险。
  • 利用活跃上下文压缩与增量处理减少上下文开销和重复计算,适合大规模并发科研任务。
  • 表明科学智能体能力不仅取决于基础模型,还取决于代理架构能否匹配任务的认知与验证结构。
📝 原始笔记(逐字保留)
标题:Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery 来源:arXiv 链接:https://arxiv.org/abs/2608.19047 摘要:We present Eureka, a task-conditioned Meta-Agent architecture that compiles long-horizon tasks into dynamic obligation graphs with explicit acceptance semantics. During execution, Eureka forms Macro-Agents with specialized state, memory, operators, tools, verifiers, and local topology via receding-horizon planning, architecture promotion, and minimal-sufficient compilation. When bottlenecks recur, cost-benefit-gated evolution updates the local architecture under constraints. Theoretically, we establish results on regret, planning invalidation, amortization, subtree interfaces, serializability, and verification. Experimentally, Eureka completes 170/170 recursive tasks and generates 3,948 certificates with no false acceptances. Active context compresses median input from 9,490 to 4,005 token

自适应记忆与反思的医疗问答多智能体系统

AMR-Agent通过专属记忆、反思反馈、复杂度路由与伦理审查,提升多智能体医疗问答的准确性、适应性和可信度。

 医疗人工智能 多智能体系统 智能体记忆 经验检索 人在回路 自我反思 人工智能伦理治理

AMR-Agent是一个面向医疗问答的自适应记忆与反思多智能体框架,各专业代理拥有独立记忆,并可检索相关历史病例辅助推理。系统先评估问题复杂度,再将任务路由至单代理、协作或升级处理流程。共识模块负责整合多个代理的推理结果,伦理监督模块则对最终输出进行审查。MedQA与MedMCQA上的实验显示其优于多种基线,消融实验表明代理专属记忆、反思和外部检索的组合效果最佳。

用途与启示
  • 为复杂医疗问答提供按难度动态分配推理资源的多智能体架构。
  • 展示持久记忆与反思反馈如何复用历史病例经验并改善后续决策。
  • 可借鉴共识整合和伦理监督模块,增强高风险领域智能体输出的可靠性与责任性。
  • 为研究记忆、外部检索和多智能体协作之间的互补作用提供实验依据。
📝 原始笔记(逐字保留)
标题:Adaptive Memory and Reflection Multi-Agent System for Medical Question Answering 来源:arXiv 链接:https://arxiv.org/abs/2608.19029 摘要:Accurate and responsible medical question answering (QA) is important in healthcare, where complex cases require factual knowledge and nuanced reasoning. Existing medical QA systems, typically based on single-agent architectures and static retrieval, often lack adaptability, persistent memory, and structured decision-making. This work introduces an adaptive memory and reflection (AMR) agentic system, a multi-agent framework in which specialized agents use dedicated memory and reflection-based feedback to retrieve relevant prior cases and improve subsequent reasoning. Complexity assessment routes questions through solo, collaborative, or escalated workflows, while consensus and ethical overseer modules support reasoning consolidation and output review. Evaluation on MedQA and MedMCQA demons

Harness 持续学习:超越模型参数的持续适应

论文提出 Harness Continual Learning(HCL),将持续学习从模型参数扩展到冻结基础模型之外的提示、记忆、工具、技能、工作流与路由,并通过受控的提议—评估—提交闭环积累能力、抑制脚手架级遗忘。

 持续学习 智能体脚手架 智能体 智能体记忆 智能体工具 模型路由 灾难性遗忘 脚手架遗忘 智能体脚手架演化 能力迁移 闭环评估 安全护栏演化 外参学习

论文将持续学习对象扩展到模型外部的执行脚手架,并把更新导致既有可靠行为退化的现象定义为“脚手架级遗忘”(Harness-level Forgetting)。HCL 将 Harness 分解为任务接口(Task Interface)、经验记忆(Experience Memory)、能力地图(Capability Map)和自适应路由器(Adaptive Router),基础模型参数保持冻结。其 Guarded Harness Evolution 机制将候选更新生成与状态提交分离,只有在持续评估确认当前任务改善、历史锚点行为保留,并满足工具调用及环境动作等有效性要求后才提交更新。ALFWorld、Minecraft、文本推理和多模态感知等实验表明,HCL 能够积累能力并从失败中恢复,在多个场景中相对基线提升超过 10%;历史损失容忍度可显式调节稳定性与可塑性的权衡,更新越自由并不必然带来更好的长期表现。

用途与启示
  • 为冻结模型提供无需参数微调的持续适应框架,将提示、记忆、技能、工具、工作流和路由统一视为可演化状态。
  • 提醒智能体系统除模型层遗忘外,还需量化 Harness 更新对历史任务锚点与既有可靠行为的破坏。
  • 可借鉴“生成候选更新—回归评估—验证后提交”的部署门禁,隔离候选状态与线上状态,并支持版本管理和安全回滚。
  • 为 HarnessEvolve 研究提供组件化架构、遗忘度量及稳定性—可塑性调节范式,辅助选择兼顾当前收益与长期能力保持的演化轨迹。
📝 原始笔记(逐字保留)
标题:Harness Continual Learning: Continual Adaptation Beyond Model Parameters 来源:arXiv 链接:https://arxiv.org/abs/2608.19013 摘要:Continual learning has largely been model-centric, treating model parameters as the state that changes with sequential experience. Modern agents can also adapt through a harness of prompts, memories, tools, skills, and routing rules. Because these contents jointly shape later execution, a harness update can disrupt previously reliable behavior even when the model is frozen. This raises a new question: how can an agent continually improve its state outside the model while retaining behavior acquired earlier? We formulate Harness Continual Learning (HCL), a new continual learning paradigm in which the harness evolves around a frozen foundation model, and define the resulting loss of earlier behavior as harness-level forgetting. We instantiate HCL with four execution-facing components: the Ta [合并自 2026-08-29 harness-continual-learning-agent-harness] HarnessEvolve|Harness Continual Learning:持续学习,从模型参数走向Agent Harness https://mp.weixin.qq.com/s/69SPcWnQN8GKC_ctNG0ctw

给验证器打分:LLM 推理验证自治等级 L0–L5

论文提出验证自治等级 VAL,以验证规范的来源和结论保证为统一轴线,对 LLM 推理验证方案进行 L0–L5 分级,并揭示开放世界验证难以突破完备性瓶颈。

 形式化验证 过程验证 推理 模型评估 自主验证 完备性盲区

论文指出,现有研究中的“验证等级”混杂了验证粒度、概念抽象、风险层级、系统栈位置和真值来源等不同维度。作者提出 Verification Autonomy Levels(VAL),依据验证规范来自何处以及验证结论能保证什么,将方案划分为 L0–L5。VAL 从缺少确定性锚点的 L0 自我声明,经由只能保证正确性的 L2 客观真值验证,延伸至可判定系统中具备单属性或领域级完备性的 L3/L4,而不受限场景下的 L5 被认为不可实现。论文强调“完备性盲区”:替换或采样式验证器可以确认候选答案成立,却无法证明没有遗漏其他候选;因此事实核查、医疗诊断等开放世界任务通常最多达到 L2。作者通过符号数学、行为监控、医疗诊断和代码生成四个领域及 17 篇论文说明,VAL 与粒度、风险和系统层级等分类轴彼此正交。

用途与启示
  • 为不同 LLM 验证器提供统一、可比较的能力分级框架,减少“验证等级”概念混用。
  • 评测验证系统时应分别报告正确性与完备性,避免把局部步骤检查误称为完整证明。
  • 对开放世界任务,应明确其结论通常只能达到锚定正确性,而不能保证候选或错误已被穷尽。
  • 可用于设计推理评测、代码验证和医疗智能系统的能力边界声明与风险沟通规范。
📝 原始笔记(逐字保留)
标题:Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning 来源:arXiv 链接:https://arxiv.org/abs/2608.19009 摘要:Large language models (LLMs) are increasingly paired with verifiers (step checkers, self-consistency filters, tool-based fact checkers, formal proof assistants) that claim to detect the model's errors. Yet the verification literature uses the word "level" to mean at least five different things: verification granularity, concept abstraction, risk tier, system-stack layer, and the epistemic source of the ground truth. We propose Verification Autonomy Levels (VAL), a meta-standard classifying verification schemes along a single axis: where does the verification spec come from, and what does the verdict guarantee? VAL ranges from L0 (LLM self-declaration, no deterministic anchor) through L2 (objective ground truth, correctness only) to L3/L4 (decidable systems with single-property or domain-le

事后辩论裁判理论

论文构建事后辩论裁判理论,并表明计算论证语义可在保持与 LLM 裁判相近准确率的同时提供更可靠的形式保证。

 多智能体系统 事实核查 答案评判 人工智能可解释性 形式化验证 辩论评判模型 论证语义

论文面向由外部裁判事后决定结果的智能体辩论,提出一套通用的辩论判定理论。作者从可复现性、鲁棒性、有据性和可解释性等方面定义裁判方法应满足的形式性质。研究在主张核验任务中比较了 LLM-as-a-Judge 的多种变体与源自计算论证的形式语义方法。实验显示两类方法的准确率相近,但 LLM 裁判可能缺少后者所具备的形式保证,因此论证语义更适合作为原则化的辩论裁判机制。

用途与启示
  • 为多智能体辩论系统提供可检验的裁判设计准则,而非仅依赖最终准确率。
  • 可用于审计 LLM-as-a-Judge 在复现性、鲁棒性、有据性和解释性方面的缺陷。
  • 启示事实核查与高风险决策系统引入计算论证语义,以获得明确的形式保证。
  • 为融合 LLM 的语言理解能力与符号论证方法的可靠判定能力提供理论依据。
📝 原始笔记(逐字保留)
标题:A Theory of Post-hoc Debate Judgement 来源:arXiv 链接:https://arxiv.org/abs/2608.19002 摘要:Debates have recently emerged as a useful methodology for agentic AI to improve performance as well as to aid explainability and user engagement. For example, LLM-empowered agents may debate internally (with themselves) and/or externally (with other agents). In many settings where debates are used, debates' outcomes and resulting outputs are determined post-hoc by external judges, often LLMs. In this paper we develop and test a novel theory of debate judgement applicable to all settings where agents engage in debates by providing pros and cons for their opinions therein. Specifically, we identify a number of formal properties that debate judgement may be required to satisfy in general, as concerns reproducibility, robustness, groundedness and explainability. Then, we explore their satisfac

SkillForge:自蒸馏智能体学习项目知识以解决仓库问题

SkillForge通过合成并解决项目特定问题,将代码仓库知识蒸馏为实体关联的可复用技能,从而提升智能体处理真实软件问题的能力。

 人工智能辅助编程 软件缺陷修复 自蒸馏 技能生成 SWE 软件工程 智能体 代码仓库知识

SkillForge面向LLM智能体因缺乏项目特定知识而难以解决特定仓库问题的局限。框架从仓库自身出发,重新实现已被测试覆盖的核心功能,以主动合成项目特定问题。智能体解决这些合成问题后,将所得知识蒸馏为与仓库实体关联的可复用技能,供后续真实问题修复时检索使用。开源与闭源模型实验均表明,预先获取项目知识可持续提升下游问题解决表现。

用途与启示
  • 无需依赖历史问题及修复记录,即可从现有代码与测试中提炼项目知识。
  • 将高成本的逐问题在线探索转化为可提前执行、可复用的技能构建过程。
  • 可用于增强代码智能体在私有仓库、新项目及历史信号稀缺场景中的缺陷修复能力。
  • 启示软件工程智能体可围绕仓库实体组织技能索引,实现更精准的经验检索与迁移。
📝 原始笔记(逐字保留)
标题:SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution 来源:arXiv 链接:https://arxiv.org/abs/2608.18933 摘要:Large language model (LLM) based agents have demonstrated remarkable proficiency in automated software issue resolution, yet they often struggle to resolve issues in a specific repository because they lack project-specific knowledge. Existing self-evolving approaches acquire such knowledge from repository history or online repair trajectories, but they either depend on available historical issue-resolution signals or incur substantial per-issue test-time exploration cost. In this paper, we propose SkillForge, a self-distillation framework that proactively acquires project-specific knowledge from the repository itself. Instead of waiting for real issues to expose project-specific knowledge gaps, SkillForge synthesizes project-specific issues by re-implementing test-covered core functionalit

真实开放任务中的测试时扩展:瓶颈在利用而非探索

对五类测试时扩展方法的计算归一化评测表明,增加推理预算能持续产生更优候选,但奖励模型选择能力弱、树搜索多样性坍缩,使候选利用成为开放式生成的核心瓶颈。

 测试时计算 探索与利用 奖励建模 开放式任务 树搜索 推理预算 候选选择 开放式生成

研究在医疗、法律、金融、通用对话和创意写作五类开放式生成基准上,对五个测试时扩展(TTS)方法家族进行了计算归一化比较。统一分析框架将令牌预算的作用拆分为探索与利用:随着计算增加,候选池中的最佳答案在所有场景下均持续改善,说明探索并非主要问题。当前奖励模型与真实质量的相关性仅约为 ρ≈0.12,导致候选选择近乎随机,而树搜索还会通过多样性坍缩放大这一缺陷。迭代精炼仅在五个基准中的一个有效;跨候选综合的 Fusion 是唯一稳定优于单样本基线的方法,但也只恢复了约 40% 的潜在质量。

用途与启示
  • 将开放式任务的测试时扩展重点从“生成更多候选”转向“可靠识别和整合优质候选”。
  • 评测 TTS 方法时应分别报告候选池上界与最终输出质量,避免把探索收益误判为端到端收益。
  • 奖励模型需要针对难验证、主观性强的领域提升排序校准能力,单纯增加采样预算难以弥补弱选择器。
  • 相比容易造成多样性坍缩的树搜索,跨候选证据融合与答案综合可能是更有前景的扩展方向。
📝 原始笔记(逐字保留)
标题:Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck 来源:arXiv 链接:https://arxiv.org/abs/2608.18931 摘要:Test-time scaling (TTS) improves language model outputs by spending additional inference compute - generating multiple candidates, searching over partial sequences, or iteratively refining drafts. These techniques yield large gains on mathematics and code, but have been developed and stress-tested almost exclusively on tasks where verification is straightforward. We conduct the first compute-normalised comparison of five TTS families across five open-ended generation benchmarks spanning medicine, law, finance, general chat, and creative writing - grounded in a unified framework that decomposes the effectiveness of each method's token budget into exploration and exploitation. The answer depends on which side of that decomposition you examine. Scaling exploration works: the best candidate in

LSADA:学习状态感知的动态生成式数据增强

LSADA依据样本实时学习状态动态调整增强强度,并对类别相关与无关区域实施解耦生成,在小规模自然及医学图像分类数据集上显著优于现有动态生成式增强方法。

 数据合成 扩散模型 状态表征 医疗人工智能 数据增强 小样本学习

LSADA利用样本当前损失及损失下降率构建学习状态,并将其映射为样本级动态增强强度。方法采用解耦的数据增强与扩散融合策略,对类别相关区域施加强度可控的变换,同时为类别无关区域生成多样化内容。渐进式融合机制在提升图像多样性的同时,尽可能保留类别语义。在九个公开数据集上,LSADA相较现有SOTA动态GDA方法,在六个自然图像数据集上平均提升4.5%,在三个医学图像数据集上平均提升2.5%。

用途与启示
  • 为小规模图像分类提供由模型学习进度驱动的自适应数据增强方案。
  • 表明损失及其下降速度可作为确定样本级增强强度的有效反馈信号。
  • 通过区分类别相关与无关区域,缓解生成多样性和类别语义保持之间的冲突。
  • 可用于自然图像及医学影像等标注数据稀缺场景。
📝 原始笔记(逐字保留)
标题:Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets 来源:arXiv 链接:https://arxiv.org/abs/2608.18907 摘要:Small-scale image classification is often limited by the scarcity of training data. Generative data augmentation (GDA) based on pretrained generative models has emerged as an effective solution. However, existing methods rely on task-agnostic augmentation strategies that overlook downstream model needs. Although recent dynamic GDA methods incorporate model feedback to guide augmentation, they still struggle to reliably determine sample-specific augmentation strengths and adapt augmentation strategies to different image regions while balancing image diversity and class semantics. To address these issues, we propose learning-state-aware dynamic generative data augmentation (LSADA). Specifically, LSADA constructs a learning state for each sample based on its current loss and loss-decrease rat

EvoResearcher:免训练的推理时自我反思与成本约束早停

EvoResearcher通过生成、自我批评与修订循环,在冻结大模型上实现免训练的成本受限自验证,并以CONFIRMED信号提前终止多数样本。

 测试时计算 自我验证 停止策略 成本优化 推理 自我反思 推理预算 元奖励

EvoResearcher无需强化学习或梯度更新,通过提示机制让单个冻结LLM反复执行“生成—自我批评—修订”。流程在达到最大反思深度或模型返回CONFIRMED哨兵时停止,从而将自验证限制在明确的计算预算内。方法以正确性、效率、反思深度和工具调用多样性四类元奖励作为设计原则,并在BBH、GSM8K和MATH上进行验证。在干净BBH上,其准确率提升未超出95% Wilson置信区间,但能以相同准确率提前终止82%~88%的样本,平均每题约需2.1次生成。

用途与启示
  • 为无法承担GRPO等完整强化学习流水线的项目提供零训练成本的推理增强方案。
  • 可将CONFIRMED哨兵与最大反思深度结合,构建兼顾答案复核和计算预算的停止策略。
  • 实验提示自我反思的主要收益可能是成本受控的自验证,而非必然提高准确率,评测时应同时报告准确率、生成次数与早停比例。
  • 工具调用多样性目前仅在提示层面验证,环境级和多智能体扩展仍需进一步实验。
📝 原始笔记(逐字保留)
标题:Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models 来源:arXiv 链接:https://arxiv.org/abs/2608.18884 摘要:Reinforcement-learning training of reasoning LLMs (e.g., GRPO) is expensive and requires a controllable environment, committing every contribution to a full training pipeline. We present EvoResearcher, a training-free, inference-time protocol that adds cost-bounded self-reflection to a single frozen LLM backbone. The protocol iterates generate -> self-critique -> revise until a maximum depth D is reached or the critique returns the CONFIRMED sentinel, an implicit early stop that lets the backbone self-verify its answer under a strict compute budget. Four self-reflective meta-reward components (correctness, efficiency, reflection depth, tool-call diversity) act as design principles instantiated as prompt-level mechanisms, so their benefits accrue with zero gradient updates. We validate the

GEAR:表格基础模型的生成扩增与真实锚定两阶段蒸馏

GEAR通过“合成查询扩增—真实数据锚定”的两阶段蒸馏,将表格基础模型压缩为可在普通CPU上高效运行的MLP或树模型,同时保持较高预测性能。

 模型蒸馏 表格学习 数据合成 上下文学习 推理加速 端侧部署 查询扩展 现实世界锚定

GEAR面向表格基础模型依赖上下文推理所带来的高延迟与高内存成本,采用模块化两阶段框架训练轻量学生模型。第一阶段将合成协变量仅作为教师模型的查询位置,并利用教师软标签扩大训练覆盖范围;第二阶段结合真实标签和折外教师预测,将学生模型重新锚定到目标数据分布并避免自标注泄漏。作者还给出了风险证书,用于刻画生成查询量与生成器保真度之间的权衡。TALENT与TabArena实验显示,该方法可迁移至MLP、LightGBM和XGBoost,并将中位推理时间降低57至2866倍、峰值预测内存降低1.9至3.3倍。

用途与启示
  • 为计算昂贵的表格基础模型提供可部署的蒸馏路径,使其能力能够迁移到普通CPU上的轻量预测器。
  • 将合成数据用作教师查询点而非直接伪造真实标签,可在扩大输入空间覆盖面的同时降低生成标签噪声风险。
  • 使用折外教师预测进行真实分布锚定,为避免自标注泄漏和过拟合提供了可复用方案。
  • 风险证书与查询量的边际收益分析可用于指导合成数据规模和生成器质量之间的资源配置。
📝 原始笔记(逐字保留)
标题:GEAR: Generative Expansion and Real Anchoring for Two-Stage Distillation of Tabular Foundation Models 来源:arXiv 链接:https://arxiv.org/abs/2608.18849 摘要:Tabular foundation models (TFMs) achieve strong performance through in-context learning, but context-dependent inference imposes substantial latency and memory costs, hindering large-scale deployment. We propose GEAR (\emph{Generative Expansion and Real Anchoring}), a modular two-stage framework that distills TFMs into lightweight MLP or tree-based predictors that can be deployed on commodity CPUs. Stage 1 uses synthetic covariates solely as teacher-query locations and trains the student on soft TFM targets, expanding coverage beyond observed rows. Stage 2 re-anchors the student to the target distribution using real labels and out-of-fold teacher predictions, whitch avoids self-labeling leakage. We further derive a risk certificate characterizing the trade-off between generated-query volum

识别隐含前提以逻辑重建论证图

论文提出一种神经符号流水线,由大语言模型生成隐含前提并将其转译为逻辑公式,从而重建陈述之间的蕴含、矛盾或中立关系。

 前提识别 神经符号人工智能 逻辑推理 溯因推理 论证图谱 省略论证

自然语言论证中常存在省略隐含前提的“不完全论证”,使论证图的逻辑重建面临困难。作者提出神经符号流水线,利用 LLM 生成连接显式前提与主张的中间隐含前提。系统随后将生成内容翻译为逻辑公式,并结合显式陈述的公式验证蕴含、矛盾或中立关系。该方法在 Microtext Argumentative Corpus 上进行了评估。

用途与启示
  • 为自然语言论证图补全缺失的逻辑环节,提高论证结构的完整性与可验证性。
  • 将 LLM 的开放式前提生成能力与符号逻辑验证结合,可降低纯生成方法产生不受约束解释的风险。
  • 可用于事实核查、论证分析和可解释推理系统中的隐含假设发现。
📝 原始笔记(逐字保留)
标题:Identifying Implicit Premises for Logical Reconstruction of Argument Graphs 来源:arXiv 链接:https://arxiv.org/abs/2608.18821 摘要:The logical reconstruction of argument graphs from natural language text is challenging because of the prevalence of enthymemes (i.e., arguments with implicit premises). There are natural language processing methods for identifying enthymemes in text, and there are symbolic methods based on abduction for identifying missing premises in a logical representation of enthymemes. However, there is a need for methods to generate implicit premises to logically show a known entailment or contradiction relationship between a pair of statements. To address this, we propose a neuro-symbolic pipeline that uses large language models (LLMs) to generate intermediate implicit premises that are translated into logical formulae and used with logical formulae representing explicit premises and explicit claim

语义链接不确定性下的省略论证补全选择

PWAL通过在多种跨公式语义链接配置上边缘化逻辑阻力,实现可追溯的省略前提、缺失主张及溯因假设成对选择,并在五项任务上优于仅采用最高置信链接的Top-Link。

 逻辑推理 神经符号人工智能 溯因推理 前提识别 人工智能可解释性 省略论证 语义链接

论文研究省略论证中两个候选缺失成分的逻辑选择问题,覆盖缺失前提与缺失主张,并扩展至溯因假设选择。作者将既有神经符号流程中的二元蕴含结果替换为逻辑阻力分数;基线Top-Link在单一最高置信语义链接配置上求解加权Partial MaxSAT。提出的PWAL固定翻译后的逻辑公式,对多个可能的跨公式语义链接配置进行采样,并边缘化各配置下的逻辑阻力。PWAL在五项任务上将严格准确率提高2.95至30.86个百分点、将平局率降低4.57至58.00个百分点,同时保存公式、链接配置和阻力分量以形成透明推理轨迹。

用途与启示
  • 为自然语言论证补全提供兼顾不确定性处理与逻辑可解释性的神经符号方案。
  • 表明不应只采用最高置信度的语义对齐,而应综合多个可能世界中的链接配置。
  • 逻辑阻力分数可替代粗粒度二元蕴含,为候选排序和近似结论比较提供更细致的信号。
  • 完整记录公式、采样链接和评分分量,可用于推理审计、错误诊断与可解释评测。
📝 原始笔记(逐字保留)
标题:Pairwise Logical Selection of Enthymeme Completions under Semantic-Link Uncertainty 来源:arXiv 链接:https://arxiv.org/abs/2608.18820 摘要:Arguments often omit premises or claims, forming enthymemes. We study pairwise logical selection between two candidates for the omitted component. Existing natural language methods can identify or generate candidates but often do not expose how the selected candidate completes the inference, while logic-based approaches usually assume that the required formulae and background knowledge are available. We extend a prior neuro-symbolic pipeline from missing-premise to missing-claim selection and replace binary entailment outcomes with logical-resistance scores. Top-Link uses weighted Partial MaxSAT under a single configuration of highest-confidence semantic links. We then introduce Possible-World Atom-Link Formalization (PWAL), which keeps translated formulae fixed and marginalizes logical re

分解 LLM 自洽投票中的错误共识:GPT-4.1 案例研究

论文通过分解错误答案的一致程度,揭示多数投票在困难问题上可能放大错误,且高一致性只能作为分级证据而非正确性保证。

 内部一致性 评估方差 不确定性引导搜索 推理 错误共识 多数投票

论文提出多元一致性指数 Gamma,用于衡量错误运行中与共识答案一致的样本比例,并将其分解为答案偏好所致的机械成分和偏好无法解释的残差。作者构建了按题目难度匹配且无信息泄漏的机械零模型,利用同一题目的其他运行估计准确率和选项偏好。GPT-4.1 实验显示,在 GPQA-Diamond 上,逐题答案偏好可解释 81%–93% 的错误一致性;在 AIME 上只能解释 59%–78%,仍存在显著残差。困难题上的多数投票最差会使准确率下降 0.09,而最高一致性分组的准确率也仅为 0.42–0.83,说明一致性并不能认证答案正确。

用途与启示
  • 为分析 self-consistency 多数投票失效提供可量化的分解框架。
  • 区分由候选答案吸引力造成的机械共识与偏好之外的相关错误,避免笼统归因于共享训练偏差。
  • 提醒评测与推理系统不要把高一致性直接当作正确性证明,应结合难度、基础准确率和校准信息。
  • 可用于识别多数投票可能适得其反的困难样本,并指导自适应采样或停止策略。
📝 原始笔记(逐字保留)
标题:Decomposing Wrong-Consensus Agreement in LLM Self-Consistency: A GPT-4.1 Case Study 来源:arXiv 链接:https://arxiv.org/abs/2608.18795 摘要:Majority voting over multiple LLM samples is widely used to raise answer accuracy, yet its gain varies erratically: on hard questions it can even backfire. This paper gives a quantitative account of this failure. A pluralistic agreement index Gamma is defined as the expected fraction of the samples of a wrong run that agree with the consensus, normalized by a reference scale d=(1-p)/(C-1), and is decomposed into a mechanical component (what a vote delivers given only a per-case answer preference) and a preference-unexplained residual. The mechanical null is difficulty-matched and leak-free: each case is resimulated at its own accuracy and option preference, estimated from the case's other runs, so no run predicts its own agreement. On GPT-4.1 the decomposition shows benchmark-associated di

EvalCEGAR:从盲点中自动演化评估指标

EvalCEGAR利用反例引导的抽象精化循环,从评估器的评分碰撞中自动生成缺陷检测算子,并在未见编程任务上获得显著提升。

 模型评估 评估技能 反例生成 形式化验证 自进化 指标演化 缺陷算子

论文将自动评估器表示为一组小型 Python 算子,每个算子负责识别一种具名缺陷或选择弃权,再通过投票形成评分。直接让模型生成算子会产生严重的行为重复:183 个候选仅对应 96 种不同行为。EvalCEGAR借鉴程序验证中的反例引导抽象精化,寻找被现有算子判为相同、但真实正确性不同的答案对,并以这种“评分碰撞”驱动新算子的生成及可读信息范围扩展。在 MBPP+ 和 HumanEval+ 上,系统生成的 55 行算子在 428 个未见任务上弥合了空过滤器与完美过滤器之间 15.4% 的差距;六次成功生成算子的运行均实现样本外提升。

用途与启示
  • 为缺少可靠自动指标的智能体任务提供一种由失败案例驱动的评测器自举方法。
  • 将评估盲点转化为可执行、可复用且无需持续调用大模型的轻量缺陷检测算子。
  • 提示评测器演化应优先搜索具有真实标签差异的评分碰撞,而非反复采样自然语言规则。
  • 可用于构建低成本、可解释的闭环训练与评测基础设施,并补充覆盖范围不同的 LLM 裁判。
📝 原始笔记(逐字保留)
标题:Metrics That Write Themselves: Evolving an Evaluator from Its Own Blind Spots 来源:arXiv 链接:https://arxiv.org/abs/2608.18744 摘要:Agents improve quickly against a reliable automatic metric and stall without one, and the applications that need them most, report generation among them, are the ones nobody knows how to score. Can the metric write itself? Saying what makes an answer good is hard; pointing at something wrong with one is easier, so the metric we evolve is a pool of small Python operators that each flag a candidate for one named defect, or abstain, and vote. Asking a model for operators directly does not work: 183 candidates realise only 96 distinct behaviours, from one narrow region of an enormous space. EvalCEGAR instead borrows counterexample-guided abstraction refinement from program verification. It reads the pool as an abstraction and searches for a collision, two answers the operators score identicall

能力而非准确率:无参考裁判门控的诊断方法

论文以裁判自身的解题能力刻画无参考 LLM 裁判的判别上限,并提出一种低成本探针,在将裁判接入技能优化闭环前判断其门控信号是否可用。

 技能优化 诊断门控 弱评判模型 模型评估 可识别性 模型评判

论文研究文本空间技能优化中的无参考 LLM 裁判门控,将裁判建模为依据自身潜在答案作出判决的“潜在求解器”。理论上,裁判的判别能力受其解题能力 $c$ 与答案空间大小 $k$ 约束,产生有效信号的必要条件为 $c>1/k$,并可据此得到 ROC-AUC 的闭式上界。作者指出,跨题汇总的边际 AUC 会受到题目难度混淆,而题内估计量可以规避这一问题。非干预式探针通过记录真实优化运行中的裁判分数进行部署前诊断;实验显示,基准准确率会高估真正相关的裁判能力,而该诊断能够预测闭环中的门控错误类型。

用途与启示
  • 在引入 LLM 裁判替代自动验证器前,先检查其评分能否区分正确与错误答案,避免无效门控破坏技能演化。
  • 相比直接使用整体准确率,应优先采用题内判别估计,以减少题目难度造成的虚假相关。
  • 可将非干预式探针接入技能优化流水线,在不改变决策的情况下低成本评估裁判是否达到可用能力阈值。
  • 为开放任务中的无参考评测提供理论边界,并帮助预判误接收或误拒绝等门控失效模式。
📝 原始笔记(逐字保留)
标题:Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization 来源:arXiv 链接:https://arxiv.org/abs/2608.18719 摘要:Text-space skill optimization adapts a frozen agent by evolving a natural-language skill document, accepting each candidate through a validation gate. Existing gates rely on verifiable rewards, confining these methods to tasks with an automatic verifier. Replacing the verifier with an LLM-judge gate would lift that restriction, but whether such a gate carries usable signal is untested. We ask a prior question: can we tell, before placing a judge in the loop, whether its scores separate correct from incorrect answers at all? We formalize a reference-free judge as a latent solver -- its verdict rests on agreement with whatever it would itself conclude, so its capacity to evaluate is bounded by its capacity to solve. The model yields a closed-form bound on discriminability (ROC-AUC) in the ju

RTPO:以逆序轮次优化稳定智能体强化学习训练

RTPO通过将多轮轨迹组织为稀疏逆向树并按时间逆序执行轮级策略更新,缓解上下文错配、稀疏奖励归因偏差与异步策略漂移,使智能体强化学习训练更稳定。

 强化学习 信用分配 多轮反馈 轨迹漂移 轮次级优化 逆序训练

RTPO将多轮智能体强化学习的不稳定性归因于展开与训练上下文错配、稀疏终局奖励下的轮级信用分配不足,以及长短轨迹使用不同策略版本造成的异步漂移。其把多轮 rollout 组织成稀疏逆向树,并按照时间逆序进行轮级策略更新,使每个决策与其后续执行过程对齐。理论分析表明,该方法可消除轮级建模下的上下文错配和异步漂移,降低信用分配偏差,并收敛至递归最优。多轮智能体 RL 基准实验中,RTPO相较轨迹级和轮级基线分别提升21.50%和10.76%。

用途与启示
  • 为工具调用、迭代搜索等多轮智能体提供更稳定的强化学习训练方法。
  • 提示多轮RL不应简单展平整条轨迹,而应显式建模轮次间的因果依赖与策略版本一致性。
  • 可将逆序轮级更新用于改善稀疏终局奖励下的信用分配,并降低长轨迹训练中的性能退化。
📝 原始笔记(逐字保留)
标题:RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training 来源:arXiv 链接:https://arxiv.org/abs/2608.18682 摘要:Training multi-turn agentic workflows with reinforcement learning (RL) enables large language models to perform complex reasoning, use external tools, and conduct iterative search beyond single-turn settings. Yet multi-turn RL training remains highly unstable, often causing severe performance degradation as the number of turns increases. Through theoretical analysis, we identify three tightly coupled sources of instability: rollout-training context mismatch, weak turn-level credit assignment under sparse terminal rewards, and asynchronous policy drift when short and long trajectories are optimized under different policy versions. We show that these issues share a common structural origin in flattened trajectory optimization and address them through a unified reverse-turn formulation. We pr

TranslatePsy-AfriSLM:面向非洲低资源机器翻译的高质量数据扩展

TranslatePsy-AfriSLM通过高质量平行语料、非洲语言专用合成数据和质量过滤,为19种撒哈拉以南非洲语言训练出可超越大型系统的小型翻译模型。

 多语言建模 数据合成 小语言模型 数据工程 机器翻译 非洲语言处理 数据质量过滤

TranslatePsy-AfriSLM提供面向19种撒哈拉以南非洲语言的开放机器翻译资源,包括整理后的平行数据、非洲语言专用合成数据及一系列微调小模型。统一的质量估计过滤最多可移除96%的训练令牌,同时不降低翻译质量。实验表明,过滤后的合成数据位于质量—效率的帕累托前沿,优于低质量的大规模数据堆叠。基于所得数据混合进行微调后,最小仅0.8B参数的模型即可显著超过TranslateGemma-27B和Qwen3.5-122B-A10B等更大系统。

用途与启示
  • 为非洲低资源语言机器翻译提供可开放复用的数据、合成流程与小模型资源。
  • 说明训练数据的质量筛选可能比单纯扩大语料规模更重要,可显著降低训练成本。
  • 展示小参数模型结合语言专用高质量数据后超越大型通用模型的可行性。
  • 可为其他低资源语言的数据治理、合成语料筛选和端侧翻译模型开发提供参考。
📝 原始笔记(逐字保留)
标题:TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation 来源:arXiv 链接:https://arxiv.org/abs/2608.18655 摘要:The rapid progress in Artificial Intelligence has largely bypassed African languages, creating a digital divide that limits AI adoption on the continent. Recent open-source LLMs systematically underperform on African machine translation, while the lack of large-scale, high-quality, open-source parallel data has constrained the development of competitive small language models (SLMs). We introduce *TranslatePsy-AfriSLM*, a collection of open-source MT resources for 19 Sub-Saharan African languages, including curated parallel data, African-specialized synthetic data, and a family of fine-tuned SLMs. Our empirical study shows that unified quality-estimation filtering removes up to 96% of training tokens without degrading quality, and that filtered synthetic data dominates the quality-efficienc

低标注预算下的联邦主动学习协调

研究揭示联邦主动学习中的异质性反转现象,并通过共享表征空间实现兼顾隐私与标注效率的全局协调选样。

 样本调度 信息增益 数据安全 协同验证 联邦学习 主动学习 标签稀缺学习

论文研究低标注预算下的跨机构联邦主动学习,此时缺少全局数据视图会使查询样本的协调尤为关键。理论与实验结果表明,低预算时 IID 数据更容易产生重复查询,因此比异构数据更依赖全局协调;随着预算提高,这一趋势会发生反转。作者提出利用联邦表征学习将各客户端数据对齐到共享嵌入空间,由服务器在可选混淆的嵌入上执行全局主动选样,而标注仍保留在客户端本地。该框架在更严格的低预算条件下,仍能超过获得更多标注预算的现有联邦主动学习方法。

用途与启示
  • 为隐私约束下的跨机构数据标注提供低预算、高效率的协调选样方案。
  • 提醒实践者不要照搬“数据异构性越强越困难”的传统联邦学习判断;在主动选样中,IID 数据反而可能导致更严重的查询冗余。
  • 可利用共享嵌入与服务端全局选择减少重复标注,同时通过嵌入混淆和本地标注控制隐私风险。
  • 为联邦主动学习算法设计提供预算感知依据:低预算阶段优先强化协调,高预算阶段则需重新评估异构性影响。
📝 原始笔记(逐字保留)
标题:Coordination on a Budget: Federated Active Learning with Few Labels 来源:arXiv 链接:https://arxiv.org/abs/2608.18634 摘要:Federated Active Learning (FAL) addresses the dual challenges of data privacy and label scarcity, where the absence of a global data view introduces additional hurdles for coordinated query selection. We study cross-silo FAL in the low-budget regime, where annotation decisions are most critical. We characterize, both theoretically and empirically, a heterogeneity reversal: in low-budget settings, homogeneous (IID) data requires stronger coordination to avoid redundant queries, whereas heterogeneous data naturally promotes diversity; this trend reverses at higher budgets. Thus, in contrast to the standard federated learning (FL) narrative where heterogeneity is a primary challenge, we show that IID settings are more challenging for query selection in FAL. Motivated by these findings, we pro

轻量多模态模型估计 LLM 推理表现,实现文档推理预算优化

BudgetDoc 与约 1B 参数的 DRB 预估器根据文档视觉布局预测不同推理预算下的模型表现,在维持或提升任务精度的同时显著降低推理成本。

 推理预算 成本优化 难度估计 多模态 模型路由 文档推理 预算预测 性能预测

  • 作者提出 BudgetDoc,这是首个为文档任务中的“模型—预算—性能”权衡提供显式监督的多模态基准,覆盖三类文档任务。
  • 基于该基准训练的 DRB(Document-Reasoning Balancer)约含 1B 参数,由 SigLIP-2 与 Qwen3-0.6B 组成,可在正式推理前预测各预算档位对应的序数性能,取得 0.753 的加权 F1。
  • 在五个前沿模型和三个数据集上动态分配推理预算时,DRB 在 15 种配置中的 9 种达到或超过始终使用最大预算的基线,同时大幅降低成本。
  • 初步实验还显示,DRB 有望从预算选择扩展至跨模型选择。
用途与启示
  • 为文档理解系统提供按样本分配推理算力的方法,避免统一高预算造成资源浪费和过度思考惩罚。
  • 表明文档视觉布局可作为推理难度与所需预算的重要先验,适合用于多模态预检和模型路由。
  • 可将轻量性能估计器部署在昂贵模型之前,在精度、延迟与调用成本之间进行动态权衡。
  • BudgetDoc 可用于研究预算预测、计算最优推理以及跨模型选择策略。
📝 原始笔记(逐字保留)
标题:Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference 来源:arXiv 链接:https://arxiv.org/abs/2608.18591 摘要:Uniformly allocating inference reasoning budgets to LLMs is expensive and prone to over-thinking penalties; especially in document tasks where visual layouts drive complexity. To address this, we introduce BudgetDoc, the first multimodal benchmark providing explicit supervision for model-budget-performance trade-offs across three document tasks. Using BudgetDoc, we train DRB (Document-Reasoning Balancer), an approx. 1B-parameter pre-flight estimator (SigLIP-2 + Qwen3-0.6B) that predicts ordinal model performance across budget levels, achieving a 0.753 weighted F1. When dynamically allocating reasoning budgets across five frontier models and three datasets, DRB matches or improves F1 scores compared to always-maximum-budget baselines in 9 of 15 configurations while drastically reducing cost

FACET:保留源意图与可执行状态的终端任务合成框架

FACET以修复后的共享容器状态统一生成终端任务的指令、环境、参考解法与验证器,在保留源技能意图和流程约束的同时,提升合成任务的可执行性、一致性及训练价值。

 终端任务 数据合成 可执行性 执行验证 状态表征 状态接地 工件一致性 任务生成 智能体 意图保真度

FACET(Fine-grained Agentic Construction of Executable Tasks)面向终端智能体训练,旨在解决多阶段任务合成中的任务不可解、验证错误、源信息丢失及工件假设不一致等问题。框架先将相关技能重构为包含目标、依赖、状态迁移和流程约束的连贯场景,再构建并修复可执行环境。它以最终容器状态为共同接地点生成任务指令、参考解法和可执行验证器,并通过执行验证与定向修复处理局部故障,避免重复生成已经有效的组件。FACET生成的任务具有更复杂的操作流程和更密集的可执行检查;使用成功轨迹微调不同规模模型后,模型在 Terminal-Bench 2.1 上均获得稳定提升。

用途与启示
  • 为大规模生成终端智能体的可执行监督数据提供可扩展、数据高效的环境优先范式。
  • 表明任务指令、环境、参考解法与验证器应共享同一真实执行状态,以减少不可解任务、错误判分及跨工件假设不一致。
  • 在多阶段数据合成中显式保留源材料的目标、依赖关系、状态迁移与流程约束,有助于构造更复杂且有效的任务。
  • 可采用执行验证与定向修复替代全量重新生成,在保护已正确组件的同时降低数据生产成本。
📝 原始笔记(逐字保留)
标题:FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 来源:arXiv 链接:https://arxiv.org/abs/2608.18580 摘要:Training terminal agents requires scalable executable supervision, yet synthesizing high-quality terminal tasks remains challenging. Each task couples an instruction, an initialized environment, a reference solution, and an executable verifier; if these artifacts are generated from inconsistent assumptions, the resulting task may be unsolvable or incorrectly evaluated. Meanwhile, multi-stage synthesis can discard the goals, dependencies, state transitions, and procedural constraints encoded in the original sources. We present FACET (Fine-grained Agentic Construction of Executable Tasks), a framework that addresses both information preservation and cross-artifact consistency. FACET reconstructs related agent skills into coherent, information-rich scenarios, then realizes and repairs the exe [合并自 2026-08-22 facet] [FACET:在终端任务合成中保留源代码意图与可执行状态(105 ▲)](https://huggingface.co/papers/2608.18580?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-21)

超越 LLM 推理:轻量 GNN 实现智能体失败归因

AFANet 以步骤级语义信号和智能体关系构图,用轻量 GNN 低成本定位多智能体轨迹中的故障智能体及错误类型,性能可匹配或超过 LLM 方案。

 多智能体系统 故障归因 关系学习 测试时计算 参数高效微调 图神经网络

论文研究多智能体系统的失败归因任务,即从失败的交互轨迹中识别故障智能体及其错误类型。作者提出轻量图框架 AFANet,利用步骤级语义信号与智能体级关系对轨迹进行结构化建模,避免依赖长上下文 LLM 推理、昂贵后训练和复杂智能体工作流。AFANet 以显著更少的参数和近乎为零的推理成本,在域内基准上匹配或超过包括微调模型在内的 LLM 基线,并在不同 GNN 架构下保持稳健。面对分布外基准,廉价的测试时适应还可进一步提升其归因性能。

用途与启示
  • 说明多智能体故障诊断未必需要扩大生成模型规模,结构化关系建模可能更高效。
  • 可将交互轨迹表示为图,把步骤语义与智能体依赖关系结合起来进行错误定位。
  • 为低成本、可部署的智能体监控与故障归因模块提供设计参考。
  • 测试时适应可作为增强分布外失败诊断能力的轻量方案。
📝 原始笔记(逐字保留)
标题:Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution 来源:arXiv 链接:https://arxiv.org/abs/2608.18575 摘要:Large language model (LLM)-based multi-agent systems (MAS) often exhibit complex failure modes, which frequently cause agents to produce incorrect outcomes. This motivates the task of Agent Failure Attribution: given a failed multi-agent trajectory, identify the faulty agents and their corresponding error types. Existing approaches predominantly rely on LLMs to perform failure attribution, either through direct prompting, fine-tuning on synthetic data or complex agentic pipelines. While effective, these methods incur substantial computational overhead due to long-context processing, expensive post-training and handcrafted workflows. Moreover, empirical evidence shows that even state-of-the-art models achieve limited accuracy on existing benchmarks, suggesting that scaling model size alone

Continual Reasoning Gym:持续 RLVR 中的共享推理与提示回放

研究提出持续 RLVR 评测环境 Continual Reasoning Gym,并以持续提示回放利用任务间共享推理,使顺序训练平均达到多任务联合 RLVR 的性能水平。

 持续学习 强化学习 后训练 多模态 能力迁移 灾难性遗忘 共享推理 提示回放

Continual Reasoning Gym 将文本与视觉推理任务组织为五种任务序列,用于比较持续 RLVR 与多任务联合 RLVR(MTRL)。实验发现,顺序 RLVR 的遗忘程度有限,但最终性能仍低于联合训练,且遗忘只能解释其中部分差距。作者将较低遗忘归因于任务间可迁移的共享推理结构,即在一个任务上的训练能够平均提升其他任务。为利用这一机制,论文提出 Continual Prompt Replay(CPR),回放旧任务提示并由当前策略重新生成响应,平均而言只有 CPR 达到了 MTRL 级别的表现。

用途与启示
  • 为推理模型新增任务时提供比反复执行多任务联合训练更经济的持续后训练方案。
  • 表明持续学习的性能差距不能仅用灾难性遗忘解释,还需分析任务间共享推理结构及其利用效率。
  • CPR 无需固定保存旧策略生成的答案,而是使用当前策略重新生成响应,可作为持续 RLVR 的轻量回放机制。
  • Continual Reasoning Gym 可用于评估文本与视觉推理能力在连续任务到达场景下的迁移、遗忘和最终性能。
📝 原始笔记(逐字保留)
标题:Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR 来源:arXiv 链接:https://arxiv.org/abs/2608.18574 摘要:Reinforcement learning with verifiable rewards (RLVR) commonly post-trains reasoning models on multiple tasks, while rerunning multitask RLVR (MTRL) as new tasks are added makes capability expansion costly. We therefore study continual RLVR, which updates the existing model as each task arrives. The central question is whether a model updated this way can perform as well as a jointly trained model. To answer this question, we introduce Continual Reasoning Gym, a continual-RLVR environment that organizes text and visual reasoning tasks into five task sequences. In this setting, we identify two key observations: Sequential RLVR exhibits modest forgetting, yet its final performance remains below that of MTRL. To understand the latter, we decompose final performance and show that forgetting ac

基于交互作用评估与解释 LLM 提示敏感性

论文通过分解模型输出中的非线性交互作用提出 IPS 指标,并在 50 个开源 LLM 上揭示微调、规模、稠密架构和少样本学习降低提示敏感性的共同机制。

 提示敏感性 人工智能可解释性 模型评估 因果归因 交互分解

论文指出,仅比较提示变化前后的最终输出,无法解释 LLM 提示敏感性的内部原因。作者将模型输出分数分解为一组输入变量之间的非线性交互作用,并据此提出交互式提示敏感性指标 IPS。实验发现,即使最终输出保持不变,微小且语义无关的提示改动也可能引发内部交互作用的剧烈变化。对 50 个开源 LLM 的分析显示,监督微调、更大模型规模、稠密架构和少样本学习均可降低提示敏感性,其共同机制是增强低阶交互作用的稳定性。

用途与启示
  • 为提示鲁棒性提供比最终输出差异更细粒度的评估指标。
  • 可用于定位提示扰动影响模型决策的内部交互机制,避免将表面输出一致误判为内部稳定。
  • 为模型选型与训练提供依据:监督微调、扩大规模、采用稠密架构及少样本提示可能提升稳定性。
  • 提示可优先监测和约束低阶交互作用,以设计更有针对性的鲁棒性改进方法。
📝 原始笔记(逐字保留)
标题:Evaluating and Explaining Prompt Sensitivity of LLMs Using Interactions 来源:arXiv 链接:https://arxiv.org/abs/2608.18539 摘要:The remarkable capabilities of large language models (LLMs) are often undermined by their instability. Even subtle and semantically irrelevant changes in prompts can cause dramatic fluctuations in performance, a phenomenon known as prompt sensitivity. Previous studies typically evaluate prompt sensitivity by comparing the LLM's final outputs when prompts change. However, such coarse-grained metrics fail to explain the internal reasons for prompt sensitivity. In this paper, we introduce interactions as a fine-grained tool to analyze prompt sensitivity of LLMs. Specifically, we decompose the output score of the LLM into a set of interactions. Each interaction represents a nonlinear relationship involving a set of input variables. We discover that subtle changes to prompts can trigger severe

DART-SD:面向钻石拓扑的多轮工具调用智能体自蒸馏

DART-SD通过交互状态转移图定位关键拓扑断点,并仅监督恢复步骤,在保留有效推理前缀和策略多样性的同时提升多轮工具调用能力。

 工具调用 智能体 自蒸馏 轨迹蒸馏 执行恢复 多轮反馈 拓扑蒸馏 局部纠错 钻石拓扑

DART-SD针对完整轨迹模仿会压制多子目标任务中合法执行顺序、造成策略“拓扑坍缩”的问题提出改进。方法将执行过程建模为收敛的交互状态转移图(ISTG),以刻画成功与失败探索路径形成的钻石拓扑。智能体自主展开时,框架识别关键拓扑断点(CTB),并检索由成功路径支持的恢复参考。训练仅对断点后的恢复步骤计算损失,避免破坏此前有效的推理前缀;多轮工具调用基准实验显示其显著优于完整轨迹训练基线。

用途与启示
  • 为包含多个顺序无关子目标的工具调用任务提供比单轨迹模仿更合适的监督表示。
  • 可借助关键拓扑断点实施局部信用分配,降低有效探索路径被错误惩罚的风险。
  • 为智能体自蒸馏、失败恢复和多样化策略保留提供可复用的图结构训练方案。
  • 启示训练系统将损失限制在真正需要纠正的步骤上,以减少破坏性梯度更新。
📝 原始笔记(逐字保留)
标题:DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents 来源:arXiv 链接:https://arxiv.org/abs/2608.18524 摘要:Equipping Large Language Models (LLMs) with multi-turn tool-calling capabilities is essential for building autonomous agents. However, progress is fundamentally limited by the reliance on full-length trajectory imitation. For tasks involving multiple order-independent sub-goals, the optimal solution space forms a vast combinatorial diamond lattice. Forcing this rich topology into monolithic trajectories causes a severe topological collapse, indiscriminately penalizing valid alternative explorations and severely degrading policy diversity. To address this, we propose DART-SD (Diamond-topology Aware Retrieval and Tuning for Self-Distillation), a novel framework that shifts the paradigm from global forcing to topology-guided localized correction. DART-SD first models the execution process as

NeuroAssertion:覆盖驱动的 RTL 断言生成与神经符号精炼

NeuroAssertion 结合形式化轨迹生成、SyGuS 与双 LLM 精炼机制,生成覆盖难达 RTL 行为的可靠断言,并将变异覆盖率提升约 2 倍。

 形式化验证 神经符号人工智能 自动机理论 过程验证 硬件验证 断言合成 覆盖率引导

NeuroAssertion 将难以到达的控制流条件转换为形式可达性目标,并通过模型检查生成行为多样的执行轨迹。框架利用语法引导合成(SyGuS)从轨迹中挖掘初始断言,再根据验证反馈定位尚未覆盖的设计区域。第一组 LLM 为未覆盖区域提出候选断言;若候选未通过形式检查,第二组 LLM 会生成修复语法,引导受约束的符号合成完成神经符号修复。实验显示,该方法生成的断言数量和变异覆盖率均约为传统断言挖掘方法的 2 倍。

用途与启示
  • 为 RTL 功能验证提供从覆盖缺口发现、候选断言生成到形式修复的闭环流程。
  • 说明形式方法可为 LLM 提供可靠反馈与搜索约束,降低一次性生成断言的不完整性和错误率。
  • 可用于覆盖难达硬件行为、提升缺陷暴露能力,并辅助构建更完整的回归验证断言集。
📝 原始笔记(逐字保留)
标题:Coverage-Driven RTL Assertion Generation with Formal Exploration and Neuro-Symbolic Refinement 来源:arXiv 链接:https://arxiv.org/abs/2608.18482 摘要:Hardware functional verification relies on high-quality assertions to expose design bugs and establish confidence in Register Transfer Level (RTL) designs. Yet existing assertion mining methods still struggle to produce complete and reliable assertion sets: random or limited traces fail to cover hard-to-reach behaviors, and one-shot generation provides little feedback about what remains unverified or how the assertion set should be improved. As a result, critical design behaviors can remain uncovered even when many assertions are generated. We present NeuroAssertion, a coverage-driven assertion generation framework that combines formal trace generation, syntax-guided synthesis (SyGuS), and an agent-inspired refinement process within a unified framework. Our framework first converts hard-to

遗忘、可塑性与数据共观:持续学习的第三维度

研究指出,除灾难性遗忘和可塑性下降外,训练数据能否被同时观测也是造成持续学习与离线联合训练性能差距的独立因素。

 持续学习 灾难性遗忘 全可塑性 经验复用 数据可观测性 联合训练

论文将数据访问方式与稳定性、可塑性约束解耦,单独考察数据共观对表征学习和泛化能力的影响。实验覆盖监督学习与自监督学习,并在通用数据增量分块场景中控制可塑性和缓解遗忘,联合训练仍持续优于分离训练。结果表明,同时观测训练数据带来的收益不只是知识保留,也不依赖特定的持续分布漂移。蒸馏方法主要发挥知识保持作用,而记忆回放还会重新引入数据共观效应,从而解释其额外性能优势。

用途与启示
  • 为持续学习的性能分析补充“数据共观”维度,避免仅用遗忘和可塑性解释联合训练差距。
  • 设计持续学习基准时,应分别控制知识保持、模型可塑性和数据共观条件。
  • 记忆回放的价值不应只按抗遗忘衡量,还应评估其对表征与泛化的促进作用。
  • 可据此探索在存储受限条件下近似联合观测收益的数据混合与回放策略。
📝 原始笔记(逐字保留)
标题:Forgetting, plasticity, and co-observation: a third facet of continual learning 来源:arXiv 链接:https://arxiv.org/abs/2608.18803 摘要:Efficient continual learning remains a fundamental challenge for deep neural networks. While catastrophic forgetting and loss of plasticity are widely considered the primary obstacles to overcome, we show that these two issues cannot fully explain the performance gap between naive sequential training and offline joint training. In this paper, we highlight data co-observation as a distinct factor influencing continual learning performance. By decoupling the constraints of separate data access from stability and plasticity, we systematically investigate the representational benefits gained by observing training data together. Empirically, we demonstrate a consistent performance difference between joint and separate training across both supervised and self-supervised paradigms in generic data

AtmosCoder-Bench:执行验证揭示环境科学计算中的隐性失败

AtmosCoder-Bench通过执行级过程评测发现,选择题会显著高估大模型的环境科学计算能力,而公式、约束与物理条件的不一致执行是主要失败来源。

 数值推理 执行验证 过程评估 科学研究基准 过程诊断 环境科学 科学计算 公式执行

研究提出执行落地的环境科学计算基准 AtmosCoder-Bench,包含 436 道问题、3,910 个变体和 7,029 个可评分量,并确保题目无歧义、人工可解且答案可唯一验证。基准不只检查最终答案,还通过执行计算过程定位多步推理中的具体错误。实验发现,选择题形式会使测得准确率至少虚高 12 个百分点,许多错误并非源于知识缺失,而是模型无法持续、正确地应用已知公式和约束。当前沿模型遇到使常规方法失效的任务条件时,仍常机械套用典型解法,表明专家监督依然必要。

用途与启示
  • 为科学计算模型建立从最终答案评分转向执行过程验证的评测范式。
  • 提醒研究者避免用选择题成绩直接衡量模型的真实定量推理能力。
  • 可借助中间变量和可执行步骤区分知识缺失、公式误用、约束遗漏与物理条件适配失败。
  • 为环境科学等高风险定量任务中的专家复核和人机协作流程提供依据。
📝 原始笔记(逐字保留)
标题:Execution-grounded evaluation reveals hidden failures in language-model calculations for environmental science 来源:arXiv 链接:https://arxiv.org/abs/2608.18726 摘要:Large language models are increasingly used for quantitative work in the environmental sciences, yet existing evaluations score only final answers, leaving calculation process unobserved. Here we introduce AtmosCoder-Bench, an execution-grounded benchmark that makes the calculation process visible. Built through a transferable semi-automated pipeline (436 problems, 3,910 variants, 7,029 graded quantities), every problem is validated to be unambiguous and human-solvable, with uniquely verifiable answers. We find that (i) multiple-choice formats inflate measured accuracy by at least 12 percentage points; (ii) many failures arise not from missing knowledge but from models failing to apply known formulas and constraints consistently throughout multi-step computation; and (iii) even frontier mo

基于失败模式上下文赌博机的对抗数据策展

该研究将对抗数据策展建模为失败模式上下文赌博机,通过自适应选择最有价值的模型失败样本,在控制遗忘与数据成本的同时提升自然语言理解鲁棒性。

 数据合成 主动学习 候选选择 检索增强生成 奖励建模 人工智能可靠性 失效模式分析 数据策展 对抗数据增强

框架利用检索增强提示生成候选样本,经目标模型筛选和多个 LLM 裁判自动验证后,将其聚类为反复出现的失败模式。随机策略按失败模式选择重训练数据,并依据兼顾鲁棒性增益、灾难性遗忘和数据成本的验证奖励持续更新。该方法将数据策展器本身转化为学习智能体,可跨训练轮次动态发现最值得修复的模型弱点。实验中,RoBERTa-base 在 SNLI、ANLI 和 MultiNLI 上分别提升至 92.60%、80.95% 和 71.99%,并可迁移至 FEVER 事实核查任务。理论分析表明,失败模式采样能够削弱与捷径一致的梯度贡献,同时将分布漂移控制在有限范围内。

用途与启示
  • 为自动化数据闭环提供一种以模型失败模式为中心的自适应样本调度机制。
  • 可用于替代固定奖励阈值的数据筛选策略,提高合成数据的训练价值与成本效率。
  • 将鲁棒性收益、遗忘风险和数据成本纳入统一奖励,有助于构建更稳定的持续重训练流程。
  • 无需新增人工标注即可扩展对抗数据增强,并适用于自然语言推断和事实核查等任务。
📝 原始笔记(逐字保留)
标题:Learning What to Fail On: Failure-Mode Contextual Bandits for Adversarial Data Curation 来源:arXiv 链接:https://arxiv.org/abs/2608.18681 摘要:We introduce a failure-aware adversarial retrieval-augmented framework for improving robustness in natural language understanding. Rather than selecting synthetic examples with a fixed reward threshold, our method formulates adversarial data curation as a failure-mode contextual bandit problem. Candidate examples are generated with retrieval-augmented prompting, filtered by the current target model, automatically validated by an LLM judge ensemble, and clustered into recurring failure modes. A stochastic policy then selects which failure modes to sample for retraining, and is updated using validation-based reward that balances robustness gains, forgetting, and data cost. This makes the data curator itself the learning agent, enabling adaptive selection of the most useful model failures acr

大模型不确定条件下的偏好推理

研究将偏好推理中的不确定性划分为认知不确定性与结构不确定性,并发现先进大模型难以可靠区分问题是否存在确定解。

 推理 价值对齐 社会智能 群体共识 不确定性引导搜索 偏好推理 社会选择理论 欠定推理

论文指出,现实中的偏好信息可能不完整、部分给定或具有复杂表达,因此不能仅以答案正确性衡量模型推理能力。作者将不确定性形式化为两类:信息不足导致的认知不确定性,以及标准社会选择概念下不存在解所导致的结构不确定性。通过层级化任务测试,研究发现先进大模型会系统性混淆“可确定”与“不可确定”的实例。即使任务仅要求验证候选结果,模型仍表现出明显的推理失准与置信校准问题。

用途与启示
  • 为偏好聚合、群体决策和多智能体协调建立包含“无解”与“信息不足”情形的评测框架。
  • 提醒对齐系统不要强迫模型在不充分信息下给出确定答案,而应显式识别并表达不确定性。
  • 可用于改进社会选择推理、候选解验证及决策智能体的拒答和置信校准机制。
📝 原始笔记(逐字保留)
标题:Preference Reasoning under Indeterminacy in Large Language Models 来源:arXiv 链接:https://arxiv.org/abs/2608.18631 摘要:As large language models evolve into decision-making agents, the ability to reason over preferences becomes fundamental to alignment, coordination, and collective intelligence. Yet, unlike standard benchmarks, real-world preference reasoning is inherently indeterminate: information may be incomplete, and valid solutions may not exist. We argue that indeterminacy, rather than correctness alone, is a central challenge for AI reasoning. We formalize this challenge along two axes, (i) epistemic indeterminacy, arising from incomplete, partial, or expressive preferences, and (ii) structural indeterminacy, arising from the non-existence of solutions under standard social choice concepts. Across a hierarchy of tasks, we show that state-of-the-art language models systematically fail to distinguish
0%