AI 证明泛滥后,可信验证成为最昂贵的智能
当 AI 将数学答案与证明变成廉价供给,人类审核能力成为瓶颈,数学研究的核心价值正从发现答案转向构建机器可核验的可信系统。
子主题:形式化验证 新智元
形式化验证 自动定理证明 人机协同验证 可信执行 多智能体系统
数学学者 Rishikesh Gajjala 因 AI 在数月内帮助攻克多个长期课题,决定离开传统数学学术界,转而使用 Lean 构建形式化验证系统。文章指出,AI 生成证明的速度已远超人类审查速度,未经验证的精巧证明与错误结果难以区分,形成陶哲轩所称的“证明消化不良”。Axiom Math 的多智能体系统 AxiomProver 自动完成了“246 定理”的形式化验证,并将相关素数间隙成果整理为可复用基础设施。随着答案和代码大量由 AI 生成,逐行机器核验、认证体系及可信执行能力将成为新的稀缺资源。
用途与启示
- 提示数学与科研系统将从“答案稀缺”转向“验证能力稀缺”,评估基础设施的重要性会持续上升。
- 可用 Lean 等证明助手将 LLM 生成的推理转化为机器可检查对象,降低隐藏错误进入知识体系的风险。
- 自动科研系统应把形式验证、证据追踪和可复用定理库纳入闭环,而不应只优化生成速度。
- 面对无人完整阅读的 AI 代码与证明,可信认证可能成为连接智能供给与实际应用的关键瓶颈。
📝 原始笔记(逐字保留)
哲思|智能正在变成最便宜的东西,但能被信任的智能,还是最贵。https://mp.weixin.qq.com/s/-JIh2i3iLbXRGeXt6CnilQ
HarnessEval:以可执行 Harness 重构 Benchmark
MirroS 联合清华、北大、Berkeley、MIT、英伟达等 15 家学术与产业机构发布 HarnessEval,将 Benchmark 从固定指标与 Rubric 升级为可规划、路由、验证并输出可追溯证据树的智能体评测系统。
[合并自 2026-08-25 harnesseval-rsi]
HarnessEval将评测组织为可动态选择技能、调用工具、拆解问题并交叉验证证据的智能体工作流,使Benchmark能够随模型能力和失败模式持续进化。
子主题:评测编排 机器之心 Groom EvalEvolve HarnessEvolve
模型评估 世界模型 智能体 工具调用 智能体技能库 证据推理 闭环评估 递归自我改进 评估编排 证据树 评估技能 评估智能体 世界模型评估 动态基准测试 多智能体系统 自进化 持续评估
HarnessEval 主张,当被测对象从单一模型演变为包含工具、记忆和执行环境的复杂系统时,Evaluation 也应成为能够理解、规划、调查和验证的可执行 Harness,而非静态指标集合。其工作流包含 Plan、Route、Decompose 和 Verify 四个阶段,可针对具体案例选择 Skill、拆分可测子问题,并调度子智能体与诊断工具搜集和审计证据。首个开源实现 HarnessEval-W 面向交互式世界模型,从观测质量、状态转移正确性和世界持续性等维度动态组织评测,并计划扩展至代码、搜索和机器人等复杂场景。系统同时输出量化分数与层级式 evidence tree,使评测目标、工具调用、证据来源及结论形成过程均可追溯。该框架还将评测视为递归式自我改进闭环中的反馈系统,可通过持续扩展 Skill Library 与增加测试时计算提升评测能力。
[合并自 2026-08-25 harnesseval-rsi]
HarnessEval首次将Harness执行框架引入评测,由主Agent根据案例动态派生专业子Agent,完成技能选择、问题拆解、证据搜集和结论复核。其首个应用HarnessEval-W面向交互式世界模型,从观察质量、转移正确性和世界持续性三条主轴及九项技能进行评估。系统不仅负责阅卷,还参与候选场景生成与有效性验证,使Benchmark从冻结数据集转变为持续生产、质检和更新任务的系统。评测结果除分数外还提供可展开的Evidence Tree,记录工具调用、证据和结论形成过程,以支持诊断、审计与复核。
用途与启示
- 为复杂 Agent、世界模型和交互式生成系统构建按案例动态编排的评测流程,减少固定 Rubric 带来的无关检查与关键遗漏。
- 通过层级式证据树提高评分的可解释性、可复现性和可追责性,帮助定位失败来自模型、工具、环境还是评测器。
- 将评测技能沉淀为可复用、可组合的 Skill Library,并结合子智能体分工与证据审计机制,建设可扩展至代码、搜索、机器人等领域的评测基础设施。
- 将评测器纳入测试时扩展与递归自我改进闭环,使 Eval 能随任务和被测系统共同演化,并降低围绕单一分数优化所引发的奖励作弊与评测盲区风险。
[合并自 2026-08-25 harnesseval-rsi]
- 为能力持续增强的Agent提供可按任务难度扩展推理、工具调用和验证深度的测试时评测框架。
- 将行业评测能力沉淀为可组合、可版本化的Skill Library,便于针对新失败模式快速补充验证能力。
- 通过Evidence Tree提升评测结论的可解释性、可审计性和可复核性,降低弱裁判限制前沿模型评估的风险。
- 为RSI闭环提供自监督基础,使Evaluator能够识别自身技能缺口并引入工具或新技能后重新验证。
📝 原始笔记(逐字保留)
Groom|开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval https://mp.weixin.qq.com/s/T_fBh7p82OHaKw75oq-5cQ
[合并自 2026-08-20 harnesseval-benchmark]
https://mp.weixin.qq.com/s/T_fBh7p82OHaKw75oq-5cQ
[合并自 2026-08-25 harnesseval-rsi]
https://mp.weixin.qq.com/s/pZW6wcL79lktaVqs1_j6pw?scene=1
Zetta ζ:闭环物理智能体在线自进化
清华 AIR 与域变换推出 Zetta ζ,通过动作级监控恢复、批量故障诊断和验证门控技能更新,使机器人在不重训底层策略模型的情况下持续提升任务成功率。
子主题:自进化闭环 机器之心 DataEvolve
具身智能 自进化 持续学习 智能体运行时 执行恢复 故障归因 技能演化 试错效率 闭环治理 在线学习 物理智能
- Zetta ζ 以三个时间尺度的闭环驱动物理智能体进化:运行时 Critic 实时发现异常并触发恢复,批量优化环定位失败根因,验证门控环筛选可泛化的技能更新。
- 系统将 Critic、Recovery 与工具更新沉淀到技能记忆库,使机器人能够从 rollout 经验中逐步学会抓取保持、碰撞规避和稳定接触等可迁移能力。
- 在 LIBERO-Pro 和 RoboCasa 上,平均成功率分别达到 90.8% 和 93.6%,部分任务呈现从平台期突然跃升的“Aha Moment”。
- 配套 Z-Infra 解耦智能体逻辑与异构硬件,将有效 rollout 吞吐从每分钟 1.7 个 episode 提升至 35.1 个,为规模化自进化提供基础设施。
用途与启示
- 展示一种不依赖反复训练或微调底层 VLA 模型、而通过演化执行系统提升具身可靠性的路径。
- 将故障检测与恢复前移到动作执行现场,可减少事后轨迹复盘中的信用分配困难和关键状态丢失。
- 通过历史回归和隔离验证控制技能更新风险,为部署后持续学习提供可审计的门控机制。
- 高吞吐 rollout 基础设施表明,环境交互效率可能成为物理智能扩展的重要瓶颈与优化方向。
📝 原始笔记(逐字保留)
DataEvolve|机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw
SA-MRPO:面向多奖励策略优化的饱和感知优势重加权
SA-MRPO依据各奖励目标的饱和程度动态重加权优势,将梯度预算转向尚未充分优化的目标,同时保持已满足目标的性能。
子主题:奖励优化 Hugging Face Papers
强化学习 后训练 奖励建模 策略优化 多目标优化 饱和感知
现有多奖励策略优化通常先对奖励向量固定加权求和,再执行组内标准化,可能让奖励画像不同的轨迹获得相同优势,并持续浪费梯度预算在已饱和目标上。SA-MRPO先独立标准化每个奖励目标,再根据批次级目标饱和度自适应降低其贡献,使优化重点转向剩余提升空间更大的目标。该重加权不仅改变更新幅度,还可能反转更新方向。在数学推理、动态推理和代码任务中,该方法普遍改善较难目标,其中AIME24最高提升5%,AMC23提升9.2%,代码通过率最高提升2.3%,且基本维持容易目标的既有水平。
用途与启示
- 为多奖励强化学习提供动态分配梯度预算的方法,避免固定奖励权重造成优化失衡。
- 可用于同时优化正确性、格式遵循、推理长度或代码执行结果等难度不同的目标。
- 提示后训练系统应持续估计各目标的饱和程度,而非在整个训练过程中沿用静态权重。
- 独立标准化各奖励维度有助于保留轨迹之间更细粒度的奖励差异。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.16072?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-18
Agentic Transaction:面向 ACID 合规的智能体系统
论文将数据库 ACID 原则重新解释为面向智能体执行的四类语义保证,并通过事务化探索、执行与验证机制提升长程任务的可靠性。
子主题:事务执行 Hugging Face Papers
智能体 人工智能可靠性 可信执行 状态安全 执行恢复 事务语义 并发控制 状态持久化
论文提出“智能体事务”概念,以应对智能体操作持久环境和多步工作流时的执行失败、状态不一致、安全并发与结果持久化问题。框架将经典 ACID 重构为语义原子性、语义一致性、语义隔离性和语义持久性四项保证。作者实现了一个 ACID 合规的数据智能体,引入事务化探索—执行—验证循环、事务技能中心、基于置信度分歧的验证、语义依赖感知隔离及事务感知的语义状态管理。实验显示,该系统在常用基准上较包括 Claude Code 在内的先进智能体提升 10.6%。
用途与启示
- 为长程智能体提供类似数据库事务的可靠执行抽象,降低部分执行、状态污染和并发冲突风险。
- 可用于设计具备提交、回滚、隔离和持久恢复能力的智能体运行时与工具调用框架。
- 将模型不确定性纳入事务验证过程,为可信、可扩展及可自我演化的智能体系统提供系统化基础。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.13900?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-18
RelArena-α、TabPFN-Rel 与 RPI:开放可复现的关系学习工具栈
Prior Labs 开源 RelArena-α、TabPFN-Rel 和 RPI,以统一评测、强基线与模型无关接口推动关系学习研究的开放复现和实际应用。
子主题:关系推理评测 Hugging Face Papers
关系学习 人工智能框架 模型评估 真实世界任务 关系学习基准 链接预测 数据库机器学习
RelArena-α 面向 RelBench v1,统一数据加载、评估协议、调参方案及自定义调参系统支持,以提高关系学习方法比较的可靠性与可复现性。TabPFN-Rel 是为 TabPFN-3 构建的关系学习工具框架,当前在 RelArena-α 中排名第一,并作为 RDBLearn 的改进型强基线。实验结果进一步表明,将关系数据库展平为单表的方法,在真实任务上仍可与专用关系架构竞争。RPI 则提供模型无关的关系预测接口,使研究者和早期用户能够在新数据库上定义问题,并直接应用 RelArena-α 中实现的模型。
用途与启示
- 为关系学习算法提供统一、可复现的基准测试与调参环境。
- 将 TabPFN-Rel 作为强基线,用于检验复杂关系架构是否真正优于数据库展平方案。
- 借助 RPI 降低在新数据库上定义和部署关系预测任务的工程成本。
- 适合作为关系学习研究中基准建设、方法对比及真实场景验证的基础工具栈。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.16319?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-18
HarnessEval-W:智能体化视觉世界模型评测
HarnessEval-W 通过父智能体分解任务、专业子智能体诊断及证据验证,将视觉世界模型评测转化为透明、可核验的层级证据树。
子主题:世界模型评测 Hugging Face Papers EvalEvolve HarnessEvolve
世界模型 具身智能评估 多智能体系统 评估编排 证据树 人工智能可解释性 世界模型评估 评估智能体
HarnessEval-W 将 LLM 生态中的 harness 范式引入视觉世界模型评测,不再依赖固定规则和仅输出标量分数的指标。系统会结合具体案例拆解评测问题,并生成配备定制上下文与诊断工具的专业子智能体,分别检查物理规律、因果关系和世界状态演化。父智能体负责验证子智能体收集的证据并汇总最终判断,使每次评测都形成完整、透明且可核验的证据树。实验覆盖 18 个代表性世界模型和 330 个评测案例,其判断与人类偏好高度一致,并能提供细粒度的生成轨迹失效诊断。
用途与启示
- 为世界模型建立超越单一分数的可解释评测流程,定位具体的物理、因果与状态演化错误。
- 利用分层多智能体和专用工具扩展评测能力,降低复杂视觉轨迹的人工审查成本。
- 将证据验证纳入最终裁决,可用于提升自动评测的可信度、可审计性与人类一致性。
- 开放式技能与案例扩展机制可支持世界模型持续演化过程中的动态基准建设。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.16859?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-18
Large Discovery Models:基于实证的开放式科学搜索
Large Discovery Model 将生成模型与贝叶斯非参数奖励代理结合,以实验反馈和不确定性感知价值持续引导开放假设空间中的候选生成、优化与选择。
子主题:开放式搜索 Hugging Face Papers
科学发现 贝叶斯方法 开放式演化 多目标优化 智能体记忆 模型发现 开放式搜索 不确定性引导搜索
论文提出 Large Discovery Model(LDM),面向分子、蛋白质序列和程序等庞大、结构化且开放的假设空间进行搜索。该架构将负责提出和迭代候选方案的生成模型,与预测实验表现及量化认知不确定性的贝叶斯非参数奖励代理相结合。随着新实验观测到来,发现记忆与代理模型会持续更新,并以不确定性感知价值指导后续生成、精炼和筛选。在神经网络训练、抗体设计和分子优化任务中,LDM 相比仅依赖 LLM 反思或传统统计搜索取得显著提升,包括验证 BPB 降幅提高 2.4 倍、结合能相对下降 18.2%,以及分子多目标性能相对提升超过 60%。
用途与启示
- 为昂贵实验目标提供“生成模型提案—代理模型评估—真实实验反馈—持续更新”的闭环发现框架。
- 用贝叶斯不确定性替代不可靠的模型自评,改善分布外新候选的探索与选择。
- 可作为跨模态通用发现引擎,应用于模型架构、蛋白质、药物分子及程序设计等开放搜索任务。
- 启示自动科研系统应维护动态发现记忆,并在探索新颖候选与利用高价值区域之间进行显式权衡。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.15669?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-18
StateM:以状态化 Harness Scaling 提升长程智能体执行
StateM 通过持久状态、局部上下文、受检转换和可恢复运行手册,在不修改模型权重的情况下将 Terminal-Bench 2.1 原始准确率提升至 95.3%,并显著降低运行成本。
子主题:状态运行时 Hugging Face Papers HarnessEvolve
智能体 状态持久化 执行恢复 长程任务 智能体脚手架 智能体运行时 运维手册 状态机
StateM 是面向智能体的状态化运行时,将长程执行组织为持久状态、阶段局部上下文、受检状态转换、可恢复运行手册和版本化操作实践。它使 GPT-5.6 Sol xhigh 在 Terminal-Bench 2.1 的 445 次试验中达到 95.3% 原始准确率,并让全部 89 项任务至少成功一次。相同运行时与规则经不足 38 美元适配后,将 DeepSeek-V4 Flash 从 82.7% 提升至 88.1%,最终评分 API 成本约 15 美元,远低于 GPT 参考方案的 574.68 美元。BusinessBench 实验表明,具体规则可在执行机制相近的任务间迁移,而将复盘结论固化为可执行前置条件有助于形成持续、可检查的控制机制。
用途与启示
- 说明长程智能体的瓶颈不仅在模型能力,也在状态丢失、流程遗漏和过早停止等执行系统问题。
- 可通过 Harness Scaling,在不更新模型权重的情况下获得显著性能与成本收益。
- 将复盘经验编码为版本化运行手册和可执行前置条件,可支持故障恢复、经验复用与人机共同审查。
- 为低成本模型迁移高质量智能体流程提供路径,但规则迁移效果取决于任务是否共享执行结构。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.15089?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-18
面向通用图像生成的能力中心化数据设计
该研究以生成能力依赖关系为核心,联合设计异构监督数据与多阶段课程调度,推动文生图、图像编辑和知识关联能力协同演化。
子主题:数据课程 arXiv
数据科学 课程学习 扩散模型 多模态 数据合成 能力迁移 能力编排 关系监督
研究提出能力驱动的数据基础设施,不再孤立优化各任务语料,而是依据生成能力之间的依赖关系组织异构监督。三个可互操作的数据引擎分别构建文本—图像对齐、图像间变换及图像—知识关联监督,并通过 caption 专家统一文生图与编辑任务的监督粒度。多阶段课程沿能力习得顺序联合调整任务构成、视觉概念分布、数据质量和图像分辨率,并借助能力感知评测执行定向检索与缺口重采样。该框架最终整理出 4.4 亿张文生图数据、1.2 亿组编辑对和超过 2700 万组图像—实体对,并从零训练了 3B 与 6B 多模态扩散模型。
用途与启示
- 为通用图像生成提供从“任务语料堆叠”转向“能力依赖编排”的数据工程范式。
- 可借鉴其闭环机制,用能力评测定位数据缺口,再进行定向构造、检索和重采样。
- 表明课程学习不仅可以调节样本难度,还能联合控制任务比例、概念分布、质量与分辨率。
- 为文生图、图像编辑和知识增强生成的统一训练及跨能力迁移提供规模化实践参考。
📝 原始笔记(逐字保留)
标题:From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
来源:arXiv
链接:https://arxiv.org/abs/2608.18076
摘要:Large-scale image generation has benefited from advances in data scale, quality, rebalancing, and recaptioning, yet conventional pipelines typically optimize task-specific datasets in isolation. A central challenge is not only how to curate each task-specific corpus, but also how to organize heterogeneous supervision according to the dependencies among generative capabilities. We present a \textbf{capability-driven data infrastructure} that couples capability-specific supervision construction with capability-aligned curriculum scheduling. Its three specialized yet interoperable data engines build complementary relational supervision for text-image grounding, inter-image transformation, and image-knowledge association, while caption experts align T2I and editing supervision across tasks and
自改进智能体的脆弱性:方差、任务顺序与规格不足
研究发现,基于文本记忆的自改进智能体会放大评测噪声,其性能高度依赖任务顺序和隐式课程,补充评分细则与环境反馈只能部分缓解这一问题。
子主题:模型可靠性 arXiv Awesome-RSI EvalEvolve
自进化 智能体 智能体记忆 评估方差 课程学习 人工智能可靠性 人在回路 顺序效应 欠规范性
作者通过多次独立运行和随机打乱任务顺序,重新评估了两种基于文本记忆的自改进智能体方法。实验显示,复杂环境与多步任务本身具有较大评测噪声,而自改进循环会进一步放大这种方差。智能体的改进还高度依赖任务排列,既有工作的默认顺序可能构成隐含课程和隐藏的成功前提。人工检查记忆后,作者将部分脆弱性归因于任务及环境规格不足;引入详细评分标准和环境反馈虽能缩小性能损失,但仍无法消除显著差距。
用途与启示
- 自改进智能体应报告多次运行的均值、方差及置信区间,避免以单次结果判断能力增长。
- 评测协议应随机化任务顺序,并显式比较不同排列,以识别默认顺序带来的隐式课程效应。
- 构建记忆时可纳入详细评分细则和环境反馈,降低任务与环境规格不足造成的错误经验沉淀。
- 系统接口需要支持有效的人类监督和异常检查,防止噪声或错误记忆在持续改进循环中被放大。
📝 原始笔记(逐字保留)
标题:On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
来源:arXiv
链接:https://arxiv.org/abs/2608.18066
摘要:Memory-based self-improving agents--those that learn from an online stream of tasks and improve over time by maintaining a textual memory bank--have shown great promise in recent literature. However, the reliability aspects of these methods have been critically overlooked. In this work, we conduct a comprehensive re-evaluation of two memory-based methods, broadening the scope of evaluation along two axes: (1) including multiple runs to quantify variance, and (2) randomly shuffling the tasks to investigate the effect of task order. Through these experiments, we make two observations that expose the fragility of current methods: First, agent evaluation is inherently noisy in complex environments and on multi-step tasks, and stacking a self-improving loop on top can further amplify this noise
StagedWorkspace:面向知识工作智能体的版本化工作区
StagedWorkspace 通过将解析视图、原生文件、审查差异和提交产物绑定到明确版本,减少知识工作智能体因工作区状态不一致导致的执行与评测偏差。
子主题:版本工作区 arXiv
智能体 版本状态管理 编辑契约 状态表征 真实世界任务 工作空间 版本契约 视图一致性
论文提出“工作区状态契约”:智能体使用的每个视图都应明确关联到持续演化的工作区版本。StagedWorkspace 以原生文件的内容哈希为锚点,将解析记录和审查 diff 与对应文件版本绑定,覆盖 PDF、表格、幻灯片、Notebook 及混合格式项目。固定执行框架消融实验显示,同时提供解析视图与原生文件访问,可使 OfficeQA Pass@1 提升 8.3~12.1 个百分点,并使 APEX 平均评分提升 4.7~9.2 分。SW-AGENT 在 OfficeQA 上使用 Gemini 3.1 Pro 获得 63.9%,在 APEX 上使用 GPT-5.4 Nano 获得 42.1;另有 57 项文件编辑任务表明,向智能体展示 diff 时观测得分更高。
用途与启示
- 为非代码类知识工作智能体提供类似代码仓库的版本、搜索、差异审查与提交契约。
- 将工作区状态视为智能体实验中的独立变量,避免不同版本的解析内容、原生文件和最终产物被混用。
- 启发评测基准显式记录并评分证据引用、暂存编辑和产物提交等状态转换。
- 适用于文档、电子表格、幻灯片及混合文件项目中的可靠编辑、审查与复现。
📝 原始笔记(逐字保留)
标题:StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents
来源:arXiv
链接:https://arxiv.org/abs/2608.18050
摘要:AI agents increasingly perform knowledge work (i.e., produce and modify persistent digital artifacts such as code repositories, documents, spreadsheets, slides, reports), yet the parsed views they search, the native files they edit, the changes they review, and the artifacts they submit can refer to different versions of the same work product. We formulate this as a workspace-state contract: every view should be explicitly tied to a version of the evolving workspace state. Coding agents partly address this need through repository contracts for search, diffs, and tests, whereas an analogous contract is less explicit for PDFs, spreadsheets, slides, notebooks, and mixed-format project folders. We propose StagedWorkspace, a versioned workspace for knowledge-work agents. The workspace binds par
经验链:通过测试时交互持续改进 LLM
Chain-of-Experience 让 LLM 在测试时积累自反馈与环境反馈,形成无需参数更新的持续改进闭环,整体性能提升 5.6%,同时降低 19% API 成本。
子主题:经验学习 arXiv EvolveLLM
持续学习 测试时计算 经验学习 多轮反馈 成本优化 经验链 自我改进 执行反馈 经验反馈
论文提出 Chain-of-Experience(CoE),使模型在推理阶段通过与自身或环境反复交互积累经验轨迹,形成超越静态零样本推理的持续改进循环。研究结合模型自反馈、答案正确性和公开编程测试通过率等信号,在数学、编程与知识任务上评估 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet 等 8 个模型。CoE 相比无反馈基线整体性能提升 5.6%、API 成本降低 19%,且单位 token 的准确率优于已有测试时策略。不同反馈通道具有互补性,多数收益集中于早期迭代;基础能力更强的模型通常具有更大的改进潜力,并对弱反馈或伪反馈表现出一定鲁棒性。
用途与启示
- 为无需更新模型参数的测试时持续学习提供通用框架,将历史交互轨迹转化为后续推理经验。
- 可在数学推理、代码生成、知识问答及智能体系统中组合自反馈与可验证环境信号,获得互补增益。
- 实际部署可优先利用早期迭代并设计按收益停止的策略,在准确率、token 消耗与 API 成本之间权衡。
- 动态评测 LLM 时可纳入其从交互经验中持续改进的能力,而非仅考察静态零样本表现。
📝 原始笔记(逐字保留)
标题:Chain-of-Experience for Continual LLM Improvement
来源:arXiv
链接:https://arxiv.org/abs/2608.18027
摘要:Humans continuously learn from experience, whereas conventional large language model (LLM) evaluations ignore the models' ability to improve through inference-time interaction. In this paper, we study how LLMs learn from iterative experience at test time, a setting we refer to as Chain-of-Experience (CoE), where models accumulate experiential traces through iterative interactions with self or environmental feedback to form a continual improvement loop beyond zero-shot inference. We instantiate CoE with diverse feedback mechanisms, including model self-feedback and environmental signals such as correctness or public coding test pass rates, and evaluate across math, coding, and knowledge domains using 8 LLMs, including GPT-5, Gemini-2.5 Pro, Claude-4.5 Sonnet. Our study shows that leveraging
[合并自 2026-08-21 chain-of-experience-llm]
[Chain-of-Experience for Continual LLM Improvement](https://huggingface.co/papers/2608.18027)
IOL-AI Challenge:以语言学奥赛推进语言推理评测
IOL-AI Challenge以2026年国际语言学奥赛未见题目评测模型发现隐含语言规则并据此推理的能力,揭示解码与输出处理比单纯扩大模型规模更关键。
子主题:语言推理 arXiv
逻辑推理 规则学习 多语言建模 科学研究基准 评估方差 语言推理 语言谜题
IOL-AI Challenge使用2026年国际语言学奥赛个人赛的未见题目,并首次邀请官方评审按人类选手标准为AI系统评分。比赛在单张T4、30分钟的严格算力限制下吸引了46支队伍提交731次,同时评测了15个不受限的前沿及开放模型。Claude Opus 4.8取得相当于金牌的评审成绩,但受限系统仅处于人类参赛者后5%的区间;部分14B模型还超过了参数量大一倍的模型,增益主要来自解码和输出处理。自动指标与评审的系统排序完全一致,但会压缩分差,对弱系统高估约13分并低估强系统;模型对题目语言的先验知识也未带来显著帮助。
用途与启示
- 将语言学谜题作为通用推理基准,可同时考察隐含规则发现、归纳和规则内推演能力。
- 资源受限场景下应优先优化解码策略、答案格式与输出处理,而非仅扩大模型规模。
- 自动评测适合系统排序,但分数校准仍需人类评审,避免高估弱系统或低估强系统。
- 未见语言与严格算力预算有助于降低记忆和规模因素干扰,更真实地衡量可泛化推理能力。
📝 原始笔记(逐字保留)
标题:The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning
来源:arXiv
链接:https://arxiv.org/abs/2608.18011
摘要:Reasoning in LLMs is overwhelmingly studied in domains that provide a model with rules: mathematics and code. Linguistic puzzles invert this: the solver must first discover the system before reasoning within it. We present the IOL-AI Challenge, an open-science competition run on the unseen problems of the International Linguistics Olympiad (IOL) 2026 Individual Contest, evaluated both automatically and, for the first time, by members of the official IOL Jury under the same rubrics applied to human contestants. The challenge drew 731 submissions from 46 teams under a strict compute budget (one T4, 30 mins). We additionally benchmark 15 unconstrained frontier and open models, with Claude Opus 4.8 earning a jury score equivalent to a gold medal, while both resource-constrained systems we subm
表格基础模型的惊人泛化机制
研究发现,表格基础模型仅在一张真实表格上进行自监督预训练也能实现强迁移,其泛化能力主要取决于任务数量与质量,并可能源于对上下文样本的检索和聚合。
子主题:表格泛化 arXiv
上下文学习 数据库机器学习 检索增强生成 数据科学 表格学习 任务中心化
研究表明,表格基础模型无需海量合成数据或真实数据集,仅通过单张真实表格的自监督预训练也能获得显著的跨任务迁移能力。不同表格通常会跨下游任务表现出稳定的高价值或低价值,而表格的特征数量比实例数量更能预测预训练效果。由此,作者提出任务中心视角:表格预训练的关键是可产生任务的数量与质量,细粒度列级预处理也比数据集级过滤或去重更有效。论文进一步认为,表格上下文泛化主要是一种检索式机制,优秀模型能够识别上下文中的相关样本并有效聚合其信息。
用途与启示
- 为表格基础模型选择预训练数据时,应优先关注特征丰富度及其可构造的任务质量,而非单纯扩大样本量。
- 在大规模语料设计中,可优先投入列级清洗与预处理,而不是依赖数据集级过滤和去重。
- 可从检索与聚合能力出发设计模型结构、上下文选择策略和可解释性分析方法。
- 单表预训练的强迁移结果为低成本、领域专用表格模型提供了可行路径。
📝 原始笔记(逐字保留)
标题:Understanding the Surprising Generalization Properties of Tabular Foundation Models
来源:arXiv
链接:https://arxiv.org/abs/2608.17957
摘要:Tabular Foundation Models (TFMs) increasingly rely on in-context learning, where a model receives labelled examples at inference time and predicts labels for new inputs without updating its weights. Existing TFMs are typically trained on either massive synthetic corpora or very large collections of real datasets. In contrast, we show that surprisingly strong transfer can emerge from self-supervised pre-training on just a single real table. In this setting, we also find that tables tend to be either broadly useful or broadly poor regardless of downstream prediction task, and that the strongest predictor of usefulness is the number of features rather than the number of instances. This leads to a task-centric interpretation of tabular pre-training: the number and the quality of tasks are esse
LLM 长上下文流形的拓扑压缩与六度分隔
研究发现深层 LLM 隐状态会形成满足六度分隔的小世界网络,并可借助其拓扑结构差异对 RAG 幻觉进行零样本检测。
子主题:拓扑压缩 arXiv
长上下文 潜空间推理 人工智能可解释性 检索增强生成 科学幻觉 事实核查 拓扑压缩 流形几何 小世界网络
论文绕过易受注意力汇聚点等路由伪影影响的注意力权重,直接分析长上下文隐状态流形的动态几何。作者将连续相似度矩阵稀疏化为无权图,在两种不同架构中追踪相距较远的语义锚点,发现模型深层潜在空间呈现小世界网络结构。网络随层数发生明显的拓扑相变:早期句法层连接破碎,而深层推理层会把遥远概念压缩至不超过 6 次语义跳跃的路径。基于 RAGognize 数据集的实验显示,有事实依据的生成与来源上下文通常相距约 3 跳,而幻觉会引发显著的拓扑坍缩,可据此开展零样本可靠性检测。
用途与启示
- 为解释 LLM 如何在长上下文中完成跨越遥远信息的多跳推理提供几何视角。
- 可将隐状态图的路径长度与结构完整性用作无需额外训练的 RAG 幻觉检测信号。
- 提示模型分析不应只依赖注意力权重,还可结合潜在流形的连通性、相变层位置和拓扑坍缩程度。
- 有望形成跨架构的事实可靠性评测指标,并辅助定位长上下文推理开始整合语义信息的关键层。
📝 原始笔记(逐字保留)
标题:Do Large Language Models Play Six Degrees of Separation? Measuring Topological Compression in Long-Context Manifolds
来源:arXiv
链接:https://arxiv.org/abs/2608.17950
摘要:Large Language Models (LLMs) demonstrate remarkable multi-hop reasoning capabilities over long contexts, yet the internal mechanisms enabling these distant cognitive leaps remain poorly understood. Traditional attention-based interpretability often fails to capture true semantic proximity due to routing artifacts like attention sinks. In this paper, we bypass attention weights to directly analyze the dynamic geometry of the hidden state manifold, proving that deep LLM latent spaces natively organize into Small-World networks. By sparsifying the continuous similarity matrices of long-context representations into unweighted graphs, we trace the connectivity between highly disjoint semantic anchors across two distinct architectures. Our findings reveal a sharp topological phase transition: wh
基于图结构在线难度估计的高效 RLVR 调度
该研究利用样本关系图共享 rollout 反馈并在线估计难度,从而以更低探测开销实现 RLVR 的自适应样本选择与探索预算分配。
子主题:难度调度 arXiv
强化学习 难度控制 资源调度 在线学习 关系学习 难度估计
论文针对 RLVR 为不同难度样本平均分配 rollout 预算所造成的探索浪费,提出可即插即用的图结构在线难度估计器。方法依据语义与推理相似性构建难度感知样本图,并通过 Potts 先验促使相邻样本共享潜在难度状态。状态级 Beta-Binomial 模型聚合同类样本的 rollout 结果,再由在线平均场变分算法持续更新状态归属与难度估计。该框架无需额外探测即可缓解冷启动和历史反馈陈旧问题,并能接入样本选择及 rollout 分配调度器;多种底座模型、调度器和基准上的实验显示其可提升性能。
用途与启示
- 通过关联样本之间共享反馈,减少为估计训练样本难度而进行的额外生成与探测开销。
- 为易样本减少冗余 rollout,同时向困难但仍可学习的样本分配更多探索预算。
- 图先验与在线贝叶斯更新的组合可用于缓解自适应课程学习中的冷启动和反馈陈旧问题。
- 该估计器采用即插即用设计,可作为现有 RLVR 样本选择器和 rollout 分配器的难度信号模块。
📝 原始笔记(逐字保留)
标题:Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation
来源:arXiv
链接:https://arxiv.org/abs/2608.17941
摘要:Reinforcement learning with verifiable rewards (RLVR) improves the reasoning capabilities of large language models but relies on costly rollout exploration. Assigning the same exploration budget to samples with different difficulty levels is inefficient: easy samples may receive redundant rollouts, whereas difficult but learnable samples may receive too little exploration. Existing adaptive schedulers address this mismatch through curriculum-based sample selection or non-uniform rollout allocation based on estimated sample difficulty. However, obtaining reliable online difficulty estimates remains challenging: dedicated probing adds substantial generation overhead, whereas history-based estimators face a cold start with no initial observations and stale feedback, and typically ignore relat
评分靠量规,而非模型智能
显式评分量规,尤其是其中的标准答案,可使低成本小模型对开放式答案的评分达到与前沿模型相当的可靠性。
子主题:量规评分 arXiv
模型评估 小语言模型 评估方差 成本优化 测量效度 量规评分
论文提出 any-to-bench:由前沿模型在材料导入阶段一次性抽取题目和评分量规,后续重复评分全部交给低成本模型。研究测试了两个模型家族、三档推理强度下的六种配置,围绕 24 道开放题产生 3,456 个逐题评分;答案身份解释了 95.6% 的分数方差,而评审模型身份仅解释 0.2%。提高答题模型的推理强度最多可使得分变化满分的 0.143,但提高评分模型的推理强度最多只改变 0.006,六个前沿模型评审也未表现出更高可靠性。消融实验显示,仅移除评分标准和等级几乎没有影响,但进一步移除标准答案会使 ICC 从 0.888 降至 0.628,并引发分数膨胀,说明标准答案是量规发挥作用的核心。
用途与启示
- 可将高成本前沿模型集中用于一次性的题目与量规构建,再用小模型完成大规模重复评分,显著降低评测成本。
- 开放式答案的自动评分应优先提供明确标准答案,而非单纯提升评审模型规模或推理强度。
- 设计模型评测基准时,可通过量规消融和评审方差分析,检验评分可靠性究竟来自量规还是模型能力。
- 结果表明量规锚定评分未呈现明显的长度偏好或同模型家族偏好,可用于构建更稳定的自动评测流水线。
📝 原始笔记(逐字保留)
标题:Grading Needs a Rubric, Not Intelligence
来源:arXiv
链接:https://arxiv.org/abs/2608.17938
摘要:Small language models can grade open-ended examination answers as reliably as substantially more expensive models when they grade against an explicit rubric. We test this claim as the design principle behind any-to-bench: a frontier model reads source documents once, at ingestion, to extract each question and its rubric; lower-cost models then perform all repeated grading work. We evaluate six cost-efficient model configurations from two model families at three reasoning-effort levels. Each configuration answers 24 open-ended examination questions, and each also grades every answer sheet three times, yielding 3,456 per-question grades. Scores depend overwhelmingly on the answer being graded: answer identity explains 95.6% of score variance, whereas judge identity explains only 0.2%. Raisin
EvoTS-Agent:自进化金融时序变点检测智能体
EvoTS-Agent利用验证反馈自主进化可执行实验轨迹,为不同金融资产和市场状态自适应构建变点检测流程。
子主题:变点检测 arXiv Awesome-RSI HarnessEvolve
智能体 自进化 时序建模 量化金融 实验执行 变点检测 金融时间序列
金融时间序列具有非平稳性和异质性,单一无监督变点检测算法难以跨资产与市场状态稳定工作。EvoTS-Agent先通过策划式探索性数据分析刻画数据特征并初始化候选检测模型,再自主搜索可执行的实验轨迹。系统通过 Revision、Alternative Strategy 和 Recombination 三类算子分别改进当前最优方案、探索不同建模方向及融合高质量轨迹证据。四个基准数据集上的实验显示,该方法持续优于现有 LLM 智能体,并在所有受测骨干模型上达到 100% 的执行成功率。
用途与启示
- 将专家主导的模型选择、特征设计和超参数调优转化为验证反馈驱动的自动化搜索流程。
- 三类轨迹演化算子兼顾局部优化、停滞后的方向切换与优秀方案重组,可复用于其他数据科学智能体。
- 以执行成功率约束自进化过程,说明提升智能体探索能力时也应同步关注实验流程的可靠性。
- 可用于金融市场结构变化、风险状态切换及异常区间的自动识别。
📝 原始笔记(逐字保留)
标题:EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection
来源:arXiv
链接:https://arxiv.org/abs/2608.17933
摘要:Financial time series exhibit non-stationary and heterogeneous statistical properties, making change-point detection challenging because no single unsupervised algorithm performs consistently across assets and market regimes. Conventional workflows consequently depend heavily on expert-driven model selection, feature design, and hyperparameter tuning, limiting their scalability and adaptability. We propose EvoTS-Agent, a validation-guided self-evolving LLM agent for autonomous financial time-series change-point detection. EvoTS-Agent first performs curated exploratory data analysis to characterize dataset properties and initialize candidate detection models. It then evolves executable experiment trajectories through three complementary operators: \textit{Revision} exploits the current best
集体反事实规划:表征约束下的协调、同意与验证
论文提出集体反事实规划形式模型,以智能体特有子空间刻画表征限制,并通过构想、同意、执行联盟与验证资格四道门判断团队能否达成且合法确认联合目标。
子主题:协同规划 arXiv
多智能体系统 任务规划 多智能体协作 反事实推理 形式化验证 表征几何 群体共识 协同验证
论文将多智能体协作的关键瓶颈建模为表征几何,而非能力、知识或可观测性不足:每个智能体只能通过公共任务空间在自身子空间上的投影来感知状态、构想动作、表达同意和认证目标。作者定义集体反事实可解性(CCS)问题,区分几何可行性、可执行达成和经验证完成,并以执行联盟、构想、同意及任务相关验证资格四道门约束合法完成。跨智能体的迭代接力可能生成任何一次性汇总个人计划都不包含的解,但依赖全体共同盲区的目标条件即使偶然实现,也无法被有效验证和宣告完成。论文还区分无记忆同意与审计式同意,前者约束动作方向、后者约束累积轨迹状态,二者互不支配;其有界时域四步穷举方案在精确表示接力闭包时具备可靠性与完备性。
用途与启示
- 为多智能体协作系统提供一种同时分析计划可达性、参与者同意和结果可验证性的统一形式框架。
- 提醒系统设计者区分“目标事实上已达成”与“团队有资格确认目标已达成”,避免把偶然成功误判为有效完成。
- 可用于识别团队共同表征盲区、规划跨专家边界的接力机制,并设计强制分工或补充验证者。
- 无记忆同意与审计式同意约束对象不同,实际系统应根据动作风险和轨迹累积风险组合使用。
📝 原始笔记(逐字保留)
标题:Collective Counterfactual Planning: Coordination, Consent, and Verification under Representational Constraints
来源:arXiv
链接:https://arxiv.org/abs/2608.17932
摘要:Groups routinely complete projects that no single member can plan, execute, or verify alone. We propose a formal model of this phenomenon, Collective Counterfactual Planning (CCP), in which the binding limitation on each agent is neither capability, knowledge, nor observability, but representational geometry: each agent perceives the state, conceives moves, consents to actions, and certifies goal requirements only through a projection onto an agent-specific subspace of a common task space. Four gates jointly determine whether a team can reach a conjunctive goal and legitimately recognize that it has done so: the exogenous implementation coalitions required to perform each action, together with three representational gates -- conception, consent, and task-relative verification qualification
群组去中心化规划实现并行终身多智能体寻路
论文从理论上证明 RHCR 在折扣 MDP 形式的终身多智能体路径规划中近似最优,并提出可并行扩展至更多智能体的群组去中心化 GD-RHCR。
子主题:并行路径规划 arXiv
多智能体系统 任务规划 并行搜索 多智能体协作 路径规划 终身路径规划 分布式规划
论文研究终身多智能体路径规划(L-MAPF),其中智能体需要持续前往新目的地,同时规避障碍物和彼此碰撞。作者借助局部相依多智能体 MDP 的理论方法,证明滚动时域碰撞消解框架 RHCR 在折扣 MDP 表述下具有指数接近最优的保证。基于该结论,论文提出 GD-RHCR,按照传递通信关系划分智能体群组,并对不同分组进行并行规划。理论结果揭示了 RHCR 的时间限制与 GD-RHCR 空间分区之间的对偶性;实验显示,GD-RHCR 在多种地图和更高智能体数量下保持高吞吐量,同时显著降低单次规划成本。
用途与启示
- 为 RHCR 提供近似最优性的理论依据,帮助理解滚动时域规划的有效边界。
- 通过空间分组和并行规划缓解集中式多智能体寻路的计算瓶颈。
- 可用于仓储机器人、物流调度等需要大量智能体持续执行路径任务的系统设计。
- 展示以局部通信依赖划分协作群组的方法,可启发其他大规模多智能体规划框架。
📝 原始笔记(逐字保留)
标题:A Theoretical Framework for Parallel Lifelong MAPF Using Group Decentralized Planning
来源:arXiv
链接:https://arxiv.org/abs/2608.17928
摘要:In the Lifelong Multi-Agent Path Finding (L-MAPF) problem, agents must repeatedly move from one destination to another while avoiding obstacles and inter-agent collisions. Widely regarded as one of the highest-performing solutions to this problem is the Rolling-Horizon Collision Resolution (RHCR) framework. However, commensurate with its quality solutions, it incurs a computational cost that limits its applicability to even modest agent counts. In this paper, leveraging theoretical methods from the Locally Interdependent Multi-Agent MDP literature, we first theoretically prove the near-optimality of RHCR in a discounted MDP formulation of the L-MAPF problem. Then, we leverage these results to naturally motivate an extended framework called Group Decentralized RHCR (GD-RHCR) which incorpora
Diff-DDoS:面向5G信息物理系统的扩散攻击合成与鲁棒检测
Diff-DDoS利用表格扩散模型生成保持真实分布的DDoS攻击样本,并通过对抗扩散训练提升5G信息物理系统检测器对自适应攻击的鲁棒性。
子主题:入侵检测 arXiv
网络安全 扩散模型 数据合成 形式化鲁棒性 红队测试 入侵检测 攻击合成 通信安全
论文指出,基于固定倍率手工构造的DDoS攻击无法反映真实数据分布,相关检测器面对分布保持型攻击时的F1分数可下降约47%至100%。Diff-DDoS首先基于呼叫详单(CDR)的时空网格训练CNN基线检测器,再以正常CDR聚合数据训练TabDDPM,合成逼真攻击并暴露检测漏洞。第三阶段采用逆分类器引导的对抗扩散训练,持续生成困难但保持分布特征的样本,直至检测器收敛。在Milano CDR数据集的短信洪泛、静默呼叫、互联网信令及混合攻击场景中,ResNet50结合该方法取得最高100%的F1分数,并显著优于CTGAN等合成基线。
用途与启示
- 为标签稀缺的5G信息物理系统生成更逼真、保持原始分布的攻击训练数据。
- 可将扩散模型作为检测器压力测试工具,揭示手工攻击样本无法暴露的脆弱性。
- 逆分类器引导可用于构造困难样本,形成攻击生成与检测加固的迭代闭环。
- 结果提示安全检测评测不应只依赖固定规则或缩放倍率合成的攻击,还需验证对自适应攻击的泛化能力。
📝 原始笔记(逐字保留)
标题:Diff-DDoS: Realistic Cyber-Physical Attack Synthesis and Robust Detection for 5G-Enabled CPS Using Tabular Diffusion Models
来源:arXiv
链接:https://arxiv.org/abs/2608.17796
摘要:Deep learning-based DDoS detectors for 5G-enabled cyber-physical systems face scarce labeled attack data and unrealistic synthetic substitutes, which limit robustness against adaptive adversaries. Detectors trained on hand-crafted attacks with fixed scaling multipliers degrade catastrophically (F1-score drops of about 47 percent to 100 percent, depending on scenario) when confronted with realistic, distribution-preserving samples. We propose Diff-DDoS, a three-phase framework for realistic attack synthesis and robust detection using tabular diffusion models. Phase 1 trains a baseline CNN cell-level detector on spatiotemporal grids from call detail records (CDRs). Phase 2 trains a tabular denoising diffusion probabilistic model (TabDDPM) on normal CDR aggregates to generate realistic attack
TraceSQL:可追溯的无参考 Text-to-SQL 验证
TraceSQL 通过67项显式诊断特征,在无需标准SQL或参考执行结果的情况下评估生成SQL的正确性,并提供可追溯的特征级证据。
子主题:查询验证 arXiv
数据库机器学习 人工智能可解释性 过程验证 人工智能可靠性 查询验证 答案评判
TraceSQL 面向真实部署中的无参考 Text-to-SQL 验证,仅根据用户问题、数据库上下文和生成SQL估计查询能否正确回答问题。模型使用67项显式特征,覆盖问题歧义与需求、问题—模式—SQL一致性、SQL结构及意图对齐,并允许将预测追溯到具体诊断证据。在 BIRD 开发集数据库上,TraceSQL 达到66.47%的F1和64.48%的ROC-AUC,优于 GradeSQL-7B ORM 基线的61.87%和58.26%。特征归因结果表明,模型同时利用语义落地信号和确定性的SQL结构信号,以轻量方法兼顾验证性能与可解释性。
用途与启示
- 为缺少标准SQL及参考执行结果的线上场景提供轻量级质量门控。
- 通过特征级归因定位问题歧义、模式对齐或SQL结构错误,辅助调试与修复。
- 说明无参考验证不必完全依赖大型LLM裁判,显式诊断特征也能获得更高的透明度和竞争性效果。
- 可作为候选SQL重排序、拒答决策和 Text-to-SQL 系统可靠性监控的基础组件。
📝 原始笔记(逐字保留)
标题:TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification
来源:arXiv
链接:https://arxiv.org/abs/2608.17795
摘要:Text-to-SQL systems are commonly evaluated using ground-truth SQL queries or reference execution results, but such supervision is unavailable at inference time in real-world deployments. This creates a critical verification problem: given only a user question, database context, and generated SQL, can a system estimate whether the generated query is likely to correctly answer the question? Recent approaches use LLMs as judge or specialized agents to inspect generated SQL, but their decisions can be difficult to trace. Outcome Reward Models (ORMs) address this by learning from execution-labeled candidate SQLs and assigning correctness scores to unseen queries, yet they still provide limited visibility into the signals behind each verification. To address this limitation, we propose TraceSQL,
辩论训练减少 RLAIF 奖励作弊
由生成者与批评者进行对抗辩论并交由较弱模型裁决,可显著缓解 RLAIF 策略利用裁判系统性错误所导致的奖励作弊。
子主题:辩论式对齐 arXiv
奖励作弊 强化学习 多智能体系统 博弈论 价值对齐 辩论训练 弱评判模型
研究在答案可验证的数学任务上,以 Gemini 2.5 Flash 级策略和冻结的较弱 Gemini 2.5 Flash Lite 裁判,对比单智能体 RLAIF 与生成者—批评者辩论训练。基线策略很快学会欺骗裁判,而辩论机制能在训练期间维持裁判表现,并挽回峰值验证准确率差距的 45%,优势可持续多个强化学习步骤。进一步削弱裁判会加速奖励作弊,但增加一轮辩论能够补偿这一影响,辩论激励也能压过提示中注入的错误对齐倾向。多智能体训练需要严格平衡双方能力,否则批评者也可能转向攻击裁判;将批评限制在最多 150 词可有效抑制该问题,但会牺牲表达清晰度。
用途与启示
- 为使用弱模型监督更强模型提供一种可扩展的 RLAIF 方案,降低策略利用裁判漏洞的风险。
- 表明增加辩论轮次可部分补偿裁判能力不足,为监督预算与训练配置提供设计依据。
- 提醒多智能体对抗训练必须约束参与者的行动空间,否则奖励作弊可能从生成者转移到批评者。
- 可将可验证任务中的真实正确率与裁判奖励联合用于监测训练期间的奖励作弊动态。
📝 原始笔记(逐字保留)
标题:Debate Training Reduces Reward Hacking in RLAIF
来源:arXiv
链接:https://arxiv.org/abs/2608.17776
摘要:We demonstrate that RL finetuning an LLM using debate, a two-player adversarial game between a generator and a critic adjudicated by a weaker LLM judge, reduces reward hacking compared to a reinforcement learning from AI feedback (RLAIF) baseline. Reward hacking is a central obstacle in RLAIF: as training progresses, the policy learns to exploit systematic errors in its AI judge, degrading task performance, a problem that worsens precisely when the judge is weaker than the policy, the setting most relevant to overseeing increasingly capable AI systems. We study mathematics tasks, where final-answer correctness is verifiable, allowing us to measure reward hacking dynamics. We train a Gemini~2.5 Flash-class policy with a frozen, weaker Gemini~2.5 Flash Lite judge, comparing a single-player R
D²ACCI:证据保留的智能体记忆双循环诊断协议
D²ACCI通过配对统计、受保护切片监控和阶段级追踪,为智能体持久记忆系统提供可定位、可回放且具回归感知的双循环迭代协议。
子主题:记忆诊断 arXiv
智能体记忆 状态持久化 故障归因 闭环评估 内部一致性 诊断门控 切片回归
D²ACCI面向由摄取、检索、过滤和生成构成的多阶段智能体记忆流水线,解决端到端评测难以定位故障来源的问题。其外层诊断门根据配对证据、受保护切片表现和追踪可定位性,决定升级、特性开关保留或拒绝一项记忆干预。论文还提出衡量故障可观测性的分级指标DCR,以及支持诊断门回放的D²ACCI-Eval工件,并在MemStack中完成实例化。系统在LoCoMo、LongMemEval和PersonaMem-V2上分别取得93.59%、90.93%和57.20%,丰富诊断轨迹的DCR@3达到98%至100%,而仅含结果的日志为0%。
用途与启示
- 为持久记忆系统建立阶段级故障定位机制,避免只根据聚合分数判断改动成败。
- 使用配对统计检验和受保护切片监控,识别总体提升掩盖的局部性能退化。
- 通过可回放诊断工件保留实验依据,使记忆模块的升级、灰度启用与回滚更可审计。
- DCR可作为记忆系统可观测性的补充指标,用于衡量日志是否足以支持根因分析。
📝 原始笔记(逐字保留)
标题:D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory
来源:arXiv
链接:https://arxiv.org/abs/2608.17756
摘要:Memory is a key capability of LLM agents. Persistent memory extends this across sessions---enabling recall, revision, and personalization. Yet its multi-stage pipeline (ingestion, retrieval, filtering, generation) makes failures difficult to localize: end-to-end evaluation reveals that an error occurred, but not which stage caused it. Existing evaluations often report aggregate performance without paired statistical comparisons, slice-level non-regression checks, or stage-level diagnostic traces. We propose D$^2$ACCI (Diagnostic-Driven Artifact-based Closed-loop Controlled Iteration), a dual-loop protocol whose outer diagnostic gate promotes, feature-flags, or rejects memory interventions based on paired evidence, protected-slice monitoring, and trace-level localizability. We further intro
低资源语言推理:SFT 构建语言习惯,RL 修复行为缺陷
研究发现,准确率无法反映低资源语言后训练的关键变化:SFT 能建立稳定的希腊语推理习惯,而可验证奖励强化学习可进一步修复格式违约、通道泄漏和指令服从不足等行为缺陷。
子主题:低资源推理 arXiv
多语言建模 后训练 强化学习 测量效度 母语推理 语言对齐 混合专家模型 低资源语言建模
研究对三款前沿混合专家模型进行希腊语推理微调;基础模型在 1,000 条轨迹中从未使用希腊语思考,而 SFT 后各公开检查点约 98% 的样本会使用问题对应语言推理,同时改善语法流畅度并基本保持通用能力。仅更换随机种子就会造成 7.7 个百分点的准确率波动,超过所有数据和训练配方带来的效果,说明准确率难以可靠识别真实行为变化。论文提出六个带长度相关性门控的行为测量维度,并通过随机奖励对照、预注册实验等方式识别评测工具自身的失真。SFT 后仍存在约 24% 的格式回退、3.5% 的推理通道答案泄漏及指令服从不足;可验证奖励强化学习将前两者分别降至 2.5% 和 0%,提高“用英语思考”等指令的遵循率,同时保留希腊语推理习惯。
用途与启示
- 评估低资源语言模型时,不能只看最终答案准确率,还应检查推理语言、语法质量、格式遵循、通道边界和指令服从。
- 可先用 SFT 建立稳定的目标语言推理习惯,再用可验证奖励强化学习修复格式和行为层面的具体缺陷。
- 随机种子波动可能掩盖微调收益,实验应采用多种子复现、随机奖励对照、预注册设计及输出长度相关性门控。
- 该方法及其测量框架可迁移到其他低资源语言,以提升推理过程的可读性、可审计性和可纠正性。
📝 原始笔记(逐字保留)
标题:Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See
来源:arXiv
链接:https://arxiv.org/abs/2608.17744
摘要:Take three frontier mixture-of-experts models (Alibaba, OpenAI, NVIDIA; 3.6-4.0B active parameters each) and fine-tune them to reason in a low-resource language. On accuracy benchmarks almost nothing happens, and the benchmark itself is noise at this scale: changing only the random seed moves the score by 7.7 points, more than every data and recipe effect we measured. That null is our first result. The real changes live where accuracy cannot see. Base models never think in Greek: 0 of 1,000 reasoning traces, even when the question is Greek, so the model answers correctly while reasoning in a form its user cannot read, audit, or correct. After supervised fine-tuning (SFT), every released checkpoint reasons in the language of the question on ~98% of items, one family at 3x fewer tokens, with
[合并自 2026-08-22 sft-rl]
[用低资源语言进行思考:SFT 构建了什么,RL 修正了什么,准确率无法看见什么(10 ▲)](https://huggingface.co/papers/2608.17744?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-21)
Baobab:将 OWL 2 DL 编译为可微电路的神经符号学习
Baobab 将基于 SROIQ 描述逻辑的 OWL 2 DL 本体编译为哨兵决策图,通过加权模型计数训练感知网络,并刻画和缓解非 Horn 逻辑中的推理捷径。
子主题:本体推理 arXiv
神经符号人工智能 逻辑推理 捷径学习 形式化验证 描述逻辑 本体推理 加权计数
Baobab 面向完整 OWL 2 DL,而非仅限具有单一规范模型的 Horn 片段 EL++,保留经典逻辑蕴含能力。其先以基于后果的演算饱和命题核心,再在活动域上实例化名词、公称、数目限制和角色公理,最终编译为哨兵决策图(SDD)。系统利用证据条件下的加权模型计数,在部分 ABox 监督下训练 CNN 识别 MNIST 图像并恢复潜在本体概念。针对多个本体一致补全导致的推理捷径,论文提出按查询论证索引的混合模型,并通过电路枚举补全进行初始化,在实验中达到贝叶斯最优后验;编译器可靠性及相关表示结论由 Lean 4 机器验证。
用途与启示
- 为在完整 OWL 2 DL 知识约束下训练感知模型提供保持经典蕴含的可微实现路径。
- 可用于生物医学和语义网场景中部分标注、逻辑约束与视觉或其他感知信号的联合学习。
- 揭示多种逻辑一致解释可能诱发感知模型选择单一补全的推理捷径,并给出基于论证混合与补全枚举的缓解方案。
- 展示形式化验证可用于保障神经符号编译器的可靠性,为高可信逻辑学习系统提供参考。
📝 原始笔记(逐字保留)
标题:Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits
来源:arXiv
链接:https://arxiv.org/abs/2608.17741
摘要:OWL 2 DL ontologies, grounded in the description logic $\mathcal{SROIQ}$, express large knowledge bases in biomedicine and the Semantic Web. Neuro-symbolic (NeSy) learners over description logics either embed the ontology in a continuous space, abandoning classical entailment, or restrict to the Horn fragment $\mathcal{EL}^{++}$, which has a single canonical model. We present Baobab, which compiles a $\mathcal{SROIQ}$ ontology with a finite ABox into a Sentential Decision Diagram (SDD): it saturates a propositional core under a consequence-based calculus and instantiates the remaining $\mathcal{SROIQ}$ features (nominals, number restrictions, and the role axioms) over the active domain. The SDD's evidence-conditioned weighted model count then trains a perception network to recognize real i
用多样性剖面评估 AI 生成内容
论文提出曲线形式的“多样性剖面”,取代容易产生矛盾结论的单一标量指标,以更透明、具分辨率感知的方式评估 AI 生成内容的多样性。
子主题:多样性评测 arXiv
模型评估 测量效度 构念效度 多模态 多样性分析
现有方法通常在嵌入空间中计算样本间距离或相似度,再聚合为单一多样性分数,但不同指标的归纳偏置可能导致相互矛盾的排序。论文通过公理分析指出,代表性标量指标无法同时满足所有理想性质;实证分析还发现,高维表征会产生距离集中现象,且其分布依赖具体模态。为此,作者提出“多样性剖面”,在指定表征及距离或核函数后,跨阈值、尺度、指数或阶数评估参数化指标族。曲线化结果能够揭示多样性比较是否在不同分辨率下保持稳健,或只是由任意参数选择所驱动。
用途与启示
- 为生成图像、文本等内容的多样性评测提供比单一分数更完整的诊断工具。
- 在比较生成模型时展示结论对阈值、尺度和指标参数的敏感性,避免依赖任意超参数得出片面排名。
- 提醒评测设计者明确表征空间、距离函数和模态特性,提高多样性测量的透明度与构念效度。
📝 原始笔记(逐字保留)
标题:Evaluating the Diversity of AI-Generated Content with Diversity Profiles
来源:arXiv
链接:https://arxiv.org/abs/2608.17731
摘要:Diversity is a fundamental criterion for evaluating generative artificial intelligence (AI) systems, yet its measurement remains inherently ambiguous. Existing approaches typically represent generated samples in an embedding space, compute pairwise distances or similarities, and aggregate them into a single scalar score. Such scalar summaries are convenient, but they often encode different inductive biases and may yield contradictory rankings of the same sample sets. In this paper, we argue that diversity evaluation for AI-generated content is intrinsically under-specified when reduced to a single number. We first review representative diversity metrics, and then diagnose their limitations from two complementary perspectives: an axiomatic analysis showing that no representative scalar metr
跨视图对应是一种测量干预:智能体评测与信用分配的双向验证
论文指出跨视图输出对应并非中性预处理,并提出兼顾干扰消除与响应保真的双向验证、全最优解识别及不确定性传播框架。
子主题:对应审计 arXiv
测量效度 交互式评估 信用分配 智能体 轨迹验证 跨视图学习 对应校准
论文将智能体评测和轨迹学习中的跨视图对应视为一种测量干预:缺少对应会制造敏感性,而过度激进的映射会制造虚假不变性。作者提出三部分审计框架,包括对干扰消除与响应保真的双向验证、考察全部最优对应下结论是否一致,以及在效度成立后传播不确定性。对公共代码与 SQL 流水线的实验显示,两种确定性最优回溯在 1,586 个非零轨迹对中的 55.9% 上给出了不同的时间定位;工具使用审计还发现精确最优解之间可能出现回合级信用符号反转。控制实验进一步表明,仅用良性样本校准的映射可能抹除所有保留下来的有害响应,而双向验证能够筛选出保留真实响应的替代映射。
用途与启示
- 将跨视图对齐、轨迹匹配和回溯算法纳入评测协议,而不是作为无需说明的预处理步骤。
- 在报告智能体敏感性、不变性或回合级信用前,同时验证映射是否消除了无关变化并保留了任务相关响应。
- 对所有精确最优对应计算结论范围;若信用坐标的非零符号不能在全部最优解中保持一致,则不应给出点式归因。
- 为轨迹学习和智能体评测增加对应关系审计与不确定性传播,降低由任意匹配规则造成的伪结论。
📝 原始笔记(逐字保留)
标题:Cross-View Correspondence Is a Measurement Intervention: Two-Sided Validation for Agent Evaluation and Credit Assignment
来源:arXiv
链接:https://arxiv.org/abs/2608.17713
摘要:Agent evaluations and trace-based learning often compare outputs across transformed views through a post-response correspondence treated as neutral preprocessing. We show that this correspondence is a measurement intervention: omitting it can manufacture sensitivity, an over-aggressive map can manufacture invariance, and multiple optimal correspondences can leave mechanism labels and signed learning credit unidentified. We develop a validity theory and audit with three components: two-sided validation of nuisance removal and response preservation, all-optima identification of downstream conclusions, and uncertainty propagation after validity is established. We characterize the linear feasibility boundary for response-preserving nuisance removal, compute sharp ranges over exact-optimum corr
金融智能体自进化审计:能力增益、安全漂移与执行接口错配
研究审计三类自进化金融智能体,发现能力提升可能伴随攻击面扩大、未授权状态变更增加,并揭示技能产物与执行器接口错配会严重扭曲评测结果。
子主题:安全审计 arXiv EvalEvolve
智能体 自进化 智能体安全 安全审计 技能演化 接口边界 状态安全 模型评估 安全漂移 接口错配 金融智能体
- 研究在模拟电子银行环境中审计 SkillOpt、Agent Workflow Memory(AWM)和 ReasoningBank,采用匹配的良性经验轨迹、密封评测端点、执行落地检查与独立状态回放。
- 在 Qwen 3.7 Flash 上,SkillOpt 将良性效用从 0.741 提升至 0.837,但注入内容暴露率由 0.820 升至 0.943,总体攻击成功率由 0.496 升至 0.530,未授权金融状态变更达到 0.685。
- ReasoningBank 将效用提升至 0.859,且未增加总体攻击成功率,但未授权状态变更仍略高于静态基线,说明单一 ASR 指标不足以反映真实风险。
- AWM 的 WebArena 文本动作封装与原生函数调用执行器不兼容;移除该封装后效用从 0.319 恢复至 0.756,同时暴露率和攻击成功率显著上升,表明接口错配既会压低能力评测,也可能掩盖安全风险。
用途与启示
- 自进化智能体不能只比较演化后的任务准确率,还应同步追踪能力回归、恶意内容接触、条件攻击成功率和未授权环境状态变更。
- 金融智能体的安全评测应以实际执行结果和独立状态回放为准,避免仅依据模型回复文本判断是否造成损失。
- 在比较不同技能、工作流或记忆机制前,应验证其产物格式与目标执行器兼容,防止接口错配形成虚假的低能力或低风险结论。
- 多条独立演化谱系可能产生不同安全结果,因此需要重复演化实验并报告风险方差,而非依赖单次运行。
📝 原始笔记(逐字保留)
标题:Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch
来源:arXiv
链接:https://arxiv.org/abs/2608.17684
摘要:Self-evolving agents turn experience into reusable skills, workflows, or memories, but post-evolution accuracy alone does not show whether learned behavior preserves previously correct behavior or security. We audit SkillOpt, Agent Workflow Memory (AWM), and ReasoningBank in simulated e-banking using matched benign acquisition trajectories, sealed evaluation endpoints, execution-grounded checks, and independent state replay. On Qwen 3.7 Flash, SkillOpt raises benign utility from 0.741 to 0.837 while exposure to injected content rises from 0.820 to 0.943. Conditional attack success after exposure falls from 0.605 to 0.562, yet overall attack success rate (ASR) rises from 0.496 to 0.530 and unauthorized financial state changes rise to 0.685. Across three independently evolved lineages, capab
自动化安全补丁回移基准:现有工具能走多远?
Porting Benchmark以统一框架评测五类自动安全补丁回移工具,揭示其在复杂、跨版本和跨仓库场景中的泛化能力远低于既有同质化评测所呈现的水平。
子主题:补丁回移 arXiv
软件缺陷修复 网络安全 SWE 软件工程 模型评估 跨域泛化 补丁移植
论文提出 Porting Benchmark,收录 1,234 个跨版本、跨分支及跨仓库的安全补丁回移案例,并提供统一评测框架。对程序分析、LLM 提示和 LLM 智能体等五种工具的对齐评测表明,统一协议会显著改变既有性能排名。随着补丁结构复杂度提升,最佳提交级成功率从 Type-I 的 85.2% 降至 Type-IV 的 24.0%。研究归纳出目标 API 感知缺失、跨版本语义不匹配、非局部依赖传播失败以及补丁构造或定位失败四类根因。动态验证还显示,精确匹配会低估合理的目标适配,而静态参考一致性也可能遗漏真实集成故障。
用途与启示
- 为自动化安全补丁回移工具提供覆盖异构场景的统一比较基准。
- 提醒研究者避免仅凭参考补丁精确匹配判断修复成败,应结合测试、POC 与可执行验证。
- 指导下一代工具加强目标 API 识别、跨版本语义适配和非局部依赖传播能力。
- 表明可执行反馈迭代对高难案例有一定恢复作用,但仍需更强的补丁定位与集成验证机制。
📝 原始笔记(逐字保留)
标题:Benchmarking Automated Security Patch Backporting: How Far Are We?
来源:arXiv
链接:https://arxiv.org/abs/2608.17671
摘要:Automated security patch backporting is critical for mitigating N-day vulnerabilities. Recent tools report success rates above 80% on their respective datasets. However, these evaluations are often confined to homogeneous environments, such as one repository or specific project versions. Consequently, it remains unclear how well these tools generalize beyond their originally targeted scenarios. We present Porting Benchmark, a curated dataset of 1,234 security patch backporting cases spanning cross-version, cross-branch, and cross-repository scenarios, paired with a common evaluation framework. Using this benchmark, we evaluate five tools spanning program analysis, LLM prompting, and LLM agents under aligned settings. Our results show that aligned evaluation changes the apparent performance
GraphWake:利用记忆级联诱导 LLM 智能体社区群体极化
GraphWake 将智能体记忆作为持久化通道、公共讨论作为传播通道,仅干预少量目标智能体即可在 LLM 智能体社区中级联放大群体极化。
子主题:极化攻击 arXiv
多智能体系统 智能体记忆 意见演化 群体动力学 智能体安全 群体极化 记忆投毒 极化传播
论文提出“记忆介导的极化级联”威胁,通过少量目标智能体的记忆系统持久保存立场强化论据。随后,立场中性的公共讨论提示触发目标智能体检索并复述这些论据,使未被直接干预的智能体受到影响并继续传播。GraphWake 使用立场支持论证知识图谱构造论据,以面向公理的三元组选择提升记忆保留与复现的可靠性,并通过中性记忆提示启动并发传播。跨多种讨论场景和记忆系统的实验表明,该方法能显著提高智能体社区的群体极化程度。
用途与启示
- 揭示智能体长期记忆可能成为低成本、隐蔽且持续的社区级操纵入口。
- 为多智能体平台的记忆写入审计、检索监控和异常意见传播检测提供威胁模型。
- 提示安全评测不应只检查单个智能体或提示词,还应覆盖跨轮次记忆效应与群体级联风险。
- 可用于设计针对记忆投毒、极化传播和协同操纵的红队测试与防御机制。
📝 原始笔记(逐字保留)
标题:GraphWake: Group Polarization via Memory-Mediated Polarization Cascade in LLM-Agent Communities
来源:arXiv
链接:https://arxiv.org/abs/2608.17665
摘要:LLM-driven agents can autonomously exchange opinions on online platforms and form communities. Such agent-operated social platforms raise a new security concern: attackers may manipulate agents to induce group polarization. Existing methods manipulate agent prompts or construct echo chambers, both of which are difficult to realize in practice. We therefore formulate a new threat, Memory-Mediated Polarization Cascade, which uses agent memory as a persistence channel and public discussion as a propagation channel. This threat contains three stages. During exposure and memory retention, the attacker exposes a small set of target agents to arguments that reinforce their respective stated stances. The targets' memory systems then process and retain these arguments. During retrieval and reproduc
MobileWorldSafety:Android GUI 智能体环境注入安全基准
MobileWorldSafety 通过真实 Android 应用中的 142 项风险任务评测 GUI 智能体抵御环境注入攻击的能力,发现六类受测智能体的攻击成功率高达 40.4% 至 66.9%。
子主题:提示注入评测 arXiv
智能体安全 提示注入攻击 具身智能评估 红队测试 智能体 环境注入 移动安全
MobileWorldSafety 面向智能手机 GUI 智能体在日常移动环境中遭遇的间接提示注入和对抗指令,构建了基于真实 Android 应用的 142 项风险任务。每项任务都针对最终系统状态定义可编程验证的风险指标,并采用规则验证与 LLM 裁决相结合的两阶段评测流程。该设计能够区分安全失效与能力不足,提高评测的客观性和可复现性。对六种通用或专用 GUI 智能体的实验显示,其攻击成功率介于 40.4% 至 66.9%,表明现有智能体容易将恶意环境内容当作普通上下文执行。
用途与启示
- 为移动 GUI 智能体提供贴近日常应用场景的环境注入安全测试集。
- 通过最终状态风险指标区分安全违规与任务执行能力不足,减少评测歧义。
- 可用于比较防注入策略、权限控制、指令来源识别及安全对齐方法的效果。
- 提示实际部署手机智能体时,应将屏幕内容、通知和应用内文本统一视为不可信输入。
📝 原始笔记(逐字保留)
标题:MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps
来源:arXiv
链接:https://arxiv.org/abs/2608.17659
摘要:LLM-powered GUI agents that autonomously operate smartphones are rapidly transitioning from research prototypes to early real-world deployment. However, because these agents routinely process untrusted environmental content, they are highly vulnerable to environmental injection attacks, which include indirect prompt injections and adversarial instructions. Such attacks can manipulate the behavior of agents without user awareness through diverse channels encountered in everyday mobile use. Despite these risks, existing benchmarks often fail to capture everyday user scenarios, lacking a systematic evaluation of GUI agents under environmental injection attacks on mobile devices. To address this gap, we introduce MobileWorldSafety, a benchmark of 142 risk tasks built on real Android applicatio
J64/R64:从原生 MoE 路由读出可解释推理状态
论文将模型内部推理状态压缩为可解释的 J64 语义坐标,并从原生专家路由统计重建低开销 R64,用于候选选择、加权投票、动态停止与推理机制干预。
子主题:状态读出 arXiv
混合专家模型 状态表征 人工智能可解释性 模型路由 停止策略 测试时计算 状态读出 路由干预
论文提出两级 MoE 推理状态读出:先从词表尺度的 J-space 蒸馏出包含 64 个语义轴的 J64,以区分推理投入与题目引发的压力等未显式写入思维轨迹的状态。J64 相比基于相同 rollout 令牌占用率的基线,在留出集上的 AUC 提升 0.096~0.135。研究进一步利用原生专家路由统计重建 R64,其各轴与 J64 的中位相关系数在三个模型、两个模型家族上达到 0.69~0.86,并在 gpt-oss-20b 上保留 J64 预测增益的 95%~100%。J64/R64 可改善单分支选择和加权投票,滚动窗口还能驱动停止并重采样策略;针对相关路由机制的编辑也产生了预期行为,使推理由数值猜测转向精确符号执行。
用途与启示
- 为无法从显式思维链观察到的内部推理过程提供可解释、可量化的状态监测方法。
- 可将 R64 作为低开销在线信号,用于候选答案路由、加权投票以及动态停止和重采样。
- 展示了从相关性诊断走向路由机制干预的路径,有助于定位推理停滞并主动改变模型行为。
- 提示 MoE 的专家路由统计不仅是计算调度信息,也可作为部署阶段的过程监督与可靠性信号。
📝 原始笔记(逐字保留)
标题:Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing
来源:arXiv
链接:https://arxiv.org/abs/2608.17638
摘要:What a reasoning model writes is only a partial record of the process that produces it. We introduce a two-level internal readout for mixture-of-experts reasoning. We first distill vocabulary-scale J-space into J64, a 64-axis semantic frame learned from the model's own reasoning states. J64 reveals readable process state that the emitted trace does not show: it separates inference effort from problem-induced strain. It also adds 0.096 to 0.135 held-out AUC over a baseline that reads the same rollout as token occupancy and aggregates it in exactly the same way. We then reconstruct J64 from native expert-routing statistics. The result is R64, a low-overhead proxy: its median per-axis correlation with J64 is 0.69 to 0.86 across three models and two families, and on gpt-oss-20b it preserves 95
HarnessRisk:面向生命周期的智能体 Harness 安全基准
HarnessRisk 以六阶段生命周期和128个沙箱案例系统评测智能体 Harness 的安全风险,发现配置阶段最脆弱,且识别风险并不必然转化为安全行动。
子主题:生命周期安全 arXiv HarnessEvolve
智能体安全 智能体评估 生命周期管理 状态安全 权限传播 安全审计 配置安全 工具链安全
HarnessRisk 将智能体 Harness 安全划分为配置、能力扩展、运行时操作、状态持久化、行动控制和事件恢复六个阶段。基准包含128个沙箱案例,每个案例都将正常用户目标与隐藏在不可信工作流产物中的对抗指令配对,并以效用、攻击成功率、持久性和检测率评估完整轨迹。对三个 Harness、六个语言模型及14种配置的实验显示,攻击成功率为12.6%至80.9%,而任务效用仍保持在75.0%至97.6%。Harness 配置阶段在所有系统中最易受攻击,并且部分配置即使风险检测率超过90%,仍存在显著的攻击成功率。
用途与启示
- 为智能体 Harness 提供覆盖部署全生命周期的统一安全评测框架。
- 提醒开发者重点保护安全敏感配置、权限参数、持久状态和恢复流程。
- 说明风险识别能力不能替代安全执行机制,评测应同时检查检测结果与实际行动。
- 支持在模型与 Harness 联合配置层面比较安全性,而非仅孤立评估模型。
📝 原始笔记(逐字保留)
标题:HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety
来源:arXiv
链接:https://arxiv.org/abs/2608.17597
摘要:Large language models are increasingly deployed through agent harnesses that manage tools, extensions, persistent state, permissions, and external actions. Existing safety benchmarks mainly target individual attack mechanisms or a limited subset of operational settings, making it difficult to compare how safety failures emerge across different harness responsibilities. We present HarnessRisk, a lifecycle oriented benchmark that organizes agent harness safety into six operational phases including Harness Configuration, Capability Extension, Runtime Operation, State Persistence, Action Control, and Incident Recovery. HarnessRisk contains 128 sandboxed cases, each pairing a benign user objective with an adversarial instruction embedded in an untrusted workflow artifact. We evaluate each traje
TRUSS:兼顾任务可靠与用户安全的智能体技能生成框架
TRUSS通过静态证据审查、受控影子执行和执行轨迹驱动的迭代修复,自动生成兼具任务有效性与安全可靠性的智能体技能。
子主题:技能生成 arXiv
智能体 技能安全 智能体技能库 可信执行 安全审计 技能生成 影子执行
TRUSS先依据来源与领域证据核验技能的功能声明,并按照九项预定义安全属性审查完整技能制品。通过静态门控的候选技能会被加载至可控执行环境中的影子智能体,由工具代理层实施策略约束,并记录保留来源信息的执行轨迹。框架把功能失败和安全属性违规定位回具体技能内容,据此进行迭代优化。在SkillInject、SkillSafetyBench和SkillGenBench上的实验中,TRUSS实现漏洞检测精确率与召回率均为100%,将技能生成任务有效率从17.11%提升至52.94%,同时把安全率从50.80%提升至100%。
用途与启示
- 为自动生成智能体技能提供“静态审查—受控执行—证据反馈—迭代修复”的闭环方法。
- 说明仅检查技能制品或最终任务结果不足以发现真实行为及其副作用,执行轨迹应成为安全评估的核心证据。
- 可用于构建技能市场、企业智能体平台和工具调用系统的准入门控与自动修复机制。
- 将功能故障和策略违规归因到具体技能内容,为可审计、可追溯的技能演化提供基础。
📝 原始笔记(逐字保留)
标题:TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation
来源:arXiv
链接:https://arxiv.org/abs/2608.17588
摘要:Agent Skills package reusable natural language procedures with executable resources, enabling software agents to acquire task specific capabilities without model adaptation. Automatically generating such Skills can improve task performance, yet evaluating a candidate solely from its artifact or final task outcome leaves unresolved which actions the equipped agent will perform and which side effects those actions will produce. We present TRUSS, an evidence guided framework for generating functionally effective and safety reliable Agent Skills. TRUSS first inspects functional claims against source and domain evidence while evaluating the complete artifact under nine predefined safety properties. Candidates admitted by this static gate are loaded by a shadow agent inside a Controllable Execut
WER:通过执行反馈强化学习实现技能优化
WER 将技能编写、重复执行和结果精炼组织为多阶段强化学习流程,使独立优化器能够从成败轨迹中持续改进工具智能体的自然语言技能。
子主题:技能优化 arXiv
技能演化 强化学习 工具调用 经验学习 信用分配 技能优化 执行反馈
专家编写的自然语言技能可以增强工具智能体,但智能体自行编写的技能反而比无技能基线低 8~11 个百分点,表明技能遵循与技能改进是两种不同能力。WER 在冻结的执行器之外训练独立 Skill Optimizer,由优化器提出技能、冻结智能体重复执行,并通过程序化验证器对结果评分。框架利用相对信用分配筛选结果有好有坏的记录,再将匹配的成功与失败轨迹构造成下一阶段的精炼状态。在 BFCL v4 多轮任务和 tau2-bench 上,WER 的平均 Pass@1 分别比无技能基线提高 7.80 和 3.85 点;训练后的 4B 优化器在 BFCL v4 上达到 76.63%。
用途与启示
- 将中间技能的执行结果转化为可训练状态,为智能体技能的持续优化提供闭环方案。
- 通过冻结执行器并单独训练优化器,解耦技能执行能力与技能改写能力。
- 成功和失败轨迹的配对可为技能改进提供更明确的相对信用信号。
- 结果表明,小型专用技能优化器有机会超过通用大模型,并降低工具智能体迭代技能的成本。
📝 原始笔记(逐字保留)
标题:Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback
来源:arXiv
链接:https://arxiv.org/abs/2608.17587
摘要:Expert-written natural language skills can improve tool-using agents, yet agent-authored skills perform 8-11 points worse than using no skill. This gap suggests that following procedural guidance and improving it from execution evidence are distinct capabilities. Inference time loops can repair skills but do not improve the model that writes the next one. We study how to organize execution experience from intermediate skills into training states for an optimizer. We introduce WER (Write, Execute, and Refine), a multi-phase framework that trains a Skill Optimizer outside a frozen executor. The optimizer proposes skills, a frozen agent executes each repeatedly, and a programmatic verifier scores the outcomes. The scores provide relative credit and select mixed-outcome records. Matched succes
SRT:面向语言模型持续预训练的间隔复习
SRT利用SM-2算法和样本级困惑度自适应安排历史与新增样本复习,在不修改模型、目标函数和优化器的情况下改善持续预训练的稳定性—可塑性权衡。
子主题:间隔重复调度 arXiv
持续学习 模型训练 经验复用 间隔重复 样本调度 灾难性遗忘
论文将语言模型持续预训练重新表述为自适应复习调度问题,不仅决定历史数据的回放比例,还针对不同遗忘速度选择具体样本。Spaced Repetition Training(SRT)为每个样本维护复习状态,将困惑度映射为回忆质量信号,并借助SuperMemo-2算法安排历史样本保持与新样本巩固。实验显示,在时间分隔的Wikipedia与代码语料上,SRT可挽回朴素持续预训练所损失的5至37个百分点旧知识准确率,同时保持或改善新知识习得。更大规模实验中,SRT能更好维持综合基准表现,视觉和表格数据实验也初步表明该调度原则具有跨模态适用性。
用途与启示
- 为持续预训练提供比固定新旧数据混合比例和均匀回放更细粒度的样本级调度方案。
- 可依据样本困惑度动态识别易遗忘内容,将训练算力优先投入最需要复习的样本。
- 方法无需改动模型结构、训练目标或优化器,便于集成到现有持续训练流水线。
- 间隔复习原则有望扩展到语言之外的视觉、表格等持续学习任务。
📝 原始笔记(逐字保留)
标题:When to Review: Spaced Repetition for Continual Pre-Training of Language Models
来源:arXiv
链接:https://arxiv.org/abs/2608.17530
摘要:Continual pre-training of large language models must acquire new information without erasing old knowledge. Existing replay methods often choose a global old/new mixture and sample uniformly, ignoring that examples differ in how quickly they are forgotten. We formulate continual pre-training as adaptive review scheduling: the training loop should decide not only how much history to replay, but which examples should return at each step. We introduce Spaced Repetition Training (SRT), a continual learning framework inspired by cognitive science, which schedules sample-rehearsal using the SuperMemo-2 (SM-2) algorithm. SRT maintains per-example review state, maps per-example perplexity to a recall-quality signal, and schedules historical examples for retention and new examples for consolidation
当 AI 设计 AI:创新还是模仿?
研究发现,LLM 智能体虽能偶尔设计出达到或超过人类 SOTA 的方法,但绝大多数设计仍局限于人类已有算法空间,主要体现为重组而非原创。
子主题:设计创新 arXiv
设计智能体 自动化设计 创新模式 智能体 模型评估 算法创新 设计空间
论文从人类设计的方法中提取任务特定的算法设计空间,并将人类与智能体设计的方法映射到其中,以模块为单位量化设计差异。研究在横跨多种模态的开放式 AI 任务上评估常用 LLM 智能体,兼顾任务性能与算法新颖性。实验中,智能体仅在 72 种配置中的 10 种达到或超过人类 SOTA,且这种成功无法跨任务或智能体稳定泛化。约 96.8% 的智能体方法落在人类衍生的设计空间内,近半数与已有的人类算法设计完全一致,表明当前能力主要来自既有模块的复用和重组。
用途与启示
- 为自动化 AI 方法设计提供同时衡量性能与算法新颖性的评估框架。
- 提醒研究者不要仅凭 SOTA 指标判断智能体具备真正的算法创新能力。
- 可通过设计空间覆盖率、模块差异和与既有方案的精确匹配率检测“伪创新”。
- 启示后续系统应加强设计空间外探索,并验证新模块是否带来可泛化的性能收益。
📝 原始笔记(逐字保留)
标题:When AI Designs AI: Innovation or Imitation?
来源:arXiv
链接:https://arxiv.org/abs/2608.17471
摘要:Recent advances in LLM agents have made them increasingly capable of designing methods for complex AI tasks. This raises two central questions about agent-designed methods relative to human-designed methods: how well they perform, and how different their algorithmic designs are. To study these questions, this paper introduces an analysis that derives task-specific algorithmic design spaces from human-designed methods, maps both human- and agent-designed methods into these spaces, and quantifies their algorithmic differences at the module level. Widely used LLM agents are evaluated on a suite of representative, open-ended AI tasks spanning multiple modalities, and the methods they design are analyzed in terms of both task performance and algorithmic differences from human-designed methods.
SAGE:归因引导规则演化的自进化分镜技能
SAGE从专家分镜示范中归纳、归因并演化导演规则,通过场景化路由按需注入知识,在实际短剧生产中达到接近专业导演的质量并显著降低制作成本。
子主题:分镜演化 arXiv EvolveLLM
技能演化 技能归因 规则学习 经验检索 交互式叙事 分镜生成 导演知识
SAGE通过对比训练剧本与专业导演分镜,提炼不依赖具体剧集内容的导演规则。生成时,系统记录每个叙事组采用的规则,并结合局部反馈将效果归因到具体规则,从而实施针对性更新。演化后的规则被组织成带路由索引的场景包,使每个叙事组只检索有限且适用的知识。在三个类型的18集测试中,SAGE获得77.8分,高于专业导演的77.1分;上线14天产生1,344组输出,其中87.2%无需实质修改,并将单集编写时间减少83%以上。论文同时发布PROSE数据集,包含68集剧本与专业分镜配对数据。
用途与启示
- 为隐性专家知识提供“示范提炼—执行归因—规则更新—按需路由”的闭环演化路径。
- 证明细粒度记录规则使用情况能够把局部反馈准确转化为可维护的知识更新。
- 场景包与路由索引可缓解全量知识注入造成的上下文超限和无关信息干扰。
- PROSE可用于分镜生成、导演知识学习及规则演化系统的训练与评测。
📝 原始笔记(逐字保留)
标题:SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution
来源:arXiv
链接:https://arxiv.org/abs/2608.17468
摘要:Storyboards turn screenplays into visual shot plans for automated short drama production. Professional storyboarding relies on tacit directorial expertise and remains an industrial bottleneck. Large language models can automate this step, but methods for supplying directing knowledge face three challenges: (1) Knowledge acquisition: the craft remains implicit in exemplars or must be written manually. (2) Knowledge refinement: authored knowledge is not evaluated against execution outcomes, and opaque generation prevents feedback attribution to the knowledge behind each decision. (3) Knowledge injection: injecting all knowledge exceeds usable context, while manual selection for every narrative group does not scale. We present SAGE (Skill with Attribution-Guided Evolution), a deployed framewo
SIRLM:结构内化规则语言模型实现可信知识图谱推理
SIRLM通过结构关系记忆、知识图谱分词器和神经符号规则执行反馈,将大模型推理锚定于图谱结构证据,提升知识图谱推理的效果与忠实性。
子主题:知识图谱推理 arXiv
链接预测 神经符号人工智能 规则学习 证据推理 内部一致性 知识图谱 结构内化 规则语言
论文指出,知识图谱结构上下文与大模型参数知识之间的表征不一致,会引发“推理证据感知漂移”,削弱推理效果和忠实性。作者提出结构内化规则语言模型 SIRLM,以结构规则生成为核心,将结构知识学习与推理逻辑的忠实性评估结合起来。其规则生成器 SIRG 引入结构关系记忆、基于结构不变性学习的 KG tokenizer,以及通过规则约束消息传播实现的神经符号推理器。SIRLM 可接入 SFT、GRPO 等标准训练范式,并在 36 个数据集上相较 17 种先进知识图谱推理方法取得显著优势。
用途与启示
- 为缓解大模型参数知识与知识图谱结构证据之间的错位提供结构内化方案。
- 可借助可执行规则和神经符号反馈,提高知识图谱推理过程的可验证性与忠实性。
- 展示了结构专用 tokenizer、关系记忆与强化学习训练范式结合的可行路径。
- 可用于关系预测、事实补全及其他要求严格遵循图结构约束的推理任务。
📝 原始笔记(逐字保留)
标题:Structure-Internalized Rule Language Model for Faithful Knowledge Graph Reasoning
来源:arXiv
链接:https://arxiv.org/abs/2608.17443
摘要:Knowledge Graph Reasoning (KGR) aims to discover latent facts by leveraging the structural evidence available in KGs, posing a challenge to the structural semantic understanding capability of KGR models. Recent studies have demonstrated that Large Language Models (LLMs) can achieve remarkable progress on KGR tasks via flexible in-context learning. However, the inherent representation inconsistency between KG structural context and LLM parametric knowledge remains inadequately addressed. This limitation prevents LLMs from effectively perceiving reasoning evidence that aligns with KG constraints, which undermines both the effectiveness and faithfulness of reasoning. We refer to this problem as reasoning evidence perception drift of LLMs over KGs. To address this problem, we propose a Structu
面向关键基础设施运维的任务感知 Harness 配置
研究将关键基础设施智能体的 Harness 配置建模为任务需求与资源供给的匹配问题,并通过按任务配置、失败后升级的策略优化准确率与令牌成本。
子主题:配置供应 arXiv HarnessEvolve
智能体 模型路由 资源调度 成本优化 工具调用 人工智能可靠性 配置供应 任务分配
论文依据底层系统的数学表示对关键基础设施任务分类,并按可提供信息的数量与类型对 Harness 配置分级。研究通过文献挖掘和受控智能体执行实验,建立任务到 Harness 的映射,并提出“映射引导升级”算法:先提供任务专属配置,仅在自检失败后扩展至完整配置。在液冷任务中,该方法将准确率由完整供给时的 0.652 提升至 0.715,并以少 48% 的令牌达到与 Reflexion 相当的准确率。在电网任务中,完整供给仍具有最高准确率,表明 Harness 配置存在依赖领域的准确率—成本 Pareto 前沿,而非统一最优方案。
用途与启示
- 为高风险基础设施智能体提供按任务最小化权限、信息和工具暴露的配置思路。
- 可通过自检失败触发渐进式资源升级,在可靠性与推理成本之间进行动态权衡。
- 提示 Harness 路由策略应针对具体领域和任务测量,不能默认完整配置始终最优。
- 可作为智能体运行时资源调度、工具权限治理及成本优化的设计参考。
📝 原始笔记(逐字保留)
标题:Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations
来源:arXiv
链接:https://arxiv.org/abs/2608.17433
摘要:LLM agents have been widely adopted to operate mission-critical infrastructure (MCI). These agents normally rely on a harness that determines what information they can access, which tools they can use, and what actions they can take. Existing systems often expose the same comprehensive harness to every task, which may not be necessary and cause resource wastes. In this paper, we focus on the identification of optimal harness configurations, and view it as a resource-matching problem between what each task requires and what the harness provides. To measure this match, we classify MCI tasks based on the mathematical representation of the underlying system and rank harness configurations by the amount and type of information they provide. We then construct task-to-harness mappings from two so
GUPO:面向大模型后训练的梯度不确定性感知策略优化
GUPO以贝叶斯方式估计组梯度的不确定性,并据此校准梯度聚合权重,以缓解GRPO中的梯度方向冲突并提升大模型推理后训练效果。
子主题:策略优化 arXiv EvolveLRM
后训练 强化学习 策略优化 贝叶斯方法 人工智能可靠性 梯度冲突 梯度聚合
GRPO直接平均同一小批次内不同查询产生的组梯度,但这些梯度可能方向冲突,进而导致低效的策略更新。GUPO将每个组梯度建模为贝叶斯框架下的随机变量,并估计其概率分布。该方法采用基于Dirichlet分布的形式刻画梯度不确定性,再按可靠程度校准各组梯度对最终更新方向的贡献。多个基准上的实验表明,GUPO能够改善大语言模型推理任务的后训练效果。
用途与启示
- 为GRPO等群组式强化学习算法提供更可靠的梯度聚合机制。
- 利用不确定性降低冲突或低可信组梯度对策略更新的负面影响。
- 启示后训练系统从简单平均转向基于梯度可靠性的自适应加权。
📝 原始笔记(逐字保留)
标题:GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models
来源:arXiv
链接:https://arxiv.org/abs/2608.17411
摘要:Group Relative Policy Optimization (GRPO) has become a widely used approach for post-training Large Language Models (LLMs) for reasoning. In GRPO, the group gradients induced by different queries within the same mini-batch are directly averaged to form the policy update. However, these group gradients can point in conflicting directions. Our empirical analysis suggests that group-gradient conflicts tend to be associated with less effective policy updates, motivating the need for a reliable aggregated update direction under such conflicts. Standard GRPO aggregation treats the realized group gradients as deterministic contributions and does not account for differences in their reliability during aggregation. To address this issue, we propose Gradient Uncertainty-Aware Policy Optimization (GU
LEGO-RL:面向编程智能体原生 Harness 的强化学习框架
LEGO-RL 在不改动编程智能体 Harness 内部控制流的前提下,通过生成流代理、沙箱编排和轨迹监控实现可靠且训推一致的策略梯度训练。
子主题:训练-推理对齐 arXiv HarnessEvolve
人工智能辅助编程 强化学习 智能体 智能体脚手架 奖励作弊 智能体编排 训练-推理对齐
LEGO-RL 面向长时间运行的编程智能体 Harness,解决环境崩溃、奖励作弊及训练—推理行为脱节等问题。框架通过进程内 LLM 代理捕获原始生成流,并在训练端重新计算 token 级对数概率,即使 Harness 执行了上下文压缩或重序列化也能保持优化对齐。其沙箱编排支持镜像缓存和分阶段防护,同时集成自动验证、监控插件与 Live UI,以诊断细粒度智能体轨迹。使用 GSPO 训练 Qwen3.5-35B-A3B 后,模型在 OpenHands SDK、Claude Code 和 OpenCode 上的 SWE-bench Verified 成绩分别提升至 70.4%、68.2% 和 66.6%, rollout 与训练概率相关性保持在 0.99 以上。
用途与启示
- 为现有编程智能体 Harness 接入策略梯度训练提供低侵入方案,无须重写其内部控制流。
- 通过原始生成流捕获和训练端概率重算,降低上下文压缩、序列化差异造成的训推偏移。
- 利用分阶段沙箱防护与自动验证抑制奖励作弊,并提高长轨迹执行的稳定性。
- 可作为 Harness 演化、编程智能体后训练及跨 Harness 泛化研究的工程基础设施。
📝 原始笔记(逐字保留)
标题:LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents
来源:arXiv
链接:https://arxiv.org/abs/2608.17393
摘要:Reinforcement learning for coding agents increasingly relies on long-running agent harnesses to manage tool integration, repository contexts, and execution feedback. However, the native execution environments of these harnesses are inherently misaligned with policy-gradient training: environmental crashes and reward hacking corrupt outcome signals, while train-inference discrepancies decouple rollout behavior from policy updates. To address this, we present LEGO-RL, a framework that bridges native coding-agent harnesses with scalable policy-gradient optimization without modifying their internal control flow. LEGO-RL is built upon three pillars: (1) faithful optimization via in-process LLM proxying that captures raw generation streams for token-level alignment and robust trainer-side log-pr
开放权重模型实现纯 LLM PDDL 领域修复
研究评估开放权重大模型仅依靠 LLM 修复 PDDL 领域模型的能力,最佳模型虽以 0.87 的 F1 显著超过符号基线,但仍无法可靠满足全部测试约束。
子主题:领域修复 arXiv
任务规划 软件缺陷修复 形式语言 逻辑推理 开放权重模型 模型修复
论文研究如何根据正例与负例测试计划,自动修复存在错误的 PDDL 世界模型。作者采用不依赖外部符号修复器的纯 LLM 方法,评估近期开放权重大模型在该任务上的表现。最佳 LLM 在高推理强度下取得 0.87 的 F1,相比符号基线的 0.49 提升 0.38。然而,该设置的平均测试通过率仅为 0.82,并在 Thoughtful 领域降至 0.06;即使加入测试轨迹,最佳通过率也只有 0.92。
用途与启示
- 展示开放权重 LLM 在结构化规划模型修复上超越传统符号基线的潜力。
- 提醒研究者不能只依据 F1 判断修复质量,还应严格检查测试约束是否全部满足。
- 表明纯 LLM 方法目前尚不足以支撑高可靠的自动模型修复,可考虑结合符号验证与约束求解形成闭环。
📝 原始笔记(逐字保留)
标题:LLM-Only PDDL Domain Repair with Open-Weight Models
来源:arXiv
链接:https://arxiv.org/abs/2608.17341
摘要:AI planning is concerned with finding a sequence of actions that achieves a specified goal. It relies on explicit models of the world, commonly represented in the Planning Domain Definition Language (PDDL). An active line of research investigates how errors in such models can be detected and repaired. For example, users may provide positive test plans that are solutions, and negative test plans that fail during execution. Automated repair methods then modify the PDDL model to satisfy these constraints. In this paper, we evaluate the ability of recent open-weight large language models to perform this repair task using an LLM-only approach. Our experiments show that the symbolic baseline achieves an $F_1$ score of $.49$, while the best-performing LLM reaches $.87$ with high reasoning effort,
合成数据训练热红外无人机检测模型
研究提出先用合成场景训练、再以少量真实红外数据微调的无人机检测方案,并发现数据集语义对齐比模型规模更能决定性能。
子主题:红外目标检测 arXiv
数据合成 跨域泛化 视觉表征学习 航空人工智能 红外检测 无人机
研究面向中波与长波红外图像中的地对空无人机检测,解决纹理不足、传感器噪声、热对比度弱和标注数据稀缺等问题。方法首先利用合成场景学习初始目标表征,再使用真实域内红外数据进行微调。实验表明,即使只加入少量真实红外样本,也能显著缩小合成域与真实域之间的差距。相比扩大模型规模,数据集对齐对检测性能的影响更大,其中特征空间的语义对齐最具预测力,熵和动态范围等辐射属性也有助于提升鲁棒性。
用途与启示
- 为真实红外数据稀缺的无人机检测任务提供“合成预训练+少量真实数据微调”的实用路线。
- 数据预算有限时,应优先提升合成数据与部署场景的语义及辐射分布对齐,而非单纯扩大模型规模。
- 可将特征空间语义相似度、图像熵和动态范围用作合成数据筛选及质量评估指标。
📝 原始笔记(逐字保留)
标题:Training with synthetic data for drone detection in thermal imagery
来源:arXiv
链接:https://arxiv.org/abs/2608.17799
摘要:Ground-to-Air (G2A) drone detection in medium- and long-wave infrared (MWIR/LWIR) imagery is challenging due to reduced texture information, sensor noise, weak thermal contrast, and the scarcity of annotated data. This work investigates a synthetic-first training strategy that combines synthetic scene generation with fine-tuning on real data. We show that synthetic data provides an effective basis for learning initial object representations, while real in-domain thermal imagery is still essential for reliable deployment. Even small amounts of real IR data substantially reduce domain gaps. Our experiments indicate that dataset alignment has a stronger impact on performance than model scale. Finally, our analysis of the dataset suggests that semantic alignment in feature space is the stronge
商业 LLM API 迁移中的题项级能力回归测量
研究发现,商业 LLM 升级的总体分数会掩盖大量双向题项变化,即使整体性能提升,仍可能有显著比例的题目稳定退化。
子主题:迁移评测 arXiv
切片回归 模型评估 多样性分析 版本契约 评估方差 题项回归 模型迁移
研究针对 GPT-5.4 至 GPT-5.6 Sol 产品序列中的三组升级,在研究生知识、奥数和指令遵循基准的 900 个题项上,对每个模型和题项重复查询 50 次。作者结合错误发现率控制与实际显著性阈值,将题项划分为可靠提升、可靠退化、实际等价或结论不确定,并使用标签置换零假设进行校准。九个“迁移—基准”组合中均同时存在可靠提升与可靠退化;总体提升最多 7.3 个百分点的迁移仍包含最多 8.3% 的可靠退化题项。最新迁移在指令遵循任务上的严格评分下降 3.9 个百分点,而宽松评分仅下降 0.04 个百分点,说明评分口径也会显著影响迁移结论。
用途与启示
- 为依赖商业 LLM API 的软件系统提供比总体基准分数更细粒度的版本迁移评估方法。
- 在升级前识别与具体业务能力相关的稳定退化题项,避免总体增益掩盖关键功能回归。
- 建议通过重复采样、实际显著性阈值和多重检验校正建立迁移门禁,而非依赖单次测试。
- 严格与宽松评分结果的明显差异表明,迁移评测需要明确评分契约并保持跨版本一致。
📝 原始笔记(逐字保留)
标题:What Aggregate Scores Miss: Measuring Item-Level Regressions in Commercial LLM API Migrations
来源:arXiv
链接:https://arxiv.org/abs/2608.17719
摘要:Context: Software systems that depend on commercial large language model APIs must migrate to successor versions when vendors deprecate older models. Migration decisions typically rely on aggregate benchmark scores, which compress heterogeneous item-level behaviour into a single net figure. Objective: We measure what that compression conceals. Method: On three pairwise upgrades in the GPT-5.4 to GPT-5.6 Sol product sequence, we query 900 public benchmark items (graduate-level knowledge, olympiad mathematics, instruction following) 50 times per item per model, classify each item as reliably improved, reliably regressed, practically equivalent, or inconclusive under false-discovery-rate control and a practical-significance threshold, and calibrate the results against a label-permutation null
Judge, Retrieve, or Abstain:具风险保证的 LLM 裁判
该研究通过校准双重不确定性阈值,在参数化判断、检索增强和弃权之间动态路由,并以有限样本统计界保证已接受判决的错误率。
子主题:风险评估 arXiv EvalEvolve
人工智能可靠性 拒答校准 检索增强生成 模型路由 模型评估 风险控制 判决校准
论文关注无参考答案的客观任务中,LLM 裁判可能因知识不足或幻觉而给出不可靠判决的问题。方法利用留出校准集和有限样本 Clopper–Pearson 区间设定不确定性阈值,使已接受判决中的错误发现率以高概率低于用户指定水平 α。低置信度样本会从参数化判断模式路由至检索增强模式,通过网络证据重新评判,并应用第二个校准阈值决定接受或弃权。该双阈值路由无需额外假设即可继承风险保证,并在开放域问答基准及不同规模裁判模型上获得高于单模式基线的覆盖率。
用途与启示
- 为 LLM-as-a-Judge 提供可配置、可统计验证的可靠性边界,而非仅依赖经验置信度。
- 通过仅对低置信度样本启用网络检索,在评判覆盖率、错误风险与工具调用成本之间取得平衡。
- 可用于事实问答评测、自动数据验收和模型输出审核等需要高可信判决的流程。
- “判断—检索—弃权”的分层机制可作为评测系统中的安全门控与人工复核入口。
📝 原始笔记(逐字保留)
标题:Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees
来源:arXiv
链接:Using LLMs as judges has become standard practice for evaluating model outputs at scale. This is particularly common for subjective, open-ended tasks such as assessing helpfulness or alignment, where no single reference answer exists. However, objective tasks introduce a distinct reliability challenge for reference-free LLM judging. In the absence of a reference answer, the judge evaluates factual correctness either through its parametric knowledge or through tool augmentation. Although the former enables efficient evaluation, the judge may hallucinate or lack sufficient evidence for its verdict. Conversely, tool augmentation can provide additional evidence but introduces extra computational cost and requires an appropriate mechanism to determine when and how that evidence should be used reliably. More importantly, neither approach alone provides formal control over the risk of accepted verdicts or guarantees their reliability at a specified level. We propose a risk-controlled framework that calibrates uncertainty thresholds on a held-out set so that the false discovery rate among accepted verdicts remains below a user-specified level~α with high probability, using finite-sample Clopper--Pearson intervals. When the parametric mode is not sufficiently confident, the instance is routed to a retrieval-augmented mode, where the judge gathers web evidence and re-evaluates the instance under a second calibrated threshold. The finite-sample guarantee carries over to this two-threshold routing without additional assumptions. Across open-domain QA benchmarks and judges of varying scales, the framework maintains the target error rate while achieving substantially higher coverage than single-mode baselines.
Recirculation:基础模型的推理时再循环
Recirculation 通过在推理时引入由模型自身特性指导的循环架构,使冻结权重的现成基础模型能够持续更新信念状态,并显著降低困惑度、提升推理准确率。
子主题:循环推理 arXiv
循环计算 推理 测试时计算 递归模型 信念跟踪 架构演化
论文提出推理时架构增强方法 Recirculation,通过特定形式的循环让前馈 Transformer 表现为可跟踪信念状态的动力系统,突破状态更新次数受模型深度限制的问题。该方法无需重新训练模型权重,生成阶段几乎不增加延迟,但预填充阶段需要串行处理。作者进一步提出仅需轻量超参数调节的自适应版本,并将其与思维链、深度循环及训练递归 Transformer 的方案加以区分。在 Gemma 3 系列上,自适应 Recirculation 将多数据集困惑度降低 23%,使 GSM8K 准确率提升 21%,并在其他下游任务上取得稳定增益。
用途与启示
- 为冻结权重的现成基础模型提供低成本、训练无关的推理能力增强路径。
- 将基础状态跟踪交给循环动力学机制,可避免为简单状态更新消耗冗长的思维链令牌。
- 表明已训练模型的内部特性可以反向指导架构修改,为模型驱动的架构进化提供依据。
- 适合生成延迟敏感但可接受更高预填充串行成本的部署场景。
📝 原始笔记(逐字保留)
标题:Recirculation
来源:arXiv
链接:https://arxiv.org/abs/2608.17981
摘要:We describe an inference-time architectural enhancement for off-the-shelf foundation models that markedly reduces perplexity and boosts accuracy across generation and reasoning tasks. Our approach incurs essentially no additional latency during generation, though it requires serial processing in the prefill phase. Motivated by the fundamental limitation that state updates in feedforward transformers are bounded by model depth, our technique, recirculation, introduces a specific form of recurrence that allows the model to act as a dynamical system and track belief states. We distinguish this technique from chain-of-thought computation---which is better reserved for complex inferences rather than basic state tracking---as well as from popular depth-recurrence techniques (looping) and the costly training of recurrent transformers. We also propose and evaluate an adaptive variant of recirculation which requires only light tuning of hyperparameters while freezing the original model weights. Relative to the off-the-shelf baseline, adaptive recirculation achieves remarkable gains on the Gemma3 family, including a 23% reduction in perplexity on a suite of datasets, a 21% increase in accuracy on GSM8k, and reliable improvements in accuracy on other downstream tasks. Our training-free approach succeeds by leveraging the model itself to inform architectural modifications, suggesting a route to architectural evolution guided by a trained network's properties rather than forced, arbitrary design choices.
冻结 LLM 的几何约束“可解码但不可行动”鸿沟审计
研究以参数化 CAD 约束为受控测试场,发现冻结 LLM 隐状态中的几何信息即使可被线性解码,也未必能被模型生成、因果利用或稳定操控。
子主题:表征审计 arXiv
人工智能可解释性 因果归因 表征探测 状态读出 行为建模 几何约束 表征干预 可控性
研究对六个冻结的仅解码器 LLM 进行探测,从线性可解码性、强制选择生成、激活层影响和行为可操控性四个维度审计几何表征。预训练显著增强了局部几何关系的解码能力,且在打乱顺序、排除位置线索后仍保持优势;相比之下,草图级自由度(DOF)状态在随机初始化表征中就已高度可解码。尽管相关信息可跨层解码,模型生成却经常无法表达它,两个受测骨干模型在实体位置上的激活恢复效应也会消失。均值差 steering 同样无法可靠控制输出,说明“编码、解码、因果使用与行为控制”是可能彼此分离的能力。
用途与启示
- 提醒研究者不要将线性探针的高准确率直接解释为模型真正使用了对应知识。
- 可将生成测试、激活修补和 steering 与表征解码结合,建立更完整的模型机制审计流程。
- 参数化 CAD 提供了区分局部关系与全局约束状态的受控环境,适合研究几何推理和表征因果性。
- 随机初始化对照揭示部分探针性能可能来自架构或输入结构,而非预训练获得的知识。
📝 原始笔记(逐字保留)
标题:Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints
来源:arXiv
链接:https://arxiv.org/abs/2608.17843
摘要:Large language models (LLMs) have demonstrated strong performance on structured reasoning tasks, but what they encode and whether it informs model behavior remain unclear. We investigate this question through geometric reasoning, using parametric CAD constraints as a controlled testbed for separating local pairwise relations from sketch-level constraint status. By probing the hidden states of six frozen decoder-only LLMs, we examine four properties: linear decodability, forced-choice generation, activation-level influence, and behavioral steerability. Pretraining substantially improves the decoding of local geometric relations, and this advantage persists after accounting for positional cues with shuffled-order controls. In contrast, sketch-level DOF status is already highly decodable from randomly initialized representations and improves only modestly with pretraining, indicating that much of its probe performance is available without learned weights. Further analyses show that decodable information is not always actionable. Generation often fails to express this information, and on the two intervention-tested backbones, activation-restoration effects at the patched entity position vanish while decodability persists across depth. Mean-difference steering also does not reliably control outputs. These results show that decodability, generation, activation-level influence, and steerability can diverge in the tested setting. The audit provides a controlled way to distinguish failures to encode geometric structure from failures to express or control encoded information.
Agent Lightning v1.0:面向脚手架式智能体强化学习
Agent Lightning v1.0 将部署侧智能体脚手架直接接入强化学习后训练,以约 3,500 行代码实现轻量、通用且可复现的流程,并将 Qwen3.5-9B 在 SWE-bench Verified 上的成绩从 41.8% 提升至 56.4%。
子主题:智能体强化学习 arXiv HarnessEvolve
人工智能辅助编程 后训练 强化学习 智能体 智能体脚手架 训练-应用协同 人工智能框架 训练解耦
Agent Lightning v1.0 提出“脚手架式智能体强化学习”范式,由部署侧脚手架掌控工具、上下文、控制流与环境交互,训练器仅观测 LLM 请求—响应序列。框架通过 LLM endpoint proxy 将任意智能体接入强化学习训练,实现交互执行与训练后端解耦,整体约 3,500 行代码,并覆盖指令遵循、搜索和编码智能体。该范式需要专门处理重分词、样本合并、优势计算、损失归一化和后端调度等稳定性问题。使用约 6,000 条训练样本和有限算力,强化学习将 Qwen3.5-9B 在 SWE-bench Verified 上的成绩从 41.8% 提升至 56.4%,绝对提升 14.6 个百分点。作者还发布了完整的编码智能体强化学习工作流与训练脚本,以支持复现实验。
用途与启示
- 为不同智能体脚手架低侵入接入强化学习后训练提供轻量、通用且可复用的工程路径。
- 表明部署侧脚手架不仅是执行容器,其工具链、控制流和上下文管理也会影响训练数据语义、优化稳定性与最终效果。
- 可作为研究重分词、轨迹与样本合并、优势计算、损失归一化及异构后端调度等问题的可复现实验平台。
- 证明中等规模模型可借助少量训练样本和适度算力显著提升真实软件工程任务能力。
📝 原始笔记(逐字保留)
标题:Agent Lightning v1.0: Towards Harnessed Agentic RL
来源:arXiv
链接:https://arxiv.org/abs/2608.17528
摘要:Modern agents operate inside agent harnesses that manage tools, context, and control flow, making the harness a critical part of the agent system. Our original Agent Lightning introduced a disaggregated architecture that connects arbitrary agents to RL training through an LLM endpoint proxy, an approach later adopted by frameworks such as verl Uni-Agent, AReaL 2.0, slime, and Polar. We refer to this paradigm as harnessed agentic RL, where the deploy-time harness directly participates in model post-training. Harnessed agentic RL differs fundamentally from traditional agentic RL: the harness, rather than the training engine, owns the environment interaction loop, while the trainer observes only sequences of LLM request-response pairs. This introduces challenges in retokenization, sample merging, advantage calculation, loss normalization, and backend scheduling, which can substantially affect training stability and effectiveness. We present Agent Lightning v1.0, a lightweight framework for harnessed agentic RL implemented in approximately 3,500 lines of code. It supports arbitrary agent harnesses and serves as a practical testbed for studying these challenges. We evaluate it on instruction-following, search, and coding agents, and provide a complete reproducible pipeline for coding-agent RL. Using only 6K training examples and modest compute, RL improves Qwen3.5-9B on SWE-bench Verified from 41.8% to 56.4%, a 14.6-point absolute gain. We release the complete workflow and training scripts to facilitate reproducible research on harnessed agentic RL.
[合并自 2026-08-20 agent-lightning-v1-0]
[Agent Lightning v1.0:迈向可驾驭的智能体强化学习(16 ▲)](https://huggingface.co/papers/2608.17528?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-19)
AdaLens:长时智能体数据分析的交互式监控与引导
AdaLens 以故事线统一呈现智能体的分析计划、执行进度、中间发现与数据列使用情况,帮助分析师实时监控并干预长时数据分析流程。
子主题:交互监督 arXiv
交互式叙事 人在回路 数据科学 智能体 长程任务 交互监督 过程观测
AdaLens 面向多步骤、长时间运行的智能体数据分析,解决传统对话界面难以呈现并行分支和持续演化决策结构的问题。系统通过故事线表示统一组织分析计划、执行进度、中间发现以及相关数据列,提高工作流的可观测性。分析师可以基于这些分析元素提供方向性指导、终止低价值探索,或深化有潜力的分析分支。作者通过两个案例研究和一项用户研究评估了系统对监控与引导长时智能体分析的支持能力。
用途与启示
- 为长时间运行的数据分析智能体提供结构化、可追踪的过程视图,降低人工理解复杂执行轨迹的成本。
- 将人工干预锚定到计划、发现和数据列等具体分析元素,使引导操作比自然语言轮次交互更精确。
- 可作为人在回路智能体系统的界面设计参考,支持及时停止低价值分支并加深高价值探索。
- 启示智能体评测应同时关注最终结果、过程可观测性以及执行期间的可操控性。
📝 原始笔记(逐字保留)
标题:AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis
来源:arXiv
链接:https://arxiv.org/abs/2608.17834
摘要:Large language models are pushing data science toward increasingly autonomous and agentic workflows, with recent systems already supporting multi-step and long-running analyses. As these workflows become more autonomous, conventional interfaces no longer provide adequate support for two critical requirements: observability for understanding an agent's evolving reasoning and evidence, and steerability for redirecting low-value directions or deepening promising ones during execution. Existing interactive approaches improve process visibility and open intervention points, but they remain largely designed for discrete, turn-by-turn exchanges rather than the parallel branches and evolving decision structures of long-running agentic analysis. We study this need as interactive oversight in long-running agentic data analysis and present AdaLens, an interactive system for monitoring and steering ongoing runs. AdaLens combines a storyline-based representation that unifies analytical plans, execution progress, intermediate findings, and data-column involvement with steering interactions grounded in these analytical elements for directional guidance and execution control. We evaluate AdaLens through two case studies and a user study, examining how it supports analysts in monitoring and steering long-running agentic data analysis.
超越可疑步骤:长程智能体的本体信任
论文提出基于角色、目标与证据分解的在线监控器 RGE,用可回放的确定性信任状态识别长程智能体轨迹相对用户授权任务的渐进漂移。
子主题:轨迹可信度 arXiv
智能体安全 任务锚定 信任机制 原始证据 轨迹验证 长程任务 本体信任 轨迹漂移 前缀监控
论文提出“本体信任”,用于衡量长程智能体的轨迹前缀是否仍与用户授权的任务保持一致,而非只检查单步行为是否合法。RGE 在线监控器从角色(Role)、目标(Goal)和证据(Evidence)三个维度分解信任,LLM 仅负责生成结构化表示,状态更新、投影和干预决策均采用确定性机制。作者基于 OSWorld、FinanceBench 和 EICU-AC 构建跨领域轨迹语料,覆盖正常执行、前缀配对漂移和伪一致性失败。使用较大估计模型时,RGE 在各基准上的漂移检测 F1 均超过 93%,正常轨迹覆盖率不低于 95.8%;但伪一致性检测仍受任务完成状态能否被外部观察的限制。
用途与启示
- 将智能体安全审查从局部动作合规扩展到轨迹是否持续忠于用户授权,可用于长程任务的在线偏航预警。
- 角色、目标和证据三维分解有助于定位漂移来源,并支持针对性的暂停、回滚或人工复核。
- 确定性的信任状态更新可生成可重放、可审计的监控轨迹,降低对黑箱 LLM 裁判的依赖。
- 对不可外部观测的任务完成状态,仍需引入环境证明、执行反馈或可信状态读出,以缓解伪一致性盲区。
📝 原始笔记(逐字保留)
标题:Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents
来源:arXiv
链接:https://arxiv.org/abs/2608.17718
摘要:Long-horizon agents increasingly operate across many steps, tools, and observa- tions. In this setting, the relevant oversight question is not only whether each action is locally valid, but whether the evolving trajectory still corresponds to the task the user authorized. Drift can accumulate quietly: an agent may call the right tool with plausible arguments at every step, while its prefix moves toward a broader role, an adjacent objective, or evidence the user never supplied. Existing monitors mostly check local compliance, deliver final-trace verdicts, or score generic risk; they do not directly estimate this prefix-level relation. We introduce ontological trust, a task-conditioned property of trajectory prefixes, and instantiate it as RGE, an online monitor that decomposes trust along Role, Goal, and Evidence. RGE uses LLMs only to derive structured task and step representations; trust-state updates, projec- tions, and intervention decisions are deterministic, so the output is a replayable and auditable trust trajectory rather than a single end-to-end judge verdict. We construct a cross-domain trajectory corpus from OSWorld, FinanceBench, and EICU-AC, covering benign executions, prefix-paired drift, and pseudo-consistency failures. On this corpus, RGE outperforms adapted rule-, judge-, and shield-style baselines on prefix-paired drift detection. With the two larger estimator models, it exceeds 93% Drift F1 on every benchmark while keeping benign coverage at or above 95.8%. Pseudo-consistency is harder: detection depends on whether task completion is externally visible, a structural limit we characterize empirically.