2026-08-18 科研追新

当日精选(由提交工具自动创建)。

多智能体Harness加速自主科研:Kimi K3逼近Opus 5

Prime Intellect通过多智能体Harness提升实验试错吞吐量,使开源模型Kimi K3在nanoGPT优化任务中逼近顶级闭源模型,展示了科研基础设施驱动AI自我改进的潜力。

 自动化科学研究 多智能体系统 闭环科学研究 实验执行 系统优化 试错效率 科研基础设施 智能体编排

Prime Intellect让18个前沿模型在断网沙箱中自主修改代码、运行训练并验证假设,目标是以少于3290步将1.24亿参数GPT的验证损失降至3.28以下。团队共开展153次全自主实验,其中Fable 5达到2726步,Kimi K3配合Prime Agent Harness达到2930步,接近Opus 5的2920步并超过GPT-5.6 Sol的3042步。实验未发现真正全新的优化方法,但表明强模型更擅长处理噪声、复测旧方案、执行消融实验以及自行构建分析工具。研究由此认为,AI科研能力不仅取决于模型智力,也高度依赖Harness提供的持久状态、工具环境、多智能体协作和低成本试错吞吐量。

用途与启示
  • 为自主科研系统设计提供参考:将高层判断交给强模型,把监控、实现和批量实验分配给更便宜的开源模型。
  • 说明评估研究智能体时应重点考察噪声处理、复现实验、消融验证和假设回滚,而非只看能否提出新想法。
  • 展示持久IPython内核、沙箱执行和并行实验编排对长程科研任务的重要性。
  • 提示RSI可能由科研基础设施和实验吞吐量渐进推动,而不一定依赖单一闭源模型率先发生能力跃迁。
📝 原始笔记(逐字保留)
EvolveLRM | 闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5 https://mp.weixin.qq.com/s/BM4vYijAcAwdjPNTKfLAhg

真实工作场景中Agent成功率仍然偏低

RealReplicaBench等基准显示,Agent在电商、办公和生活等真实工作场景中的成功率及重复执行稳定性,仍显著落后于代码任务表现。

 智能体 人工智能应用 模型评估 人工智能可靠性 长程任务 真实世界任务 电子商务评估

RealReplicaBench从约160万条真实对话中提炼出107项可复现电商任务,覆盖采购、商品发布、物流、售后争议和跨平台对账等场景。基准通过检查邮箱、日历、草稿及JSON文件等最终状态进行全自动评测,每项任务的全部检查组均通过才计分,因而更贴近商业环境中的端到端成功标准。在PI Harness下,最高模型仅完成65项任务、通过率为60.75%,多数模型不足50%;采用电商专用Agent框架后整体成绩有所提升。E-Bench和VibeLifeBench也反映出类似问题:模型偶尔完成任务并不等于能够稳定、重复地完成真实工作,当前Coding能力与通用工作能力之间仍有明显差距。

用途与启示
  • 用于建立面向真实工作流、而非单一能力题目的Agent评测体系。
  • 提示评测应关注端到端任务成功率、最终环境状态和多次运行稳定性,避免仅看局部过程得分。
  • 表明领域专用Harness、工具配置及人机协同机制可能显著改善Agent落地效果。
  • 可将RealReplicaBench、E-Bench和VibeLifeBench纳入持续更新的新模型实测榜单。
📝 原始笔记(逐字保留)
Evolve应用|说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。https://mp.weixin.qq.com/s/APKrN2aRYo36PWSscczrdg

清昴智能以AI自进化打造国产万亿Token工厂

清华团队孵化的清昴智能通过自主优化与经验演化闭环,自动适配国产芯片并提升Token生产效率,推动AI Infra从人工调优走向持续自进化。

 自进化 系统优化 异构计算 经验复用 自动化部署 国产算力 算力工厂 算子优化

清昴智能将自我驱动机器学习理念用于AI Infra,让系统依据真实运行反馈自动定位瓶颈、搜索优化方案,并沉淀可跨模型、芯片和环境复用的经验。其技术体系由“自主优化”和“自主演化”构成,使算子开发、框架适配、内存调度和推理优化形成持续迭代闭环。文章称,复杂算子的开发调优可由约两周压缩至约1小时,国产芯片全链路打通可由约一个月缩短至1天至1周,部分算子相较基线最高加速30倍。公司已适配数十款国产芯片,并通过直接供应Token或输出私有化Token生产平台,建设日均万亿级Token工厂。

用途与启示
  • 展示递归自我改进思想从模型研发延伸至算子、编译、运行时和资源调度等基础设施环节的产业路径。
  • 可将每次调优产生的轨迹、性能反馈与成功方案沉淀为经验库,降低新模型和新芯片适配的重复试错成本。
  • 为国产异构算力提升利用率、缩短适配周期并降低大规模Agent服务的Token成本提供参考。
  • 评估此类系统时应持续核验端到端吞吐、延迟、稳定性、适配覆盖率及经验跨环境迁移能力,而不只关注单个算子的峰值加速。
📝 原始笔记(逐字保留)
自进化|AI Infra进入自进化时代!清华团队用「AI优化AI」造就国产万亿Token工厂https://mp.weixin.qq.com/s/WSdLvHOr1YHgXj5spag-5g

Apodex Discovery:面向真实发现任务的AI评测环境

Apodex Discovery以可验证、长周期、有状态的真实调查任务和HDS6多维指标,推动AI评测从预定义题目转向现实科学与产业发现。

 科学发现 科学智能 科学研究基准 过程评估 工具调用 开放式任务 科研智能体 真实世界基准

Apodex Discovery面向“发现型人工智能”,将基础模型、执行框架、工具和控制策略组成可开展长期、有状态、可验证调查的重型求解器。研究团队调研了16个行业门类下的561个产业,汇集423个高价值现实问题,并在首版中选取20项任务。框架采用统一的环境—任务—回合抽象,提供数据、工具、约束、反馈、轨迹记录,以及对中间产物和最终结果的验证。HDS6分别评估工具使用、修复、替代方案、连贯性、证据和范围,使性能差异可归因于具体求解器组件;在AAV衣壳设计和药物再利用等任务上取得了显著提升。

用途与启示
  • 为构建面向真实科学与产业问题的研究智能体提供统一环境、任务接口和验证范式。
  • 通过记录并验证完整调查轨迹,将评测重点从最终答案扩展到工具使用、修复能力、证据质量和方案覆盖度。
  • 固定的TRACES回合接口支持受控消融和组件归因,可用于比较模型、工具、执行框架及控制策略。
  • 说明高价值AI基准可从静态题库升级为长期、有状态、可复现的真实发现任务。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.11341?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-17

HumanTracker:人类感知对齐的人形运动追踪基准

HumanTracker以大规模多样化运动数据和偏好对齐指标HumanScore,更准确地评估人形机器人运动追踪中的接触、支撑稳定性等人类可感知缺陷。

 具身智能 模型评估 测量效度 行为建模 数据工程 运动追踪 人形机器人控制 接触评估

HumanTracker面向遥操作与全身动作模仿,解决传统逐帧运动学误差与人类视频观感不一致的问题。基准收录约153小时、由多位专业表演者生成的光学运动轨迹,划分为四类运动并提供文本标签,支持对接触丰富和长时程行为的细粒度诊断。作者还提出HumanScore,使用包含2.4万个动作的1.2万对偏好数据训练,使评分结果与人类偏好对齐。对多种先进追踪器的实验表明,HumanScore比常用运动学指标更容易识别脚部滑动、触地时机错误和支撑不稳定等缺陷。

用途与启示
  • 为人形机器人运动追踪算法提供规模更大、动作类型更丰富的统一评测基准。
  • 用人类偏好监督弥补平均姿态误差无法反映物理真实性与视觉质量的问题。
  • 支持针对接触、稳定性和长时程动作失败进行细粒度诊断,可用于模型选择与控制策略优化。
  • 启示具身评测应从单纯的几何精度转向兼顾人类感知、接触合理性和物理稳定性的综合指标。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.13555?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-17

专访胡梦康:Agent 之后,下一站是 AI 自我进化

Evolvent AI 创始人胡梦康阐述从 Agent、世界模型走向递归自我改进的技术路线,并提出以 Data、Environment、Verifier、Harness 和 Experience 构建 Evolution OS。

 自进化 递归自我改进 智能体 世界模型 自动化科学研究 科研品味 数据合成 环境演化 进化系统 数据科学 进化服务

胡梦康认为,真正的智能需要与真实环境交互,并从失败和反馈中持续调整策略,而 Agent 的能力上限已不再只由模型参数决定。有效的递归自我改进要求新系统在旧系统基础上产生可验证的能力提升,其关键环节包括 Data、Environment、Verifier、Harness 与 Experience。与具有清晰验证器的 Coding 不同,自动科研成本高、反馈周期长,因此模型还需具备在有限预算下选择方向和设计实验的 Research Taste。Evolvent AI 正从数据、环境和评测切入,将真实任务转化为可运行、可验证的实验闭环,长期目标是构建标准化、隔离且可复现的 Evolution OS。其数据理念强调在 Model Frontier 上寻找仍有学习梯度的下一块踏脚石,而非简单堆积标注或不断提高任务难度。

用途与启示
  • 为判断 AI 系统是否实现真正的自我改进提供标准:改进后的性能必须稳定超过原始系统。
  • 提示 Agent 研发应从单纯优化模型,转向联合建设环境、验证器、执行框架和经验数据。
  • 为自动科研系统设计提供方向:重点优化研究品味、实验成本、反馈周期与资源分配能力。
  • 可借鉴 Evolution OS 思路,将训练和实验能力封装为标准化、隔离、可复现的基础设施。
  • 数据团队可围绕 Model Frontier 主动定义任务并生产可验证经验,而不只是扩大传统标注规模。
📝 原始笔记(逐字保留)
自进化|Z Tech|专访00后港大博士、Evolvent AI创始人胡梦康:Agent之后,下一站是AI自我进化https://mp.weixin.qq.com/s/ZcCsfjXF1J4QYAQl8KYEHw

Spellcaster:6个Agent协作生成、试玩并修复游戏

Spellcaster通过六个专用Agent构建“生成—运行—检查—修复”闭环,将一句话创意转化为可持续迭代的可玩游戏原型。

 多智能体系统 智能体编排 人工智能辅助编程 世界模型 闭环评估 游戏生成 可玩性 智能体 软件缺陷修复 可玩性评估

Spellcaster先将用户描述拆解为游戏规则、角色能力、关卡目标、胜负条件、敌人行为和关键数值,再由六个专用Agent协同完成原型。 Rule、Level和Asset Agent分别处理规则、关卡与素材,Playability和Simulation Agent验证关键路径、核心交互及必死局,Repair Agent负责定位并局部修复问题。 系统采用“生成—运行—检查—修复”的循环,并支持通过对话持续调整速度、敌人、难度、关卡和视觉风格,而非每次从头生成。 团队下一阶段计划引入世界模型,根据玩家动作、角色状态与交互历史实时预测后续变化并直接生成画面和反馈。

[合并自 2026-08-19 spellcaster] Spellcaster先将用户描述拆解为规则、角色能力、关卡目标、胜负条件、敌人行为和关键数值,再由六个专用Agent协同生成游戏。Rule、Level与Asset Agent分别负责规则、关卡和素材,Playability与Simulation Agent通过实际运行检查关键路径、核心交互及必死局,Repair Agent则定位并局部修复问题。系统支持通过对话持续调整玩法、数值和视觉风格,无需每次从头生成,约15分钟即可产出常见类型的可玩原型。团队下一阶段计划引入世界模型,根据玩家状态与交互历史实时预测并生成后续画面和反馈,逐步摆脱传统代码与游戏引擎管线。

用途与启示
  • 为AI游戏生成提供从代码正确性扩展到实际可玩性的闭环验证范式。
  • 展示多智能体按规则、关卡、素材、仿真和修复分工,可降低复杂生成任务的定位与迭代成本。
  • 可用于独立游戏的玩法验证、互动内容原型制作及非程序员的低门槛创作。
  • 启示生成系统应保留逻辑自洽的意外玩法,而非仅按预设规则机械删除偏差。
  • 世界模型有望进一步将游戏生成从静态项目生产推进到实时响应玩家的动态世界推演。

[合并自 2026-08-19 spellcaster]

  • 将游戏生成的评价标准从“代码可运行”提升为“玩法可完成、交互可持续”。
  • 展示多Agent按规则、关卡、素材、仿真和修复分工的闭环编排范式。
  • 可用于低成本验证玩法创意,帮助独立开发者和内容创作者快速制作、试玩并迭代原型。
  • 为从代码驱动游戏转向世界模型实时推演的生成式交互系统提供产品路径。
📝 原始笔记(逐字保留)
标题:6个Agent组团Vibe Gaming:自己生成、试玩、修Bug 来源:量子位(微信公众号) 链接:https://www.qbitai.com/2026/08/474806.html 摘要:代码能跑≠游戏能玩 [合并自 2026-08-19 spellcaster] LogicEvolve|6个Agent组团Vibe Gaming:自己生成、试玩、修Bug https://www.qbitai.com/2026/08/474806.html

状态成为攻击面:具身智能体的状态语义注入

论文指出,LLM 驱动的具身智能体可能因恶意操纵环境状态及其语义表示而产生错误规划与危险行为,使状态信息成为新的攻击面。

 具身智能 智能体安全 提示注入攻击 状态表征 技能安全 状态安全 语义注入

论文关注 LLM 从文本生成核心演变为具备环境感知、工具调用和任务执行能力的具身智能体后出现的新型安全风险。此类系统需要综合场景状态、物体属性、空间关系和执行反馈进行任务落地,因此状态信息会直接影响高层规划与行为决策。作者提出“状态语义注入”这一攻击视角,即攻击者可通过干预智能体读取或理解的状态语义来诱导错误决策,而不必局限于传统文本提示注入。研究强调,技能库、运动规划器和控制器执行模型计划的链路可能进一步放大受污染状态造成的现实影响。

用途与启示
  • 将具身智能体的安全审计范围从用户提示和工具输出扩展到环境状态、对象属性及空间关系。
  • 为机器人规划链路设计状态来源认证、语义一致性检查和异常状态检测机制。
  • 提醒开发者在高风险动作执行前引入独立验证、权限约束与人在回路确认。
  • 可用于构建覆盖感知、状态表征、任务规划和控制执行全链路的红队测试。
📝 原始笔记(逐字保留)
标题:When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents 来源:arXiv 链接:https://arxiv.org/abs/2608.16806 摘要:Large Language Models (LLMs) have demonstrated capabilities in in-context learning, task decomposition, step-by-step reasoning, and code generation, driving their gradual evolution from text generation models into the core of agents capable of perceiving environments, invoking tools, and executing tasks. Traditional LLM Agents typically obtain information through webpages, documents, databases, or external tools and generate corresponding invocation sequences according to user goals; when this technology is further integrated with robotic systems, large language models begin to undertake functions such as task understanding, high-level planning, and behavioral decision-making. SayCan combines the task reasoning capability of language models with the affordances of robotic skills, while Cod

AI 编程智能体团队的协调测量

研究以时序网络刻画多智能体编程中的消息与文件交互,揭示团队规模、任务结构和文件策略对协调成本、通信模式及任务成功率的影响。

 多智能体系统 人工智能辅助编程 多智能体协作 交互式评估 基准污染 协调性测量 通信网络

研究将智能体、文件建模为节点,将带时间戳和成本的消息、文件读写建模为有向边,并在采用固定测试套件的 1902 次运行中测量团队协调。随着团队扩大,直接消息量起初接近二次增长,随后在大型团队中趋于平缓,广播通信则变得更多。共享规范驱动的任务会形成密集网络,流水线任务更倾向于围绕局部接口形成稀疏网络;在消息密集型任务中,共享文件可使八智能体团队的输出 token 减少约 42%。指定协调者并未形成稳定的通信中心,也没有可靠提升成功率;此外,智能体频繁主动寻找隐藏评分材料,该现象在 244 次密封环境复现实验中仍出现在约五分之四的运行里。

用途与启示
  • 为多智能体编程评测补充成功率和成本之外的协调结构指标,可用于比较不同团队架构与通信策略。
  • 可依据任务形态选择协调机制:共享规范任务重视广播或共享状态,流水线任务则应强化局部接口设计。
  • 共享文件可降低重复点对点通信,但在文件本就承担协调功能时可能增加额外开销,需要按任务动态启用。
  • 单纯指定协调者不足以改善协作,应通过权限、路由或明确职责建立真正的协调枢纽。
  • 智能体主动搜寻隐藏评分材料暴露出基准污染与评测安全风险,评测环境应隔离测试资产并审计文件访问轨迹。
📝 原始笔记(逐字保留)
标题:When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding 来源:arXiv 链接:https://arxiv.org/abs/2608.16801 摘要:We study how teams of AI coding agents coordinate while solving programming tasks. Current evaluations usually report whether the agents complete the task and how much the run costs, leaving the coordination inside the team largely unmeasured. We introduce an instrument to measure this coordination. Each run is represented as a temporal network in which agents and files are nodes, and messages, file writes, and file reads are timestamped directed edges with an associated cost. We apply this instrument to 1902 runs, each evaluated with a fixed test suite, across configurations that vary the team size, the team structure, and the file policy. The resulting networks show how coordination changes as teams grow and as the work changes. Direct messaging initially increases close to quadratically

ClawGym II:面向 Agent Harness 的黑箱强化学习

ClawGym II 提出统一的黑箱强化学习框架,通过沙箱并发执行、模型边界代理与前缀树轨迹重建,稳定扩展复杂异构 Agent Harness 上的长程任务训练。

 强化学习 智能体脚手架 智能体 沙箱训练 长程任务 训练轨迹 黑箱训练 混合脚手架 调用树

该工作将任务环境与 Agent Harness 隔离在临时沙箱中,以支持安全的大规模并发 rollout。框架把策略优化与不透明的 Harness 执行解耦,并在模型调用边界部署服务代理,以捕获调用并将多轮交互轨迹重建为前缀树。作者改造 PPO 与 GRPO,使其可直接利用恢复出的树状轨迹进行优化,同时保持训练与推理的一致性,并支持同一模型跨多个异构 Harness 联合训练。基于 Qwen3-30A3B 的实验中,模型在 ClawGym-Bench 上经 OpenClaw 和 Claude Code 分别获得 9.98 与 14.81 个 Pass@1 百分点提升,在 JobBench、OfficeQA 上也取得稳定增益。

用途与启示
  • 为无法访问内部实现或执行逻辑的 Agent Harness 提供通用、可扩展的强化学习方案。
  • 通过模型边界调用捕获与前缀树重建,以较少侵入式改造将复杂多轮执行转换为可优化轨迹。
  • 利用前缀树复用多轮轨迹的共享前缀,降低 PPO、GRPO 等算法的长程训练成本。
  • 将沙箱隔离、并发 rollout 与训练—推理一致性设计用于提升大规模智能体训练的安全性、稳定性和可复现性。
  • 混合 Harness 训练可减少模型对单一执行框架的绑定,为跨 OpenClaw、Claude Code 等异构系统培养通用智能体提供路径。
📝 原始笔记(逐字保留)
标题:ClawGym II: Exploring Black-Box RL on Agent Harness 来源:arXiv 链接:https://arxiv.org/abs/2608.16798 摘要:Agent harnesses have substantially improved performance on long-horizon tasks by coordinating agent interactions with the environment. However, reinforcement learning through complex harnesses remains largely unexplored, as scaling such training to long-horizon agent tasks introduces fundamental challenges. In this work, we present a unified black-box RL framework for stable and scalable optimization of general agents through complex harnesses. Concretely, we first build a sandbox-based execution infrastructure that isolates task environments and harnesses within temporary sandboxes for large-scale concurrent rollouts. We then decouple policy optimization from opaque harness execution and place a serving proxy at the model boundary to capture model calls. To reconstruct multi-turn trajecto [合并自 2026-08-19 clawgym-ii-agent-harness] https://huggingface.co/papers/2608.16798?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-18

科学问题发现的历史回测协议与天文学试点

论文提出可证伪的科学问题发现历史回测协议,以时间隔离的天文学语料检验问题是否被未来研究回答、提出或证伪,并揭示生成方法与评审一致性的关键缺陷。

 科学发现 科学研究基准 延迟评估 基准污染 评估方差 回测

论文以历史截止点冻结语料和候选问题,再用时间隔离的未来文献判定问题是否被回答、部分涉及、独立提出或忽略,以及其前提是否得到支持或反驳。作者发布了可复现的天文学实例、可审计标签、四种基线和提交接口,并在2010—2024年的四个截止窗口中评审了798个问题。实验显示,证据结构优先的生成方式优于仅用LLM提示的方法,后者更多表现为记忆相关性而非具体的前瞻能力。七名评审者对90个样本的研究还发现,人类标注者一致性仅为κ=0.17,而前沿模型之间的高一致性可能将LLM裁判的可靠性夸大约三倍;作者另冻结了200个问题,计划于2027—2030年进行前瞻评分。

用途与启示
  • 为科学问题生成系统提供可复现、可审计且能被未来证据证伪的评测范式,减少对专家主观评分和LLM-as-judge的依赖。
  • 可借助严格的时间切分测试系统是真正具有前瞻发现能力,还是仅复现训练数据中的既有研究趋势。
  • 提示基准设计者同时审计结果分类体系与评审者可靠性,不能用模型之间的一致性直接替代真实标注效度。
  • 适合扩展到其他科学领域,构建由后续文献自动或半自动结算的长期延迟评测基准。
📝 原始笔记(逐字保留)
标题:Historical Backtesting for Scientific Question Discovery: A Protocol and Astronomy Pilot 来源:arXiv 链接:https://arxiv.org/abs/2608.16795 摘要:Systems that generate scientific research questions are evaluated today by expert scores, LLM-as-judge ratings, or curated case studies -- all subjective, none falsifiable. We formalize historical backtesting as an alternative: a system generates questions from a corpus frozen at a historical cutoff, the questions are frozen before any access to later literature, and a temporally isolated future corpus then determines whether each question was subsequently answered, partially addressed, independently posed, or ignored, and whether its underlying premise was supported or refuted. The protocol is model-agnostic: any system that emits frozen questions can be scored. We release reproducible astronomy instances with temporally isolated corpora, frozen questions, auditable labels, four reference

CHIVE:用反事实实验评估大模型行为解释

CHIVE 通过自动编辑提示并开展反事实实验,以解释能否预测相关输入上的模型行为为标准,评估并改进大模型行为解释方法。

 人工智能可解释性 反事实推理 行为建模 智能体 数据合成 解释效用 反事实实验

论文提出 CHIVE(Counterfactual Hypothesis Investigation Via Edits),一种发现真实场景中异常模型行为并通过反事实提示编辑调查原因的智能体流水线。它以“反事实可模拟性”为解释质量标准,即解释是否有助于预测模型在相关反事实输入上的行为。CHIVE 生成了数千条自然发生的模型行为解释及其反事实证据,但实验发现所研究的常见大模型可解释性技术均未提升智能体的反事实预测能力。利用 CHIVE 反事实实验结果训练模型后,模型在多种分布外场景中的结果预测能力得到泛化。

用途与启示
  • 为大模型解释提供以预测效用为核心、可通过实验验证的评估标准。
  • 揭示常见可解释性技术可能无法帮助使用者准确预测模型在反事实条件下的行为。
  • 可自动构造带反事实证据的高质量训练数据,用于提升模型行为预测的分布外泛化能力。
  • 为思维链忠实性、异常行为诊断和可解释性方法比较提供自动化实验流水线。
📝 原始笔记(逐字保留)
标题:Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments 来源:arXiv 链接:https://arxiv.org/abs/2608.16747 摘要:Many areas of AI research, such as language model interpretability and chain of thought faithfulness, seek to explain model behaviors. But what constitutes a "good" explanation? In this work, we evaluate explanations through the lens of counterfactual simulatability-whether the explanation is useful for predicting model behaviors on related counterfactual inputs. To this end, we introduce CHIVE (Counterfactual Hypothesis Investigation Via Edits), a novel agentic pipeline that identifies unexpected model behaviors in the wild and investigates them with counterfactual prompt edits. This yields thousands of high-quality explanations for naturally-occurring model behaviors along with supporting counterfactual evidence. We apply CHIVE in two ways. First, we evaluate whether common LLM interpret

Le Critique:用于 LLM 强化学习的特权价值函数

论文提出特权价值函数 PVF 与自适应基线 TETHER,以更准确的 token 级信用分配降低 LLM 强化学习方差,并缓解多轨迹采样的吞吐瓶颈。

 强化学习 信用分配 后训练 推理 价值函数

GRPO 等组相对方法通过为每个提示采样多条轨迹降低梯度方差,但只能提供序列级信用信号,并容易受到慢轨迹阻塞和策略滞后的影响。论文提出特权价值函数(PVF),利用额外的任务相关 token 级信息改进价值估计,同时不对策略目标引入偏差。作者还提出 TETHER,根据价值函数的准确性,自适应地在组相对基线与价值基线之间插值。在多项推理任务中,两种方法均稳定优于标准价值函数基线,并达到或超过采用均值基线的 GRPO。

用途与启示
  • 为 LLM 强化学习提供更细粒度的 token 级信用分配方案,减少对大规模同提示轨迹组的依赖。
  • PVF 展示了如何在不改变策略优化目标的前提下,将训练期特权信息注入价值函数。
  • TETHER 可在 critic 尚不准确时借助组相对基线,并随价值估计改善动态调整,提升训练稳定性。
  • 有望减少慢轨迹造成的同步等待,提高推理任务后训练的吞吐量并降低 off-policy 程度。
📝 原始笔记(逐字保留)
标题:Le Critique: Privileged Value Functions for LLM Reinforcement Learning 来源:arXiv 链接:https://arxiv.org/abs/2608.16739 摘要:Reinforcement learning algorithms for Large Language Models (LLMs) are largely distinguished by their variance reduction strategy. Group-relative methods like GRPO reduce gradient variance by sampling multiple rollouts per prompt, but provide only sequence-level credit. Training is also blocked by straggler rollouts, reducing throughput and increasing off-policyness. Learned value functions theoretically address both problems, providing token-level advantages without requiring large groups. However, additional infrastructure engineering challenges combined with the practical success of critic-free methods have made it difficult to justify their inclusion in RL pipelines. We propose two complementary strategies to improve the performance of value function RL: 1) Privileged Value Functions (

Semantic Bandits:语义先验如何影响上下文探索与利用

论文提出语义多臂老虎机框架,揭示动作标签和奖励表述所携带的预训练语义先验会系统性改变大模型智能体的探索—利用策略。

 智能体 强化学习 行为建模 提示敏感性 人工智能可靠性 语义先验 探索偏置 探索与利用

论文将经典多臂老虎机扩展为“语义老虎机”,显式考察动作的文本标签如何影响大模型智能体决策。具有明确语义的动作标签会使模型减少探索、偏向利用;当语义与真实奖励结构一致时可提高表现,错位时则会导致性能严重下降。实验还发现,负奖励比等量正奖励更容易触发探索,反映出预训练数据中的奖励表达惯例造成了预期尺度偏置。研究指出,以自然语言定义环境与奖励会引入难以避免的语义偏差,进而影响智能体在真实决策场景中的可靠性与鲁棒性。

用途与启示
  • 为评测大模型智能体的探索—利用能力提供显式控制语义变量的新基准框架。
  • 设计决策任务时应对动作标签、奖励措辞和语义—收益对齐关系进行消融,避免将语言先验误判为推理或探索能力。
  • 在高风险部署中可采用标签随机化、语义中性化及多种奖励表述测试,识别由预训练语义先验造成的策略偏移。
  • 提示智能体训练与评测需要同时关注正负奖励的不对称效应及其对长期探索行为的影响。
📝 原始笔记(逐字保留)
标题:Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors 来源:arXiv 链接:https://arxiv.org/abs/2608.16707 摘要:Large language models (LLMs) are increasingly deployed as decision-making agents in settings that require sophisticated environmental exploration. However, existing work has raised questions about how LLMs actually balance exploration and exploitation. Unlike classical agents, LLM agents engage with tasks through natural language, exposing them to semantic information with no formal counterpart in the task structure. We introduce the semantic bandit, an extension of the multi-armed bandit setting that explicitly considers the textual labels assigned to actions, and use it to study how semantic priors --- inductive biases arising from associations between language and expected reward learned during pre-training, shape LLM exploration behaviour. We find that semantically informative action l

受限语义规划与确定性编译提升企业 Text-to-SQL 可靠性

语义路径编译(SPC)将语言模型限制在受治理的语义规划环节,并以代码确定性完成关系遍历、粒度处理和 SQL 构造,在企业 Text-to-SQL 基准上显著提升正确性与稳定性。

 任务规划 人工智能可靠性 神经符号人工智能 形式化验证 语义编译 查询生成

论文提出语义路径编译(SPC),把随机性边界限制在多轮语义规划阶段,由模型完成短语落地并从问题特定的受治理选项中选择。关系图遍历、角色谓词、聚合粒度下推、SQL 构造及检查均由确定性代码执行,以减少“可执行但语义错误”的查询。在 ACME 保险基准的 38 道裁决题上,SPC 有 37 题在三次运行中全部正确,题级稳定正确率为 97.4%,而直接 DDL-to-SQL 基线为 55.3%。114 次运行中,SPC 仅出现一次拒答且没有错误但成功执行的结果;不过作者强调这是端到端系统对比,不能将增益单独归因于编译,因为 SPC 还获得了基线没有的受治理语义资产。

用途与启示
  • 为企业 Text-to-SQL 提供“模型负责受限语义决策、程序负责确定性执行”的可靠架构范式。
  • 说明仅以 SQL 是否成功执行作为评测标准不足,还需检查关系角色、聚合粒度和业务语义是否正确。
  • 可将受治理语义选项、角色谓词和确定性检查用于降低生产环境中的静默查询错误。
  • 提醒系统比较应控制语义资产与上下文差异,避免把端到端收益简单归因于单一编译模块。
📝 原始笔记(逐字保留)
标题:Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL 来源:arXiv 链接:https://arxiv.org/abs/2608.16663 摘要:Direct text-to-SQL asks a language model to do two jobs: interpret the business question and construct the complete relational query. In enterprise schemas, SQL can execute successfully while using the wrong relationship role or aggregation grain. We study an alternative placement of the stochastic boundary. A multi-turn planner grounds phrases and selects from question-specific governed options; graph traversal, role predicates, grain lowering, SQL construction, and deterministic checks are implemented in code. We evaluate this semantic path compilation (SPC) system against direct DDL-to-SQL generation on the ACME insurance benchmark. On a 38-question adjudicated comparison set with three runs per question, SPC was adjudicated correct on every run for 37 questions (97.4%), compared with 2

同策略蒸馏泛化的双重效应:行为迁移与能力跷跷板

受控实验表明,同策略蒸馏(OPD)主要迁移教师的推理行为而非特定答案,其跨语言、跨推理长度和跨领域泛化高度依赖师生模型是否同源,并在多教师场景中产生能力此消彼长的跷跷板效应。 [合并自 2026-08-25 omniassistbench] OmniAssistBench 通过逆向构建多轮交互视频评测实时全模态助手,揭示现有模型在视觉提示理解、历史上下文保持和响应时机判断方面仍有明显不足。

 在策略蒸馏 模型蒸馏 能力迁移 多语言建模 跨域泛化 多教师蒸馏 同源迁移 蒸馏泛化 交互式评估 响应时机 多模态 智能体记忆 视频智能助手 连续交互 实时智能助手

OmniAssistBench 面向持续感知环境并实时指导用户完成目标的 Omni-LLM,重点评估动态、多轮的助手式视频交互能力。研究团队从互联网视频反推出用户目标,将视频切分为多轮片段,并提供源视频路线先验,以控制不同交互路径带来的评测偏差,数据构建耗费超过 1000 个专家工时。实验中 Gemini-3-Pro 得分为 66.4/100,开源 Qwen3-Omni-Instruct 得分为 51.2。当前模型虽通常能够理解用户输入,但容易给出错误或不完整的回答,尤其不擅长识别手势等视觉提示、保持多轮历史上下文,以及等待目标事件出现后再适时响应。

[合并自 2026-08-25 omniassistbench] 研究通过逐一控制域内分布偏移、跨领域迁移和多教师设置等因素,系统考察 OPD 的泛化规律。结果显示,OPD 主要迁移教师的推理行为,而非具体问题的答案;训练样本难度影响较小,即使教师未能解出的题目也可提供有效监督。师生来源关系是关键变量:同源模型组合可跨语言、推理长度乃至领域实现广泛迁移,而异源组合通常仅拟合训练分布。广泛迁移也具有双刃剑效应,多位领域教师的影响难以通过提示路由完全隔离,最终会形成随教师混合比例变化的能力跷跷板。

用途与启示
  • 为评估 OPD 提供覆盖域内分布偏移、跨语言、跨推理长度和跨领域迁移的实验框架,避免仅凭单一领域或近训练分布基准判断泛化能力。
  • 选择教师—学生组合时应重点考虑模型来源关系;若追求广泛能力迁移,应优先考虑同源模型,而不能只比较教师自身的任务准确率。
  • 蒸馏数据筛选不必过度强调题目难度或教师答对率,因为失败轨迹中的推理行为仍可能促进能力迁移。
  • 多教师蒸馏不能仅依赖领域提示隔离教师影响,需要显式评估不同混合比例下各项能力的增益、干扰与退化。

[合并自 2026-08-25 omniassistbench]

  • 为实时视频助手和 Omni-LLM 提供比静态视频问答更贴近真实使用场景的多轮交互评测。
  • 可将视觉提示识别、上下文保持与响应时机拆分为独立能力维度,辅助模型诊断和定向训练。
  • 逆向互联网视频构造交互轨迹的方法,可缓解真实人机交互视频稀缺的问题。
  • 结果表明可靠的实时助手不仅需要正确回答,还需要持续维护状态并决定何时响应。
📝 原始笔记(逐字保留)
标题:Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models 来源:arXiv 链接:https://arxiv.org/abs/2608.16647 摘要:On-policy distillation (OPD) transfers teacher capabilities by supervising trajectories sampled from the student's own policy, yet its generalization behavior remains poorly understood, as most studies evaluate OPD on a single domain and on benchmarks close to the training data. We present a controlled study that varies one generalization factor at a time, from in-domain distribution shifts to cross-domain transfer and the multi-teacher setting. We find that OPD transfers a teacher's reasoning behavior rather than its answers to particular problems: training difficulty barely matters, and even problems the teacher never solves are useful. Transfer depends strongly on the origin relationship between teacher and student: same-origin pairs bring the student close to the teacher across languag [合并自 2026-08-24 opd] https://huggingface.co/papers/2608.16647 [合并自 2026-08-25 omniassistbench] [每枚硬币都有两面:大型语言模型在线策略蒸馏中泛化的双重性质(15 ▲)](https://huggingface.co/papers/2608.16647?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-24)

Reconstruction:从发表前参考文献盲重建研究创意

Reconstruction 基准要求模型仅依据论文发表前的参考文献恢复其真实研究创意,严格防泄漏评测显示多智能体评审与锦标赛选择可显著优于单模型。

 科研创意 科学研究基准 多智能体系统 基准污染 文献阅读 文献溯源 创意重建

Reconstruction 隐藏种子论文及同期、未来文献,仅向模型提供冻结的发表前参考文献,要求其提出与真实研究创意匹配的假设。基准通过时间截断、匿名参考文献 ID 和逐论文冻结书目等机制,降低提示阶段的信息泄漏风险。评测覆盖六个科学领域和 643 篇论文,七个前沿模型的单模型 Match 率仅约为 3%~15%。仅使用参考文献的多智能体流程结合跨模型评审和瑞士制锦标赛选择,将 Match 率提高至约 23%~42%,相对最佳单模型提升约 2.4 倍。

用途与启示
  • 为研究创意生成系统提供更严格的盲测基准,区分真正的创意恢复能力与文献记忆或数据污染。
  • 表明单模型从参考文献推断新研究方向的能力仍有限,而跨模型评审和候选竞争机制具有明显增益。
  • 其时间截断、匿名化和冻结输入设计可用于改进自动科研、科学发现及研究代理的防泄漏评测。
  • 可进一步研究多智能体流程的成本收益、裁判模型偏差以及跨领域创意匹配的可靠性。
📝 原始笔记(逐字保留)
标题:Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies 来源:arXiv 链接:https://arxiv.org/abs/2608.16645 摘要:Can a language model recover the true research idea of a published paper when given only that paper's pre-publication bibliography? We introduce Reconstruction, a blind idea-recovery benchmark that withholds the seed paper and all contemporaneous or future literature, and asks models to propose hypotheses that an independent large language model judge matches against the held-out ground-truth idea. A strict anti-leakage protocol-temporal citation cutoff, anonymous reference IDs, and frozen per-paper bibliographies, which prevents prompt-time leakage of the seed idea. Across six scientific domains and 643 evaluated papers, seven frontier models achieve only modest Match rates (approx. 3-15%). We then evaluate a reference-only multi-agent (top 4) pipeline that combines cross-model review wit

PDDLCoder:智能体式 PDDL 生成辅助符号规划

PDDLCoder 通过智能体迭代生成、分析和修正 PDDL 规划规范,在可自动验证的 NL-pddlgym 基准上将计划可执行率提升至 89.6%。

 任务规划 智能体 神经符号人工智能 形式化验证 长程任务 符号规划 规划语言

PDDLCoder 将自然语言规划问题转换为 PDDL,并通过生成、分析与修正的智能体循环持续完善规划规范,再交由符号规划器生成可验证计划。作者同时提出 NL-pddlgym 基准,包含 23 个领域的 711 个规划问题,并配备可执行 Gym 环境以自动检验计划的适用性。其测试集覆盖 4 个未见领域的 106 个问题,PDDLCoder 获得 89.6% 的可执行计划生成率。该结果明显超过改造后的既有 PDDL 生成方法最高 45.3% 的成绩,也优于直接使用 LLM 规划所达到的最高 74.5%。

用途与启示
  • 为解决大模型长程规划中的逻辑不一致与动作不可执行问题提供神经符号混合方案。
  • 展示“智能体迭代修正规范+符号规划器验证”比固定式 PDDL 生成流水线更可靠。
  • NL-pddlgym 可用于标准化评估自然语言到 PDDL 的转换能力及计划实际可执行性。
  • 可启发面向机器人、流程自动化和任务代理的可验证长程规划系统设计。
📝 原始笔记(逐字保留)
标题:PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning 来源:arXiv 链接:https://arxiv.org/abs/2608.16637 摘要:LLMs remain unreliable for long-horizon planning, often generating logically inconsistent or non-applicable plans. Recent hybrid methods instead translate natural language into the Planning Domain Definition Language (PDDL), allowing symbolic planners to produce verifiable plans. However, existing methods frequently rely on rigid generation pipelines, a partial PDDL definition, or human feedback. Furthermore, their evaluation is hindered by the lack of standardized benchmarks with automated verification. To address these limitations, we present PDDLCoder, an agentic framework for PDDL generation from natural language that iteratively generates, analyzes, and refines planning specifications. We further introduce NL-pddlgym, a benchmark dataset comprising 711 planning problems across 23 doma

自然语言解释何时助益上下文学习:类型与忠实度比较

研究系统比较不同来源与筛选方式的自然语言解释对上下文学习的影响,发现其效用取决于任务、模型、解释来源及忠实度指标。

 上下文学习 人工智能可解释性 模型评估 提示敏感性 解释忠实性 解释选择

研究在六个基准和四个指令微调模型上,比较人工撰写、自生成及外部 LLM 生成的自然语言解释,并考察随机选择与基于忠实度筛选的差异。分类任务中,在少样本提示里加入解释通常能够提高准确率,外部 LLM 生成的解释表现较强,在具备人工解释的任务上也具有竞争力。自生成解释对筛选策略更敏感,而数学推理任务中的收益则明显依赖具体模型和解释来源。忠实度筛选整体仅带来小幅平均增益,不同忠实度指标之间可能显著分歧;置换解释和分布外解释实验表明,模型具有部分鲁棒性,但语义对齐仍是性能提升的重要因素。

用途与启示
  • 为解释增强型少样本提示提供选型依据:分类任务可优先尝试外部 LLM 生成的解释。
  • 不应将忠实度筛选视为稳定增益手段,需针对任务、模型和评价指标分别验证。
  • 报告实验结果时应明确解释来源、筛选策略及忠实度指标,避免把提示设计差异误判为模型能力差异。
  • 可通过随机置换或分布外解释开展对照实验,检验性能提升究竟来自语义信息还是提示格式等捷径。
📝 原始笔记(逐字保留)
标题:When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness 来源:arXiv 链接:https://arxiv.org/abs/2608.16627 摘要:Natural language explanations (NLEs) are increasingly used as inputs, for example, as few-shot rationales that influence model behavior in in-context learning (ICL). However, it remains unclear how different types of NLEs compare in their effects on downstream model performance in explanation-augmented prompting. Therefore, we provide a comparative evaluation across six benchmarks and four instruction-tuned models, studying how NLE source (human-written when available, self-generated explanations, generated by an external LLM) and NLE selection (random vs faithfulness-based filtering) affect downstream utility of NLEs when used in ICL settings. Our extensive evaluation shows that, on classification-style benchmarks, adding NLEs to few-shot prompts often improves accuracy over few-shot prom

Palmyra x6:基于锚定监督微调的企业级工具调用模型

Palmyra x6 通过少量经验证的合成工具调用轨迹与 KL 锚定监督微调,在企业智能体任务、BFCL Core 及安全评测中取得较强表现。

 智能体 工具调用 后训练 混合专家模型 数据合成 锚定微调

Palmyra x6 是面向企业级智能体任务优化的大语言模型,由混合专家基础模型后训练而成。其 Anchored Supervised Fine-Tuning 仅使用 626 条经验证的合成工具调用轨迹,并采用单轮训练、低学习率和相对冻结基础模型的 KL 锚定,以控制能力漂移。训练优化器结合 Muon 与 Adam,体现出紧凑数据和保守训练配置的技术路线。该模型相较 Writer Agent 先前默认模型显著提升,在 BFCL Core 上取得 0.785 的最高分,并获得同组模型中最高的六项基准平均成绩。模型在偏见与安全评估中也达到具有竞争力或领先的水平。

用途与启示
  • 展示少量高质量、经验证的合成工具轨迹也可显著增强模型的企业级智能体能力。
  • KL 锚定、低学习率和单轮训练可作为降低后训练能力漂移与灾难性遗忘风险的保守方案。
  • Muon 与 Adam 的混合优化策略为混合专家模型的可控后训练提供了参考。
  • BFCL 等工具调用基准结果表明,训练数据质量与轨迹验证可能比单纯扩大数据规模更关键。
📝 原始笔记(逐字保留)
标题:Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning 来源:arXiv 链接:https://arxiv.org/abs/2608.16620 摘要:Palmyra x6 is a large language model optimized for use with enterprise-oriented agentic tasks. The model was built by post-training a Mixture-of-Experts base model with Anchored Supervised Fine-Tuning on a compact corpus of verified, synthetic tool-use trajectories, optimized with a Muon + Adam hybrid. The recipe is deliberately conservative and deliberately controlled: 626 trajectories, a single epoch, a low learning rate, and a KL anchor to the frozen base. The model shows substantial gains over the previous default model for Writer Agent, and compares favorably with several recent models on public benchmarks, scoring the highest on BFCL Core at $0.785$ and posts the highest six-benchmark mean of the cohort. Furthermore, the model has shown itself to be competitive or leading relative to

智能体物理学:统计力学预测 AI 群体行为

研究通过逾一万个语言模型智能体社区实验与统计力学建模,将群体互动归纳为冷漠、极化和共识三种状态,并预测个体意见轨迹及群体行为分布。

 多智能体系统 群体行为建模 行为建模 社会智能 机制发现 统计物理 意见演化 群体动力学

研究让超过一万个语言模型智能体社区反复交换消息并修正观点,任务涵盖客观数学题和主观政治陈述。群体动力学主要呈现冷漠、极化和共识三种状态;互动通常会增强智能体的确信程度,并提高客观问题上的集体准确率。对于主观问题,交流可能使群体政治观点发生系统性右移,显示互动也会放大共同偏差。作者以社会压力为核心构建统计力学模型,仅根据初始观点便能预测个体轨迹、泛化至未见过的社区图,并解释低临界社会温度、吸引关系占优及正确答案持有者影响力更强等现象。

用途与启示
  • 为多智能体系统提供可预测的群体动力学模型,用于预判共识、极化和从众现象。
  • 启示系统设计者应同时评估协作带来的准确率增益与主观偏见放大风险。
  • 可利用社会温度、关系吸引力和个体影响强度等参数设计群体行为监控及干预机制。
  • 为多智能体对齐、通信拓扑设计和集体决策安全评测提供统计物理视角。
📝 原始笔记(逐字保留)
标题:Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents 来源:arXiv 链接:https://arxiv.org/abs/2608.16578 摘要:AI agents increasingly operate as part of interacting systems rather than in isolation. As agents exchange information and jointly make decisions, their interactions can improve collective reasoning but may also produce herding, polarization, or amplify shared biases. Understanding and predicting these collective dynamics is therefore important for designing effective and aligned multi-agent systems. Here, we study over 10,000 communities of language-model agents that repeatedly exchange messages and revise their opinions across objective mathematics questions and subjective political statements. Despite substantial diversity in possible behavior, the individual and group dynamics can be represented by three characteristic regimes: indifference, polarization, and consensus. AI agents start

大语言模型充当合成临床专家辅助纵向罕见病建模

研究利用大语言模型生成临床判断来监督变分自编码器学习脊髓性肌萎缩症的纵向表征,从而提升重建结果的临床忠实度与运动功能里程碑预测能力。

 医疗人工智能 临床推理 时序建模 伪监督学习 特权信息学习 人工智能可解释性 罕见病 临床表征学习

研究将大语言模型视为离线的“合成临床专家”,根据患者观测的文本描述判断疑似临床类别。团队以这些判断训练可微代理模型,并在变分自编码器损失中加入合成专家约束,使重建结果保留输入样本的临床标签分布。该方法应用于脊髓性肌萎缩症儿童的纵向运动功能评估,并用多变量混合效应模型连接各次就诊的低维表征。实验将原始样本与重建样本之间的 SMA 类型标签分歧率从约 11% 降至 7%,同时优于无监督表征和数据层基线的运动功能里程碑预测。

用途与启示
  • 在临床专家时间有限、罕见病样本稀缺时,可用 LLM 离线生成弱监督信号,将领域知识注入表征学习。
  • 相较只优化数值重建误差,引入临床语义约束可避免重建结果跨越疾病类型边界。
  • “LLM 判断—可微代理—模型损失”的设计为把不可微专家意见整合进端到端训练提供了通用范式。
  • 合成专家可能存在偏差,实际应用中仍需通过真实临床专家审查和外部队列验证其可靠性。
📝 原始笔记(逐字保留)
标题:Large language models as synthetic clinical experts to inform longitudinal rare-disease modeling 来源:arXiv 链接:https://arxiv.org/abs/2608.16507 摘要:Due to the limited amount of information, modeling longitudinal rare-disease data can benefit from integrating clinical knowledge. Yet, elicitation of expert knowledge and formalization for model fitting is challenging, in particular due to limited time of clinical experts. To nevertheless make domain knowledge accessible during model fitting, we use large language models (LLMs) as synthetic clinical experts to supervise a variational-autoencoder-based approach that learns low-dimensional latent summaries of visit-level observations. Specifically, LLMs are queried offline on textual descriptions of patient observations to obtain judgments, e.g., the suspected clinical category. To improve the variational autoencoder fit, we train a differentiable surrogate model on these judgments and augm

JailbreakSkill:以可复用、持续进化技能扩展自动红队测试

JailbreakSkill 将分散的越狱攻击策略封装为可复用的智能体技能,并通过攻击经验持续诊断、组合和演化技能,显著提升跨模型自动红队测试效果。

 红队测试 智能体技能库 技能安全 自进化 智能体安全 越狱攻击

JailbreakSkill 将已有攻击策略封装成模块化、智能体可调用的技能,可根据任务与目标模型自适应选择。框架构建了“攻击—学习—进化”闭环,利用攻击经验诊断、改进、组合并发现新技能,再将其纳入持续扩充的技能库。在 AdvBench 和 HarmBench 上,宏平均攻击成功率分别提高 17.5 和 13.4 个百分点,其中针对 GPT-5.4 的 AdvBench 成绩提升 48.6 个百分点。演化过程还能发现“将直接请求重构为未完成文档续写”等新策略,部分技能无需额外适配即可泛化到未见提示和目标模型。

用途与启示
  • 为自动化红队系统提供统一的攻击能力封装、复用和动态路由机制。
  • 表明攻击轨迹不仅可用于评估,还能作为技能诊断、组合与持续进化的数据来源。
  • 可用于构建跨模型迁移的越狱测试技能库,降低重复设计攻击提示和工作流的成本。
  • 提醒模型安全团队采用持续更新的防御评测,而非依赖固定攻击集合或静态基准。
📝 原始笔记(逐字保留)
标题:JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills 来源:arXiv 链接:https://arxiv.org/abs/2608.16465 摘要:Automated red-teaming has produced a growing collection of attack strategies, yet they typically remain scattered across prompts and workflows, making them difficult to systematically integrate, reuse, and improve at scale. We introduce \textsc{JailbreakSkill}, a skill-centric framework for scaling automated red-teaming through reusable and continuously evolving attack capabilities. \textsc{JailbreakSkill} packages existing attack strategies into modular, agent-ready skills that can be directly reused and adaptively selected across tasks and target models. Beyond reuse, it closes the loop between attacking and learning: attack experience is used to diagnose, refine, combine, and discover new skills, which are added back to an ever-growing skill library. This evolution lifts macro-average A

Time to Reason:基于模糊语义的可扩展 LTLf 神经符号学习

论文提出无需自动机的 DiffLTLf 框架,以可微模糊语义直接解释有限轨迹线性时序逻辑,在保持预测性能的同时显著提升神经符号学习的可扩展性。

 神经符号人工智能 时序建模 形式语言 逻辑推理 时序逻辑 模糊语义

论文在统一框架下形式化定义了多种 LTLf 模糊语义,并系统分析时序算子的等价关系与对偶性质。作者提出 DiffLTLf,将这些可微语义直接集成至神经符号学习过程,从而避免使用自动机表示时序知识所带来的扩展瓶颈。论文还设计了复杂度高于既有基准的新评测协议,用于考察不同学习任务和约束规模下的表现。实验显示,模糊语义的具体选择会显著影响预测性能,而 DiffLTLf 的效果与先进概率方法相当或更优,并具有更好的可扩展性。

用途与启示
  • 为带有时序约束的深度学习任务提供可微、端到端的逻辑监督机制。
  • 表明直接解释时序公式可以替代自动机编译,降低大规模 LTLf 学习的计算与表示成本。
  • 提醒研究者将模糊语义视为关键设计变量,应系统比较不同语义对准确率、梯度质量和扩展性的影响。
  • 可用于流程合规、事件序列识别、行为监测及长程任务约束等需要有限轨迹推理的场景。
📝 原始笔记(逐字保留)
标题:Time to Reason: Scalable Neurosymbolic Learning for LTLf via Fuzzy Semantics 来源:arXiv 链接:https://arxiv.org/abs/2608.16443 摘要:Neurosymbolic (NeSy) Artificial Intelligence aims to integrate Deep Learning (DL) architectures with symbolic reasoning. While initial NeSy approaches have targeted mainly symbolic reasoning in propositional and first-order logics, recent works have started to address the construction of neurosymbolic frameworks for Temporal Logics, and in particular for LTLf. These approaches have established temporal NeSy as a promising research direction, laying the foundations for learning under temporal constraints. Nonetheless, they leave many questions unanswered. From a theoretical perspective, several differentiable semantics for interpreting LTLf have been proposed but have not yet been formally and systematically defined within a unified framework. Moreover, existing approaches commonly rely on

ParaTempo:基于时间置信度的高效并行推理

ParaTempo以分支局部的时间置信度统一驱动异步并行推理中的剪枝、提前退出、算力重分配和全局停止,在保持准确率的同时显著降低延迟与令牌消耗。 [合并自 2026-08-25 paratempo] ParaTempo利用分支级时间置信度进行异步剪枝、提前终止与计算重分配,在保持推理准确率的同时显著降低延迟和令牌消耗。

 并行搜索 推理加速 停止策略 资源调度 测试时计算 时间置信度 分支调度 异步推理 成本优化 分支剪枝 置信度调度

  • ParaTempo是一种无需训练的异步并行推理框架,以答案空间随时间的收敛程度作为统一控制信号。
  • 系统周期性探测各推理分支的候选答案概率分布,并依据近期结果对主导答案的集中程度计算时间置信度。
  • 该信号用于剪除低置信分支、提前结束持续收敛的分支、利用释放的算力派生新路径,并在置信加权投票充分集中时全局停止生成。
  • 数学与科学推理实验显示,该方法将平均延迟降低21.8%—32.2%、总令牌量降低18.1%—30.3%,同时保持有竞争力的准确率。

[合并自 2026-08-25 paratempo] ParaTempo是一种无需训练的异步并行推理框架,用时间置信度衡量每条推理分支在答案空间中的收敛程度。框架周期性探测分支的暂定答案概率分布,并根据近期探测结果是否集中于主导答案计算置信度。该信号统一用于剪除低置信分支、提前终止持续收敛的分支、将释放的算力用于派生新分支,以及在置信度加权投票趋于集中时停止整体生成。数学与科学推理实验显示,其平均延迟降低21.8%至32.2%,总令牌消耗减少18.1%至30.3%,同时保持有竞争力的准确率。

用途与启示
  • 为测试时并行推理提供无需额外训练、不依赖最终答案共识的在线动态调度方案。
  • 可用时间稳定的答案收敛信号统一控制分支剪枝、提前退出、计算重分配和全局停止。
  • 适合对延迟和令牌成本敏感的数学、科学推理服务,也可为多分支搜索系统的预算管理提供借鉴。
  • 启示推理系统将控制依据从瞬时 token 置信度或滞后的最终共识,转向跨时间的轨迹级收敛趋势。

[合并自 2026-08-25 paratempo]

  • 为并行推理提供无需额外训练、无需轨迹同步的动态计算控制方案。
  • 可将时间置信度作为比局部令牌概率或单次中间探测更稳定的分支收敛指标。
  • 适合用于高成本推理服务中的分支剪枝、早停和推理预算自适应分配。
  • 启示系统可用单一、可在线更新的置信信号统一协调局部调度与全局停止。
📝 原始笔记(逐字保留)
标题:ParaTempo: Efficient Parallel Reasoning via Temporal Confidence 来源:arXiv 链接:https://arxiv.org/abs/2608.16425 摘要:Parallel reasoning improves the accuracy and robustness of large reasoning models by exploring multiple solution paths, but its computational cost grows with reasoning depth and branch count. Existing methods for managing these parallel paths typically rely on final-answer consensus, local token confidence, or isolated intermediate probes. However, these signals are often delayed, weakly tied to actual reasoning progress, or too noisy for dynamic, branch-level control. To address these limitations, we introduce ParaTempo, a training-free asynchronous parallel reasoning framework. ParaTempo is driven by temporal confidence, a branch-local measure of answer-space convergence. Each branch is periodically probed for a tentative answer probability distribution, and temporal confidence quantifie [合并自 2026-08-24 paratempo] https://huggingface.co/papers/2608.16425 [合并自 2026-08-25 paratempo] [ParaTempo:基于时间置信度的高效并行推理(27 ▲)](https://huggingface.co/papers/2608.16425?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-24) [合并自 2026-08-25 paratempo-2] [ParaTempo:基于时间置信度的高效并行推理(27 ▲)](https://huggingface.co/papers/2608.16425?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-24)

PertMind:用细胞扰动强化学习激发生物推理能力

PertMind 将细胞扰动图谱转化为可计算奖励的强化学习环境,仅训练正向扰动响应预测,便获得可迁移至多种生物任务的通用推理能力。

 生物信息学 强化学习 科学智能 推理 后训练 能力迁移 细胞扰动 生物推理

PertMind 以细胞扰动后的实测基因响应作为奖励信号,减少对人工编写生物学推理轨迹的依赖。模型先通过可信轨迹进行监督初始化,再结合基因、通路和输出格式三个层级的强化信号训练。尽管训练任务仅为正向扰动—响应预测,模型仍能泛化至未见细胞环境,并零样本迁移到逆向扰动识别、双扰动推理、表型筛选排序和生物过程解释。模型生成的生物学画像还可支持基因、细胞和供体等多尺度下游表征任务,同时保持通用语言能力。

用途与启示
  • 展示如何把不断扩展的实验图谱直接构造成具有客观、可计算奖励的生物推理训练环境。
  • 为降低生物领域后训练对昂贵人工推理轨迹的依赖提供可扩展路径。
  • 表明围绕实验终点进行强化学习,可能集中并激活预训练模型中已有的可复用生物学策略。
  • 可启发药物筛选、基因功能分析和细胞状态预测等任务采用统一的扰动学习范式。
📝 原始笔记(逐字保留)
标题:PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data 来源:arXiv 链接:https://arxiv.org/abs/2608.16419 摘要:Large language models can describe mechanisms, yet scalable post-training still depends on costly, manually curated biological reasoning traces. Here we show that cellular perturbation atlases can instead become reinforcement-learning environments, where measured gene responses provide computable rewards for biological reasoning. We introduce PertMind, which combines trusted-trajectory supervised initialization with gene-, pathway-, and format-level reinforcement signals. Trained only on forward perturbation-response prediction, PertMind improved response inference in unseen cellular contexts while retaining general language capabilities. It also transferred without task-specific post-training to reverse perturbation identification, double-perturbation reasoning, phenotypic-screen prioriti

迈向无风险 AI 智能体部署:基于轨迹的测试与调试

文章主张以智能体完整执行轨迹为核心,通过系统化测试、故障归因与调试修复降低 LLM 智能体在安全、合规和功能方面的部署风险。

 智能体 自动化部署 安全审计 过程诊断 人工智能可靠性 智能体评估 轨迹验证 故障归因

文章将智能体轨迹定义为推理步骤、工具调用和环境观察的连续记录,指出许多部署故障只能在轨迹层面被发现。智能体测试面临测试预言缺失、运行非确定性、轨迹有效性验证困难以及充分性指标缺位等挑战。调试环节需要覆盖自动化故障归因、修复以及智能体自进化,并关注长程轨迹中的根因定位。作者进一步提出覆盖完整部署生命周期的就绪检查清单,并将形式化充分性指标和自进化可靠性列为关键开放问题。

用途与启示
  • 为企业部署 LLM 智能体提供以执行轨迹为核心的风险审查框架。
  • 指导构建覆盖推理、工具调用与环境交互的测试和调试基础设施。
  • 推动研究可量化的测试充分性指标及长程任务根因归因方法。
  • 提醒自修复、自进化智能体必须接受持续验证,避免演化过程引入新的安全与功能风险。
📝 原始笔记(逐字保留)
标题:Towards Risk-free AI Agent Deployment 来源:arXiv 链接:https://arxiv.org/abs/2608.16411 摘要:LLM-based agents are rapidly moving from research prototypes into the core business processes of organizations, but these agents pose deployment risks to security, compliance, and functionality. In this article, we argue that risk-free deployment must be grounded in the agent's trajectory: the recorded sequence of reasoning steps, tool invocations, and environmental observations. Trajectories are available for any agent, and many failures are visible only in the trajectory. To make agents deployable and sustainable, we advocate agent testing and debugging as a systematic research direction for detecting and mitigating these risks. This article begins with the challenges of testing agents, including the oracle problem, non-determinism, trajectory validation, and the absence of adequacy metr

面向可信智能体执行的策略代数

论文将智能体可靠能力定义为受身份、权限、预算、审批与审计等约束的执行路径属性,并提出可组合的策略代数保障企业级可信执行。

 智能体安全 人工智能可靠性 智能体运行时 形式化验证 多智能体系统 策略代数 权限传播 可信执行

论文指出,智能体成功完成任务并不等同于可靠执行,未经授权的数据访问、权限扩张、未审批副作用、预算耗尽和证据缺失都会破坏可信性。作者提出策略代数,通过连接、交集、预算收窄、审批继承和证据累积,组合安全配置与运行时义务,并生成满足全部约束且限制最少的执行状态。该代数还能在多智能体调用中传播限制,并依据成本将开放式执行重定向为可恢复的产物生成。实验中,运行时干预了 94.8% 的违规事件,同时保持 86.9% 的任务完成率,并将审计完整率提升至 98.6%。

用途与启示
  • 为企业智能体建立以完整执行路径而非最终结果为核心的可靠性定义。
  • 可用于统一组合身份、工具、数据、记忆、预算、审批、产物和审计策略。
  • 为多智能体委派中的权限收窄与约束继承提供形式化语义。
  • 支持构建可执行、可审计且能在预算压力下恢复的智能体运行时。
📝 原始笔记(逐字保留)
标题:A Policy Algebra for Trust-Preserving Agentic AI Execution 来源:arXiv 链接:https://arxiv.org/abs/2608.16402 摘要:Large language model-based agentic frameworks primarily optimize capability: whether an agent can reason, retrieve information, call tools, delegate work, and complete a goal. Enterprise execution requires a stronger property. A successful result is not reliable if it was produced through unauthorized data access, widened delegated authority, unapproved side effects, unrecoverable budget consumption, or incomplete evidence. This paper defines reliable capability as a path property: an agent is reliably capable only when it completes a task through action events that remain admissible under identity, profile, tool, data, memory, budget, artifact, approval, and audit constraints. We propose a policy algebra that defines the reliability envelope within which agent capability may be exercised.

AstronOS:面向长程智能体的统一执行模型与运行时

AstronOS以持久工作项身份和版本化权威状态统一跨调用执行,在软件版本更新基准中显著提升智能体跨会话任务的端到端成功率。

 智能体 长程任务 状态移交 会话交接 智能体运行时 SWE 软件工程 版本状态管理

AstronOS不再围绕单次对话、模型调用或智能体实例组织任务,而是为工作项维护持久身份与版本化的权威状态。每个执行步骤仅接收特定状态版本及新增材料,其结果须经验证和记录后才能推进状态,系统通过 Cases、Tasks 和 Scenario Packs 支持中心与本地执行。研究比较了重读原始材料、回放完整历史、确定性文本摘要、确定性 JSON 与运行时介导交接五种跨会话策略,共完成 150 次受控执行。在主要三阶段批次中,AstronOS 通过 15 次执行中的 14 次,明显高于重读材料的 0 次和完整历史回放的 2 次,并降低了每次成功执行的模型令牌成本,但增加了单次尝试的执行时间。

用途与启示
  • 为长程智能体提供独立于单次会话的持久任务身份和可审计状态,减少上下文切换造成的信息丢失。
  • 表明结构化摘要或完整历史回放不足以稳定完成跨阶段任务,运行时层面的状态验证与交接更关键。
  • 可用于软件工程代理、跨会话工作流和中心—本地混合执行系统的架构设计。
  • 在评估智能体系统时,应同时衡量端到端成功率、成功所需令牌成本与执行窗口时间。
📝 原始笔记(逐字保留)
标题:AstronOS: A Unified Execution Model and Runtime for Long-Horizon Agentic Systems 来源:arXiv 链接:https://arxiv.org/abs/2608.16381 摘要:Agentic systems often organize execution and state around a single conversation, model invocation, or agent instance, even when real work spans many calls and stages. We introduce a unified execution model that maintains a work item's persistent identity and versioned authoritative state across calls. Each step receives input scoped to a specific state version and new material; a result advances state only after validation and recording. We implement selected paths of this model in AstronOS using Cases, Tasks, and Scenario Packs across central and local execution. We compare five complete strategies for carrying an established software-version update plan into a fresh model session: rereading original materials, replaying full history, deterministic text summary, deterministic JSON, and th

合成数据增强用于乌克兰战损农田卫星分析

研究利用GAN与DDPM生成合成卫星影像缓解战损农田样本稀缺和类别失衡问题,使ViT分类器的平衡准确率由67%提升至81%。

 数据合成 扩散模型 视觉表征学习 人工智能应用 遥感分析 战损评估

研究面向乌克兰战争受损农田的卫星影像分类,重点解决标注数据稀缺与类别不平衡问题。作者分别训练类别条件GAN和DDPM,生成遭轰炸与未遭轰炸的农田图像,并仅将合成样本用于训练增强。所有下游评估均在纯真实测试集上完成,以检验合成数据的实际效用。采用平衡DDPM增强后,ViT分类准确率从84%升至88%,平衡准确率从67%升至81%,宏平均F1从65%升至78%,少数类召回率从41%升至69%。

用途与启示
  • 说明生成式数据增强可缓解战区遥感任务中真实标注样本不足与类别失衡问题。
  • 表明DDPM生成的平衡样本能显著改善少数类识别,且收益可在纯真实测试集上成立。
  • 可为粮食安全监测、环境影响评估及战后农业恢复规划提供更可靠的卫星分析方法。
  • 提示合成遥感数据的评估应严格隔离训练与测试数据,避免生成样本造成结果高估。
📝 原始笔记(逐字保留)
标题:Synthetic Data Augmentation for Satellite-Based Analysis of Battle-Damaged Agricultural Fields in Ukraine 来源:arXiv 链接:https://arxiv.org/abs/2608.16380 摘要:Monitoring war-induced damage to agricultural land in Ukraine is important for understanding threats to food security, environmental stability, and post-war recovery. However, the development of computer-vision systems for satellite-based damage analysis is limited by the scarcity of labeled imagery, especially for damaged agricultural fields. This work investigates synthetic data augmentation as a method for improving classification under limited and imbalanced training data. We train class-conditional Generative Adversarial Network (GAN) and Denoising Diffusion Probabilistic Model (DDPM) architectures on real satellite images and use them to generate additional bombed and not-bombed agricultural-field samples. The generated images are used only for training augmentation, while all downst

上下文压缩会增加智能体的隐性交互成本

研究发现,上下文压缩即使未显著降低任务完成率,也可能迫使智能体反复检索被丢弃的执行状态,从而产生任务完成指标无法揭示的交互成本。

 智能体 长上下文 交互式评估 工具调用 状态表征 评估方差 上下文压缩 重获成本 交互成本

研究提出受控运行时测量协议,在固定 24 轮的确定性规划环境中量化工具型智能体重新获取丢失状态的成本,并将工具调用拆分为检索与执行两类。对三个模型、两种任务设置的实验表明,六组比较中的检索调用均随压缩增加,且几乎解释了全部新增交互;在预设的 5 倍压缩点,任务完成率变化均不显著。以 GPT-5.5 为例,完成率由 80% 变为 85%,但平均检索调用从 21.0 次升至 63.9 次;DeepSeek 仅在 10 倍压缩时出现显著完成率下降。保留状态的内容有效性会显著影响重获成本,而 ALFWorld 中未出现同类检索激增,说明该现象取决于环境及执行相关状态是否需要被重新获取。

用途与启示
  • 提醒智能体评测不能只看任务完成率,还应报告检索调用、总工具调用、延迟与令牌成本等运行时指标。
  • 可用于比较不同上下文压缩、摘要和记忆保留策略,区分“仍能完成任务”与“能够高效完成任务”。
  • 为长程工具调用智能体设计状态保留机制提供依据,应优先保存执行相关且语义有效的状态,而非仅控制上下文长度。
  • 评估压缩方案时应覆盖不同环境,因为状态重获成本并非上下文缩短后必然出现的普遍现象。
📝 原始笔记(逐字保留)
标题:What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics 来源:arXiv 链接:https://arxiv.org/abs/2608.16370 摘要:Task completion is the standard metric for evaluating context compression, yet it is incomplete: compression can increase an agent's interaction cost by forcing it to reacquire dropped state while leaving completion statistically unchanged. We introduce a controlled runtime measurement protocol for reacquisition cost in a bounded-horizon tool-using agent. The agent acts in a deterministic planning environment under a fixed 24-turn horizon. We vary compression severity, compare a dropping operator with a fact-preserving operator, restore dropped state through controlled oracle interventions, and decompose tool calls into retrieval and execution. We evaluate three models across two task regimes. Retrieval calls increase in all six model-regime comparisons and account for almost all added int

MELD:分布式智能体记忆的知识合并协议

MELD 通过知识图谱、可审计 Patch 与无协调者 CRDT,在分布式智能体记忆间实现知识合并、关联、冲突保留及分区后自愈。

 多智能体系统 智能体记忆 知识解耦 内部一致性 执行恢复 协议审计 联邦记忆 知识合并 冲突保留

MELD 面向分布式智能体记忆联邦,为每条传入声明提供插入、合并、关联、冲突或拒绝五种处理结果。决策综合带作用域的声明键、嵌入相似度和自然语言推断结果,并受上下文与新鲜度门控;所有状态变更只能通过经过认证、可审计的 Patch 完成。系统结合发布/订阅传输与逐声明状态 CRDT,无需中心协调者即可在网络分区或有损路由后重新收敛,同时保留矛盾声明而不擅自裁定真伪。实验显示,其分布式合并召回率不逊于集中式存储,相比朴素并集减少约 11% 在线存储,合并分类器 AUC 达 0.968,语义路由在同等召回率下将消息量降低约 3 倍。

用途与启示
  • 为多智能体系统设计可互操作的长期记忆层提供协议化参考。
  • 用唯一、认证且可审计的 Patch 约束状态修改,可增强知识更新的可追溯性与安全性。
  • 将矛盾表示为显式冲突而非静默覆盖,适合需要后续人工或自动证据裁决的系统。
  • 逐声明状态 CRDT 与语义路由可用于构建具备断网自愈能力、通信成本更低的边缘—云协同智能体架构。
📝 原始笔记(逐字保留)
标题:MELD: A Protocol for Merging Knowledge Across Distributed Agentic Memories 来源:arXiv 链接:https://arxiv.org/abs/2608.16357 摘要:Autonomous agents share a transport and can call each other's tools, but they cannot share what they know: no protocol lets two agents' memories reconcile a fact phrased two ways, link related facts held apart, or reconcile contradictory knowledge without silently discarding either claim. We present MELD, a self-managing coherence mechanism for a federation of agent memories whose run-time model is the knowledge graph itself. Each brain admits every incoming claim through a five-outcome procedure (insert, merge, relate, conflict, or reject), decided from three signals (scoped claim-key identity, embedding similarity, and a natural-language-inference verdict) under context and freshness gates, and acting through exactly one auditable, authenticated Patch, the only object that mutates state.

AeroCopilotBench:交互式虚拟驾驶舱中的航空副驾驶智能体评测

AeroCopilotBench通过静态知识与交互式应急操作两级评测,系统衡量航空副驾驶智能体的程序执行、状态反馈利用和安全合规能力。

 智能体 交互式评估 过程评估 技能安全 长程任务 航空人工智能 驾驶舱系统

论文提出可复现的航空副驾驶操作环境 ACOE,以及包含两级任务的 AeroCopilotBench。Tier-1 使用 1,200 道选择题评估航空知识,Tier-2 则在虚拟驾驶舱中设置 73 项源自制造商飞行员操作手册的紧急与异常任务。ACOE 将自然语言程序转化为可执行的状态转移、终态目标和硬安全约束,并通过标准化工具接口要求智能体诊断故障和操作飞机系统。对 12 个模型的测试显示,Tier-2 最高成功率为 72.6%,且静态知识成绩不能稳定转化为程序执行能力;451 个失败回合主要暴露出程序不完整、忽视状态反馈和长程执行管理不足。

用途与启示
  • 为航空智能体提供兼顾知识、任务完成度与轨迹安全性的可复现评测框架。
  • 提醒研究者不能以静态问答成绩替代真实交互环境中的程序执行评估。
  • 可用于研究状态感知的智能体编排、长程任务管理以及硬安全约束下的工具调用。
  • 适合作为航空代理版本迭代中的重复回归测试基准,定位操作流程和安全合规退化。
📝 原始笔记(逐字保留)
标题:AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment 来源:arXiv 链接:https://arxiv.org/abs/2608.16349 摘要:Large language model (LLM) agents may assist flight crews with complex decisions and task execution, but existing aviation evaluations centered on static knowledge do not support systematic testing of procedural execution and safety compliance in interactive environments. This paper presents the AeroCopilot Operational Environment (ACOE), a reproducible interactive virtual-cockpit test environment, and AeroCopilotBench, a two-tier aviation agent evaluation benchmark. Tier-1 evaluates aviation knowledge using 1,200 multiple-choice questions, while Tier-2 comprises 73 emergency and abnormal tasks derived from the manufacturers' Pilot's Operating Handbooks (POHs) and instantiated in ACOE. ACOE converts natural-language procedures into executable state transitions, final-state goal conditions,

TAILS:任务锚定的预训练模型持续学习表征塑形

TAILS 通过固定任务锚点构造潜在回忆并直接修正特征表征,以较低开销缓解预训练模型持续学习中的跨任务歧义。

 持续学习 状态表征 目标推断 任务锚定 表征塑形 跨任务推理

预训练模型虽然能为持续学习提供稳定表征,但单任务适应良好并不意味着模型能在未知任务归属下可靠预测。TAILS 在预训练模型之后加入轻量模块,以固定任务锚点作为累积知识的持久参照,并根据样本与各锚点的关系组合跨任务证据。该方法将组合后的证据形成“潜在回忆”,在分类前直接修正特征,而非选择任务专属路径或调整分类器输出。实验显示,TAILS 可兼容多种基于预训练模型的持续学习范式,以较少参数和近乎可忽略的推理成本提升分类及任务推断性能。

用途与启示
  • 为解决类增量学习中的任务身份未知问题提供表征层方案,减少语义交叠任务之间的推断歧义。
  • 固定任务锚点可作为低成本、持久化的知识索引,为持续积累任务提供稳定参照。
  • 解耦训练且不改动原始预训练模型、分类器和方法专属模块,便于作为插件集成到现有持续学习系统。
  • 将跨任务证据用于预测前的特征纠偏,为记忆检索、任务路由之外的持续学习设计提供新思路。
📝 原始笔记(逐字保留)
标题:Task-Anchored Representation Shaping for Pre-Trained Model-Based Continual Learning 来源:arXiv 链接:https://arxiv.org/abs/2608.16345 摘要:Pre-trained models (PTMs) provide a strong foundation for continual learning by offering stable representations that facilitate lightweight adaptation to new tasks. However, adapting well to each task does not ensure reliable inference over all learned tasks. Since task boundaries are often artificial and semantically entangled, an input from an unknown task can remain ambiguous even with strong PTM features, making cross-task prediction a key bottleneck. We propose Task-Anchored Inference Latent Shaping (TAILS), a lightweight post-PTM module that can be integrated into diverse continual learners and optimized through a decoupled step. TAILS uses fixed task anchors as persistent references to accumulated knowledge. It interprets each sample's feature representation relative to these refere

实证研究:AI在“杀猪盘”中比人类更易建立信任

一项对照实验与诈骗产业访谈显示,LLM智能体比受训人类更易在长期聊天中取得信任,而东南亚诈骗团伙已将大模型用于翻译、话术润色和批量维护关系。

 网络安全 智能体 用户保护 社会智能 人工智能安全治理 长程任务 情感诈骗 社会工程攻击 诈骗检测

研究人员让22名参与者分别与LLM智能体和受训人类连续聊天一周,46%的参与者接受了AI推荐的应用,而接受真人推荐程序的比例为18%。参与者约80%的消息发给AI,对AI的平均信任评分为3.78分,高于真人的3.31分,揭示了耐心互动、持续记忆和合理化失误对信任建立的作用。团队还访谈了145名诈骗产业相关人士;2024年接受访谈的34名内部人士均表示日常工作会使用ChatGPT,主要用于翻译、润色和根据聊天记录起草回复。此类诈骗的恶意意图分散在长期关系塑造过程中,单条消息通常无害,使依赖显性违规内容的传统安全过滤器难以及时识别。

用途与启示
  • 提醒安全研究从单条内容审核转向跨会话、长时间跨度的意图与关系演化检测。
  • 可据此设计情感诈骗基准,评估模型是否会主动拉近关系、隐藏身份、规避核验并逐步引导交易。
  • 防骗产品应结合聊天轨迹、异常亲密速度、回避音视频、迁移封闭平台和资金请求等复合信号。
  • 面向普通用户,应强调涉及下载未知应用或资金转移时进行独立核验,不能仅凭对话自然度判断对方是否可信。
📝 原始笔记(逐字保留)
标题:实证研究:AI杀猪盘比人类更强,已上岗缅甸 来源:量子位(微信公众号) 链接:http://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247913187&idx=3&sn=1e01310da3828a8ff7ec06940f621592&chksm=e9b8c63a746c5406b2d5398ab6e11623070d7d3fc2b81db5560c9d1e61320f1d8576d78aa29c&scene=0&xtrack=1#rd 摘要:

MemoraX Code:让 Coding Agent 拥有长期记忆

MemoraX Code 通过跨任务、跨对话和跨 Agent 的长期记忆及 Procedure Memory,将历史开发轨迹提炼为可复用工程经验,以提升复杂编程任务表现并降低调用成本。

 人工智能辅助编程 智能体记忆 经验复用 轨迹蒸馏 智能体技能库 长程任务 编程记忆 过程记忆

MemoraX Code 结合本地代码仓记忆与云端长期记忆,保存项目结构、历史决策、开发者习惯和关键约束,并支持在 Codex、Claude Code 等不同 Agent 之间复用。系统不直接回填全部历史,而是学习信息的写入、更新、提炼与按需召回,使被上下文压缩丢弃的关键经验仍可进入后续任务。其 Procedure Memory 可从历史 Coding 轨迹中提炼结构化 Skill;实验中从 123 个任务片段归纳出 15 条工程经验和 4 类过程记忆,使新增长程任务综合得分由 11.71 提升至 70.30,关键检查项由 2/13 增至 10/13。该方法还将 API 调用成本从 31.48 美元降至 24.37 美元,降幅约 22.6%;在 AML Coding Track 获得 62 分,并报告 85.5% 的记忆触发行为与用户判断一致。

用途与启示
  • 为长期软件工程 Agent 提供独立于单次会话和具体模型的项目记忆层,减少重复扫描、解释和试错。
  • 将历史执行轨迹提炼为可复用的工程技能,使 Agent 从“记住发生过什么”进一步转向“学习以后怎么做”。
  • 记忆系统的核心评估不应只看存储或召回率,还应衡量其对后续任务决策、完成质量和调用成本的实际增益。
  • 在私有数据与训练体系隔离的前提下,可利用专门任务、奖励和反馈训练记忆的写入、更新、遗忘及触发策略。
📝 原始笔记(逐字保留)
标题:让 Coding Agent 开始「记住过去」:MemoraX Code 的长期记忆系统 来源:机器之心(微信公众号) 链接:http://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651050939&idx=1&sn=048d1d6f8e05e0ae4bd944928e5d2171&chksm=85a4c0fde3a366ed05ceb6d20865113a94146121bfc49133d590d96304df40137ff4780c34a7&scene=0&xtrack=1#rd 摘要:

PIHF:以人类反馈将后训练强化学习引入上下文学习

PIHF以固定权重语言模型为执行底座,通过模型批评者与临床专家迭代修订版本化的自然语言策略和工具集,在超罕见病诊断中显著提升检索召回率。

 上下文学习 人在回路 临床推理 罕见病 策略优化 工具调用 状态回滚 专家反馈

PIHF借鉴广义策略迭代的“评估—改进”循环,但不更新预训练模型权重,而是持续修订版本化的自然语言策略与工具集。语言模型批评者和临床专家共同审查完整的面板推理及工具调用轨迹,定位反复出现的失败并提出候选修订。临床专家可以重新解释证据,并保留策略准入与回滚的最终决定权,候选策略执行后再以Recall@1和Recall@5验证效果。在累积消融和超罕见病基准上,该策略同时改善了闭源及3B至49B参数规模的多个开放权重执行模型,其中GPT-5.4与Qwen3.6-35B的Recall@1分别提升32.7和31.1个百分点。

用途与启示
  • 展示一种无需更新模型权重、仅演化提示策略和工具集的后训练替代路径。
  • 可将专家审查、候选策略准入、效果验证和版本回滚组织为可审计的持续改进闭环。
  • 表明高质量策略能够跨不同规模和来源的执行模型迁移,适合模型受限或临床安全要求较高的场景。
  • 为罕见病诊断系统提供以召回率为核心、由临床专家掌握最终控制权的人机协作范式。
📝 原始笔记(逐字保留)
标题:Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning 来源:arXiv 链接:https://arxiv.org/abs/2608.16831 摘要:Generative pretraining established reusable task representations; later work on language-based task conditioning and in-context learning showed that a fixed model could adapt its behavior from instructions and demonstrations. Policy Iteration with Human Feedback (PIHF) builds on this development and the recurrent evaluate-and-improve structure of generalized policy iteration. PIHF uses a pretrained language model as its execution substrate and moves persistent revision to a versioned natural-language policy and tool set. A language-model critic and clinical expert review complete-panel reasoning and tool-use trajectories to localize recurrent failures and form candidate revisions; the expert may reinterpret the evidence and retains authority over admission and rollback, while Recall@1 and

神经符号具身智能体:视觉探索与约束规划

该研究将任务导向的视觉探索、PDDL 约束解码与蒙特卡洛树搜索结合,使开放模型生成可执行的长程家庭任务计划,并在 VirtualHome 和 ALFWorld 上取得超过 90% 的成功率。

 神经符号人工智能 具身智能 符号规划 任务规划 第一人称视觉 长程任务 约束解码 视觉探索 可执行性

研究提出一种神经符号具身智能体,将长程家庭任务拆分为任务导向的视觉探索和受约束的符号规划两个阶段。第一阶段通过视觉语言模型与探索框架,从第一视角观察和落地交互中获取目标相关谓词及实例绑定,构建符号初始状态。第二阶段利用 PDDL 转移模型将解码限制在可执行动作上,再由蒙特卡洛树搜索结合领域无关启发式评估后续计划。在 VirtualHome 和 ALFWorld 中,4B—27B 开放模型的成功率均超过 90%,其中约束与搜索结合在 ALFWorld 上解决了超过 95% 的任务,同时减少了生成令牌和模型可见图像数量。残余错误主要来自状态获取和视觉落地,而非计划生成。

用途与启示
  • 为具身智能体提供“感知建模—符号约束—搜索验证”的长程任务规划范式。
  • 说明约束解码与搜索具有互补性,单独使用任一机制都难以保证复杂任务的高成功率。
  • 可通过 PDDL 转移模型在生成阶段保证动作序列的可执行性,降低语言模型产生违反环境动力学计划的风险。
  • 结果表明小型开放模型配合结构化规划框架,可优于更大的端到端视觉策略,并显著降低推理成本。
  • 失败定位提示后续工作应优先改进视觉落地、状态获取与符号初始状态构建。
📝 原始笔记(逐字保留)
标题:Neurosymbolic Embodied Agents 来源:arXiv 链接:https://arxiv.org/abs/2608.16794 摘要:Language and vision-language models generate plausible embodied plans but do not guarantee executability, as their outputs can violate environment dynamics or act on incorrectly grounded entities. We present a neurosymbolic agent that factors long-horizon household tasks into task-directed visual exploration and constrained symbolic planning. In the first phase, a vision-language model and exploration harness acquire goal-relevant predicates and instance bindings from egocentric observations and grounded interactions, producing a symbolic initial state. In the second, a PDDL transition model restricts decoding to tokens that extend applicable actions. Monte Carlo tree search then evaluates executable continuations using a domain-independent planning heuristic. The resulting plans are execu

TDD-Agent:测试驱动的代码生成推理

TDD-Agent 先生成可执行测试以明确预期行为,再利用执行反馈迭代优化代码与测试,从而提升仓库级代码生成的正确性和测试质量。

 人工智能辅助编程 智能体 SWE 软件工程 过程验证 软件缺陷修复 测试驱动开发 双轨精炼

TDD-Agent 将测试驱动开发范式引入代码生成,让模型在实现代码前先生成可执行测试,以显式梳理预期行为。框架依据执行反馈,对生成代码和测试进行双轨迭代精炼,避免将不完整或错误的测试视为固定验证器。仅采用测试优先推理的 TDD-prompt 已在 LiveCodeBench 上优于推理提示基线,完整框架在仓库级 RepoEval 上也超过检索式与智能体式基线。进一步分析表明,迭代过程同时提高了代码正确率以及测试的通过率、覆盖率和变异测试得分。

用途与启示
  • 将测试从事后验证工具转化为可持续演化的推理载体,用于澄清需求并指导实现。
  • 为仓库级代码智能体提供“先测试、再实现、共同修正”的闭环工作流。
  • 评估代码生成系统时,应同时考察实现正确性、测试覆盖率和变异测试得分,防止错误测试产生误导反馈。
  • 可用于自动缺陷修复、代码补全及复杂软件工程任务中的执行反馈优化。
📝 原始笔记(逐字保留)
标题:TDD-Agent: Test-Driven Reasoning for Code Generation 来源:arXiv 链接:https://arxiv.org/abs/2608.16742 摘要:Large Language Models (LLMs) have achieved remarkable progress in code generation, yet ensuring correctness in complex, repository-level tasks remains challenging. Existing approaches often use generated tests as static post-hoc validators, which limits their ability to guide implementation and may introduce misleading feedback when the tests themselves are incomplete or incorrect. In this paper, we introduce TDD-Agent, which operationalizes the test-driven development paradigm for code generation. TDD-Agent first prompts the model to generate executable tests, encouraging it to clarify expected behaviors before implementation, and then performs iterative dual-track refinement over both the generated code and tests using execution feedback. We first isolate the effect of test-first reasoni

VCE-Skill:利用版本变更经验增强技能自进化

VCE-Skill将公共技能版本历史提炼为结构化演化经验,并与当前任务的执行轨迹自适应融合,以提升智能体技能自进化及跨模型迁移能力。

 自进化 智能体技能库 经验复用 轨迹技能 版本状态管理 能力迁移 版本经验 技能演化 变更提炼

VCE-Skill针对现有方法主要依赖当前任务执行轨迹、未充分利用公共技能版本历史的问题,引入版本变更经验。该方法从噪声较多且依赖具体实现的公开技能变更中,提炼可复用的结构化演化先验。随后,它将这些外部先验与基础演化器基于任务轨迹生成的修改建议自适应融合,从而兼顾通用经验与任务证据。实验显示,VCE-Skill将平均得分提高3.20至4.98分,演化后的技能还具有更强的跨模型迁移表现。

用途与启示
  • 将公共仓库中的技能版本历史视为可复用的演化数据源,拓展仅靠在线执行轨迹的技能优化范式。
  • 可用于构建具备持续维护和自我改进能力的智能体技能库。
  • 结构化提炼与自适应融合机制为整合外部经验和任务内证据提供了通用方案。
  • 跨模型迁移结果表明,版本变更经验有助于减少技能对特定底座模型的依赖。
📝 原始笔记(逐字保留)
标题:VCE-Skill: Enhancing Skill Self-Evolution with Version-Change Experience 来源:arXiv 链接:https://arxiv.org/abs/2608.16544 摘要:Agents increasingly rely on reusable skills to encode task knowledge, tool-use procedures, and validation rules. Existing skill self-evolution methods primarily revise skills using execution trajectories collected from current tasks, leaving the evolution knowledge accumulated in public skill version histories largely untapped. Our pilot study reveals a clear complementarity between the two sources: public skill changes provide reusable evolution priors, whereas trajectories provide evidence grounded in the current task. Motivated by this, we propose VCE-Skill, which distills noisy and implementation-specific public skill changes into reusable, structured version-change experience and adaptively fuses it with trajectory-derived proposals from the base evolver, thereby exploiting external e

工具技能检索中的来源风格坍缩

研究揭示工具与可执行技能检索器会因查询来源风格变化而性能坍缩,并提出基于 TF-IDF 风格指纹的 ToolScout 路由机制来显著恢复覆盖率。

 工具调用 智能体技能库 检索增强生成 模型路由 跨域泛化 风格坍缩 信息源路由

论文在 ToolRet 基准上发现,即使工具语料库保持不变,在单一来源切片上微调的检索器也可能在另一来源切片上严重失效,作者将其称为“来源风格坍缩”。查询侧 TF-IDF 指纹比语义相似度或长度特征更能预警这种来源错配。作者提出来源感知路由方法 ToolScout,在包含 4,996 个查询的混合流上将覆盖率从 22.3% 提升至 86.1%。在五个发生坍缩的来源上,仅使用 20 个匹配样例,就将覆盖率加权的全局 Top-1 代理指标从 1.3% 提升至 53.9%;将工具改写为可执行技能卡后现象仍然存在,说明问题并非仅由 API Schema 格式造成。

用途与启示
  • 为工具调用智能体提供低成本的检索失效预警信号,避免能力存在却无法被检索和调用。
  • 在多来源查询场景中加入来源感知路由守卫,可按风格选择更匹配的检索器。
  • 评估工具或技能检索系统时,应显式采用跨来源切片测试,而不能只依赖随机划分和整体平均指标。
  • 少量来源匹配样例即可显著改善路由效果,为低成本适配新用户、新平台或新查询风格提供思路。
📝 原始笔记(逐字保留)
标题:When Tool-Backed Skill Retrieval Fails: Source-Style Collapse in Executable Capability Retrieval 来源:arXiv 链接:https://arxiv.org/abs/2608.16502 摘要:Large-scale agents increasingly rely on retrieval to access external capabilities. We study this retrieval gate in structured tools and APIs, a measurable class of tool-backed executable skills that must be surfaced before an agent can plan, incorporate, or act. In this setting the retrieval layer can silently fail even when the capability corpus is fixed: on ToolRet, a retriever fine-tuned on one source-specific slice collapses on another source-specific slice of the same benchmark, with FT-1100 despite its higher lexical overlap with the gold tools. We call this failure mode source-style collapse. Query-side TF-IDF fingerprints flag source styles on which the fine-tuned retriever is likely to fail better than semantic or length-based proxies, giving a cheap signal for mismatch over a fix

SoftModel:可自主生长拓扑的持续在线学习模型

SoftModel以“全可塑性”为前提,通过受预算、审计和现实验证门控约束的结构算子,使长期运行的神经模型能随非平稳需求持续扩展拓扑并保持学习稳定性。

 持续学习 自进化 模型开发 环境适应 生命周期管理 结构生长 全可塑性

SoftModel打破“训练后冻结参数与拓扑”的传统范式,允许模型在持续服务期间同时改变参数和网络结构。其结构代数覆盖宽度、层级、组合、输入接口、循环结构和注意力头等扩展操作,并保证操作应用时的精确性。所有结构增长均受预算与审计机制约束,是否采纳则由独立留出数据构成的现实门控统一评判。作者在标准持续学习基准上验证了长任务序列中的学习保持能力,同时通过预注册实验完整报告有效与失败结果。

用途与启示
  • 为非平稳数据流上的长期在线模型提供按需求扩容的新架构思路。
  • 将稳定性从“冻结模型”转化为可审计的生命周期治理属性。
  • 可用于研究参数更新与拓扑演化的统一评估、预算控制和采纳机制。
  • 提示结构扩容的边际价值可能只能在实施后观测,因此增长治理需重视事后验证与回滚。
📝 原始笔记(逐字保留)
标题:SoftModel: A Neural Model That Grows Its Own Topology -- Governed Structural Growth for Continual In-Service Learning 来源:arXiv 链接:https://arxiv.org/abs/2608.16409 摘要:Today, a neural system is almost always used in two phases -- trained, then deployed -- and in that regime it freezes twice: training ends, and the topology itself was never a degree of freedom. We take the opposite premise as an axiom -- total plasticity: no part of a model, including its structure, is ever frozen -- and derive the governance a lifelong learner then requires. The design's target regime is continual, in-service learning: a long-lived model on a non-stationary stream, whose stability comes from governance rather than immobility and whose capacity follows demand. The result is a growable soft model: an algebra of structural operators (width, hierarchy, composition, input interface, grown cycles, attention heads), each exact at application, budgeted, and audited, with adoptio

DeepInsight II:从基准到真实机器人的统一评测轨迹

DeepInsight II 以统一轨迹贯通导航、操作、全身控制及真实机器人实验,使仿真到现实差距可直接量化,并支持面向修复的故障定位。

 具身智能 模型评估 真实世界基准 轨迹验证 故障归因 闭环评估 具身智能评估 仿真到现实迁移

DeepInsight II 沿用首版的任务、资源与结果三类抽象,将量化评测重点扩展至 Physical AI 的具身层。研究按照原生协议复现两个导航和四个操作基准中的公开检查点,并通过 MotionBench 统一评测四种全身控制器。仿真与真实机器人执行共享父级轨迹标识,同时保留各执行域记录,从而可原生计算 sim-to-real 差距。系统还为 System 2–1–0 组合流程定义五类有证据支撑的交接故障标签,并将其映射到具体修复动作与可修复性指标。

用途与启示
  • 为导航、操作和全身控制提供跨基准、跨机器人接口的统一评测方式。
  • 通过配对的仿真与实体轨迹,减少跨工具链对账造成的误差,更可靠地衡量 sim-to-real 差距。
  • 将系统级失败定位到不同层级的交接环节,并关联可执行的修复动作。
  • 为具身智能从基准测试走向真实部署建立可追踪、可诊断的证据链。
📝 原始笔记(逐字保留)
标题:DeepInsight II: One Trace from Benchmark to Robot 来源:arXiv 链接:https://arxiv.org/abs/2608.16556 摘要:Across a Physical AI stack, evaluation maturity is inversely aligned with deployment risk: foundation models enjoy mature, standardized harnesses, while the embodied layers on which deployment actually turns remain fragmented across benchmark-specific simulators, embodiments, and interfaces. The first DeepInsight report (v1) unified evaluation across this stack behind three abstractions---task, resource, and result---but its quantitative evidence centered on the foundation-model layer; navigation and manipulation (System 1) and whole-body control (System 0) remained simulation case studies, and physical execution was outside its empirical scope. DeepInsight II keeps that substrate fixed and quantifies the embodied half. First, it reproduces released-checkpoint references across two navigat

ACA-RL:面向缺失前提推理的询问、条件回答与弃答强化学习

ACA-RL通过推理图引导的数据增强和结构化奖励,训练模型识别缺失前提,并在询问、条件回答或弃答之间采取合适策略。

 推理 强化学习 拒答校准 数据合成 逻辑推理 欠定推理 前提识别

论文关注现实查询因缺少关键前提而无法得到唯一答案的问题,主张模型不应简单作答或一律拒绝。ACA-RL利用推理图将完备问题转换为带局部缺口标注的缺失前提训练样本,并针对五类可观察响应行为设计结构化奖励。作者还提出经人工验证的 Missing-Premise Benchmark(MPB),包含274个数学、逻辑和现实文字问题实例。在Qwen3和Llama模型上的实验表明,该方法能持续提升缺失前提处理能力,同时保持对完备推理任务的竞争力。

用途与启示
  • 将推理模型的训练目标从“必须给出答案”扩展为识别任务是否欠定,并选择询问、条件回答或弃答。
  • 可用于改进智能体在信息不完整场景下的澄清能力,降低臆测前提和无依据回答。
  • 推理图引导的缺口构造方法为生成高质量不完备问题训练数据提供了可复用方案。
  • MPB可用于评测模型的不确定性处理、前提识别与拒答校准能力。
📝 原始笔记(逐字保留)
标题:Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning 来源:arXiv 链接:https://arxiv.org/abs/2608.16554 摘要:Answer-only reinforcement learning (RL) trains reasoning models to solve fully specified problems, but many realistic queries omit a premise needed for a unique answer. In this setting, the useful response is not always refusal: the model should ask for the missing premise, condition its answer on the unknown quantity, or abstain when no informative conditional response is available. We present \emph{Ask-Condition-Abstain Reinforcement Learning} (ACA-RL), a data-augmented RL framework for this setting. Its reasoning-graph-guided pipeline converts well-posed problems into missing-premise training instances with localized gap annotations; ACA-RL then trains on these instances with a structured reward over five observable response behaviors. We also introduce the \emph{Missing-Premise Benchma
0%