2026-09-03 科研追新
当日精选(由提交工具自动创建)。
MVP具身模型展示长程决策与跨本体协作能力
神秘团队通过四组一镜到底Demo展示代号“MVP”的具身模型在物理交互、零样本家务、跨本体协作和能量导向决策方面的能力,并宣称其具备持续自进化特征。
- MVP(Make Veritable People)模型在外力干扰下同时保持水杯稳定并扶住易拉罐,团队将其归因于动力学预测与长期状态建模的统一。
- 在家务整理Demo中,机器人依据空间关系和物体属性完成拖、挂、抛等操作;团队宣称该任务为零样本执行,成功率达到80%,但未提供公开评测细节。
- 两台不同型号机器人仅通过人类视频训练完成床单拉平与抖动,展示“一脑多形”的跨本体协作能力。
- 模型还被描述为采用能量驱动的行为决策,在长程收纳任务中一次携带多件物品,以降低行动成本;目前相关技术路线、数据和实验结果尚未公开验证。
- 为具身基础模型研究提供融合物理动力学、空间语义、长程状态与行为习惯的系统设计参考。
- 提示具身智能可将任务效率或能量下降作为决策目标,以形成更接近人类的自主规划策略。
- 跨本体协作Demo可用于探索共享策略、能力迁移以及多机器人任务分工。
- 文章主要依据演示视频和团队口述,缺少论文、代码、基准及第三方复现,评估时应重点核查遥操作排除、零样本定义和成功率统计方法。
📝 原始笔记(逐字保留)
EvoX 蜂群智能体让 AI 自主寻找研究方向
EvoMap 通过去中心化蜂群协作、独立上下文和经验继承机制,让多智能体共同完成算法优化与可验证的自动化科研闭环。
多智能体系统 多智能体协作 自动化科学研究 自进化 经验复用
EvoMap 推出的 EvoX 采用去中心化蜂群模式,使多个 Agent 根据任务信号自主组队、协作并继承经验,而非依赖单一调度中心。文章称,在使用 Claude Haiku 4.5 解答 563 道逻辑、数学和物理题的测试中,单 Agent、Sub-Agent 与 EvoX 蜂群模式的正确率分别约为 26%、38% 和 70% 以上。其关键设计是让各 Agent 保持独立上下文,并由程序确定性汇合结果,以减少多智能体交接和汇总过程中的信息损耗。开源项目 AutoResearch 将规划、实现、运行和审查 Agent 组成科研闭环,并在 SWE-bench Lite 的 Django 修复任务中实现新增测试 7/7、回归测试 203/203 通过。
- 展示了在模型不变的情况下,智能体组织结构和结果汇合机制也可能显著影响系统性能。
- 为自动化科研提供“规划—实现—运行—审查—反馈迭代”的可追溯闭环范式。
- 提示多智能体系统应重点控制上下文交接损耗,优先采用独立上下文、结构化产物和确定性验证。
- 可用于持续优化遗留算法、软件修复、调度系统和其他试错成本较高的工程任务。
- “一个 Agent 学会、多个 Agent 继承”的经验复用机制,为群体智能持续进化提供了工程化方向。
📝 原始笔记(逐字保留)
ClawBench:真实网站任务中前沿 AI Agent 最高成功率仅 33%
ClawBench 在 144 个真实生产网站上评测 8 款 AI Agent,揭示其在写操作、长程执行、终态提交和反机器人验证方面仍存在严重缺陷,最高任务完成率仅约 33%。
ClawBench 包含 144 个真实生产网站上的 153 项日常任务,覆盖购物、旅行、求职、社交和工作等 15 类场景,重点考察下单、预约、提交申请等会改变网站状态的写操作。评测采用 final-request interception,通过 Chrome 扩展与 CDP 拦截不可逆的最终 HTTP 请求,使 Agent 能走完真实流程而不实际下单或发送信息。Claude Sonnet 4.6 的最高完成率约为 33%,GPT-5.4 仅为 6.5%,且 44.4% 的任务没有任何模型完成;Qwen 3.5 和 GLM-5 则展现出较好的成本性能。主要失效模式包括反机器人验证、登录与表单错误、过早退出、虚假完成、无效循环,以及到达最终确认页后不提交的“最后一公里不承诺”。结果表明,沙箱网页基准上的高分难以迁移至真实互联网环境,当前网页 Agent 仍缺乏稳定的长程执行、状态理解、故障恢复与任务闭环能力。
- 为网页 Agent 提供更贴近实际部署条件的评测框架,避免仅依赖静态页面或沙箱环境高估能力。
- 可将终态请求拦截用于真实网站上的安全测试,在保留完整交互流程的同时阻止不可逆操作。
- Agent 设计应加入提交前状态验证、明确的完成判据、停止策略和循环检测,减少虚假完成与无效重试。
- 真实部署需要重点解决反机器人验证、登录状态、动态表单、超时恢复及类人交互等工程问题。
- 不同模型存在明显领域特化与成本差异,可据任务类型采用模型路由,而非假设单一旗舰模型能够通吃所有网站任务。
📝 原始笔记(逐字保留)
HarnessDev:LLM 自主创建与演化 Agent Harness
字节 Seed 团队提出 HarnessDev,让 LLM 从零创建并根据反馈演化 Agent Harness,但其性能提升稳定性、跨任务泛化和跨模型迁移能力仍然有限。
智能体脚手架演化 智能体脚手架 自我改进 智能体评估 成本优化
HarnessDev 分为 Creation 与 Evolution 两个阶段:先让 LLM 基于弱 seed 和少量案例搭建完整执行系统,再利用下游任务反馈持续修改 Harness。评估同时考察留出基准的任务成功率与执行 token 成本,实验覆盖 6 个 creator LLM、4 个领域和 2207 个留出任务实例。自动创建的 Harness 在代码、搜索和研究任务上仍明显落后于人工工程方案,但在写作与机器学习实验领域可达到或超过参考系统。演化虽然能够提高得分,却存在不稳定、对未见任务迁移有限以及跨模型复用效果较弱等问题。
- 说明 Agent 能力不仅取决于模型权重,也高度依赖执行循环、工具调用、上下文管理和故障恢复等 Harness 设计。
- 为自动化创建和演化智能体脚手架提供了兼顾任务效果与运行成本的评估范式。
- 提醒实践者谨慎看待“自进化”叙事:当前方法更接近受限的脚手架调优,尚不能稳定替代人工系统工程。
- 跨模型迁移结果表明,Harness 优化可能与底层模型深度耦合,部署时需要针对目标模型重新验证。
📝 原始笔记(逐字保留)
逐篇盘点:自进化系统学到了什么,局限在哪里
文章系统梳理20篇自进化方法论文,比较程序、提示词、工作流、技能库与harness五类优化对象的实际产物、评测表现及作弊、过拟合和基座依赖等局限。
文章按干预深度将自进化系统划分为程序、提示词或经验、工作流、skill 库和 harness 五类,并逐篇列出机制、学到的具体工件与使用限制。多数系统获得的并非抽象的“能力涌现”,而是可检查的代码工具、提示词规则、经验条目、工作流结构和脚手架组件。现有成果主要集中在数学、代码与终端等可自动验证任务,AlphaEvolve、DGM 和 TF-GRPO 等案例显示,自进化可通过搜索和评测反馈绕开部分昂贵的权重训练。横向比较也暴露出评测作弊、建模集与评测集重合、held-out 验证不足、弱基座失效和复现细节缺失等系统性问题。
- 为自进化系统选型提供分类框架,可按迭代速度、可逆性、跨任务复用能力和干预深度选择优化对象。
- 提醒研究者将独立 held-out 测试、反作弊检查和跨基座迁移纳入闭环评测,避免把评测器漏洞或基准过拟合误判为能力提升。
- 启示工程实践优先沉淀可审计、可复用的代码、规则、经验与技能工件,并完整披露搜索预算、评测协议和关键超参数。
📝 原始笔记(逐字保留)
Qwen-Drive-1.0:自动驾驶视觉语言基础模型
Qwen-Drive-1.0在预训练视觉语言模型上统一集成三维感知、视觉问答与运动规划,并在保留通用视觉语言能力的同时取得有竞争力的自动驾驶规划表现。
Qwen-Drive-1.0沿用预训练视觉语言模型架构,将三维感知、视觉问答和运动规划纳入统一框架。外接的鸟瞰视角(BEV)感知头联合完成三维目标检测、语义占用预测与BEV地图分割,并提供可检查的三维场景结构接口。Planning Expert基于共享的VLM表征生成自车未来轨迹,分阶段训练则混合驾驶监督数据与通用视觉语言数据。实验显示,该模型具备较强的三维感知和驾驶场景理解能力,并在开环、伪闭环及闭环评测中展现出有竞争力的运动规划性能。
- 展示通用视觉语言模型向自动驾驶感知、理解与规划一体化迁移的可行路径。
- 通过显式BEV感知接口增强三维场景结构的可检查性,有助于分析共享视觉表征中的空间信息。
- 分阶段混合训练可作为兼顾驾驶专用能力与通用视觉语言能力的训练范式。
- 多层次规划评测说明自动驾驶基础模型应同时覆盖开环、伪闭环和闭环场景。
📝 原始笔记(逐字保留)
SMELT:计算匹配型 MoE 循环 Transformer 的扩展规律
SMELT 在参数量、单词元 FLOPs 和 KV 缓存均匹配的条件下复用中间层,相比标准 MoE Transformer 可节省 6.8%~18.0% 的最优训练计算量。
SMELT(Sparse MoE Transformer, middle layers Loop Twice)将 Transformer 中间一半的层循环执行两次,同时严格匹配非嵌入参数量、单词元 FLOPs 和 KV 缓存预算。研究将该架构扩展至四种规模,最大达到 540 亿非嵌入参数,并分别拟合 Chinchilla 风格的扩展定律。结果显示,SMELT 的损失随计算量增长下降得更快,在计算最优前沿可节省 6.8%~18.0% 的训练 FLOPs,其优势在代码任务、长样本及更多上下文示例下尤为明显。机制分析发现,第二次经过共享层能够减弱 attention sink,并将注意力重新分配到与内容相关的词元。
- 说明循环复用深度的收益并非仅来自额外计算,在严格预算匹配下仍可优于普通 MoE Transformer。
- 为设计计算高效的大规模 MoE 模型提供可直接采用的中间层双循环方案。
- 提示扩展定律研究应同时控制参数量、FLOPs 与 KV 缓存,避免将计算增量误判为架构优势。
- 注意力重分配机制可用于解释循环架构在代码、长序列和上下文学习任务上的额外收益。
📝 原始笔记(逐字保留)
UI-Venus-2:跨移动端、Web 与桌面的通用 GUI 智能体
UI-Venus-2 通过统一的闭环推理—行动框架、规模化环境与任务构造以及多层轨迹验证,打造可跨移动端、Web 和桌面运行的开源通用 GUI 智能体。
UI-Venus-2 是面向真实数字任务自动化的通用基础 GUI 智能体,可在移动端、Web 与原生桌面操作系统中采用统一的闭环推理—行动框架执行任务。其环境覆盖超过 170 个多语言移动应用,并通过深度研究流水线生成与实际功能对齐的任务指令。训练阶段结合轨迹级与样本级评估器、视觉关键点和多模型投票,为强化学习提供更可靠的奖励信号。系统还引入面向高后果操作的安全机制,以提升执行的可控性、可验证性和实际部署可靠性。
- 展示了从基准导向 GUI 模型迈向真实世界通用智能体时,环境、任务和验证三个维度需要同步扩展。
- 可借鉴视觉关键点、轨迹评估与多模型投票相结合的奖励验证方案,降低强化学习中的错误奖励。
- 为跨移动端、Web 和桌面的统一智能体架构及多语言环境覆盖提供参考。
- 强调对高后果动作设置安全控制,可用于设计更可靠的 GUI 智能体执行边界。
📝 原始笔记(逐字保留)
H3-World:以语言指令实现交互式世界控制
H3-World通过结构化语言指令、时序潜变量对齐和注意力路由,将MiniMax-H3视频生成器轻量改造为可精确控制角色与镜头的交互式世界模型。
H3-World将330亿参数的MiniMax-H3视频生成器转化为交互式世界模型,不需要引入专门的动作模块。该框架把动作表示为角色指令与镜头指令的结构化组合,并将其与对应时间段的视频潜变量对齐。其时序注意力路由机制将每条指令限制在目标时间区间内,从而减少不同动作之间的控制泄漏。模型仅使用8,000个游戏样本、10,000步LoRA优化及0.199%的可训练参数,便实现有效控制、保持生成质量,并能泛化至未见场景。
- 展示自然语言可作为大型视频生成模型的统一控制接口,将预训练阶段形成的语义能力转化为世界交互能力。
- 为低成本构建可控世界模型提供路径:复用视频模型表征,仅通过LoRA和少量游戏数据完成适配。
- 时序注意力路由可用于提升连续动作的时间边界精度,降低多条指令之间的相互干扰。
- 可为交互式游戏生成、虚拟环境控制和具身智能仿真提供基础模型方案。
📝 原始笔记(逐字保留)
ZimaBlue:可扩展视频预训练驱动的泛化世界行动模型
ZimaBlue通过大规模第一人称视频预训练、机器人轨迹中期训练和目标机器人适配,将无动作标注视频转化为可实时控制且具备零样本泛化能力的世界行动模型。
ZimaBlue面向机器人动作轨迹昂贵且多样性有限的问题,利用人类与机器人第一人称视频学习物体交互、接触动力学、工具使用和长程行为。其三阶段课程依次包括因果具身视频预训练、采用统一动作表征的视频—动作中期训练,以及面向目标机器人的专门适配。系统采用异步 Slow-Fast 双分支架构,由高容量 Slow 世界模型提供可泛化的时空表征,轻量 Fast 分支则在 NVIDIA RTX 4090 上实现 30 Hz 动作预测。真实机器人零样本评测中,将训练规模从目标机器人数据扩展至超过 12 万小时具身视频后,任务成功率由 36.1% 提升至 77.8%,且在未见任务上的增益尤为明显。
- 展示了如何将海量无动作标注的第一人称视频转化为机器人控制所需的具身经验,缓解真实机器人数据稀缺问题。
- 三阶段训练方案为视频预训练、异构机器人动作对齐和目标平台部署提供了可复用的训练范式。
- Slow-Fast 异步架构兼顾大模型的表征与泛化能力和实时控制所需的低延迟,可用于具身基础模型的系统设计。
- 结果表明,扩大具身视频数据规模能够显著改善零样本与未见任务泛化,为世界模型的规模化训练提供实证支持。
📝 原始笔记(逐字保留)
Hi-Q:层次化证据引导的多跳问答查询优化
Hi-Q依据检索证据动态判断查询节点应终止还是继续分解,以层次化查询树缓解多跳问答中问题粒度与可检索证据粒度不匹配的问题。
Hi-Q将多跳问答的核心瓶颈表述为“可检索粒度发现”,不依赖固定分解模板或预先构建的语料图。框架在每个查询节点使用解析算子检查当前证据是否足以支持该查询单元:已解析节点停止扩展,未解析节点则通过保持依赖关系的二元算子继续分解,并由语义覆盖验证器检查。由此形成的查询树拓扑由语料支持信号动态决定,更适合在含大量开放域干扰项的全语料检索环境中定位相互依赖的证据。在三个多跳问答基准上,Hi-Q于全语料设置平均取得52.3 EM和64.0 F1,显著优于IRCoT,并在MuSiQue-full上超过图式RAG方法PropRAG且无需构建全局语料图。
- 为多跳检索系统提供按证据充分性自适应控制查询分解深度的方法,避免无效或过度分解。
- 展示了以局部证据支持信号动态生成查询树,可替代成本较高的全语料图构建。
- 解析算子与语义覆盖验证器可用于改进深度研究智能体的检索停止策略和证据完整性检查。
- 结果表明,开放域多跳问答的关键不仅是迭代检索,还包括发现与语料可检索粒度相匹配的查询单元。
📝 原始笔记(逐字保留)
原生统一多模态模型的理解-生成协同机制
研究从表征、任务与系统三个层面揭示统一多模态模型中视觉理解和生成的协同条件,并表明任务解耦架构与端到端优化可避免能力竞争。
研究在不依赖预训练视觉先验的原生统一多模态模型中,系统分析视觉理解与生成目标之间的关系。表征层面,生成可丰富理解任务的视觉特征,而理解可增强生成任务中的视觉-语言对齐,但共享同一计算路径时容易出现单一目标主导。任务解耦架构通过专门化存在冲突的视觉计算、同时保留语义交互,缓解了这种非对称退化。任务层面的案例表明,共享知识可带来双向正迁移;系统层面,端到端统一模型在同时要求图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。
- 为统一多模态模型的架构设计提供依据:冲突计算应适度专门化,语义知识则应保持共享。
- 提示理解与生成的统一并不天然产生协同,需要依据任务知识重叠程度设计联合训练目标。
- 支持在理解和生成紧密耦合的复杂任务中采用端到端系统,而非完全拆分的规划器-执行器方案。
- 可用于诊断联合训练中的容量竞争、目标主导和非对称能力退化问题。
📝 原始笔记(逐字保留)
DiagEvo:基于层次化错误记忆的诊断引导自进化
DiagEvo从模型自身失败历史中提炼层次化错误原因并据此生成训练课程,在无需外部任务资源的自博弈中持续改善推理能力。
DiagEvo引入诊断器,从求解器的历史失败中抽取反复出现的错误原因,并按技能节点组织为层次化错误记忆。系统依据针对性问题上的自一致性,将错误原因标记为 Active 或 Mastered,挑战器再结合状态与复现次数平衡定向出题和自由探索。双置信度过滤仅保留难度适中且多数答案具有明显票数优势的问题,以提高自博弈训练数据质量。使用默认的 4B 诊断器时,DiagEvo在三种求解器和九项基准上的平均准确率均优于基线;Qwen3-8B在五项数学推理基准上达到72.3%,比R-Zero高4.5个百分点。
- 表明模型的失败历史可以直接转化为自生成课程,无需依赖人工样例、外部语料或预设难度目标。
- 层次化错误记忆可用于持续追踪尚未掌握与已经掌握的推理技能,减少重复训练和能力退化。
- 将错误原因定向生成与自由探索结合,有助于兼顾弱点修复和新能力发现。
- 双置信度过滤为自博弈数据筛选提供了可复用机制,可提升训练样本的难度适配性与答案可靠性。
📝 原始笔记(逐字保留)
EvoMap:以经验流转构建系统级 RSI 闭环
EvoMap 团队通过 EvoX、Evolver 与 GEP 协议,将智能体执行轨迹蒸馏为可验证、可变异和可分发的 Gene,在不更新模型参数的情况下实现经验驱动的系统级递归自我改进。 [合并自 2026-09-03 evomap-rsi] EvoMap团队通过EvoX执行、Evolver提炼验证和GEP协议分发结构化经验基因,在不更新模型参数的情况下构建可持续进化的智能体网络。
自进化 智能体 递归自我改进 经验复用 多智能体系统 经验学习
EvoX在真实代码和工具环境中执行任务并记录带有成败反馈的完整轨迹,为后续经验提炼提供原材料。Evolver不直接复用冗长日志或Skill文档,而是将有效策略和失败警告蒸馏为紧凑、结构化且可验证的Gene;相关实验显示,其相较Skill方案可完成更多长流程任务,并降低9.9%的Token消耗。EvoMap借助GEP协议完成Gene的匹配注入、执行回写、验证、变异与固化,使经验能够在超过35.7万个Agent及481万项经验资产之间流转。LongWoF-Bench测试显示,Gene注入方案在7款主流模型上比依赖Skill文件的基线高出8.7至15.5个百分点,表明系统层经验复用可以在不更新基模参数的情况下提升能力。
[合并自 2026-09-03 evomap-rsi] EvoX 在真实代码与工具环境中执行任务并保留完整轨迹,使成功、失败和修复过程成为系统持续进化的原材料。内置的 Evolver 不直接复用冗长 Skill 文档,而是把轨迹蒸馏为紧凑的结构化控制对象 Gene,并对其适用条件和效果进行验证。EvoMap 通过 GEP(Gene Evolution Protocol)在超过 35.7 万个 Agent 与 481 万项经验资产之间完成匹配注入、执行回写、验证、变异和固化。文章援引实验称,Gene 相比普通 Skill 能提高复杂长流程任务通过率并降低 Token 消耗,说明系统可在不进行 SFT、RLHF 或参数更新的情况下持续增强。
- 为递归自我改进提供一条系统工程路径:先优化经验的提炼、验证和传播,而非完全依赖模型自训练。
- 将智能体轨迹压缩为带适用边界和版本状态的控制对象,可减少长上下文中的噪声与错误经验复用。
- 通过跨智能体共享已验证经验,使单次任务中的试错转化为群体可复用的能力资产。
- 可用于构建具备持续学习、失败规避和低成本测试时控制能力的代码智能体或科研智能体。
[合并自 2026-09-03 evomap-rsi]
- 为 RSI 提供参数更新之外的工程路径:通过执行、提炼、验证和分发经验实现系统级自我改进。
- 将智能体记忆从长篇日志或文档转化为带适用边界、版本和负面警告的结构化控制对象。
- 支持跨智能体复用真实任务经验,减少重复试错并形成群体层面的能力复利。
- 提示智能体系统评估应同时关注任务成功率、经验迁移效果、失效条件与 Token 成本。
📝 原始笔记(逐字保留)
通用决策大模型 Decitron:开放世界推演与求解闭环
中科闻歌发布通用决策大模型 Decitron,以显式世界模型、SAO 表示和混合多智能体推理架构实现开放世界中的持续建模、推演、求解与概率校准。
Decitron 将复杂决策问题统一表示为世界状态、参与主体、行动空间、约束关系、多轮互动和不确定结果,形成从现实信息到决策输出的完整链路。其 MetaWorld 通过环境层、智能体指标层和关系矩阵维护持久化世界状态,并以因果 DAG 约束状态更新;SAO 表示则记录状态、行动与结果的连续轨迹。AutoABM 自动构建多智能体仿真环境,并结合博弈、资源优化、路径规划、概率推断和约束满足等形式化求解器,对候选策略进行可行性检验。系统还利用外部信号和预测评分规则校准未来路径概率,在 TMGBench、自建事件预测集及 PolyBench 上展示了较强的博弈求解与事件预测能力。
- 为经济、政策、企业竞争和地缘分析等开放系统提供可持续更新的结构化决策推演框架。
- 展示了将大模型语义理解、多智能体模拟、因果世界模型、博弈求解和概率校准组合为完整系统的工程路径。
- 提示决策型 AI 的评估应超越答案准确率,进一步考察状态一致性、约束可验证性、概率可靠性和动态更新能力。
- 说明基础模型正从独立产品转变为复杂决策系统中的组成模块,模型竞争单位可能进一步转向端到端系统。
📝 原始笔记(逐字保留)
WikiSkill:将智能体经验编译为持久知识以持续演化技能
谷歌团队提出 WikiSkill,通过原始轨迹、持久 Wiki 与技能库三层架构及执行—提炼—提案—验证四步循环,让智能体从历史经验中持续沉淀并优化可复用技能。
WikiSkill 将智能体工作空间划分为原始层、Wiki 层和技能层,分别保存不可修改的执行轨迹、结构化成败模式与演化日志,以及经过验证的技能文件。系统循环执行任务、提炼知识、提出技能修改,并通过验证集门控决定接受或回滚,同时保留成功与失败提案所产生的知识。实验覆盖数学推理、网络搜索、电子表格、长文档问答和具身任务,结果显示其相较其他技能优化方法具有更高且更稳定的准确率。研究还发现,优质技能能够缩小模型规模差距并跨模型迁移,但通用流程比针对单一模型缺陷设计的 workaround 更具迁移价值。当前局限包括技能检索缺失、门控策略过于保守、Wiki 持续膨胀以及尚未覆盖超长程任务。
- 为持续运行的智能体建立可审计、可复用且不断积累的经验知识库,避免经验散落在轨迹和优化历史中。
- 将知识整理与技能修改解耦,可降低重复试错,并利用失败提案指导后续技能演化。
- 可探索由强模型负责知识发现和技能生成、较小模型负责执行的分工,以降低部署成本。
- 实际落地时需补充技能检索、知识压缩与清理机制,并改进仅按即时验证增益进行门控的策略。
📝 原始笔记(逐字保留)
DroneCATS:评估多模态 LLM 的通用无人机控制能力
DroneCATS 基准通过接近、跟踪、搜索和多机指挥任务,评估多模态 LLM 在无需微调或函数调用模式下直接充当无人机视觉-语言-动作智能体的能力。
论文提出 DroneCATS-Agent 架构,将可替换的多模态 LLM 直接置于无人机控制回路,并仅通过提示声明完整动作空间。DroneCATS 基准覆盖接近可见目标、跟踪移动目标、搜索初始视野外目标以及指挥多无人机编队四项核心能力,同时评测前沿模型与最低 2B 参数的开放模型。实验发现,小型开放模型有时比前沿模型更可靠地进入成功半径,但常因过早宣布到达或未输出终止动作而导致任务失败。在多机控制中,小模型还会忽略不同无人机的独立视角,将同一坐标机械复制给多个个体,说明当前瓶颈主要是持续遵守动作协议和正确终止,而非基础空间导航能力。
- 为多模态模型作为通用无人机控制智能体提供统一的具身评测框架。
- 揭示导航成功率不足以衡量任务完成度,终止判断与动作协议遵循应成为关键评估指标。
- 支持研究适合机载算力的轻量模型,重点优化持续规划、多视角区分和可靠终止能力。
- 为多无人机协同控制中的坐标复制、视角混淆和协议失效等典型故障提供诊断依据。
📝 原始笔记(逐字保留)
Safin-1:以记忆原生状态演化实现内生安全
Safin-1 通过 MARCH 记忆路由架构维护并演化持久能力状态,使模型无需反复修改主干参数即可在测试时适配安全任务。
智能体记忆 状态持久化 人工智能安全治理 长上下文 安全对齐
Safin-1 提出“由内而外的安全”,主张将安全能力内化为模型原生计算状态,而非仅依赖外部防护或事后对齐。其 MARCH 架构维护结构化记忆状态,并通过内容条件路由选择性检索历史信息。模型可在不反复修改主干网络的情况下,于测试时更新持久能力状态,并借助 Safety State 对下游安全任务进行受控适配。实验覆盖通用能力、长上下文理解、检索与效率,表明记忆可从被动上下文记录转变为持续维护和演化模型行为的主动载体。
- 为将安全能力设计成模型内部可维护状态提供新的架构路径。
- 可用于需要长期交互、持续记忆和动态安全适配的智能体系统。
- 启示研究者将上下文记忆与持久能力适配统一起来,减少频繁微调主干模型的成本与风险。
- 当前仍属初步架构探索,需要进一步验证状态更新的稳定性、可控性及抗攻击能力。
📝 原始笔记(逐字保留)
面向网页智能体的判别式世界模型
研究提出预测状态匹配目标,使世界模型能够区分不同候选动作产生的网页状态,从而提升网页智能体的动作排序与端到端任务成功率。
论文指出,传统网页世界模型采用监督式下一状态预测生成 HTML 或 AXTree 表征,但该目标与下游动作排序器对状态判别性的需求并不一致。作者提出“预测状态匹配”训练目标,要求模型从替代动作产生的状态中识别真实后继状态。训练数据来自 WebArena Go-Browse 轨迹构建的分支式网页智能体数据集,每个决策点均包含多个候选动作及其结果状态。实验表明,该方法在状态匹配基准和 WebPRMBench 动作排序上优于监督式下一状态预测,并在 WebArena-Lite 上提升了端到端任务成功率。
- 将世界模型的训练目标从单纯复现下一状态转向区分候选动作后果,可改善训练目标与测试时动作选择之间的对齐。
- 分支轨迹同时记录多个动作及其结果,为训练具备反事实判别能力的网页智能体提供了有效数据形式。
- 判别式世界模型可作为 PRM 的状态预测组件,提高测试时候选动作排序质量与网页任务执行成功率。
📝 原始笔记(逐字保留)
用户反馈提供 LLM 无法自行识别的独特改进信号
研究表明用户反馈能显著帮助 LLM 修复特定问题,但现有 LLM 评判器经常无法识别这些真实改进,从而系统性低估反馈价值。
研究通过具有明确真值的合成数据隔离用户反馈的实际作用,并使用自然交互数据验证结论在真实场景中的有效性。与无法访问反馈的基线相比,利用反馈生成的修订能以显著更高的比例解决用户指出的目标问题。论文发现,用户反馈此前被认为噪声较大、作用有限,主要源于当前评估范式的系统性偏差。当回答仅因用户反馈而得到正确修复时,LLM 评判器往往无法辨认改进后的答案,反而偏好质量更差的基线输出。
- 说明真实用户交互反馈可作为模型持续改进和后训练的高价值监督信号。
- 提醒研究者不要仅依赖 LLM-as-a-Judge 衡量反馈驱动的局部修复效果。
- 建议在反馈学习评测中引入明确真值、目标问题级指标或人工审查,以降低评判模型偏差。
- 为构建人在回路的模型改进闭环提供依据:反馈本身可能有效,关键瓶颈在于评估系统能否识别改进。
📝 原始笔记(逐字保留)
语言不可读性对 LLM 安全的影响
论文指出语言输出与语言化探针未必忠实反映模型内部计算,因此仅依赖思维链监控或自我批评无法提供完备安全保证,需以污点追踪和强隔离机制构建安全底线。
人工智能可靠性 思维链安全 人工智能可解释性 安全沙箱 可信执行
作者提出“语言不可读性”,指模型输出或机制探针提取的语言表征无法真实反映其内部计算过程。由于 LLM 的核心计算发生在激活空间,自然语言只是有损转换后的外部表达,思维链监控、宪法式自我批评和语言特征探测等机制都可能失效。论文主张安全沙箱不能依赖模型对自身状态的语言化报告,而应采用污点追踪,预先限制模型生成数据可影响的系统状态。稳健虚拟化与第三方沙箱配置审计等措施可进一步形成独立于语言监控的安全底线。
- 提醒安全研究者不要把思维链或语言化激活特征等同于模型真实内部推理。
- 为智能体沙箱设计提供原则:安全保证应建立在信息流控制、权限隔离和可信执行之上,而非模型自述。
- 可将污点追踪、稳健虚拟化及第三方配置审计组合为纵深防御体系。
- 启示评测工作增加“语言报告与实际行为不一致”的攻击场景,检验监控机制的失效边界。
📝 原始笔记(逐字保留)
后训练语言模型实现信息学竞赛金牌级表现
研究通过题目策展、合成推理轨迹、SFT、强化学习及反馈驱动的 GenCorrect 策略,使 Nemotron-3-CC 系列在 IOI 竞赛中达到并超过顶尖人类选手水平。
研究提出面向竞技编程的端到端专门化流水线,结合 2.2 万道精选题目、合成推理轨迹、监督微调(SFT)与强化学习(RL)。Nemotron-3-Nano-CC 经后训练后在 IOI 2025 上由 130 分提升至 291 分,再借助 GenCorrect 达到 468 分,超过金牌线 438.3 分。GenCorrect 在测试时迭代生成、评估并修正多样化解法,以反馈扩大推理计算并提高解题可靠性。竞赛专用 Ultra-CC 系统在与人类选手相同的时间、联网和提交限制下,于 IOI 2026 获得 535.4/600 分,超过金牌线及最高人类得分 498.27。
- 展示大规模题目策展、合成推理数据、SFT 与 RL 相结合,可显著提升语言模型的竞技编程能力。
- 说明反馈驱动的测试时生成与修正能够在不继续更新模型权重的情况下进一步突破性能上限。
- 为代码模型在复杂算法设计、候选解验证和受限提交场景中的系统化训练与部署提供参考。
- 提示评估高水平编程智能时,应采用与人类一致的时间、工具访问和提交次数约束。
📝 原始笔记(逐字保留)
Cliff:从首次错误学习过程奖励
Cliff 利用通用教师模型定位推理轨迹中的首次错误,将正确前缀与错误后缀转化为细粒度 token 级优势信号,以改善 RLVR 的推理训练。
Cliff 针对可验证奖励强化学习(RLVR)仅依赖粗粒度结果奖励、难以监督中间推理过程的问题提出奖励塑形方法。该方法使用现成 LLM 教师识别每条 rollout 的首次错误,并据此将轨迹划分为正确前缀和错误后缀。训练时,Cliff 为正确前缀分配正向 token 级优势,并对首次错误之后的内容施加负向反馈,无需专用过程奖励模型,也不要求师生采用相同推理模式。在 12 种实验场景中,Cliff 的推理性能相比在策略蒸馏提升 15%,相比标准 GRPO 提升 7%,使用能力有限的教师模型时仍保持有效。
- 为 RLVR 提供比最终答案奖励更细粒度的过程监督,同时降低训练专用过程奖励模型的成本。
- 将监督重点放在首次错误边界,避免继续评估建立在无效前缀上的后续推理,提升反馈的信息效率。
- 可作为 GRPO 等强化学习算法的通用奖励塑形模块,用于数学、代码及其他可验证推理任务。
- 表明中等能力教师也能有效标注错误边界,为低成本教师监督和过程奖励构造提供思路。
📝 原始笔记(逐字保留)
EarlyEval:通过早期结果预测降低智能体评测成本
EarlyEval通过分析智能体的中间行为并提前预测任务成败,在基本保持评测准确性与通过率统计稳定的同时显著减少执行步数及Token消耗。
EarlyEval提出“早期结果预测”,从单个任务的执行过程入手降低LLM智能体评测成本,与减少任务数量的基准蒸馏方法形成互补。该框架基于行为、文本及参考解法特征,分别训练轻量级LightGBM成功与失败分类器,并在任一分类器超过校准置信度阈值时终止执行。在SWE-bench Verified、TerminalBench和Toolathlon上,该方法可减少13%至26%的智能体执行步骤、最多44.1%的输入Token和29.4%的输出Token。其结果预测准确率达到89%至97%,各智能体任务解决率平均仅偏移1至2个百分点,且逐步预测开销可忽略不计。
- 为高成本智能体基准测试提供任务内提前终止机制,减少重复开发周期中的评测开销。
- 表明中间执行轨迹包含可用于判断最终成败的早期信号,可进一步用于运行时监控和故障预警。
- 可与基准蒸馏、任务采样等任务级成本优化方法组合,形成任务间与任务内的双重评测加速。
- 实际部署时需校准置信度阈值,并持续监测提前终止对不同智能体解决率和评估排序的影响。
📝 原始笔记(逐字保留)
增量池化 LLM 评测:低成本选择检索模型
通过增量扩展候选系统的检索文档池并复用 LLM 相关性判断,该方法在保持可靠排序的同时将生产级检索模型评测成本最多降低 4.9 倍。
论文提出池化 LLM 评测方法,让 LLM 对所有候选检索系统返回文档的并集进行相关性判断,并据此在统一标准下比较系统。引入新系统时,仅评判其新增且尚未进入文档池的结果,已有判断可持续复用。作者在四个检索基准、11 个稠密或稀疏及混合检索系统上验证该方法;考虑 qrels 的 bootstrap 不确定性后,97% 的系统两两排序得以保留。在金融新闻问答系统的 62 种检索配置中,文档重叠带来 65%~80% 的判断复用率,使评测成本最多降低 4.9 倍。
- 为生产级 RAG 系统提供可增量维护的检索模型选型流程,避免每次加入候选系统都重新标注全部文档。
- 利用候选系统之间的结果重叠复用相关性判断,可显著降低 LLM 评判费用和重复评测成本。
- 池化机制让不同批次加入的检索系统基于共同判断集合进行比较,有助于提高排名的一致性与可比性。
- 实际部署时应结合 bootstrap 等不确定性分析,避免将细微的评测分数差异误判为稳定的系统优劣。
📝 原始笔记(逐字保留)
SafeEvolve:基于智能体经验的脚手架—策略协同演化安全对齐
SafeEvolve利用在策略执行轨迹中的安全经验,持续协同演化运行时脚手架与模型策略,以兼顾智能体安全性和任务效用。
SafeEvolve针对智能体最终响应和多步执行轨迹中的双重安全风险,提出经验驱动的脚手架—策略协同演化框架。脚手架侧将轨迹级安全证据转化为安全提示和分层技能的有界组件更新,使演化产物可审计、可逆。策略侧采用两阶段 SFT-RL:先通过脚手架使用微调引导模型主动利用演化产物,再以验证器分解奖励强化多步探索中的自主安全行为。实验显示,该方法取得更优的安全—效用权衡;在 Qwen3.5-4B 上将 AgentDojo 的攻击成功率降低至原来的三分之一,同时把良性任务效用从 59.79% 提升至 61.86%。
- 展示如何将智能体执行轨迹中的安全证据转化为可持续复用的运行时控制组件和内生策略能力。
- 为脚手架更新与策略训练割裂的问题提供协同演化方案,并通过有界、可逆更新增强安全治理能力。
- 验证 SFT、强化学习与验证器分解奖励相结合,可在降低攻击成功率的同时维持甚至提升正常任务效用。
📝 原始笔记(逐字保留)
从重加权到响应重写:释放影响样本的训练干预效应
研究提出影响函数引导的响应重写方法,证明改写高影响力训练样本的回答比传统重加权能产生更强、更持久且双向可控的模型行为变化。
研究指出,训练数据归因的干预价值不仅取决于选中哪些样本,也取决于如何修改这些样本。作者利用影响函数定位高影响力样本,在保持指令不变的情况下,将回答替换为符合或违背目标行为的监督信号。基于四个开放权重大模型的实验显示,响应重写在认知性拒答任务上产生了更强、更持久且可双向控制的行为偏移,而相同样本的重加权效果较弱且不稳定。进一步分析表明,影响函数选出的样本比其他选择方法具有更高的重写杠杆,变化主要集中于目标相关行为,并可推广至安全拒答场景。
- 说明影响函数的局部重加权估计不能直接等同于样本在实际数据修改中的干预潜力。
- 为训练数据归因方法提供“样本选择与修改策略联合评估”的新范式。
- 可通过定向重写少量高影响力样本,高效调节模型的拒答、置信表达与安全行为。
- 提醒模型开发者评估数据归因工具时,应关注真实行为干预效果、持续性和目标外影响,而非仅考察归因分数。
📝 原始笔记(逐字保留)
表格基础模型懂物理吗?数据污染、单位与确定性极限
研究以316个物理方程生成的数据评测四种表格基础模型,发现其虽具备出色的物理规律插值能力,但尚不能表示无噪声机制与物理单位。
研究直接探查表格基础模型的贝叶斯先验,在来自316个物理方程的域内与域外数据集上评测 TabPFN-3、TabICLv2、TabDPT 和 Real-TabPFN-2.5。四种模型与六个基线相比,无论直接使用还是调优后均表现占优,显示其能够有效插值物理规律。论文同时考察了潜在的数据污染问题,以区分模型先验中的物理知识与训练数据记忆。结果表明,这些模型的先验无法准确表示无噪声的确定性机制,也不能理解和处理物理单位,因此尚不足以充当真正的物理模型。
- 为评估基础模型是否真正掌握科学规律提供了基于域外方程、数据污染和确定性极限的分析框架。
- 提醒研究者不能仅凭低预测误差断言模型理解物理,还需检验单位一致性、无噪声极限与机制外推能力。
- 表明未来表格基础模型可通过显式单位表征、量纲约束和确定性机制先验增强其科学建模能力。
📝 原始笔记(逐字保留)
双层协调反思:多智能体 LLM 系统的博弈论方法
论文以双层协调博弈统一刻画多智能体任务分解、反思式记忆更新与外部验证,并提出具有收敛保证的随机反思记忆上升方法 SRMA。
论文将编排器与工作智能体的交互建模为双层协调博弈,证明有界耦合下局部更新构成近似势博弈,其均衡误差由任务分解质量控制。作者把文本反思描述为语义记忆状态上的随机移动,并给出自由形式反思的有限时间上界、最坏情形紧致性及持续伤害条件下的正下界。理论结果表明,仅观察生成轨迹的门控器无法在文本不可区分的环境中实现一致改进,而基于环境真实反馈的门控器可以突破这一限制。为此,论文提出随机反思记忆上升 SRMA,仅在环境评估风险严格下降时接受候选记忆,并证明其在相应条件下具有几何或多项式收敛保证。在 500 个 SWE-bench 实例上,完整的 Kimi 系统解决率达到 72.2%,高于公开 mini-SWE-agent 参考系统的 70.8%。
- 为多智能体 LLM 系统的任务分解、局部协作与反思改进提供统一的博弈论分析框架。
- 说明仅依赖智能体自身文本轨迹进行反思门控存在信息论局限,系统应引入环境真实反馈或可执行验证。
- SRMA 可用于设计更可靠的长期记忆更新机制,避免错误反思被持续写入并导致性能漂移。
- 收敛率与重锚定分析可指导非平稳环境中的评估频率、置信门控和记忆刷新策略。
📝 原始笔记(逐字保留)
Repo-To-Skill:将 GitHub 仓库蒸馏为 AI4AI 技能
DisCo 将机器学习仓库中的操作性知识蒸馏为紧凑、可验证的技能,使科研智能体在固定模型与执行预算下显著提升多项端到端研究基准表现。
科研智能体 智能体技能库 技能生成 经验复用 自动化科学研究
DisCo 是一个能够创建并调用技能的科研智能体,旨在补足模型与智能体脚手架之外的领域操作性知识。其蒸馏分为任务无关和任务导向两种形式:前者从常用开源仓库提炼通用技能,后者针对具体研究任务生成所需技能。研究构建了 AREX-Skill Library,从 1,000 个常用机器学习仓库中蒸馏出超过 5,000 个已验证技能,覆盖 20 个领域和 178 个能力族。在保持 GPT-5.5、研究脚手架及下游执行预算不变时,引入技能使智能体在 MLE-bench、PaperBench、FrontierCS 和 PassNet 上分别提升 134.3%、34.4%、9.2% 和 14.0%。
- 将大型代码仓库中面向人类的隐性操作经验转化为可按需加载、复用和验证的智能体技能。
- 表明科研智能体的能力提升不必完全依赖更强模型或更多推理预算,结构化操作知识同样能带来显著增益。
- 可用于建设跨任务科研技能库,减少智能体在每次实验中重复探索工具配置、实现细节和执行流程。
- 任务无关蒸馏与任务导向蒸馏相结合,为通用技能积累和即时能力补全提供了统一路径。