2026-08-17 科研追新

当日精选(由提交工具自动创建)。

ScienceDiscovery:可溯源的一站式 AI 科研工作台

ScienceDiscovery v0.1 通过多智能体协作、300 余项科研 Skills、结构化记忆图谱和多级审核机制,实现可复现、可溯源的全流程科研自动化,并在 BiomniBench-DA 上取得 77.4 分。

 自动化科学研究 科学智能 闭环科学研究 多智能体系统 事件溯源 工具调用 沙箱训练 科学幻觉 证据图谱

ScienceDiscovery 是基于 Agent OS(JiuwenSwarm)构建的一站式 AI 科研工作台,覆盖文献阅读、假设提出、代码编写、实验试错和参数调优等环节。平台以 MCP Connector 统一接入科研数据与工具,并在隔离沙箱中运行 Python、R 和 Shell,通过多智能体动态编排 300 余项跨领域 Skills。其结构化记忆图谱记录任务时序、代码、环境、日志和结论证据链,再结合多级 Reviewer 审核,提升科研结果的可追溯性与可复现性。基于 GLM-5.2,系统在生物医学智能体基准 BiomniBench-DA 上获得 77.4 分,并已用于脓毒症数据分析、纳米抗体设计及跨库文献调研。未来平台计划引入 RSI、自主迭代和多路径启发式搜索能力,扩展至药物、材料、流体仿真和数学证明等领域。

用途与启示
  • 为跨学科科研团队提供从资料检索、数据分析到报告生成的一体化自动执行环境,减少工具切换成本。
  • 以任务图谱、原始代码、运行环境和日志构建证据链,降低虚假引用、错误推导和实验过程不可复现的风险。
  • 展示 MCP 工具标准化、多智能体分工与领域 Skills 组合在自动科研系统中的工程实现路径。
  • BiomniBench-DA 的结果说明,过程审核与专业工具执行相结合,可能比单纯依赖大模型生成更适合高可信科研任务。
  • 可作为生物医药设计、科学数据分析、文献证据综合及跨学科工作流自动化的基础平台。
📝 原始笔记(逐字保留)
Auto Research|ScienceDiscovery发布:零科研幻觉的一站式AI工作台,BiomniBench-DA验证效果业界SOTA https://mp.weixin.qq.com/s/XSaX6oyok9qqZmwBUiQCFg

最大规模AI自主科研测试:Fable 5断层领先

Prime Intellect在nanoGPT优化任务上测试18个前沿模型,发现Fable 5显著领先,而模型差距主要来自噪声建模、实验设计与弱信号验证能力,尚未体现真正的方法创新。

 自动化科学研究 实验执行 科研品味 闭环评估 智能体 科学研究基准 噪声建模

Prime Intellect在隔离的8张H200沙箱中对18个前沿模型进行了153次自主科研运行,要求模型持续优化1.24亿参数的nanoGPT,以尽可能少的训练步数将验证损失降至指定阈值。Fable 5以2726步排名第一,闭合人类纪录差距的81.7%,Opus 5和Kimi K3分列第二、第三,且排名在不同资源预算下保持稳定。领先模型更善于测量噪声、保留弱信号、多种子验证、重新消融已有改进,并会自主构建配置编译器、数值实验室或多角色研究工具。实验显示模型已具备较强的研究执行和机制理解能力,但所有有效改进仍与既有文献相似,尚未产生本质上新颖的方法。

用途与启示
  • 可作为评估大模型长周期自主科研能力的公开基准,重点考察实验规划、执行、复盘和资源分配,而不只是最终指标。
  • 提示自主科研系统应显式建立噪声模型,并采用多种子筛选、分阶段确认和动态消融,避免因单次负面结果丢弃潜在方向。
  • 展示了持久化计算环境、受控实验工具和多角色智能体对科研效率的价值,也说明共享目录权限与只读契约等安全边界不可忽视。
  • 当前模型的主要优势仍是高质量搜索与实验执行,后续评测需引入更开放的任务,以区分工程优化能力与真正的科学创新能力。
📝 原始笔记(逐字保留)
EvolveLRM|全网最大规模AI自主科研测试出炉:Fable 5断层领先,Kimi进前三,DeepSeek提前建实验室https://mp.weixin.qq.com/s/WeVdpSg9o3DEHZl_SIFVsQ

循环模型为何越想越错:递归深度与训练稳定性

循环语言模型可通过复用网络层增加测试时计算,但深度外推易引发误差累积、残差爆炸和性能退化,稳定机制与训练配方是关键瓶颈。

 递归模型 循环计算 潜空间推理 测试时计算 残差稳定性

循环模型在隐空间中反复更新状态,以参数共享的方式按任务难度增加计算量,避免必须生成冗长思维链。部分研究表明,增加测试时循环深度能改善 GSM8K、HumanEval 等任务,但收益会饱和,超过训练深度后甚至明显下降。Ouro-Thinking 1.4B 在 AIME 2024 上由第 4 轮的 65 分跌至第 8 轮的 38.67 分,说明额外循环可能放大错误。Parcae 将问题归因于残差爆炸和损失突升,并通过重新设计稳定机制使验证集困惑度最多降低 6.3%,表明循环架构仍需专门的归一化、优化与监督方案。

用途与启示
  • 为潜在推理模型设计按题目难度动态分配循环次数的停止策略,避免无效或有害计算。
  • 评估模型时应绘制性能随循环深度变化的曲线,而非默认测试时计算越多越好。
  • 训练中需持续监控残差范数、梯度振荡和损失尖峰,并针对参数共享结构设计稳定机制。
  • 循环深度的训练分布应覆盖预期推理深度,以提升模型对测试时深度外推的鲁棒性。
📝 原始笔记(逐字保留)
EvolveLRM|「有些模型就是不想学?」循环模型为什么越想越错?https://mp.weixin.qq.com/s/Ju-Wbqn9NK_MXy-kmN2zWw

Intern-S2-Mobius:知识与推理解耦的基础模型

Intern-S2-Mobius 通过共享知识记忆与迭代推理模块解耦,在减少训练数据需求的同时实现接近 4 倍的端到端推理加速。

 模型开发 推理 智能体记忆 循环计算 系统优化 知识解耦 推理加速

  • Mobius-v0 将存储知识向量的全局共享 Memory(FFN)与负责组合推理的多个 Reasoner(Self-Attention)分离。
  • Reasoner 以隐藏状态作为缓存和信息载体,迭代查询 Memory 中所需的知识向量,再将知识传回推理算子。
  • 从头训练的 7B 模型仅使用 Transformer 基线 62.6% 的训练数据,便取得相近的下游任务成绩。
  • 基于 Qwen3.5-35B 持续预训练的 Intern-S2-Mobius 在保持相近效果的同时,实现近 4 倍端到端推理加速。
用途与启示
  • 为知识存储与推理计算解耦提供新的基础模型架构,可提升参数利用率和知识压缩效率。
  • 表明共享知识模块与迭代推理机制有望降低大模型预训练数据及计算成本。
  • 可作为高吞吐推理、循环计算架构和模块化模型设计的研究参考。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.14290

MobileMem:从一年移动端经历中学习长期记忆

MobileMem 基于一年尺度的移动端经历构建基准与框架,用于评估个人智能体在异构、多模态且持续变化的用户体验中形成长期记忆并不断适应的能力。

 智能体记忆 持续学习 端侧部署 多模态 长程任务 体验智能 移动记忆

MobileMem 面向持久型个人智能体,研究如何在移动设备上积累和利用用户长期经历,而非仅记忆彼此孤立的事实。其知识驱动的合成流程从用户与应用的会话中构造连贯、时间一致的长程轨迹,并覆盖文本和多模态两种设置。基准考察多跳推理、时间推理、知识更新和隐式偏好推断等能力。该工作将长期记忆从信息检索推进到“体验智能”,使智能体能够记住过去、理解当下并适应未来。

用途与启示
  • 为端侧个人智能体的长期记忆系统提供更贴近真实移动场景的评测基准。
  • 可用于检验记忆写入、更新、检索与遗忘机制在一年尺度经历中的可靠性。
  • 为持续个性化、多模态用户建模和隐式偏好学习提供长程实验环境。
  • 启示智能体研究从静态事实记忆转向具有时间演化和个人情境的体验学习。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.13606

SimpleOPD:分词器无关的长上下文同策略蒸馏

SimpleOPD通过共享文本空间对齐、参考策略KL约束与终止令牌优势掩码,将长上下文教师的证明推理能力稳定蒸馏到短上下文学生模型。

 在策略蒸馏 模型蒸馏 长上下文 推理 自动定理证明 后训练 词元化对齐 长度控制

SimpleOPD研究从长上下文推理模型 SU-01 向短上下文学生模型迁移证明推理能力时的分词器不匹配、分布偏移、回答长度膨胀及训练不稳定问题。方法在共享文本空间执行同策略蒸馏,仅对师生分词器中占据相同文本区间的令牌进行对齐。为减少过长生成和频繁截断,作者加入学生初始策略参考 KL 损失,并屏蔽 </think><|im_end|> 等特殊终止令牌的优势值,使推理长度稳定增长。该方法在 Qwen3、Qwen3.5、Intern-S2、GLM-4.7 和 Gemma-4 等同族及跨族模型上均取得提升,其中 Intern-S2-Preview 在 ProofBench 上提升 21.2 分至 55.2,并在 HLE、HiPhO 等科学基准上展现跨领域泛化。

用途与启示
  • 为不同分词器架构的教师与学生模型提供无需统一词表的推理蒸馏方案。
  • 说明参考策略 KL 约束和终止令牌优势掩码可缓解蒸馏中的长度爆炸与训练不稳定。
  • 可用于将昂贵长上下文模型的证明和科学推理能力迁移到更高效的短上下文模型。
  • 结果表明,在数学证明数据上学习到的推理能力能够泛化至部分科学推理任务。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.14277

DFM Mimir v1:仅用许可数据训练的 1B HRM 模型

DFM Mimir v1 基于 HRM 架构,以161个许可数据集从头训练,在仅10亿参数下取得有竞争力的英语、数学与代码表现,并刷新丹麦语模型成绩。

 模型开发 小语言模型 推理 模型训练 数据工程 多语言建模 数据许可

DFM Mimir v1 是一个基于 Hierarchical Reasoning Model(HRM)架构的 10 亿参数语言模型,强调从头训练及训练数据的许可合规性。其训练混合涵盖 161 个数据集,并在英语、数学与代码、丹麦语等方向的 20 项基准上接受评测。模型性能超过原始 HRM-Text 1B,并可与 Qwen 3.5 4B、Gemma 4 E2B 等更大模型竞争,同时在丹麦语任务上达到新的领先水平。模型权重已发布至 Hugging Face Hub:https://huggingface.co/danish-foundation-models/DFM-Mimir。

用途与启示
  • 说明通过HRM架构与高质量许可数据,小参数模型也能获得接近更大前沿模型的综合能力。
  • 为重视开源合规、数据可追溯和可复现实验的模型研发提供训练范例。
  • 展示面向丹麦语等非英语语言构建高性能基础模型的可行路径。
  • 可用于研究参数效率、层次化推理架构以及训练数据质量与模型能力之间的关系。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.13517

Gowers:AI数学突破更擅长搜索反例与特殊构造

菲尔兹奖得主 Timothy Gowers 指出,当前AI在重大数学问题上的突出优势,是低成本、大规模搜索反例或特殊对象,而非提出全新的普适证明方法。

 科学发现 自动定理证明 并行搜索 开放式推理 自动化科学研究 反例生成 数学直觉 猜想检验

菲尔兹奖得主 Timothy Gowers 观察到,近期AI在雅可比猜想、Erdős单位距离问题、非sofic群及多色Ramsey数等方向的成果,多依赖寻找反例或构造特殊对象。大模型的优势在于知识覆盖广、跨领域组合工具的成本低,并能用较低费用反复尝试大量候选路线。此类能力适合被表述为“是否存在某个对象”的搜索型数学任务,但AI目前仍不擅长及早判断研究路线是否值得继续。Gowers认为,AI若能提出前所未有、事后看来又自然且可被数学界持续复用的新方法,才算真正进入顶级数学创造阶段。

用途与启示
  • 可优先将开放猜想转化为反例搜索、特殊对象构造或有限条件检验任务,发挥模型的大规模探索优势。
  • 可结合符号计算、随机搜索和形式验证,对AI生成的候选反例进行逐项核验,形成可信闭环。
  • 研究代理应强化路线剪枝、失败诊断和价值判断能力,以弥补当前数学“嗅觉”不足。
  • 评估AI数学创造力时,不应只看是否解题,还应考察方法的新颖性、自然性与后续可复用性。
📝 原始笔记(逐字保留)
标题:菲尔兹奖得主:AI现在主要靠「抬杠」突破重大数学猜想 来源:量子位(微信公众号) 链接:https://www.qbitai.com/2026/08/474381.html 摘要:AI最近最出圈的数学突破,都在“找反例”

跨会话边界的上下文学习状态交接

论文将跨会话任务延续形式化为任务相关的上下文学习状态转移,并从预测等价性出发刻画充分交接信息及其内存需求。

 上下文学习 智能体记忆 长上下文 状态表征 会话交接 状态移交

论文研究上下文耗尽、应用重启或更换智能体时,应该将哪些历史信息传递给新会话。作者区分了对原始材料的精确恢复与对目标预测分布的保持,并证明在外生性条件下,预测等价性可刻画最粗粒度的确定性充分交接状态。论文提出三部分交接记录:精确保留决策与约束、用任务相关统计量压缩重复证据,并保存统计量无法覆盖其影响的原始观测。在线性高斯回归中,该方法可得到精确有限维交接与有限比特扰动界;在非参数回归中,则建立了内存规模与平方预测误差之间的上下界。

用途与启示
  • 为长程任务跨会话延续提供信息筛选原则,避免简单复制全部历史上下文。
  • 可指导智能体在上下文窗口耗尽、进程重启或任务转交时设计结构化记忆与交接协议。
  • 通过预测等价性评估摘要是否充分,并量化有限内存压缩对后续任务性能的影响。
  • 启发将决策约束、充分统计量和关键原始证据分层存储,以平衡准确性与存储成本。
📝 原始笔记(逐字保留)
标题:Handover of In-Context Learning State Across Session Boundaries 来源:arXiv 链接:https://arxiv.org/abs/2608.14528 摘要:This study investigates the methodological and theoretical properties of session handover in applications that use large language models. A task may continue in a new session when the context reaches the model's input limit, when the application restarts, or when another agent is asked to finish the task. The application must then decide which information from the earlier session to pass on. We formulate handover as the transfer of a task-relative in-context learning (ICL) state and distinguish exact recovery of earlier material from preservation of the target distribution. Under an exogeneity condition, predictive equivalence characterizes the coarsest deterministic sufficient handover and gives a fixed-length bit requirement. The analysis isolates the effects of the memory constraint, th

Rollplex:VLM 后训练的跨阶段 GPU 空间共享

Rollplex 通过将前缀计算移入 rollout 解码窗口,并采用阶段感知显存管理与并行感知权重共享,显著提升视觉语言模型同步在线强化学习后训练的 GPU 利用率。

 后训练 强化学习 多模态 系统优化 资源调度 显存共享 阶段并行

Rollplex 针对 VLM 在线强化学习中 rollout、参考模型评分和 actor 训练严格串行造成的 GPU 算力浪费,将与响应生成无关的视频及提示前缀计算迁移至 rollout 解码窗口并发执行。系统通过阶段感知的显存管理,按照张量的生产者—消费者生命周期控制 HBM 驻留。其并行感知权重共享机制允许不同张量并行度复用布局兼容张量的物理存储,仅重建不兼容部分,避免保存完整的第二份 actor 权重。在 32 张 H800 GPU 上,Rollplex 相比串行共置方案加速 1.23~1.30 倍,相比模型分离部署加速 1.57~2.24 倍,同时保持同步在线强化学习语义。

用途与启示
  • 为视频密集型 VLM 后训练提供跨阶段重叠执行方案,减少 rollout 解码期间的 GPU 空闲算力。
  • 展示如何结合张量生命周期与 HBM 驻留策略,缓解大模型多阶段共置带来的显存压力。
  • 为不同张量并行度和权重布局之间的低冗余共享提供系统设计参考。
  • 在不改变同步在线策略更新语义的前提下提升训练吞吐,适合具身智能与视觉智能体训练基础设施。
📝 原始笔记(逐字保留)
标题:Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training 来源:arXiv 链接:https://arxiv.org/abs/2608.14498 摘要:Vision-language models (VLMs) enable embodied agents to reason and act from visual observations and language instructions. Reinforcement learning (RL) post-training enhances these capabilities using task feedback, but current on-policy RL runtimes execute rollout, reference scoring, and actor training in strict serial phases. While effective for text-only RL, this phase-granular execution is wasteful for VLMs, where processing dense video inputs and prompt prefixes occupies a large fraction of each phase. Because prefix processing is independent of the generated response, it can be run alongside rollout decoding, which leaves GPU compute capacity underutilized, without breaking synchronous on-policy semantics. We present Rollplex, a runtime that decomposes the reference and training phase

用表格扩散 Transformer 生成基准健康数据

研究提出两阶段跨表格数据生成框架,以统一模型学习多种异构健康表格,并生成兼顾真实性与多样性的合成数据集。

 数据合成 医疗人工智能 多模态 表格生成 扩散模型

该研究面向 Cross-Tabular Data Generation,解决现有方法通常只能从单一表格学习、难以处理特征集合各异的多张异构表格的问题。第一阶段将每张原始表格转换为列结构统一的统计表,编码各字段的边缘分布及字段间的成对相关性。第二阶段训练扩散 Transformer 学习这些统计表的共同结构,并生成新的合成统计表。系统再通过多元高斯采样和逆概率积分变换重建原始格式的数据,实验显示其具有较高保真度及良好的保真度—多样性权衡。

用途与启示
  • 为缺少统一字段定义的多来源健康数据提供可扩展的合成方案。
  • 可生成不限数量的异构基准表格,用于医疗模型训练、评测与数据共享。
  • 以标准化统计表示解耦原始表格结构,为跨机构数据建模提供通用中间层。
  • 在实际应用中仍需进一步验证隐私保护、非高斯依赖关系还原及下游任务有效性。
📝 原始笔记(逐字保留)
标题:Generating Benchmark Health Data Using a Tabular Diffusion Transformer 来源:arXiv 链接:https://arxiv.org/abs/2608.14496 摘要:Cross-Tabular Data Generation (CTDG) seeks to learn a generative model from multiple heterogeneous tables and produce new synthetic tabular datasets. However, existing synthetic tabular data generation methods are largely restricted to single-input-table scenarios and struggle to effectively handle multiple heterogeneous tables with diverse feature sets. To address this limitation, we propose a two-stage framework for cross-tabular data generation. In the first stage, each heterogeneous raw table is transformed into a standardized statistical table with the same set of columns across all tables. Each statistical table captures the marginal distributions of the original columns and the pairwise correlations among them. In the second stage, a diffusion transformer model is trained to capture

智能爆炸的动力学机制

Toby Ord 从数学上分析 AI 辅助 AI 研发的反馈循环,指出有限时间奇异增长比既有经济学模型所暗示的更难出现,而反馈循环的代际时间是决定智能爆炸形态的关键参数。

 递归自我改进 模型开发 计算规模扩展 智能爆炸

论文研究 AI 参与自身研发后形成的正反馈循环,以及该循环能否引发能力快速升级的“智能爆炸”。作者指出,趋向垂直渐近线的有限时间奇异增长,其实现条件比近期经济学启发模型所预测的更苛刻。研究还强调了一类被忽视的增长形态:速度快于指数增长,但不会在有限时间内发散。反馈循环的代际时间,即完成一轮 AI 研发改进所需的时间,是决定动力学行为的核心参数;只有当它迅速趋近于零时,奇异增长才可能发生。

用途与启示
  • 为递归自我改进与 AI 研发自动化提供更精确的增长动力学框架。
  • 提醒研究者区分超指数增长与有限时间奇异增长,避免将快速进步直接等同于能力发散。
  • 可将反馈循环的代际时间纳入智能爆炸预测、风险评估和能力扩展模型。
  • 启发对研发周期压缩、自动化程度与能力增长率之间关系的实证测量。
📝 原始笔记(逐字保留)
标题:The Dynamics of Intelligence Explosions 来源:arXiv 链接:https://arxiv.org/abs/2608.14426 摘要:AI is increasingly being used to help with AI R&D. Under certain conditions this feedback loop might be able to produce an intelligence explosion, with rapidly escalating AI capabilities. I explore the mathematics of the most explosive possibilities, with an eye to understanding what drives the dynamics. I show that singular growth (towards a vertical asymptote) is harder to achieve than would be expected from recent economics-inspired modelling, and that there is an important but neglected class of growth rates that are faster than exponential but don't lead to a vertical asymptote. I draw out the generation time (the time to go around the feedback loop) as a neglected parameter that plays a pivotal role in determining the behaviour of any intelligence explosion --- one cannot have singul

知道何时停止:LLM 评测的贝叶斯最优停止

optstop 通过层次贝叶斯推断按不确定性自适应分配评测样本,在保持总体结论一致的同时显著减少无效重复计算。

 停止策略 贝叶斯方法 模型评估 成本优化 资源调度 序贯评估 精度停止准则

论文将 LLM 评测建模为序贯测量问题:对不确定性较高的项目继续采样,对估计已足够精确或稳定的项目停止采样。optstop 基于层次贝叶斯推断,支持二元、序数和连续结果,且无需预先校准的题库。该方法可用于实时评测或历史数据回溯,并在模型表现接近零、罕见成功尤为重要时采取更谨慎的停止机制。在包含 200 个项目和 10 个 epoch 的示例中,它在九种验证设置下减少了 57%–97% 的计划试验,同时得到与完整评测基本一致的总体结论。

用途与启示
  • 将固定重复次数改为按后验不确定性分配算力,可显著降低 LLM 基准评测成本。
  • 适合高成本、多轮或大规模模型比较,并可减少已稳定样本上的冗余调用。
  • 对接近零成功率的任务需保留更保守的采样规则,避免因罕见成功未被观测而过早停止。
  • 可作为评测流水线中的动态预算控制模块,为不同结果类型提供统一的停止标准。
📝 原始笔记(逐字保留)
标题:Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations 来源:arXiv 链接:https://arxiv.org/abs/2608.14425 摘要:LLM evaluations often use fixed sampling budgets, testing every item the same number of times even after estimates are precise. We introduce optstop, a precision-based adaptive stopping framework that treats evaluation as a sequential measurement problem: keep sampling where uncertainty remains high, and stop where estimates are precise or stable enough. The framework builds on hierarchical Bayesian inference, supports binary, ordinal, and continuous outcomes, and keeps every benchmark item eligible for sampling, without requiring a calibrated item bank. It runs live or retrospectively, and includes a safeguard that samples more cautiously as measured performance approaches zero, where rare successes matter most. In an illustrative 200-item, 10-epoch evaluation, it removes 57%-97% of plann

正确概率更高,答案反而更差:Power Sampling 的失效与修复

研究揭示 Power Sampling 可能在增加正确轨迹概率质量的同时降低推理准确率,并提出形变可控、保持路径支持度的修复方法。

 推理 测试时计算 人工智能可靠性 幂律采样 分布锐化 支持保持

Power Sampling 通过对完整生成轨迹的分布进行锐化,在无需验证器的情况下增强测试时推理,但其与自一致性结合时可能导致准确率下降最多 18.5 个百分点。作者将这一悖论归因于两类错配:固定指数在不同问题上造成差异巨大的分布变化,即“剂量错配”;全局锐化又会将概率集中于少数主导路径,破坏下游聚合、搜索和选择所需的广泛路径覆盖,即“覆盖错配”。因此,高 pass@k 并不必然意味着推理路径的有效多样性得到保留。论文提出形变可控且保持支持度的 Power target,用于跨问题校准锐化强度并限制中等概率路径受到的压制;在相同预算下结合加权自一致性,可逆转原方法的性能损失并优于标准多样本推理。

用途与启示
  • 提醒测试时分布锐化不能只关注正确轨迹的总概率质量,还需评估其对推理路径覆盖面的影响。
  • 为自一致性、搜索和候选选择等多样本推理方法提供更稳健的前置采样机制。
  • 建议按问题自适应校准锐化强度,避免固定指数造成不可控的分布变化。
  • 说明 pass@k 可能掩盖路径支持度收缩,评测采样器时应同时衡量覆盖性与下游聚合准确率。
📝 原始笔记(逐字保留)
标题:More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It 来源:arXiv 链接:https://arxiv.org/abs/2608.14420 摘要:Power Sampling sharpens a language model's distribution over complete generation trajectories, offering a verifier-free way to improve reasoning at inference time. It also has the potential to serve as a general-purpose front end for a broad range of downstream sampling methods. However, we uncover a striking paradox: Power Sampling can drive more probability mass toward correct trajectories while degrading the downstream inference it is intended to enhance. Using self-consistency as a representative case, we observe accuracy drops of up to 18.5 percentage points across models and reasoning benchmarks. We trace this paradox to two mismatches. Dose mismatch arises because a fixed exponent induces drastically different amounts of distributional change across problems. Coverage mismatch arise

LLM 不为“跃迁”付出代价:机器溯因缺少物理成本

论文以普朗克提出量子假设为例,主张机器溯因的关键障碍并非缺少具身模拟,而是固定权重 Transformer 无法让认知错误产生足以迫使系统修正理论的物理代价。

 推理 具身智能 科学发现 人工智能可解释性 溯因推理 认知成本

论文反驳“缺少具身模拟导致 LLM 无法完成科学发现式跃迁”的单一解释,指出某些溯因突破并不依赖感觉运动基础。作者以普朗克通过 $E=h\nu$ 解决黑体辐射问题为例,认为这一假设既不能由归纳直接获得,也不能由既有理论演绎得出。论文提出,真正关键的是将认知错误与物理成本耦合,使不可接受的预测能够迫使系统修正自身理论。作者通过热力学耦合形式化这一区别,并认为固定权重 Transformer 的推理过程无论规模多大都缺少此类机制;任务因果难度上升时准确率显著下降而输出熵近乎不变的实验现象也与该观点一致。

用途与启示
  • 为研究 LLM 的科学溯因与理论创新能力提供超越“是否具身”的新分析框架。
  • 启发构建能够让预测错误影响内部状态、资源消耗或后续策略的闭环学习系统。
  • 提醒评测者不要只考察答案准确率,还应测量模型是否会随因果难度和错误代价调整不确定性与推理行为。
  • 可用于探索持续学习、主动实验和世界模型中“错误—成本—理论修正”的机制设计。
📝 原始笔记(逐字保留)
标题:LLMs Don't Pay for the Jump 来源:arXiv 链接:https://arxiv.org/abs/2608.14397 摘要:Zahavy [2026] argues that Large Language Models, despite their capabilities in induction and deduction, cannot perform the abductive "Jump" that produced Einstein's equivalence principle, and attributes this limitation to the absence of embodied simulation. Zheng-Xin [2026] and Farmer [2026] question whether embodiment is necessary for abduction, pointing to alternative routes to General Relativity and forms of abduction that require no sensorimotor grounding. Max Planck resolved the blackbody radiation problem in 1900. Planck's move to E = hν required no embodied simulation. It was motivated by a mathematical consequence of classical theory, an infinite predicted energy for a finite measured quantity, that could not be physically accepted. We show that neither induction nor deduction coul

AgentRewind:长程 LLM 智能体的可恢复执行

AgentRewind 通过同步保存智能体上下文与环境状态的检查点,使长程任务能够在出错后回滚并携带既往尝试信息继续执行。

 智能体 长程任务 智能体运行时 轨迹控制 人工智能可靠性 状态回滚 执行恢复 模型检查点

AgentRewind 面向长程执行中早期错误沿智能体上下文和环境状态持续传播、难以通过后续动作逆转的问题。框架在运行时记录对齐的智能体上下文与受控环境检查点,使智能体可以回到较早状态,并利用此前尝试获得的信息重新执行。作者还构建了 MettleBench,用于评估包含一系列关联需求的长程工程任务,指标覆盖任务完成率与部分进度。跨任务、模型、执行策略和智能体 harness 的实验表明,该方法相较基线提高了任务成功率和平均检查项进度。

用途与启示
  • 为长程智能体提供错误发生后的恢复机制,补充计划优化和执行前安全检查的不足。
  • 将上下文回滚与环境回滚对齐,避免仅恢复对话状态而保留错误环境副作用。
  • 可用于构建具备检查点、失败诊断和重试能力的可靠智能体运行时。
  • MettleBench 可作为评估智能体长程任务完成度及局部进展的参考基准。
📝 原始笔记(逐字保留)
标题:AgentRewind: Recoverable Execution for Long-Horizon LLM Agents 来源:arXiv 链接:https://arxiv.org/abs/2608.14380 摘要:Many real-world tasks require LLM agents to interact with their environments over long execution horizons. Errors that occur early in execution may propagate through both the agent context and environment state, and their effects may be difficult to reverse through subsequent actions. Existing methods mainly seek to reduce such errors through plan refinement and safety checks but provide little support after errors occur. To enable recovery during long-horizon execution, we present AgentRewind, a runtime recovery framework that records aligned checkpoints of the agent context and controlled environment, allowing agents to return to an earlier state and resume execution with information from previous attempts. We also construct MettleBench, a benchmark for evaluating task completion and par

Reflex:面向反应关键型操作的快速预测式 VLA 模型

ReflexBench 与 ReflexVLA 通过动态任务、可配置推理延迟、潜在未来预测和部署优化,提升机器人在反应关键型操作中的实时决策能力。

 具身智能 多模态 时序建模 推理加速 模型评估 动态操控 延迟评估

ReflexBench 面向现有静态操作基准忽视动态交互的问题,提供六项反应关键型任务。其评估框架将模拟器步进与机器人控制解耦,并支持在同步、异步推理模式下配置延迟。ReflexVLA 无需大规模机器人数据预训练,通过潜在未来预测和视觉骨干内的多帧时序融合增强时间推理能力。模型还利用批量视觉编码与 CUDA Graph replay 降低部署延迟,在动态任务上持续提升表现,同时保持静态操作基准的竞争力,并通过真实机器人实验验证有效性。

用途与启示
  • 为动态机器人操作提供比静态成功率更贴近实际部署的延迟感知评测框架。
  • 表明未来状态预测与多帧融合可增强 VLA 对高速环境变化的响应能力。
  • 批量视觉编码和 CUDA Graph replay 可作为降低具身模型端到端控制延迟的工程方案。
  • 可用于研究同步与异步推理、控制频率和推理延迟对机器人任务成功率的影响。
📝 原始笔记(逐字保留)
标题:Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation 来源:arXiv 链接:https://arxiv.org/abs/2608.14379 摘要:Vision-Language-Action (VLA) models have recently achieved promising performance in robotic manipulation. However, existing benchmarks mainly evaluate generalization on static manipulation tasks and largely overlook dynamic interaction scenarios. To address this gap, we present ReflexBench, a benchmark for reaction-critical manipulation. ReflexBench contains six dynamic tasks and introduces an evaluation framework that decouples simulator stepping from robot control while supporting configurable latency under synchronous and asynchronous inference. Building upon ReflexBench, we propose ReflexVLA, an efficient VLA model designed for reaction-critical manipulation without large-scale robot-data pretraining. ReflexVLA enhances temporal reasoning through latent future prediction and multi-fram

错误但有用:多智能体消息的轨迹价值超越答案正确性

论文提出 DHD 测量协议,以反事实回放评估多智能体消息对后续推理的轨迹价值,发现错误答案所含推理仍可能显著提升最终正确率。

 多智能体系统 信用分配 过程评估 反事实推理 因果归因 信息价值

论文区分消息的答案正确性与轨迹价值:错误消息也可能提供有用的任务分解、约束或科学原理。Diverse Hypothesis Deliberation(DHD)缓存五条独立生成的消息,并通过向同一下游整合器展示或隐藏每条消息进行反事实回放,测量其对后续推理的帮助或伤害。在五个数学与科学基准及两个开放模型家族上,所有“基准—模型”组合均出现了“答案错误但轨迹有益”的消息;在会改变最终正确性的错误消息中,两个模型里都有超过四成的变化是正向的。干预实验表明,保留完整消息效果最好,保留其推理过程也优于仅保留答案,说明多智能体消息筛选不应只依赖一致性、置信度或答案正确性。

用途与启示
  • 为多智能体系统提供超越答案正确性的消息保留与删除标准。
  • 可利用 DHD 生成可复用的轨迹价值标签,训练智能体判断何时应采纳其他智能体的消息。
  • 提示奖励建模与信用分配应评估消息对后续推理路径的因果影响,而非只看消息自身是否答对。
  • 支持通过反事实回放识别有益的错误推理,减少简单正确性过滤造成的信息损失。
📝 原始笔记(逐字保留)
标题:Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages 来源:arXiv 链接:https://arxiv.org/abs/2608.14375 摘要:Multi-agent reasoning systems often use agreement, confidence, or automated scores to decide which messages should shape a final answer. Such filtering assumes that a message likely to be correct is also worth keeping. Yet a wrong answer can contain a useful decomposition, constraint, or scientific principle. We test this distinction with Diverse Hypothesis Deliberation (DHD), a controlled measurement protocol that caches five independently generated messages and replays the same downstream solver, called the integrator, with each message available or hidden. The replay comparison measures a message's trajectory value: whether making the message available helps or harms subsequent reasoning. Across five mathematics and science benchmarks and two openly available model families, gpt-oss-120

ScienceFlow:面向长程科研的自主智能体框架

ScienceFlow通过可恢复执行状态、动态研究轨迹重定向和证据感知的算力分配,让LLM智能体能够持续开展长周期机器学习与科学发现任务。

 自动化科学研究 长程任务 智能体 资源调度 闭环科学研究 执行恢复

ScienceFlow将长周期科研流程划分为依托可执行工作空间的研究片段,并把研究进展表示为可恢复、可修订和可继续执行的状态。其ESTRA机制可在当前状态与历史归档状态间重新选择锚点,决定继续现有路线或从死胡同中恢复并转向。证据感知执行控制器依据资源可用性、剩余预算和已验证进展,为实际计算任务动态分配资源。该框架覆盖机器学习、科学建模和数学优化任务,并在24小时预算下于完整MLE-bench取得70.22%的Any-Medal成绩,较此前公开结果提升4.92个百分点。

用途与启示
  • 为长程自主科研智能体提供可恢复的状态管理方案,降低失败分支造成的进展丢失。
  • 展示如何结合历史状态重锚定与轨迹重定向,提高开放式研究搜索的连续性和效率。
  • 可借鉴其证据驱动的资源控制机制,在固定算力或时间预算下优先执行更有价值的实验。
  • 说明扩展自动科研能力不仅依赖更强模型,也依赖状态管理、探索策略和目标一致的执行调度。
📝 原始笔记(逐字保留)
标题:ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond 来源:arXiv 链接:https://arxiv.org/abs/2608.14354 摘要:Enabling LLM agents to sustain productive, stable, and goal-aligned research over extended horizons is a central challenge for autonomous machine learning and scientific discovery, as progress hinges on continuously managing evolving state, exploration decisions, and computational resources. Pioneering autoresearch agents, despite great success, still lack mechanisms for continuity, recovery from dead ends, and value-driven compute allocation, which inherently undermines overall search efficiency, wastes computational resources, and lowers the chance of ultimate success. To bridge this gap, we introduce ScienceFlow, an end-to-end autoresearch agent framework that organizes long-horizon research work into research segments grounded in executable workspaces. It represents research progress a

ATLAS:从智能体轨迹中发现可解释策略

ATLAS 结合 LLM 引导的轨迹抽象与自动机学习,将智能体执行轨迹转化为可解释的有限状态行为模型,用于策略发现、审计、故障分析和知识迁移。

 智能体 人工智能可解释性 轨迹蒸馏 网络安全 模型蒸馏 行为建模 自动机理论 策略发现

ATLAS 首先对智能体与环境的交互轨迹进行抽象,再通过自动机学习推断有限状态模型,以显式呈现智能体采用的高层策略。模型能够识别重复行为、关键决策点、成功任务路径及失败循环,弥补仅以任务成功率和原始轨迹评估智能体的不足。作者在包含 12 台易受攻击机器的渗透测试案例中验证了该方法,揭示了原始执行记录中难以直接辨认的攻击策略。研究还展示了基于符号行为模型将前沿模型知识迁移至小模型,以及通过模型变换生成简洁行为解释的能力。

用途与启示
  • 将冗长、低层的智能体轨迹压缩为可审查的显式策略模型,提升智能体系统的可解释性。
  • 可用于定位失败循环、异常决策与高风险行为,为安全审计和执行诊断提供结构化依据。
  • 支持模型引导的后续探索,利用已发现状态与路径系统性覆盖尚未验证的行为区域。
  • 为大模型向小模型迁移策略知识提供符号化中介,减少仅依赖轨迹模仿或黑盒蒸馏的局限。
📝 原始笔记(逐字保留)
标题:ATLAS: Discovering Agent Strategies through LLM-Guided Abstraction and Automata Learning 来源:arXiv 链接:https://arxiv.org/abs/2608.14352 摘要:Large Language Model (LLM)-based agents are increasingly used for complex tasks such as software testing and cybersecurity assessment. While these agents demonstrate impressive capabilities, their behavior is difficult to understand, explain, and analyze. Existing evaluations focus mainly on task success and execution traces, offering limited insight into the strategies employed by the agent. We present ATLAS (Automata Learning for Agent Trajectory Analysis and Strategy Discovery), an approach for recovering interpretable behavioral models from agent trajectories. ATLAS combines trace abstraction with automata learning to infer finite-state models that capture observed agent-environment interaction strategies. These models provide human-interpretable insights and support automated analyses

Twin:测试时数字孪生破解未知游戏

Twin 让编码智能体在测试时根据交互轨迹编写并持续修复可执行世界模型,在 ARC-AGI-3 未知游戏中将同一基础模型的得分从 7.8%提升至 93.3%。

 世界模型 测试时计算 持续学习 反例生成 过程验证 智能体 数字孪生 规则学习 目标推断

Twin 面向规则和目标均未知的持续学习任务,由前沿编码智能体在测试时构建可执行的数字孪生世界模型。系统在采取新动作前,要求程序准确复现此前观察到的全部状态转移;预测与真实结果的每次不一致都会转化为反例,用于修复模型。Twin 在 183 个关卡中通过 179 个(97.8%),并在其中 156 个关卡获得奖励前便推断出目标。相同基础模型直接游玩仅得 7.8%,使用通用脚手架后为 61.1%,引入 Twin 后达到 93.3%,表明目标推断比构建可用的转移模型更具挑战。

用途与启示
  • 展示一种在测试时从交互数据自动归纳游戏规则、状态转移与任务目标的方法。
  • 通过“历史轨迹全量回放验证”约束智能体行动,可降低错误世界模型导致的规划偏差。
  • 将真实交互产生的预测失配转化为反例,可形成世界模型持续诊断、修复和再验证的闭环。
  • 实验提示世界模型的转移拟合可能并非主要瓶颈,后续研究应更关注无奖励条件下的目标推断与主动探索。
📝 原始笔记(逐字保留)
标题:Twin: Playing an Unknown Game with a Test-Time Digital Twin 来源:arXiv 链接:https://arxiv.org/abs/2608.14490 摘要:We present a Test-time World-model Inference (Twin) system, in which a frontier coding agent writes an executable world model for completing continual learning tasks, such as ARC-AGI-3 games. Traditional approaches hand-engineer such models, one custom design per task. Each game hides its rules and goal, and our system constructs them from simulation and interaction alone. Its inductive prior over grid games is strong enough to recover the true transitions of the game and the goal on nearly all levels. Replay validation happens in a twin world model. The harness enforces that an action is not made until the program reproduces every previous observed game transition. Each mismatch between a world model prediction and the actual action result becomes a counterexample that is used to repair t

PACE-Bench:动态环境中的代码演化与物理适应评测

PACE-Bench 通过六类物理领域中的动态环境突变,评测自进化智能体能否利用沙箱反馈迭代修改代码并恢复任务能力。

 环境适应 演化评估 自进化 智能体 代码重构 物理适应 代码演化

PACE-Bench 包含六个物理领域的 144 组源环境到目标环境适应任务,目标和接口保持不变,但物理条件发生突变,使原先有效的代码方案失效。智能体需要在有限尝试预算内,根据诊断性沙箱反馈持续修改代码,使设计重新适应目标环境。对十种、四类自进化方法的比较显示,该基准仍远未饱和,Reflexion + Qwen3-14B 的全基准成功率仅为 35.9%,GPT-5.5 在 Statics 子集满预算下达到 66.7%。实验发现,基于模拟器反馈的反思优于未经验证的自我修订,而记忆机制容易锚定早期方案,宽泛树搜索则常常无法收敛;即使直接告知物理变化,性能上限也未显著提高,表明核心瓶颈是机制重构而非参数推断。

用途与启示
  • 为动态条件变化下的自进化智能体提供可复现、模拟器落地的适应能力基准。
  • 提示评测不应只考察固定环境中的持续优化,还应测试环境突变后的诊断、恢复与机制重构能力。
  • 沙箱执行反馈和结果验证比无验证的自我反思更可靠,可作为代码演化代理的关键闭环组件。
  • 记忆与树搜索并非天然提升适应性,需要避免早期方案锚定,并增强搜索收敛和结构性重设计能力。
📝 原始笔记(逐字保留)
标题:PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments 来源:arXiv 链接:https://arxiv.org/abs/2608.14441 摘要:Self-evolving agents improve future behavior from interaction experience, yet existing evaluations typically optimize under fixed execution conditions and do not test recovery after those conditions change. To address this gap, we introduce PACE-Bench (Physics Adaptation via Code Evolution), a simulator-grounded benchmark of 144 source-to-target adaptation pairs across six physics domains. Each pair links a source environment to a mutated target environment with the same goal and interface. A code-driven design that succeeds in the source fails in the target, where agents must iteratively adapt it into a working target design using diagnostic sandbox feedback within a limited attempt budget. We compare ten self-evolving methods from four paradigms. The benchmark remains far from saturated:

风格还是签名?艺术家隔离的绘画风格分类评测

研究通过艺术家隔离评测发现,冻结视觉嵌入的绘画风格分类成绩部分来自对画家身份的识别,而非对跨艺术家风格特征的真正理解。

 模型评估 构念效度 捷径学习 处理泄漏 多模态 视觉表征学习 计算艺术

研究质疑 CLIP 等冻结图像编码器在艺术风格分类中的高准确率是否真正代表风格理解,因为随机划分会让同一艺术家的作品同时出现在训练集和测试集中。作者在包含四种二十世纪艺术流派、共 320 幅画作的平衡数据集上,采用逐一留出艺术家的隔离协议重新评测。5-NN 分类准确率由随机划分下的 0.87 降至 0.77,且不同流派的降幅明显不均,其中超现实主义下降约 20 个百分点,而印象主义和立体主义基本稳定。该现象在四种图像编码器上均成立,包括纯视觉自监督模型,说明偏差主要源于视觉结构而非语言信息。结果表明,艺术家难以被识别但风格分类仍稳健时,嵌入更可能捕获了跨艺术家的共享形式。

用途与启示
  • 在艺术风格识别任务中采用艺术家隔离划分,避免模型凭画家个人特征取得虚高成绩。
  • 提醒视觉表征评测应检查身份信息与目标概念之间的混淆,验证指标是否真正测量预期构念。
  • 可将分组留一评测推广到医学、作者识别和产品分类等存在主体重叠风险的任务。
  • 分类别分析性能降幅,有助于识别哪些标签依赖共享结构,哪些标签更容易受到实例或身份捷径影响。
📝 原始笔记(逐字保留)
标题:Style or Signature? Artist-Disjoint Evaluation of Style Classification in Frozen Vision Embeddings 来源:arXiv 链接:https://arxiv.org/abs/2608.14435 摘要:Frozen image embeddings from models such as CLIP are increasingly used to classify paintings by art-historical style, with high reported accuracy. We ask whether this accuracy reflects an understanding of style or the recognition of individual artists. Standard evaluation uses random splits in which works by the same artist appear on both sides, so a classifier can succeed by recognising the painter rather than the movement. We re-evaluate style classification under an artist-disjoint protocol, holding out every artist in turn so that no work is ever classified using other works by its own painter. On a balanced dataset of 320 paintings across four twentieth-century movements, 5-NN style accuracy falls from 0.87 to 0.77 under this protocol, and the drop is sharply uneven. Impressionism and
0%