2026-08-12 科研追新

当日精选(由提交工具自动创建)。

Kimi 前 CLI 负责人:模型越强,Harness 反而越厚

Kimi 前 CLI 负责人 stdrc 认为,模型增强只会让 Harness 的复杂度从能力补丁层迁移至多智能体协作、状态管理与安全治理层,而不会使其消失。

 智能体

  • Harness 并非简单的 System Prompt 与工具封装,而是模型外层负责执行循环、上下文与状态管理、资源调度及安全治理的运行时工程层。
  • 随着模型能力增强,格式约束、冗长工具提示和固定重试等底层补丁会被内化,但多智能体通信、任务交接、跨会话记忆和动态权限等上层需求随之增长。
  • Kimi CLI 的实践表明,子智能体调度和并行工具调用可交由模型通过脚本完成,但复杂度会进一步迁移到多个 Agent 之间的协议、分工与状态同步。
  • stdrc 创办的 Raft 直接接入 Claude Code、DeepSeek 等成熟 Agent,将重点放在身份与记忆、任务协作、跨厂商通信以及人机共同工作区上,使 Harness 逐渐成为隐形的协作基础设施。
用途与启示
  • 设计 Agent 系统时,应区分用于弥补模型缺陷的底层 Harness 与承载复杂业务协作的上层 Harness。
  • 可将成熟单 Agent 产品作为基础能力接入,把工程投入转向跨 Agent 通信、持久状态、权限控制和可审计工作流。
  • 评估 Harness 演化不应只看提示词和工具封装是否减少,还要观察复杂度是否向组织协作与系统治理层迁移。
  • 为异构模型组成的 Agent Swarm 建立统一协议和任务交接机制,可能形成比单模型能力更持久的工程壁垒。
📝 原始笔记(逐字保留)
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解https://mp.weixin.qq.com/s/UTgNzheCj0OxPxA9oaKMPw 只有那些真正在一线写过CLI、调过 Agent Swarm 的人才会知道:模型不能解决一切。

浙大开源 HugAgentOS:三引擎驱动可控自进化

浙江大学开源 HugAgentOS,通过记忆、技能与编排三类自进化引擎,将智能体经验沉淀为可复用能力,并以归因、隔离回放、用户确认和领域本体实现全过程可审计与可回滚。

 智能体技能库 智能体 人工智能框架 经验检索 自进化 智能体记忆 长程任务

  • HugAgentOS 将智能体 Harness 拆分为记忆、技能和编排三个可成长引擎,分别负责留存执行经验、蒸馏可复用 Skill,以及固化技能、工具和子智能体之间的稳定协作流程。
  • 系统设置统一归因模块,一次失败最多只允许一个责任层更新;修改需经过历史任务隔离回放验证和用户确认,且支持全程追踪与回滚。
  • 领域本体以机器可执行的概念、关系、约束和工作流为进化划定边界,确定性门禁无需调用 LLM 即可拦截违规动作并返回整改路径。
  • 项目还集成 AgentSkills、MCP、插件、子智能体、知识库、计划模式、安全沙箱和文件交付能力,并支持 Docker Compose、命令行及跨平台桌面端部署。
用途与启示
  • 为解决智能体重复任务仍从零规划的问题,提供从历史轨迹到记忆、技能和默认工作流的三级经验沉淀机制。
  • 为多模块自我修改引入单责任层归因、证据门槛和“不更新”规则,降低错误更新与能力污染风险。
  • 通过隔离回放、人工确认、版本追踪和撤回机制,使智能体自进化具备可验证、可审计、可回滚属性。
  • 领域本体可将行业规则转化为运行时和进化时的确定性约束,为高风险企业应用中的可控智能体提供参考架构。
📝 原始笔记(逐字保留)
浙大开源HugAgentOS:三引擎一体自进化,每步可归因/回放/回滚 https://mp.weixin.qq.com/s/xgkjoyntEkRpusBkLhj9sg

AI4AI 从自进化、元进化迈向递归自我改进

青稞Talk 系统梳理 AI4AI 从进化、自进化、元进化迈向递归自我改进的理论脉络,并介绍由 NatureBench、Frontis-MA1 与 OpenMLE 构成的任务、学习和优化开源闭环。

 元学习 自进化 模型训练 模型评估 递归模型 人工智能辅助编程 强化学习 人工智能 智能体 科学发现 经验学习 长程任务 自动化科学研究

AI4AI 可从优化对象、持久经验和改进机制三个维度区分进化、自进化与元进化,其中元进化强调将解决问题的经验迁移至未知任务。NatureBench 借助 NatureGym 将 Nature 系列论文批量转化为可执行开发任务,用于评估代码智能体复现科研级 AI 模型的能力;Frontis-MA1 则面向有限算力与时间约束下的全栈机器学习工程。作为 OpenRSI 系列首个项目,OpenMLE 由含 5,758 个可执行任务及评估器的 OpenMLE-Gym、执行反馈驱动的 OpenMLE-ERL 和经验引导搜索框架 OpenMLE-Evo 组成,连接训练、评测与推理时搜索。OpenMLE-ERL 使用 26,259 条执行验证样本进行全参 SFT 和 GSPO 强化学习,将 Frontis-MA1-35B 在 MLE-Bench Lite 上的 Medal Average 从 39.39% 提升至 60.61%;叠加 OpenMLE-Evo-Max 后,发布方在单卡 RTX 4090 条件下自测达到 71.21%,相对基线降低 41.7% token 消耗。项目公开代码、模型权重、训练数据和评测管线,并在 NatureBench Lite 上验证后训练与搜索框架的迁移收益,但相关成绩并非官方榜单结果。

用途与启示
  • 为研究进化、自进化、元进化与递归自我改进的关系提供统一分析框架。
  • 展示如何将科研论文转化为可执行任务,并以执行反馈驱动 SFT、强化学习和经验沉淀。
  • 为机器学习工程智能体构建任务发现、能力学习、性能优化及推理时搜索闭环提供开源参考。
  • 经验引导及 score、gain、novelty 联合选择机制可减少长程搜索中的重复探索与局部最优,促进跨任务经验复用。
  • 适合研究低成本长时程智能体和搜索—学习协同;引用 71.21% 成绩时应注明其为发布方单卡预算下的系统级自测,商业使用前还需核查 CC BY-NC 4.0 及第三方组件条款。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/CmuiMvrISgkx9Fl655QNHw [合并自 2026-08-12 openmle] OpenMLE:连接搜索与进化的纽带 https://www.chooseai.net/news/5437/

经验时代的自改进智能体:从自我进化到元进化综述

该综述以运行时基座为核心,系统梳理智能体如何将部署后的交互轨迹转化为技能、记忆、模型行为及元层控制能力。

 元学习 智能体技能库 持续学习 智能体 自进化 自我验证 智能体记忆 模型评估 经验学习

综述指出,经验时代的智能体能力不再仅取决于静态数据上的推理,还取决于部署后对交互经验的积累、组织与复用。运行时基座负责捕获轨迹、路由动作、暴露反馈并管理可变状态,是经验驱动改进的基础设施。文章梳理了经验向可复用技能、持久记忆、可验证环境反馈、可训练模型行为和元层控制转化的主要路径。作者进一步总结了纵向评估、跨任务迁移、更新验证与安全治理等关键障碍,并将智能体进化概括为“从轨迹到能力”的系统问题。

用途与启示
  • 为自改进智能体研究提供从经验采集、能力更新到元层控制的统一分类框架。
  • 启发围绕运行时基座设计可追踪、可验证且可回滚的持续进化机制。
  • 可用于梳理技能库、长期记忆、在线训练和环境反馈之间的协同关系。
  • 指出纵向评测、迁移验证及安全治理是智能体部署后可靠进化的重点方向。
📝 原始笔记(逐字保留)
综述:https://openreview.net/pdf?id=IUltZSgLMm

Awesome Self-Improving Agents:自改进智能体资源库

该资源库系统梳理自改进智能体从运行时适应、经验积累到参数更新与元演化的论文、系统、基准和相关资源。

 强化学习 智能体技能库 持续学习 智能体 自进化 智能体记忆 模型评估

该项目以 harness agent 为核心,将部署后的智能体视为基础模型、可变运行框架、用户接口和环境接口共同构成的系统。资源分类涵盖技能与技能库、记忆与上下文管理、工具和环境反馈、智能体强化学习、持续学习、元智能体及演化编排。其自改进路径分为外部运行时适应与模型参数更新:前者编辑技能、记忆、上下文和工具,后者通过强化学习、微调或持续学习固化经验。项目同时收录评估、安全与治理工作,以讨论部署后持续演化的条件、边界和风险。

用途与启示
  • 可作为自改进智能体、经验学习与元演化研究的文献入口和分类索引。
  • 为构建 harness-centered 智能体框架提供技能、记忆、工具、环境及运行反馈等模块化参考。
  • 帮助对比运行时快速适应与参数级长期学习两类技术路线。
  • 可用于跟踪智能体评测、安全治理及可靠部署方面的最新进展。
📝 原始笔记(逐字保留)
资源库:https://github.com/FrontisAI/Awesome-Self-Improving-Agents

NatureBench:编程智能体能否复现论文中的 SOTA

NatureBench 旨在评估编程智能体能否完成真实科研代码任务,并达到已发表论文报告的 SOTA 水平。

 人工智能辅助编程 智能体 科学发现 模型评估 SWE 软件工程

NatureBench 聚焦编程智能体在真实科研场景中的能力评测。其核心问题是智能体能否理解论文方法、实现或修改实验代码,并复现已发表的 SOTA 结果。该基准有助于揭示代码生成表现与端到端科研复现能力之间的差距。

用途与启示
  • 评估编程智能体在复杂科研代码与实验复现任务中的真实能力
  • 分析智能体与论文已发布 SOTA 之间的性能差距
  • 为自动化科学研究和科研软件工程提供统一评测依据
📝 原始笔记(逐字保留)
论文:NatureBench: Can Coding Agents Match the Published SOTA o

Frontis-MA1:专攻机器学习工程的全栈模型

Frontis-MA1 是一款面向机器学习工程全流程任务的专用全栈模型。

 人工智能辅助编程 全栈演化 模型开发 SWE 软件工程 机器学习

Frontis-MA1 定位为专攻机器学习工程的全栈模型。其目标场景可能覆盖机器学习项目中的开发、训练、评估及部署等环节。当前信息未提供模型架构、性能指标、论文或代码等具体细节。

用途与启示
  • 探索专用模型在机器学习工程全生命周期中的应用价值
  • 为端到端自动化开发与模型运维提供潜在工具
  • 关注其后续公开的技术报告、评测结果与代码资源
📝 原始笔记(逐字保留)
Frontis-MA1:专攻机器学习工程的“全栈”模型

OpenMLE:单卡运行的 AI 自进化全栈系统

清华与 Frontis.AI 开源 OpenMLE 全栈系统及 Frontis-MA1 模型,通过统一进化算子、执行导向强化学习和经验驱动搜索,在单张 RTX 4090 上实现接近顶级闭源代码智能体的机器学习建模能力。

 人工智能辅助编程 全栈演化 强化学习 智能体 科学发现 系统优化 经验检索 自进化 机器学习

OpenMLE 由可执行任务环境 OpenMLE-Gym、算子训练层 OpenMLE-ERL 和进化搜索层 OpenMLE-Evo 组成,统一使用 Draft、Improve、Debug、Crossover 四类代码进化算子。系统从 Kaggle 等来源构建 5758 个可执行任务,并利用 26259 条高质量样本开展 SFT 和执行反馈强化学习。OpenMLE-Evo 通过经验卡片、三因子父本选择和按需记忆合成持续执行“写代码—运行—反馈—再进化”,可将 Prompt 长度降低 60%–86%。在 MLE-Bench Lite 上,Frontis-MA1 配合增强版搜索取得 71.21% 的 Medal Average;在 NatureBench 上也表现出向科学建模任务迁移的能力。

用途与启示
  • 为递归自我改进研究提供涵盖任务构建、模型训练、沙箱执行和长时搜索的可复现平台。
  • 展示如何用统一原子算子连接 SFT、强化学习与测试时搜索,减少训练和推理阶段的目标割裂。
  • 可借鉴经验卡片、按需记忆和多因素父本选择机制,提升长程代码智能体的搜索效率并抑制早熟收敛。
  • 证明消费级单卡也能开展 AI4AI 与机器学习工程智能体实验,降低相关研究的算力门槛。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/fftp5K4UUhRiGoC6Bt7UCw

秦兵:大模型时代的科研品味

秦兵教授指出,大模型时代科研执行环节正逐步被AI接管,研究者应以“重要的问题、简洁的方法”培养不可替代的科研判断力。

 人工智能 科研品味

秦兵教授在ChinaMM 2026专题论坛中将科研品味概括为研究者选择问题和设计方法时依赖的底层判断力。好的选题应聚焦根本、真实且尚属空白的问题,避免追逐短期热点或人为制造任务。好的方法则应穿透复杂性、剔除多余假设与组件,以简洁、通用且可扩展的设计解决核心问题。随着文献调研、代码实现、实验执行和论文写作逐渐由AI承担,研究者更应保留对“问什么、怎么答”的判断,并通过精读经典、聆听主旨报告、同行交流和跨学科熏陶持续培养品味。

用途与启示
  • 为大模型时代的科研选题提供判断框架:优先寻找根本、真实且存在空白的问题。
  • 指导方法设计减少模块堆砌,追求简洁、通用、可靠和可扩展的方案。
  • 提醒研究者将AI用于调研、编码与实验等执行工作,同时保留问题定义和方案取舍的主导权。
  • 可用于实验室科研训练、论文评审及选题讨论,帮助团队建立长期主义的研究标准。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/PLuusSQfeTgykNAcbUQMFg?scene=1

阿里 Skill-SP:以自进化技能库实现高质量自博弈

阿里通义千问团队提出 Skill Self-Play,通过动态进化的模块化技能库兼顾合成任务的多样性与可验证性,持续提升模型的工具调用和逻辑推理能力。

 任务生成 智能体工具 强化学习 智能体技能库 数据合成 自进化 逻辑推理 自博弈 难度控制

Skill-SP 由出题器、解题器和技能控制器组成,将技能引导生成与无约束开放探索结合,在保证任务质量的同时持续发现新题型。系统通过格式合规、合约有效和答案稳定三重校验筛选样本,并优先选择位于模型能力前沿、正确率接近 50% 的任务用于 GRPO 强化学习。控制器会根据训练反馈精炼、裁剪和归纳技能,使技能库与模型能力共同进化,5 轮后生效技能增至 86 个。实验显示,该方法在工具调用和 ZebraLogic 逻辑推理任务上稳定优于无引导自博弈,尤其能为基础能力较弱的模型提供有效训练信号。

用途与启示
  • 为开放式自博弈提供兼顾任务多样性与验证可靠性的合成数据方案。
  • 可用于工具调用 Agent、逻辑推理模型及其他可验证任务的强化学习训练。
  • 动态技能库能压缩和复用训练经验,降低重复生成、错误累积与合成数据坍塌风险。
  • 可进一步探索自适应课程学习、跨模型技能迁移,以及多模态和长流程智能体任务。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/HGZuNR2q6rg4HxvtIivIaQ

什么是 Self-evolving、Self-improving 与 RSI?

文章将自进化与递归自我改进划分为 Artifacts、Harness 和 Model 三个层次,并结合前沿机构与系统案例梳理其实现路径和发展趋势。

 智能体技能库 智能体 人工智能框架 人工智能 自进化 模型训练 智能体脚手架

文章以优化对象为依据,将自进化分为三层:持续改进代码、论文或算法等产出物的 Artifacts 层,优化提示词、记忆、工具、技能与多智能体路由的 Harness 层,以及更新模型参数和训练流程的 Model 层。三者都通过“生成—评估—反馈—修订”循环提升性能,并可借助经验、数据和工具相互反哺,最终形成闭环。Karpathy Autoresearch 与 AlphaEvolve 展示了自动搜索训练配置和算法代码的产物级进化,Hermes、MiniMax M2.7 和 Apodex 则体现了技能沉淀、脚手架迭代及多智能体验证等 Harness 路径。文章判断近期更现实、性价比更高的突破口是 Harness 自进化,而完整 RSI 的长期目标是让 AI 自主完成训练、测试、诊断和下一代系统设计。

用途与启示
  • 为 Self-evolving、Self-improving 与 RSI 提供统一的三层分类框架,避免将自训练、智能体迭代和产物优化混为一谈。
  • 指导项目根据优化对象选择评测指标:Artifacts 看任务产出,Harness 看跨任务收益,Model 看训练后的能力增量。
  • 优先探索低成本、无需更新权重的 Harness 进化,例如自动沉淀技能与记忆、优化工具调用及多智能体协作。
  • 构建可验证的闭环,把执行轨迹转化为评测、经验和训练数据,使 Harness、模型与产出物形成持续增强的飞轮。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/iWh5x-SPxa-MhMq4OLLqpw

97页综述:现代 AI Agent 的自我进化体系

综述将现代智能体的自我进化归纳为模型权重更新与脚手架重组两条路线,并系统讨论提示、记忆、工具、全栈代码的优化机制及评估安全问题。

 全栈演化 人工智能可靠性 智能体工具 智能体 智能体脚手架 自进化 模型训练 智能体记忆 模型评估 人工智能安全治理

综述将自主进化智能体拆分为“大模型大脑”和“操作脚手架”,前者通过合成数据、自我反馈或环境反馈更新权重,后者则在不改模型的情况下调整提示、记忆、工具与调度逻辑。权重进化成本高且存在模型坍塌、奖励投机和灾难性遗忘风险,但能把能力固化为可跨任务复用的长期能力。脚手架进化更轻量、易回滚,可进一步发展为提示词优化、动态记忆治理、工具创建以及整套 Agent 源代码的递归重构。评估应在固定预算下追踪完整进化曲线、任务迁移、旧能力退化与实际成本,并将训练阶段的评判者和最终评估者解耦。具备自我修改能力的系统还需通过权限隔离、功能测试、异常输入验证和持续审计,将进化限制在明确的安全边界内。

用途与启示
  • 为自我进化 Agent 提供“模型权重—外围脚手架”的统一技术分类框架。
  • 支持采用脚手架快速试错,再将稳定有效的能力蒸馏或训练进模型权重。
  • 指导长期任务系统建设可筛选、压缩、衰减和重构的动态记忆机制。
  • 提醒评估者关注完整学习轨迹、迁移能力、遗忘率、计算成本及评判者偏置。
  • 为递归修改代码和自主创建工具的智能体设计沙盒、权限检查与多重验证机制。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/FGb-bxKqeoVwszzKCAiUPw?scene=1

2026—2027年大模型行业两大里程碑

推理效率突破与AI自学习能力成熟,可能成为2026—2027年大模型行业的关键分水岭。

 持续学习 推理 人工智能 系统优化 自进化

行业未来两年的第一个重要里程碑,是大模型推理效率取得实质性突破。第二个里程碑,是AI自学习问题得到解决,使模型能够更自主地持续改进。两项进展将分别缓解大模型的部署成本与能力演化瓶颈,并可能重塑行业竞争格局。

用途与启示
  • 将推理效率视为大模型规模化应用和商业落地的核心约束。
  • 关注持续学习、自我进化等方向能否解决AI自主获取经验与改进能力的问题。
  • 可围绕这两个里程碑建立2026—2027年的技术趋势跟踪与评估框架。
📝 原始笔记(逐字保留)
2026-2027年两个里程碑。大模型行业的下一个分水岭,一是推理效率问题取得突破,二是AI自学习问题被解决。这两个事儿

AIDE²:零权重更新实现一阶递归自我改进

Weco AI 让外层研究智能体在固定预算和隐藏评测约束下连续迭代内层 AIDE 的运行框架,8 天完成100轮全自动改写,并获得可迁移的一阶递归自我改进证据。

 人工智能可靠性 智能体 人工智能框架 系统优化 自进化 模型评估 长程任务 递归自我改进 奖励作弊

AIDE² 在不更新基础模型权重的情况下,让外层智能体自动修改内层研究智能体的搜索策略、上下文管理、错误处理与评测逻辑。系统连续运行8天、完成100轮迭代,仅有第2、6、28、39、47、63和85轮刷新历史最佳成绩,内部综合分数从0.703提升至0.778。AIDE₄₇与AIDE₈₅在机器学习工程、启发式算法和天气模拟等未参与筛选的任务上均超过初始版与人工调试版,体现出二阶泛化;其中 AIDE₈₅ 还将 KernelBench 奖励作弊率从63%降至34%。改进主要来自基于多臂老虎机的分支搜索、按操作构建最小上下文以及隐藏评测筛选,但最终代码复杂度和无效逻辑有所增加,且尚未证明 Level 2“点火”或持续加速。

用途与启示
  • 展示无需更新模型权重、仅演化 agent harness 也能形成可积累且可迁移的能力提升。
  • 为自动研发系统提供外层优化范式:使用固定成本、隐藏评测和严格保留机制筛选框架改动。
  • 说明搜索策略与上下文压缩是智能体长期迭代的重要优化方向,可将节省的 token 转化为更多实验步骤。
  • 提醒递归自我改进需要同时关注奖励作弊、统计波动、代码复杂度和外部任务泛化,不能只依据内部得分判断进展。
  • 当前结果仅支持 RSI Level 1;是否能让改进后的内层智能体成为更强的外层优化器,仍需进一步验证。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/MCGaSYk2UYY81baNymTWqQ?scene=1

清华推出 Ctx2Skill:通过多智能体自博弈实现 Skill 自主进化

Ctx2Skill 通过挑战者与推理者的多智能体自博弈,在无需人工标注、外部反馈或参数训练的情况下,从复杂上下文中自主发现、优化并筛选可复用的 Skill。

 博弈论 多智能体系统 智能体技能库 推理 自博弈 自进化 长上下文 对抗回放

Ctx2Skill 设置挑战者、推理者、裁判、提议者和生成器等智能体,通过持续出题、作答、诊断失败和更新 Skill,使出题与解题能力协同进化。系统仅更新自然语言形式的 Skill,不调整模型参数,也不依赖人工标注、标准答案或外部奖励。为避免后期 Skill 过度专精导致对抗崩塌,框架利用困难题库与简单题库进行跨时间回放,从历史版本中选取表现最均衡的 Skill。CL-Bench 实验显示,GPT-4.1 搭配 Ctx2Skill 后达到 16.5%,超过无 Skill 的 Gemini 3 Pro,并且生成的 Skill 可以跨模型迁移。

用途与启示
  • 为陌生行业文档、实验报告和操作手册自动提炼可复用的规则与流程,降低人工编写提示词和 Skill 的成本。
  • 展示无外部监督条件下,以多智能体自博弈驱动 Skill 层自我进化的可扩展范式。
  • 跨时间回放可用于缓解迭代中的过拟合、遗忘和对抗崩塌,为进化式智能体系统提供版本选择机制。
  • 生成的纯文本 Skill 可直接加入系统提示词并跨模型复用,适合低成本增强弱模型的上下文学习能力。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/TtFPqd4eMUliLhJj52O3cw

清华 CPMöbius:Coach-Player 协作共演化实现自主出题训练

清华 THUNLP 提出 CPMöbius,通过 Coach 出题与 Player 解题的协作式共演化闭环,在共演化阶段无需新增人工训练题,并提升数学推理及分布外泛化能力。

 任务生成 强化学习 推理 数据合成 自进化 模型训练 课程学习 协同演化 难度控制

CPMöbius 将 Coach 的奖励与 Player 在固定验证集上的进步绑定,使出题者和求解者形成协作关系,而非相互制造极端难题的对抗关系。Player 对每道题生成 16 份解答并以多数投票构造伪标签,再通过 GRPO 更新;Coach 则依据验证性能增量调整出题策略。系统使用“最近发展区”过滤器,仅保留当前 Player 解题准确率在 20% 至 80% 之间的题目,让课程难度随能力自动增长。实验显示,该方法在四类基座模型上领先 R-Zero、RENT 等基线,并在 Minerva 等分布外基准上取得显著提升。不过其“无数据”仅限共演化阶段,初始化仍使用约 4K 条 warm-up 数据,评估也依赖人工构建的固定基准。

用途与启示
  • 为高质量人工训练数据日益稀缺的问题提供自主生成任务与伪标签的替代方案。
  • 表明将出题者奖励绑定到学习者的真实进步,比单纯追求题目难度的对抗式设计更稳定。
  • 可将动态难度过滤视为自动课程学习机制,帮助模型持续处于有效学习区间。
  • 固定外部验证集、难度过滤和协作奖励可共同抑制错误伪标签在闭环中的自我放大。
  • Coach-Player 框架有望扩展到代码生成、科学推理等领域,但仍需研究长期训练稳定性及对人工评测数据的依赖。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/neBUj5Rt1auIvxhmHBDSmA

SWE-Bench ProMax:大规模多语言代码重构智能体基准

SWE-Bench ProMax 收录170个跨七种编程语言的真实大型重构任务,通过专家重写需求和人工审查测试提升评测质量,当前最佳智能体解决率仅为41.2%。

 人工智能辅助编程 基准污染 模型评估 SWE 软件工程 长程任务 代码重构 多语言建模

SWE-Bench ProMax 是面向AI编程智能体的专家策划代码重构基准,包含来自真实提交的170个实例,覆盖 Python、Java、TypeScript、Go、C、C++ 和 Rust。研究团队从头重写任务描述,并人工审查测试套件,以减少测试过窄、测试范围过宽及训练数据补丁泄漏等既有基准问题。任务强调跨文件、行为保持的大规模修改,平均涉及11.4个文件和261.6行代码,复杂度显著高于现有基准。前沿模型在两种智能体脚手架下的最高解决率仅为41.2%,表明该基准仍未饱和。

用途与启示
  • 用于评估AI编程智能体执行大规模、跨文件和长程代码重构任务的真实能力。
  • 通过重写需求与人工审核测试,为降低基准污染和错误测试带来的评测偏差提供范式。
  • 可用于比较不同模型与智能体脚手架在多语言软件工程任务上的稳定性和泛化能力。
  • 为构建更高难度、更贴近真实开发流程的软件工程评测集提供数据与设计参考。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.09802?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-11

Macaron-V1:基于自我改进与 Mixture-of-LoRA 的开放持续学习

Macaron-V1 通过模型—脚手架递归共进化与 Mixture-of-LoRA 专家组合,使智能体能够从真实环境经验中学习并在部署后持续适应。

 持续学习 模型开发 智能体 人工智能框架 自进化 递归自我改进 长上下文

Macaron-V1 是面向经验智能的开放智能体模型家族,强调从真实环境经验中学习并在部署后继续改进。系统通过带版本的模型—脚手架组合、外部 HCP 契约和递归自我改进循环,将一次运行产生的经验用于构造后继版本。其 Mixture-of-LoRA 架构冻结基础模型,并在每轮用户交互中从聊天、智能体、编程和 GenUI 等专业 LoRA 中选择一个。旗舰版本 Venti 基于 744B 参数的 GLM-5.2,面向本地部署的 Tall 则基于 50B 参数的 Qwen3.6,同时配套 MindForge、MinT、LongStraw 和 UI4A 等训练与执行基础设施。

用途与启示
  • 为部署后持续学习提供参数高效的方案,可通过扩展专业 LoRA 增加能力而无需反复更新基础模型。
  • 展示模型与脚手架协同设计的递归改进路径,将经验收集、外部评估和版本迭代纳入统一闭环。
  • 可作为研究个性化智能体、长程任务学习及多能力协作架构的开放系统基线。
  • 当前结果主要验证系统可行性,持续学习的复合收益与集体智能增益仍有待长期实验确认。
📝 原始笔记(逐字保留)
https://arxiv.org/abs/2608.09819

Ouroboros:可自我演化的前沿编程智能体

Ouroboros 通过受审查的代码提交持续改进工具、提示词、上下文组装与核心实现,并在多个智能体基准上取得领先成绩。

 人工智能辅助编程 人工智能安全治理 智能体 经验学习 自进化 递归自我改进

Ouroboros 是一种可自我发展的智能体脚手架,其工具、提示词、上下文组装方式及核心代码能够通过审核后的提交持续演化,并成为后续任务的新运行时。系统支持递归自由演化与经验驱动演化:前者将改进自身作为可循环调度的任务,后者从日常工作和社会互动中发现缺陷并推动结构性修改。其 Opus 5 版本在 Terminal-Bench 2.1 和 OSWorld-Verified 上分别达到 86.74% 与 90.69%,在 CL-Bench 五次 rollout 中获得 0.2301 的归一化奖励。公开部署 Hope 已持续运行 161 天,并通过冻结评测快照、隔离演化分支和权威护栏,应对智能体改写自身代码及切换模型 API 带来的安全风险。

用途与启示
  • 为递归自我改进智能体提供“审核提交即新运行时”的工程实现范式。
  • 展示如何利用真实任务与人类互动产生的经验,持续发现并修复智能体脚手架缺陷。
  • 提示自演化系统需将代码审查、快照冻结、分支隔离和不可被演化绕过的安全护栏纳入核心设计。
  • 可作为研究编程智能体、长期自主运行和经验驱动脚手架演化的重要案例。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.08311?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-11

BDH-CQ:基于循环潜在推理的上下文学习

BDH-CQ 将持续更新的循环记忆与潜空间迭代计算结合,以低成本在 ARC-AGI-1 上实现较强的上下文学习与推理性能。

 推理 模型开发 智能体记忆 模型评估 递归模型 潜空间推理 上下文学习

BDH-CQ 是一种结合上下文学习与循环潜在推理的模型,推理时输入会持续更新其循环记忆。模型在高维潜空间中进行多轮迭代计算,无需将中间推理过程显式语言化。研究通过 ARC-AGI-1 及受控的类 ARC 干预实验,分析模型从示例中学习变换、稳定应用规则及处理困难概念的能力。其 1.5 亿参数版本以每题约 0.0007 美元的计算成本取得 29.5% pass@2,刷新了该基准的成本—准确率帕累托前沿。

用途与启示
  • 为无需显式思维链的潜空间推理提供轻量级模型方案。
  • 展示循环记忆可在推理阶段持续吸收示例,并支持上下文内规则归纳。
  • 为 ARC 类抽象推理系统的成本效率优化提供新的架构与评测参考。
  • 受控干预方法可用于诊断模型能否一致应用所推断的变换及其概念短板。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.09888?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-11

无监督同策略自蒸馏 U-OPSD

U-OPSD仅利用模型自身生成结果和内部一致性构造伪解,在无外部监督下实现同策略自蒸馏,并在多项数学推理基准上媲美或超越监督方法。

 推理 数据合成 自进化 自蒸馏 模型训练 内部一致性 伪监督学习

U-OPSD通过多次采样模型回答,并在满足自一致性阈值时以多数投票构造伪解,全程不依赖真实答案、环境反馈或更强教师模型。方法以伪解为条件重构模型分布,重点蒸馏与多数结论不一致的生成,使模型在具有较高内部置信度时纠正错误。实验覆盖多种基础模型、训练配置及五项数学推理基准,均稳定优于原始模型。在Qwen3 4B与8B非思考模式下,平均提升分别达到8.5%和10.7%,并超过有真实标签的OPSD;思考模式下也与OPSD相当且优于GRPO。

用途与启示
  • 展示无需人工标签、奖励模型或外部验证器的推理能力后训练路径,可降低监督数据与环境反馈成本。
  • 可将多次采样的一致性转化为伪监督信号,用于自动生成训练目标和筛选高置信样本。
  • 为模型自我进化提供闭环范式:模型生成、内部聚合、定位分歧并针对性蒸馏。
  • 提示多数投票误差和自一致性阈值是关键风险点,应用时需监控错误共识导致的自我强化。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.06296?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-11

Agent Memory Distillation:用分层教师记忆增强小模型智能体

AMD 无需训练,通过蒸馏大模型教师智能体的分层轨迹记忆,显著提升 4B~8B 小模型智能体的工具使用能力。

 智能体工具 智能体 人工智能框架 经验学习 经验检索 智能体记忆 记忆蒸馏 小语言模型 工具调用

AMD 从教师智能体的成功轨迹中构建工作流、子任务和函数三类互补记忆,将结构化经验迁移给小模型学生智能体。工作流与子任务记忆在任务开始时主动注入,函数记忆则在工具调用出错后按需检索,用于补充调用规范和常见陷阱。以 GPT-5-mini 为教师、四个 4B~8B 模型为学生时,AMD 在 AppWorld、BFCL V3 和 ToolSandbox 上分别取得平均 27.2、11.2 和 3.4 个百分点的准确率提升,并优于现有记忆基线。消融分析表明子任务记忆贡献最大,教师效果同时取决于教师能力及师生兼容性,其中 4B 模型受益最明显。

用途与启示
  • 提供一种无需更新学生模型参数的能力迁移方案,适合低成本增强小模型工具智能体。
  • 表明将成功轨迹拆分为任务策略、子任务示例和函数规范,比使用单一粒度的记忆更有效。
  • 可将主动注入与错误触发检索结合,减少无关上下文,同时针对工具调用失败进行定向修正。
  • 提示教师选择不能只看模型能力,还需评估其轨迹风格与学生模型的兼容性。
📝 原始笔记(逐字保留)
https://arxiv.org/abs/2608.07169 https://github.com/taeilkim2465/agentic_memory_distillation

专有 LLM API 推理轨迹窃取攻击

研究发现主流 LLM API 的加密推理块可跨会话、用户和模型复用,攻击者可借助同一提供商旗下防护较弱的模型解密并窃取推理轨迹。

 人工智能可靠性 人工智能安全治理 推理 智能体 模型窃取 隐私泄露 提示注入攻击

论文揭示了一种客户端侧加密推理块的架构漏洞:这些密文可在同一提供商生态内跨会话、用户及模型互换。攻击者可将强模型生成的加密推理轨迹注入防护较弱的模型,诱使后者逐字输出明文,无需直接越狱原模型。该攻击可绕过反蒸馏机制,并已在 Anthropic、OpenAI 和 Google 的模型生态中得到验证。作者还从公开代码仓库抓取并解码了 315,320 个推理块,发现 367 条个人身份信息和 182 项凭证,同时展示了危险信息泄露与隐形提示注入风险。论文在负责任披露后提出了密码学与系统层面的客户端推理保护方案。

用途与启示
  • 提醒 API 提供商不要仅依赖可跨上下文复用的加密推理块保护模型知识产权。
  • 为推理轨迹的会话绑定、用户绑定、模型绑定及完整性认证提供安全设计依据。
  • 揭示公开智能体日志可能携带密文中的隐私、凭证及危险内容,应加强发布前扫描与脱敏。
  • 可用于构建针对反蒸馏绕过、跨模型密文重放和隐形提示注入的安全评测。
📝 原始笔记(逐字保留)
https://arxiv.org/abs/2608.09867 Stealing Reasoning Traces from Proprietary LLM APIs Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko Leading large language model providers now conceal their models' step-by-step reasoning, or chain-of-thought, to protect intellectual property and limit information leakage. Rather than storing these traces server-side, providers return them to the client as blocks of encrypted text, which the client passes back with each subsequent request. Building on prior research, we identify an architectural vulnerability: these encrypted blocks are fully compatible and interchangeable across different sessions, users, and models within a provider's ecosystem. We exploit this compatibility to develop a scalable decryption jailbreak. By injecting an encrypted reasoning trace from a given model into a weaker, and less safeguarded model from the same provider, we force it to decode and output the trace verbatim in plaintext, without ever jailbreaking the more capable model directly. This vulnerability enables four distinct attack vectors. First, it circumvents anti-distillation mechanisms, allowing adversaries to extract a proprietary model's reasoning, as we demonstrate across Anthropic, OpenAI, and Google. Second, it allows for large-scale private data extraction. Developers frequently share session logs publicly, unaware of contents of the encrypted blocks. By decoding 315,320 reasoning blocks scraped from public repositories, we recovered 367 Personally Identifiable Information (PII) artifacts and 182 credentials. Third, it inadvertently reveals hazardous information hidden within the reasoning process, even in cases where the model's final, visible output safely rejects a malicious request. Fourth, attackers can leverage this flaw to execute invisible prompt injections, embedding malicious payloads entirely within encrypted blocks to poison public agentic rollouts. Following responsible disclosure, we propose concrete cryptographic and system-level mitigations to secure client-side reasoning.
0%