2026-08-11 科研追新

当日精选(由提交工具自动创建)。

Prime Agent 开源自我改进智能体框架

Prime Agent 是开源自我改进 RLM 智能体框架,通过可编程上下文、持久化执行环境、跨轨迹经验沉淀与子智能体协作支持长程任务,但其公开基准成绩、过拟合及安全风险仍需进一步核验。

 人工智能辅助编程 智能体 人工智能框架 自进化 长程任务 递归模型 人工智能可靠性 多智能体系统 模型评估 长上下文 基准污染 奖励作弊 自我改进 智能体脚手架演化 状态持久化 基准过拟合 安全沙箱 递归语言 会话安全 子智能体 执行恢复 执行验证 能力膜 智能体脚手架 资源调度 递归智能体 长程智能体 智能体执行框架 智能体编排

Prime Agent 以持久化 IPython REPL 将上下文和任务记录转化为可编程变量,并通过函数化子智能体、后台守护、心跳唤醒及跨会话重连支持长时间任务的并行执行与故障恢复。Continual Harness 允许运行时更新历史、提示词、记忆、技能和子智能体配置,借助 /refine 沉淀跨轨迹经验,同时提供版本快照、回滚、结果验证与资源计量能力。项目方报告其将 ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5%,并在长上下文编程、GPU 内核生成、模拟器构建、nanoGPT 加速和 Factorio 等任务上展现优势。由于相关成绩可能受到公开环境持续适配、任务特定过拟合或奖励投机影响,且框架缺少内置安全沙箱,其递归能力、推理成本、泛化性与复现条件仍需通过私有评测和严格消融进一步验证。

用途与启示
  • 为长时间代码重构、模拟器开发、算法实验和 GPU Kernel 调优提供持久状态、故障恢复、执行验证与资源计量的一体化底座。
  • 展示将执行轨迹沉淀为可复用提示词、记忆、技能和子智能体配置的工程路径,可用于自我改进 Harness 与复杂任务编排研究。
  • 有助于将模型能力不足与脚手架故障区分开来,并以统一执行和验证机制开展长程智能体评测。
  • 评测时应采用隐藏测试集、跨任务泛化实验和严格消融,核查模型依赖、推理预算及复现条件,避免将公开基准过拟合误判为通用能力提升。
  • 生产部署应实施权限隔离、资源上限、规则校验、自动化验收、人工复核和版本回滚,防止奖励投机、环境漏洞固化及越权操作。
📝 原始笔记(逐字保留)
一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。https://mp.weixin.qq.com/s/_Z4RGnO8GKxjbbA8ZB0AYQ 这个框架名叫 Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」。项目链接:https://github.com/PrimeIntellect-ai/prime-agent [合并自 2026-08-12 prime-agent-rlm-harness-arc-agi-3] https://mp.weixin.qq.com/s/_Z4RGnO8GKxjbbA8ZB0AYQ [合并自 2026-08-25 prime-agent] https://mp.weixin.qq.com/s/ri36KwRf9xbLpOxxE-Y9nA [合并自 2026-08-25 prime-agent-rlm] 标题:Prime Agent: A Self-Improving RLM Harness 来源:arXiv 链接:https://arxiv.org/abs/2608.23552 摘要:Language models are sequential processors, but long-horizon agency requires external information and computation beyond model weights and active context. Prime Agent is an open-source harness for long-horizon evaluation and coding-agent workflows. A persistent IPython REPL follows the Recursive Language Model abstraction for programmatic context processing and test-time compute, while Continual Harness preserves histories, memories, skills, prompts, and subagent specifications across trajectories. Recursive subagents coordinate through direct agent-to-agent communication, and the Agents View lets humans inspect and manage daemon-backed sessions. Prime Agent standardizes execution, recovery, verification, and resource accounting while leaving strategy construction to the model. This low-fri [合并自 2026-08-26 prime-agent-rlm] [Prime Agent:自我改进的 RLM 框架(32 ▲)](https://huggingface.co/papers/2608.23552?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-25)

蚂蚁集团开源多智能体协作基础设施 Avernet

蚂蚁集团正式开源 Avernet,首个社区版本提供智能体发现、共识、跨团队协作及治理等多智能体协作网络能力。

 智能体工具 人工智能 智能体 人工智能框架 多智能体系统

蚂蚁集团正式开源多智能体协作基础设施 Avernet,社区版本现已上线。首个版本重点开放智能体协作网络能力,支持不同智能体相互发现并建立协作关系。该框架还提供共识机制、跨团队协作与治理能力,旨在支撑复杂多智能体系统的组织和运行。

用途与启示
  • 为构建跨团队、跨系统的多智能体应用提供通用协作基础设施。
  • 降低智能体发现、共识建立及协作治理机制的开发成本。
  • 可用于探索大规模智能体网络的互操作性、组织机制与治理方案。
📝 原始笔记(逐字保留)
蚂蚁集团正式开源多智能体协作基础设施Avernet,社区版本已上线。首个版本重点开放智能体协作网络能力,支持不同智能体之间的发现、共识、跨团队协作与治理。https://www.qbitai.com/2026/08/467871.html

RLSVR:面向开放式任务的自验证奖励框架

RLSVR 通过任务变换构造含隐藏环境变量和确定性规则的代理任务,使大模型在数学与代码之外的开放式任务中也能获得稳定、可扩展的自验证奖励。

 任务生成 人工智能可靠性 强化学习 自进化 模型训练 自我验证 奖励建模 开放式任务

RLSVR 旨在突破 RLVR 对数学、代码等天然可验证任务的依赖,将强化学习扩展到更开放的任务空间。其核心思想受到自监督学习启发,通过任务变换从数据与环境本身生成监督信号。框架构造带有隐藏环境变量和确定性规则的代理任务,使模型输出能够被自动、稳定地验证。该方法为开放式大模型自我改进提供了可扩展的奖励构造路径。

用途与启示
  • 为缺少标准答案的开放式任务自动构造可验证奖励,降低人工标注和奖励模型依赖。
  • 将自监督任务设计与强化学习结合,为 RLVR 扩展到通用任务提供新思路。
  • 可用于研究大模型在持续训练和自我进化过程中的稳定反馈机制。
  • 启发开发者利用环境隐藏变量与确定性规则设计低成本、抗投机的训练任务。
📝 原始笔记(逐字保留)
走出数学与代码,大模型还能自我进化吗?如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。 受到自监督学习的启发,作者提出了 RLSVR(Reinforcement Learning with Self-Verifiable Rewards)训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。 论文标题:From RLVR to RLSVR: Task Transformation Induces SelfVerifiable Rewards for Open-Ended LLM Self-Improvement 代码链接:https://github.com/wangqinsi1/RLSVR/tree/SpyRL  论文链接:https://arxiv.org/abs/2607.23802 https://mp.weixin.qq.com/s/ijDAG4xEPp0PhmX-yDwhww

HarnessBank:面向 Agent-Harness 自进化的语义基因库

HarnessBank 通过语义基因库检索与门控验证,使 Agent 能够诊断失败、重写运行逻辑,并降低自我改进过程中的过拟合风险。

 智能体 人工智能框架 经验检索 自进化 智能体工具 数据工程 模型评估 智能体技能库 强化学习 推理 模型训练 自蒸馏 演化评估 持续学习 智能体记忆 全栈演化

HarnessBank 面向 Agent-Harness 自进化,使智能体能够自主分析任务失败并修改自身运行逻辑。框架将可复用的改进经验组织为语义“基因库”,通过检索寻找与当前失败模式相关的候选方案。门控验证机制负责筛选和验证修改,避免局部成功的策略被直接固化。该设计旨在提升自我改进的泛化能力,从机制上缓解针对特定任务或样例的过拟合。

用途与启示
  • 为可持续自我改进的智能体提供经验存储、检索与复用机制。
  • 支持 Agent 自动诊断失败并重写 Harness,减少人工调试成本。
  • 通过门控验证约束策略更新,提高自进化过程的可靠性与泛化能力。
  • 可作为 HarnessEvolve 类研究中运行逻辑演化与验证闭环的参考框架。
📝 原始笔记(逐字保留)
EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(https://arxiv.org/abs/2607.13683)一文中,提出了一套全新的框架:它能够让Agent自主诊断失败并重写自己的运行逻辑,同时从根本上解决了自我改进中的过拟合问题。https://mp.weixin.qq.com/s/9Id67e3JMMYm16eC0IY24g [合并自 2026-08-11 skillcorpus] 《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(https://arxiv.org/abs/2607.15557)。随着开源社区中技能文件(如Skill.md格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。EverMind团队构建了一个名为SkillCorpus的框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。https://mp.weixin.qq.com/s/9Id67e3JMMYm16eC0IY24g [合并自 2026-08-11 dash] 自进化的最深层,是模型权重的自我迭代。EverMind的最新论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》(https://arxiv.org/pdf/2608.06243v1),展示了其在底层算法上的深厚功底。https://mp.weixin.qq.com/s/9Id67e3JMMYm16eC0IY24g [合并自 2026-08-11 evoagentbench-agent] 今年4月,团队就率先提出了针对Agent自进化的评测基准EvoAgentBench,当月在Hugging Face同类benchmark上下载量第一。https://mp.weixin.qq.com/s/9Id67e3JMMYm16eC0IY24g [合并自 2026-08-11 evermind] 中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷https://mp.weixin.qq.com/s/9Id67e3JMMYm16eC0IY24g

Floatboat Harness五项基准超越Claude Opus 4.8

Floatboat宣称其Harness搭载低成本DeepSeek V4 Flash,在五项第三方基准中全面超过价格高出57.1倍的Claude Opus 4.8,表明智能体表现高度依赖运行底座。

 智能体 模型评估

Floatboat将文件管理器、编辑器和浏览器整合为Agent运行环境,并通过FloatIM和FloatSchedule支持跨主体任务交接与定时自主执行。其认为这些产品形态背后的核心并非界面创新,而是持续演进的Harness底座。8月7日公布的评测显示,搭载DeepSeek V4 Flash的Floatboat Harness在五项第三方基准中均超过Claude Opus 4.8等海外模型。完整评测报告见:https://floatboat.ai/news/harness-benchmark。

用途与启示
  • 说明Agent能力不仅取决于基础模型,工具编排、上下文管理和任务执行机制同样关键。
  • 为采用低成本模型配合高性能Harness降低智能体部署成本提供案例参考。
  • 提示模型评测应同时披露运行底座、工具权限、上下文策略和成本,避免只比较模型名称。
  • 可作为办公智能体、长程任务执行及Harness演化研究的产品化样本。
📝 原始笔记(逐字保留)
贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness https://mp.weixin.qq.com/s/i_18N4NLYDlb8-unAaC_ug 2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。三次发布,三个此前市面上没有的东西,全部围绕真实办公场景。但这三件事没有一件是界面创新。外界看到的是产品形态,每一次底下动的都是 Harness。8 月 7 日,他们把这层底座直接摆上了榜单 ——Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash,成绩超过了一众海外顶尖模型。前面三次,这层技术是以产品形态交付的;这一次,它自己上场接受计量。完整报告链接:https://floatboat.ai/news/harness-benchmark

SkillOpt:冻结模型权重,优化智能体技能文档

微软联合上海交大、同济和复旦提出 SkillOpt,通过冻结目标模型并优化智能体使用的技能文档,在无需重新训练模型的情况下提升任务表现。

 智能体 系统优化 自进化

SkillOpt 将智能体执行任务时使用的技能文档视为可优化对象,而非直接调整模型参数。该方法冻结目标模型权重,通过修改模型遵循的规则和技能说明改善任务执行效果。其核心思路是把能力优化从参数空间转移到外部技能表示空间。这样可以降低重新训练模型的成本,并为智能体技能的持续迭代提供更轻量的路径。

用途与启示
  • 为无法微调或训练成本较高的模型提供轻量级能力优化方案。
  • 支持通过迭代技能文档持续改善智能体表现。
  • 启发将提示、规则和操作流程等外部知识纳入自动优化对象。
📝 原始笔记(逐字保留)
微软与上海交大、同济、复旦团队提出的SkillOpt,尝试了另一条路:冻结目标模型权重,把Agent使用的技能文档当成优化对象。模型不用重新训练,只修改它执行任务时遵循的规则,表现也能提高。https://mp.weixin.qq.com/s/8AwdqW7Jp-EV-Gn9FMH_vA

持续学习赛道升温:Karpathy称仍需十年

尽管 Karpathy 判断成熟的持续学习能力可能还需十年,相关创业公司、模型架构与智能体自进化工具已密集涌现,持续学习正成为大模型研究和产业竞争的新焦点。

 持续学习 人工智能 智能体 人工智能框架 自进化

近期,围绕大模型持续学习的创业项目和研究成果密集出现,覆盖 LoRA、长上下文压缩、灾难性遗忘与多任务适配等方向。部分研究尝试将上下文知识写入模型权重,以突破 KV Cache 和固定上下文窗口的限制。另一些工作通过自动生成智能体训练任务、构建 Harness,让模型在交互中持续积累能力并实现自我进化。虽然 Karpathy 认为真正成熟的持续学习可能仍需十年,但该方向已成为研究界和产业界争相布局的重要赛道。

用途与启示
  • 跟踪持续学习从学术概念走向模型架构、开发工具和创业产品的产业趋势。
  • 关注权重更新、记忆机制、多任务适配和抗遗忘等关键技术路线。
  • 为大模型长期运行、自我进化及低成本能力扩展提供研究选题参考。
📝 原始笔记(逐字保留)
Karpathy说还要十年,可这条路已经挤满了人 最近我们报道了不少剑指「持续学习」方向的创业公司和研究成果,比如《Mind Lab 连续发布 LoRA 最新进展,大模型「持续学习」新范式浮现》、《告别 KV Cache 枷锁,将长上下文压入权重,持续学习大模型有希望了?》、《ICML 2026 | 突破极限!港大提出首个适配 300+任务的持续学习架构,破解遗忘难题》、《能让 DeepSeek 自进化的 Harness!LlamaFactory 作者开源新工具:0.2 元自动造 Agent》、《当「变大」不再是唯一的路,又一国产模型开源了》……是的,相当密集,「持续学习」也正在成为我们最常遭遇的关键词之一。而这背后也昭示着一个被反复念叨的判断。https://mp.weixin.qq.com/s/36ckT5YKJbVuq8754RC1BA

EverMind以EverOS与EverMe推动AI自进化产品化

EverMind基于EverOS记忆架构推出C端产品EverMe,通过跨Agent的个人记忆管理与调用能力,让AI在持续使用中更懂用户。

 人工智能应用 智能体 框架适配 自进化 智能体记忆 用户画像

EverMind试图解决模型更换Harness或运行环境后能力下降、经验难以延续的问题,将自进化能力从研究探索推向实际产品。其首个C端产品EverMe已上线内测,并非简单移植EverOS的开发者接口。EverMe提供轻量、直观的个人记忆汇集、查看、追溯与调用能力。用户还可将积累的记忆数据交给不同Agent服务,使个性化经验能够跨应用复用。

用途与启示
  • 为跨Harness、跨Agent的长期记忆迁移与复用提供产品化思路。
  • 通过持续积累用户记忆,增强AI服务的个性化与长期适应能力。
  • 展示自进化系统从底层架构走向C端应用的可行路径。
📝 原始笔记(逐字保留)
模型换个Harness就「变笨」?EverMind把自进化从研究推向产品,让AI「越用越聪明」目前,EverMind 的首个 C 端产品 EverMe 已上线内测。它并不是把 EverOS 的开发者接口简单搬到消费端,而是在 EverOS 记忆架构基础上,提供更轻便、直观的个人记忆管理与调用能力,让普通用户能够汇集、查看、追溯和使用自己的记忆,并将这些记忆数据交给不同 Agent 服务。https://mp.weixin.qq.com/s/O9NosqGn5dIisxWus8Vuqg

哈萨比斯:数学 AI 的“第37手”只是时间问题

Demis Hassabis 以 AlphaGo 的“第37手”为喻,认为 AI 在数学领域产生突破性、超越人类直觉的成果只是时间问题。

 推理 人工智能 科学发现

文章援引 Demis Hassabis 的观点,讨论 AI 在数学研究中发现非直觉解法与新知识的潜力。“第37手”指向一种超出既有人类经验、但事后可被理解和验证的创造性突破。数学具有明确规则和可验证结果,是检验 AI 推理与创新能力的重要场域。相关进展也可能推动 AI 从辅助解题工具走向参与前沿科学发现。

用途与启示
  • 关注数学推理作为衡量 AI 创造力和可靠推理能力的重要方向。
  • 探索搜索、形式化验证与大模型推理结合的研究路线。
  • 为评估 AI 是否能够产生超越训练数据的新颖发现提供案例框架。
📝 原始笔记(逐字保留)
哈萨比斯预告:数学的AI「第37手」只剩时间问题https://mp.weixin.qq.com/s/VKXtMVItiaPzSxtgbM13ag
0%