2026-08-11 科研追新
当日精选(由提交工具自动创建)。
Prime Agent 开源自我改进智能体框架
Prime Agent 是开源自我改进 RLM 智能体框架,通过可编程上下文、持久化执行环境、跨轨迹经验沉淀与子智能体协作支持长程任务,但其公开基准成绩、过拟合及安全风险仍需进一步核验。
人工智能辅助编程 智能体 人工智能框架 自进化 长程任务 递归模型 人工智能可靠性 多智能体系统 模型评估 长上下文 基准污染 奖励作弊 自我改进 智能体脚手架演化 状态持久化 基准过拟合 安全沙箱 递归语言 会话安全 子智能体 执行恢复 执行验证 能力膜 智能体脚手架 资源调度 递归智能体 长程智能体 智能体执行框架 智能体编排
Prime Agent 以持久化 IPython REPL 将上下文和任务记录转化为可编程变量,并通过函数化子智能体、后台守护、心跳唤醒及跨会话重连支持长时间任务的并行执行与故障恢复。Continual Harness 允许运行时更新历史、提示词、记忆、技能和子智能体配置,借助 /refine 沉淀跨轨迹经验,同时提供版本快照、回滚、结果验证与资源计量能力。项目方报告其将 ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5%,并在长上下文编程、GPU 内核生成、模拟器构建、nanoGPT 加速和 Factorio 等任务上展现优势。由于相关成绩可能受到公开环境持续适配、任务特定过拟合或奖励投机影响,且框架缺少内置安全沙箱,其递归能力、推理成本、泛化性与复现条件仍需通过私有评测和严格消融进一步验证。
- 为长时间代码重构、模拟器开发、算法实验和 GPU Kernel 调优提供持久状态、故障恢复、执行验证与资源计量的一体化底座。
- 展示将执行轨迹沉淀为可复用提示词、记忆、技能和子智能体配置的工程路径,可用于自我改进 Harness 与复杂任务编排研究。
- 有助于将模型能力不足与脚手架故障区分开来,并以统一执行和验证机制开展长程智能体评测。
- 评测时应采用隐藏测试集、跨任务泛化实验和严格消融,核查模型依赖、推理预算及复现条件,避免将公开基准过拟合误判为通用能力提升。
- 生产部署应实施权限隔离、资源上限、规则校验、自动化验收、人工复核和版本回滚,防止奖励投机、环境漏洞固化及越权操作。
📝 原始笔记(逐字保留)
蚂蚁集团开源多智能体协作基础设施 Avernet
蚂蚁集团正式开源 Avernet,首个社区版本提供智能体发现、共识、跨团队协作及治理等多智能体协作网络能力。
蚂蚁集团正式开源多智能体协作基础设施 Avernet,社区版本现已上线。首个版本重点开放智能体协作网络能力,支持不同智能体相互发现并建立协作关系。该框架还提供共识机制、跨团队协作与治理能力,旨在支撑复杂多智能体系统的组织和运行。
- 为构建跨团队、跨系统的多智能体应用提供通用协作基础设施。
- 降低智能体发现、共识建立及协作治理机制的开发成本。
- 可用于探索大规模智能体网络的互操作性、组织机制与治理方案。
📝 原始笔记(逐字保留)
RLSVR:面向开放式任务的自验证奖励框架
RLSVR 通过任务变换构造含隐藏环境变量和确定性规则的代理任务,使大模型在数学与代码之外的开放式任务中也能获得稳定、可扩展的自验证奖励。
任务生成 人工智能可靠性 强化学习 自进化 模型训练 自我验证 奖励建模 开放式任务
RLSVR 旨在突破 RLVR 对数学、代码等天然可验证任务的依赖,将强化学习扩展到更开放的任务空间。其核心思想受到自监督学习启发,通过任务变换从数据与环境本身生成监督信号。框架构造带有隐藏环境变量和确定性规则的代理任务,使模型输出能够被自动、稳定地验证。该方法为开放式大模型自我改进提供了可扩展的奖励构造路径。
- 为缺少标准答案的开放式任务自动构造可验证奖励,降低人工标注和奖励模型依赖。
- 将自监督任务设计与强化学习结合,为 RLVR 扩展到通用任务提供新思路。
- 可用于研究大模型在持续训练和自我进化过程中的稳定反馈机制。
- 启发开发者利用环境隐藏变量与确定性规则设计低成本、抗投机的训练任务。
📝 原始笔记(逐字保留)
HarnessBank:面向 Agent-Harness 自进化的语义基因库
HarnessBank 通过语义基因库检索与门控验证,使 Agent 能够诊断失败、重写运行逻辑,并降低自我改进过程中的过拟合风险。
智能体 人工智能框架 经验检索 自进化 智能体工具 数据工程 模型评估 智能体技能库 强化学习 推理 模型训练 自蒸馏 演化评估 持续学习 智能体记忆 全栈演化
HarnessBank 面向 Agent-Harness 自进化,使智能体能够自主分析任务失败并修改自身运行逻辑。框架将可复用的改进经验组织为语义“基因库”,通过检索寻找与当前失败模式相关的候选方案。门控验证机制负责筛选和验证修改,避免局部成功的策略被直接固化。该设计旨在提升自我改进的泛化能力,从机制上缓解针对特定任务或样例的过拟合。
- 为可持续自我改进的智能体提供经验存储、检索与复用机制。
- 支持 Agent 自动诊断失败并重写 Harness,减少人工调试成本。
- 通过门控验证约束策略更新,提高自进化过程的可靠性与泛化能力。
- 可作为 HarnessEvolve 类研究中运行逻辑演化与验证闭环的参考框架。
📝 原始笔记(逐字保留)
Floatboat Harness五项基准超越Claude Opus 4.8
Floatboat宣称其Harness搭载低成本DeepSeek V4 Flash,在五项第三方基准中全面超过价格高出57.1倍的Claude Opus 4.8,表明智能体表现高度依赖运行底座。
Floatboat将文件管理器、编辑器和浏览器整合为Agent运行环境,并通过FloatIM和FloatSchedule支持跨主体任务交接与定时自主执行。其认为这些产品形态背后的核心并非界面创新,而是持续演进的Harness底座。8月7日公布的评测显示,搭载DeepSeek V4 Flash的Floatboat Harness在五项第三方基准中均超过Claude Opus 4.8等海外模型。完整评测报告见:https://floatboat.ai/news/harness-benchmark。
- 说明Agent能力不仅取决于基础模型,工具编排、上下文管理和任务执行机制同样关键。
- 为采用低成本模型配合高性能Harness降低智能体部署成本提供案例参考。
- 提示模型评测应同时披露运行底座、工具权限、上下文策略和成本,避免只比较模型名称。
- 可作为办公智能体、长程任务执行及Harness演化研究的产品化样本。
📝 原始笔记(逐字保留)
SkillOpt:冻结模型权重,优化智能体技能文档
微软联合上海交大、同济和复旦提出 SkillOpt,通过冻结目标模型并优化智能体使用的技能文档,在无需重新训练模型的情况下提升任务表现。
SkillOpt 将智能体执行任务时使用的技能文档视为可优化对象,而非直接调整模型参数。该方法冻结目标模型权重,通过修改模型遵循的规则和技能说明改善任务执行效果。其核心思路是把能力优化从参数空间转移到外部技能表示空间。这样可以降低重新训练模型的成本,并为智能体技能的持续迭代提供更轻量的路径。
- 为无法微调或训练成本较高的模型提供轻量级能力优化方案。
- 支持通过迭代技能文档持续改善智能体表现。
- 启发将提示、规则和操作流程等外部知识纳入自动优化对象。
📝 原始笔记(逐字保留)
持续学习赛道升温:Karpathy称仍需十年
尽管 Karpathy 判断成熟的持续学习能力可能还需十年,相关创业公司、模型架构与智能体自进化工具已密集涌现,持续学习正成为大模型研究和产业竞争的新焦点。
近期,围绕大模型持续学习的创业项目和研究成果密集出现,覆盖 LoRA、长上下文压缩、灾难性遗忘与多任务适配等方向。部分研究尝试将上下文知识写入模型权重,以突破 KV Cache 和固定上下文窗口的限制。另一些工作通过自动生成智能体训练任务、构建 Harness,让模型在交互中持续积累能力并实现自我进化。虽然 Karpathy 认为真正成熟的持续学习可能仍需十年,但该方向已成为研究界和产业界争相布局的重要赛道。
- 跟踪持续学习从学术概念走向模型架构、开发工具和创业产品的产业趋势。
- 关注权重更新、记忆机制、多任务适配和抗遗忘等关键技术路线。
- 为大模型长期运行、自我进化及低成本能力扩展提供研究选题参考。
📝 原始笔记(逐字保留)
EverMind以EverOS与EverMe推动AI自进化产品化
EverMind基于EverOS记忆架构推出C端产品EverMe,通过跨Agent的个人记忆管理与调用能力,让AI在持续使用中更懂用户。
人工智能应用 智能体 框架适配 自进化 智能体记忆 用户画像
EverMind试图解决模型更换Harness或运行环境后能力下降、经验难以延续的问题,将自进化能力从研究探索推向实际产品。其首个C端产品EverMe已上线内测,并非简单移植EverOS的开发者接口。EverMe提供轻量、直观的个人记忆汇集、查看、追溯与调用能力。用户还可将积累的记忆数据交给不同Agent服务,使个性化经验能够跨应用复用。
- 为跨Harness、跨Agent的长期记忆迁移与复用提供产品化思路。
- 通过持续积累用户记忆,增强AI服务的个性化与长期适应能力。
- 展示自进化系统从底层架构走向C端应用的可行路径。
📝 原始笔记(逐字保留)
哈萨比斯:数学 AI 的“第37手”只是时间问题
Demis Hassabis 以 AlphaGo 的“第37手”为喻,认为 AI 在数学领域产生突破性、超越人类直觉的成果只是时间问题。
文章援引 Demis Hassabis 的观点,讨论 AI 在数学研究中发现非直觉解法与新知识的潜力。“第37手”指向一种超出既有人类经验、但事后可被理解和验证的创造性突破。数学具有明确规则和可验证结果,是检验 AI 推理与创新能力的重要场域。相关进展也可能推动 AI 从辅助解题工具走向参与前沿科学发现。
- 关注数学推理作为衡量 AI 创造力和可靠推理能力的重要方向。
- 探索搜索、形式化验证与大模型推理结合的研究路线。
- 为评估 AI 是否能够产生超越训练数据的新颖发现提供案例框架。