2026-08-07 科研追新
当日精选(由提交工具自动创建)。
PenguinHarness:构建持续自我进化 Agent 的开源框架
PenguinHarness 支持 Agent 构建新的 Agent,并驱动其持续进行自我评测与优化。
PenguinHarness 是一个面向持续进化 Agent 的开源 Harness 项目。它允许 Agent 自动构建其他 Agent,形成以智能体开发智能体的工作流程。构建出的 Agent 还可继续执行评测,并根据结果迭代优化自身。项目代码与主页均已公开。
- 用于搭建 Agent 自动构建、评测和优化的闭环流程。
- 为研究智能体自我改进与持续进化提供开源基础设施。
- 可用于探索减少人工干预的 Agent 开发和迭代范式。
面壁智能发布 ForgeStencil:自动研究与部署闭环 AI 系统
面壁智能联合 OpenBMB 开源 ForgeStencil,构建面向 Stencil 优化的“自动研究+自动部署”大闭环 AI 系统。
智能体工具 智能体 自进化 模型训练 SWE 软件工程 自动化部署 系统优化
ForgeStencil 是面壁智能基于 Forge Engineering 软件工程新范式研发的 AI 系统。该系统聚焦 Stencil 优化,将自动研究与自动部署串联为完整闭环。项目由面壁智能联合 OpenBMB 开源社区发布并开源,是其继 AI 编写的预训练框架 ForgeTrain 后的又一成果。ForgeStencil 也体现了面壁智能在 AI 智能自主进化方向上的进一步布局。
- 探索 AI 从优化方案研究到工程部署的端到端自主闭环。
- 降低 Stencil 性能优化对人工专家经验的依赖。
- 为可自主迭代的软件工程智能体和系统优化工具提供参考。
- 展示 Forge Engineering 范式在复杂工程任务中的应用潜力。
面壁智能发布 AI 编写的大模型预训练框架 ForgeTrain
面壁智能发布号称全球首个完全由 AI 编写的大模型预训练框架 ForgeTrain,其训练速度据称比英伟达 Megatron 快 10%。
面壁智能于今年 5 月底发布大模型预训练框架 ForgeTrain。该框架被称为全球首个完全由 AI 编写的同类框架,展示了 AI 参与复杂基础软件开发的潜力。官方称 ForgeTrain 的训练速度比英伟达 Megatron 快 10%,但具体测试环境、模型规模及评测方法尚未提供。
- 为大模型预训练基础设施提供新的高性能框架选择。
- 展示 AI 自动编写和优化复杂训练系统代码的可行性。
- 后续应重点核验其性能基准、硬件配置、稳定性及可复现性。
BigBang-V1:35B 模型用自演化合成数据挑战万亿参数模型
上交大等团队推出 BigBang-V1,通过 Generator、Critic 与 Meta-Critic 双层循环自主生成和验证训练任务,仅用约一万条 AI 合成数据显著提升 35B 模型的科研、检索和编程能力。
数据合成 模型开发 智能体 自进化 模型训练 任务生成 课程学习
- BigBang-V1 基于 Qwen3.6-35B-A3B 后训练,训练数据完全由 AI 合成,在 11 项评测中的 10 项超过基础模型。
- 内层 Generator–Critic 循环负责修改数据合成程序、生成并求解任务,同时检查工具调用、证据链、格式和答案可验证性。
- 外层 Meta-Critic 通过真实研究任务上的训练收益校准评价标准,避免把表面复杂但没有实际训练价值的数据误判为优质样本。
- 模型在 FrontierScience Research、Humanity’s Last Exam、BrowseComp 和 SWE-Bench Pro 等科研、长程检索及软件工程评测上获得明显提升,展示了数据管线与模型能力共同演化的潜力。
- 说明提升模型能力不必只依赖参数扩张,持续演化的高质量任务生产系统也可能成为新的规模化维度。
- 为可验证合成数据提供双层闭环范式:快速 Critic 筛选负责效率,真实下游训练收益负责最终校准。
- 可用于构建面向科研、编程和长程搜索的自动课程系统,让任务难度与领域分布随模型能力动态调整。
- 展示数据层递归自我改进的早期路径,为更完整的 AI 自主研发和 RSI 系统提供实践参考。
OneDayAgent:面向自主智能体的长程执行框架
OneDayAgent通过任务分解、执行记忆及交付物验证修复,提升自主智能体处理跨环境、多模态长程任务的可靠性。
OneDayAgent将开放式日常请求转化为受托管的执行流程,并拆分为边界明确的子任务。框架在上下文压力下维护执行记忆,以缓解目标漂移、状态丢失和上下文溢出等问题。它还会验证并修复最终交付物,从而形成覆盖规划、执行与验收的闭环。在包含104项任务的AgentIF-OneDay评测中,搭配GLM-5.2取得0.821的总分,并在三个模型家族的五种后端LLM上展现出无需调优的泛化能力。
- 为长程自主智能体提供统一的任务分解、记忆管理和结果验收框架。
- 说明智能体运行框架可在不针对后端模型调优的情况下实现跨模型迁移。
- 为研究不同LLM在相同工作流中的执行风格和失败模式提供评测基础。
- 可用于构建面向工作、学习和生活场景的可靠长任务代理系统。
SEAGym:自我演化 LLM 智能体评估环境
SEAGym通过覆盖训练、验证、测试、重放与成本记录的多视角评估,系统衡量LLM智能体更新的泛化能力、可靠性及长期收益。
智能体 人工智能框架 自进化 模型评估 演化评估 人工智能可靠性
SEAGym面向自我演化LLM智能体,评估提示、记忆、工具、中间件及模型—工具交互循环等智能体执行层更新。它将Harbor兼容基准转化为动态任务源,支持批量训练、冻结更新验证、ID/OOD迁移测试、重放诊断以及快照和成本记录。研究在Terminal-Bench 2.0与HLE上采用统一协议比较ACE、TF-GRPO和AHE。结果表明,频繁更新不一定改善长期性能,有效的中间快照可能在后续训练中崩溃,任务源多样性与模型后端也会影响智能体可靠性。
- 为自我演化智能体建立超越单次任务得分的多阶段评估协议。
- 识别更新过程中的过拟合、能力遗忘、性能崩溃和成本增长问题。
- 利用冻结验证、ID/OOD测试与重放诊断判断改进能否稳定复用和迁移。
- 为不同智能体演化算法提供统一、可复现的横向比较环境。
MemoHarness:从执行经验中学习的自适应智能体框架
MemoHarness 通过双层经验库持续总结执行案例,并动态调整智能体框架的六个控制维度,从而优于固定配置并迁移至未见任务与基础模型。
智能体 人工智能框架 系统优化 自进化 智能体记忆 经验检索 框架适配
- MemoHarness 将智能体框架拆分为上下文、工具、编排、记忆、解码和输出处理六个可编辑控制维度。
- 系统从自身执行中提取案例级诊断与全局模式,并将其保存在双层经验库中。
- 推理时,框架利用检索到的经验进行自适应调整,无需测试阶段标签、额外反馈或搜索。
- 在 Shell 智能体、代码生成和分析推理基准上,该方法优于固定框架,并展现出对未见任务套件和基础模型的选择性迁移能力。
- 为智能体框架从单一静态配置转向基于执行经验的持续自适应提供设计范式。
- 可用于自动优化上下文管理、工具选择、任务编排、记忆机制和输出处理策略。
- 双层经验库适合支持跨任务复用与经验缓存,有望在控制推理成本的同时提升泛化能力。
- 后续研究可进一步验证统计鲁棒性,并分析六个控制维度各自的性能贡献。
GDPevo:真实业务任务上的智能体自我进化评测
GDPevo 通过拆分并重组真实企业工作流中的原子业务规则,可归因地评估智能体利用训练经验完成保留业务任务的自我进化能力。
GDPevo 是面向真实经济活动的智能体自我进化基准,覆盖 CRM、ERP、金融、医疗、法律及数据密集型工作流。其“规则混合”机制将企业工作流拆分为原子业务规则,分别用于构造训练任务与规则重组后的保留测试任务,从而增强性能提升的可归因性。V1 包含 12 组共 120 个任务,自动化流水线可在两天内扩展为 24 组共 240 个任务的 V2,以降低数据污染风险。实验中,自我进化使四类智能体在保留测试集上的准确率最高提升 16.44 个百分点,但最佳结果仍显著低于 91.6% 的信息完备预言机上限。
- 为智能体自我进化提供贴近真实企业工作流且具有经济价值的评测环境。
- 利用训练与测试阶段的规则拆分和重组,判断性能提升是否真正来源于经验积累。
- 通过自动生成和快速扩展任务套件,缓解静态基准的数据污染问题。
- 揭示当前智能体持久化、复用经验及迁移业务规则的能力仍有较大提升空间。
LongHorizon-Harness:以状态管理提升长程智能体执行
LongHorizon-Harness 通过外置任务状态与独立环境审计,显著提升多种模型和代理框架在现实长程任务中的执行可靠性。
LongHorizon-Harness 将长程智能体执行重新表述为任务状态管理问题,避免不断膨胀的上下文和错误自我评估影响后续决策。框架采用管理—执行—审计(MEA)循环:管理器维护状态并选择子任务,执行器在全新上下文中操作,审计器依据环境中可独立验证的事实检查结果。轻量级 Agent Adapter 可连接不同模型与框架后端,无需修改其原生代理循环。该方法将 Qwen 3.7-Plus 在 WeaveBench、Terminal-Bench 2.1 和 OSWorld 2.0 上的成绩分别由 51.8%、69.7% 和 2.8% 提升至 80.7%、77.2% 和 8.3%,并在 OSWorld 子集上将 Claude Opus 4.7 的成绩由 20.0% 提升至 34.3%。
- 为长程智能体提供上下文之外的显式、可追踪任务状态,降低状态漂移风险。
- 通过只读审计和环境事实验证,阻断错误自我评估向后续步骤传播。
- MEA 循环可作为跨模型、跨框架的通用长程任务执行架构。
- Agent Adapter 的设计为现有智能体框架低成本接入可靠性增强机制提供参考。
Kimi K3:开放前沿智能模型
Kimi K3 是一款具备原生视觉与百万 Token 上下文的 2.8 万亿参数 MoE 模型,通过架构、训练及基础设施协同优化实现前沿级长程编码、智能体与推理能力。
多模态 强化学习 模型开发 智能体 系统优化 混合专家模型 长上下文
Kimi K3 总参数量为 2.8 万亿、每次激活 1040 亿参数,并支持原生视觉输入和 100 万 Token 上下文窗口。模型结合 Kimi Delta Attention、Attention Residuals 与 Stable Latent MoE,每个 Token 可从 896 个路由专家中有效激活 16 个,使扩展效率较 Kimi K2 提升约 2.5 倍。后训练覆盖通用、智能体及编码强化学习,并通过持久化 rollout、沙盒状态和系统协同设计支持百万 Token 级智能体训练与长时程执行。评测显示其在长程编码、智能体、知识、推理和视觉任务上达到前沿水平,完整模型权重将开放发布。
- 为研究超大规模稀疏 MoE、注意力架构及深层信息流动提供参考。
- 展示百万 Token 上下文与持久化沙盒状态结合的长程智能体强化学习方案。
- 为长时程编码、多模态推理和复杂智能体应用提供开放权重基础模型。
- 提供算法—系统协同设计及大规模专家并行训练、部署优化的工程经验。
持续学习向系统级适应的范式转型
论文以 When、How、Where 三轴框架梳理持续学习从参数更新走向覆盖训练、推理与外部组件的系统级适应。
经典持续学习主要依靠训练策略、架构设计和权重调整,实现知识的更新与保留。新兴范式进一步引入在策略学习、测试时训练,以及记忆、技能库和交互协议等外部组件,将能力演化扩展至静态参数之外。论文从学习发生的时间(When)、更新方式(How)和更新位置(Where)三个维度构建统一分析框架。作者据此梳理代表性方法,并讨论持续学习转向系统级适应所带来的挑战、影响与未来方向。
- 为持续学习、测试时适应和外部记忆等分散研究提供统一分类框架。
- 启发从单纯优化模型参数转向联合设计参数、记忆、工具与交互协议。
- 可用于定位现有方法的覆盖范围,并发现跨训练阶段和跨更新机制的研究空白。
WorldClaw:智能体驱动的大规模 3D 开放世界生成
WorldClaw 通过多智能体协作与由粗到细的生成流程,将开放式文本提示转化为全局连贯、局部丰富且资产可编辑的大规模 3D 世界。
多模态 人工智能应用 智能体 人工智能框架 任务规划 三维生成 场景建模
WorldClaw 是一个完全由智能体驱动的开放世界 3D 场景生成框架,规划智能体首先将文本提示转换为涵盖区域、地形、资产、材质和空间关系的结构化规范。系统结合语义布局、可复用资产、生成式或程序化材质以及区域感知高度场,构建具有全局一致性的地形基础。对于重点区域,框架会生成受地形约束的组合场景,重建可编辑的纹理网格,并恢复资产在地形中的放置位置。基于渲染的智能体随后优化地形、物体外观与接触关系,使最终场景兼具空间连贯性、局部细节和实例级可编辑性。
- 展示智能体规划、程序化生成与生成模型协同构建超大规模 3D 内容的可行路径。
- 结构化场景规范和实例级可编辑资产便于后续人工编辑、复用及交互式应用开发。
- 可用于游戏世界制作、具身智能仿真、虚拟环境构建和大规模合成数据生成。
- 由粗到细及区域感知的生成策略可为复杂长程任务中的分层规划与全局一致性维护提供参考。