自进化 LLM-DailyDigest 2026-08-12 2026-08-12 约 100 字 预计阅读 1 分钟 自进化 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 三层框架 1 自进化(Self-evolving/RSI)三层框架与实践路径 08-30 上下文进化 1 ACE:无需微调的语言模型自我进化范式 12-31 严谨推理 1 Brain Researcher:以分析严谨性约束神经影像科研智能体 08-21 临床进化 1 MediSkill-Evo:过程约束的循证临床智能体自进化 08-25 产业知识图谱 1 RSI产业图谱:围绕智能进化速度的新竞赛 08-28 代码评审 1 LLM评审:面向IT自动化的无参考Bash代码验证与改进 06-16 做中学 1 MetaAgent:通过边做边学实现持续自我完善 12-31 元推理 1 当前模型缺乏推理过程的内在调节机制 12-31 元智能体 1 元代理:通过自我进化的代理元学习工具 08-04 元认知 2 MERA:通过推理-控制分离与 CSPO 实现元认知控制 12-31 元优化与元认知:从训练效率到模型自我反思 08-06 元进化 1 OpenMLE:单卡运行的 AI 自进化全栈系统 08-12 具身基础模型 1 MVP具身模型展示长程决策与跨本体协作能力 09-03 内在反馈 1 RLIF:利用模型内在置信度实现无外部监督的强化学习 12-31 内在奖励 1 Learning to Reason without External Rewards:无需外部奖励的推理学习 05-26 内生记忆 1 MemoraX以可学习记忆推动AI进入经验时代 08-22 前沿挑战 1 大模型强化学习的关键挑战与下一代范式 12-31 协同演化 4 J-Zero:零数据下挑战者、求解器与评判者统一协同进化 09-01 智能体系统协同演化:迈向超越人工设计的自主进化 08-13 清华 CPMöbius:Coach-Player 协作共演化实现自主出题训练 08-12 Socratic-Zero:以苏格拉底式教学推动智能体协同进化 12-31 变点检测 1 EvoTS-Agent:自进化金融时序变点检测智能体 08-19 合成强化 2 Synthetic Data RL:仅靠任务定义合成数据并强化学习 06-25 合成数据强化学习:任务定义即你所需 05-23 图形用户界面探索 1 ScreenExplorer:基于好奇心机制自主探索 GUI 的视觉语言智能体 06-28 多智能体系统 4 EvoX 蜂群智能体让 AI 自主寻找研究方向 09-03 蚂蚁 AWorld 以多智能体系统复现 DeepMind IMO 解题成果 07-24 Xolver:基于整体经验学习的多智能体推理框架 06-19 通过多智能体反思增强大语言模型推理 06-12 多源指令 1 Agent 的多源指令机制 12-31 多路径推理 1 华为提出思维森林:多路径推理破解大模型数学瓶颈 12-31 奖励机制 1 RLSVR:面向开放式任务的自验证奖励框架 08-11 学术搜索 1 百度“伐谋”自演化智能体:56分钟破解亿级特征组合搜索 08-14 安全审计 1 金融智能体自进化审计:能力增益、安全漂移与执行接口错配 08-19 工作流进化 1 具备自进化能力的智能体工作流系统 12-31 工具使用元学习 2 MetaAgent:通过元工具学习实现持续自我进化 12-31 MetaAgent:通过工具元学习实现自我进化智能体 08-01 弱点合成 1 SwS:LLM 推理强化学习中的自我感知弱点驱动问题合成 06-12 形式化证明 1 Goedel-Prover-V2:通过分阶段数据合成与自我纠正扩展形式定理证明 08-05 技术生态 1 AI4AI 从自进化、元进化迈向递归自我改进 08-12 技术趋势 2 持续学习赛道升温:Karpathy称仍需十年 08-11 AI学会自我进化:潜在的领域突破 07-27 技能优化 1 SkillOpt:冻结模型权重,优化智能体技能文档 08-11 技能压缩 2 SkillZip Pro:面向自进化智能体的执行感知技能动态压缩 09-01 SkillZip:无需评估的自进化智能体技能压缩 08-13 技能安全 1 Practice Makes Unsafe:自改进 LLM 智能体的技能误演化 08-16 技能演化 8 WikiSkill:将智能体经验编译为持久知识以持续演化技能 09-03 Warp 用双 Skill 构建 Claude 自我改进 Agent 09-01 JailbreakSkill:以可复用、持续进化技能扩展自动红队测试 08-18 VCE-Skill:利用版本变更经验增强技能自进化 08-18 SkillEvo:以多轮交互反馈持续演化智能体技能 08-16 Socratic-SWE:基于轨迹技能的自进化编程智能体 08-14 CODESKILL:编码智能体的自进化技能学习 08-14 清华推出 Ctx2Skill:通过多智能体自博弈实现 Skill 自主进化 08-12 技能自博弈 1 阿里 Skill-SP:以自进化技能库实现高质量自博弈 08-12 持续学习 2 持续学习向系统级适应的范式转型 08-07 GeRe:通过通用样本重放缓解大模型持续学习中的灾难性遗忘 08-06 持续适应 1 Macaron-V1:基于自我改进与 Mixture-of-LoRA 的开放持续学习 08-12 指标演化 1 EvalCEGAR:从盲点中自动演化评估指标 08-20 探索锐化 1 自进化时代需要兼顾锐化与探索的新型强化学习 08-27 推理优化 1 直接推理优化:LLM 自我奖励并完善开放式任务推理 06-18 推理范式 1 CMU 与斯坦福提出新型推理范式:让 LLM 自主发现抽象“窍门” 12-31 推理记忆 1 ReasoningBank:通过推理记忆扩展智能体自我进化 09-30 提示合成 1 PromptCoT 2.0:以 EM 循环合成高难度推理任务 12-31 插件架构 2 DeepSeek Cordis:面向自进化 Agent 的时空可组合框架 08-15 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 改进脆弱性 1 自改进智能体的脆弱性:方差、任务顺序与规格不足 08-20 数学推理 2 DeepMind FunSearch 发现目前最大的 Cap Set 12-31 仅靠提示词与自我验证,Gemini 2.5 Pro 达到 IMO 2025 金牌水平 07-21 数学研究 1 AIM:面向数学理论研究的自动化智能体 12-31 数据合成 1 DataFoundry:递归自改进的数据生产流程 09-02 数据自演化 1 BigBang-V1:35B 模型用自演化合成数据挑战万亿参数模型 08-07 无监督训练 1 MM-UPT:基于 GRPO 的多模态大模型无监督持续自我改进框架 05-28 智能体 1 EvoAgentX:具备自我进化能力的多智能体自动化系统 12-31 智能体框架 2 Prime Agent 开源自我改进智能体框架 08-11 Agent Zero:开源 AI 智能体框架 12-31 智能体研究综述 1 自进化智能体综述:迈向人工超级智能之路 07-28 智能体自进化 9 自进化智能体技术最新综述:迈向人工超级智能 12-31 EvoAgentX:支持自主进化的多智能体框架 12-31 Darwin Gödel Machine:通过开放式进化实现智能体自我改进 12-31 斯坦福 AgentFlow:智能体在交互中实时进化 10-14 SEAgent:从经验中自主学习的自进化计算机使用代理 08-06 SEA:面向计算机使用的自我进化代理 08-06 普林斯顿王梦迪团队综述:自我进化智能体的持续学习与适应 08-01 MetaAgent:无需参数更新的自我进化智能体范式 06-13 UI-Genie:面向移动端 GUI 智能体的自改进框架 05-28 智能体训练 2 L0:面向通用智能体的可扩展端到端强化学习训练系统 07-01 Agent-RLVR:通过指导与环境奖励训练软件工程智能体 06-16 机制学习 1 理解底层运行机制:从信息宇宙到可学习的潜在结构 10-20 架构发现 1 AI 架构发现呈现“科学发现的规模法则” 12-31 架构搜索 1 ASI-ARCH 自主发现 106 种线性注意力架构 12-31 架构研究综述 1 长程智能体综述:Harness 与模型协同优化 08-22 核心演化 1 Ouroboros:可自我演化的前沿编程智能体 08-12 框架演化 2 SHAPER:通过技能与执行框架演化实现具身智能体自进化 08-14 AIDE²:零权重更新实现一阶递归自我改进 08-12 概念研究综述 1 什么是 Self-evolving、Self-improving 与 RSI? 08-12 模型可靠性 1 自改进智能体的脆弱性:方差、任务顺序与规格不足 08-19 模型架构创新 1 ASI-ARCH:从神经架构搜索迈向自主架构创新 12-31 模型架构演进 1 模型架构发现的 AlphaGo 时刻:ASI-Arch 07-24 模型编辑 1 SMEdit:面向低数据场景的高效元学习模型编辑方法 12-31 模型量化评测 1 Seed-Evolving 量化策略研发与自迭代能力评测 08-14 模型验证 1 OpenAI以「通用验证器」推动GPT-5全领域能力提升 12-31 游戏生成 1 VibeGame:可试玩、自反思、自进化的多智能体游戏开发框架 09-01 演化失控 1 应用层 Agent 自我演化为何失败 08-29 演化能力评测 3 ASPIRE:模型能否从模糊目标中自我演化? 09-01 SEAGym:自我演化 LLM 智能体评估环境 08-07 GDPevo:真实业务任务上的智能体自我进化评测 08-07 物理适应 1 PACE-Bench:动态环境中的代码演化与物理适应评测 08-17 环境协同演化 1 EnvHarness:让静态环境适应智能体学习 08-21 知识发现 1 MetaAgent:自我进化智能体提升通用知识发现能力 12-31 研究方向 2 无需外部数据!AI自问自答实现推理能力进化 12-31 智能体的自主决策与递归自我改进 12-31 科学发现 1 DrSR:基于数据与经验双重推理的科学方程发现框架 06-23 科研平台 1 深势科技发布玻尔·科学空间,AI接管科研全流程 08-22 科研评测 1 MLS-Bench:140道真实任务检验AI方法创新能力 08-13 程序进化 4 AlphaEvolve 将矩阵乘法指数上界降至 2.371177 09-01 AlphaEvolve:谷歌让 AI 通过代码实现自我进化 12-31 AlphaEvolve:利用大语言模型实现程序自动进化 12-31 达尔文哥德尔机:开放式进化的自我改进智能体 05-29 空间记忆 1 Spatial Memory Agent:基于经验程序记忆的空间智能 08-15 算力进化 1 清昴智能以AI自进化打造国产万亿Token工厂 08-18 算法发现 1 AlphaEvolve:结合大语言模型与自动评估实现算法自我进化 12-31 经验学习 1 MemoHarness:从执行经验中学习的自适应智能体框架 08-07 经验授权 1 BCIT:自主后训练中的条件化经验迁移 08-29 经验进化 1 经验时代的自改进智能体:从自我进化到元进化综述 08-12 结构生长 1 SoftModel:可自主生长拓扑的持续在线学习模型 08-18 置信度评估 1 LLM 的置信度能否反映回答正确性? 12-31 脚手架优化 2 AutoDesign:面向长程智能体设计的元脚手架优化 08-15 自动优化 Agent Harness 的三条路径:Meta-Harness、AHE 与 Self-Harness 08-14 脚手架演化 5 AI4AI:强模型自动构建 Harness 向弱模型迁移能力 08-31 Harness 自进化全景:三种范式与六个系统 08-28 JIT-Agent:通过即时脚手演化扩展智能体能力 08-27 OpenClacky:用自然语言让 Agent 自我改造 08-24 DarwinX:通过自然选择演化智能体脚手架 08-15 自动化优化 1 面壁智能发布 ForgeStencil:自动研究与部署闭环 AI 系统 08-07 自动化科研 2 OpenAI Astra突破自动化科研基准,瞄准年底AGI 08-28 自我加速 AI 系统蓝图:开放框架、架构与认知轨迹 12-31 自博弈 6 SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」 12-31 零和博弈自对弈驱动模型自主学习推理 12-31 SPIRAL:通过多智能体多轮强化学习在零和博弈自博弈中激励推理 12-31 以游戏自对弈筛选可泛化思维链 12-31 SQLM:非对称自我博弈框架 12-31 SPIRAL:零和博弈自博弈激发可迁移推理能力 06-30 自我反思 1 MAPS:通过自动提示与多层自我反思增强大模型多步数学推理 07-01 自我奖励 1 一致的路径通向真理:面向LLM推理的自我奖励强化学习 06-12 自我学习 1 MIT SEAL:通过自生成数据与权重更新实现模型自我适应 12-31 自我批判 1 Double-Checker:通过自我批判微调增强慢思维大模型推理 06-27 自我提问 1 SQLM:无需外部数据的自我提问模型框架 12-31 自我改进 3 现代智能体自我改进:从模型更新到脚手架演化 08-20 哥德尔机:可证明的递归自我改进构想 12-31 多游戏联合训练促进自主智能体技能协同 08-05 自我确定 1 用 KL 散度衡量模型的「自我确定性」 12-31 自我纠错 1 PAG:以策略作为生成式验证器的多轮强化学习自我纠错 06-13 自我训练 1 CMU 提出自我奖励训练 SRT:大模型能否实现无标签自训练? 05-27 自演化数据合成 1 VISA:面向多模态指令遵循的智能体自演化数据合成 08-27 自蒸馏 2 LOPD:潜在同策略自蒸馏 08-16 无监督同策略自蒸馏 U-OPSD 08-12 自进化 18 逐篇盘点:自进化系统学到了什么,局限在哪里 09-03 DiagEvo:基于层次化错误记忆的诊断引导自进化 09-03 Zeva:具身模型通过上下文因果学习实现部署时自进化 09-02 Zeva:冻结参数实现具身上下文因果自进化 09-01 超越人类监督扩展大型推理模型:通往超级智能的路径 09-01 专访胡梦康:Agent 之后,下一站是 AI 自我进化 08-18 浙大开源 HugAgentOS:三引擎驱动可控自进化 08-12 Alita:可自主创造 MCP 工具的极简通用智能体 12-31 动态反馈推动智能体持续自我优化 12-31 Meta:智能体无需奖励或模仿,利用早期经验主动学习 10-11 上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench 07-02 阿里巴巴与上交等提出 Agent 自进化方法,Solver 性能提升 20.2 个百分点 06-30 ML-Agent:7B智能体仅用9个任务训练实现自主机器学习工程 06-23 ALITA:最小预定义+最大自进化的通用智能体 06-04 普林斯顿 Alita 开启通用智能体自主进化新范式 06-04 ALITA:以最少预定义和最大自我进化实现可扩展智能体推理 05-27 DeepMind 发布 AlphaEvolve,以进化算法广度探索解空间 05-14 多数投票驱动的推理模型迭代式自我训练 02-03 自进化框架 2 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 PenguinHarness:构建持续自我进化 Agent 的开源框架 08-07 自进化系统 1 Mobius:可自进化的开源 Agent OS 08-30 自进化闭环 4 EvoMap:以经验流转构建系统级 RSI 闭环 09-03 Agent 自进化飞轮:评测、记忆、落地与控制 08-26 AI4AI:AI训练、优化与评测AI的新范式 08-20 Zetta ζ:闭环物理智能体在线自进化 08-19 自适应 1 自适应语言模型(SEAL) 06-12 自适应防御 1 自进化多智能体框架防御 LLM 越狱攻击 08-27 行业动态 1 AI彻底不当人了?Anthropic这波“自我进化”骚操作,看得我人已麻 12-31 视频剪辑智能体 1 RefineCut:8B模型自我进化实现手机本地视频剪辑 08-30 认知推理 1 借鉴认知科学提升 AI 推理解释的真实性 12-31 记忆产品 1 EverMind以EverOS与EverMe推动AI自进化产品化 08-11 评测审计 1 Phantom Gains:用实测零基线审计模型自我改进 08-21 评测编排 1 HarnessEval:以可执行 Harness 重构 Benchmark 08-19 课程发布 1 斯坦福 CS329A:自改进 AI Agent 课程公开 08-26 课程学习 1 百个种子问题驱动的多智能体课程生成 12-31 资源研究综述 1 Awesome Self-Improving Agents:自改进智能体资源库 08-12 趋势预测 1 2026—2027年大模型行业两大里程碑 08-12 跨域经验迁移 1 Isaac 启发学习:跨域经验驱动大模型认知内生化 08-27 轨迹推断 1 SpaCellAgent:自进化多智能体自动完成单细胞轨迹推断 08-22 运行时防御 1 HARD:面向 LLM 智能体的自演化运行时防御 08-16 进化安全 1 Self-evolving Agents 并非总是良性:警惕智能体“错误进化”风险 12-31 进化建模 1 AI可高效建模由进化形成的复杂系统 12-31 进化搜索 1 LLM 引导的进化搜索:通向超级智能混合系统的新方向 12-31 进化研究综述 1 97页综述:现代 AI Agent 的自我进化体系 08-12 进化算法 1 谷歌将大语言模型引入进化算法,实现代码自我迭代 12-31 递归自我改进 2 综述:递归自我改进(RSI)的能力边界与关键瓶颈 08-13 Mendel Gödel Machine:比较进化驱动的编程智能体递归自改进 08-13 通用智能体 1 Agent Zero:可协作执行任务的通用个人助手 12-31 错误反思 1 LEMMA:用“错题本”反思学习提升大模型数学推理能力 06-19 闭环具身智能 1 Zetta:面向自我进化物理智能的高效闭环具身框架 08-21 顶级学术会议成果 1 小米 8 篇大模型与智能体论文入选 EMNLP 2026 08-29 题目生成 1 Ornith-1.5 自出题强化学习闭环,两月自测提升 11% 08-28