智能体 LLM-DailyDigest 2025-09-17 2025-09-17 约 100 字 预计阅读 0 分钟 相关消息(按子主题自动聚合) AI辅助编程 3 Super Library Agent:跨多代码库联合生成与维护应用 09-02 Gemini CLI 开源并免费提供 06-26 昆仑万维发布软件工程智能体模型 Skywork-SWE-32B 06-20 三层框架 1 自进化(Self-evolving/RSI)三层框架与实践路径 08-30 三维生成 1 WorldClaw:智能体驱动的大规模 3D 开放世界生成 08-07 上下文管理 1 Sculptor:通过主动上下文管理赋能 LLM 认知代理能力 08-07 上下文进化 1 ACE:无需微调的语言模型自我进化范式 12-31 世界模型 5 面向网页智能体的判别式世界模型 09-03 Code-as-World:智能体发现可执行世界表示以增强物理推理 09-01 AutoWorldModel-Bench:自动化世界模型研究的状态中心基准 08-14 谷歌 DeepMind 发布新一代通用世界模型 Genie 3 08-05 让小说角色“活”起来:复旦 BookWorld 打造沉浸式小说世界模拟系统 06-25 业务评测 1 Thinkingbox:有状态业务工作流智能体沙箱与基准 08-21 严谨推理 1 Brain Researcher:以分析严谨性约束神经影像科研智能体 08-21 临床进化 1 MediSkill-Evo:过程约束的循证临床智能体自进化 08-25 主动学习 1 ATGen:面向自然语言生成的主动文本生成框架 07-01 主动推理 1 从被动推理到主动推理:大型语言模型能否在不完整信息下提出正确问题? 06-12 事务执行 1 Agentic Transaction:面向 ACID 合规的智能体系统 08-19 事实核查 1 ReflectFact:自反思智能体提升多跳事实核查 08-16 云端智能体 1 Grok Bot以零配置云端多智能体打造“一人公司” 08-21 交互式评测 1 PlayWorld:智能体玩家驱动的长程世界模型评测基准 08-15 交互成本 1 上下文压缩会增加智能体的隐性交互成本 08-18 交互控制 1 OS-Kairos:以置信度机制避免 GUI 智能体“过度执行” 07-03 交互监督 1 AdaLens:长时智能体数据分析的交互式监控与引导 08-19 产品设计 1 对话 Claude Code 之父:模型越聪明,工作流越应简化 08-26 人工智能教育应用 1 超越自动化:苏格拉底式 AI 与编排式多智能体学习架构 08-07 代码世界模型 1 Code World Model:以编码代理充当世界大脑 08-28 代码仓库级技能 1 SkillForge:自蒸馏智能体学习项目知识以解决仓库问题 08-20 代码智能体 1 Reflection AI 发布代码理解智能体 Asimov 08-06 代码评审 1 LLM评审:面向IT自动化的无参考Bash代码验证与改进 06-16 代码评测 2 NatureBench:编程智能体能否复现论文中的 SOTA 08-12 微软发布 SWE-bench-Live:Agent 全自动搭建代码环境并实时更新评测 06-20 令牌消耗 1 智能体 token 用量已达人类 5.2 倍 08-26 任务生成 3 FACET:保留源意图与可执行状态的终端任务合成框架 08-20 AgentSynth:面向通用计算机使用智能体的可扩展任务生成 06-19 TaskCraft:自动生成代理式任务与执行轨迹 06-13 信息检索 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-27 信用分配 1 CrEST:面向多轮多步 LLM 智能体的验证器约束信用分配 08-16 信用审计 1 无真值信用:基于执行回放审计 LLM 智能体的步骤级信用分配 08-21 做中学 1 MetaAgent:通过边做边学实现持续自我完善 12-31 元智能体 1 元代理:通过自我进化的代理元学习工具 08-04 元进化 1 OpenMLE:单卡运行的 AI 自进化全栈系统 08-12 具身规划 1 Embodied Planner-R1:通过强化学习释放 LLM 的具身任务规划能力 07-01 内生记忆 1 MemoraX以可学习记忆推动AI进入经验时代 08-22 办公智能体 1 豆包工作正式发布:深度融合飞书的办公智能体 08-25 动作推理 1 Chain-of-Action:通过轨迹自回归实现动作推理的模仿学习新范式 07-18 动机推理 1 MotiveBench:大型语言模型距离类人动机推理还有多远? 06-18 协作博弈 1 推理腐蚀:推理语言模型成为公共产品博弈中的搭便车者 07-01 协同演化 2 智能体系统协同演化:迈向超越人工设计的自主进化 08-13 Socratic-Zero:以苏格拉底式教学推动智能体协同进化 12-31 博弈智能体 2 DipLLM:以少量数据微调大模型的外交博弈智能体框架 07-02 TextAtari:语言智能体仅用 10 万帧完成游戏学习 06-09 博弈评测 1 Board Game Arena:通过策略游戏评估大型语言模型的框架与基准 08-05 反馈协同演化 1 CAFE:搜索智能体与反馈批评器协同进化 08-26 变点检测 1 EvoTS-Agent:自进化金融时序变点检测智能体 08-19 叙事一致性 1 NCP-Bench:LLM 智能体交互叙事长程一致性评测 08-14 句子简化 1 句子简化的LLM:混合多智能体提示方法 06-16 图工程 1 Graph Engineering:从个体智能迈向多智能体系统智能 08-24 图形用户界面探索 1 ScreenExplorer:基于好奇心机制自主探索 GUI 的视觉语言智能体 06-28 图形用户界面纠错 1 GUI-Critic-R1:为GUI智能体操作加上“紧急刹车” 06-18 在线演化 1 Continual Harness:智能体脚手架的在线持续进化 08-25 基准分析 1 剖析 SWE-Bench 排行榜:基于 LLM 和智能体的软件修复系统提交者与架构分析 06-23 基础模型 1 华为发布盘古大模型 5.5 系列 06-23 基础模型评测 1 Floatboat Harness五项基准超越Claude Opus 4.8 08-11 复杂环境 1 智能体迈向复杂环境交互 12-31 多元推理 1 思想定理:面向溯因、演绎与归纳推理的多智能体框架 06-11 多智能体协作框架 2 蚂蚁集团开源多智能体协作基础设施 Avernet 08-11 昆仑万维 Skywork 发布分层多智能体协作框架 AgentOrchestra 07-17 多智能体协作风险 1 Anthropic揭示多智能体协作与冲突隐患 08-15 多智能体系统 7 Hermon Moment:AI 自我超越与人类叙事 09-01 蚂蚁 AWorld 以多智能体系统复现 DeepMind IMO 解题成果 07-24 许多 LLM 比一个更实用:多智能体协作中的道德判断 07-01 Xolver:基于整体经验学习的多智能体推理框架 06-19 多智能体正在“燃烧”Token:Anthropic 公开研究系统构建经验 06-14 通过多智能体反思增强大语言模型推理 06-12 从辩论到均衡:基于贝叶斯纳什均衡的信念驱动多智能体 LLM 推理 06-12 多模态搜索 1 MMSearch-R1:激励大型多模态模型自主搜索 06-26 多源指令 1 Agent 的多源指令机制 12-31 失控模式 1 Agent 失控的四类常见模式 08-20 奖励机制 1 强化学习奖励机制现状:验证、粒度与训练策略 12-31 奖励模型评测 1 Agent-RewardBench:面向现实世界多模态智能体的统一奖励建模基准 06-27 学术搜索 2 百度“伐谋”自演化智能体:56分钟破解亿级特征组合搜索 08-14 北大发布学术搜索评测 ScholarSearch:挑战主流 Deep Research 系统 06-27 学术海报 1 PosterAgent:一键将论文生成顶会级学术海报 06-04 学术论文 1 arXiv 论文 2508.05748 12-31 安全审计 1 金融智能体自进化审计:能力增益、安全漂移与执行接口错配 08-19 安全评测 1 AgentAuditor:让智能体安全评估器的精确度达到人类水平 06-28 实验设计 1 MDA:大模型与贝叶斯推断协同设计关键实验 08-15 对应审计 1 跨视图对应是一种测量干预:智能体评测与信用分配的双向验证 08-19 对话者建模 1 代理对代理心智理论:测试大语言模型的对话者意识 07-01 工业控制代码 1 SemaPLC:项目级验证门控的 PLC 代码生成智能体框架 08-21 工作流进化 1 具备自进化能力的智能体工作流系统 12-31 工具使用元学习 2 MetaAgent:通过元工具学习实现持续自我进化 12-31 MetaAgent:通过工具元学习实现自我进化智能体 08-01 工具使用训练 5 单策略强化学习超越树搜索的化学工具调用 09-01 MidTool:面向智能体工具使用的中期训练数据合成 08-21 Palmyra x6:基于锚定监督微调的企业级工具调用模型 08-18 ToolTrain:借助代码库检索工具提升大模型问题定位能力 12-31 MCP·RL:用强化学习训练智能体自主发现并调用工具 12-31 工具推理 1 大模型推理崩溃论战:从「思维错觉」到多重反驳 06-25 工具调用 2 多工具智能体的全自动推理轨迹生成与训练 12-31 DICE-BENCH:多轮多方对话中的大模型工具使用评估 06-28 工程架构 1 Kimi 前 CLI 负责人:模型越强,Harness 反而越厚 08-12 工程框架 1 Harness成为AI规模化落地新战场 08-23 开发评测 1 SWE-Dev:评估与训练自主特性驱动软件开发系统 05-16 开源框架 1 OpenAI开源Codex Harness智能体执行框架 08-21 开源社区 1 PhanthyMotus启动具身智能生态共建计划 08-25 强化学习 1 言语强化学习的兴起:自然语言反馈统一框架 09-02 形式化验证 1 Vero:智能体能否构建形式化验证的软件仓库 08-16 心智理论 1 Decrypto:多智能体推理与心智理论基准测试 06-26 思维链监测 1 CoT监测或成为控制AI智能体的核心方法 07-17 性能优化 1 ChatGPT长对话提速与Codex多智能体v2上线 08-16 恶意技能 1 MaliciousSkillBench:恶意智能体技能检测综合基准 08-21 情感诈骗 1 实证研究:AI在“杀猪盘”中比人类更易建立信任 08-18 执行评测 1 QuoteBench:同分掩盖的命令路径故障 08-16 技术生态 2 OpenClaw热潮退去,Agent竞争转向Harness 08-30 AI4AI 从自进化、元进化迈向递归自我改进 08-12 技术趋势 2 持续学习赛道升温:Karpathy称仍需十年 08-11 AI学会自我进化:潜在的领域突破 07-27 技能优化 1 SkillOpt:冻结模型权重,优化智能体技能文档 08-11 技能协同演化 1 FlowEvo:工作流与可执行技能协同进化的智能体 08-22 技能压缩 2 SkillZip:面向可扩展智能体技能库的契约保持图压缩 08-14 SkillZip:无需评估的自进化智能体技能压缩 08-13 技能安全 1 Practice Makes Unsafe:自改进 LLM 智能体的技能误演化 08-16 技能机制 1 智能体技能为何有效,又为何失效 08-20 技能演化 7 Warp 用双 Skill 构建 Claude 自我改进 Agent 09-01 PRACTICE:具身智能体从经验到专长的自进化 09-01 WikiSkill:将智能体经验编译为持久知识以推动技能演化 08-28 SkillForge:面向强化学习智能体的可验证技能演化 08-26 SkillEvo:以多轮交互反馈持续演化智能体技能 08-16 Socratic-SWE:基于轨迹技能的自进化编程智能体 08-14 CODESKILL:编码智能体的自进化技能学习 08-14 技能生成 2 SkillAlchemy:开放世界智能体技能创建 08-25 TRUSS:兼顾任务可靠与用户安全的智能体技能生成框架 08-19 技能迁移 1 拆解再传递:LLM 智能体的跨任务技能迁移 08-21 技能选择 1 LLM 智能体技能选择的双准则最优保证 08-21 拓扑蒸馏 1 DART-SD:面向钻石拓扑的多轮工具调用智能体自蒸馏 08-20 持续学习 1 JitRL:免梯度实现 LLM Agent 测试时持续学习 08-22 持续适应 1 Macaron-V1:基于自我改进与 Mixture-of-LoRA 的开放持续学习 08-12 接待智能体 1 硅星人推出 Demo Agent,让 Agent 自主完成项目自荐 08-21 推理安全 1 专有 LLM API 推理轨迹窃取攻击 08-12 推理扩展 1 五年前的“开放式推理”设想预见 OpenAI o1、o3 路线 08-15 推理效率 1 扩散语言模型让端侧 Agent 推理提速约 5 倍 09-02 推理记忆 1 ReasoningBank:通过推理记忆扩展智能体自我进化 09-30 提示优化 2 朴素提示优化:复杂 Prompt 搜索并非必要 08-28 提示词自动优化网站 06-11 提示注入评测 1 MobileWorldSafety:Android GUI 智能体环境注入安全基准 08-19 插件开发 1 用 GLM 5.3 开发 DeepSeek Harness 插件 08-16 插件架构 3 DeepSeek Harness:全插件化 AI 编程 Agent 框架 08-21 DeepSeek Cordis:面向自进化 Agent 的时空可组合框架 08-15 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 插件生态 1 DeepSeek Harness 插件生态爆发:长期记忆、多智能体与小游戏齐上阵 08-15 搜索推理 1 R-Search:通过多奖励强化学习与搜索增强大模型推理 06-09 搜索能力评测 2 结构检索中的表层形式偏差:从数学题到智能体轨迹 09-02 Mind2Web 2:基于 Agent-as-a-Judge 的智能体搜索评估 06-27 改进脆弱性 1 自改进智能体的脆弱性:方差、任务顺序与规格不足 08-20 数字孪生 1 Twin:测试时数字孪生破解未知游戏 08-17 数学推理 2 OpenAI IMO 金牌团队:模型拒答难题,长时推理面临评估瓶颈 12-31 AI Mathematician(AIM)框架探索前沿理论研究 12-31 数学研究 1 AIM:面向数学理论研究的自动化智能体 12-31 数据合成 2 RailGen:智能体引导的铁路小型异物生成与检测 09-01 什么是优质智能体数据?基于 ACE 视角的数据生成框架 08-28 数据科学 1 AutoMind:用于自动化数据科学的自适应知识智能体 06-13 数据自演化 1 BigBang-V1:35B 模型用自演化合成数据挑战万亿参数模型 08-07 数据规模扩展 1 Skywork-SWE:揭示大模型软件工程能力的数据缩放定律 06-25 文档交互 1 编码智能体如何发现、阅读与编写技术文档 08-21 文档处理 1 otto-SR:自动化与人机协作的系统综述工具 06-17 文献工具 1 Paper Burner X:开源 AI 文献阅读与翻译工作站 08-15 文献综述生成 1 SurveyForge:自动生成高质量学术综述的创新框架 06-13 智能体 3 EvoAgentX:具备自我进化能力的多智能体自动化系统 12-31 SWE-Dev:构建具备训练与推理扩展能力的软件工程智能体 06-07 SWE-Dev:通过训练与推理扩展构建软件工程智能体 06-07 智能体安全 1 OpenART:通过开放式环境演化扩展智能体红队测试 08-14 智能体工作流 1 WebAgents 完成用户指令的三个核心过程 12-31 智能体工具 1 Hugging Face推出MCP服务器,强化AI智能体生态 06-09 智能体应用 1 从 OpenClaw 迁移到 Hermes Agent:安装与自进化机制指南 08-25 智能体强化学习 1 Agent Lightning v1.0:面向脚手架式智能体强化学习 08-19 智能体微调 1 Agentic ESOpt:低显存微调长时程 LLM 智能体 08-20 智能体推理 1 Agentic-R1:7B小模型的逆袭,让LLM学会“见招拆招” 07-18 智能体框架 7 OpenClaw 2.0 发布:最大规模更新与 Agent Harness 赛道反思 09-02 OpenClaw 2.0 发布:全面升级通用 Agent 运行时 09-01 智能体式工件创建:系统、评估与设计原则综述 09-01 Prime Agent 开源自我改进智能体框架 08-11 腾讯 AI Lab 开源层次化智能体框架 Cognitive Kernel-Pro 12-31 首个开源多模态 Deep Research 智能体,超越多个闭源方案 12-31 Agent Zero:开源 AI 智能体框架 12-31 智能体生态 1 DeepSeek Harness 发布后,Agent 商业格局生变 08-20 智能体研究综述 1 自进化智能体综述:迈向人工超级智能之路 07-28 智能体网络 1 Agentic Web:由 AI 智能体驱动的下一代互联网生态 12-31 智能体自进化 9 自进化智能体技术最新综述:迈向人工超级智能 12-31 EvoAgentX:支持自主进化的多智能体框架 12-31 Darwin Gödel Machine:通过开放式进化实现智能体自我改进 12-31 斯坦福 AgentFlow:智能体在交互中实时进化 10-14 SEAgent:从经验中自主学习的自进化计算机使用代理 08-06 SEA:面向计算机使用的自我进化代理 08-06 普林斯顿王梦迪团队综述:自我进化智能体的持续学习与适应 08-01 MetaAgent:无需参数更新的自我进化智能体范式 06-13 UI-Genie:面向移动端 GUI 智能体的自改进框架 05-28 智能体规模扩展 1 Apodex 1.1:面向复杂工作的智能体能力扩展 08-25 智能体训练 3 上交大新范式:78条高质量样本胜过万条数据 09-28 L0:面向通用智能体的可扩展端到端强化学习训练系统 07-01 Agent-RLVR:通过指导与环境奖励训练软件工程智能体 06-16 智能体记忆 1 Memory+Agent:人大高瓴与华为诺亚构建大模型智能体记忆研究体系 08-08 智能体评测 15 E-Commerce Bench:长程自主电商运营智能体评测 09-01 BrowseComp-VL:面向跨模态研究任务的视觉语言评测基准 12-31 AI Agent 评测基准的“环境—能力”分类框架 12-31 AI Agent 评测的四大演进趋势 12-31 AI Agent 与传统聊天机器人的本质区别及科学评测方法 07-17 LLM 智能体与传统聊天机器人的本质区别及科学评测 07-03 RExBench:评估 LLM 智能体实现研究扩展的能力 07-01 ScienceBoard:面向真实科学工作流的多模态智能体评测环境 06-27 ALE-Bench:编程智能体跻身 NP 难题竞赛前 2% 06-18 DeepResearch Bench:深度研究智能体综合评测基准 06-16 基于LLM的人工智能代理评估的进化视角:全面综述 06-16 测量数据科学自动化:AI 助手与智能体评估工具综述 06-12 EconWebArena:现实 Web 环境中的经济任务自治智能体评测基准 06-12 面向未来的基准:预测智能体的 Pastcasting 基准 06-11 TextAtari:使用语言智能体挑战10万步Atari游戏 06-05 智能浏览器 1 首个 AI 原生浏览器 Dia 正式启动内测 06-15 智能评测 1 ACL 2025 Oral:Evaluation Agent,懂模型的智能评测搭子 07-18 机制发现 1 Mechanist:自主发现 AI 智能机制的科学智能体 08-14 机制研究综述 1 大语言模型智能体记忆机制综述 12-31 架构搜索 1 ASI-ARCH 自主发现 106 种线性注意力架构 12-31 架构研究综述 1 长程智能体综述:Harness 与模型协同优化 08-22 校园招聘面试 1 字节跳动 2027 校招重点 AI 岗位真题合集 08-26 核心演化 1 Ouroboros:可自我演化的前沿编程智能体 08-12 根因分析 1 OpsHarness:面向根因分析的自进化智能体外壳 08-27 框架修复 1 能力层模型:组合式智能体 Harness 修复与真实仓库压力测试 08-16 框架拆解 1 DeepSeek V4 Pro 与 Harness:后训练、缓存经济学及代理自进化 08-23 框架演化 2 SHAPER:通过技能与执行框架演化实现具身智能体自进化 08-14 AIDE²:零权重更新实现一阶递归自我改进 08-12 框架评测 1 DeepSeek + Pi:轻量 Harness 提升智能体成功率与缓存效率 08-16 桌面端应用 1 ChatGPT Linux 桌面版开放预览,集成 Work 与 Codex 08-15 检索智能体 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-28 概念研究综述 1 什么是 Self-evolving、Self-improving 与 RSI? 08-12 模型发布 8 UI-Venus-2:跨移动端、Web 与桌面的通用 GUI 智能体 09-03 Qwen3.8-27B开源:消费级显卡可运行“Opus级”Agent 08-16 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 GLM-5.3:后训练 Scaling 提升编程与网络安全能力 08-14 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 DeepSeek V4 Pro 正式版上线,主打 Agent 与 Coding 08-13 Kimi K3:开放前沿智能模型 08-07 Gemini 2.5 Pro 稳定版全面可用 06-19 模型可靠性 1 自改进智能体的脆弱性:方差、任务顺序与规格不足 08-19 模型架构创新 1 ASI-ARCH:从神经架构搜索迈向自主架构创新 12-31 模型架构演进 1 模型架构发现的 AlphaGo 时刻:ASI-Arch 07-24 模型路由 2 英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard 08-13 Router-R1:通过强化学习实现多轮大模型路由与聚合 06-12 模型量化 1 AQuA:递归自我改进的量化交易研究智能体 08-16 模型量化评测 1 Seed-Evolving 量化策略研发与自迭代能力评测 08-14 步骤归因 1 SkillShapley:智能体技能步骤的边界自适应 Shapley 归因 08-16 流程合规 1 PolicyGuide:面向全工作流的智能体策略合规引导 08-22 测试生成 1 CodeContests+:为竞技编程生成高质量测试用例 06-10 测试驱动开发 1 TDD-Agent:测试驱动的代码生成推理 08-18 浏览器 1 浏览器智能体 Fellou 2.0 发布 06-04 深度研究智能体 4 MiroMind 发布开放式深度研究系统 ODR 12-31 MiroMind ODR:开放深度研究全流程项目 12-31 WebWatcher:面向高难度多模态深度研究的智能体方案 12-31 深度研究智能体重塑知识发现与问题解决范式 08-07 游戏生成 2 VibeGame:可试玩、自反思、自进化的多智能体游戏开发框架 09-01 Spellcaster:6个Agent协作生成、试玩并修复游戏 08-18 演化失控 1 应用层 Agent 自我演化为何失败 08-29 演化能力评测 3 ASPIRE:模型能否从模糊目标中自我演化? 09-01 SEAGym:自我演化 LLM 智能体评估环境 08-07 GDPevo:真实业务任务上的智能体自我进化评测 08-07 灾害评测 1 EarthVerse:动态地球系统与自然灾害科学智能体基准 08-25 版本工作区 1 StagedWorkspace:面向知识工作智能体的版本化工作区 08-19 物理适应 1 PACE-Bench:动态环境中的代码演化与物理适应评测 08-17 状态交接 1 AstronOS:面向长程智能体的统一执行模型与运行时 08-18 状态管理 1 LongHorizon-Harness:以状态管理提升长程智能体执行 08-07 状态运行时 1 StateM:以状态化 Harness Scaling 提升长程智能体执行 08-19 环境协同演化 1 EnvHarness:让静态环境适应智能体学习 08-21 环境合成 1 AgentMercury:规模化合成可验证商业智能体环境 08-24 环境工程 1 Agentic Environment Engineering:智能体环境工程综述 09-01 环境自博弈 1 SPADE:自适应可执行环境中的自博弈 08-20 用量增长 1 智能体Token用量升至人类的5.2倍 08-25 真实世界评测 1 真实工作场景中Agent成功率仍然偏低 08-18 知识发现 1 MetaAgent:自我进化智能体提升通用知识发现能力 12-31 研究方向 1 智能体的自主决策与递归自我改进 12-31 社会仿真 1 LearnerAgent:使用 LLM 智能体模拟类人学习动态 08-07 科学仿真 1 KI 为科学 Agent 注入可执行常识,仿真成功率升至 84% 08-28 科学发现 1 DrSR:基于数据与经验双重推理的科学方程发现框架 06-23 科学数据 1 AutoSDT:面向开放科学智能体的数据驱动发现任务合成管道 06-12 科研复现 1 自动化 LLM 速通基准:评估 NanoGPT 改进复现能力 06-30 科研工作流编排 1 18个Agent自主科研:Kimi K3借Harness逼近Opus 5 08-21 科研工具 1 实测9款AI:Agent究竟如何改变PPT制作? 07-18 科研平台 2 深势科技发布玻尔·科学空间,AI贯通科研全流程 08-23 深势科技发布玻尔·科学空间,AI接管科研全流程 08-22 科研应用 1 AI4Research:人工智能赋能科学研究综述 07-02 科研智能体 6 OmniScientist:全模态跨学科 AI 科学家 08-16 浙大开源 AI 科研智能体 Polaris 08-16 Intern-S2-Preview:科学智能体基础模型 08-15 AIBuildAI Science Agent:4小时自主完成顶刊级模型研发 08-13 Kimi Researcher 12-31 MiroMind Open Deep Research 开放式深度研究系统 12-31 科研桌面 1 玻尔·科学空间发布:桌面端 AI 接管科研全流程“体力活” 08-22 科研评测基准 1 DeltaML-Bench:真实科研仓库中的机器学习智能体评测 08-21 程序修复 1 ExpeRepair:双重记忆驱动的仓库级缺陷修复系统 06-12 程序进化 3 AlphaEvolve:谷歌让 AI 通过代码实现自我进化 12-31 AlphaEvolve:利用大语言模型实现程序自动进化 12-31 达尔文哥德尔机:开放式进化的自我改进智能体 05-29 稳定性 1 比想象中更脆弱:工具集成型 LLM 智能体的稳定性研究 06-30 端侧框架 1 端侧专用 Harness:Qwen 3.8 27B 实现近零成本推理 08-30 符号规划 1 PDDLCoder:智能体式 PDDL 生成辅助符号规划 08-18 策略优化 3 学习式前沿选择的智能体逆生物合成框架 09-01 TASPO:协调过程监督与结果信用的智能体策略优化 09-01 SAPO:面向智能体强化学习的单轨迹自回归策略优化 08-21 策略发现 1 ATLAS:从智能体轨迹中发现可解释策略 08-17 策略固化 1 AI 后训练缺少什么:智能体策略重估能力的实证分析 08-20 算法发现 1 AlphaEvolve:结合大语言模型与自动评估实现算法自我进化 12-31 算法设计 1 AI4AI-Bench:评测 LLM 智能体的递归自改进算法设计能力 08-21 红队演化 1 RedEvoAgent:经验驱动技能演化的自动红队智能体 08-28 纵向记忆 1 LifeMem:用纵向生命轨迹缓解 LLM 智能体身份本质主义 08-22 经验学习 1 MemoHarness:从执行经验中学习的自适应智能体框架 08-07 经验进化 1 经验时代的自改进智能体:从自我进化到元进化综述 08-12 编程工具 1 Google Gemini CLI:终端中的开源 AI 智能体 12-31 网络智能体 1 WebAgents:SIGKDD 教程与 PPT 12-31 群体探索 1 SwarmResearch:编排 Coding Agents 实现开放式发现 08-14 联网工具 1 Agent-Reach:一句话部署智能体全网访问工具 08-23 脚手架 1 Opus 5借助极简Harness在ARC-AGI-3取得96.2%通关率 08-14 脚手架优化 3 AutoSaddler:基于执行轨迹的智能体脚手架自动优化 08-27 AutoDesign:面向长程智能体设计的元脚手架优化 08-15 自动优化 Agent Harness 的三条路径:Meta-Harness、AHE 与 Self-Harness 08-14 脚手架协同演化 1 TaoLive:让数字化身智能体与工具链共同进化 08-29 脚手架学习 1 Harness 持续学习:超越模型参数的持续适应 08-20 脚手架演化 9 JIT-Agent:按任务即时生成并演化智能体 Harness 09-02 Harness 自进化全景:三种范式与六个系统 08-28 HarnessLens:行为感知验证驱动的高效智能体脚手演化 08-28 JIT-Agent:通过即时脚手演化扩展智能体能力 08-27 Self-Harness 更新并开源:Agent 自主改进执行框架 08-26 StarHarness:以分层搜索演化企业智能体脚手架 08-26 OpenClacky:用自然语言让 Agent 自我改造 08-24 HSI:面向任务专属可进化智能体脚手架的层级自我改进 08-22 DarwinX:通过自然选择演化智能体脚手架 08-15 自主智能体 2 月之暗面推出 Kimi-Researcher,自主 Agent 在“人类最后一场考试”取得 SOTA 06-23 Kimi-Researcher:月之暗面最强自主 Agent 06-21 自动化优化 1 面壁智能发布 ForgeStencil:自动研究与部署闭环 AI 系统 08-07 自动化科研 3 OpenAI Astra突破自动化科研基准,瞄准年底AGI 08-28 最大规模AI自主科研测试:Fable 5断层领先 08-17 自我加速 AI 系统蓝图:开放框架、架构与认知轨迹 12-31 自动化维护 1 Claude自动维护应用:388个AI PR中180个获合并 08-15 自博弈 4 SSR:通过自博弈训练超智能软件智能体 08-14 SPIRAL:通过多智能体多轮强化学习在零和博弈自博弈中激励推理 12-31 SPIRAL 强化学习代码仓库 12-31 SPIRAL:零和博弈自博弈激发可迁移推理能力 06-30 自我改进 2 现代智能体自我改进:从模型更新到脚手架演化 08-20 多游戏联合训练促进自主智能体技能协同 08-05 自我验证 1 LLM-as-a-Verifier:自验证让 DeepSeek V4 Flash 低成本反超闭源模型 08-21 自演化数据合成 1 VISA:面向多模态指令遵循的智能体自演化数据合成 08-27 自蒸馏 2 DART-SD:面向多轮工具调用智能体的拓扑感知自蒸馏 09-01 LOPD:潜在同策略自蒸馏 08-16 自进化 13 逐篇盘点:自进化系统学到了什么,局限在哪里 09-03 专访胡梦康:Agent 之后,下一站是 AI 自我进化 08-18 浙大开源 HugAgentOS:三引擎驱动可控自进化 08-12 Alita:可自主创造 MCP 工具的极简通用智能体 12-31 动态反馈推动智能体持续自我优化 12-31 Meta:智能体无需奖励或模仿,利用早期经验主动学习 10-11 上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench 07-02 阿里巴巴与上交等提出 Agent 自进化方法,Solver 性能提升 20.2 个百分点 06-30 ML-Agent:7B智能体仅用9个任务训练实现自主机器学习工程 06-23 ALITA:最小预定义+最大自进化的通用智能体 06-04 普林斯顿 Alita 开启通用智能体自主进化新范式 06-04 ALITA:以最少预定义和最大自我进化实现可扩展智能体推理 05-27 DeepMind 发布 AlphaEvolve,以进化算法广度探索解空间 05-14 自进化框架 2 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 PenguinHarness:构建持续自我进化 Agent 的开源框架 08-07 自进化系统 1 Mobius:可自进化的开源 Agent OS 08-30 自进化闭环 1 EvoMap:以经验流转构建系统级 RSI 闭环 09-03 航天控制 1 MIT研究:大语言模型自主操控飞船,Llama实现零失败率 07-03 航空评测 1 AeroCopilotBench:交互式虚拟驾驶舱中的航空副驾驶智能体评测 08-18 蛋白质设计 1 Claude自主设计蛋白质结合剂,14个靶标实验命中 08-20 行业动态 1 AI彻底不当人了?Anthropic这波“自我进化”骚操作,看得我人已麻 12-31 规划差距 1 TraceML:人类与智能体的机器学习开发规划实证分析 08-27 视觉导航 1 VLN-R1:基于第一人称视觉的连续具身导航 06-26 视觉推理 1 LOCI:定位器-批评器视觉证据迭代框架 09-01 视频剪辑智能体 1 RefineCut:8B模型自我进化实现手机本地视频剪辑 08-30 视频理解 1 微软推出长视频探索智能体 Deep Video Discovery 07-01 解释评测 1 CHIVE:用反事实实验评估大模型行为解释 08-18 计算机控制 1 Cradle:赋能基础智能体实现通用计算机控制 07-18 认知工具 1 用认知工具在语言模型中激发推理 06-18 训练-推理对齐 1 LEGO-RL:面向编程智能体原生 Harness 的强化学习框架 08-19 记忆产品 1 EverMind以EverOS与EverMe推动AI自进化产品化 08-11 记忆演化 1 Recuris:面向长程智能体脚手架的递归经验—工作记忆演化 08-26 记忆能力评测 3 MemBench:全面评估基于 LLM 的智能体记忆能力 06-30 MemBench:面向大语言模型智能体记忆能力的综合评估 06-26 MemSim:用于评估大模型个人助理记忆能力的贝叶斯模拟器 09-30 记忆蒸馏 1 Agent Memory Distillation:用分层教师记忆增强小模型智能体 08-12 论文生成 1 Spark-to-Paper:以可组合技能端到端生成研究论文 08-14 论文索引 1 arXiv 论文 2503.23350(标题未提供) 12-31 设计创新 1 当 AI 设计 AI:创新还是模仿? 08-19 证据导航 1 AtlasNav:持久语料导航缓解智能体证据盲视 08-26 评测基准 1 剖析 SWE-Bench 排行榜:LLM 与智能体修复系统的提交者及架构画像 06-24 评测审计 2 LLM 智能体商业评测中的构念效度失效 09-02 MCP 智能体安全评测中的处理泄漏与构念效度 08-16 评测编排 1 HarnessEval:以可执行 Harness 重构 Benchmark 08-19 语义先验 1 Semantic Bandits:语义先验如何影响上下文探索与利用 08-18 语言反馈 1 可证明地从语言反馈中学习:HELiX 算法与理论框架 06-13 课程发布 1 斯坦福 CS329A:自改进 AI Agent 课程公开 08-26 课程学习 1 百个种子问题驱动的多智能体课程生成 12-31 课程学习研究综述 1 斯坦福新课 CS329A:Self-Improving AI Agents 08-21 谜题生成 1 GenEscape:分层多智能体生成密室逃脱谜题 06-27 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 资源图谱 1 LLM强化学习环境与开源训练框架资源图谱 12-31 资源研究综述 1 Awesome Self-Improving Agents:自改进智能体资源库 08-12 资源调度 1 Libra:Agentic RL 后训练动态资源管理系统 08-14 过程信用分配 1 MileGPO:基于局部证据的长程智能体里程碑信用分配 08-21 过程评测 1 超越最终得分:长程 AI 研发智能体的系统评估 08-16 运行时契约 1 面向可扩展、可管理智能体运行时的契约中心架构 08-28 运行时干预 1 COTA:小模型比较顾问实现智能体运行时干预 08-24 运行时恢复 1 AgentRewind:长程 LLM 智能体的可恢复执行 08-17 运行时防御 1 HARD:面向 LLM 智能体的自演化运行时防御 08-16 进化安全 1 Self-evolving Agents 并非总是良性:警惕智能体“错误进化”风险 12-31 进化研究综述 1 97页综述:现代 AI Agent 的自我进化体系 08-12 递归自我改进 4 iCoder:AI 主导开发 27B 工业代码模型 09-02 Meta^n:通过涌现深度实现递归自我改进 08-31 Meta^n:以涌现深度实现递归式自我改进 08-27 Mendel Gödel Machine:比较进化驱动的编程智能体递归自改进 08-13 递归调用 1 循环语言模型提升组合式工具调用能力 08-21 通用智能体 2 Agent Zero:可协作执行任务的通用个人助手 12-31 OpenAI 通用智能体 ChatGPT Agent 正式发布 07-18 逻辑推理 1 清华推出“AI数学家”:可自主调用定理并构建证明思路 06-04 部署测试 1 迈向无风险 AI 智能体部署:基于轨迹的测试与调试 08-18 配置供应 1 面向关键基础设施运维的任务感知 Harness 配置 08-19 长期记忆 2 Claude Chat与Cowork打通共享记忆 08-31 M+:以协同检索器扩展 MemoryLLM 的可扩展长期记忆 08-08 长程任务执行 2 阿里开源长程智能体框架 LongHorizon-Harness 08-13 OneDayAgent:面向自主智能体的长程执行框架 08-07 长程任务研究综述 1 长程智能体综述:Harness 工程与模型优化协同演化 08-14 长程任务评测 1 VibeLifeBench:评测生活智能体的主动性与持久性 08-13 长程智能体 1 英伟达 AVO 在 ARC-AGI-3 通关 183 关并获满分 08-23 长程科研 1 ScienceFlow:面向长程科研的自主智能体框架 08-17 问题定位 1 ToolTrain:面向代码问题定位的两阶段工具集成训练框架 12-31 验证器开发 1 AI 权威执行:从应用到芯片的机器验证 08-24 黑箱训练 1 ClawGym II:面向 Agent Harness 的黑箱强化学习 08-18