长程任务 LLM-DailyDigest 2026-08-07 2026-08-07 约 100 字 预计阅读 1 分钟 长程任务 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 三维重建 1 ABot-Recon:以局部上下文实现长时域流式三维重建 09-01 交互式评测 1 PlayWorld:智能体玩家驱动的长程世界模型评测基准 08-15 交互监督 1 AdaLens:长时智能体数据分析的交互式监控与引导 08-19 代码评测 1 Φ-Bench:大模型基础设施工程能力评测基准 09-01 元智能体编排 1 Eureka:面向科学发现的任务条件元代理编排 08-20 全模态生成 1 EchoWM:开放可进入的全模态世界模型 08-26 具身基础模型 3 MVP具身模型展示长程决策与跨本体协作能力 09-03 INDI:为视觉-语言-动作模型蒸馏行为意图 09-01 GigaBrain-0.7:三系统架构扩展具身基础模型 08-27 具身推理 1 R³:用强化学习训练机器人进行自然语言推理 08-27 具身规划 1 神经符号具身智能体:视觉探索与约束规划 08-18 动态审查 1 MCR-Bench:真实多轮代码审查动态基准 08-28 原生交互 1 ASIL:以结构化状态与语义动作取代截图点击 08-29 反思优化 1 SRPO:面向长程推理的自反思策略优化 08-25 叙事一致性 1 NCP-Bench:LLM 智能体交互叙事长程一致性评测 08-14 基础设施评测 1 Φ-Bench:大模型基础设施工程能力评测 08-24 多智能体协作框架 1 HiRS-Agent:面向长程遥感任务的分层多智能体系统 09-01 失控模式 1 Agent 失控的四类常见模式 08-20 工程进化 1 腾讯混元两项工作:Harness Handbook 与 RST 递归任务合成 08-20 情感诈骗 1 实证研究:AI在“杀猪盘”中比人类更易建立信任 08-18 技术生态 1 AI4AI 从自进化、元进化迈向递归自我改进 08-12 探索锐化 1 自进化时代需要兼顾锐化与探索的新型强化学习 08-27 插件架构 1 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 无限编辑 1 InfinityEdit:轻量适配器实现无限视频编辑 08-25 时域控制 1 LocalLSTC:本地 GUI 智能体的长短期控制架构 08-27 智能体安全 1 OpenART:通过开放式环境演化扩展智能体红队测试 08-14 智能体微调 1 Agentic ESOpt:低显存微调长时程 LLM 智能体 08-20 智能体框架 2 Harness-of-Harness:持续改进的多日自主软件开发框架 09-02 Prime Agent 开源自我改进智能体框架 08-11 智能体规模扩展 1 Apodex 1.1:面向复杂工作的智能体能力扩展 08-25 智能体评测 3 ClawBench:真实网站任务中前沿 AI Agent 最高成功率仅 33% 09-03 E-Commerce Bench:长程自主电商运营智能体评测 09-01 ATLAS:工业工具调用智能体的双时域诊断评测 09-01 架构研究综述 1 长程智能体综述:Harness 与模型协同优化 08-22 框架演化 2 Evo-Bench:首个 Agent Harness 进化能力评测 08-24 AIDE²:零权重更新实现一阶递归自我改进 08-12 模型发布 3 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 GLM-5.3:后训练 Scaling 提升编程与网络安全能力 08-14 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 模型评测 1 GLM-5.3 实测:750B 基座靠后训练提升编码与安全能力 08-21 模型量化评测 1 Seed-Evolving 量化策略研发与自迭代能力评测 08-14 游戏控制 1 GameWAM:面向电子游戏的世界动作模型 08-29 状态交接 1 AstronOS:面向长程智能体的统一执行模型与运行时 08-18 状态运行时 1 StateM:以状态化 Harness Scaling 提升长程智能体执行 08-19 环境协同演化 1 EnvHarness:让静态环境适应智能体学习 08-21 真实世界评测 1 真实工作场景中Agent成功率仍然偏低 08-18 科研平台 1 深势科技发布玻尔·科学空间,AI接管科研全流程 08-22 科研智能体 1 Intern-S2-Preview:科学智能体基础模型 08-15 科研项目 1 ScienceClaw AutoProject推动AI4S从Task走向Project 08-25 端侧记忆 1 MobileMem:从一年移动端经历中学习长期记忆 08-17 符号规划 1 PDDLCoder:智能体式 PDDL 生成辅助符号规划 08-18 策略优化 1 SAPO:面向智能体强化学习的单轨迹自回归策略优化 08-21 缩放定律 1 智谱唐杰:大模型只看参数的时代结束了 08-20 群体探索 1 SwarmResearch:编排 Coding Agents 实现开放式发现 08-14 脚手架优化 1 AutoDesign:面向长程智能体设计的元脚手架优化 08-15 自进化 1 浙大开源 HugAgentOS:三引擎驱动可控自进化 08-12 航空评测 1 AeroCopilotBench:交互式虚拟驾驶舱中的航空副驾驶智能体评测 08-18 记忆演化 1 Recuris:面向长程智能体脚手架的递归经验—工作记忆演化 08-26 论文生成 1 Spark-to-Paper:以可组合技能端到端生成研究论文 08-14 课程发布 1 斯坦福 CS329A:自改进 AI Agent 课程公开 08-26 课程学习研究综述 1 斯坦福新课 CS329A:Self-Improving AI Agents 08-21 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 轨迹可信度 1 超越可疑步骤:长程智能体的本体信任 08-19 迁移评测 1 SWE Refactor Bench:编码智能体的全仓长程栈迁移评测 08-25 过程信用分配 1 MileGPO:基于局部证据的长程智能体里程碑信用分配 08-21 过程评测 1 超越最终得分:长程 AI 研发智能体的系统评估 08-16 运行时恢复 1 AgentRewind:长程 LLM 智能体的可恢复执行 08-17 重构评测 1 SWE-Bench ProMax:大规模多语言代码重构智能体基准 08-12 长期记忆 4 ContextPilot:用细粒度强化学习实现主动上下文管理 09-01 Claude Chat与Cowork打通共享记忆 08-31 ReWorld:具备长时记忆的交互式世界模型 08-26 MemoraX Code:让 Coding Agent 拥有长期记忆 08-18 长程任务执行 2 阿里开源长程智能体框架 LongHorizon-Harness 08-13 OneDayAgent:面向自主智能体的长程执行框架 08-07 长程任务研究综述 1 长程智能体综述:Harness 工程与模型优化协同演化 08-14 长程任务评测 1 VibeLifeBench:评测生活智能体的主动性与持久性 08-13 长程智能体 1 英伟达 AVO 在 ARC-AGI-3 通关 183 关并获满分 08-23 长程科研 1 ScienceFlow:面向长程科研的自主智能体框架 08-17 高斯引导 1 Agent-G²:面向智能体强化学习的高斯引导 08-25 黑箱训练 1 ClawGym II:面向 Agent Harness 的黑箱强化学习 08-18