任务规划 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 任务规划 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 三维生成 1 WorldClaw:智能体驱动的大规模 3D 开放世界生成 08-07 三维重建 1 Lucida:可组合真实到模拟场景建模框架 09-02 世界模型 5 H3-World:以语言指令实现交互式世界控制 09-03 通用决策大模型 Decitron:开放世界推演与求解闭环 09-03 面向网页智能体的判别式世界模型 09-03 PEVA:基于全身动作条件的第一视角视频预测世界模型 07-02 让小说角色“活”起来:复旦 BookWorld 打造沉浸式小说世界模拟系统 06-25 元智能体编排 1 Eureka:面向科学发现的任务条件元代理编排 08-20 具身基础模型 1 Qwen-Drive-1.0:自动驾驶视觉语言基础模型 09-03 具身导航 1 Embodied-Navigator:定位、思考、记忆与对齐的高效具身导航 08-20 具身规划 2 神经符号具身智能体:视觉探索与约束规划 08-18 Embodied Planner-R1:通过强化学习释放 LLM 的具身任务规划能力 07-01 分层推理 1 HRM:无需预训练或 CoT 数据的分层推理模型 07-01 动作推理 1 Chain-of-Action:通过轨迹自回归实现动作推理的模仿学习新范式 07-18 协同规划 1 集体反事实规划:表征约束下的协调、同意与验证 08-19 协同驾驶 1 G-MARK:基于知识图谱的协同驾驶多智能体推理 08-21 博弈评测 1 Game Arena:以游戏评估 AI 的复杂推理与规划能力 08-07 原型推理 1 ProtoReasoning:以推理原型提升大模型跨领域泛化能力 06-23 反馈规划 2 KRCL:借鉴人类运动学习反馈的双向闭环规划机制 12-31 按需激活反馈接收的正向规划机制 12-31 可信推理 1 FLARE:基于逻辑辅助搜索的可信推理与探索方法 12-31 图像编辑 1 DARS:面向指令图像编辑的双层信用分配强化学习 08-21 基站部署 1 多智能体离策略深度强化学习优化智慧校园覆盖 08-20 多智能体系统 2 多智能体正在“燃烧”Token:Anthropic 公开研究系统构建经验 06-14 从辩论到均衡:基于贝叶斯纳什均衡的信念驱动多智能体 LLM 推理 06-12 多模态搜索 1 MMSearch-R1:激励大型多模态模型自主搜索 06-26 奖励模型评测 1 Agent-RewardBench:面向现实世界多模态智能体的统一奖励建模基准 06-27 学术搜索 1 百度“伐谋”自演化智能体:56分钟破解亿级特征组合搜索 08-14 实验设计 1 MDA:大模型与贝叶斯推断协同设计关键实验 08-15 并行路径规划 1 群组去中心化规划实现并行终身多智能体寻路 08-19 指标对齐 1 潜在世界模型的决策指标对齐与 MPC 规划诊断 08-21 推理扩展 1 五年前的“开放式推理”设想预见 OpenAI o1、o3 路线 08-15 搜索能力评测 1 TsuGO:以围棋死活题评测大模型推理搜索效率 08-16 敏捷软件开发 1 Scrum 敏捷项目管理方法 12-31 数据科学 1 AutoMind:用于自动化数据科学的自适应知识智能体 06-13 方法选型 1 按项目规模选择软件开发方法 12-31 智能体工作流 1 WebAgents 完成用户指令的三个核心过程 12-31 智能体框架 2 智能体式工件创建:系统、评估与设计原则综述 09-01 首个开源多模态 Deep Research 智能体,超越多个闭源方案 12-31 智能体网络 1 Agentic Web:由 AI 智能体驱动的下一代互联网生态 12-31 智能体自进化 5 EvoAgentX:支持自主进化的多智能体框架 12-31 斯坦福 AgentFlow:智能体在交互中实时进化 10-14 SEAgent:从经验中自主学习的自进化计算机使用代理 08-06 SEA:面向计算机使用的自我进化代理 08-06 MetaAgent:无需参数更新的自我进化智能体范式 06-13 智能体训练 1 L0:面向通用智能体的可扩展端到端强化学习训练系统 07-01 智能体评测 5 DroneCATS:评估多模态 LLM 的通用无人机控制能力 09-03 AI Agent 评测基准的“环境—能力”分类框架 12-31 AI Agent 评测的四大演进趋势 12-31 ALE-Bench:编程智能体跻身 NP 难题竞赛前 2% 06-18 TextAtari:使用语言智能体挑战10万步Atari游戏 06-05 模型发布 1 Gemini 2.5 Pro 稳定版全面可用 06-19 深度研究智能体 1 深度研究智能体重塑知识发现与问题解决范式 08-07 混合控制 1 LLM 常识推理驱动的自动驾驶多智能体编排 08-21 混合规划 1 融合神经与符号系统的混合规划器 12-31 游戏评测 1 LMGame-Bench:用经典游戏评测大模型感知、记忆与推理能力 07-02 状态管理 1 LongHorizon-Harness:以状态管理提升长程智能体执行 08-07 研究方向 1 智能体的自主决策与递归自我改进 12-31 神经符号人工智能 1 “神经-符号”融合规划器显著超越 o1 12-31 科研智能体 1 RPM 用研究偏好提升科研智能体算力分配效率 09-02 移动端评测 1 MobilePA-Bench:复杂真实移动任务规划智能体基准 08-26 符号规划 1 PDDLCoder:智能体式 PDDL 生成辅助符号规划 08-18 策略优化 1 学习式前沿选择的智能体逆生物合成框架 09-01 群体探索 1 SwarmResearch:编排 Coding Agents 实现开放式发现 08-14 能力提升 1 GPT-5 幻觉减少,空间推理与规划能力提升 12-31 脚手架 1 Opus 5借助极简Harness在ARC-AGI-3取得96.2%通关率 08-14 脚手架演化 1 JIT-Agent:按任务即时生成并演化智能体 Harness 09-02 自主智能体 1 月之暗面推出 Kimi-Researcher,自主 Agent 在“人类最后一场考试”取得 SOTA 06-23 自进化 3 上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench 07-02 ALITA:以最少预定义和最大自我进化实现可扩展智能体推理 05-27 DeepMind 发布 AlphaEvolve,以进化算法广度探索解空间 05-14 自适应想象 1 RISE:世界动作模型的自适应想象与选择性推演 08-26 航天控制 1 MIT研究:大语言模型自主操控飞船,Llama实现零失败率 07-03 规划差距 1 TraceML:人类与智能体的机器学习开发规划实证分析 08-27 规划评测 1 看似简单的规划问题也具计算挑战:倒计时游戏基准 08-04 规则规划 1 RuleMaze:多模态模型的规则约束视觉空间规划 08-21 视觉导航 1 VLN-R1:基于第一人称视觉的连续具身导航 06-26 视频剪辑智能体 1 RefineCut:8B模型自我进化实现手机本地视频剪辑 08-30 视频理解 1 微软推出长视频探索智能体 Deep Video Discovery 07-01 计算机控制 1 Cradle:赋能基础智能体实现通用计算机控制 07-18 语义编译 1 受限语义规划与确定性编译提升企业 Text-to-SQL 可靠性 08-18 谜题生成 1 GenEscape:分层多智能体生成密室逃脱谜题 06-27 过程评测 1 从原子能力到智能体:可解释评测 LLM 数学智能体能力 08-29 进化建模 1 AI可高效建模由进化形成的复杂系统 12-31 递归调用 1 循环语言模型提升组合式工具调用能力 08-21 逻辑推理 1 清华推出“AI数学家”:可自主调用定理并构建证明思路 06-04 逻辑生成 1 LAG:从笛卡尔视角出发的逻辑增强生成 12-31 长程任务执行 1 OneDayAgent:面向自主智能体的长程执行框架 08-07 长程任务研究综述 1 长程智能体综述:Harness 工程与模型优化协同演化 08-14 需求管理 1 根据需求稳定性选择开发模型 12-31 领域修复 1 开放权重模型实现纯 LLM PDDL 领域修复 08-19