闭环评估 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 闭环评估 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 世界模型 1 AutoWorldModel-Bench:自动化世界模型研究的状态中心基准 08-14 交互式评测 1 PlayWorld:智能体玩家驱动的长程世界模型评测基准 08-15 具身智能评测 1 DeepInsight II:从基准到真实机器人的统一评测轨迹 08-18 决策协商 1 BoardroomAI:基于演化决策图的人类可操控多智能体协商 08-16 技能演化 2 SkillEvo:以多轮交互反馈持续演化智能体技能 08-16 Socratic-SWE:基于轨迹技能的自进化编程智能体 08-14 游戏生成 1 Spellcaster:6个Agent协作生成、试玩并修复游戏 08-18 演化能力评测 1 ASPIRE:模型能否从模糊目标中自我演化? 09-01 脚手架优化 1 自动优化 Agent Harness 的三条路径:Meta-Harness、AHE 与 Self-Harness 08-14 脚手架学习 1 Harness 持续学习:超越模型参数的持续适应 08-20 自动化科研 1 最大规模AI自主科研测试:Fable 5断层领先 08-17 自动化维护 1 Claude自动维护应用:388个AI PR中180个获合并 08-15 自进化闭环 2 Agent 自进化飞轮:评测、记忆、落地与控制 08-26 AI4AI:AI训练、优化与评测AI的新范式 08-20 记忆诊断 1 D²ACCI:证据保留的智能体记忆双循环诊断协议 08-19 评测编排 1 HarnessEval:以可执行 Harness 重构 Benchmark 08-19 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 过程评测 1 超越最终得分:长程 AI 研发智能体的系统评估 08-16 递归自我改进 1 综述:递归自我改进(RSI)的能力边界与关键瓶颈 08-13