执行验证 LLM-DailyDigest 2026-08-20 2026-08-20 约 100 字 预计阅读 1 分钟 执行验证 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 事故复盘 1 Claude安全降级失误,误删开发者700GB主目录 08-30 代码评测 1 Φ-Bench:大模型基础设施工程能力评测基准 09-01 任务生成 1 FACET:保留源意图与可执行状态的终端任务合成框架 08-20 合规性评测 1 ReguSim:评测金融 LLM 智能体的规则落地能力 08-21 多智能体系统 1 双层协调反思:多智能体 LLM 系统的博弈论方法 09-03 实验审计 1 超越代码执行:审计 LLM 科研实验的忠实性 08-29 工业控制代码 1 SemaPLC:项目级验证门控的 PLC 代码生成智能体框架 08-21 形式化验证 1 Specula 自动形式化验证:67 个开源系统发现 382 个深层 Bug 08-27 插件架构 1 DeepSeek Harness:全插件化 AI 编程 Agent 框架 08-21 智能体框架 3 Harness-of-Harness:持续改进的多日自主软件开发框架 09-02 智能体式工件创建:系统、评估与设计原则综述 09-01 Prime Agent 开源自我改进智能体框架 08-11 根因分析 1 OpsHarness:面向根因分析的自进化智能体外壳 08-27 模型发布 1 UI-Venus-2:跨移动端、Web 与桌面的通用 GUI 智能体 09-03 模型验证 1 以模型检验为预言机自动测试 LLM 事后解释器 09-01 流程合规 1 PolicyGuide:面向全工作流的智能体策略合规引导 08-22 物理重建 1 Code-as-World:从视频逆推可执行物理世界 08-29 环境协同演化 1 EnvHarness:让静态环境适应智能体学习 08-21 科学仿真 1 KI 为科学 Agent 注入可执行常识,仿真成功率升至 84% 08-28 科研智能体 1 OmniScientist:全模态跨学科 AI 科学家 08-16 移动端评测 1 MobilePA-Bench:复杂真实移动任务规划智能体基准 08-26 程序修复 1 WebWorld:以浏览器世界模型驱动 Web 代码自我改进 09-01 脚手架演化 1 Harness 自进化全景:三种范式与六个系统 08-28 自演化数据合成 1 VISA:面向多模态指令遵循的智能体自演化数据合成 08-27 计算评测 1 AtmosCoder-Bench:执行验证揭示环境科学计算中的隐性失败 08-20 记忆演化 1 Recuris:面向长程智能体脚手架的递归经验—工作记忆演化 08-26 轨迹审计 1 Trace Integrity:面向 LLM 数据智能体的可审计结构化推理 08-27 运行时授权 1 工具输出成为命令:分离动作诱导与运行时授权 08-28 递归自我改进 1 iCoder:AI 主导开发 27B 工业代码模型 09-02