过程验证 LLM-DailyDigest 2026-08-14 2026-08-14 约 100 字 预计阅读 1 分钟 过程验证 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 临床进化 1 MediSkill-Evo:过程约束的循证临床智能体自进化 08-25 信用分配 1 CrEST:面向多轮多步 LLM 智能体的验证器约束信用分配 08-16 分层验证 1 给验证器打分:LLM 推理验证自治等级 L0–L5 08-20 失控模式 1 Agent 失控的四类常见模式 08-20 形式化证明 2 AxiomProver用Lean 4完成“246定理”形式化验证 08-23 AI 辅助攻克森多夫猜想,陶哲轩推导出更强结果 08-16 形式化验证 1 Vero:智能体能否构建形式化验证的软件仓库 08-16 搜索能力评测 1 TsuGO:以围棋死活题评测大模型推理搜索效率 08-16 数字孪生 1 Twin:测试时数字孪生破解未知游戏 08-17 断言生成 1 NeuroAssertion:覆盖驱动的 RTL 断言生成与神经符号精炼 08-20 查询验证 1 TraceSQL:可追溯的无参考 Text-to-SQL 验证 08-19 测试驱动开发 1 TDD-Agent:测试驱动的代码生成推理 08-18 科研评测 1 AutoSciRub:先评估后改进的科研智能体自动准则归纳 09-01 纠错治理 1 调校随机机器:人机工程的系统运维模型 08-20 视觉推理 1 VBVR-Pro:可扩展、可验证的原生视觉推理套件 08-27 课程发布 1 斯坦福 CS329A:自改进 AI Agent 课程公开 08-26 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 轨迹审计 1 Trace Integrity:面向 LLM 数据智能体的可审计结构化推理 08-27 轨迹推断 1 SpaCellAgent:自进化多智能体自动完成单细胞轨迹推断 08-22 过程评测 1 LCoT-GV:基于图注意力网络的长思维链验证 09-01