自我验证 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 自我验证 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 事实核查 1 ReflectFact:自反思智能体提升多跳事实核查 08-16 反思早停 1 EvoResearcher:免训练的推理时自我反思与成本约束早停 08-20 奖励建模 1 HSRM:用于测试时验证的隐藏状态奖励模型 09-01 奖励机制 1 RLSVR:面向开放式任务的自验证奖励框架 08-11 空间记忆 1 Spatial Memory Agent:基于经验程序记忆的空间智能 08-15 端侧框架 1 端侧专用 Harness:Qwen 3.8 27B 实现近零成本推理 08-30 经验进化 1 经验时代的自改进智能体:从自我进化到元进化综述 08-12 自我验证 1 LLM-as-a-Verifier:自验证让 DeepSeek V4 Flash 低成本反超闭源模型 08-21 视觉推理 1 LOCI:定位器-批评器视觉证据迭代框架 09-01 论文生成 1 Spark-to-Paper:以可组合技能端到端生成研究论文 08-14 评测审计 1 Phantom Gains:用实测零基线审计模型自我改进 08-21 课程学习研究综述 1 斯坦福新课 CS329A:Self-Improving AI Agents 08-21 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 长程任务执行 1 阿里开源长程智能体框架 LongHorizon-Harness 08-13