过程评估 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 过程评估 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 世界模型 1 面向网页智能体的判别式世界模型 09-03 价值估计 1 错误但有用:多智能体消息的轨迹价值超越答案正确性 08-17 信用审计 1 无真值信用:基于执行回放审计 LLM 智能体的步骤级信用分配 08-21 发现能力评测 1 Apodex Discovery:面向真实发现任务的AI评测环境 08-18 响应对齐 1 PatternEval:混合思考多模态模型的响应行为对齐 08-24 基础设施评测 1 Φ-Bench:大模型基础设施工程能力评测 08-24 多模态推理 1 OCR-MetaReasoning:文本密集图像元推理评测基准 09-01 思维链审计 1 正确诊断,装饰性推理:医疗思维链扰动审计 08-26 搜索能力评测 1 TsuGO:以围棋死活题评测大模型推理搜索效率 08-16 智能体评测 2 EarlyEval:通过早期结果预测降低智能体评测成本 09-03 ATLAS:工业工具调用智能体的双时域诊断评测 09-01 模型评测 1 超越评分:解析 LLM-as-a-Judge 的摘要评估机制 09-02 灾害评测 1 EarthVerse:动态地球系统与自然灾害科学智能体基准 08-25 科研评测 1 ScienceArena:最新科学奥赛大模型评测基准 09-01 航空评测 1 AeroCopilotBench:交互式虚拟驾驶舱中的航空副驾驶智能体评测 08-18 规则评测 1 RuleWeaver:评测大模型规则中心场景推理 08-29 视觉推理 2 VGI-Bench:评测视频生成模型的视觉智能 08-28 VBVR-Pro:可扩展、可验证的原生视觉推理套件 08-27 计算评测 1 AtmosCoder-Bench:执行验证揭示环境科学计算中的隐性失败 08-20 过程评测 2 从原子能力到智能体:可解释评测 LLM 数学智能体能力 08-29 超越最终得分:长程 AI 研发智能体的系统评估 08-16