评估方差 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 评估方差 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 交互成本 1 上下文压缩会增加智能体的隐性交互成本 08-18 任务采样 1 Task-CoEvolve:自适应验证任务驱动的高效 Harness 优化 08-21 修辞敏感性 1 120篇 ICLR 投稿实测:修辞改写可显著影响 AI 审稿评分 08-27 历史回测 1 科学问题发现的历史回测协议与天文学试点 08-18 截尾偏差 1 截尾评分量表中的双重差分会制造虚假效应 08-28 探针效度 1 探针方向由提示词决定,而非模型属性 08-16 改进脆弱性 1 自改进智能体的脆弱性:方差、任务顺序与规格不足 08-20 模型可靠性 1 自改进智能体的脆弱性:方差、任务顺序与规格不足 08-19 脚手架优化 1 自动优化 Agent Harness 的三条路径:Meta-Harness、AHE 与 Self-Harness 08-14 评测复现 1 J-Space Skill 提升 DeepSeek V4 Pro 的评测争议 08-20 评测审计 3 LLM 智能体商业评测中的构念效度失效 09-02 SASST:面向交互式智能体的选择感知压力测试 09-01 Phantom Gains:用实测零基线审计模型自我改进 08-21 语言推理 1 IOL-AI Challenge:以语言学奥赛推进语言推理评测 08-19 跨模态一致性 1 语音与文本输入下多模态模型的跨模态不稳定性 08-28 迁移评测 1 商业 LLM API 迁移中的题项级能力回归测量 08-19 过程评测 1 超越最终得分:长程 AI 研发智能体的系统评估 08-16 量规评分 1 评分靠量规,而非模型智能 08-19 错误共识 1 分解 LLM 自洽投票中的错误共识:GPT-4.1 案例研究 08-20 锚定偏差 1 LLM裁判的锚定偏差:先前评分损害评估独立性 08-27 顺序一致性 1 同等排序质量为何导致不同决策:顺序一致 LLM 评分器 08-29