模型评估 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 模型评估 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 一致性评测 1 ConsistencyChecker:基于树结构评估大模型泛化一致性 06-18 下游任务适配 1 为下游任务优化语言模型:训练后视角 06-27 专家智能 1 AAI 推动人工专家智能新路径 12-31 临床评测 1 LLM作为模糊评判:微调大模型用于临床评估 06-16 主动学习 1 ATGen:面向自然语言生成的主动文本生成框架 07-01 主动推理 1 从被动推理到主动推理:大型语言模型能否在不完整信息下提出正确问题? 06-12 事实一致性 1 AssertBench:评估大型语言模型自我断言能力的基准 06-16 事实核查 2 验证核验器:揭示事实核验系统的陷阱与潜力 06-18 验证验证者:揭示事实验证器的陷阱与潜力 06-18 交互式评测 1 PlayWorld:智能体玩家驱动的长程世界模型评测基准 08-15 交互控制 1 OS-Kairos:以置信度机制避免 GUI 智能体“过度执行” 07-03 人名识别评测 1 PUN:面向人物中心 LLM 评测的可信未知姓名 08-24 人工智能教育应用 1 超越自动化:苏格拉底式 AI 与编排式多智能体学习架构 08-07 人工监督 1 强化人工监督以验证 AI 推理 12-31 代码模型 4 后训练语言模型实现信息学竞赛金牌级表现 09-03 Claude Opus 4.1 发布,SWE-bench 成绩提升至 74.5% 08-05 蚂蚁开源代码模型实现 44% 自动修 Bug 解决率 06-28 Kimi-Dev 开源代码模型在 SWE-bench Verified 取得开源 SOTA 06-17 代码评审 1 LLM评审:面向IT自动化的无参考Bash代码验证与改进 06-16 代码评测 6 Φ-Bench:大模型基础设施工程能力评测基准 09-01 NatureBench:编程智能体能否复现论文中的 SOTA 08-12 OJBench:面向大语言模型的竞赛级代码评测基准 06-24 微软发布 SWE-bench-Live:Agent 全自动搭建代码环境并实时更新评测 06-20 LiveCodeBench Pro:奥赛级竞技编程基准揭示顶尖 LLM 的推理短板 06-19 人类最后的代码考试:高级大模型能否攻克最难编程竞赛? 06-18 价值权衡 1 你内心有许多狼:运用认知模型解读 LLM 中的价值权衡 06-25 任务生成 3 从 CNF 实例生成多样化可满足性逻辑推理问题 12-31 AgentSynth:面向通用计算机使用智能体的可扩展任务生成 06-19 TaskCraft:自动生成代理式任务与执行轨迹 06-13 元认知 4 评估与改进大语言模型的自我建模能力 09-01 SAGE-nano:通过逆向推理实现大模型元认知自我解释 06-30 推理模型如何识别无益想法并从中恢复? 06-13 大型语言模型具有内在元认知,但需要良好的评估透镜 06-12 公平性评测 1 LiveBench:具有挑战性且无污染的大语言模型基准 07-17 关系推理评测 1 RelArena-α、TabPFN-Rel 与 RPI:开放可复现的关系学习工具栈 08-19 具身智能评测 1 DeepInsight II:从基准到真实机器人的统一评测轨迹 08-18 决策说服 1 LLM 中理解与说服之间的细线 07-03 分层验证 1 给验证器打分:LLM 推理验证自治等级 L0–L5 08-20 分解粒度 1 VAT 判定中的 LLM 智能体分解粒度控制实验 08-25 创意写作 1 LitBench:可靠评估创意写作的基准与数据集 07-02 创造力评测 1 人类创造力的核心机制,AI 已开始掌握:IEI 分层评估框架 06-26 动态操控 1 Reflex:面向反应关键型操作的快速预测式 VLA 模型 08-17 动态评测 1 仇恨革命:静态基准没有告诉我们什么 12-31 动机推理 1 MotiveBench:大型语言模型距离类人动机推理还有多远? 06-18 医学影像分析 1 GPT-5医学影像推理与理解准确率超过人类专家 12-31 医疗AI评测 4 LLM评判器对AI临床笔记的遗漏盲区及改进方法 09-01 MedXpertQA:专家级医学知识与高级推理评估基准 12-31 VQA-RAD医学视觉问答测试集 12-31 USMLE:标准化医学能力评估基准 08-15 医疗人工智能 1 百川开源医疗推理模型 Baichuan-M2-32B,HealthBench 超越 GPT-OSS-120B 08-11 协作博弈 1 推理腐蚀:推理语言模型成为公共产品博弈中的搭便车者 07-01 协同演化 1 智能体系统协同演化:迈向超越人工设计的自主进化 08-13 博弈智能体 1 TextAtari:语言智能体仅用 10 万帧完成游戏学习 06-09 博弈评测 4 Game Arena:以游戏评估 AI 的复杂推理与规划能力 08-07 Grok 4夺得首届大模型国际象棋对抗赛冠军 08-07 Board Game Arena:通过策略游戏评估大型语言模型的框架与基准 08-05 谷歌首届大模型对抗赛:DeepSeek、Kimi 等模型同场博弈 08-04 反例推理 1 ICML 2025:首个反例驱动推理基准揭示大模型“刷题式假象” 10-23 叙事一致性 1 NCP-Bench:LLM 智能体交互叙事长程一致性评测 08-14 可信推理 1 ReliableMath:评估大模型数学推理可靠性的开源基准 07-17 可扩展推理 1 SLR:可扩展逻辑推理的自动化综合框架 06-23 可靠性认证 1 智能体行为契约 II:无独立性假设的组合可靠性认证 08-16 可靠性训练 1 基于可验证奖励训练接地大模型的经验总结 06-23 可验证奖励 1 具有可验证奖励的强化学习可隐式激励基础大模型正确推理 06-19 合规性评测 1 ReguSim:评测金融 LLM 智能体的规则落地能力 08-21 响应对齐 1 PatternEval:混合思考多模态模型的响应行为对齐 08-24 因果推理 2 揭示大型语言模型中的因果推理:现实还是海市蜃楼? 06-27 CLEAR-3K:评估语言模型的因果解释能力 06-24 图像评测 1 MMMG:面向文本到图像推理的大规模多学科多层级生成基准 06-13 图形用户界面纠错 1 GUI-Critic-R1:为GUI智能体操作加上“紧急刹车” 06-18 基准优化 1 量化 ASR 模型的基准优化行为 08-21 基准分析 1 剖析 SWE-Bench 排行榜:基于 LLM 和智能体的软件修复系统提交者与架构分析 06-23 基础模型评测 1 Floatboat Harness五项基准超越Claude Opus 4.8 08-11 增量评测 1 关系深度学习的增量评测与训练 08-16 复合推理 1 从原子证据到逻辑组合:复合答案选项的结构化推理 08-16 多智能体系统 2 许多 LLM 比一个更实用:多智能体协作中的道德判断 07-01 多智能体正在“燃烧”Token:Anthropic 公开研究系统构建经验 06-14 多样性评测 1 用多样性剖面评估 AI 生成内容 08-19 多模态学习 1 GLM-4.5V:视觉多模态能力达到开源 SOTA 12-31 多模态推理 3 OCR-MetaReasoning:文本密集图像元推理评测基准 09-01 CoRGI:以视觉证据验证思维链的多模态推理框架 08-05 GRPO-CARE:面向多模态推理的一致性感知强化学习 06-24 多模态证明 1 MATP-BENCH:多模态大模型能否成为自动定理证明器? 07-17 多轮验证 1 Gemini 2.5 Pro结合多轮验证框架系统拆解IMO解题方法 12-31 奖励建模 5 HSRM:用于测试时验证的隐藏状态奖励模型 09-01 Skywork-Reward-V2:通过人机协同扩展高质量偏好数据管理 07-02 通才奖励建模的推理时间缩放:SPCT 06-28 ReasonGRM:借助大型推理模型增强生成奖励模型 06-24 ReasonGRM:通过大型推理模型增强生成式奖励模型 06-23 奖励机制 1 强化学习奖励机制现状:验证、粒度与训练策略 12-31 奖励模型评测 3 Agent-RewardBench:面向现实世界多模态智能体的统一奖励建模基准 06-27 RewardBench 2:推进奖励模型评估 06-04 RewardBench 2:高级奖励模型评估 06-02 奖励黑客 1 让模型在思维链中明确解释奖励黑客行为 06-28 学习认知 1 揭开语言模型的学习心智:认知框架与实证研究 06-18 学术搜索 1 北大发布学术搜索评测 ScholarSearch:挑战主流 Deep Research 系统 06-27 安全审计 1 金融智能体自进化审计:能力增益、安全漂移与执行接口错配 08-19 安全评测 4 PRISK:评估大语言模型个性化的隐性成本 09-02 大模型越狱鲁棒性随运行状态显著波动 09-01 用户调用方式如何影响编程智能体的仓库投毒风险 09-01 AgentAuditor:让智能体安全评估器的精确度达到人类水平 06-28 对话者建模 1 代理对代理心智理论:测试大语言模型的对话者意识 07-01 工作流评测 1 FrontierChallenge:科学工作流完成度评测 08-28 工具推理 1 大模型推理崩溃论战:从「思维错觉」到多重反驳 06-25 工具调用 1 DICE-BENCH:多轮多方对话中的大模型工具使用评估 06-28 幻觉检测 2 SHROOM-Visions 2026:大视觉语言模型幻觉检测共享任务 08-27 HARP:通过推理子空间投影进行幻觉检测 09-15 幻觉评测 1 苹果再发论文:精准定位 LLM 幻觉,GPT-5、o3 仍难应对 12-31 开发评测 1 SWE-Dev:评估与训练自主特性驱动软件开发系统 05-16 开放式推理 1 PuzzleWorld:面向益智寻谜的多模态开放式推理基准 06-10 形式化证明 3 MATT-BENCH:多模态大模型能否成为优秀的自动定理证明器? 12-31 通过一阶逻辑定理证明提升大模型数学推理能力 06-24 MATP-BENCH:多模态大模型自动定理证明正确率仅约4% 06-18 形式化验证 2 Vero:智能体能否构建形式化验证的软件仓库 08-16 可验证自然语言到线性时间逻辑的转换:VLTL-Bench 基准与评估套件 07-01 心智理论 2 SoMi-ToM:评估具身社会互动中的多视角心智理论 06-29 Decrypto:多智能体推理与心智理论基准测试 06-26 忠实性验证 1 以因果验证机制检验 AI 推理忠实性 12-31 思维链 1 Bengio等质疑CoT忠实度:语言化步骤未必反映LLM真实推理 07-03 思维链监测 1 CoT监测或成为控制AI智能体的核心方法 07-17 恶意技能 1 MaliciousSkillBench:恶意智能体技能检测综合基准 08-21 意识表征 1 能否从大型语言模型内部状态中观察到“意识”?基于综合信息理论与 Span 表示的分析 07-01 执行评测 1 QuoteBench:同分掩盖的命令路径故障 08-16 技术生态 1 AI4AI 从自进化、元进化迈向递归自我改进 08-12 拒答评测 1 TRAPSBench:视觉语言模型能识别不确定性,却不会克制回答 08-16 指令数据合成 1 Infinity Instruct:扩展指令选择与合成以增强语言模型 06-16 指标演化 1 EvalCEGAR:从盲点中自动演化评估指标 08-20 探针效度 1 探针方向由提示词决定,而非模型属性 08-16 接待智能体 1 硅星人推出 Demo Agent,让 Agent 自主完成项目自荐 08-21 推理异常 1 GPT-oss 无提示生成问题并陷入数千次重复推理 12-31 推理归因 1 Thought Anchors:识别大模型推理中的关键步骤 06-25 推理扩展 1 推理时扩展的概率最优性:OptScale 动态确定最佳采样数 06-27 推理效率 2 思维令牌是帮助还是陷阱?迈向更高效的大型推理模型 07-01 Long-to-Short 是免费的午餐吗?研究大型推理模型的一致性与推理效率 06-25 推理研究综述 2 香港中文大学发布基础模型推理能力综述:方法、基准与未来方向 10-23 逻辑学研究中心联合发表大模型逻辑推理能力综述《思维机器》 10-15 推理训练 1 MERA 训练提升模型推理效率与准确性 08-06 推理记忆 1 ReasoningBank:通过推理记忆扩展智能体自我进化 09-30 推理评测 15 OneEval:面向多元化知识库的LLM知识密集型推理基准 12-31 FormulaOne:图结构动态规划评估集 12-31 Maximal-Cluster-Graph 难题中的动态规划推理链 12-31 不可解谜题暴露纯程序化推理评估的缺陷 12-31 组合深度并非可靠的推理复杂度指标 12-31 ICML 2025 新基准揭示 LLM 推理短板:高分或源于符号记忆 10-23 挑战 LLM 逻辑推理极限:新基准 TEXTGAMES 10-23 MMReason:面向 AGI 的开放式多模态多步骤推理基准 07-01 从思考到输出:推理语言模型中的思维链与文本生成特征 06-30 RE-IMAGINE:用于推理评估的符号化基准合成 06-23 大语言模型的“波将金式理解”:正确答案背后的推理不一致 06-21 IneqMath:29个大模型奥数级不等式证明成功率不足50% 06-20 苹果《思考的错觉》再遭质疑:Claude与人类共著论文指出三大测试缺陷 06-20 苹果《思考的错觉》再遭质疑:Claude 与人类共著论文指出三大关键缺陷 06-14 《思考幻觉》的幻觉:重新审视大模型推理能力崩溃 06-14 推理迁移 1 数学推理训练能否提升 LLM 的通用能力?推理能力的可转移性研究 07-01 提示格式 1 PromptResponse:优化 LLM 编程任务提示词 08-24 搜索能力评测 3 结构检索中的表层形式偏差:从数学题到智能体轨迹 09-02 TsuGO:以围棋死活题评测大模型推理搜索效率 08-16 Mind2Web 2:基于 Agent-as-a-Judge 的智能体搜索评估 06-27 故障诊断 1 FaulT-Bench:面向不可靠用户工单的网络故障排查智能体基准 08-29 效度审计 1 超越局部准确率:LLM 推理评测的协议级可识别性审计 08-16 效率评测 1 我们离最佳推理效率还有多远? 06-11 敏感性分析 1 基于交互作用评估与解释 LLM 提示敏感性 08-20 数值推理 1 大语言模型数值能力:根本局限与改进路径 08-16 数学推理 4 OpenAI IMO 金牌团队:模型拒答难题,长时推理面临评估瓶颈 12-31 大语言模型的数学推理:代码合成、证明生成与逻辑状态 08-05 仅靠提示词与自我验证,Gemini 2.5 Pro 达到 IMO 2025 金牌水平 07-21 数学推理大型语言模型研究综述 06-10 数学研究 1 AIM:面向数学理论研究的自动化智能体 12-31 数学评测 1 超越黄金标准:用于形式数学推理评估的LLM法官认识论集成 06-13 数据合成 1 SWE-Flow:以测试驱动方式合成软件工程数据 12-31 数据泄露 1 真相大白!RL不是魔法,随机奖励有效只是由于数据泄露 07-18 数据规模扩展 1 Skywork-SWE:揭示大模型软件工程能力的数据缩放定律 06-25 数据集构建 1 Skywork-SWE:SWE-Dev 可验证软件开发数据集构建流程 08-06 数理语言 1 使用多语言数字谜题研究语言模型中语言与数学推理的相互作用 06-19 文本增强 1 PromptAug:使用数据增强进行精细冲突分类 07-01 文本评测 1 面向决策的文本评估 07-03 智能体 1 SWE-Dev:通过训练与推理扩展构建软件工程智能体 06-07 智能体安全 1 OpenART:通过开放式环境演化扩展智能体红队测试 08-14 智能体框架 3 智能体式工件创建:系统、评估与设计原则综述 09-01 Prime Agent 开源自我改进智能体框架 08-11 腾讯 AI Lab 开源层次化智能体框架 Cognitive Kernel-Pro 12-31 智能体自进化 2 Darwin Gödel Machine:通过开放式进化实现智能体自我改进 12-31 普林斯顿王梦迪团队综述:自我进化智能体的持续学习与适应 08-01 智能体记忆 1 Memory+Agent:人大高瓴与华为诺亚构建大模型智能体记忆研究体系 08-08 智能体评测 19 EarlyEval:通过早期结果预测降低智能体评测成本 09-03 PTA-IRT:基于执行轨迹的高效 SWE 智能体评测 09-02 CordisBench:动态智能体脚手架的组件生命周期推理评测 09-02 BAITBENCH:评测机器学习智能体的奖励作弊行为 09-01 SwarmBench:评测大模型的智能体集群编排能力 09-01 BrowseComp-VL:面向跨模态研究任务的视觉语言评测基准 12-31 AI Agent 评测基准的“环境—能力”分类框架 12-31 AI Agent 评测的四大演进趋势 12-31 AI Agent 与传统聊天机器人的本质区别及科学评测方法 07-17 LLM 智能体与传统聊天机器人的本质区别及科学评测 07-03 RExBench:评估 LLM 智能体实现研究扩展的能力 07-01 ScienceBoard:面向真实科学工作流的多模态智能体评测环境 06-27 ALE-Bench:编程智能体跻身 NP 难题竞赛前 2% 06-18 DeepResearch Bench:深度研究智能体综合评测基准 06-16 基于LLM的人工智能代理评估的进化视角:全面综述 06-16 测量数据科学自动化:AI 助手与智能体评估工具综述 06-12 EconWebArena:现实 Web 环境中的经济任务自治智能体评测基准 06-12 面向未来的基准:预测智能体的 Pastcasting 基准 06-11 TextAtari:使用语言智能体挑战10万步Atari游戏 06-05 智能眼镜 1 从观察到行动:智能眼镜迈向第一人称智能平台 08-27 智能评测 1 ACL 2025 Oral:Evaluation Agent,懂模型的智能评测搭子 07-18 框架修复 1 能力层模型:组合式智能体 Harness 修复与真实仓库压力测试 08-16 框架演化 1 AIDE²:零权重更新实现一阶递归自我改进 08-12 框架评测 1 DeepSeek + Pi:轻量 Harness 提升智能体成功率与缓存效率 08-16 检索停止 1 多轮 RAG 何时停止:Search-R1 的结构化停止判断 08-16 概率推理 1 不完全是夏洛克·福尔摩斯:语言模型无法可靠区分不可能与不太可能的事件 06-11 模型可靠性 1 多组件系统的整体成功率会快速下降 12-31 模型安全 1 思想犯罪:推理模型中的后门与涌现失调 06-18 模型对抗 2 Grok 4晋级大模型对抗赛决赛,Gemini全军覆没 12-31 o3 以 4:0 横扫 Grok 4,夺得首届大模型对抗赛冠军 12-31 模型微调 1 在不损害能力的前提下精简大语言模型 06-13 模型训练 1 从生产流量到后训练:构建覆盖企业请求的自托管 LLM 09-02 模型评测 14 增量池化 LLM 评测:低成本选择检索模型 09-03 表格基础模型懂物理吗?数据污染、单位与确定性极限 09-03 超越评分:解析 LLM-as-a-Judge 的摘要评估机制 09-02 错误预测中的正确证据:修复 LLM 序列评分坍塌 09-01 dots.vlm1在多项多模态任务中表现突出 12-31 实测蚂蚁万亿参数思考模型 Ring-1T:对比 DeepSeek V3.2 12-31 GPT-5 首波实测:SimpleBench 超越人类平均水平 12-31 最强 Gemini 2.5 Pro 逻辑推理评测仅得 60 分 10-23 GLM-4.5 逻辑能力评测:推理模式显著降低幻觉与计算误差 07-26 Kimi-2 上线 LiveBench AI,评测超越 GPT-4.1 07-17 SuperCLUE推理榜惊现黑马:中兴AI模型表现亮眼 07-02 心理语言学词特征:评估 LLM 与人类一致性的新方法 07-01 OpenAI 发布 o3-pro,引入严格的“4/4 可靠性”评估 06-11 大型语言模型在框架与符号落地问题上的零样本评估基准 06-11 模型路由 1 LLMRouter:统一大模型路由开发、评估与部署框架 08-15 模型选型 1 LensLLM:以低成本预测微调表现的LLM选型框架 06-19 模型量化评测 1 Seed-Evolving 量化策略研发与自迭代能力评测 08-14 模型验证 5 以模型检验为预言机自动测试 LLM 事后解释器 09-01 Binoculars:机器生成文本检测器 12-31 OpenAI以「通用验证器」推动GPT-5全领域能力提升 12-31 CompassVerifier:跨领域验证 LLM 输出的轻量级模型 12-31 CompassVerifier:统一支持 LLM 评估与结果奖励的鲁棒验证器 08-06 步骤归因 1 SkillShapley:智能体技能步骤的边界自适应 Shapley 归因 08-16 泛化迁移 1 打破领域障碍:强化后训练的推理收益能否迁移到未见领域? 06-25 测试生成 1 CodeContests+:为竞技编程生成高质量测试用例 06-10 涌现能力 1 大型语言模型与涌现:复杂系统视角 06-16 游戏评测 1 LMGame-Bench:用经典游戏评测大模型感知、记忆与推理能力 07-02 演化能力评测 4 ASPIRE:模型能否从模糊目标中自我演化? 09-01 S3Gym:LLM 能否通过自测试与自评判实现自我改进 09-01 SEAGym:自我演化 LLM 智能体评估环境 08-07 GDPevo:真实业务任务上的智能体自我进化评测 08-07 潜空间推理 1 BDH-CQ:基于循环潜在推理的上下文学习 08-12 状态追踪 1 StateMemBench:智能体记忆能否追踪演化状态? 08-22 理解能力评测 1 大型语言模型中的波将金式理解 06-27 理论评测 1 Courcelle 算法元定理保证一类问题的可解性 08-15 生成式评测 1 双模型生成与评判机制 12-31 真值表征 1 探索真理的几何学:LLM 真值方向在逻辑变换与问答任务中的一致性和泛化性 06-04 真实世界评测 1 真实工作场景中Agent成功率仍然偏低 08-18 知识发现 1 MetaAgent:自我进化智能体提升通用知识发现能力 12-31 知识推理 1 OneEval:面向多样化知识库的大模型知识密集型推理评测 06-18 社会仿真 1 LearnerAgent:使用 LLM 智能体模拟类人学习动态 08-07 神经符号人工智能 1 大型语言模型模仿逻辑推理,但代价是什么? 09-16 科学数据 1 上海创智学院与上海交通大学发布科学推理数据集 MegaScience 12-31 科学检索增强生成 1 ScIRGen:为科学研究合成真实的大规模 RAG 数据集 06-16 科学编程 1 SWE-bench Science:科学软件工程中的编码智能体评测 08-21 科研复现 1 自动化 LLM 速通基准:评估 NanoGPT 改进复现能力 06-30 科研工具 1 实测9款AI:Agent究竟如何改变PPT制作? 07-18 科研智能体 2 RPM 用研究偏好提升科研智能体算力分配效率 09-02 AIBuildAI Science Agent:4小时自主完成顶刊级模型研发 08-13 科研评测 7 SCILAWS-BENCH:评测 LLM 在真实与平行世界中发现科学定律 09-02 ScienceArena:最新科学奥赛大模型评测基准 09-01 ASI-Bench:评测 AI 自主科研与创新探索能力 08-20 MLS-Bench:140道真实任务检验AI方法创新能力 08-13 SciArena:面向科学文献任务的开放式基础模型评估平台 07-02 构思与执行差距:LLM 与人类研究理念的执行结果比较 06-27 科学家的第一次考试:通过感知、理解与推理评测多模态大模型的科学认知能力 06-13 程序进化 1 达尔文哥德尔机:开放式进化的自我改进智能体 05-29 稳定性 1 比想象中更脆弱:工具集成型 LLM 智能体的稳定性研究 06-30 空间推理 1 密室逃脱成 AI 新考场:通关率不足 50%,暴露空间推理短板 07-17 空间认知 1 MindCube:从有限视图构建空间心智模型 06-27 答案聚合 1 表示一致性:聚合准确且连贯的 LLM 候选答案 06-30 答案验证 1 CompassVerifier:面向多领域答案评估与奖励的轻量级验证模型 12-31 策略归纳 1 StrategyBench:评测大模型显式策略归纳能力 08-25 算法比较 1 DPO 与 GRPO 在自回归图像生成中的系统性对比 06-20 算法设计 1 AI4AI-Bench:评测 LLM 智能体的递归自改进算法设计能力 08-21 组合推理 1 Ineq-Comp:不等式自动定理证明中的人类直觉组合推理基准 12-31 经验进化 1 经验时代的自改进智能体:从自我进化到元进化综述 08-12 缩放定律 1 能力显著性向量:面向下游任务缩放定律的损失—能力细粒度对齐 06-18 置信度评估 1 LLM 的置信度能否反映回答正确性? 12-31 能力评测基准 1 FormulaOne 基准令 GPT-5、o3 Pro 等前沿模型集体零分 12-31 能力迁移 1 不同游戏训练会形成专门化认知能力 12-31 脚手架 1 Opus 5借助极简Harness在ARC-AGI-3取得96.2%通关率 08-14 脚手架优化 1 AutoDesign:面向长程智能体设计的元脚手架优化 08-15 脚手架演化 1 DarwinX:通过自然选择演化智能体脚手架 08-15 自动化评测 1 文本、视觉和语音生成自动评估方法综述 06-13 自我批判 1 Double-Checker:通过自我批判微调增强慢思维大模型推理 06-27 自我确定 1 用 KL 散度衡量模型的「自我确定性」 12-31 自进化 3 逐篇盘点:自进化系统学到了什么,局限在哪里 09-03 上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench 07-02 普林斯顿 Alita 开启通用智能体自主进化新范式 06-04 自进化框架 2 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 PenguinHarness:构建持续自我进化 Agent 的开源框架 08-07 自适应停止 1 知道何时停止:LLM 评测的贝叶斯最优停止 08-17 补丁回移 1 自动化安全补丁回移基准:现有工具能走多远? 08-19 表征分析 1 表示空间分析工具:PCA、CKA 与 Fisher 信息矩阵 06-14 裁判模型评测 1 LLM 作为评委的实证研究:设计选择如何影响评估可靠性 06-18 裁判模型诊断 1 能力而非准确率:无参考裁判门控的诊断方法 08-20 规划评测 1 看似简单的规划问题也具计算挑战:倒计时游戏基准 08-04 视觉推理 3 TempCloze:Video-LLM 能否识别视频缺失的中间片段? 09-02 Autoregressive Mosaics:探测纯文本模型的二维空间推理 09-01 CaughtCheating:多模态大模型能否成为优秀的作弊侦探? 06-23 视觉模型 2 大模型时代,通用视觉模型将何去何从? 12-31 清华鲁继文团队综述通用视觉模型研究进展 12-31 视频到音频生成 1 Kling-Foley:为视频生成音画同步的高质量立体声 06-28 视频评测 1 Video-IFBench:评估视频理解中的指令遵循能力 08-28 解释效用 1 自然语言解释何时助益上下文学习:类型与忠实度比较 08-18 计算复杂度 1 思考的错觉:从问题复杂性理解推理模型的优势与局限 06-11 计算机控制 1 Cradle:赋能基础智能体实现通用计算机控制 07-18 认知习惯 1 了解大型推理模型的认知习惯:CogTest 基准评估 06-30 认知链 1 ECCoT:通过认知链验证增强大型语言模型的有效推理 06-25 记忆机制 1 通过电路发现理解 LLM 中的逐字记忆 06-30 记忆能力评测 3 MemBench:全面评估基于 LLM 的智能体记忆能力 06-30 MemBench:面向大语言模型智能体记忆能力的综合评估 06-26 MemSim:用于评估大模型个人助理记忆能力的贝叶斯模拟器 09-30 论文写作 1 1947篇AI顶会论文揭示高质量论文写作法则 08-14 设计创新 1 当 AI 设计 AI:创新还是模仿? 08-19 证明语料库 1 开放证明语料库:大规模研究 LLM 生成的数学证明 06-30 评分偏差 1 评估 LLM-as-a-Judge 中的评分偏差 06-30 评测争议 1 GPT-5 编程成绩被质疑:删去 23 道测试题,关键基准由自己提出 08-07 评测优化 1 重新思考 LLM 社会模拟的评估与优化 08-21 评测偏差 1 自动化评估应区分模型能力与决策偏好 12-31 评测可靠性 1 使用开放基准测试评估语言模型的陷阱 07-01 评测基准 5 FlavourBench:以可执行烹饪真值评测前沿语言模型 08-24 NoCode-bench:评估自然语言驱动功能开发的新基准 12-31 LLM 评测基准综述与多模态推理新基准 10-23 AI 基准测试:从专业难题到大众谜题,探索 AI 推理能力 10-23 剖析 SWE-Bench 排行榜:LLM 与智能体修复系统的提交者及架构画像 06-24 评测基准构建 1 BTS-AgentBench:从只读遥测日志构建可复现智能体基准 08-28 评测审计 5 用户反馈提供 LLM 无法自行识别的独特改进信号 09-03 SASST:面向交互式智能体的选择感知压力测试 09-01 Phantom Gains:用实测零基线审计模型自我改进 08-21 MCP 智能体安全评测中的处理泄漏与构念效度 08-16 垃圾输入,推理输出?为何基准分数不可靠及如何应对 07-01 评测框架 1 BenchHub:面向整体与可定制 LLM 评估的统一基准套件 06-04 评测榜单 1 HuggingFace FormulaOne 评估排行榜 12-31 评测编排 1 HarnessEval:以可执行 Harness 重构 Benchmark 08-19 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 资源研究综述 1 Awesome Self-Improving Agents:自改进智能体资源库 08-12 软件工程 1 SWE-Flow:以测试驱动方式合成软件工程数据 06-12 迁移评测 1 商业 LLM API 迁移中的题项级能力回归测量 08-19 过程奖励模型 2 SPARE:基于参考引导评估的单次过程标注框架 06-23 从数学推理到代码:测试时扩展中过程奖励模型的泛化 06-04 过程评测 2 LCoT-GV:基于图注意力网络的长思维链验证 09-01 超越最终得分:长程 AI 研发智能体的系统评估 08-16 运动跟踪 1 HumanTracker:人类感知对齐的人形运动追踪基准 08-18 进化安全 1 Self-evolving Agents 并非总是良性:警惕智能体“错误进化”风险 12-31 进化研究综述 1 97页综述:现代 AI Agent 的自我进化体系 08-12 递归自我改进 1 综述:递归自我改进(RSI)的能力边界与关键瓶颈 08-13 逻辑评测 1 SATQuest:用于逻辑推理评估与微调的验证器 12-31 重构评测 1 SWE-Bench ProMax:大规模多语言代码重构智能体基准 08-12 量规评分 1 评分靠量规,而非模型智能 08-19 错误模式 1 更强大的语言模型会产生更多类似人类的错误 06-16 长度泛化 1 Transformer 长度泛化的代数分解理论 08-16 长期记忆 1 EgoMonth:月级第一视角视频长期时空记忆基准 08-16 长程任务评测 1 VibeLifeBench:评测生活智能体的主动性与持久性 08-13 隐私风险 1 微调方法对大型语言模型中记忆的影响 06-30 领域泛化 1 从一般推理到领域专业知识:揭示大型语言模型泛化的局限性 06-30 题目生成 1 自动生成用于阅读理解评估的推理问题 06-12 题项相似性 1 双维度 LLM 框架自动分析大规模测评题项内容相似性 08-26 风格评测 1 风格还是签名?艺术家隔离的绘画风格分类评测 08-17 风险评估 1 Judge, Retrieve, or Abstain:具风险保证的 LLM 裁判 08-19 首步纠错 1 在推理的开始迷失:首个推理步骤对长链推理的关键影响 06-30 验证器模型 1 CompassVerifier:3B验证模型与多领域高难度基准 VerifierBench 12-31 鲁棒性测试 1 TESTNAV:Pareto 引导的组合鲁棒性测试 08-22