2025-10-23 科研追新

当日精选(由提交工具自动创建)。

LLM 评测基准综述与多模态推理新基准

两篇文章分别系统盘点 283 个大语言模型评测基准,并介绍面向多模态推理能力的新评测基准。

 多模态 模型评估 推理 人工智能

第一篇综述对 283 个大语言模型评测基准进行了系统梳理,为理解当前评测体系及其覆盖范围提供参考。第二篇文章介绍了一项新的多模态推理基准,关注模型综合处理多种信息并完成推理任务的能力。两项工作共同反映出大模型评估正从通用语言能力测试走向更细粒度、更复杂的多模态推理测量。

用途与启示
  • 帮助研究者快速了解现有 LLM 评测基准的整体格局与覆盖盲区
  • 为多模态模型的推理能力评估和基准选型提供参考
  • 启发构建更全面、可区分模型真实能力的新型评测体系
📝 原始笔记(逐字保留)
20251023|[综述:对 283 个 LLM 评测基准的系统盘点](https://mp.weixin.qq.com/s/B5kkcYMlroWn0dIKpVq_vQ) [多模态推理新基准!](https://mp.weixin.qq.com/s/BaGTkmjrqItbDUMve07ttg)

Courcelle 定理:树状图上的一元二阶逻辑问题可在线性时间内求解

对于树宽受限等足够类似树的图,任何可由一元二阶逻辑定义的问题都能通过动态规划以图阶数的线性时间求解。

 逻辑推理 推理

该结论通常被称为 Courcelle 定理,连接了有限模型论、图结构参数与算法设计。对于树宽受限的图,只要问题能够用一元二阶逻辑描述,就可以基于树分解构造动态规划算法。固定逻辑公式和树宽后,算法运行时间相对于图的顶点数呈线性增长。不过,其隐藏常数可能很大,因此该定理更多提供通用的可解性保证,而非直接给出实用算法。

用途与启示
  • 为树宽受限图上的逻辑可定义问题提供统一的线性时间可解性框架
  • 启发使用树分解与动态规划处理结构化图上的组合问题
  • 可用于判断新问题能否通过逻辑表达与结构参数化获得高效算法
📝 原始笔记(逐字保留)
1. 20251023|对于每个足够类似树的图,任何可用一种富有表现力的形式逻辑(一元二阶逻辑)定义的问题,都可以通过一个动态规划算法来解决,且其运行时间与图的阶数成线性关系。

香港中文大学发布基础模型推理能力综述:方法、基准与未来方向

香港中文大学发布综述,系统梳理基础模型的推理方法、评测基准及未来研究方向,并涉及命题逻辑与谓词逻辑。

 逻辑推理 推理 模型评估 人工智能

该综述聚焦基础模型的推理能力,梳理相关方法、评测基准与未来发展方向。内容涵盖命题逻辑和谓词逻辑等经典逻辑推理范式,可用于理解模型形式化推理能力的研究脉络。文章还从方法与评估角度总结当前进展,为后续改进模型推理可靠性提供参考。

用途与启示
  • 系统了解基础模型逻辑推理领域的方法与研究版图
  • 查找命题逻辑、谓词逻辑相关的评测基准
  • 为推理能力训练、评估及未来选题提供参考
📝 原始笔记(逐字保留)
20251023|[香港中文大学发布Reasoning综述 : 深入基础模型的推理能力: 方法、基准与未来方向](https://mp.weixin.qq.com/s/OxLRlkFIV35XtTDRThgt6Q) 命题和谓词逻辑

最强 Gemini 2.5 Pro 逻辑推理评测仅得 60 分

Gemini 2.5 Pro 在相关逻辑推理评测中仅获得 60 分,显示顶尖模型的推理能力仍存在明显提升空间。

 逻辑推理 模型评估 模型开发

文章关注 Gemini 2.5 Pro 在一项逻辑推理评测中的表现,其最终成绩仅为 60 分。该结果表明,即使是能力领先的大模型,在复杂逻辑任务上也可能出现显著失误。评测成绩可用于审视模型能力宣传与真实推理表现之间的差距。

用途与启示
  • 了解 Gemini 2.5 Pro 在逻辑推理任务上的能力边界
  • 提醒研究者不要仅凭综合榜单判断模型的可靠性
  • 为推理评测集设计、错误分析和模型改进提供参考
📝 原始笔记(逐字保留)
20251023|[最强Gemini 2.5 Pro仅得60分](https://mp.weixin.qq.com/s/BaGTkmjrqItbDUMve07ttg)

ICML 2025 新基准揭示 LLM 推理短板:高分或源于符号记忆

ICML 2025 的一项新基准研究指出,LLM 在部分推理任务中的高分可能依赖符号模式记忆,而非真正可泛化的逻辑推理能力。

 逻辑推理 推理 模型评估 数据工程

该研究通过新基准重新审视大语言模型在逻辑推理任务上的表现。实验表明,模型在常规测试中取得的高分,可能部分来自对符号形式和训练分布模式的记忆。面对符号替换、结构变化或分布外问题时,模型的推理能力可能明显下降。这说明现有基准未必能有效区分模式匹配与可泛化的逻辑推理。

用途与启示
  • 用于识别 LLM 推理评测中的数据污染、模板记忆与符号捷径问题
  • 启示研究者引入符号扰动和分布外测试,提升基准的区分度
  • 为训练更具组合泛化能力的推理模型提供评估依据
📝 原始笔记(逐字保留)
20251023|[ICML 2025 | 新基准揭示LLM推理能力短板:高分之下,竟是“符号记忆”?](https://mp.weixin.qq.com/s/proo0bHYHLG0MBUJB8EOjA)

ICML 2025:首个反例驱动推理基准揭示大模型“刷题式假象”

研究通过反例驱动的基准与微调方法检验模型是否真正掌握数学推理,并以千余条样本使7B模型在多个基准上超越72B模型。

 逻辑推理 推理 模型评估 模型训练 数据工程

该 ICML 2025 工作提出首个反例驱动推理基准,用于区分大模型真正的思考能力与依赖题型记忆的“刷题式”表现。研究采用反例驱动的微调策略,仅依赖一千余条样本即可显著提升模型的数学推理能力。实验显示,经过训练的 7B 模型在多个数学推理基准上的表现甚至超过 72B 模型。这表明高质量反例数据可能比单纯扩大模型规模更有助于培养稳健推理能力。

用途与启示
  • 用反例测试模型是否真正理解推理规则,而非记忆常见题型与答案模式。
  • 以少量、高信息密度的反例样本提升数学推理能力,降低训练成本。
  • 为推理模型的能力评估、数据构造和小模型训练提供新思路。
📝 原始笔记(逐字保留)
20251023|[ICML 2025 | 会做题≠会思考?首个反例驱动推理基准:揭穿大模型“刷题式假象” ](https://mp.weixin.qq.com/s/by9TGdkHb9daRfgmrooj6w)靠反例驱动的微调,仅仅依赖 1000+ 样本,就能让模型的数学推理能力 “脱胎换骨”,在多个数学推理基准测试中,7B 模型甚至能超越 72B 模型性能

挑战 LLM 逻辑推理极限:新基准 TEXTGAMES

TEXTGAMES 是一个用于挑战和评估大语言模型逻辑推理能力的新基准。

 逻辑推理 模型评估 推理

文章介绍了面向大语言模型逻辑推理能力的新基准 TEXTGAMES。该基准以文本游戏形式设置推理挑战,用于考察模型处理复杂逻辑任务的能力。其目标是探索当前 LLM 的推理极限,并为模型能力比较提供新的评估方式。

用途与启示
  • 用于系统评估大语言模型的逻辑推理能力
  • 通过文本游戏揭示模型在复杂推理任务中的能力边界
  • 为推理模型的训练、比较和改进提供参考
📝 原始笔记(逐字保留)
20251023|[挑战LLM逻辑推理极限!新基准TEXTGAMES](https://mp.weixin.qq.com/s/ZbdfnfDoZuruLPHhVpxCtA)

AI 基准测试:从专业难题到大众谜题,探索 AI 推理能力

FormulaOne 基准通过图上的 MSO 逻辑与动态规划问题评估大模型的深层算法推理能力,GPT-5、Grok 4 和 o3 Pro 等顶级模型均表现不佳。

 逻辑推理 模型评估 推理 数据工程

FormulaOne 是 AAI 提出的一项算法推理基准,采用图上的单子二阶逻辑(MSO)与动态规划生成测试问题,并设置三层递进难度。测试结果显示,GPT-5 在进阶题上的正确率仅约 4%,在最深层题目中得分为零,Grok 4 与 o3 Pro 也未能成功解决。该基准强调超越竞赛编程题型的推理深度,任务设计与路径规划等现实优化问题较为接近。结果表明,顶级大模型在需要组合逻辑、状态建模和多步算法设计的任务上仍存在明显短板。

用途与启示
  • 用于衡量大模型在图逻辑、动态规划及多步算法设计方面的真实推理深度。
  • 揭示常规竞赛编程成绩可能高估模型处理复杂现实优化问题的能力。
  • 可为推理模型训练、分层难度设计和算法能力评估提供参考。
📝 原始笔记(逐字保留)
20251023|[AI 基准测试:从专业难题到大众谜题,探索 AI 推理能力](https://mp.weixin.qq.com/s/ST_2UEMqxelSJxGOTbypOg) [2025-09-16| 顶级大模型在AAI提出的FormulaOne基准集体翻车:三层难度递进,GPT-5进阶题仅约4%正确,最深层零分;Grok 4、o3 Pro全部失手。该基准以图上MSO逻辑与动态规划生成问题,贴近路径规划等现实优化,旨在衡量超越竞赛编程的算法推理深度。](https://mp.weixin.qq.com/s/E4LilyWcLgb-H6SFWI8oew)
0%