2025-10-23 科研追新
当日精选(由提交工具自动创建)。
LLM 评测基准综述与多模态推理新基准
两篇文章分别系统盘点 283 个大语言模型评测基准,并介绍面向多模态推理能力的新评测基准。
第一篇综述对 283 个大语言模型评测基准进行了系统梳理,为理解当前评测体系及其覆盖范围提供参考。第二篇文章介绍了一项新的多模态推理基准,关注模型综合处理多种信息并完成推理任务的能力。两项工作共同反映出大模型评估正从通用语言能力测试走向更细粒度、更复杂的多模态推理测量。
- 帮助研究者快速了解现有 LLM 评测基准的整体格局与覆盖盲区
- 为多模态模型的推理能力评估和基准选型提供参考
- 启发构建更全面、可区分模型真实能力的新型评测体系
📝 原始笔记(逐字保留)
Courcelle 定理:树状图上的一元二阶逻辑问题可在线性时间内求解
对于树宽受限等足够类似树的图,任何可由一元二阶逻辑定义的问题都能通过动态规划以图阶数的线性时间求解。
该结论通常被称为 Courcelle 定理,连接了有限模型论、图结构参数与算法设计。对于树宽受限的图,只要问题能够用一元二阶逻辑描述,就可以基于树分解构造动态规划算法。固定逻辑公式和树宽后,算法运行时间相对于图的顶点数呈线性增长。不过,其隐藏常数可能很大,因此该定理更多提供通用的可解性保证,而非直接给出实用算法。
- 为树宽受限图上的逻辑可定义问题提供统一的线性时间可解性框架
- 启发使用树分解与动态规划处理结构化图上的组合问题
- 可用于判断新问题能否通过逻辑表达与结构参数化获得高效算法
📝 原始笔记(逐字保留)
香港中文大学发布基础模型推理能力综述:方法、基准与未来方向
香港中文大学发布综述,系统梳理基础模型的推理方法、评测基准及未来研究方向,并涉及命题逻辑与谓词逻辑。
该综述聚焦基础模型的推理能力,梳理相关方法、评测基准与未来发展方向。内容涵盖命题逻辑和谓词逻辑等经典逻辑推理范式,可用于理解模型形式化推理能力的研究脉络。文章还从方法与评估角度总结当前进展,为后续改进模型推理可靠性提供参考。
- 系统了解基础模型逻辑推理领域的方法与研究版图
- 查找命题逻辑、谓词逻辑相关的评测基准
- 为推理能力训练、评估及未来选题提供参考
📝 原始笔记(逐字保留)
最强 Gemini 2.5 Pro 逻辑推理评测仅得 60 分
Gemini 2.5 Pro 在相关逻辑推理评测中仅获得 60 分,显示顶尖模型的推理能力仍存在明显提升空间。
文章关注 Gemini 2.5 Pro 在一项逻辑推理评测中的表现,其最终成绩仅为 60 分。该结果表明,即使是能力领先的大模型,在复杂逻辑任务上也可能出现显著失误。评测成绩可用于审视模型能力宣传与真实推理表现之间的差距。
- 了解 Gemini 2.5 Pro 在逻辑推理任务上的能力边界
- 提醒研究者不要仅凭综合榜单判断模型的可靠性
- 为推理评测集设计、错误分析和模型改进提供参考
📝 原始笔记(逐字保留)
ICML 2025 新基准揭示 LLM 推理短板:高分或源于符号记忆
ICML 2025 的一项新基准研究指出,LLM 在部分推理任务中的高分可能依赖符号模式记忆,而非真正可泛化的逻辑推理能力。
该研究通过新基准重新审视大语言模型在逻辑推理任务上的表现。实验表明,模型在常规测试中取得的高分,可能部分来自对符号形式和训练分布模式的记忆。面对符号替换、结构变化或分布外问题时,模型的推理能力可能明显下降。这说明现有基准未必能有效区分模式匹配与可泛化的逻辑推理。
- 用于识别 LLM 推理评测中的数据污染、模板记忆与符号捷径问题
- 启示研究者引入符号扰动和分布外测试,提升基准的区分度
- 为训练更具组合泛化能力的推理模型提供评估依据
📝 原始笔记(逐字保留)
ICML 2025:首个反例驱动推理基准揭示大模型“刷题式假象”
研究通过反例驱动的基准与微调方法检验模型是否真正掌握数学推理,并以千余条样本使7B模型在多个基准上超越72B模型。
该 ICML 2025 工作提出首个反例驱动推理基准,用于区分大模型真正的思考能力与依赖题型记忆的“刷题式”表现。研究采用反例驱动的微调策略,仅依赖一千余条样本即可显著提升模型的数学推理能力。实验显示,经过训练的 7B 模型在多个数学推理基准上的表现甚至超过 72B 模型。这表明高质量反例数据可能比单纯扩大模型规模更有助于培养稳健推理能力。
- 用反例测试模型是否真正理解推理规则,而非记忆常见题型与答案模式。
- 以少量、高信息密度的反例样本提升数学推理能力,降低训练成本。
- 为推理模型的能力评估、数据构造和小模型训练提供新思路。
📝 原始笔记(逐字保留)
挑战 LLM 逻辑推理极限:新基准 TEXTGAMES
TEXTGAMES 是一个用于挑战和评估大语言模型逻辑推理能力的新基准。
文章介绍了面向大语言模型逻辑推理能力的新基准 TEXTGAMES。该基准以文本游戏形式设置推理挑战,用于考察模型处理复杂逻辑任务的能力。其目标是探索当前 LLM 的推理极限,并为模型能力比较提供新的评估方式。
- 用于系统评估大语言模型的逻辑推理能力
- 通过文本游戏揭示模型在复杂推理任务中的能力边界
- 为推理模型的训练、比较和改进提供参考
📝 原始笔记(逐字保留)
AI 基准测试:从专业难题到大众谜题,探索 AI 推理能力
FormulaOne 基准通过图上的 MSO 逻辑与动态规划问题评估大模型的深层算法推理能力,GPT-5、Grok 4 和 o3 Pro 等顶级模型均表现不佳。
FormulaOne 是 AAI 提出的一项算法推理基准,采用图上的单子二阶逻辑(MSO)与动态规划生成测试问题,并设置三层递进难度。测试结果显示,GPT-5 在进阶题上的正确率仅约 4%,在最深层题目中得分为零,Grok 4 与 o3 Pro 也未能成功解决。该基准强调超越竞赛编程题型的推理深度,任务设计与路径规划等现实优化问题较为接近。结果表明,顶级大模型在需要组合逻辑、状态建模和多步算法设计的任务上仍存在明显短板。
- 用于衡量大模型在图逻辑、动态规划及多步算法设计方面的真实推理深度。
- 揭示常规竞赛编程成绩可能高估模型处理复杂现实优化问题的能力。
- 可为推理模型训练、分层难度设计和算法能力评估提供参考。