2025-06-21 科研追新

当日精选(由提交工具自动创建)。

大语言模型的“波将金式理解”:正确答案背后的推理不一致

研究提出“波将金式理解”概念,指出大语言模型即使能正确回答基石问题,也可能在后续概念应用中表现出与自身论断不一致的系统性错误。

 逻辑推理 推理 模型评估 人工智能

论文《Potemkin Understanding in Large Language Models》研究了大语言模型在概念理解上的不一致现象,即模型能够给出标准定义或正确回答,却无法在相关问题中稳定应用该概念。作者将这种表面正确、实际推理不连贯的表现称为“波将金式理解”,并发现包括 o3 在内的先进模型也会频繁出现此类错误。研究以“波将金率”衡量模型在正确回答基石示例后,于后续问题中回答错误的比例。论文进一步指出,为人类设计的考试基准可能无法充分衡量模型理解能力,因为模型的错误模式未必与人类相似,高分因此可能掩盖概念理解上的根本差距。

用途与启示
  • 提醒研究者不要仅凭标准考试或单轮问答成绩判断模型是否真正掌握概念。
  • 可通过跨表述、反事实和连续追问测试模型能否一致地应用自身给出的定义。
  • “波将金率”可作为传统准确率之外的补充指标,用于评估推理一致性与概念稳健性。
  • 对 AGI 能力判断应区分答案正确、概念理解和持续一致推理等不同层次。
📝 原始笔记(逐字保留)
250621 「对于 LLM 及其所谓能理解和推理的神话来说,情况变得更糟了 —— 而且是糟糕得多。」https://mp.weixin.qq.com/s/rWvDwEjf-E8faRSSBQmY0Q 「波将金式理解」:一种由「与人类对概念的理解方式完全不可调和的答案」所驱动的理解假象 这项研究揭示了一种被称为「波将金式」(Potemkins)的推理不一致性模式(见下文图 1)。研究表明,即使是像 o3 这样的顶级模型也频繁犯此类错误。基于这些连自身论断都无法保持一致的机器,你根本不可能创造出通用人工智能(AGI)。 论文标题:Potemkin Understanding in Large Language Models 论文地址:https://arxiv.org/pdf/2506.21521 关键在于:用来测试 LLM 的基准(例如 AP 考试)原本是为了评估人类设计的。然而,这带来了一个重要前提:只有当 LLM 在理解概念时出现的误解方式与人类相似时,这些基准才能作为有效的能力测试。否则,模型在基准上的高分只能展现一种「波将金式理解」:看似正确的回答,却掩盖了与人类对概念的真正理解之间的巨大差距。 当人类与大型语言模型在对概念的理解上存在不一致时,就会出现「波将金现象」。 波将金率被定义为:在基石示例上做出正确回答的前提下,模型在随后的问题上回答错误的比例。 ### **[关于“思考的幻觉”的评论:将推理悬崖重构为能动性差距](https://papers.cool/arxiv/2506.18957)**

Kimi-Researcher:月之暗面最强自主 Agent

多轮搜索推理自主 Agent,平均 23 步推理、访问 200+ 网址,端到端智能体强化学习训练。

 智能体工具 智能体

月之暗面发布 Kimi-Researcher 自主 Agent,擅长多轮搜索与推理,基于 Kimi k 系列内部版本,完全通过端到端智能体强化学习训练,在「人类最后一场考试」取得 SOTA。

用途与启示
  • 端到端 RL 训练自主 Agent 的范式参考
  • 多轮搜索推理的工程实现
📝 原始笔记(逐字保留)
1. https://mp.weixin.qq.com/s/1ektvvMVp_9z2VGgaK1_bw 月之暗面「调教」出最强Agent,在「人类最后一场考试」拿下最新 SOTA ... GitHub 链接:https://moonshotai.github.io/Kimi-Researcher/ 2025年6月21日
0%