2025-07-21 科研追新

当日精选(由提交工具自动创建)。

仅靠提示词与自我验证,Gemini 2.5 Pro 达到 IMO 2025 金牌水平

研究者通过提示词优化和多轮自我验证流程,使 Gemini 2.5 Pro 在无额外训练的情况下正确解决 2025 年 IMO 六道题中的五道,达到金牌水平。

 推理 逻辑推理 模型评估 自进化 人工智能

黄奕辰、杨林福使用新发布的 2025 年 IMO 题目测试 Gemini 2.5 Pro,以降低训练数据污染的可能性。研究没有依赖额外训练或大规模算力投入,而是通过精心设计的提示词以及“生成—改进—验证—纠错”的迭代流程,让模型正确解决六道题中的五道。验证器会识别逻辑谬误、事实错误和论证缺口,并在复核错误报告后指导模型继续修正;答案连续五次通过验证才会被接受,迭代十次仍有重大问题则被拒绝。结果表明,严格的自我验证和推理流程设计能够显著释放基础模型在奥林匹克级复杂数学任务上的潜力。

用途与启示
  • 说明无需微调模型,仅通过推理流程和提示词工程也可能显著提升复杂数学任务表现。
  • 为高可靠推理系统提供可复用的“生成、验证、纠错、再验证”工作流。
  • 强调单次答案正确率不足以衡量模型能力,应引入多轮独立验证和明确的接受标准。
  • 可将该方法迁移到代码验证、形式化证明及其他需要长链条严密推理的任务。
📝 原始笔记(逐字保留)
4. 直接让基础模型Gemini 2.5 Pro轻松达到IMO金牌水平。🏅只需提示词改动……([仅用提示词工程摘下IMO金牌!清华校友强强联手新发现,学术界不靠砸钱也能比肩大厂](https://mp.weixin.qq.com/s/R6ImfxnwkwYTdHV2IEKkAQ)) 1. 一套**自我迭代验证流程**和提示词优化,就成功让Gemini 2.5 Pro完成了今年IMO题目的解答 2. [Gemini 2.5 Pro 有能力赢得 2025 年 IMO 金牌](https://arxiv.org/abs/2507.15855),黄奕辰 , 杨林福,国际数学奥林匹克(IMO)提出了独特且具有挑战性的问题,要求深刻的洞察力、创造力和严密的推理能力。虽然 LLMs 在 AIME 等数学基准测试中表现良好,但它们在奥林匹克级别的任务上仍然存在困难。我们使用谷歌的 Gemini 2.5 Pro 对新发布的 2025 年 IMO 题目进行测试,避免数据污染。通过采用自我验证流程和精心设计的提示,成功正确解决了 6 道题中的 5 道。该结果强调了开发最佳策略以充分发挥强大 LLMs 在复杂推理任务中潜力的重要性。 3. 受到了陶哲轩的认可:我认同严格验证是在复杂数学任务中取得出色表现的关键。 4. IMO可以更为充分地考验模型的抽象思维和多步骤逻辑推理能力,堪称检验LLM推理能力的“试金石”。 5. 自我验证流程,依次可分为六个步骤: 1. 初始解决方案生成:模型首先根据提示词生成初步解答,要求每一步逻辑推理清晰、解释明确。 2. 自我改进:模型对初始答案进行回顾和优化,弥补初始生成中因思维预算有限导致的不足。 3. 验证解决方案并生成错误报告:在验证器中根据提示词验证解答,生成包含关键错误(如逻辑谬误或事实错误)和不完整论证在内的问题报告。 4. 审查错误报告(可选):对问题报告进行复核,删除误报的问题,提升报告可靠性。 5. 基于错误报告纠正或改进解决方案:根据问题报告改进解答,修正后返回验证步骤。 6. 接受或拒绝解决方案:若解答连续5次都通过验证,则接受该回答;若连续迭代10次,都存在重大问题,则拒绝此答案。
0%