推理 LLM-DailyDigest 2025-09-26 2025-09-26 约 100 字 预计阅读 1 分钟 推理 历史条目已迁入对应日报,本页「相关消息」自动聚合。 相关消息(按子主题自动聚合) 一致性评测 1 ConsistencyChecker:基于树结构评估大模型泛化一致性 06-18 上下文进化 1 ACE:无需微调的语言模型自我进化范式 12-31 不确定性量化 1 Forking Fast:高效估计文本生成的不确定性动态 08-22 专家智能 1 AAI 推动人工专家智能新路径 12-31 世界模型 2 通用决策大模型 Decitron:开放世界推演与求解闭环 09-03 PEVA:基于全身动作条件的第一视角视频预测世界模型 07-02 中期训练 2 首创 Mid-training 范式破解 RL 奥秘,Llama 推理性能追平 Qwen 07-01 OctoThinker:中期训练促进强化学习规模化 06-25 主动推理 1 从被动推理到主动推理:大型语言模型能否在不完整信息下提出正确问题? 06-12 事实一致性 1 AssertBench:评估大型语言模型自我断言能力的基准 06-16 事实核查 2 ReflectFact:自反思智能体提升多跳事实核查 08-16 验证验证者:揭示事实验证器的陷阱与潜力 06-18 人工监督 1 强化人工监督以验证 AI 推理 12-31 代码评测 3 OJBench:面向大语言模型的竞赛级代码评测基准 06-24 LiveCodeBench Pro:奥赛级竞技编程基准揭示顶尖 LLM 的推理短板 06-19 人类最后的代码考试:高级大模型能否攻克最难编程竞赛? 06-18 价值估计 1 Le Critique:用于 LLM 强化学习的特权价值函数 08-18 价值权衡 1 你内心有许多狼:运用认知模型解读 LLM 中的价值权衡 06-25 低成本训练 1 游戏玩家可以训练数学推理模型吗? 06-12 低资源学习 1 面向低资源大模型任务的可迁移提示与对齐策略 07-01 偏好优化 1 隐式奖励作为桥梁:SFT 与 DPO 连接的统一视图 06-15 偏好推理 1 大模型不确定条件下的偏好推理 08-20 元推理 1 当前模型缺乏推理过程的内在调节机制 12-31 元认知 6 MERA:分离推理与控制的元认知推理框架 12-31 MERA:通过推理-控制分离与 CSPO 实现元认知控制 12-31 元优化与元认知:从训练效率到模型自我反思 08-06 SAGE-nano:通过逆向推理实现大模型元认知自我解释 06-30 推理模型如何识别无益想法并从中恢复? 06-13 大型语言模型具有内在元认知,但需要良好的评估透镜 06-12 内在奖励 1 Learning to Reason without External Rewards:无需外部奖励的推理学习 05-26 决策解释 1 使用强化学习训练大型语言模型解释人类决策 05-16 决策说服 1 LLM 中理解与说服之间的细线 07-03 分层推理 2 借鉴人类思考的分层推理:清华大学最新研究 08-05 HRM:无需预训练或 CoT 数据的分层推理模型 07-01 分层验证 1 给验证器打分:LLM 推理验证自治等级 L0–L5 08-20 分布式训练 1 并行与分布式推理语言模型的性能基础 08-28 创造力评测 1 人类创造力的核心机制,AI 已开始掌握:IEI 分层评估框架 06-26 前沿挑战 1 大模型强化学习的关键挑战与下一代范式 12-31 动作推理 1 Chain-of-Action:通过轨迹自回归实现动作推理的模仿学习新范式 07-18 动机推理 1 MotiveBench:大型语言模型距离类人动机推理还有多远? 06-18 医学影像分析 1 GPT-5医学影像推理与理解准确率超过人类专家 12-31 医疗人工智能 1 百川开源医疗推理模型 Baichuan-M2-32B,HealthBench 超越 GPT-OSS-120B 08-11 协作博弈 1 推理腐蚀:推理语言模型成为公共产品博弈中的搭便车者 07-01 协同演化 2 清华 CPMöbius:Coach-Player 协作共演化实现自主出题训练 08-12 Socratic-Zero:以苏格拉底式教学推动智能体协同进化 12-31 博弈推理 1 以玩促泛化:通过游戏学习推理 06-11 博弈评测 2 Game Arena:以游戏评估 AI 的复杂推理与规划能力 08-07 Grok 4夺得首届大模型国际象棋对抗赛冠军 08-07 原型推理 1 ProtoReasoning:以推理原型提升大模型跨领域泛化能力 06-23 反例推理 1 ICML 2025:首个反例驱动推理基准揭示大模型“刷题式假象” 10-23 反思回溯 1 ASTRO:通过上下文反思与回溯训练语言模型推理 07-01 反思早停 1 EvoResearcher:免训练的推理时自我反思与成本约束早停 08-20 反馈优化 1 Critique-GRPO:利用自然语言与数值反馈推进大模型推理 06-04 反馈规划 2 KRCL:借鉴人类运动学习反馈的双向闭环规划机制 12-31 按需激活反馈接收的正向规划机制 12-31 句子简化 1 句子简化的LLM:混合多智能体提示方法 06-16 可信推理 2 FLARE:基于逻辑辅助搜索的可信推理与探索方法 12-31 ReliableMath:评估大模型数学推理可靠性的开源基准 07-17 可扩展推理 1 SLR:可扩展逻辑推理的自动化综合框架 06-23 可解释性 1 MetaExplainer:生成多类型、以用户为中心的人工智能解释框架 07-03 可靠性训练 1 基于可验证奖励训练接地大模型的经验总结 06-23 可验证奖励 1 具有可验证奖励的强化学习可隐式激励基础大模型正确推理 06-19 因果推理 2 揭示大型语言模型中的因果推理:现实还是海市蜃楼? 06-27 CLEAR-3K:评估语言模型的因果解释能力 06-24 图像评测 1 MMMG:面向文本到图像推理的大规模多学科多层级生成基准 06-13 图形用户界面纠错 1 GUI-Critic-R1:为GUI智能体操作加上“紧急刹车” 06-18 图逻辑 1 Courcelle 定理:树状图上的一元二阶逻辑问题可在线性时间内求解 10-23 基础模型 1 华为发布盘古大模型 5.5 系列 06-23 多元推理 1 思想定理:面向溯因、演绎与归纳推理的多智能体框架 06-11 多智能体系统 5 蚂蚁 AWorld 以多智能体系统复现 DeepMind IMO 解题成果 07-24 许多 LLM 比一个更实用:多智能体协作中的道德判断 07-01 Xolver:基于整体经验学习的多智能体推理框架 06-19 通过多智能体反思增强大语言模型推理 06-12 从辩论到均衡:基于贝叶斯纳什均衡的信念驱动多智能体 LLM 推理 06-12 多模态学习 2 GLM-4.5V:视觉多模态能力达到开源 SOTA 12-31 阶跃星辰发布多模态旗舰基座模型 Step 3 12-31 多模态推理 5 CoRGI:以视觉证据验证思维链的多模态推理框架 08-05 智谱开源 GLM-4.1V-9B-Thinking:9B 参数模型斩获 23 项 SOTA 07-03 推理越多,幻觉越重?多模态推理模型的「幻觉悖论」 06-26 GRPO-CARE:面向多模态推理的一致性感知强化学习 06-24 香港中文大学 MMLab 发布多模态数学推理方案 MINT-CoT 06-17 多模态训练 1 CPGD:仅用数学训练,跨学科推理超越 o1并缓解强化学习训练崩溃 06-24 多模态证明 1 MATP-BENCH:多模态大模型能否成为自动定理证明器? 07-17 多维推理 1 突破思维模式:面向大语言模型的多维推理框架 06-18 多路径推理 1 华为提出思维森林:多路径推理破解大模型数学瓶颈 12-31 多跳推理 5 Hi-Q:层次化证据引导的多跳问答查询优化 09-03 AdaPath:基于 Path-Bank 的查询自适应生物医学知识图谱路径搜索 09-01 自动修补:增强语言模型中的多跳推理 08-15 Rex-Thinker:基于思维链的指代物体检测模型 07-01 Auto-Patching:增强语言模型的多跳推理能力 06-04 多跳问答 1 Hop, Skip, and Overthink:诊断推理模型多跳分析失误 08-07 多轮验证 1 Gemini 2.5 Pro结合多轮验证框架系统拆解IMO解题方法 12-31 奖励建模 7 HSRM:用于测试时验证的隐藏状态奖励模型 09-01 响应级奖励就是 LLM 在线强化学习所需的一切:数学视角 12-31 周志华团队理论证明:LLM中可挖掘内源性通用奖励模型 07-03 通才奖励建模的推理时间缩放:SPCT 06-28 ReasonGRM:借助大型推理模型增强生成奖励模型 06-24 ReasonGRM:通过大型推理模型增强生成式奖励模型 06-23 从通用奖励到定向奖励:在开放式长文本生成任务中超越 GPT-4 06-23 奖励机制 1 结果奖励驱动可泛化推理策略 12-31 奖励蒸馏 2 OPDVR:基于可验证奖励的在线策略蒸馏 08-27 AdvDistill:通过奖励引导的数据集蒸馏增强小语言模型推理能力 07-02 奖励黑客 1 让模型在思维链中明确解释奖励黑客行为 06-28 对齐失配 1 安全方向惩罚缓解推理诱发的模型失配 08-25 工具使用元学习 1 MetaAgent:通过元工具学习实现持续自我进化 12-31 工具推理 1 大模型推理崩溃论战:从「思维错觉」到多重反驳 06-25 工具调用 1 多工具智能体的全自动推理轨迹生成与训练 12-31 并行推理 3 腾讯AI Lab俞栋团队开源首个并行思考强化学习框架 Parallel-R1 12-31 Parallel-R1:通过强化学习让大模型学会并行思维 09-17 谷歌发布 IMO 金牌级模型 Gemini 2.5 Deep Think 08-01 幻觉检测 1 HARP:通过推理子空间投影进行幻觉检测 09-15 开放式推理 1 PuzzleWorld:面向益智寻谜的多模态开放式推理基准 06-10 开源模型 2 OpenAI 开源推理模型 gpt-oss-120b 与 gpt-oss-20b 08-05 华为开源盘古 Embedded 7B 与盘古 Pro MoE 72B 模型 07-01 弱点合成 1 SwS:LLM 推理强化学习中的自我感知弱点驱动问题合成 06-12 强化学习 3 清华、上海AI Lab等团队发布推理模型强化学习综述 12-31 大型推理模型的强化学习研究综述 09-11 Magistral:Mistral 首个推理模型与可扩展强化学习管线 06-13 形式化推理 1 字节 Seed-Prover:以引理为核心的 Lean 4 数学证明模型 12-31 形式化证明 8 AlphaProof 技术解析:结合强化学习、自动形式化与 Lean 证明反馈 12-31 MATT-BENCH:多模态大模型能否成为优秀的自动定理证明器? 12-31 阶跃星辰发布并开源 StepFun-Prover 系列形式化定理证明模型 12-31 StepFun-Prover:基于环境反馈的形式化证明训练 12-31 Goedel-Prover-V2:通过分阶段数据合成与自我纠正扩展形式定理证明 08-05 Goedel-Prover-V2开源:72B模型定理证明超越DeepSeek-Prover-V2 671B 07-18 通过一阶逻辑定理证明提升大模型数学推理能力 06-24 MATP-BENCH:多模态大模型自动定理证明正确率仅约4% 06-18 循环推理 1 Recirculation:基础模型的推理时再循环 08-19 循环深度 1 循环模型为何越想越错:隐空间推理的深度困境 08-16 心智理论 2 Decrypto:多智能体推理与心智理论基准测试 06-26 ToMAP:以心智理论训练具备对手感知能力的大模型说服者 06-25 忠实性验证 1 以因果验证机制检验 AI 推理忠实性 12-31 思维框架 1 姚期智领衔提出大模型“思维”框架,逻辑推理正确率达98% 09-23 思维链 5 SHAPE:解析数学推理中思维链的形态 09-02 MIST:基于模型内部显著性的思维链 Token 压缩 09-01 重新定义思维链的角色:线索而非完整解释 12-31 Bengio等质疑CoT忠实度:语言化步骤未必反映LLM真实推理 07-03 CoT-Bridge:为模型补上思维跳跃的“桥梁” 06-04 思维链泄露 1 EchoCoT:从大推理模型中提取隐藏思维链 08-21 思维链监测 1 CoT监测或成为控制AI智能体的核心方法 07-17 意识表征 1 能否从大型语言模型内部状态中观察到“意识”?基于综合信息理论与 Span 表示的分析 07-01 成本优化 1 DynScaling:基于动态集成采样的无验证器高效推理扩展 06-24 扩散模型 2 Mercury:首个扩散式 LLM,推理速度超过主流模型 7 倍 06-28 DiffuCoder:理解并改进用于代码生成的掩码扩散模型 06-25 扰动推理 1 PertMind:用细胞扰动强化学习激发生物推理能力 08-18 批评微调 1 通过单问题批评微调释放预训练大模型的推理潜力 06-09 技能演化 1 清华推出 Ctx2Skill:通过多智能体自博弈实现 Skill 自主进化 08-12 指令优化 1 教学学习范式:融合白盒与黑盒 LLM 的指令优化框架 06-30 指令数据合成 1 腾讯优图提出 RAIF 激励推理方法,复杂指令性能提升 11.74% 06-24 探索推理 1 探索推理:一种熵的视角 06-19 推测解码 1 S⁴C:利用语法与语义一致性加速大模型推理 06-19 推理优化 4 GMTS:基于梯度幅度的词元选择改进大模型 RLVR 推理训练 09-01 马尔可夫思考机将 LLM 推理成本降至线性 12-31 直接推理优化:LLM 自我奖励并完善开放式任务推理 06-18 NoWait:移除“等待”等思考标记可提升推理效率 06-12 推理安全 1 专有 LLM API 推理轨迹窃取攻击 08-12 推理异常 1 GPT-oss 无提示生成问题并陷入数千次重复推理 12-31 推理强化 1 SPIRAL:强化学习筛选并强化可泛化推理模式 12-31 推理归因 1 Thought Anchors:识别大模型推理中的关键步骤 06-25 推理扩展 2 五年前的“开放式推理”设想预见 OpenAI o1、o3 路线 08-15 推理时扩展的概率最优性:OptScale 动态确定最佳采样数 06-27 推理效率 6 无 LM Head 的软潜空间思考 09-01 思维令牌是帮助还是陷阱?迈向更高效的大型推理模型 07-01 Long-to-Short 是免费的午餐吗?研究大型推理模型的一致性与推理效率 06-25 PREMISE:面向大模型高效数学推理的可扩展战略提示优化 06-13 简单问题快速答,困难问题深入想:基于幂次长度惩罚的高效推理 06-13 Bingo:通过动态与显著性强化学习提升大模型推理效率 06-12 推理早停 1 答案收敛可作为推理早停信号 06-04 推理模型 2 大推理模型强化学习综述 12-31 蚂蚁开源 Ling-flash-2.0 MoE 模型,小参数量实现越级推理性能 12-31 推理研究综述 2 香港中文大学发布基础模型推理能力综述:方法、基准与未来方向 10-23 逻辑学研究中心联合发表大模型逻辑推理能力综述《思维机器》 10-15 推理系统 1 Frontier:模拟下一代大语言模型推理系统 08-05 推理范式 1 CMU 与斯坦福提出新型推理范式:让 LLM 自主发现抽象“窍门” 12-31 推理蒸馏 1 NaturalThoughts:为通用推理任务选择和提炼推理轨迹 07-03 推理训练 1 MERA 训练提升模型推理效率与准确性 08-06 推理记忆 1 ReasoningBank:通过推理记忆扩展智能体自我进化 09-30 推理评测 15 OneEval:面向多元化知识库的LLM知识密集型推理基准 12-31 FormulaOne:图结构动态规划评估集 12-31 Maximal-Cluster-Graph 难题中的动态规划推理链 12-31 不可解谜题暴露纯程序化推理评估的缺陷 12-31 组合深度并非可靠的推理复杂度指标 12-31 ICML 2025 新基准揭示 LLM 推理短板:高分或源于符号记忆 10-23 挑战 LLM 逻辑推理极限:新基准 TEXTGAMES 10-23 MMReason:面向 AGI 的开放式多模态多步骤推理基准 07-01 从思考到输出:推理语言模型中的思维链与文本生成特征 06-30 RE-IMAGINE:用于推理评估的符号化基准合成 06-23 大语言模型的“波将金式理解”:正确答案背后的推理不一致 06-21 IneqMath:29个大模型奥数级不等式证明成功率不足50% 06-20 苹果《思考的错觉》再遭质疑:Claude与人类共著论文指出三大测试缺陷 06-20 苹果《思考的错觉》再遭质疑:Claude 与人类共著论文指出三大关键缺陷 06-14 《思考幻觉》的幻觉:重新审视大模型推理能力崩溃 06-14 推理调控 1 AlphaOne:大模型先慢后快的测试时推理调控框架 06-23 推理迁移 1 数学推理训练能否提升 LLM 的通用能力?推理能力的可转移性研究 07-01 推理预算 1 通过预算引导控制大模型思维长度 06-18 提示优化 1 RiOT:基于残差优化树的高效提示词优化 06-24 提示合成 2 PromptCoT 2.0:面向大语言模型推理的可扩展提示合成 12-31 PromptCoT 2.0:以 EM 循环合成高难度推理任务 12-31 搜索推理 1 R-Search:通过多奖励强化学习与搜索增强大模型推理 06-09 搜索能力评测 1 TsuGO:以围棋死活题评测大模型推理搜索效率 08-16 效度审计 1 超越局部准确率:LLM 推理评测的协议级可识别性审计 08-16 效率评测 1 我们离最佳推理效率还有多远? 06-11 数值推理 1 大语言模型数值能力:根本局限与改进路径 08-16 数学合成 1 MathFusion:融合数学问题,45K 合成数据带来 18% 能力提升 06-18 数学推理 12 哈萨比斯:数学 AI 的“第37手”只是时间问题 08-11 MiroMind-M1:基于 Qwen-2.5 的开源数学推理模型 12-31 DeepMind FunSearch 发现目前最大的 Cap Set 12-31 OpenAI与DeepMind在IMO 2025中均攻克5道题 12-31 OpenAI IMO 金牌团队:模型拒答难题,长时推理面临评估瓶颈 12-31 AI Mathematician(AIM)框架探索前沿理论研究 12-31 大语言模型的数学推理:代码合成、证明生成与逻辑状态 08-05 仅靠提示词与自我验证,Gemini 2.5 Pro 达到 IMO 2025 金牌水平 07-21 有道开源14B「子曰3」数学模型,多项任务超越DeepSeek-R1 06-28 AceReason-Nemotron 1.1:通过 SFT 与 RL 协同提升数学和代码推理 06-18 大语言模型数学推理综述 06-12 数学推理大型语言模型研究综述 06-10 数学数据 1 DeepMath-103K:用 10.3 万道高难数学题突破大模型推理瓶颈 06-12 数学研究 1 AIM:面向数学理论研究的自动化智能体 12-31 数学评测 1 超越黄金标准:用于形式数学推理评估的LLM法官认识论集成 06-13 数据合成 2 REER-PT:以困惑度引导逆向推理增强预训练数据 09-01 Code2Logic:游戏代码驱动的多模态推理数据合成 09-23 数据混合 1 AutoMixer:利用训练检查点自动优化数据混合 06-30 数理语言 1 使用多语言数字谜题研究语言模型中语言与数学推理的相互作用 06-19 文本扩散模型 1 Cosmos:用于文本扩散建模的压缩平滑潜在空间 06-27 旗舰模型 1 Grok 4 与 Grok 4 Code 发布:强化推理与编程能力 07-03 无监督训练 1 MM-UPT:基于 GRPO 的多模态大模型无监督持续自我改进框架 05-28 时序问答 1 SABET-QA:时序知识图谱多步问答 08-21 智能体 2 SWE-Dev:构建具备训练与推理扩展能力的软件工程智能体 06-07 SWE-Dev:通过训练与推理扩展构建软件工程智能体 06-07 智能体工作流 1 WebAgents 完成用户指令的三个核心过程 12-31 智能体推理 1 Agentic-R1:7B小模型的逆袭,让LLM学会“见招拆招” 07-18 智能体自进化 1 MetaAgent:无需参数更新的自我进化智能体范式 06-13 智能体评测 6 CordisBench:动态智能体脚手架的组件生命周期推理评测 09-02 AI Agent 评测基准的“环境—能力”分类框架 12-31 ALE-Bench:编程智能体跻身 NP 难题竞赛前 2% 06-18 EconWebArena:现实 Web 环境中的经济任务自治智能体评测基准 06-12 面向未来的基准:预测智能体的 Pastcasting 基准 06-11 TextAtari:使用语言智能体挑战10万步Atari游戏 06-05 检索停止 1 多轮 RAG 何时停止:Search-R1 的结构化停止判断 08-16 概率推理 1 不完全是夏洛克·福尔摩斯:语言模型无法可靠区分不可能与不太可能的事件 06-11 模型发布 5 Qwen3.8-27B开源:消费级显卡可运行“Opus级”Agent 08-16 OpenAI 发布 GPT-5 系列模型 08-07 OpenRouter 神秘模型 Cypher Alpha 上线 07-03 Gemini 2.5 Pro 稳定版全面可用 06-19 Mistral AI 发布推理模型系列 Magistral 06-12 模型安全 1 思想犯罪:推理模型中的后门与涌现失调 06-18 模型对抗 1 Grok 4晋级大模型对抗赛决赛,Gemini全军覆没 12-31 模型微调 1 在不损害能力的前提下精简大语言模型 06-13 模型架构 1 GPT-5:基础模型、深度推理与实时路由一体化系统 12-31 模型架构创新 1 Intern-S2-Mobius:知识与推理解耦的基础模型 08-17 模型评测 7 错误预测中的正确证据:修复 LLM 序列评分坍塌 09-01 实测蚂蚁万亿参数思考模型 Ring-1T:对比 DeepSeek V3.2 12-31 GPT-5 首波实测:SimpleBench 超越人类平均水平 12-31 GLM-4.5 逻辑能力评测:推理模式显著降低幻觉与计算误差 07-26 SuperCLUE推理榜惊现黑马:中兴AI模型表现亮眼 07-02 OpenAI 发布 o3-pro,引入严格的“4/4 可靠性”评估 06-11 大型语言模型在框架与符号落地问题上的零样本评估基准 06-11 模型路由 1 Router-R1:通过强化学习实现多轮大模型路由与聚合 06-12 模型验证 1 CompassVerifier:统一支持 LLM 评估与结果奖励的鲁棒验证器 08-06 泛化 1 GPT-5数字母任务仍翻车:CoT分布外泛化问题未解 12-31 泛化推理 1 General-Reasoner:面向跨领域泛化的推理框架 06-04 泛化迁移 1 打破领域障碍:强化后训练的推理收益能否迁移到未见领域? 06-25 测试时优化 2 TTPO:测试时策略优化 08-28 MEMETRON:大型语言模型测试时响应优化的元启发式机制 06-12 测试时计算 1 e3:学习探索实现大模型测试时计算外推 06-12 涌现机制 1 为什么 LLM 的能力是涌现的? 08-06 涌现能力 1 大型语言模型与涌现:复杂系统视角 06-16 深度研究智能体 2 WebWatcher:面向高难度多模态深度研究的智能体方案 12-31 深度研究智能体重塑知识发现与问题解决范式 08-07 混合微调 2 SRFT:单阶段融合监督与强化学习的大模型微调方法 07-03 SRFT:统一监督微调与强化学习的单阶段推理训练方法 06-25 混合规划 1 融合神经与符号系统的混合规划器 12-31 游戏推理 3 ViGaL:仅通过游戏强化学习提升多模态推理能力 06-25 ViGaL:用街机游戏训练多模态模型的跨领域推理能力 06-18 玩以致泛化:通过游戏学习推理 06-09 游戏生成 1 ViGaL:以游戏化合成任务培养通用多模态推理能力 12-31 游戏评测 1 LMGame-Bench:用经典游戏评测大模型感知、记忆与推理能力 07-02 溯因推理 1 LLM 不为“跃迁”付出代价:机器溯因缺少物理成本 08-17 潜空间推理 1 BDH-CQ:基于循环潜在推理的上下文学习 08-12 理解能力评测 1 大型语言模型中的波将金式理解 06-27 真值表征 1 探索真理的几何学:LLM 真值方向在逻辑变换与问答任务中的一致性和泛化性 06-04 知识库问答 1 MCTS-KBQA:基于信息增益奖励的知识库问答 08-20 知识推理 1 OneEval:面向多样化知识库的大模型知识密集型推理评测 06-18 研究方向 2 无需外部数据!AI自问自答实现推理能力进化 12-31 智能体的自主决策与递归自我改进 12-31 研究综述 1 arXiv 2506.06034(原综述笔记,标题缺失) 06-10 神经符号人工智能 2 “神经-符号”融合规划器显著超越 o1 12-31 大型语言模型模仿逻辑推理,但代价是什么? 09-16 科学发现 1 DrSR:基于数据与经验双重推理的科学方程发现框架 06-23 科学推理 1 史上最大高质量科学推理后训练数据集开源,快速让 Qwen3 等变“科学家” 12-31 科学数据 1 上海创智学院与上海交通大学发布科学推理数据集 MegaScience 12-31 科学检索增强生成 1 ScIRGen:为科学研究合成真实的大规模 RAG 数据集 06-16 科研评测 2 ScienceArena:最新科学奥赛大模型评测基准 09-01 科学家的第一次考试:通过感知、理解与推理评测多模态大模型的科学认知能力 06-13 空间推理 1 密室逃脱成 AI 新考场:通关率不足 50%,暴露空间推理短板 07-17 空间认知 1 MindCube:从有限视图构建空间心智模型 06-27 空间记忆 1 Spatial Memory Agent:基于经验程序记忆的空间智能 08-15 端侧模型 1 Qwen发布两款4B端侧模型,支持256K上下文 12-31 答案聚合 1 表示一致性:聚合准确且连贯的 LLM 候选答案 06-30 策略蒸馏 1 SimpleOPD:分词器无关的长上下文同策略蒸馏 08-17 系统优化 1 华为 CloudMatrix 论文披露 AI 数据中心新范式,推理效率超越英伟达 H100 06-30 组合推理 1 Ineq-Comp:不等式自动定理证明中的人类直觉组合推理基准 12-31 结构推理 1 通过结构化推理增强大语言模型 06-26 缩放定律 1 智谱唐杰:大模型只看参数的时代结束了 08-20 缺失前提识别 1 ACA-RL:面向缺失前提推理的询问、条件回答与弃答强化学习 08-18 置信度评估 1 LLM 的置信度能否反映回答正确性? 12-31 能力提升 1 GPT-5 幻觉减少,空间推理与规划能力提升 12-31 能力评测基准 1 FormulaOne 基准令 GPT-5、o3 Pro 等前沿模型集体零分 12-31 能力迁移 2 AI4AI 测试时强弱模型能力迁移:用 Harness 提升小模型表现 08-14 不同游戏训练会形成专门化认知能力 12-31 脚手架演化 1 AI4AI:强模型自动构建 Harness 向弱模型迁移能力 08-31 自主智能体 1 月之暗面推出 Kimi-Researcher,自主 Agent 在“人类最后一场考试”取得 SOTA 06-23 自博弈 6 SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」 12-31 零和博弈自对弈驱动模型自主学习推理 12-31 SPIRAL:通过多智能体多轮强化学习在零和博弈自博弈中激励推理 12-31 SPIRAL 强化学习代码仓库 12-31 以游戏自对弈筛选可泛化思维链 12-31 SPIRAL:零和博弈自博弈激发可迁移推理能力 06-30 自我反思 1 MAPS:通过自动提示与多层自我反思增强大模型多步数学推理 07-01 自我奖励 1 一致的路径通向真理:面向LLM推理的自我奖励强化学习 06-12 自我批判 1 Double-Checker:通过自我批判微调增强慢思维大模型推理 06-27 自我改进 1 在策略蒸馏真的在蒸馏吗?从噪声教师到自我改进 09-01 自我确定 1 用 KL 散度衡量模型的「自我确定性」 12-31 自我纠错 1 PAG:以策略作为生成式验证器的多轮强化学习自我纠错 06-13 自我训练 1 CMU 提出自我奖励训练 SRT:大模型能否实现无标签自训练? 05-27 自蒸馏 1 无监督同策略自蒸馏 U-OPSD 08-12 自进化 6 DiagEvo:基于层次化错误记忆的诊断引导自进化 09-03 超越人类监督扩展大型推理模型:通往超级智能的路径 09-01 上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench 07-02 阿里巴巴与上交等提出 Agent 自进化方法,Solver 性能提升 20.2 个百分点 06-30 ALITA:以最少预定义和最大自我进化实现可扩展智能体推理 05-27 多数投票驱动的推理模型迭代式自我训练 02-03 自进化框架 1 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 自适应引导 1 自适应引导加速推理模型的强化学习 06-19 自适应推理 1 推理混合:教大型语言模型使用自适应策略进行推理 07-01 蛋白质建模 1 AMix-1:基于贝叶斯流网络的蛋白质基座模型新范式 12-31 裁判模型评测 1 LLM 作为评委的实证研究:设计选择如何影响评估可靠性 06-18 规划评测 1 看似简单的规划问题也具计算挑战:倒计时游戏基准 08-04 规则推理 2 StepFun-Prover-Preview:32B 规则推理模型 12-31 RuleReasoner:通过领域感知动态采样强化规则推理 06-12 规则评测 1 RuleWeaver:评测大模型规则中心场景推理 08-29 视觉推理 5 Autoregressive Mosaics:探测纯文本模型的二维空间推理 09-01 ViLaSR-7B:通过“边画边想”学习人类式空间推理 06-23 CaughtCheating:多模态大模型能否成为优秀的作弊侦探? 06-23 SynthRL:以可验证数据合成扩展视觉推理 06-04 SynthRL:通过可验证的数据合成扩展视觉推理 06-03 视觉生成 2 清华、字节提出 PAROAttention:Token 重排实现 5 倍稀疏与 4 比特量化 07-01 GoT-R1:强化学习解锁多模态视觉生成推理新范式 06-26 视频理解 1 微软推出长视频探索智能体 Deep Video Discovery 07-01 视频生成 1 DraftAttention:无需训练的视频扩散模型动态稀疏注意力加速方法 06-30 计算复杂度 1 思考的错觉:从问题复杂性理解推理模型的优势与局限 06-11 认知习惯 1 了解大型推理模型的认知习惯:CogTest 基准评估 06-30 认知工具 1 用认知工具在语言模型中激发推理 06-18 认知推理 2 借鉴认知科学提升 AI 推理解释的真实性 12-31 抽象、对齐、预测:基于认知归纳推理的零样本立场检测 06-18 认知链 1 ECCoT:通过认知链验证增强大型语言模型的有效推理 06-25 训练策略 1 无 CoT 数据下:Next-Chunk Reasoning RL 真的优于 SFT 吗? 08-25 训练配方 1 字节跳动 Seed 开源强化学习配方 POLARIS,4B 模型数学推理接近 235B 模型表现 07-17 记忆陷阱 1 MemTrapBench:评测 LLM 记忆使用中的认知陷阱 08-22 评测偏差 1 自动化评估应区分模型能力与决策偏好 12-31 评测基准 2 LLM 评测基准综述与多模态推理新基准 10-23 AI 基准测试:从专业难题到大众谜题,探索 AI 推理能力 10-23 评测审计 1 垃圾输入,推理输出?为何基准分数不可靠及如何应对 07-01 评论器训练 1 BPCO:稳定高效训练大模型评论器 08-25 课程学习 2 PAC:面向大模型多任务强化学习的进度增强优势课程 09-01 百个种子问题驱动的多智能体课程生成 12-31 负向微调 1 NFT:利用隐式负向策略提升数学推理能力 06-23 趋势预测 1 2026—2027年大模型行业两大里程碑 08-12 跨域经验迁移 1 Isaac 启发学习:跨域经验驱动大模型认知内生化 08-27 轻量化模型 1 DFM Mimir v1:仅用许可数据训练的 1B HRM 模型 08-17 过程奖励模型 4 Cliff:从首次错误学习过程奖励 09-03 SPRO:使用掩码步骤优势进行自我引导的过程奖励优化 07-02 SPARE:基于参考引导评估的单次过程标注框架 06-23 从数学推理到代码:测试时扩展中过程奖励模型的泛化 06-04 过程评测 1 LCoT-GV:基于图注意力网络的长思维链验证 09-01 进化搜索 1 LLM 引导的进化搜索:通向超级智能混合系统的新方向 12-31 进化策略 1 进化策略实现比 GRPO 更广的 LLM 推理覆盖 08-28 连续推理 3 扩散课程训练实现无时间步迭代推理 09-02 SynAdapt:利用合成连续思维链实现高效自适应推理 08-05 田渊栋团队:连续思维链通过“叠加态”实现多路径并行推理 06-20 通用推理 1 RLPR:无需验证器将RLVR扩展到通用领域 06-28 逻辑增强 1 FLARE:忠实的逻辑辅助推理与探索 10-16 逻辑推理 2 ACL 2025:让 LLM 像逻辑学家一样思考 07-28 清华推出“AI数学家”:可自主调用定理并构建证明思路 06-04 逻辑生成 1 LAG:从笛卡尔视角出发的逻辑增强生成 12-31 采样校准 1 正确概率更高,答案反而更差:Power Sampling 的失效与修复 08-17 量化感知训练 1 SageAttention3:FP4 量化加速注意力并探索 8 比特训练 06-19 金融推理 1 FinCoT:以专家知识为基础的金融思维链推理 06-24 错误共识 1 分解 LLM 自洽投票中的错误共识:GPT-4.1 案例研究 08-20 错误反思 1 LEMMA:用“错题本”反思学习提升大模型数学推理能力 06-19 音频生成 1 阿里通义开源首个 CoT 泛音频生成模型 ThinkSound 07-02 领域泛化 1 从一般推理到领域专业知识:揭示大型语言模型泛化的局限性 06-30 题目生成 1 自动生成用于阅读理解评估的推理问题 06-12 首步纠错 1 在推理的开始迷失:首个推理步骤对长链推理的关键影响 06-30 验证器模型 1 CompassVerifier:3B验证模型与多领域高难度基准 VerifierBench 12-31 高效探索 1 字节跳动与MAP提出FR3E:以结构化高效探索提升大模型强化学习上限 12-31