2025-02-03 科研追新

当日精选(由提交工具自动创建)。

多数投票驱动的推理模型迭代式自我训练

Nayoung Lee 等人探索利用模型生成更难问题、多数投票筛选答案并反复训练,从而在迷宫求解和乘法运算等推理任务上实现迭代式能力提升。

 逻辑推理 推理 自进化 模型训练 数据合成

研究提出一种循环式自我训练方案:由具备较强推理能力的基础模型生成更具挑战性的问题,再筛选出高质量答案作为新训练数据。答案筛选可以采用多数投票,也可以引入更多测试时计算。模型随后基于这些问题与优质解继续训练,并重复生成、筛选和训练过程。Nayoung Lee 等人在迷宫解谜、乘法运算等任务上研究了这一机制。

用途与启示
  • 为缺少人工标注的逻辑推理任务提供可迭代的数据合成与训练路径
  • 表明多数投票和测试时计算可以充当自我训练过程中的答案质量控制机制
  • 可用于研究模型能否持续生成超出当前训练分布难度的问题并实现能力自举
  • 提醒实践中关注错误答案被反复训练后产生的累积与放大风险
📝 原始笔记(逐字保留)
2. 一个可能的示例循环如下: * 选择一个拥有强大基础模型和高级推理能力的 AI 系统; * 让其生成一套新的、更具挑战性的问题集; * 通过某种方法(可能是多数投票,也可能是测试时计算)筛选出优质答案; * 基于这些新的、更优解进行训练,并重复这一过程。 Nayoung Lee 等人基于多数投票机制探讨了这一问题。他们研究了迷宫解谜和乘法运算等多种任务。论文链接:https://arxiv.org/pdf/2502.01612 ### 大型语言模型中「波将金式」(Potemkins)推理
0%