EvolveLRM

EvolveLRM

研究方向:大推理模型(LRM)的自我进化——通过 RL / 自我博弈等让推理模型持续提升。

研究范畴

大推理模型(Large Reasoning Model, LRM)的自我进化,聚焦于通过强化学习 / 自我博弈 / 过程奖励 / 树搜索等范式,让"System 2"式长链推理模型在推理质量上持续提升。本方向涵盖:RL 后训练、自我博弈、过程 / 结果奖励、搜索增强训练、长思维链与推理时计算。社区关注的核心问题包括:RL 训练带来的能力提升能否泛化到分布外任务、奖励稀疏 / 奖励作弊与"伪推理"如何识别与缓解、探索—利用的平衡与思维链忠实度(faithfulness),以及训练效率与推理时算力的权衡。

研究挑战

  • 训练稳定性、奖励设计与奖励黑客。
  • 高昂的算力与数据成本。
  • 评测上限(benchmark saturation)与防污染。
  • 推理安全(越狱、长链中的错误累积)。

自研项目

  • EvolveLRM — 面向逻辑推理的自我进化闭环框架,自动跑通"评测 → 数据选择 → 训练 → 再评测";含 Evaluator / DataMaker / Trainer 三模块与 Planner / Adapter / Logger,支持 SFT 与 RL(PPO/GRPO/LoRA)及底层训练框架热插拔。

相关工作

代码 / 框架

论文

相关工作(按子主题自动聚合)

元进化 1

分布式训练 1

协同演化 1

反思优化 1

反思早停 1

图推理 1

奖励机制 1

奖励蒸馏 1

实验设计 1

工程模型 1

师生协同适应 1

弱模型探索 1

循环稳定性 1

技能演化 2

技能自博弈 1

持续推理 1

探索锐化 1

数据自演化 1

框架演化 1

测试时优化 1

测试时训练 1

潜在表征 1

潜空间推理 1

环境自博弈 1

科研工作流编排 1

科研智能体 1

策略优化 1

策略固化 1

算力分配 1

自动化科研 1

自博弈 1

自我改进 1

自我验证 1

自蒸馏 1

自进化 2

自进化框架 1

蒸馏路由 1

训练框架 1

训练策略 1

记忆蒸馏 1

评论器训练 1

资源调度 1

跨域经验迁移 1

进化策略 1

递归自我改进 1

题目生成 1

0%