LogicEvolve

LogicEvolve

研究方向:大型语言模型的逻辑推理能力自我进化——让模型在逻辑 / 多步推理上持续自我改进。

研究范畴

大型语言模型的逻辑推理能力自我进化,关注让模型在形式逻辑、多步 / 组合推理上持续自我改进。本方向涵盖:神经符号(neuro-symbolic)推理、逻辑推理基准、自我验证 / 自我校正,以及 System 1 → System 2 的能力跃迁。社区关注的核心问题包括:推理过程的逻辑忠实度(faithfulness)与可验证性、组合泛化与分布外泛化及推理鲁棒性、符号求解器 / 验证器如何与神经网络互补,以及自我进化是否会放大逻辑错误(幻觉沿推理链传播)。

研究挑战

  • 逻辑正确性的自动验证困难、ground truth 成本高。
  • 基准污染与"模式匹配"伪推理。
  • 符号化方法的可扩展性与工程复杂度。
  • 评测有效性:区分真实推理与记忆。

自研项目

  • CLUB-benchmark (LogicEvolve) — 复杂逻辑推理的智能体评测与自进化平台,统一演绎/归纳、多跳、符号、程序与博弈逻辑,支持 CLUB/CLUBv2/ToolCLUB/ExCLUB/BBH/SynLogic/LogiQA2 等多基准,覆盖数据合成、评测、训练(LLaMA-Factory/verl)与可视化榜单全链路。
  • clubWeb — LogicEvolve/CLUB 的可视化榜单前端(React + TypeScript + Vite),即 clubweb.site。

相关工作

代码 / 框架

论文

相关工作(按子主题自动聚合)

世界模型 1

协同演化 1

叙事一致性 1

图推理 1

复合推理 1

奖励机制 1

形式化证明 2

形式化验证 1

技能演化 2

技能自博弈 1

改进脆弱性 1

概念研究综述 1

游戏生成 4

物理重建 1

程序修复 1

自蒸馏 1

谜题评测 1

长程任务研究综述 1

长程智能体 1

0%