强化学习 LLM-DailyDigest 2025-11-06 2025-11-06 约 100 字 预计阅读 0 分钟 相关消息(按子主题自动聚合) 世界模型 1 NashDreamer:面向零和不完美信息博弈的模型式强化学习 09-02 中期训练 2 首创 Mid-training 范式破解 RL 奥秘,Llama 推理性能追平 Qwen 07-01 OctoThinker:中期训练促进强化学习规模化 06-25 代码模型 1 后训练语言模型实现信息学竞赛金牌级表现 09-03 价值估计 1 Le Critique:用于 LLM 强化学习的特权价值函数 08-18 价值权衡 1 你内心有许多狼:运用认知模型解读 LLM 中的价值权衡 06-25 优势公平性 1 ARC:开放式交互中的公平相对优势比较 08-26 低成本训练 1 游戏玩家可以训练数学推理模型吗? 06-12 低资源推理 1 低资源语言推理:SFT 构建语言习惯,RL 修复行为缺陷 08-19 信息检索 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-27 信用分配 1 CrEST:面向多轮多步 LLM 智能体的验证器约束信用分配 08-16 偏好优化 1 隐式奖励作为桥梁:SFT 与 DPO 连接的统一视图 06-15 元认知 2 评估与改进大语言模型的自我建模能力 09-01 MERA:通过推理-控制分离与 CSPO 实现元认知控制 12-31 元进化 1 OpenMLE:单卡运行的 AI 自进化全栈系统 08-12 具身基础模型 1 LightNav-0:激发 VLM 空间智能的通用具身导航模型 09-02 具身导航 1 Embodied-Navigator:定位、思考、记忆与对齐的高效具身导航 08-20 具身推理 1 R³:用强化学习训练机器人进行自然语言推理 08-27 具身规划 1 Embodied Planner-R1:通过强化学习释放 LLM 的具身任务规划能力 07-01 内在反馈 1 RLIF:利用模型内在置信度实现无外部监督的强化学习 12-31 内在奖励 1 Learning to Reason without External Rewards:无需外部奖励的推理学习 05-26 决策解释 1 使用强化学习训练大型语言模型解释人类决策 05-16 分布式训练 1 并行与分布式推理语言模型的性能基础 08-28 前沿挑战 1 大模型强化学习的关键挑战与下一代范式 12-31 前缀滑动窗口 1 Prefix Sliding:高效扩展测试时推理 08-27 医疗人工智能 1 百川开源医疗推理模型 Baichuan-M2-32B,HealthBench 超越 GPT-OSS-120B 08-11 协同演化 1 清华 CPMöbius:Coach-Player 协作共演化实现自主出题训练 08-12 协同追捕 1 OGR-MARL:受约束港区异构无人艇协同追捕 08-16 博弈推理 1 以玩促泛化:通过游戏学习推理 06-11 博弈智能体 2 DipLLM:以少量数据微调大模型的外交博弈智能体框架 07-02 TextAtari:语言智能体仅用 10 万帧完成游戏学习 06-09 反思优化 1 SRPO:面向长程推理的自反思策略优化 08-25 反思回溯 1 ASTRO:通过上下文反思与回溯训练语言模型推理 07-01 反馈优化 1 Critique-GRPO:利用自然语言与数值反馈推进大模型推理 06-04 反馈协同演化 1 CAFE:搜索智能体与反馈批评器协同进化 08-26 可靠性训练 1 基于可验证奖励训练接地大模型的经验总结 06-23 可验证奖励 1 具有可验证奖励的强化学习可隐式激励基础大模型正确推理 06-19 合成强化 2 Synthetic Data RL:仅靠任务定义合成数据并强化学习 06-25 合成数据强化学习:任务定义即你所需 05-23 合成数据训练 1 Synthetic Data RL:仅凭任务定义生成数据并强化学习 12-31 同声传译 1 SeqPO-SiMT:序贯策略优化让同传性能直逼离线翻译 07-01 响应对齐 1 PatternEval:混合思考多模态模型的响应行为对齐 08-24 图像编辑 1 DARS:面向指令图像编辑的双层信用分配强化学习 08-21 图形用户界面探索 1 ScreenExplorer:基于好奇心机制自主探索 GUI 的视觉语言智能体 06-28 图形用户界面纠错 1 GUI-Critic-R1:为GUI智能体操作加上“紧急刹车” 06-18 图推理 1 GRAIN:以结构不变奖励提升真实世界图推理鲁棒性 08-28 在线演化 1 Continual Harness:智能体脚手架的在线持续进化 08-25 在线训练 1 桥接大语言模型的离线与在线强化学习 06-27 基站部署 1 多智能体离策略深度强化学习优化智慧校园覆盖 08-20 多智能体协作框架 1 HiRS-Agent:面向长程遥感任务的分层多智能体系统 09-01 多智能体系统 1 通过多智能体反思增强大语言模型推理 06-12 多模态推理 2 智谱开源 GLM-4.1V-9B-Thinking:9B 参数模型斩获 23 项 SOTA 07-03 GRPO-CARE:面向多模态推理的一致性感知强化学习 06-24 多模态搜索 1 MMSearch-R1:激励大型多模态模型自主搜索 06-26 多模态训练 1 CPGD:仅用数学训练,跨学科推理超越 o1并缓解强化学习训练崩溃 06-24 奖励优化 1 SA-MRPO:面向多奖励策略优化的饱和感知优势重加权 08-19 奖励建模 11 响应级奖励就是 LLM 在线强化学习所需的一切:数学视角 12-31 周志华团队理论证明:LLM中可挖掘内源性通用奖励模型 07-03 Skywork-Reward-V2:通过人机协同扩展高质量偏好数据管理 07-02 通才奖励模型:从大型语言模型中发现内生奖励 06-29 通才奖励建模的推理时间缩放:SPCT 06-28 RewardAnything:用自然语言定义通用奖励原则 06-27 奖励模型也能 Scaling:上海 AI Lab 提出策略判别学习新范式 06-24 ReasonGRM:借助大型推理模型增强生成奖励模型 06-24 ReasonGRM:通过大型推理模型增强生成式奖励模型 06-23 从通用奖励到定向奖励:在开放式长文本生成任务中超越 GPT-4 06-23 大语言模型在线强化学习仅需响应级奖励:数学视角 06-04 奖励机制 4 MedAgent-R1:面向循证医疗推理的忠实度感知强化学习 09-01 RLSVR:面向开放式任务的自验证奖励框架 08-11 结果奖励驱动可泛化推理策略 12-31 强化学习奖励机制现状:验证、粒度与训练策略 12-31 奖励模型评测 2 RewardBench 2:推进奖励模型评估 06-04 RewardBench 2:高级奖励模型评估 06-02 奖励蒸馏 2 OPDVR:基于可验证奖励的在线策略蒸馏 08-27 AdvDistill:通过奖励引导的数据集蒸馏增强小语言模型推理能力 07-02 奖励黑客 1 让模型在思维链中明确解释奖励黑客行为 06-28 对齐优化 1 基于动态奖励加权的多目标对齐优化学习 09-16 工具使用训练 3 单策略强化学习超越树搜索的化学工具调用 09-01 ToolTrain:借助代码库检索工具提升大模型问题定位能力 12-31 MCP·RL:用强化学习训练智能体自主发现并调用工具 12-31 工具调用 1 多工具智能体的全自动推理轨迹生成与训练 12-31 工程进化 1 腾讯混元两项工作:Harness Handbook 与 RST 递归任务合成 08-20 并行推理 3 腾讯AI Lab俞栋团队开源首个并行思考强化学习框架 Parallel-R1 12-31 Parallel-R1:通过强化学习让大模型学会并行思维 09-17 谷歌发布 IMO 金牌级模型 Gemini 2.5 Deep Think 08-01 开发评测 1 SWE-Dev:评估与训练自主特性驱动软件开发系统 05-16 弱模型探索 1 弱模型引导提升 RLVR 推理探索能力 08-28 弱点合成 1 SwS:LLM 推理强化学习中的自我感知弱点驱动问题合成 06-12 强化学习 4 言语强化学习的兴起:自然语言反馈统一框架 09-02 清华、上海AI Lab等团队发布推理模型强化学习综述 12-31 大型推理模型的强化学习研究综述 09-11 Magistral:Mistral 首个推理模型与可扩展强化学习管线 06-13 强化学习后训练 1 OraRL:将标注作为视频 MLLM 的神谕轨迹 08-27 形式化证明 3 AlphaProof 技术解析:结合强化学习、自动形式化与 Lean 证明反馈 12-31 StepFun-Prover:基于环境反馈的形式化证明训练 12-31 Goedel-Prover-V2:通过分阶段数据合成与自我纠正扩展形式定理证明 08-05 思维链 1 SHAPE:解析数学推理中思维链的形态 09-02 成本优化 1 DynScaling:基于动态集成采样的无验证器高效推理扩展 06-24 扩散模型 1 DiffuCoder:理解并改进用于代码生成的掩码扩散模型 06-25 扰动推理 1 PertMind:用细胞扰动强化学习激发生物推理能力 08-18 技术生态 1 AI4AI 从自进化、元进化迈向递归自我改进 08-12 技能优化 1 WER:通过执行反馈强化学习实现技能优化 08-19 技能演化 2 SkillForge:面向强化学习智能体的可验证技能演化 08-26 CODESKILL:编码智能体的自进化技能学习 08-14 技能自博弈 1 阿里 Skill-SP:以自进化技能库实现高质量自博弈 08-12 持续学习 1 JitRL:免梯度实现 LLM Agent 测试时持续学习 08-22 持续推理 1 Continual Reasoning Gym:持续 RLVR 中的共享推理与提示回放 08-20 探索推理 1 探索推理:一种熵的视角 06-19 探索锐化 1 自进化时代需要兼顾锐化与探索的新型强化学习 08-27 推理优化 2 GMTS:基于梯度幅度的词元选择改进大模型 RLVR 推理训练 09-01 直接推理优化:LLM 自我奖励并完善开放式任务推理 06-18 推理强化 1 SPIRAL:强化学习筛选并强化可泛化推理模式 12-31 推理扩展 1 五年前的“开放式推理”设想预见 OpenAI o1、o3 路线 08-15 推理效率 2 简单问题快速答,困难问题深入想:基于幂次长度惩罚的高效推理 06-13 Bingo:通过动态与显著性强化学习提升大模型推理效率 06-12 推理模型 1 大推理模型强化学习综述 12-31 推理迁移 1 数学推理训练能否提升 LLM 的通用能力?推理能力的可转移性研究 07-01 提示合成 1 PromptCoT 2.0:以 EM 循环合成高难度推理任务 12-31 搜索推理 1 R-Search:通过多奖励强化学习与搜索增强大模型推理 06-09 数学推理 5 MiroMind-M1:基于 Qwen-2.5 的开源数学推理模型 12-31 DeepMind FunSearch 发现目前最大的 Cap Set 12-31 OpenAI与DeepMind在IMO 2025中均攻克5道题 12-31 AceReason-Nemotron 1.1:通过 SFT 与 RL 协同提升数学和代码推理 06-18 数学推理大型语言模型研究综述 06-10 数学数据 1 DeepMath-103K:用 10.3 万道高难数学题突破大模型推理瓶颈 06-12 数据合成 1 AlphaGeometry:用合成数据学习几何辅助线生成 12-31 数据泄露 1 真相大白!RL不是魔法,随机奖励有效只是由于数据泄露 07-18 无教师蒸馏 1 Self-OPD:无需教师的流匹配模型在策蒸馏 08-29 无监督训练 1 MM-UPT:基于 GRPO 的多模态大模型无监督持续自我改进框架 05-28 智能体强化学习 1 Agent Lightning v1.0:面向脚手架式智能体强化学习 08-19 智能体推理 1 Agentic-R1:7B小模型的逆袭,让LLM学会“见招拆招” 07-18 智能体自进化 4 斯坦福 AgentFlow:智能体在交互中实时进化 10-14 SEAgent:从经验中自主学习的自进化计算机使用代理 08-06 SEA:面向计算机使用的自我进化代理 08-06 UI-Genie:面向移动端 GUI 智能体的自改进框架 05-28 智能体训练 2 L0:面向通用智能体的可扩展端到端强化学习训练系统 07-01 Agent-RLVR:通过指导与环境奖励训练软件工程智能体 06-16 智能体评测 1 TextAtari:使用语言智能体挑战10万步Atari游戏 06-05 机器人学习 1 MuJoCo Playground:面向机器人学习与仿真到现实迁移的开源框架 06-26 架构研究综述 1 长程智能体综述:Harness 与模型协同优化 08-22 模型发布 3 GLM-5.3:后训练 Scaling 提升编程与网络安全能力 08-14 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 Kimi K3:开放前沿智能模型 08-07 模型微调 1 NoRA:归一化低秩适配提升 LoRA 训练稳定性 09-02 模型训练 4 StudentSim:个性化 LLM 学生模拟器训练框架 09-02 SFT-RL 标注预算的跨模型规模近优分配 09-02 从生产流量到后训练:构建覆盖企业请求的自托管 LLM 09-02 Jan-nano 技术报告:以多阶段 RLVR 训练高效 4B 搜索型语言模型 06-28 模型路由 1 Router-R1:通过强化学习实现多轮大模型路由与聚合 06-12 模型验证 1 CompassVerifier:统一支持 LLM 评估与结果奖励的鲁棒验证器 08-06 泛化迁移 1 打破领域障碍:强化后训练的推理收益能否迁移到未见领域? 06-25 测试时优化 1 TTPO:测试时策略优化 08-28 测试时计算 1 e3:学习探索实现大模型测试时计算外推 06-12 测试生成 1 CodeContests+:为竞技编程生成高质量测试用例 06-10 深度研究智能体 1 MiroMind ODR:开放深度研究全流程项目 12-31 混合微调 2 SRFT:单阶段融合监督与强化学习的大模型微调方法 07-03 SRFT:统一监督微调与强化学习的单阶段推理训练方法 06-25 混合控制 1 LLM 常识推理驱动的自动驾驶多智能体编排 08-21 游戏推理 3 ViGaL:仅通过游戏强化学习提升多模态推理能力 06-25 ViGaL:用街机游戏训练多模态模型的跨领域推理能力 06-18 玩以致泛化:通过游戏学习推理 06-09 游戏数据合成 1 智能体游戏开发:可验证轨迹数据引擎扩展世界模型 08-29 潜在表征 1 Scaffolding Minds:优化多模态推理的潜在视觉目标表征 08-21 环境协同演化 1 EnvHarness:让静态环境适应智能体学习 08-21 环境合成 2 CogEvol:高效可靠的学习环境生成模型 09-02 AgentMercury:规模化合成可验证商业智能体环境 08-24 环境正则化 1 ERPO:以环境正则化破解策略优化的稳定—探索困境 08-25 环境自博弈 1 SPADE:自适应可执行环境中的自博弈 08-20 研究观点 1 强化学习之父:大语言模型是一个错误的起点 12-31 离策略强化学习 1 WarpSAC:面向不同数据规模的可扩展离策略强化学习 08-28 科研智能体 2 PaperGym:以评分准则驱动科研计划生成与训练 09-01 Intern-S2-Preview:科学智能体基础模型 08-15 程序修复 1 北大、字节跳动等发布 SWE-Swiss:面向代码修复的开源训练方案 12-31 空间认知 1 MindCube:从有限视图构建空间心智模型 06-27 答案验证 1 CompassVerifier:面向多领域答案评估与奖励的轻量级验证模型 12-31 策略优化 4 TASPO:协调过程监督与结果信用的智能体策略优化 09-01 SAPO:面向智能体强化学习的单轨迹自回归策略优化 08-21 GUPO:面向大模型后训练的梯度不确定性感知策略优化 08-19 Qwen3 提出 GSPO:从序列级重要性采样改进 GRPO 12-31 算力分配 1 Learning When to Think:自适应分配测试时推理算力 08-21 算法比较 1 DPO 与 GRPO 在自回归图像生成中的系统性对比 06-20 结构推理 1 通过结构化推理增强大语言模型 06-26 缺失前提识别 1 ACA-RL:面向缺失前提推理的询问、条件回答与弃答强化学习 08-18 群体推理 1 Co-RL:多样化智能体群体涌现无监督推理 08-21 脚手架协同演化 1 TaoLive:让数字化身智能体与工具链共同进化 08-29 自博弈 7 SSR:通过自博弈训练超智能软件智能体 08-14 SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」 12-31 零和博弈自对弈驱动模型自主学习推理 12-31 SPIRAL:通过多智能体多轮强化学习在零和博弈自博弈中激励推理 12-31 SPIRAL 强化学习代码仓库 12-31 以游戏自对弈筛选可泛化思维链 12-31 SPIRAL:零和博弈自博弈激发可迁移推理能力 06-30 自我奖励 1 一致的路径通向真理:面向LLM推理的自我奖励强化学习 06-12 自我学习 1 MIT SEAL:通过自生成数据与权重更新实现模型自我适应 12-31 自我改进 1 在策略蒸馏真的在蒸馏吗?从噪声教师到自我改进 09-01 自我确定 1 用 KL 散度衡量模型的「自我确定性」 12-31 自我纠错 1 PAG:以策略作为生成式验证器的多轮强化学习自我纠错 06-13 自我训练 1 CMU 提出自我奖励训练 SRT:大模型能否实现无标签自训练? 05-27 自我验证 1 LLM-as-a-Verifier:自验证让 DeepSeek V4 Flash 低成本反超闭源模型 08-21 自进化 5 超越人类监督扩展大型推理模型:通往超级智能的路径 09-01 动态反馈推动智能体持续自我优化 12-31 Meta:智能体无需奖励或模仿,利用早期经验主动学习 10-11 ML-Agent:7B智能体仅用9个任务训练实现自主机器学习工程 06-23 DeepMind 发布 AlphaEvolve,以进化算法广度探索解空间 05-14 自进化框架 1 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 自适应 1 自适应语言模型(SEAL) 06-12 自适应引导 1 自适应引导加速推理模型的强化学习 06-19 自适应聚合 1 pFedMARL:多智能体强化学习自适应聚合非 IID 联邦数据 08-27 蒸馏路由 1 I-SDPO:实例级自适应自蒸馏策略优化 08-16 融合范式 1 跨领域 RLVR 能力整合:三类融合范式比较 08-28 规则推理 1 RuleReasoner:通过领域感知动态采样强化规则推理 06-12 规模扩展瓶颈 1 Orion性能未达预期,三大瓶颈制约模型扩展 12-31 视觉推理 4 VBVR-Pro:可扩展、可验证的原生视觉推理套件 08-27 ViLaSR-7B:通过“边画边想”学习人类式空间推理 06-23 SynthRL:以可验证数据合成扩展视觉推理 06-04 SynthRL:通过可验证的数据合成扩展视觉推理 06-03 视觉生成 1 GoT-R1:强化学习解锁多模态视觉生成推理新范式 06-26 视频生成 1 DreamX-Creator:普惠化原生 2K 音视频联合生成 09-02 训练-推理对齐 1 LEGO-RL:面向编程智能体原生 Harness 的强化学习框架 08-19 训练优化 1 两篇 ICLR 论文破解强化学习的两个关键难题 07-18 训练策略 1 无 CoT 数据下:Next-Chunk Reasoning RL 真的优于 SFT 吗? 08-25 训练系统 1 Rollplex:VLM 后训练的跨阶段 GPU 空间共享 08-17 训练配方 1 字节跳动 Seed 开源强化学习配方 POLARIS,4B 模型数学推理接近 235B 模型表现 07-17 评论器训练 1 BPCO:稳定高效训练大模型评论器 08-25 语义先验 1 Semantic Bandits:语义先验如何影响上下文探索与利用 08-18 语言反馈 1 可证明地从语言反馈中学习:HELiX 算法与理论框架 06-13 课程发布 1 斯坦福 CS329A:自改进 AI Agent 课程公开 08-26 课程学习 1 PAC:面向大模型多任务强化学习的进度增强优势课程 09-01 课程学习研究综述 1 斯坦福新课 CS329A:Self-Improving AI Agents 08-21 课程生成 1 Ornith-1.5自生成任务闭环提升编码智能体 08-27 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 负向微调 1 NFT:利用隐式负向策略提升数学推理能力 06-23 资源图谱 1 LLM强化学习环境与开源训练框架资源图谱 12-31 资源研究综述 1 Awesome Self-Improving Agents:自改进智能体资源库 08-12 资源调度 1 Libra:Agentic RL 后训练动态资源管理系统 08-14 辩论式对齐 1 辩论训练减少 RLAIF 奖励作弊 08-19 过滤式微调 1 TailSFT:过滤式微调提升强化学习后训练性能 08-27 过程信用分配 1 MileGPO:基于局部证据的长程智能体里程碑信用分配 08-21 过程奖励模型 4 Cliff:从首次错误学习过程奖励 09-03 SPRO:使用掩码步骤优势进行自我引导的过程奖励优化 07-02 SPARE:基于参考引导评估的单次过程标注框架 06-23 从数学推理到代码:测试时扩展中过程奖励模型的泛化 06-04 进化搜索 1 LLM 引导的进化搜索:通向超级智能混合系统的新方向 12-31 逆序优化 1 RTPO:以逆序轮次优化稳定智能体强化学习训练 08-20 通用推理 1 RLPR:无需验证器将RLVR扩展到通用领域 06-28 长期记忆 1 ContextPilot:用细粒度强化学习实现主动上下文管理 09-01 长程任务研究综述 1 长程智能体综述:Harness 工程与模型优化协同演化 08-14 问题定位 1 ToolTrain:面向代码问题定位的两阶段工具集成训练框架 12-31 难度调度 1 基于图结构在线难度估计的高效 RLVR 调度 08-19 预训练 2 强化学习也能预训练?潜在意图与流匹配带来最高20倍提升 06-30 「Next-Token」范式改变:强化学习预训练来了 06-12 题目生成 1 Ornith-1.5 自出题强化学习闭环,两月自测提升 11% 08-28 高效探索 1 字节跳动与MAP提出FR3E:以结构化高效探索提升大模型强化学习上限 12-31 高斯引导 1 Agent-G²:面向智能体强化学习的高斯引导 08-25 鲁棒协作 1 SIGMA:面向结构化噪声效应的分组多智能体聚合 08-29 黑箱训练 1 ClawGym II:面向 Agent Harness 的黑箱强化学习 08-18 默契合谋 1 AI 智能体在算法化电力市场中涌现默契合谋 08-29