模型训练 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 模型训练 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) AI辅助编程 1 昆仑万维发布软件工程智能体模型 Skywork-SWE-32B 06-20 三层框架 1 自进化(Self-evolving/RSI)三层框架与实践路径 08-30 上下文压缩 1 LatentPress:超越文本与视觉的上下文压缩 09-02 下游任务适配 1 为下游任务优化语言模型:训练后视角 06-27 中期训练 2 首创 Mid-training 范式破解 RL 奥秘,Llama 推理性能追平 Qwen 07-01 OctoThinker:中期训练促进强化学习规模化 06-25 临床评测 1 LLM作为模糊评判:微调大模型用于临床评估 06-16 交互控制 1 OS-Kairos:以置信度机制避免 GUI 智能体“过度执行” 07-03 代码模型 2 后训练语言模型实现信息学竞赛金牌级表现 09-03 CodeFuse-CGM:面向代码智能的开源代码图模型 06-28 价值权衡 1 你内心有许多狼:运用认知模型解读 LLM 中的价值权衡 06-25 任务生成 1 TaskCraft:自动生成代理式任务与执行轨迹 06-13 低成本训练 1 游戏玩家可以训练数学推理模型吗? 06-12 低资源学习 1 面向低资源大模型任务的可迁移提示与对齐策略 07-01 体裁扩展 1 属性引导的多体裁创意写作数据扩展 08-21 信息检索 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-27 偏好优化 5 基于激活标签传播的低资源大模型偏好适配 09-01 PLC-DPO:噪声与模糊偏好优化中的后验标签校正 09-01 FaST:面向个性化偏好对齐的特征感知采样与调优 08-07 使用规则引导的合成数据进行可配置偏好调优 06-16 隐式奖励作为桥梁:SFT 与 DPO 连接的统一视图 06-15 元学习 1 使用元学习检测维基百科傀儡账号 06-13 元认知 3 MERA:分离推理与控制的元认知推理框架 12-31 MERA:通过推理-控制分离与 CSPO 实现元认知控制 12-31 元优化与元认知:从训练效率到模型自我反思 08-06 具身基础模型 3 ZimaBlue:可扩展视频预训练驱动的泛化世界行动模型 09-03 INDI:为视觉-语言-动作模型蒸馏行为意图 09-01 地平线与极佳提出几何一致视频世界模型,增强机器人策略学习 06-27 具身规划 1 Embodied Planner-R1:通过强化学习释放 LLM 的具身任务规划能力 07-01 内在反馈 1 RLIF:利用模型内在置信度实现无外部监督的强化学习 12-31 内在奖励 1 Learning to Reason without External Rewards:无需外部奖励的推理学习 05-26 决策解释 1 使用强化学习训练大型语言模型解释人类决策 05-16 创意写作 1 LitBench:可靠评估创意写作的基准与数据集 07-02 动作推理 1 Chain-of-Action:通过轨迹自回归实现动作推理的模仿学习新范式 07-18 协作合成 1 GRA:多角色小模型协作生成媲美大模型的高质量训练数据 06-18 协同演化 3 J-Zero:零数据下挑战者、求解器与评判者统一协同进化 09-01 清华 CPMöbius:Coach-Player 协作共演化实现自主出题训练 08-12 Socratic-Zero:以苏格拉底式教学推动智能体协同进化 12-31 博弈智能体 1 DipLLM:以少量数据微调大模型的外交博弈智能体框架 07-02 原型推理 1 ProtoReasoning:以推理原型提升大模型跨领域泛化能力 06-23 参数高效微调 1 Progtuning:基于 Transformer 语言模型的渐进式微调框架 06-27 反例推理 1 ICML 2025:首个反例驱动推理基准揭示大模型“刷题式假象” 10-23 反思回溯 1 ASTRO:通过上下文反思与回溯训练语言模型推理 07-01 反馈优化 1 Critique-GRPO:利用自然语言与数值反馈推进大模型推理 06-04 可扩展推理 1 SLR:可扩展逻辑推理的自动化综合框架 06-23 可靠性训练 1 基于可验证奖励训练接地大模型的经验总结 06-23 可验证奖励 1 具有可验证奖励的强化学习可隐式激励基础大模型正确推理 06-19 合成强化 2 Synthetic Data RL:仅靠任务定义合成数据并强化学习 06-25 合成数据强化学习:任务定义即你所需 05-23 合成数据训练 1 Synthetic Data RL:仅凭任务定义生成数据并强化学习 12-31 同声传译 1 SeqPO-SiMT:序贯策略优化让同传性能直逼离线翻译 07-01 图像生成 1 GenFirst:先生成后重建的稳定端到端潜在生成建模 09-02 图形用户界面探索 1 ScreenExplorer:基于好奇心机制自主探索 GUI 的视觉语言智能体 06-28 在线训练 1 桥接大语言模型的离线与在线强化学习 06-27 基础模型 1 中国移动发布九天基础大模型3.0,性能提升35% 07-26 增量评测 1 关系深度学习的增量评测与训练 08-16 多智能体系统 1 通过多智能体反思增强大语言模型推理 06-12 多模态推理 2 智谱开源 GLM-4.1V-9B-Thinking:9B 参数模型斩获 23 项 SOTA 07-03 GRPO-CARE:面向多模态推理的一致性感知强化学习 06-24 多模态搜索 1 MMSearch-R1:激励大型多模态模型自主搜索 06-26 多模态训练 1 CPGD:仅用数学训练,跨学科推理超越 o1并缓解强化学习训练崩溃 06-24 奖励建模 11 响应级奖励就是 LLM 在线强化学习所需的一切:数学视角 12-31 周志华团队理论证明:LLM中可挖掘内源性通用奖励模型 07-03 Skywork-Reward-V2:通过人机协同扩展高质量偏好数据管理 07-02 通才奖励模型:从大型语言模型中发现内生奖励 06-29 通才奖励建模的推理时间缩放:SPCT 06-28 RewardAnything:用自然语言定义通用奖励原则 06-27 奖励模型也能 Scaling:上海 AI Lab 提出策略判别学习新范式 06-24 ReasonGRM:借助大型推理模型增强生成奖励模型 06-24 ReasonGRM:通过大型推理模型增强生成式奖励模型 06-23 从通用奖励到定向奖励:在开放式长文本生成任务中超越 GPT-4 06-23 大语言模型在线强化学习仅需响应级奖励:数学视角 06-04 奖励机制 3 RLSVR:面向开放式任务的自验证奖励框架 08-11 结果奖励驱动可泛化推理策略 12-31 强化学习奖励机制现状:验证、粒度与训练策略 12-31 奖励模型评测 3 Agent-RewardBench:面向现实世界多模态智能体的统一奖励建模基准 06-27 RewardBench 2:推进奖励模型评估 06-04 RewardBench 2:高级奖励模型评估 06-02 奖励蒸馏 1 AdvDistill:通过奖励引导的数据集蒸馏增强小语言模型推理能力 07-02 奖励黑客 1 让模型在思维链中明确解释奖励黑客行为 06-28 对齐优化 1 基于动态奖励加权的多目标对齐优化学习 09-16 工具使用元学习 1 MetaAgent:通过工具元学习实现自我进化智能体 08-01 工具使用训练 3 MidTool:面向智能体工具使用的中期训练数据合成 08-21 ToolTrain:借助代码库检索工具提升大模型问题定位能力 12-31 MCP·RL:用强化学习训练智能体自主发现并调用工具 12-31 工具调用 1 多工具智能体的全自动推理轨迹生成与训练 12-31 并行推理 1 Parallel-R1:通过强化学习让大模型学会并行思维 09-17 开发评测 1 SWE-Dev:评估与训练自主特性驱动软件开发系统 05-16 开放式推理 1 PuzzleWorld:面向益智寻谜的多模态开放式推理基准 06-10 开源模型 1 华为开源盘古 Embedded 7B 与盘古 Pro MoE 72B 模型 07-01 引导生成 1 ICML 2025 Spotlight:流匹配模型的能量引导生成理论框架 06-30 弱点合成 1 SwS:LLM 推理强化学习中的自我感知弱点驱动问题合成 06-12 强化学习 4 言语强化学习的兴起:自然语言反馈统一框架 09-02 清华、上海AI Lab等团队发布推理模型强化学习综述 12-31 大型推理模型的强化学习研究综述 09-11 Magistral:Mistral 首个推理模型与可扩展强化学习管线 06-13 形式化推理 1 字节 Seed-Prover:以引理为核心的 Lean 4 数学证明模型 12-31 形式化证明 3 AlphaProof 技术解析:结合强化学习、自动形式化与 Lean 证明反馈 12-31 StepFun-Prover:基于环境反馈的形式化证明训练 12-31 Goedel-Prover-V2开源:72B模型定理证明超越DeepSeek-Prover-V2 671B 07-18 循环深度 1 循环模型为何越想越错:隐空间推理的深度困境 08-16 心智理论 1 ToMAP:以心智理论训练具备对手感知能力的大模型说服者 06-25 思维链 1 MIST:基于模型内部显著性的思维链 Token 压缩 09-01 扩散模型 1 DiffuCoder:理解并改进用于代码生成的掩码扩散模型 06-25 批评微调 1 通过单问题批评微调释放预训练大模型的推理潜力 06-09 技术生态 1 AI4AI 从自进化、元进化迈向递归自我改进 08-12 持续学习 4 Fast Weight Attention:面向持续学习的快速权重注意力 09-01 持续学习向系统级适应的范式转型 08-07 GeRe:通过通用样本重放实现 LLM 持续学习的高效抗遗忘 08-07 GeRe:通过通用样本重放缓解大模型持续学习中的灾难性遗忘 08-06 指令优化 1 教学学习范式:融合白盒与黑盒 LLM 的指令优化框架 06-30 指令数据合成 2 腾讯优图提出 RAIF 激励推理方法,复杂指令性能提升 11.74% 06-24 Infinity Instruct:扩展指令选择与合成以增强语言模型 06-16 探索推理 1 探索推理:一种熵的视角 06-19 推理优化 2 GMTS:基于梯度幅度的词元选择改进大模型 RLVR 推理训练 09-01 直接推理优化:LLM 自我奖励并完善开放式任务推理 06-18 推理强化 1 SPIRAL:强化学习筛选并强化可泛化推理模式 12-31 推理效率 3 思维令牌是帮助还是陷阱?迈向更高效的大型推理模型 07-01 简单问题快速答,困难问题深入想:基于幂次长度惩罚的高效推理 06-13 Bingo:通过动态与显著性强化学习提升大模型推理效率 06-12 推理模型 1 大推理模型强化学习综述 12-31 推理蒸馏 1 NaturalThoughts:为通用推理任务选择和提炼推理轨迹 07-03 推理训练 1 MERA 训练提升模型推理效率与准确性 08-06 推理迁移 1 数学推理训练能否提升 LLM 的通用能力?推理能力的可转移性研究 07-01 提示合成 2 PromptCoT 2.0:面向大语言模型推理的可扩展提示合成 12-31 PromptCoT 2.0:以 EM 循环合成高难度推理任务 12-31 搜索推理 1 R-Search:通过多奖励强化学习与搜索增强大模型推理 06-09 数学合成 1 MathFusion:融合数学问题,45K 合成数据带来 18% 能力提升 06-18 数学推理 3 MiroMind-M1:基于 Qwen-2.5 的开源数学推理模型 12-31 AceReason-Nemotron 1.1:通过 SFT 与 RL 协同提升数学和代码推理 06-18 数学推理大型语言模型研究综述 06-10 数学数据 1 DeepMath-103K:用 10.3 万道高难数学题突破大模型推理瓶颈 06-12 数据合成 9 DataFoundry:递归自改进的数据生产流程 09-02 唐杰披露智谱大模型训练数据与后训练布局 09-01 水印与掩蔽递归离散分布估计的极小极大界 09-01 RailGen:智能体引导的铁路小型异物生成与检测 09-01 REER-PT:以困惑度引导逆向推理增强预训练数据 09-01 合成数据隐患:无害文本中的隐蔽定向偏见注入 09-01 RailSyn:面向铁路异物检测的诊断引导图像生成 09-01 AlphaGeometry:用合成数据学习几何辅助线生成 12-31 仅用约100道种子题,Socratic-Zero合成数据质量超GPT-5 09-23 数据归因 1 语言模型预训练中的任务无关数据影响度量 08-16 数据效能 1 语言模型训练的数据效能:DELT 数据组织范式 06-27 数据泄露 1 真相大白!RL不是魔法,随机奖励有效只是由于数据泄露 07-18 数据混合 4 难度感知数据策展缩小文档 VLM 成本与质量差距 09-02 工业级 LLM 后训练:面向棕地维护的 Dataware 工程 09-01 AutoMixer:利用训练检查点自动优化数据混合 06-30 Domain2Vec:向量化数据集,无需训练寻找最优数据混合 06-13 数据策展 2 从重加权到响应重写:释放影响样本的训练干预效应 09-03 蚂蚁OmniTable统一宽表管理35PB大模型训练数据 09-02 数据自演化 1 BigBang-V1:35B 模型用自演化合成数据挑战万亿参数模型 08-07 数据获取 1 清华刘知远团队:高质量 LLM 训练数据获取 06-13 数据规模扩展 1 Skywork-SWE:揭示大模型软件工程能力的数据缩放定律 06-25 数据质量 1 评估数据质量在训练双语语言模型中的作用 06-18 文本增强 1 PromptAug:使用数据增强进行精细冲突分类 07-01 文本扩散模型 1 Cosmos:用于文本扩散建模的压缩平滑潜在空间 06-27 无监督训练 1 MM-UPT:基于 GRPO 的多模态大模型无监督持续自我改进框架 05-28 时间序列模型 1 清华发布首个万亿级时间点预训练生成式时序大模型「日晷」 06-23 智能体 2 SWE-Dev:构建具备训练与推理扩展能力的软件工程智能体 06-07 SWE-Dev:通过训练与推理扩展构建软件工程智能体 06-07 智能体框架 1 腾讯 AI Lab 开源层次化智能体框架 Cognitive Kernel-Pro 12-31 智能体自进化 3 SEAgent:从经验中自主学习的自进化计算机使用代理 08-06 SEA:面向计算机使用的自我进化代理 08-06 UI-Genie:面向移动端 GUI 智能体的自改进框架 05-28 智能体训练 3 上交大新范式:78条高质量样本胜过万条数据 09-28 L0:面向通用智能体的可扩展端到端强化学习训练系统 07-01 Agent-RLVR:通过指导与环境奖励训练软件工程智能体 06-16 机器人学习 1 MuJoCo Playground:面向机器人学习与仿真到现实迁移的开源框架 06-26 概念研究综述 1 什么是 Self-evolving、Self-improving 与 RSI? 08-12 模型发布 2 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 DeepSeek V4 Pro 正式版上线,主打 Agent 与 Coding 08-13 模型可靠性 1 良性微调下的安全路由失效与对齐脆弱性 09-02 模型安全 1 思想犯罪:推理模型中的后门与涌现失调 06-18 模型微调 3 NoRA:归一化低秩适配提升 LoRA 训练稳定性 09-02 MokA:面向多模态大模型的低秩适配微调新范式 06-30 在不损害能力的前提下精简大语言模型 06-13 模型架构创新 1 Qwen3.8-Next 架构设计:效率、能力与训练稳定性的联合优化 09-02 模型架构演进 1 模型架构发现的 AlphaGo 时刻:ASI-Arch 07-24 模型编辑 1 SMEdit:面向低数据场景的高效元学习模型编辑方法 12-31 模型训练 7 StudentSim:个性化 LLM 学生模拟器训练框架 09-02 SFT-RL 标注预算的跨模型规模近优分配 09-02 从生产流量到后训练:构建覆盖企业请求的自托管 LLM 09-02 Puro-2B:单卡 RTX 5090 低预算训练 2B 模型 09-01 面向噪声 LLM 标注的错误类型感知 NER 损失重加权 09-01 dots.vlm1:自研 NaViT 编码器与 DeepSeek V3 组成的多模态模型 12-31 Jan-nano 技术报告:以多阶段 RLVR 训练高效 4B 搜索型语言模型 06-28 泛化迁移 1 打破领域障碍:强化后训练的推理收益能否迁移到未见领域? 06-25 测试时计算 1 e3:学习探索实现大模型测试时计算外推 06-12 深度研究智能体 2 MiroMind ODR:开放深度研究全流程项目 12-31 WebWatcher:面向高难度多模态深度研究的智能体方案 12-31 混合微调 2 SRFT:单阶段融合监督与强化学习的大模型微调方法 07-03 SRFT:统一监督微调与强化学习的单阶段推理训练方法 06-25 游戏推理 2 ViGaL:仅通过游戏强化学习提升多模态推理能力 06-25 ViGaL:用街机游戏训练多模态模型的跨领域推理能力 06-18 游戏生成 1 ViGaL:以游戏化合成任务培养通用多模态推理能力 12-31 演化能力评测 1 ASPIRE:模型能否从模糊目标中自我演化? 09-01 环境合成 1 CogEvol:高效可靠的学习环境生成模型 09-02 环境工程 1 Agentic Environment Engineering:智能体环境工程综述 09-01 生成式评测 1 双模型生成与评判机制 12-31 监督学习 1 生成式视角重塑监督学习:预测一致性学习让标签成为学习指南 06-25 科学推理 1 史上最大高质量科学推理后训练数据集开源,快速让 Qwen3 等变“科学家” 12-31 科学数据 2 上海创智学院与上海交通大学发布科学推理数据集 MegaScience 12-31 AutoSDT:面向开放科学智能体的数据驱动发现任务合成管道 06-12 科研复现 1 自动化 LLM 速通基准:评估 NanoGPT 改进复现能力 06-30 科研智能体 1 PaperGym:以评分准则驱动科研计划生成与训练 09-01 程序修复 3 WebWorld:以浏览器世界模型驱动 Web 代码自我改进 09-01 Anchored Self-Play:锚定自博弈提升代码修复真实性 08-14 北大、字节跳动等发布 SWE-Swiss:面向代码修复的开源训练方案 12-31 策略优化 1 Qwen3 提出 GSPO:从序列级重要性采样改进 GRPO 12-31 算法比较 1 DPO 与 GRPO 在自回归图像生成中的系统性对比 06-20 系统优化 2 华为 CloudMatrix 384 超节点很强,但它的“灵魂”在云上 07-03 华为 CloudMatrix 论文披露 AI 数据中心新范式,推理效率超越英伟达 H100 06-30 结构引导 1 设计合成:通过结构引导控制数据生成 06-11 结构推理 1 通过结构化推理增强大语言模型 06-26 统一多模态建模 1 OpenUni:1.1B 参数统一多模态模型媲美 BLIP3-o-8B 06-23 统一框架 1 多模态统一框架的设计与规模化训练挑战 12-31 缩放定律 2 智谱唐杰:大模型只看参数的时代结束了 08-20 能力显著性向量:面向下游任务缩放定律的损失—能力细粒度对齐 06-18 自动化优化 1 面壁智能发布 ForgeStencil:自动研究与部署闭环 AI 系统 08-07 自博弈 2 SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」 12-31 以游戏自对弈筛选可泛化思维链 12-31 自我奖励 1 一致的路径通向真理:面向LLM推理的自我奖励强化学习 06-12 自我学习 1 MIT SEAL:通过自生成数据与权重更新实现模型自我适应 12-31 自我批判 1 Double-Checker:通过自我批判微调增强慢思维大模型推理 06-27 自我提问 1 SQLM:无需外部数据的自我提问模型框架 12-31 自我改进 2 在策略蒸馏真的在蒸馏吗?从噪声教师到自我改进 09-01 多游戏联合训练促进自主智能体技能协同 08-05 自我纠错 1 PAG:以策略作为生成式验证器的多轮强化学习自我纠错 06-13 自我训练 1 CMU 提出自我奖励训练 SRT:大模型能否实现无标签自训练? 05-27 自蒸馏 2 DART-SD:面向多轮工具调用智能体的拓扑感知自蒸馏 09-01 无监督同策略自蒸馏 U-OPSD 08-12 自进化 4 超越人类监督扩展大型推理模型:通往超级智能的路径 09-01 动态反馈推动智能体持续自我优化 12-31 ML-Agent:7B智能体仅用9个任务训练实现自主机器学习工程 06-23 多数投票驱动的推理模型迭代式自我训练 02-03 自进化框架 1 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 自适应 1 自适应语言模型(SEAL) 06-12 自适应引导 1 自适应引导加速推理模型的强化学习 06-19 自适应推理 1 推理混合:教大型语言模型使用自适应策略进行推理 07-01 表征对齐 1 何恺明改进 REPA:大幅简化方法并保持强劲性能 06-13 规则推理 1 RuleReasoner:通过领域感知动态采样强化规则推理 06-12 规模扩展瓶颈 1 Orion性能未达预期,三大瓶颈制约模型扩展 12-31 视觉推理 3 ViLaSR-7B:通过“边画边想”学习人类式空间推理 06-23 SynthRL:以可验证数据合成扩展视觉推理 06-04 SynthRL:通过可验证的数据合成扩展视觉推理 06-03 视觉生成 1 GoT-R1:强化学习解锁多模态视觉生成推理新范式 06-26 视频生成 3 DreamX-Creator:普惠化原生 2K 音视频联合生成 09-02 向量化时间步:极低成本微调大规模预训练视频扩散模型 06-20 稀疏蒸馏实现 H200 单卡 5 秒生成视频,去噪提速 70 倍 05-19 训练优化 1 两篇 ICLR 论文破解强化学习的两个关键难题 07-18 训练框架 1 面壁智能发布 AI 编写的大模型预训练框架 ForgeTrain 08-07 训练范式 1 ORBIT:时间序列基础模型的可控训练范式 08-16 训练配方 1 字节跳动 Seed 开源强化学习配方 POLARIS,4B 模型数学推理接近 235B 模型表现 07-17 证明语料库 1 开放证明语料库:大规模研究 LLM 生成的数学证明 06-30 语言反馈 1 可证明地从语言反馈中学习:HELiX 算法与理论框架 06-13 课程学习 1 PAC:面向大模型多任务强化学习的进度增强优势课程 09-01 负向微调 1 NFT:利用隐式负向策略提升数学推理能力 06-23 资源图谱 1 LLM强化学习环境与开源训练框架资源图谱 12-31 超参数迁移 1 MoE 大模型的计算高效超参数迁移 08-24 跨模态对齐 1 LIFT:冻结LLM文本编码器,准确率超CLIP 11% 07-03 软件工程 1 SWE-Flow:以测试驱动方式合成软件工程数据 06-12 轻量化模型 1 DFM Mimir v1:仅用许可数据训练的 1B HRM 模型 08-17 过程奖励模型 2 SPRO:使用掩码步骤优势进行自我引导的过程奖励优化 07-02 SPARE:基于参考引导评估的单次过程标注框架 06-23 进化安全 1 Self-evolving Agents 并非总是良性:警惕智能体“错误进化”风险 12-31 进化研究综述 1 97页综述:现代 AI Agent 的自我进化体系 08-12 连续推理 2 扩散课程训练实现无时间步迭代推理 09-02 SynAdapt:利用合成连续思维链实现高效自适应推理 08-05 选择性蒸馏 1 CROP:基于反事实任务相关性的选择性在线策略蒸馏 08-16 递归自我改进 1 iCoder:AI 主导开发 27B 工业代码模型 09-02 通用推理 1 RLPR:无需验证器将RLVR扩展到通用领域 06-28 逻辑评测 1 SATQuest:用于逻辑推理评估与微调的验证器 12-31 量化感知训练 1 SageAttention3:FP4 量化加速注意力并探索 8 比特训练 06-19 错误反思 1 LEMMA:用“错题本”反思学习提升大模型数学推理能力 06-19 问题定位 1 ToolTrain:面向代码问题定位的两阶段工具集成训练框架 12-31 间隔重复调度 1 SRT:面向语言模型持续预训练的间隔复习 08-19 隐私风险 1 微调方法对大型语言模型中记忆的影响 06-30 音频理解 1 小米开源 MiDashengLM-7B,声音理解能力刷新 SOTA 12-31 预训练 2 强化学习也能预训练?潜在意图与流匹配带来最高20倍提升 06-30 「Next-Token」范式改变:强化学习预训练来了 06-12 预训练对齐 1 Synthetic Persona Pretraining:从首个 Token 开始对齐 08-16 领域微调 1 ICML 2025 Spotlight|清华朱军组与 NVIDIA 提出 DDO,革新扩散与自回归模型训练 07-02 题目生成 1 通过联合叙事与难度控制推进问题生成 06-11 验证器模型 1 CompassVerifier:3B验证模型与多领域高难度基准 VerifierBench 12-31 高效探索 1 字节跳动与MAP提出FR3E:以结构化高效探索提升大模型强化学习上限 12-31