后训练 LLM-DailyDigest 2026-08-13 2026-08-13 约 100 字 预计阅读 1 分钟 后训练 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 主权人工智能模型 1 Thomson:以持续学习构建主权前沿模型 08-28 人群仿真 1 聚合移动统计蒸馏为大型活动后人群仿真策略 08-22 价值估计 1 Le Critique:用于 LLM 强化学习的特权价值函数 08-18 低资源推理 1 低资源语言推理:SFT 构建语言习惯,RL 修复行为缺陷 08-19 偏好优化 2 基于激活标签传播的低资源大模型偏好适配 09-01 PLC-DPO:噪声与模糊偏好优化中的后验标签校正 09-01 分布式训练 1 并行与分布式推理语言模型的性能基础 08-28 反思优化 1 SRPO:面向长程推理的自反思策略优化 08-25 同策略蒸馏 1 DiffusionOPSD:扩散模型的在线策略自蒸馏 08-27 奖励优化 1 SA-MRPO:面向多奖励策略优化的饱和感知优势重加权 08-19 奖励蒸馏 1 OPDVR:基于可验证奖励的在线策略蒸馏 08-27 对齐失配 1 安全方向惩罚缓解推理诱发的模型失配 08-25 尺度解耦 1 DPO 中优化尺度与偏好尺度的解耦 08-28 工具使用训练 2 MidTool:面向智能体工具使用的中期训练数据合成 08-21 Palmyra x6:基于锚定监督微调的企业级工具调用模型 08-18 师生协同适应 1 DualOPSD:自适应特权教师的在策自蒸馏 08-27 强化学习后训练 1 OraRL:将标注作为视频 MLLM 的神谕轨迹 08-27 思维链 1 SHAPE:解析数学推理中思维链的形态 09-02 意图拒绝 1 WIFA:基于意图组监督的 LLM 安全拒绝训练 08-16 扰动推理 1 PertMind:用细胞扰动强化学习激发生物推理能力 08-18 持续后训练 1 VDA:面向多模态无监督持续后训练的视觉依赖框架 08-27 持续推理 1 Continual Reasoning Gym:持续 RLVR 中的共享推理与提示回放 08-20 排序蒸馏 1 TUP:基于排名分类的 Best-of-N 蒸馏 08-21 数据合成 1 唐杰披露智谱大模型训练数据与后训练布局 09-01 数据混合 1 工业级 LLM 后训练:面向棕地维护的 Dataware 工程 09-01 智能体强化学习 1 Agent Lightning v1.0:面向脚手架式智能体强化学习 08-19 智能体微调 1 Agentic ESOpt:低显存微调长时程 LLM 智能体 08-20 机器遗忘 1 AdaPop:基于事实流行度的自适应 LLM 遗忘 08-21 框架拆解 1 DeepSeek V4 Pro 与 Harness:后训练、缓存经济学及代理自进化 08-23 模型发布 3 GLM-5.3:后训练 Scaling 提升编程与网络安全能力 08-14 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 DeepSeek V4 Pro 正式版上线,主打 Agent 与 Coding 08-13 模型微调 1 NoRA:归一化低秩适配提升 LoRA 训练稳定性 09-02 模型训练 2 SFT-RL 标注预算的跨模型规模近优分配 09-02 从生产流量到后训练:构建覆盖企业请求的自托管 LLM 09-02 模型评测 1 GLM-5.3 实测:750B 基座靠后训练提升编码与安全能力 08-21 流形漂移 1 流偏好优化中的流形漂移与奖励作弊 08-22 漏洞训练 1 CyberFactory:用真实漏洞实例扩展大模型网络安全能力 08-27 知识内化 1 IAR:面向无检索文档知识内化的三阶段后训练 08-22 科研智能体 1 Intern-S2-Preview:科学智能体基础模型 08-15 端侧框架 1 端侧专用 Harness:Qwen 3.8 27B 实现近零成本推理 08-30 策略优化 2 SAPO:面向智能体强化学习的单轨迹自回归策略优化 08-21 GUPO:面向大模型后训练的梯度不确定性感知策略优化 08-19 策略固化 1 AI 后训练缺少什么:智能体策略重估能力的实证分析 08-20 策略蒸馏 1 SimpleOPD:分词器无关的长上下文同策略蒸馏 08-17 经验授权 1 BCIT:自主后训练中的条件化经验迁移 08-29 自蒸馏 1 LOPD:潜在同策略自蒸馏 08-16 蒸馏平衡 1 Open-MOPD:修复多教师在线策略蒸馏的能力失衡 08-28 融合范式 1 跨领域 RLVR 能力整合:三类融合范式比较 08-28 训练策略 1 无 CoT 数据下:Next-Chunk Reasoning RL 真的优于 SFT 吗? 08-25 训练系统 1 Rollplex:VLM 后训练的跨阶段 GPU 空间共享 08-17 评测审计 1 Phantom Gains:用实测零基线审计模型自我改进 08-21 资源调度 1 Libra:Agentic RL 后训练动态资源管理系统 08-14 过滤式微调 1 TailSFT:过滤式微调提升强化学习后训练性能 08-27 过程奖励模型 1 Cliff:从首次错误学习过程奖励 09-03 进化策略 1 进化策略实现比 GRPO 更广的 LLM 推理覆盖 08-28 逆合成分析 1 化学合理性感知大模型用于单步逆合成 08-21