奖励建模 LLM-DailyDigest 2026-08-11 2026-08-11 约 100 字 预计阅读 1 分钟 奖励建模 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 协同演化 1 J-Zero:零数据下挑战者、求解器与评判者统一协同进化 09-01 响应对齐 1 PatternEval:混合思考多模态模型的响应行为对齐 08-24 奖励优化 1 SA-MRPO:面向多奖励策略优化的饱和感知优势重加权 08-19 奖励建模 1 HSRM:用于测试时验证的隐藏状态奖励模型 09-01 奖励机制 2 MedAgent-R1:面向循证医疗推理的忠实度感知强化学习 09-01 RLSVR:面向开放式任务的自验证奖励框架 08-11 奖励蒸馏 1 OPDVR:基于可验证奖励的在线策略蒸馏 08-27 拓扑优化 1 RGA-Designer:奖励引导的多智能体通信拓扑生成 08-21 指令精炼 1 指令质量决定偏好学习效果:基于奖励与规则的指令精炼 08-29 排序蒸馏 1 TUP:基于排名分类的 Best-of-N 蒸馏 08-21 数据策展 1 基于失败模式上下文赌博机的对抗数据策展 08-20 模型训练 1 StudentSim:个性化 LLM 学生模拟器训练框架 09-02 测试扩展 1 真实开放任务中的测试时扩展:瓶颈在利用而非探索 08-20 混合控制 1 LLM 常识推理驱动的自动驾驶多智能体编排 08-21 科研智能体 1 PaperGym:以评分准则驱动科研计划生成与训练 09-01 群体推理 1 Co-RL:多样化智能体群体涌现无监督推理 08-21 自演化数据合成 1 VISA:面向多模态指令遵循的智能体自演化数据合成 08-27 自进化闭环 1 AI4AI:AI训练、优化与评测AI的新范式 08-20 蒸馏路由 1 I-SDPO:实例级自适应自蒸馏策略优化 08-16 过程奖励模型 1 Cliff:从首次错误学习过程奖励 09-03 逆合成分析 1 化学合理性感知大模型用于单步逆合成 08-21 顺序一致性 1 同等排序质量为何导致不同决策:顺序一致 LLM 评分器 08-29