信用分配 LLM-DailyDigest 2026-08-16 2026-08-16 约 100 字 预计阅读 1 分钟 信用分配 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 价值估计 2 Le Critique:用于 LLM 强化学习的特权价值函数 08-18 错误但有用:多智能体消息的轨迹价值超越答案正确性 08-17 信用分配 1 CrEST:面向多轮多步 LLM 智能体的验证器约束信用分配 08-16 信用审计 1 无真值信用:基于执行回放审计 LLM 智能体的步骤级信用分配 08-21 反思优化 1 SRPO:面向长程推理的自反思策略优化 08-25 图像编辑 1 DARS:面向指令图像编辑的双层信用分配强化学习 08-21 对应审计 1 跨视图对应是一种测量干预:智能体评测与信用分配的双向验证 08-19 技能优化 1 WER:通过执行反馈强化学习实现技能优化 08-19 推理优化 1 GMTS:基于梯度幅度的词元选择改进大模型 RLVR 推理训练 09-01 智能体微调 1 Agentic ESOpt:低显存微调长时程 LLM 智能体 08-20 策略优化 2 TASPO:协调过程监督与结果信用的智能体策略优化 09-01 SAPO:面向智能体强化学习的单轨迹自回归策略优化 08-21 自我改进 1 现代智能体自我改进:从模型更新到脚手架演化 08-20 过程信用分配 1 MileGPO:基于局部证据的长程智能体里程碑信用分配 08-21 逆序优化 1 RTPO:以逆序轮次优化稳定智能体强化学习训练 08-20