策略优化 LLM-DailyDigest 2026-08-14 2026-08-14 约 100 字 预计阅读 1 分钟 策略优化 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 世界模型 1 NashDreamer:面向零和不完美信息博弈的模型式强化学习 09-02 协同演化 1 SafeEvolve:基于智能体经验的脚手架—策略协同演化安全对齐 09-03 奖励优化 1 SA-MRPO:面向多奖励策略优化的饱和感知优势重加权 08-19 持续学习 1 JitRL:免梯度实现 LLM Agent 测试时持续学习 08-22 模型量化评测 1 Seed-Evolving 量化策略研发与自迭代能力评测 08-14 测试时优化 1 TTPO:测试时策略优化 08-28 环境正则化 1 ERPO:以环境正则化破解策略优化的稳定—探索困境 08-25 策略优化 3 学习式前沿选择的智能体逆生物合成框架 09-01 TASPO:协调过程监督与结果信用的智能体策略优化 09-01 GUPO:面向大模型后训练的梯度不确定性感知策略优化 08-19 策略固化 1 AI 后训练缺少什么:智能体策略重估能力的实证分析 08-20 策略迭代 1 PIHF:以人类反馈将后训练强化学习引入上下文学习 08-18 自适应聚合 1 pFedMARL:多智能体强化学习自适应聚合非 IID 联邦数据 08-27 蒸馏路由 1 I-SDPO:实例级自适应自蒸馏策略优化 08-16 过程信用分配 1 MileGPO:基于局部证据的长程智能体里程碑信用分配 08-21