探索与利用 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 探索与利用 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 弱模型探索 1 弱模型引导提升 RLVR 推理探索能力 08-28 探索锐化 1 自进化时代需要兼顾锐化与探索的新型强化学习 08-27 测试扩展 1 真实开放任务中的测试时扩展:瓶颈在利用而非探索 08-20 环境正则化 1 ERPO:以环境正则化破解策略优化的稳定—探索困境 08-25 离策略强化学习 1 WarpSAC:面向不同数据规模的可扩展离策略强化学习 08-28 语义先验 1 Semantic Bandits:语义先验如何影响上下文探索与利用 08-18