在策略蒸馏 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 在策略蒸馏 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 交互式评测 1 OmniAssistBench:全模态助手交互评测基准 08-24 动态调度 1 D³-MOPD:面向多教师蒸馏的自适应领域调度 08-28 同策略蒸馏 1 DiffusionOPSD:扩散模型的在线策略自蒸馏 08-27 奖励蒸馏 1 OPDVR:基于可验证奖励的在线策略蒸馏 08-27 师生协同适应 1 DualOPSD:自适应特权教师的在策自蒸馏 08-27 无教师蒸馏 1 Self-OPD:无需教师的流匹配模型在策蒸馏 08-29 泛化机制 1 同策略蒸馏泛化的双重效应:行为迁移与能力跷跷板 08-18 测试时优化 1 TTPO:测试时策略优化 08-28 策略蒸馏 1 SimpleOPD:分词器无关的长上下文同策略蒸馏 08-17 脚手架协同演化 1 TaoLive:让数字化身智能体与工具链共同进化 08-29 自我改进 1 在策略蒸馏真的在蒸馏吗?从噪声教师到自我改进 09-01 自蒸馏 1 LOPD:潜在同策略自蒸馏 08-16 蒸馏坍缩 1 一个症状、三个杠杆:在策自蒸馏批判性综述 08-27 蒸馏平衡 1 Open-MOPD:修复多教师在线策略蒸馏的能力失衡 08-28 通用化与专业化权衡 1 不确定性校准 MOPD 保持领域专化中的通用能力 08-29