多轮反馈 LLM-DailyDigest 2026-08-16 2026-08-16 约 100 字 预计阅读 1 分钟 多轮反馈 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 交互式评测 1 OmniAssistBench:全模态助手交互评测基准 08-24 动态审查 1 MCR-Bench:真实多轮代码审查动态基准 08-28 多路径教学 1 ToST:支持多路径引导与并行思考的思维树苏格拉底教学框架 08-27 技能演化 1 SkillEvo:以多轮交互反馈持续演化智能体技能 08-16 拓扑蒸馏 1 DART-SD:面向钻石拓扑的多轮工具调用智能体自蒸馏 08-20 经验学习 1 经验链:通过测试时交互持续改进 LLM 08-19 评测审计 1 用户反馈提供 LLM 无法自行识别的独特改进信号 09-03 逆序优化 1 RTPO:以逆序轮次优化稳定智能体强化学习训练 08-20