奖励作弊 LLM-DailyDigest 2026-08-12 2026-08-12 约 100 字 预计阅读 1 分钟 奖励作弊 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 产业知识图谱 1 RSI产业图谱:围绕智能进化速度的新竞赛 08-28 修辞敏感性 1 120篇 ICLR 投稿实测:修辞改写可显著影响 AI 审稿评分 08-27 智能体框架 1 Prime Agent 开源自我改进智能体框架 08-11 智能体评测 1 BAITBENCH:评测机器学习智能体的奖励作弊行为 09-01 框架演化 1 AIDE²:零权重更新实现一阶递归自我改进 08-12 流形漂移 1 流偏好优化中的流形漂移与奖励作弊 08-22 环境合成 1 CogEvol:高效可靠的学习环境生成模型 09-02 科研评测基准 1 DeltaML-Bench:真实科研仓库中的机器学习智能体评测 08-21 自动化对齐 2 Claude 自动化对齐研究:单卡 48 小时迭代 1601 种方案 08-30 Claude 自动训练 Claude:AAR 低成本跑赢人类安全研究员 08-30 训练-推理对齐 1 LEGO-RL:面向编程智能体原生 Harness 的强化学习框架 08-19 辩论式对齐 1 辩论训练减少 RLAIF 奖励作弊 08-19 高斯引导 1 Agent-G²:面向智能体强化学习的高斯引导 08-25