价值对齐 LLM-DailyDigest 2026-08-16 2026-08-16 约 100 字 预计阅读 1 分钟 价值对齐 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 偏好推理 1 大模型不确定条件下的偏好推理 08-20 意图拒绝 1 WIFA:基于意图组监督的 LLM 安全拒绝训练 08-16 流形漂移 1 流偏好优化中的流形漂移与奖励作弊 08-22 自动化对齐 1 Claude 自动训练 Claude:AAR 低成本跑赢人类安全研究员 08-30 辩论式对齐 1 辩论训练减少 RLAIF 奖励作弊 08-19 采样控制 1 嵌套序贯蒙特卡洛控制离散扩散生成 08-21 预训练对齐 1 Synthetic Persona Pretraining:从首个 Token 开始对齐 08-16