安全对齐 LLM-DailyDigest 2026-08-24 2026-08-24 约 100 字 预计阅读 1 分钟 安全对齐 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 主权人工智能模型 1 Thomson:以持续学习构建主权前沿模型 08-28 协同演化 1 SafeEvolve:基于智能体经验的脚手架—策略协同演化安全对齐 09-03 安全评测 1 大模型越狱鲁棒性随运行状态显著波动 09-01 对齐失配 1 安全方向惩罚缓解推理诱发的模型失配 08-25 数据合成 1 合成数据隐患:无害文本中的隐蔽定向偏见注入 09-01 数据策展 1 从重加权到响应重写:释放影响样本的训练干预效应 09-03 模型可靠性 1 良性微调下的安全路由失效与对齐脆弱性 09-02 测试时对齐 1 ReFrame:证据引导的多模态模型测试时安全对齐 08-24 自动化对齐 2 Claude 自动化对齐研究:单卡 48 小时迭代 1601 种方案 08-30 Claude 自动训练 Claude:AAR 低成本跑赢人类安全研究员 08-30 评测意识 1 评测意识并非单一变量:能力框架可预测模型服从性 08-29 长期记忆 1 Safin-1:以记忆原生状态演化实现内生安全 09-03