人工智能安全治理 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 人工智能安全治理 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 协同演化 1 智能体系统协同演化:迈向超越人工设计的自主进化 08-13 多智能体协作风险 1 Anthropic揭示多智能体协作与冲突隐患 08-15 安全评测 1 大模型越狱鲁棒性随运行状态显著波动 09-01 循环安全 1 安全不可组合:自主 LLM 智能体的非衰减循环状态 08-28 情感诈骗 1 实证研究:AI在“杀猪盘”中比人类更易建立信任 08-18 意图拒绝 1 WIFA:基于意图组监督的 LLM 安全拒绝训练 08-16 技术生态 1 OpenClaw热潮退去,Agent竞争转向Harness 08-30 技能安全 1 Practice Makes Unsafe:自改进 LLM 智能体的技能误演化 08-16 推理安全 1 专有 LLM API 推理轨迹窃取攻击 08-12 提示审计 1 斯坦福、MIT 等发布最大系统提示词库与 AISPA 审计框架 08-15 插件架构 1 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 智能体安全 1 OpenART:通过开放式环境演化扩展智能体红队测试 08-14 机制发现 1 Mechanist:自主发现 AI 智能机制的科学智能体 08-14 核心演化 1 Ouroboros:可自我演化的前沿编程智能体 08-12 模型发布 1 GLM-5.3:后训练 Scaling 提升编程与网络安全能力 08-14 群体安全 1 Anthropic:单体安全不等于多智能体系统安全 08-16 群体风险 1 Anthropic揭示多智能体协作、合谋与冲突隐患 08-16 运行时防御 1 HARD:面向 LLM 智能体的自演化运行时防御 08-16 进化研究综述 1 97页综述:现代 AI Agent 的自我进化体系 08-12 长期记忆 1 Safin-1:以记忆原生状态演化实现内生安全 09-03 预训练对齐 1 Synthetic Persona Pretraining:从首个 Token 开始对齐 08-16