智能体安全 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 智能体安全 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 事故复盘 1 Claude安全降级失误,误删开发者700GB主目录 08-30 分层防护 1 ClawSentry:自主 LLM 智能体的渐进式多层安全监控 08-24 协同演化 1 SafeEvolve:基于智能体经验的脚手架—策略协同演化安全对齐 09-03 可信执行 1 面向可信智能体执行的策略代数 08-18 合规性评测 1 ReguSim:评测金融 LLM 智能体的规则落地能力 08-21 多智能体系统 1 GlossoGen:复杂多智能体交互中的涌现语言 09-02 安全审计 1 金融智能体自进化审计:能力增益、安全漂移与执行接口错配 08-19 安全沙箱 1 WorkSwarm 多智能体协作与 JiuwenBox 安全沙箱 08-21 安全评测 2 用户调用方式如何影响编程智能体的仓库投毒风险 09-01 LLM 交叉赋能软件工程与软件安全:证据中心综述 08-24 循环安全 1 安全不可组合:自主 LLM 智能体的非衰减循环状态 08-28 恶意技能 1 MaliciousSkillBench:恶意智能体技能检测综合基准 08-21 技能演化 2 Defense-as-Skill:可演化的智能体运行时防护技能 09-02 JailbreakSkill:以可复用、持续进化技能扩展自动红队测试 08-18 持久化智能体 1 OpenAI测试Codex持久化模式:跨会话续跑并自主创建任务 08-28 提示注入评测 1 MobileWorldSafety:Android GUI 智能体环境注入安全基准 08-19 智能体框架 2 OpenClaw 2.0 发布:最大规模更新与 Agent Harness 赛道反思 09-02 OpenClaw 2.0 发布:全面升级通用 Agent 运行时 09-01 智能体评测 2 ClawBench:真实网站任务中前沿 AI Agent 最高成功率仅 33% 09-03 BAITBENCH:评测机器学习智能体的奖励作弊行为 09-01 极化攻击 1 GraphWake:利用记忆级联诱导 LLM 智能体社区群体极化 08-19 模型发布 1 UI-Venus-2:跨移动端、Web 与桌面的通用 GUI 智能体 09-03 测试时对齐 1 ReFrame:证据引导的多模态模型测试时安全对齐 08-24 状态授权 1 AID-Guard:面向委托式智能体效果的有状态授权 08-24 状态注入 1 状态成为攻击面:具身智能体的状态语义注入 08-18 生命周期安全 1 HarnessRisk:面向生命周期的智能体 Harness 安全基准 08-19 端侧框架 1 端侧专用 Harness:Qwen 3.8 27B 实现近零成本推理 08-30 群体演化 1 SwarmWorld:语言模型智能体社会的痕迹式技术演化 08-27 轨迹可信度 1 超越可疑步骤:长程智能体的本体信任 08-19 运行时授权 1 工具输出成为命令:分离动作诱导与运行时授权 08-28 运行时防御 1 HARD:面向 LLM 智能体的自演化运行时防御 08-16