人工智能可靠性 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 人工智能可靠性 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 业务评测 1 Thinkingbox:有状态业务工作流智能体沙箱与基准 08-21 事务执行 1 Agentic Transaction:面向 ACID 合规的智能体系统 08-19 事实核查 1 ReflectFact:自反思智能体提升多跳事实核查 08-16 事实纠错 1 DEDUCE:主动纠正输入事实扰动,提升 LLM 鲁棒性 08-27 事故复盘 1 Claude安全降级失误,误删开发者700GB主目录 08-30 偏好优化 1 PLC-DPO:噪声与模糊偏好优化中的后验标签校正 09-01 判断校准 1 Localize-Then-Decide:LLM 判断的人类一致性保障 08-27 医疗AI评测 1 LLM评判器对AI临床笔记的遗漏盲区及改进方法 09-01 叙事一致性 1 NCP-Bench:LLM 智能体交互叙事长程一致性评测 08-14 可信执行 1 面向可信智能体执行的策略代数 08-18 可靠性认证 1 智能体行为契约 II:无独立性假设的组合可靠性认证 08-16 多智能体协作风险 1 Anthropic揭示多智能体协作与冲突隐患 08-15 奖励机制 2 MedAgent-R1:面向循证医疗推理的忠实度感知强化学习 09-01 RLSVR:面向开放式任务的自验证奖励框架 08-11 安全评测 1 PRISK:评估大语言模型个性化的隐性成本 09-02 实验设计 1 MDA:大模型与贝叶斯推断协同设计关键实验 08-15 形式化验证 1 Vero:智能体能否构建形式化验证的软件仓库 08-16 循环深度 1 循环模型为何越想越错:隐空间推理的深度困境 08-16 思维链 1 语言不可读性对 LLM 安全的影响 09-03 意图拒绝 1 WIFA:基于意图组监督的 LLM 安全拒绝训练 08-16 执行评测 1 QuoteBench:同分掩盖的命令路径故障 08-16 技术趋势 1 AI4Math 3万篇论文实证审计:AI正从润色走向证明构建 09-01 技能机制 1 智能体技能为何有效,又为何失效 08-20 拒答评测 1 TRAPSBench:视觉语言模型能识别不确定性,却不会克制回答 08-16 探针效度 1 探针方向由提示词决定,而非模型属性 08-16 推理安全 1 专有 LLM API 推理轨迹窃取攻击 08-12 数值推理 1 大语言模型数值能力:根本局限与改进路径 08-16 数据合成 2 水印与掩蔽递归离散分布估计的极小极大界 09-01 合成数据隐患:无害文本中的隐蔽定向偏见注入 09-01 数据策展 1 基于失败模式上下文赌博机的对抗数据策展 08-20 智能体框架 1 Prime Agent 开源自我改进智能体框架 08-11 智能体评测 2 BAITBENCH:评测机器学习智能体的奖励作弊行为 09-01 ATLAS:工业工具调用智能体的双时域诊断评测 09-01 查询验证 1 TraceSQL:可追溯的无参考 Text-to-SQL 验证 08-19 框架修复 1 能力层模型:组合式智能体 Harness 修复与真实仓库压力测试 08-16 框架演化 1 AIDE²:零权重更新实现一阶递归自我改进 08-12 模型可靠性 2 良性微调下的安全路由失效与对齐脆弱性 09-02 自改进智能体的脆弱性:方差、任务顺序与规格不足 08-19 模型架构创新 1 微型 Transformer 实现电路计算的完美长度泛化 09-01 模型训练 1 面向噪声 LLM 标注的错误类型感知 NER 损失重加权 09-01 模型评测 2 超越评分:解析 LLM-as-a-Judge 的摘要评估机制 09-02 错误预测中的正确证据:修复 LLM 序列评分坍塌 09-01 模型验证 1 以模型检验为预言机自动测试 LLM 事后解释器 09-01 演化能力评测 1 SEAGym:自我演化 LLM 智能体评估环境 08-07 状态授权 1 AID-Guard:面向委托式智能体效果的有状态授权 08-24 真实世界评测 1 真实工作场景中Agent成功率仍然偏低 08-18 程序修复 1 Anchored Self-Play:锚定自博弈提升代码修复真实性 08-14 策略优化 1 GUPO:面向大模型后训练的梯度不确定性感知策略优化 08-19 脚手架优化 2 AutoSaddler:基于执行轨迹的智能体脚手架自动优化 08-27 自动优化 Agent Harness 的三条路径:Meta-Harness、AHE 与 Self-Harness 08-14 自进化 2 逐篇盘点:自进化系统学到了什么,局限在哪里 09-03 超越人类监督扩展大型推理模型:通往超级智能的路径 09-01 论文生成 1 Spark-to-Paper:以可组合技能端到端生成研究论文 08-14 证据仲裁 1 文本与数字冲突时:大模型的证据仲裁 08-21 证明修复 1 CAPRI:面向 Isabelle 的契约感知证明修复 08-16 评测审计 3 LLM 智能体商业评测中的构念效度失效 09-02 SASST:面向交互式智能体的选择感知压力测试 09-01 MCP 智能体安全评测中的处理泄漏与构念效度 08-16 语义先验 1 Semantic Bandits:语义先验如何影响上下文探索与利用 08-18 语义编译 1 受限语义规划与确定性编译提升企业 Text-to-SQL 可靠性 08-18 轨迹审计 1 Trace Integrity:面向 LLM 数据智能体的可审计结构化推理 08-27 过程评测 1 LCoT-GV:基于图注意力网络的长思维链验证 09-01 运行时干预 1 COTA:小模型比较顾问实现智能体运行时干预 08-24 运行时恢复 1 AgentRewind:长程 LLM 智能体的可恢复执行 08-17 进化研究综述 1 97页综述:现代 AI Agent 的自我进化体系 08-12 部署测试 1 迈向无风险 AI 智能体部署:基于轨迹的测试与调试 08-18 配置供应 1 面向关键基础设施运维的任务感知 Harness 配置 08-19 采样校准 1 正确概率更高,答案反而更差:Power Sampling 的失效与修复 08-17 长期记忆 1 预计算记忆的组合、重建与纠错成本 09-01 长程任务执行 1 阿里开源长程智能体框架 LongHorizon-Harness 08-13 长程任务研究综述 1 长程智能体综述:Harness 工程与模型优化协同演化 08-14 长程任务评测 1 VibeLifeBench:评测生活智能体的主动性与持久性 08-13 风险评估 1 Judge, Retrieve, or Abstain:具风险保证的 LLM 裁判 08-19