人工智能可解释性 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 人工智能可解释性 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 世界模型评测 1 HarnessEval-W:智能体化视觉世界模型评测 08-19 临床协作 1 MARC v1:面向临床推理与协作的开源多智能体框架 08-16 元认知 1 评估与改进大语言模型的自我建模能力 09-01 决策协商 1 BoardroomAI:基于演化决策图的人类可操控多智能体协商 08-16 多智能体系统 2 GlossoGen:复杂多智能体交互中的涌现语言 09-02 Hermon Moment:AI 自我超越与人类叙事 09-01 思维链 3 语言不可读性对 LLM 安全的影响 09-03 SHAPE:解析数学推理中思维链的形态 09-02 MIST:基于模型内部显著性的思维链 Token 压缩 09-01 拒答评测 1 TRAPSBench:视觉语言模型能识别不确定性,却不会克制回答 08-16 拓扑压缩 1 LLM 长上下文流形的拓扑压缩与六度分隔 08-19 拓扑解释 1 E2-Explainer:用因果推断解析多智能体通信拓扑 08-16 探针效度 1 探针方向由提示词决定,而非模型属性 08-16 敏感性分析 1 基于交互作用评估与解释 LLM 提示敏感性 08-20 数据归因 1 语言模型预训练中的任务无关数据影响度量 08-16 机制发现 1 Mechanist:自主发现 AI 智能机制的科学智能体 08-14 查询验证 1 TraceSQL:可追溯的无参考 Text-to-SQL 验证 08-19 模型评测 2 超越评分:解析 LLM-as-a-Judge 的摘要评估机制 09-02 错误预测中的正确证据:修复 LLM 序列评分坍塌 09-01 模型验证 1 以模型检验为预言机自动测试 LLM 事后解释器 09-01 步骤归因 1 SkillShapley:智能体技能步骤的边界自适应 Shapley 归因 08-16 溯因推理 1 LLM 不为“跃迁”付出代价:机器溯因缺少物理成本 08-17 状态读出 1 J64/R64:从原生 MoE 路由读出可解释推理状态 08-19 神经符号人工智能 1 Moose:具备推理捷径感知的 EL++ 潜在概念学习 08-16 策略发现 1 ATLAS:从智能体轨迹中发现可解释策略 08-17 罕见病建模 1 大语言模型充当合成临床专家辅助纵向罕见病建模 08-18 表征审计 1 冻结 LLM 的几何约束“可解码但不可行动”鸿沟审计 08-19 规则规划 1 RuleMaze:多模态模型的规则约束视觉空间规划 08-21 解释效用 1 自然语言解释何时助益上下文学习:类型与忠实度比较 08-18 解释评测 1 CHIVE:用反事实实验评估大模型行为解释 08-18 论证补全 1 语义链接不确定性下的省略论证补全选择 08-20 语义表征 1 AI 语言表征中虚假与不可能性方向不同 08-16 辩论评判 1 事后辩论裁判理论 08-20