交互式评估 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 交互式评估 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 交互式评测 2 OmniAssistBench:全模态助手交互评测基准 08-24 PlayWorld:智能体玩家驱动的长程世界模型评测基准 08-15 交互成本 1 上下文压缩会增加智能体的隐性交互成本 08-18 优势公平性 1 ARC:开放式交互中的公平相对优势比较 08-26 协同测量 1 AI 编程智能体团队的协调测量 08-18 原生交互 1 ASIL:以结构化状态与语义动作取代截图点击 08-29 对应审计 1 跨视图对应是一种测量干预:智能体评测与信用分配的双向验证 08-19 技能演化 1 SkillEvo:以多轮交互反馈持续演化智能体技能 08-16 智能体评测 1 MNIST-PRO:面向部分可观测智能体的感知状态评测 09-01 泛化机制 1 同策略蒸馏泛化的双重效应:行为迁移与能力跷跷板 08-18 演化能力评测 1 S3Gym:LLM 能否通过自测试与自评判实现自我改进 09-01 结构读出 1 Prompt-Model 交互抵达固定点:无任务确定性结构读出 08-24 航空评测 1 AeroCopilotBench:交互式虚拟驾驶舱中的航空副驾驶智能体评测 08-18 语音-文本冲突 1 文本误导下的音频扎根对话推理 08-28 跨模态一致性 1 语音与文本输入下多模态模型的跨模态不稳定性 08-28