智能体评估 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 智能体评估 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 业务评测 1 Thinkingbox:有状态业务工作流智能体沙箱与基准 08-21 动态审查 1 MCR-Bench:真实多轮代码审查动态基准 08-28 医疗AI评测 1 BALMS:面向纵向心理健康感知的智能体大模型基准 08-28 城市导航 1 UrbanGround:真实尺度城市中的空间能动性评测 08-29 工业控制系统安全 1 PLCBench:评测自主 LLM 智能体对 PLC 的持续物理影响 08-29 工作流评测 1 FrontierChallenge:科学工作流完成度评测 08-28 故障诊断 1 FaulT-Bench:面向不可靠用户工单的网络故障排查智能体基准 08-29 智能体评测 10 ClawBench:真实网站任务中前沿 AI Agent 最高成功率仅 33% 09-03 DroneCATS:评估多模态 LLM 的通用无人机控制能力 09-03 EarlyEval:通过早期结果预测降低智能体评测成本 09-03 PTA-IRT:基于执行轨迹的高效 SWE 智能体评测 09-02 MNIST-PRO:面向部分可观测智能体的感知状态评测 09-01 E-Commerce Bench:长程自主电商运营智能体评测 09-01 BAITBENCH:评测机器学习智能体的奖励作弊行为 09-01 ATLAS:工业工具调用智能体的双时域诊断评测 09-01 SwarmBench:评测大模型的智能体集群编排能力 09-01 BekchiAI:一键评测、观测与控制 LLM 智能体 08-29 根因评测 1 TraceBench:受控评测 LLM 智能体的时序根因归因能力 08-28 模型发布 1 DeepSeek-V4-Flash-Vision-Exp 多模态模型开源 09-01 演化能力评测 2 ASPIRE:模型能否从模糊目标中自我演化? 09-01 S3Gym:LLM 能否通过自测试与自评判实现自我改进 09-01 生命周期安全 1 HarnessRisk:面向生命周期的智能体 Harness 安全基准 08-19 科学编程 1 SWE-bench Science:科学软件工程中的编码智能体评测 08-21 科研评测 2 AutoSciRub:先评估后改进的科研智能体自动准则归纳 09-01 ASI-Bench:评测 AI 自主科研与创新探索能力 08-20 移动端评测 1 MobilePA-Bench:复杂真实移动任务规划智能体基准 08-26 脚手架演化 1 HarnessDev:LLM 自主创建与演化 Agent Harness 09-03 记忆能力评测 1 编码智能体工作记忆的语义化评估 09-01 评测基准构建 1 BTS-AgentBench:从只读遥测日志构建可复现智能体基准 08-28 评测审计 2 LLM 智能体商业评测中的构念效度失效 09-02 SASST:面向交互式智能体的选择感知压力测试 09-01 课程生成 1 Ornith-1.5自生成任务闭环提升编码智能体 08-27 轨迹审计 1 Trace Integrity:面向 LLM 数据智能体的可审计结构化推理 08-27 迁移评测 1 SWE Refactor Bench:编码智能体的全仓长程栈迁移评测 08-25 过程评测 1 从原子能力到智能体:可解释评测 LLM 数学智能体能力 08-29 部署测试 1 迈向无风险 AI 智能体部署:基于轨迹的测试与调试 08-18 题目生成 1 Ornith-1.5 自出题强化学习闭环,两月自测提升 11% 08-28