工具调用 LLM-DailyDigest 2026-08-12 2026-08-12 约 100 字 预计阅读 1 分钟 工具调用 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 业务评测 1 Thinkingbox:有状态业务工作流智能体沙箱与基准 08-21 严谨推理 1 Brain Researcher:以分析严谨性约束神经影像科研智能体 08-21 临床协作 1 MARC v1:面向临床推理与协作的开源多智能体框架 08-16 云端智能体 1 Grok Bot以零配置云端多智能体打造“一人公司” 08-21 交互成本 1 上下文压缩会增加智能体的隐性交互成本 08-18 产品设计 1 对话 Claude Code 之父:模型越聪明,工作流越应简化 08-26 优势公平性 1 ARC:开放式交互中的公平相对优势比较 08-26 信用分配 1 CrEST:面向多轮多步 LLM 智能体的验证器约束信用分配 08-16 办公智能体 1 豆包工作正式发布:深度融合飞书的办公智能体 08-25 发现能力评测 1 Apodex Discovery:面向真实发现任务的AI评测环境 08-18 图推理 1 GRAIN:以结构不变奖励提升真实世界图推理鲁棒性 08-28 多智能体协作框架 1 HiRS-Agent:面向长程遥感任务的分层多智能体系统 09-01 工具使用训练 3 单策略强化学习超越树搜索的化学工具调用 09-01 MidTool:面向智能体工具使用的中期训练数据合成 08-21 Palmyra x6:基于锚定监督微调的企业级工具调用模型 08-18 开源框架 1 OpenAI开源Codex Harness智能体执行框架 08-21 思维链泄露 1 EchoCoT:从大推理模型中提取隐藏思维链 08-21 执行评测 1 QuoteBench:同分掩盖的命令路径故障 08-16 技能优化 1 WER:通过执行反馈强化学习实现技能优化 08-19 拓扑蒸馏 1 DART-SD:面向钻石拓扑的多轮工具调用智能体自蒸馏 08-20 接待智能体 1 硅星人推出 Demo Agent,让 Agent 自主完成项目自荐 08-21 提示工程 1 Agent 时代仍实用的 12 个常用 Prompt 08-22 插件开发 1 用 GLM 5.3 开发 DeepSeek Harness 插件 08-16 插件架构 2 DeepSeek Harness:全插件化 AI 编程 Agent 框架 08-21 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 插件生态 1 DeepSeek Harness 插件生态爆发:长期记忆、多智能体与小游戏齐上阵 08-15 智能体安全 1 OpenART:通过开放式环境演化扩展智能体红队测试 08-14 智能体规模扩展 1 Apodex 1.1:面向复杂工作的智能体能力扩展 08-25 智能体评测 3 ClawBench:真实网站任务中前沿 AI Agent 最高成功率仅 33% 09-03 ATLAS:工业工具调用智能体的双时域诊断评测 09-01 BekchiAI:一键评测、观测与控制 LLM 智能体 08-29 本地智能体 1 Meta 开源本地多模态智能体模型 Muse Glimmer 30B 08-25 框架评测 1 DeepSeek + Pi:轻量 Harness 提升智能体成功率与缓存效率 08-16 检索失效 1 工具技能检索中的来源风格坍缩 08-18 模型发布 2 DeepSeek Harness v0.1.0-rc.8 增强多模态与子代理能力 08-21 DeepSeek V4 Pro 正式版上线,主打 Agent 与 Coding 08-13 模型路由 1 英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard 08-13 漏洞训练 1 CyberFactory:用真实漏洞实例扩展大模型网络安全能力 08-27 灾害评测 1 EarthVerse:动态地球系统与自然灾害科学智能体基准 08-25 用量增长 1 智能体Token用量升至人类的5.2倍 08-25 盲测 1 匿名模型 Ox Alpha 刷屏,代码能力逼近头部模型 08-23 知识协作 1 用 Obsidian 与 MCP 搭建团队 Agent 知识系统 08-29 科学仿真 1 KI 为科学 Agent 注入可执行常识,仿真成功率升至 84% 08-28 科研平台 2 深势科技发布玻尔·科学空间,AI接管科研全流程 08-22 ScienceDiscovery:可溯源的一站式 AI 科研工作台 08-17 科研智能体 1 浙大开源 AI 科研智能体 Polaris 08-16 科研桌面 1 玻尔·科学空间发布:桌面端 AI 接管科研全流程“体力活” 08-22 移动端评测 1 MobilePA-Bench:复杂真实移动任务规划智能体基准 08-26 策略迭代 1 PIHF:以人类反馈将后训练强化学习引入上下文学习 08-18 红队演化 1 RedEvoAgent:经验驱动技能演化的自动红队智能体 08-28 联网工具 1 Agent-Reach:一句话部署智能体全网访问工具 08-23 脚手架 1 Opus 5借助极简Harness在ARC-AGI-3取得96.2%通关率 08-14 脚手架优化 1 AutoDesign:面向长程智能体设计的元脚手架优化 08-15 脚手架演化 1 StarHarness:以分层搜索演化企业智能体脚手架 08-26 自动化维护 1 Claude自动维护应用:388个AI PR中180个获合并 08-15 自蒸馏 1 DART-SD:面向多轮工具调用智能体的拓扑感知自蒸馏 09-01 蛋白质设计 1 Claude自主设计蛋白质结合剂,14个靶标实验命中 08-20 记忆蒸馏 1 Agent Memory Distillation:用分层教师记忆增强小模型智能体 08-12 论文生成 1 Spark-to-Paper:以可组合技能端到端生成研究论文 08-14 证据仲裁 1 文本与数字冲突时:大模型的证据仲裁 08-21 评测基准构建 1 BTS-AgentBench:从只读遥测日志构建可复现智能体基准 08-28 评测审计 1 MCP 智能体安全评测中的处理泄漏与构念效度 08-16 评测编排 1 HarnessEval:以可执行 Harness 重构 Benchmark 08-19 谜题评测 1 Pencil Puzzle Bench:可逐步验证的多步推理评测基准 08-14 资源调度 1 Libra:Agentic RL 后训练动态资源管理系统 08-14 轨迹推断 1 SpaCellAgent:自进化多智能体自动完成单细胞轨迹推断 08-22 递归调用 1 循环语言模型提升组合式工具调用能力 08-21 配置供应 1 面向关键基础设施运维的任务感知 Harness 配置 08-19 长程任务执行 1 阿里开源长程智能体框架 LongHorizon-Harness 08-13 长程任务研究综述 1 长程智能体综述:Harness 工程与模型优化协同演化 08-14 长程智能体 1 英伟达 AVO 在 ARC-AGI-3 通关 183 关并获满分 08-23