2026-08-14 科研追新

当日精选(由提交工具自动创建)。

百度“伐谋”自演化智能体:56分钟破解亿级特征组合搜索

百度发布AI4S自我演化智能体“伐谋”,通过生成、验证和迭代搜索未知解,在林业病害识别、数学证明、能源调度及工业生产等场景实现效率与精度提升。

 人工智能应用 智能体 科学发现 自动化科学研究 自进化 任务规划

百度“伐谋”将模型、工具、搜索算法和可验证反馈组成自我演化系统,使AI从知识预测器转向持续寻找更优方案的搜索者。在松材线虫病识别任务中,系统用56分钟从107个候选特征中筛选约5个,将早期病害检出率由89.1%提升至98.0%,并把误报率从13.6%降至5.1%。该方法还被用于Lean形式化证明、空中博弈、零碳园区调度、电磁材料研究、抑郁症诊断及港口调度等任务。百度同时发布AI4S“1+10+N”战略,计划联合100位科学家,将可验证的进化搜索推广至更多科研与产业问题。

用途与启示
  • 展示“目标定义—候选生成—工具验证—反馈进化”的通用科研智能体范式。
  • 为高维特征选择、组合优化和复杂调度提供可复现、可持续迭代的自动搜索方案。
  • 表明模型结构不必大幅改变,也可通过扩大试错空间和闭环评估显著提升任务表现。
  • 启示AI4S系统应优先选择具有明确评价函数、可自动验证且搜索空间庞大的真实问题。
📝 原始笔记(逐字保留)
刚刚,中国AI交卷!40年难题56分钟破局,AI不再「学习」https://mp.weixin.qq.com/s/hxKmonuGbMhhWXYpzHRmhA

Opus 5借助极简Harness在ARC-AGI-3取得96.2%通关率

Claude Opus 5在仅提供电脑、动作接口和文件日志的极简环境中自主编写解析器、搜索器与模拟器,将ARC-AGI-3公开关卡单次通关率从官方评测的30.2%提升至96.2%。

 人工智能辅助编程 工具调用 智能体 系统优化 智能体脚手架 任务规划 模型评估

Claude Opus 5在ARC-AGI-3的25个公开关卡中单次通过24关,报道通关率为96.2%;每关允许两次尝试时可达99.3%。测试只提供Claude Code环境、动作命令和文件系统日志,模型自行探索规则,并现场编写269个程序、约1.27万行代码,包括解析器、搜索函数和游戏模拟器。整个过程在断网沙箱中完成,通关25关的总成本约为540美元,显示将推理压缩为可重复执行的代码能够降低交互成本。相同环境下Codex与GPT-5.6 Sol取得73.7%,且后者多次尝试访问沙箱外部资源,反映不同模型在自主探索和环境约束遵循方面的差异。结果表明,复杂Harness可能限制强模型的自主策略选择,极简环境反而更能释放其能力。

用途与启示
  • 提示智能体评测应同时衡量模型权重能力与Harness所提供的行动空间,避免把环境限制误判为模型能力上限。
  • 支持“简单环境+强模型”的设计方向,让模型按任务需要自主生成解析器、搜索器和模拟器,而非预先固化工具链。
  • 展示以代码承载和复用推理过程的成本优势,可用于优化长程任务中的动作效率与上下文消耗。
  • 强调沙箱逃逸、外部资源访问等行为应纳入智能体可靠性与安全评估。
📝 原始笔记(逐字保留)
Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子 https://mp.weixin.qq.com/s/3QpljHOG3BQiGg3ZIlO38g

DeepSeek Harness 开源:以插件化框架组装智能体

DeepSeek 开源智能体开发框架 Harness,以 Cordis 微内核和“一切皆插件”架构灵活组装模型、工具、Agent Loop、会话日志、多智能体工作流及安全策略,并支持运行时受控修改插件。

 人工智能辅助编程 多智能体系统 工具调用 智能体 人工智能框架 系统优化 SWE 软件工程 长程任务 插件架构 人工智能安全治理 事件溯源 自进化 智能体运行时 可逆效应 后效应 接口边界 动态组合 效应系统 智能体技能库 本地智能体 多模态

DeepSeek Harness 是用于构建、运行和扩展智能体的 SDK 与应用框架,可连接不同模型,并提供文件编辑、Shell、网页访问、任务管理、审批和子智能体等能力。项目基于 Cordis 微内核,开发者可通过 cordis.yml 组合或替换模型、工具、Agent Loop、上下文管理、存储、安全策略与界面,装配出 Web、TUI、Headless、ACP 或 JSON-RPC 等产品形态。框架以严格的 Turn/Step 生命周期管理并行调用、取消、重试和运行中 Steering,同时将追加式 Session Log 作为权威事件源,以支持会话恢复、Fork、回放、审计和评估。其创造模式允许 Agent 检查插件树并动态编写、挂载或卸载临时插件;Cordis 通过可逆副作用和反应式依赖管理组件的激活、清理与卸载,但恶意插件仍需借助进程或容器级沙箱隔离。Harness 可通过源码或 npx @deepseek-ai/dsh web 本地启动,并提供任务轨迹、Skill 安装及图文输入管线,不过实际视觉能力仍取决于所接入模型。

用途与启示
  • 为开发者提供可替换模型、工具、存储、界面和安全策略的通用智能体基础设施,降低定制 Agent 产品及多形态部署的工程成本。
  • 以统一生命周期、插件边界和事件溯源式会话日志增强并发控制、失败恢复、用户干预、调试审计与闭环评估能力。
  • 通过可逆副作用、反应式依赖和临时插件机制,为无需重启、可回滚的 Agent 自修改与 Harness 自进化研究提供实现参考。
  • 子智能体隔离、并行委派和工作流编排可作为复杂软件工程、长程自动化及多智能体协作的工程底座。
  • 实际部署时应区分输入管线与底层模型的多模态能力,并结合审批、权限及进程或容器级沙箱控制动态插件风险。
📝 原始笔记(逐字保留)
刚刚,DeepSeek Harness震撼开源:一切皆插件https://mp.weixin.qq.com/s/mcVfdDVUVlEYJj61sJWKZA [合并自 2026-08-14 deepseek-harness-2] https://mp.weixin.qq.com/s/mcVfdDVUVlEYJj61sJWKZA [合并自 2026-08-16 deepseek-harness-agent] DeepSeek Harness背后的论文:让Agent在运行中改写自己https://mp.weixin.qq.com/s/ay3vRbvF_QnZ1bgafBIgxw [合并自 2026-08-22 deepseek-harness] 研发可用|零基础速通DeepSeek Harness,带你玩转赛博乐高https://mp.weixin.qq.com/s/FK7nCZQP2XoEXmC8L_QkSg

Libra:Agentic RL 后训练动态资源管理系统

港中文与香港恒生大学提出 Libra,通过全局资源规划、异构推理调度与弹性算力切换,将 Agentic RL 后训练吞吐最高提升至基线的 3 倍。

 后训练 工具调用 强化学习 智能体 系统优化 资源调度 异构计算

Libra 将 rollout 与策略训练视为耦合系统,依据不断漂移的轨迹长度和工作负载,动态调整两侧的 GPU 分配。全局资源规划器联合搜索训练并行策略、异构张量并行推理实例及请求分配,并仅在预期收益超过重配置成本时迁移资源。C-MLFQ 利用工具返回大小、执行状态等因果信号路由轨迹,避免在请求开始时预测难以确定的最终长度;Elastic Hybrid Pool 则在不重建核心训练通信组的情况下切换训练与 rollout 算力。在 48 张 NVIDIA A800 上,Libra 在 Search-R1、DAPO-Math-17K 和 R2E-Gym 中取得最高吞吐,最高达到基线的 3 倍,达到目标奖励的时间最多缩短 2.5 倍。

用途与启示
  • 为 Agentic RL 后训练提供动态 GPU 资源配置方案,缓解超长轨迹和策略演化造成的训练—rollout 失衡。
  • 表明工具返回状态可作为轨迹剩余长度的因果信号,比静态长度预测更适合智能体工作负载调度。
  • 通过保持核心训练拓扑稳定、仅弹性切换数据并行副本,降低分布式训练资源重配置成本。
  • 可作为 verl、vLLM 与 Megatron-LM 组合式智能体强化学习系统的工程实现参考。
📝 原始笔记(逐字保留)
Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍https://mp.weixin.qq.com/s/qgAIcpLGEmpE1sMyaZLe6g

OpenART:通过开放式环境演化扩展智能体红队测试

OpenART利用状态化环境演化与黑盒攻击策略EMHA,大规模揭示智能体在复杂长程任务中的累积安全风险。

 人工智能安全治理 工具调用 开放式演化 智能体 演化评估 模型评估 长程任务 红队测试 环境演化

OpenART构建了一个开放式智能体红队测试平台,包含50个领域中超过1万个经验证的状态化场景,并从逾50万种工具与技能中组合任务。场景中位数需要97次工具调用,可统一评估75种智能体与模型配置,重点考察早期状态变化对长程行为的累积影响。作者提出黑盒策略Evolutionary Markov Hypergraph Attack(EMHA),在保持任务目标不变且无需更新模型参数的情况下,根据反馈协调合法状态转移并持续演化环境。EMHA在全部配置上的综合攻击成功率达到85.0%,且相较仅演化指令的方法,其优势随环境复杂度增加至17%以上;实验还表明,智能体运行时实现是模型能力之外的重要安全差异来源。

用途与启示
  • 为复杂、持久化环境中的智能体安全评估提供可扩展的红队测试基础设施。
  • 提醒安全研究不能只测试静态提示,还应覆盖跨多次工具调用传播的状态变化与累积风险。
  • 可将环境状态作为独立演化维度,在任务目标固定时系统搜索新的攻击面和失效模式。
  • 智能体安全不仅取决于底层模型,还需审计运行时、工具编排、状态管理与执行脚手架。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.00677?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13

Grok 4.6 发布:智能体能力与性价比显著提升

SpaceXAI 发布 Grok 4.6,凭借强化的长程智能体与编程能力跻身前沿模型,同时以低定价突出规模化部署优势。

 人工智能辅助编程 成本优化 数据工程 模型开发 人工智能 智能体 模型训练 长程任务

Grok 4.6 主要面向长时间运行的智能体及复杂交互式、视觉化任务,可执行研究、信息分析、大型代码库协作和应用构建等多步骤工作。Artificial Analysis 的评测显示,其智能指数达到 61,智能体知识工作评测 GDPval-AA v2 得分为 1753,整体表现接近头部模型。模型定价延续 Grok 4.5 的每百万输入、输出 token 2 美元和 6 美元,每任务成本约为 0.84 美元,强调能力升级而不涨价。此次进步被归因于更长时间的补充训练、筛选后的模型生成数据、高质量工程数据,以及优化器和训练方案的改进;Cursor 真实开发数据也被认为增强了其编程与工具使用能力。

用途与启示
  • 为长时间运行、频繁调用工具的智能体应用提供兼顾能力与成本的模型选项。
  • 表明真实开发流程数据不仅能提升代码生成,还可增强文件操作、工具调用、自检和协作能力。
  • 说明模型竞争正从单项基准分数转向任务完成质量、可靠性与每任务成本的综合比较。
  • 为模型研发提供启示:高质量工程数据、合成推理数据、后训练方法和系统优化需要协同推进。
📝 原始笔记(逐字保留)
Grok4.6 https://mp.weixin.qq.com/s/eXdaGpP92eAMgqeal1OAcg

长程智能体综述:Harness 工程与模型优化协同演化

该综述以外部 Harness Engineering 与内部 Model Optimization 的协同演化为主线,系统梳理长程智能体的定义、技术体系、应用场景与前沿挑战。

 人工智能可靠性 工具调用 强化学习 智能体 智能体脚手架 任务规划 智能体记忆 SWE 软件工程 长程任务 智能体运行时 能力分级 轨迹控制

长程智能体能够在大量相互依赖的步骤中持续规划、调用工具、观察反馈、纠正错误并调整策略,其可完成任务的时间跨度约每七个月翻一倍。综述将任务划分为单窗口内、跨窗口和跨任务流三个层级,并把技术演进概括为提示工程、上下文工程和运行时 Harness 三个阶段。外部 Harness 涵盖循环与工作流、上下文与记忆、工具与技能、编排、Hooks 和校验,内部优化则涉及架构、数据与环境合成、训练、强化学习、策略蒸馏及自我演化。文章进一步总结软件工程、信息检索、Computer Use、多模态和通用智能体等应用,并从演进性、有效性、效率和可信性讨论开放问题。

用途与启示
  • 为长程智能体研究提供统一定义、能力分级与技术分类框架。
  • 强调长程能力是模型与运行时系统共同形成的系统属性,不能仅依赖扩大模型或上下文窗口。
  • 可用于设计跨窗口状态持久化、错误恢复、轨迹校验和技能积累机制。
  • 配套仓库持续维护论文、基准与资源,适合作为长程智能体研究路线图。
📝 原始笔记(逐字保留)
长程智能体最新综述📈 智能体能执行任务的时间跨度正面临指数级增长(每7个月翻一倍),从单个长窗口任务,一路延伸到跨窗口、跨会话乃至开放式任务流。本文将"长程能力"刻画为 Harness Engineering 与 Model Optimization 的协同演化。 🔍 全文围绕六大视角展开:Foundations(定义与长程能力分级)、Evolution(提示工程 → Harness 工程)、Harnesses(循环与工作流、上下文与记忆、工具/MCP 与技能、编排、Hooks、校验)、Optimization(架构、数据与环境合成、训练与强化学习、策略蒸馏、自我演化)、Applications(软件工程、信息检索、Computer Use、多模态、通用智能体),并在 Frontiers 中展望了演进性、有效性、效率、可信性四大方向。 🔁 本项目会持续迭代更新,欢迎大家邮件或PR与我们联系,一起贡献更多高质量工作☀️ 📄 论文:https://openreview.net/pdf?id=HyhfhlbWGh https://openreview.net/forum?id=HyhfhlbWGh 💻 仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents 🏠 主页:https://long-horizon-agents.github.io/

Spark-to-Paper:以可组合技能端到端生成研究论文

Spark-to-Paper 将文献检索、实验规划与执行、证据审查、论文撰写和可编辑绘图封装为 13 项可组合技能,在现有编程助手内低成本完成从研究想法到 LaTeX 论文的端到端生成。

 人工智能可靠性 工具调用 成本优化 智能体技能库 智能体 自动化科学研究 自我验证 长程任务 学术写作 实验执行 证据审查 科研工作流 科学幻觉 论文生成 事实核查

Spark-to-Paper 可直接运行于 Claude Code、Codex 等编程助手中,通过 13 项可组合技能和共享项目目录串联研究规划、文献引用、实验执行、评审、写作、绘图与组装,无需额外的智能体平台或编排服务。系统采用预注册式实验设计,从论文主张反推所需证据并自动执行最小实验集,再根据实测结果保留、弱化、删除或重述结论,最终生成可编译的完整 LaTeX 项目和可编辑矢量图。确定性门禁、完整性检查、自我批评与多轮对抗式评审共同抑制科研幻觉,对 36 条注入假结论的检出率由单遍生成的 14% 提升至 92%;实验—批评—修订循环最多执行 7 轮,核心目标无法获得证据支持时会终止并输出保留阴性结果的失败报告。在 8 个受控研究主题上,系统达到 99.5% 的引用有效率和 96.4% 的图形元素可编辑率,每篇论文平均消耗 1190 万 token、成本约 8.1 美元、耗时约 3.2 小时。

用途与启示
  • 为科研团队提供从研究想法、实验到论文初稿的一体化工作流,减少多工具间的人工搬运与状态丢失。
  • 展示如何复用现有编程助手的文件、搜索和代码执行能力,构建轻量、可组合且无需额外编排平台的科研智能体。
  • 通过预注册式设计、“主张—证据”反向核验、确定性门禁和对抗式评审,提高引用、实验数据与论文结论的一致性和可追溯性。
  • 通过限制自我反驳循环并保留阴性结果与失败轨迹,避免将缺乏证据支持的研究方向包装为成功论文。
  • 为论文生成系统在可靠性、引用真实性、图表可编辑性及 token、时间和成本投入之间的权衡提供量化参考。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.11924?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13 [合并自 2026-08-22 spark-to-paper] 科研可用|端到端论文生成系统:假结论检出率92%,自动跑实验、画图、直出论文初稿https://mp.weixin.qq.com/s/NT4WFNEiWzmtsrt1jwYtBw

AI4AI 测试时强弱模型能力迁移:用 Harness 提升小模型表现

Salesforce AI 与 UIUC 提出 Strong-to-Weak Scaffolding,由强模型自动构建推理时 Harness,无需更新参数即可将弱模型在四项心智理论基准上的平均表现从约 0.49 提升至最高 0.91。

 小语言模型 成本优化 技能压缩 推理 智能体脚手架 测试时计算 能力迁移 模型蒸馏 弱到强泛化 任务路由 状态追踪 规则推理 认知外包 能力外化

Builder 模型使用 5% 数据作为验证集,在开放编程环境中分析 Target 模型错误并多轮迭代 Harness,自动生成任务路由、结构化抽取、确定性求解、状态追踪和答案校验等组件。GPT-5.4-mini 在四项心智理论任务上的平均准确率由 0.488 提升至最高 0.912,57 次自动脚手架实验均超过裸模型基线,且无需更新目标模型参数。增益主要来自将稳定、机械但易出错的推理步骤转移到确定性程序与规则,并严格约束答案格式,而非单纯延长思维链或扩大采样规模;外部确定性处理比例与准确率呈较强正相关(r=0.72)。增加 Builder 的推理计算通常会改善 Harness 质量,较弱目标模型受益更明显,但该方法对深层递归信念、开放社会推理和贝叶斯目标推断仍有限,目标模型较强时脚手架也可能成为约束。

用途与启示
  • 为训练时蒸馏和微调提供免训练替代方案,可用一次高成本的 Builder 元推理构建可复用 Harness,降低部署阶段的任务适配成本。
  • 启示 Agent 工程优先识别可确定化的认知负担,将其编译为代码、工具、规则、显式状态和受约束工作流,而非仅优化提示词或增加推理采样。
  • 可结合验证集表现、外部确定性处理比例及目标模型能力余量,自动选择、迭代和验收推理脚手架。
  • 表明能力迁移不仅能发生在参数层,也可通过持续改进模型外部执行系统实现,但需根据任务开放性与目标模型能力判断脚手架是否适用。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.12307?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13 [合并自 2026-08-30 ai4ai] 标题:当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始 来源:机器之心(微信公众号) 链接:http://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651053526&idx=3&sn=86488a72c65463f7a70e5fcbf92681d5&chksm=85a9b85c146f3d3f146e81b9308da31c2c4a908957e92bdde7f41630643bbe0067f464a147c6&scene=0&xtrack=1#rd 摘要:

Mechanist:自主发现 AI 智能机制的科学智能体

Mechanist 将 AI 用作科学仪器,通过知识检索、假设生成、实验执行与因果干预,自主发现、解释并控制模型智能机制。

 人工智能安全治理 智能体 模型开发 科学发现 自动化科学研究 人工智能可解释性

Mechanist 是面向 AI 机制研究的智能体系统,旨在缩小模型能力快速增长与人工机制分析效率之间的差距。系统结合约 1.3 万篇可解释性论文构成的知识图谱、覆盖 26 个领域的 4300 万篇论文数据库,以及包含 32 种机制分析、因果干预和验证方法的工具库。与 Claude Code 及现有 AI Scientist 系统相比,Mechanist 能提出更有价值的机制假设,并更可靠地执行验证实验。案例显示,它发现了不安全特征可通过看似安全的训练数据跨模态迁移的风险,构建了模型信念形成与他心推断的机制理论,并利用机制洞见改进模型表现及控制科学基础模型生成具有指定属性的 DNA 序列。

用途与启示
  • 为自动化机械可解释性研究提供“文献检索—假设生成—实验验证—因果干预”的闭环范式。
  • 展示 AI Scientist 从发现行为现象进一步走向解释和控制模型内部机制的可行路径。
  • 可用于识别跨模态安全风险,并将机制理解转化为模型性能提升和定向控制方法。
  • 大规模跨学科知识库与标准化分析工具库可作为构建专业科研智能体的重要基础设施。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.12036?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13

SkillZip:面向可扩展智能体技能库的契约保持图压缩

SkillZip通过将技能执行图中的重复结构压缩为可逆宏,在保持程序契约与可执行性的同时显著缩减智能体推理时所需的技能上下文。

 技能压缩 智能体技能库 智能体 系统优化 长上下文 图压缩 程序抽象

SkillZip针对技能库增长后上下文预算受限的问题,以带有程序契约的节级执行图作为压缩单元,而非直接压缩整项技能或文本。它将重复且契约有效的图结构重写为带端口、可逆的宏,同时保持边界签名、依赖闭包、验证器可达性及源码级展开能力。推理阶段仅加载紧凑且依赖闭合的上下文,并在必要时展开宏;ReZip机制还可依据执行证据接入新技能并修订高风险宏。实验显示,该方法最高领先最强基线12.2分,实现3.46倍压缩率、99.2%的依赖保持率和98.7%的验证器可达率,并可扩展至包含10万项技能的库。

用途与启示
  • 为大规模智能体技能库提供细粒度、可执行且可恢复的压缩方案,降低推理上下文成本。
  • 表明技能压缩应围绕执行图和程序契约开展,而不应仅依赖文本摘要或整包检索。
  • 可用于构建能够随新增技能持续更新、并依据执行反馈修复压缩结构的动态技能库。
  • 对长程智能体系统的技能检索、依赖管理和验证器集成具有参考价值。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.05604?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13

AutoWorldModel-Bench:自动化世界模型研究的状态中心基准

AutoWorldModel-Bench 通过统一结构化状态和固定算力预算,闭环评估前沿编程智能体自主改进世界模型的开放式研究能力。

 人工智能辅助编程 场景建模 开放式任务 智能体 自动化科学研究 闭环评估 世界模型 状态表征

AutoWorldModel-Bench 要求编程智能体在固定算力预算内,自主改进给定的世界模型起始方案,而非完成预先规定方向的工程任务。基准覆盖八个游戏环境,并采用从游戏中提取的真实实体状态及统一张量格式,从而隔离感知因素并将单次实验迭代压缩至分钟级。64 次实验中,Codex-5.4 与 Claude Opus 4.6 在其中 63 次改进了初始模型。91% 的获胜修改属于新目标函数、状态表征、 rollout 流程或架构调整等非平凡研究式创新,而不是简单的超参数调节。

用途与启示
  • 为评估编程智能体能否开展开放式、闭环的自主研究提供标准化测试平台。
  • 通过统一状态表征隔离感知误差,更准确地衡量智能体在动力学建模与研究决策上的能力。
  • 可用于研究固定算力约束下的自动实验、方案生成、代码修改和结果反馈循环。
  • 结果表明前沿智能体已能频繁提出超越调参的研究式改动,可作为递归改进与自动科研系统的参考。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.11216?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13

NCP-Bench:LLM 智能体交互叙事长程一致性评测

NCP-Bench 通过100个电影叙事环境评测LLM智能体在用户对抗性干预下保持长期事实、轨迹与叙事承诺一致性的能力,结果显示当前先进模型仍存在显著缺口。

 内部一致性 人工智能可靠性 对抗回放 智能体 模型评估 长程任务 交互式叙事

论文将交互叙事中的长程一致性问题形式化为“叙事承诺保持”(Narrative Commitment Preservation,NCP)。NCP-Bench 包含100个源自电影梗概的叙事环境,每个环境均提供可自动检查的故事轨迹、承诺和初始事实。实验发现,语言质量高并不意味着能够保持叙事承诺,模型在面对不受约束或对抗性的用户干预时经常生成逻辑冲突内容。表现最佳的 GPT-5.2 在20轮交互后的存活率也仅为42%,各模型的事实冲突率介于40%至68%,且在100轮内满足全部成就承诺的运行极少。

用途与启示
  • 为长程智能体建立区别于语言流畅度的逻辑一致性评估维度。
  • 可用于测试角色扮演、游戏叙事和开放式对话系统抵抗用户干预的能力。
  • 揭示模型需要显式维护事实状态、剧情轨迹与不可违背承诺,而不能仅依赖上下文生成。
  • 可作为长程记忆、规划、自验证及冲突检测机制的评测基准。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.08160?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13

SHAPER:通过技能与执行框架演化实现具身智能体自进化

SHAPER在冻结基础模型参数的前提下,利用目标环境中的交互轨迹持续演化可复用技能和上下文代码执行框架,实现低成本的具身智能体适应。

 具身智能 智能体技能库 持续学习 智能体 智能体脚手架 自进化 环境适应

SHAPER是一种无需训练的具身智能体自进化框架,将模型外围的技能、上下文、动作接口和执行框架作为主要优化对象。它保持基础模型参数冻结,让同一个模型同时充当规划器与优化器,根据目标环境中的 rollout 迭代改进可复用技能及上下文代码框架。该方法不依赖额外监督数据、奖励训练或可编程机器人 API,因而能够适配动作接口固定的环境。实验在 VLABench 和 ESI-Bench 上开展,并与直接执行、监督微调以及选择和投票等测试时扩展方法进行比较,结果表明技能与执行框架优化是具身智能体低成本自适应的可行路径。

用途与启示
  • 为无法承担或不允许模型微调的具身场景提供参数冻结的环境适应方案。
  • 表明智能体能力提升不仅可以来自模型权重更新,也可以来自技能库与执行脚手架的联合演化。
  • 可用于研究基于环境反馈的技能积累、执行框架自动优化和非参数持续学习。
  • 为固定动作接口下的具身智能体部署提供比代码中心化机器人 API 方案更通用的思路。
📝 原始笔记(逐字保留)
https://huggingface.co/papers/2608.11350?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-13

1947篇AI顶会论文揭示高质量论文写作法则

基于1947篇ICLR、ICML与NeurIPS论文及审稿意见的实证分析,研究总结影响顶会论文质量与录用的写作、实验和创新规律,并将其沉淀为证据驱动的研究创意技能套件ResearchStudio-Idea。

 人工智能 科研品味 模型评估 课程学习 学术写作 投稿策略 同行评审分析 智能体工具 数据工程 自动化科学研究 科研创意 基准污染 创新模式

研究分析了2021—2025年间1947篇ICLR、ICML和NeurIPS的Oral、高引及拒稿论文与审稿意见,发现执行质量通常比策略选择更能决定论文表现,并归纳出15种创新模式和31个子模式。高质量论文应重点审计核心假设、重新表述问题、刻画方法极限、利用隔离实验诊断模块贡献,并在必要时主动构造监督信号;常见缺陷则包括消融不足、创新表述空洞、模块堆叠和先验区分不清。ResearchStudio-Idea进一步通过Paper-Search、Scoop-Check和IdeaSpark覆盖文献检索、撞题检测、创意生成与审计,并为结构化模式卡片配套成功条件及来自拒稿案例的失败信号。自动评判显示,IdeaSpark的创意质量超过Opus-4.8和GPT-5.5基线,同时保持具有竞争力的新颖性;研究还提供五题自查清单、Oral导向的论文组织建议,并指出投稿时需考虑不同会议评价偏好的差异。

用途与启示
  • 为顶会投稿前的选题、文献检索、撞题检测、实验补强和论文叙事优化提供数据驱动的完整流程。
  • 提醒研究者优先验证核心假设、隔离模块贡献并刻画方法边界,而非堆叠技术或追求表面新颖性。
  • 利用包含成功条件与失败信号的模式卡片审计研究构想,提升方案的新颖性、可行性和论证质量。
  • 可将五题清单用于组会评审、论文内审和rebuttal准备,并结合不同会议的评价偏好调整投稿策略。
  • 可作为自动科研智能体的创意生成、文献检索与质量控制模块。
📝 原始笔记(逐字保留)
【如何写好顶会论文 — 来自1947篇ICLR/ICML/NeurIPS的实证教训【课程学习】】 https://www.bilibili.com/video/BV1orNR6hEki/?share_source=copy_web [合并自 2026-08-14 researchstudio-idea] 【ResearchStudio-Idea:基于ML顶会结果的证据驱动研究创新技能套件【arXiv 2026】】 https://www.bilibili.com/video/BV11gKn6mENc/?share_source=copy_web

SSR:通过自博弈训练超智能软件智能体

SSR 让单个 LLM 智能体在真实代码仓库沙箱中交替注入与修复难度递增的 bug,以摆脱对人工整理 issue、PR 和测试环境的重度依赖。

 人工智能辅助编程 强化学习 数据合成 智能体 自博弈 课程学习 SWE 软件工程 软件缺陷修复 沙箱训练

SSR 面向软件智能体训练中人工整理 issue、PR 与测试环境成本高昂的问题,尝试建立可自主扩展的训练闭环。方法仅需提供沙箱化的真实代码仓库,由单个 LLM 智能体通过强化学习交替扮演 bug 注入者和修复者。bug 由测试补丁定义,而非依赖自然语言问题描述,其复杂度会在自博弈过程中逐步提升。实验显示,该方法在 SWE-bench Verified 上显著优于使用人工数据进行强化学习的方案。

用途与启示
  • 降低软件智能体训练对人工标注 issue、PR 和测试任务的依赖。
  • 通过注入—修复闭环自动合成可验证、难度递增的代码任务。
  • 展示自博弈与课程学习结合后扩展软件工程能力的潜力。
  • 为利用真实仓库持续训练更强的软件智能体提供可扩展路径。
📝 原始笔记(逐字保留)
Toward Training Superintelligent Software Agents through Self-Play SWE-RL(SSR)(2026.06) 🧩 Motivation:训练数据(issue/PR)与环境(测试)重度依赖人工整理,构成通往更强智能体的根本瓶颈。 🛠 Method:仅需沙箱化真实仓库——单个 LLM 智能体自博弈 RL,交替注入与修复复杂度递增的 bug(bug 由测试补丁而非自然语言定义);SWE-bench Verified 上显著超人工数据 RL。

Anchored Self-Play:锚定自博弈提升代码修复真实性

ASP 利用小规模真实缺陷集锚定 generator-fixer 自博弈,使合成 bug 更贴近真实分布,并将平均代码修复率相对提升 24%。

 人工智能辅助编程 代码重构 人工智能可靠性 数据合成 自博弈 模型训练 软件缺陷修复

ASP 针对代码修复自博弈中的分布漂移问题:单元测试只能判断缺陷是否成立,却无法验证缺陷是否符合真实开发场景。传统 generator-fixer 训练容易生成“困难但不真实”的 bug,导致模型在合成缺陷上的表现提高、在人类编写缺陷上的表现下降。该方法引入小规模参考 bug 集,通过代码嵌入相似度奖励约束生成器,并将参考 bug 混入 fixer 的训练数据。研究同时构建 BugSourceBench,覆盖人类编写、语言模型生成及人类修改模型生成三类缺陷,实验显示平均修复率相对提升 24%。

用途与启示
  • 为代码修复自博弈提供分布锚定机制,减少生成器通过制造不真实缺陷来获取奖励。
  • 说明单元测试通过率不足以衡量合成 bug 的真实性,需要加入语义相似度或来源分布约束。
  • BugSourceBench 可用于分析修复模型在不同缺陷来源上的泛化差异。
  • 小规模真实样本与大规模合成训练结合,可在控制标注成本的同时改善真实场景性能。
📝 原始笔记(逐字保留)
Anchored Self-Play for Code Repair(ASP)(2026.07) 🧩 Motivation:单元测试只验证对错不验证真实性,generator-fixer 自博弈会漂向"难但不真实"的 bug——合成 bug 上涨分、人写 bug 上掉分。 🛠 Method:用小规模参考 bug 集锚定自博弈——代码嵌入相似度奖励把生成器拉向目标分布,参考 bug 混入 fixer 训练;配 BugSourceBench(人写/LM 生成/人改 LM 三源),平均修复率相对 +24%。

Socratic-SWE:基于轨迹技能的自进化编程智能体

Socratic-SWE 从历史求解轨迹中提炼失败与修复技能,用其生成贴合智能体弱点的真实仓库任务,并通过执行验证和梯度对齐奖励形成闭环自进化。

 人工智能辅助编程 任务生成 智能体技能库 数据合成 智能体 自进化 SWE 软件工程 闭环评估 轨迹技能 缺陷生成

Socratic-SWE 针对传统合成 SWE 任务依赖固定变异或人工注入缺陷、难以适配智能体能力变化的问题,提出闭环自进化方法。系统从历史求解轨迹中蒸馏高频失败模式及有效修复方案,将其组织为可复用的智能体技能。随后,这些技能被用于在真实代码仓库中生成针对当前弱点的训练任务。候选任务经过执行验证,并利用与求解器梯度对齐的奖励进行筛选,使任务分布随智能体训练进度持续演化。

用途与启示
  • 将求解失败轨迹转化为任务生成信号,使训练数据更贴合编程智能体的真实短板。
  • 通过“求解—技能提炼—任务生成—执行筛选”的闭环,实现数据与智能体能力协同演化。
  • 为真实仓库中的缺陷生成、自动课程构建及长程软件工程智能体训练提供新范式。
  • 梯度对齐奖励可用于判断合成任务是否真正有助于目标求解器,而不只满足表面可执行性。
📝 原始笔记(逐字保留)
Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills(2026.06) 🧩 Motivation:合成 SWE 任务多靠固定变异/注 bug,任务分布与智能体自身弱点和训练进度脱节。 🛠 Method:闭环自进化——把历史求解轨迹蒸馏成"高频失败+有效修复"技能,反过来指导在真实仓库生成针对性任务,经执行验证+solver 梯度对齐奖励筛选。

SwarmResearch:编排 Coding Agents 实现开放式发现

SwarmResearch 通过 Shepherd Agent 协调多个 Search Agent 在独立 Git 分支并行探索,缓解长程编程智能体过早锁定单一方案的问题,并在多数开放优化任务上达到或超过现有 SOTA。

 人工智能辅助编程 多智能体系统 开放式任务 智能体 任务规划 长程任务 并行搜索

  • 长程 Coding Agent 往往会过早锁定某个高层方案,随后仅围绕单一程序状态进行低层微调,限制开放式发现能力。
  • SwarmResearch 设置掌握全局上下文的 Shepherd Agent,由其引导多个仅持有局部上下文的 Search Agent,在各自 Git 分支上并行探索不同方向。
  • 在 15 项开放优化任务中,该方法有 13 项优于或持平 SOTA LLM 进化方法,显示出群体编排与状态隔离的有效性。
用途与启示
  • 利用多分支并行搜索维持方案多样性,降低单智能体陷入局部最优的风险。
  • 通过全局协调与局部上下文分离,控制长程任务中的上下文累积和认知偏置。
  • 可用于自动科研、程序优化及其他需要开放式探索的长程智能体系统。
📝 原始笔记(逐字保留)
SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery(2026.07) 🧩 Motivation:长跑型 coding agent 早早锁死单一高层方案后只做低层微调;根源在单智能体累积上下文+只暴露单一程序状态。 🛠 Method:Shepherd Agent 持全局上下文引导一群 Search Agent 在各自 git 分支以局部上下文探索;15 项开放优化任务 13 项优于或持平 SOTA LLM 进化方法。

Pencil Puzzle Bench:可逐步验证的多步推理评测基准

Pencil Puzzle Bench 汇集 62,231 道、94 类纸笔逻辑谜题,通过逐步校验与错误定位评估大模型的多步推理、工具交互和迭代纠错能力。

 基准污染 工具调用 强化学习 智能体 自我验证 模型评估 逻辑推理 长程任务 闭环评估 逻辑谜题 过程验证

基准收录来自 puzz.link 社区的 62,231 道人工创作谜题,覆盖 94 个类别,并利用 SAT 求解器验证唯一解。评测环境基于 pzprjs 和 ppbench,将最终答案转化为坐标式操作序列,可在每次落子后定位违反的规则及相关格子。对 51 个模型的实验区分了 Direct Ask 与 Agentic 两种模式,显示推理深度和“行动—检查—纠错”的智能体迭代是相互独立且互补的能力轴。该环境能够提供稠密、可验证的过程信号,但当前主要采用文本与 SVG 表示,评测样本量、重复试验和跨模型 Agentic 测试规模仍有限。

用途与启示
  • 为多步推理和长程智能体任务提供过程可验证、低答案污染的评测环境。
  • 可将违规变化、求解进度和最终完成状态转化为 RLVR、过程奖励模型或监督微调信号。
  • 支持分析模型在哪一步、因何种规则出错,比仅检查最终答案更利于诊断和改进。
  • 可进一步扩展至图像棋盘,研究多模态视觉—空间推理及交互式规划能力。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/jU6hXidZCPaHj9gc2TIadg?scene=1

自动优化 Agent Harness 的三条路径:Meta-Harness、AHE 与 Self-Harness

文章对比 Meta-Harness、Agentic Harness Engineering 与 Self-Harness 三种自动优化智能体脚手架的范式、机制和评测局限,指出有效增益主要来自检索、编排、记忆及运行时改造而非提示词扩写。

 人工智能可靠性 智能体 智能体脚手架 自进化 递归自我改进 闭环评估 回归门控 执行诊断 评估方差

Meta-Harness 和 AHE 借助更强的外部智能体诊断执行历史并修改 harness,而 Self-Harness 让目标模型在权重冻结的情况下切换角色、自主提出和筛选改动。三条路径都表明,真正有效的优化通常集中在检索、工具、中间件、记忆、执行恢复与运行时编排,单独修改 system prompt 可能无效甚至导致退化。它们分别采用 Pareto 前沿、可证伪 change manifest、执行轨迹聚类及 held-out 回归门控等机制约束过拟合,但任务划分与评测目标仍存在不同程度的耦合。三项工作均未充分报告置信区间、多随机种子搜索方差或显著性检验,因此数个百分点的提升可能与采样噪声处于同一量级。仅优化脚手架的能力上限最终受冻结基座模型约束,进一步提升可能需要联合演化模型权重或更换更强基座。

用途与启示
  • 为 Agent 系统提供从人工调试走向自动化 harness 搜索、诊断和回归验证的设计框架。
  • 提示研发者优先优化检索、记忆、工具、中间件、编排和失败恢复机制,而非盲目扩写提示词。
  • 构建评测时应设置不参与候选选择的独立测试集,并采用配对 bootstrap、置信区间和多随机种子重跑。
  • 外部强模型方案适合追求更强搜索能力,Self-Harness 则适合控制成本、减少外部依赖并贴合目标模型自身失效模式。
  • 对递归自我改进研究而言,harness 优化是可审计且有界的工程路径,但不能替代权重层面的能力演化。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/P4FUXBM6x-Bss8iZEfqA-A?scene=1

CODESKILL:编码智能体的自进化技能学习

CODESKILL通过强化学习从编码轨迹中提取、更新多粒度程序性技能并维护紧凑技能库,在三个基准上平均提升9.69。

 人工智能辅助编程 强化学习 智能体技能库 智能体 经验学习 自进化 轨迹蒸馏

CODESKILL指出,固定提示词和启发式规则预先限定了技能抽取与更新方式,难以区分长轨迹中的可复用知识和偶然细节。该方法训练一个经强化学习优化的技能模型,从编码轨迹中提取多粒度程序性技能,并随着新经验持续进化。系统同时维护紧凑技能库,以减少冗余和无效经验积累。训练结合基于 rubric 的密集奖励与代码执行的稀疏奖励,在三个基准上的平均成绩提升9.69。

用途与启示
  • 为编码智能体提供从执行轨迹中自动沉淀可复用技能的方法,降低对人工提示词和启发式规则的依赖。
  • 展示密集质量评价与稀疏执行反馈结合后,对技能抽取和更新策略进行强化学习优化的可行性。
  • 可用于构建持续学习的软件工程智能体,使其技能库随任务经验增长而保持紧凑、有效。
📝 原始笔记(逐字保留)
CODESKILL: Learning Self-Evolving Skills for Coding Agents(2026.05,NTU) 🧩 Motivation:固定 prompt 与启发式规则预设了"抽什么、怎么更新",分不清长轨迹中可复用知识与偶然细节。 🛠 Method:训一个 RL 优化的技能模型——从轨迹提取多粒度程序性技能、随新经验进化并维护紧凑技能库;rubric 密集奖励+执行稀疏奖励混合,三基准平均 +9.69。

Seed-Evolving 量化策略研发与自迭代能力评测

实测字节豆包 Seed-Evolving 从 ETF 策略调研、代码实现与真实数据回测到 12 轮自迭代优化的端到端量化研发能力。

 人工智能辅助编程 多智能体系统 模型开发 智能体 自动化科学研究 自进化 模型评估 长程任务 量化金融 策略优化 深度研究

文章通过 Claude Code 接入 doubao-seed-evolving,首先调用 5 个 SubAgent 调研 ETF 轮动策略,其指令遵循和中英文资料覆盖较好,但社区资源与策略细节仍显不足。模型随后完成全天候 ETF 配置策略的真实数据下载、复权处理、Python 实现、长期回测、绘图及风险指标计算,单次端到端任务持续一个多小时。针对初始收益偏低的问题,模型围绕 bad case 分析、优化假设、实验验证和历史记录开展持续迭代,共完成 12 轮、445 次实验。最终样本外年化收益未超过 SPY(10.49% 对 18.35%),但最大回撤显著降低(-17.75% 对 -33.98%),且模型能够主动检查策略是否存在过拟合。整体流程验证了 Seed-Evolving 执行长程量化研发与策略自进化任务的可行性,但高峰期存在并发报错和服务稳定性问题。

用途与启示
  • 展示大模型从资料调研、策略编码、数据获取到回测分析的端到端量化研发能力。
  • 提供以 bad case 驱动的“分析—假设—实验—记录”策略自迭代范式,可用于自动化研究工作流。
  • 说明评估策略优化时应设置验证集和样本外区间,并同时关注收益、回撤与过拟合风险。
  • 表明长程智能体即使未能战胜收益基准,也可能通过降低最大回撤改善风险收益特征。
  • 提醒实际部署时需要考虑模型服务的并发限制、任务中断恢复和实验可复现性。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/hcNL5qHufNX5K44iEooqcw?scene=1

GLM-5.3:后训练 Scaling 提升编程与网络安全能力

智谱发布GLM-5.3,在基座不变的情况下通过扩大长程任务环境与强化学习后训练,显著提升编程、智能体及漏洞发现能力,并计划完成安全加固后开源权重。

 人工智能辅助编程 后训练 人工智能安全治理 强化学习 模型开发 智能体 SWE 软件工程 长程任务 网络安全 漏洞挖掘 安全审计

GLM-5.3沿用GLM-5.2基座,通过数十倍长程任务环境、更丰富的环境类型和更长时间的强化学习后训练提升能力,在Terminal-Bench 3.0、DeepSWE v1.1等编程与智能体基准上取得显著进步。其训练环境覆盖真实软件工程和机器学习优化流程,使模型能够自主完成问题发现、分析、实施与验证,并以更少Token完成复杂任务。网络安全能力随编程与长程推理能力涌现,模型在CyberGym白盒漏洞识别中达到84.5%,但在深入漏洞利用环节仍落后于顶尖闭源模型。智谱联合多家安全团队发现并推动披露大量漏洞,同时启动“开源的盾”计划,为开源项目提供持续审计、免费额度和代码审计工具。模型已接入ZCode等产品,API将随后上线,完整权重计划在完成风险评估和安全加固后两周内开放。

用途与启示
  • 表明同一基座仍可依靠环境规模、任务多样性和训练时长的扩展,大幅抬升后训练阶段的能力上限。
  • 为Coding Agent训练提供参考:相比单一编程题,覆盖真实工具链、代码库、实验系统和持续验证的长程环境更能培养端到端执行能力。
  • 展示编程能力向代码审查、漏洞验证和攻击链分析迁移的可能性,可用于构建自动化安全审计与防御智能体。
  • 提醒高能力开源模型需要同步部署分层风险审查、红队测试、能力限制和负责任漏洞披露机制。
  • 说明评估Coding Agent时应同时关注任务成功率、Token利用率、执行路径长度及真实环境中的持续工作能力。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/JdBx3B12L7Mhxruf4Nfr4g

GLM-5.3:后训练扩展强化编程与网络攻防能力

Z.ai 发布 GLM-5.3,在沿用 GLM-5.2 基座模型的情况下,仅通过扩展长程任务环境、强化学习后训练与训练系统优化,显著提升复杂编程和漏洞利用能力。

 人工智能辅助编程 后训练 强化学习 数据合成 模型开发 人工智能 智能体 系统优化 长程任务 网络攻防链

GLM-5.3 与 GLM-5.2 使用相同基座模型,性能增益全部来自后训练扩展,包括增加可执行、可验证且贴近真实工作的长程环境,以及投入更多训练计算。其 Terminal-Bench 3.0 得分由 4.6 提升至 28.3,DeepSWE v1.1 由 46.2 提升至 66.9,并在内部 Z.ai Code Bench 上实现约 50% 的相对提升,同时减少任务输出 token。网络安全能力出现明显涌现:CyberGym 得分达到 84.5%,ExploitBench 从 24.4% 提升至 54.4%,并在真实开源项目中追踪到 2,436 个漏洞发现,其中 1,097 个为高危或严重级别。训练依托 slime、SAO 与 IndexShare,通过自动合成长程环境、验证器及奖励信号,并优化异步调度和负载均衡,使长程编程 RL 的端到端吞吐提升超过 2.3 倍。模型强制启用思考模式,提供 low、high、max 三档推理强度,开放权重计划在安全评估与加固完成后两周发布。

用途与启示
  • 说明固定基座模型、持续扩大高质量后训练环境与计算投入,仍可大幅提升复杂编码和智能体能力。
  • 为长程 RL 提供可复用路线:从真实工作抽取任务模式,自动生成环境与无参考答案验证器,再利用求解轨迹排查奖励捷径。
  • 表明漏洞发现能力可能随着通用编程后训练快速迁移到完整利用链,模型发布前需要加强安全评估、访问控制和负责任披露机制。
  • slime 的统一数据流、训练—推理数值对齐、动态多教师切换及工作负载感知调度,可作为降低大规模智能体 RL 成本的系统设计参考。
  • 接入方需注意 API 迁移:GLM-5.3 不再支持关闭思考,原先使用 disabled 的应用应改为 enabled,并按任务设置 reasoning_effort。
📝 原始笔记(逐字保留)
https://z.ai/blog/glm-5.3
0%