2026-08-13 科研追新
当日精选(由提交工具自动创建)。
AIBuildAI Science Agent:4小时自主完成顶刊级模型研发
谢澎涛团队的 AIBuildAI Science Agent 可在4小时内自主完成科学任务的模型设计、编码、训练与迭代,并在 NatureBench 上取得第一名。
人工智能辅助编程 智能体 科学发现 自动化科学研究 模型评估 模型开发
AIBuildAI Science Agent 面向 AI for Science,可根据任务描述和数据自主完成问题分析、模型设计、代码实现、训练调优及实验迭代,全程无需人类研究者参与。在包含90个 Nature 系列期刊真实任务的 NatureBench 中,该智能体排名第一,57.8%的任务达到或超过论文最高水平,25.6%的任务超越论文最佳方法。系统尤其擅长目标明确、输入输出清晰且可通过可微损失优化的任务,但在整数规划、动态规划等不可微问题上仍较弱。目前它主要自动化模型研发环节,问题定义、数据准备、湿实验验证、实际部署及安全伦理决策仍需人类负责。团队已成立 AIBuildAI 公司并完成约400万美元融资,未来计划通过 API 或技术合作连接实验平台,形成模型预测、实验验证、数据回流和模型迭代的闭环。
- 展示科研智能体从辅助编码迈向自主完成模型研发闭环的可行性。
- 为自动科研系统提供可量化范式:在受限时间内持续执行设计、实验、反馈与优化。
- 提示未来科研瓶颈可能由计算建模转向数据准备、湿实验标准化和验证产能。
- 适合作为 AI build AI、科研智能体能力评估及人机科研分工研究的案例。
📝 原始笔记(逐字保留)
英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard
英伟达推出面向高频智能体任务的开源混合专家模型 Nemotron 3.5 Lightning 及动态模型路由库 NeMo Switchyard,以提升执行效率并降低多模型调用成本。
人工智能辅助编程 小语言模型 工具调用 模型开发 智能体 人工智能框架 混合专家模型 科学发现 系统优化 自动化科学研究 模型路由 成本优化
Nemotron 3.5 Lightning 是一款约 300 亿参数的混合专家模型,面向代码审查、工具调用、安全监控和账单问答等长期运行的智能体任务。英伟达称其输出速度最高可达同类模型的 4 倍,并可将智能体任务完成速度提升约 30%,但通用能力并非当前最高水平。开源路由库 NeMo Switchyard 可结合准确率、延迟、Token 消耗和成本,在智能体运行过程中动态选择不同模型,多项企业测试显示其能显著降低成本与运行时间。英伟达还计划开放部分训练数据并推进更大规模的 Nemotron 4,借开源模型、数据、框架和算力构建完整的 AI 基础设施生态。
- 为复杂智能体采用“强模型规划、小模型执行”的分层架构提供参考,减少昂贵前沿模型的调用次数。
- 可利用动态模型路由,在准确率、延迟与成本之间进行任务级权衡,优化企业级智能体部署。
- 展示了针对垂直任务低成本微调执行模型和路由器的可行路径。
- 反映 AI 竞争正从单一模型能力转向多模型协同、开放生态与基础设施效率。
📝 原始笔记(逐字保留)
DeepSeek V4 Pro 正式版上线,主打 Agent 与 Coding
量子位报道称 DeepSeek-V4-Pro-0813 已在 API 平台上线,以低价调用和强化后的 Coding、Agent 能力为主要卖点,但官方博客及完整技术细节尚未公布。
人工智能辅助编程 工具调用 模型开发 智能体 系统优化 模型训练 后训练
- DeepSeek API 平台已更新至正式版模型
DeepSeek-V4-Pro-0813,但发布时官方博客和完整技术报告尚未公开。 - 报道称该模型在 HLE、Terminal Bench、Cybergym、DeepSWE 等基准上展现出较强的 Agent 与软件工程能力,部分成绩接近或超过文中所对标的闭源模型。
- API 定价为每百万 tokens 输入 3 元、缓存命中 0.025 元、输出 6 元,基本延续 Pro 预览版的低价策略。
- 网友实测认为其思维链表达被大幅压缩,可能有助于减少 token 消耗并优化推理效率,但自然语言写作质量或可读性可能受到影响。
- 目前性能信息主要来自媒体报道和榜单对比,仍需等待官方材料及独立评测验证。
- 跟踪 DeepSeek 新模型在 Coding、Agent 和软件工程任务上的能力演进。
- 评估低价高性能 API 对智能体应用部署成本及模型选型的影响。
- 研究后训练与思维链压缩在性能、token 成本和文本质量之间的权衡。
- 在正式采用前通过独立基准和真实业务任务复核报道中的性能结论。
📝 原始笔记(逐字保留)
MLS-Bench:140道真实任务检验AI方法创新能力
MLS-Bench以12个领域的140项可执行研究任务表明,前沿模型虽能调优和重组已有组件,却仍缺乏可靠发现新机器学习方法的能力。
MLS-Bench覆盖语言模型、视觉生成、强化学习、机器人、AI for Science等12个领域,共包含140个源自真实代码库的研究任务,并提供精简版MLS-Bench-Lite。每项任务在统一代码库和训练协议下设置至少三个人类强基线及三个迁移测试环境,同时冻结数据管线、评测器和容量等变量,以区分算法创新与工程取巧。实验发现,即使获得Human SOTA完整实现并可多轮运行实验,前沿模型整体仍无法超越人类方法,其改进主要来自调参、搜索和已有组件重组。增加测试时采样、网页搜索、理论材料或自由实验预算只能带来有限收益,暴露出模型在提出洞见假设、设计高信息量实验和判断研究路线方面的不足。
- 为自动科研与递归自我改进系统提供比代码榜更严格的方法创新评测。
- 评估模型成绩时,应控制模型规模、数据、训练预算和评测流程,避免把扩容或过拟合误判为算法进步。
- 自进化研究不能只扩大候选采样,还需增强假设生成、实验设计、证据判断和跨环境迁移能力。
- 可将MLS-Bench用于比较不同智能体脚手架、推理预算及知识检索方案对真实科学发现能力的影响。
📝 原始笔记(逐字保留)
综述:递归自我改进(RSI)的能力边界与关键瓶颈
一篇覆盖1250余项研究的综述指出,AI已具备有限自我改进能力,但可靠评估仍是迈向真正递归自我改进的核心瓶颈。
人工智能 自动化科学研究 自进化 模型评估 递归自我改进 闭环评估
该综述系统梳理了1250余篇与自我改进相关的研究,涵盖 Self-Refine、Self-Reward、AlphaEvolve、代码生成、实验设计和模型优化等方向。现有AI已经能够参与自身改进过程,但这种能力仍属于受限的自我改进,距离真正的 Recursive Self-Improvement(RSI)尚远。关键限制并非缺少候选方案的生成能力,而是系统难以可靠判断新方案是否确实优于旧方案。未来竞争焦点可能由单纯训练更大模型,转向构建具备生成、评估和持续迭代闭环的自进化系统。
- 用于快速建立RSI与AI自进化研究的整体脉络,定位主要方法和开放问题。
- 提示模型研发应将评估器、验证机制和改进闭环置于与生成能力同等重要的位置。
- 可作为自动科研、代码演化及模型优化系统设计与文献调研的入口。
- 启发研究者关注有限自我改进向持续递归改进扩展时的可靠性与安全治理问题。
📝 原始笔记(逐字保留)
阿里开源长程智能体框架 LongHorizon-Harness
阿里 DreamX Team 开源 LongHorizon-Harness,通过管理、执行、审计分离及持久化验证状态,显著提升现有智能体完成长程任务的可靠性。
上下文学习 人工智能可靠性 工具调用 智能体 人工智能框架 自我验证 长程任务
LongHorizon-Harness 是运行在 Claude Code、Codex CLI 等现有 Agent 外层的长程任务执行框架,无需重新训练模型。其核心 MEA 循环将 Manager、Executor 和 Auditor 分离:Manager 维护已验证状态,Executor 在全新上下文中执行子任务,Auditor 则只读检查真实环境后再写回结果。使用相同的 Qwen 3.7-Plus 与 Claude Code 后端时,WeaveBench PassRate 从 51.8% 提升至 80.7%,OSWorld 2.0 完整完成率从 2.8% 提升至 8.3%,Terminal-Bench 2.1 成功率从 69.7% 提升至 77.2%。该方法以额外执行和审计成本换取更低的错误累积、上下文退化及任务状态丢失风险,但不同基准上的 Token 开销差异明显。
- 为长程智能体提供可独立于基础模型部署的执行、状态管理与结果验证层。
- 通过新鲜上下文和持久化任务状态,缓解历史上下文膨胀及错误状态持续传播。
- 将执行者的自我判断改为基于环境证据的独立审计,提高最终交付物的可信度。
- 为长程任务 Harness 的模块化演化、异构模型分工及可靠性评测提供参考架构。
📝 原始笔记(逐字保留)
智能体系统协同演化:迈向超越人工设计的自主进化
该综述提出智能体协同演化的三阶段分类框架,系统梳理智能体、环境及演化机制相互施加适应压力并逐步摆脱人工约束的研究路径。
协同演化 多智能体系统 人工智能安全治理 开放式任务 智能体 自进化 模型评估 开放式演化
论文将协同演化定义为多智能体及其环境彼此施加动态适应压力的多组件自进化过程,以突破固定任务和反馈对单体自进化的限制。作者提出三个递进阶段:智能体—智能体协同演化、智能体—环境协同演化,以及让演化机制自身可演化的元协同演化。智能体间的演化涵盖对抗、协作和组织适应,环境演化则涉及任务、反馈及交互空间的动态变化。论文还总结了系统评估、多组件扩展,以及高自主性演化过程的安全性与可控性等开放挑战。
- 为多智能体协同演化研究提供统一的概念体系和文献分类框架。
- 启发从固定任务与静态反馈转向智能体、任务、环境和反馈共同变化的开放式训练系统。
- 将演化机制本身纳入优化对象,为元层面的自主改进和递归演化提供研究方向。
- 提醒研究者同步建设可扩展评测、安全约束与人工可控机制,避免自主演化失控。
📝 原始笔记(逐字保留)
Mendel Gödel Machine:比较进化驱动的编程智能体递归自改进
MGM 利用跨任务轨迹比较与跨谱系经验杂交改写编程智能体,在 SWE-bench 和 Polyglot 上提升了自进化的性能、效率与泛化能力。
人工智能辅助编程 协同演化 智能体 自进化 SWE 软件工程 递归自我改进 比较进化
Mendel Gödel Machine(MGM)针对现有自改进编程智能体通常只依据单条失败轨迹修改自身的局限,引入基于历史尝试档案的比较进化机制。除单轨迹克隆突变外,它提出“反应规范突变”,依据智能体在多个任务上的轨迹同时进行修改;还提出“跨谱系杂交”,借助另一谱系智能体在相同任务上的轨迹完成改写。理论分析与受控代理模拟表明,在加性适应度景观下,这两种策略比单轨迹基线收敛更快、效果更好。SWE-bench 与 Polyglot 实验进一步验证了 MGM 在性能、效率和泛化能力上的稳定改进。
- 为递归自改进智能体提供一种充分利用历史轨迹档案的比较式演化框架。
- 启示智能体优化不应局限于单次失败复盘,而应联合分析跨任务表现和其他谱系的成功经验。
- 可用于改进软件工程智能体的脚手架搜索、自我修改效率及跨任务泛化能力。
- 为多谱系智能体并行探索、经验交换和受控“杂交”提供理论与实验依据。
📝 原始笔记(逐字保留)
VibeLifeBench:评测生活智能体的主动性与持久性
VibeLifeBench 通过持续数周、环境自主变化的模拟生活任务,评估智能体能否主动发现变化、及时行动并长期遵守隐含约束。
人工智能可靠性 场景建模 智能体 模型评估 长程任务 主动智能
VibeLifeBench 包含覆盖十个日常生活领域的 200 个长程任务,每项任务均以持续数周的脚本化时间线展开。基准构建了由 22 个模拟服务组成的生活环境,环境会按自身时钟演化,部分变化不会主动通知智能体,需要其重新检查才能发现。评测采用细粒度加权检查,同时衡量最终状态、行动及时性以及对隐含约束的遵守情况。七个前沿模型在该基准上均得分较低,表明当前智能体距离可靠的现实生活辅助仍有明显差距。
- 为长期运行的个人助理和生活智能体提供更贴近现实的评测基准。
- 推动智能体从被动响应转向主动观察,并自主判断何时行动、询问或保持沉默。
- 检验智能体在动态环境中的持续规划、及时执行和隐含约束保持能力。
- 可用于定位模型在长程一致性、环境重检和现实任务可靠性方面的不足。
📝 原始笔记(逐字保留)
SkillZip:无需评估的自进化智能体技能压缩
SkillZip 通过带类型的最小描述长度目标发现技能中的可复用结构,在无需任务回放或评估集的情况下压缩自进化智能体积累的技能。
智能体技能库 持续学习 智能体 系统优化 自进化 记忆蒸馏 技能压缩
SkillZip 面向自进化智能体技能库不断膨胀的问题,将重复规则提升到共同作用域,并把重复动作序列提取为共享过程,仅显式保留差异与例外。方法将技能表示为契约与残差,采用带类型的最小描述长度目标,同时对触发条件、工作流边、工具要求、义务和输出字段施加硬覆盖约束。该设计无需压缩时评估或任务 rollout,且能按构造保留未被采样任务触发的罕见规则。系统提供一次性压缩模式,以及无需重放任务或重新解析全部历史的持续 Zip-on-Write 更新模式。实验显示其在压缩效果、泛化能力和成本开销方面具有优势。
- 降低不断增长的智能体技能在上下文注入时的 token 与推理成本。
- 为技能库和经验记忆提供结构感知的去重、抽象与模块化维护方法。
- 避免依赖压缩期评估集,减少 rollout 成本及由测试任务覆盖不足导致的偏差。
- Zip-on-Write 模式可用于持续学习系统,在写入新经验时增量维护紧凑技能库。
- 硬覆盖约束为工具契约、输出格式及罕见例外的可靠保留提供了思路。