2026-08-22 科研追新
当日精选(由提交工具自动创建)。
MemoraX以可学习记忆推动AI进入经验时代
天津大学教授郝建业创办MemoraX AI,尝试将智能体记忆的写入、更新、遗忘与召回转化为可训练的学习问题,使Agent能从长期交互经验中持续进化。
智能体记忆 智能体 经验学习 持续学习 人工智能辅助编程 自进化 内生记忆 记忆模型 经验时代
MemoraX认为,聊天记录、长上下文和RAG主要解决信息承载或相似性召回,而真正的Memory还需具备主动筛选、动态更新和智能调用能力。团队通过人工体验反馈以及代码正确性、执行成功率和效率等端到端任务信号,训练记忆模型管理信息的完整生命周期。其“内生型”路线以数据驱动模型自主完成记忆写入、更新与召回,并利用用户交互数据形成持续训练和自我进化的飞轮。面向Coding Agent,系统分别管理代码仓静态状态、长期项目经验、开发者偏好及从历史轨迹提炼出的可复用程序性技能,同时强调跨平台、跨模型的中立记忆基础设施定位。
- 为长程智能体提供超越长上下文与传统RAG的经验沉淀机制。
- 将记忆选择、遗忘、更新和召回建模为可通过任务反馈持续优化的学习问题。
- 支持Coding Agent跨会话、跨设备和跨工具复用项目经验与用户偏好。
- 启示智能体基础设施可从“存储历史”进一步演进为“学习和调度经验”,形成使用数据驱动的能力增长闭环。
📝 原始笔记(逐字保留)
Jeff Dean谈递归自我改进与Discovery Loop科研自动化
Jeff Dean离开谷歌后的首次公开访谈聚焦递归自我改进,提出将数据、评测、架构和科学实验整合为可持续优化的自动化闭环。
自我改进 闭环科学研究 自动化科学研究 科学发现 多智能体系统 人工智能辅助编程 网络安全 实验加速
- Jeff Dean回顾Gemini研发,认为原生多模态路线是正确选择,但团队早期对Coding能力重视不足,而代码能力的提升通常也会迁移至通用推理。
- 他承认TensorFlow缺少早期Eager Execution支持、contrib生态过于混乱两项设计失误,并主张核心框架应保持简洁。
- 新公司Discovery Loop将自动化科学与工程实验闭环,让模型分解问题、调度Agent、执行和评估实验,再依据反馈选择下一轮实验。
- 其递归自我改进愿景覆盖训练数据、Eval、模型参数乃至架构,并希望把单轮实验从数天压缩到分钟或小时级,同时并行运行大量实验。
- 他还指出AI网络攻防能力已接近甚至超过顶尖人类,并建议研究者通过广泛浏览论文、数量级估算和高风险试验来发现值得长期投入的方向。
- 为递归自我改进系统提供完整边界:不仅优化模型参数,还要联合演化数据、评测、架构与实验调度机制。
- 启发自主科研平台围绕“问题分解—实验生成—执行—评价—反馈”建设端到端闭环,并利用多智能体扩大实验并行度。
- 表明Coding训练可作为增强通用分解与推理能力的重要抓手。
- 提醒自动化能力提升必须同步建设网络安全、权限控制、审计与监管机制。
- 研究选题可采用广泛扫描、跨领域连接与数量级估算,优先寻找已初现可行性但仍需方法突破的问题。
📝 原始笔记(逐字保留)
Agent 时代仍实用的 12 个常用 Prompt
文章整理了覆盖问题澄清、学习研究、问题解决、决策与自我认知五类场景的 12 个可直接复用 Prompt 模板。
工具调用 事实核查 深度研究 人机协同决策 反事实实验 自我反思 提示工程 问题澄清 决策支持
文章将作者长期使用的 12 个 Prompt 重新整理为五类场景,并强调模板无需额外安装 Skill,可适配主流 AI 产品。问题澄清与学习部分包括苏格拉底式提问、双层解释、反向拆解、横纵分析和事实核查,重点是补足上下文、区分事实与判断并建立可追溯认知。解决问题部分利用专家会诊、第一性原理和跨领域借解,从多专业分歧、基本事实及相似问题结构中推导方案。决策部分通过双向钢人论证和最小可逆实验识别关键变量,以现实反馈替代持续空想;自我认知部分则通过连续追问梳理个人经历与潜在天赋。
- 可作为研发、产品分析和 Vibe Coding 中的问题澄清与复杂故障诊断模板。
- 将事实、推断、价值判断和隐含假设拆开,有助于减少模型幻觉及未经验证的结论。
- 通过专家视角互相质疑、第一性原理重构和跨领域类比,扩展复杂问题的候选解法。
- 面对难以取舍的方案时,可先做双向钢人论证,再设计低成本、可逆的最小实验获取证据。
- 模板化输出便于沉淀为团队 Prompt 库,并按具体任务补充文档、约束和验收指标。
📝 原始笔记(逐字保留)
长程智能体综述:Harness 与模型协同优化
149页综述系统提出长程智能体的核心并非运行时间或上下文长度,而是外部 Harness 与内部模型优化共同支撑长依赖决策、状态管理、反馈利用和风险控制。 [合并自 2026-08-25 harness] 149页综述提出以任务决策依赖而非运行时长定义长程智能体,并将外部 Harness 与内部模型优化的协同演进视为提升长期执行可靠性的核心路径。
智能体 长程任务 智能体脚手架 智能体运行时 智能体记忆 自进化 强化学习 多智能体系统 长程智能体 框架与模型协同 智能体执行框架 状态持久化 长上下文
- 综述以决策链条的逻辑耦合度界定长程任务,并将其分为单上下文 H1、跨上下文 H2 和跨任务持续演化 H3 三个层级,强调长程能力与运行时长、自主性及自进化并不等价。
- 长程执行的主要瓶颈包括目标漂移与误差累积、上下文腐化,以及稀疏延迟奖励和不可逆操作,单纯扩大上下文窗口或模型规模无法根治。
- 外部 Harness 通过循环与工作流、上下文和记忆、工具与技能、智能体编排、Hooks 中间件及过程验证,提供可控、可恢复、可审计的执行闭环。
- 内部模型优化则覆盖长轨迹架构、数据与环境合成、中期训练、微调、智能体强化学习、同策略蒸馏和自进化,将经过验证的外部脚手架能力逐步内化。
- 软件工程、深度检索、GUI 操作、多模态任务和通用数字助手是主要应用方向,未来需重点解决跨框架迁移、真实环境交互、动态成本分配及长周期安全问题。
[合并自 2026-08-25 harness] 综述将长程任务按能力递进划分为 H1 单上下文、H2 跨上下文和 H3 跨任务开放式任务流,强调长程能力与运行时长、自主性及自进化并不等价。长链执行的主要瓶颈包括目标漂移与误差累积、上下文腐化,以及稀疏延迟奖励和不可逆操作带来的信用分配风险。外部 Harness 通过循环与工作流、上下文和记忆、工具与技能、智能体编排、Hooks 及验证机制,提供可控、可恢复和可审计的运行环境。内部模型则借助长轨迹架构、环境与数据合成、中期训练、微调、智能体强化学习、同策略蒸馏和自进化,将成熟的外部调度能力逐步内化。
- 为长程智能体建立统一分级标准,避免将长时间运行、大上下文、自主执行和自进化混为一谈。
- 指导系统采用“模型能力 + Runtime Harness”的联合设计,而非只依赖扩大参数量或上下文窗口。
- 可据六类 Harness 组件检查工作流是否具备记忆、恢复、验证、权限拦截和预算停止机制。
- 为训练路线提供参考:先由外部脚手架稳定长流程,再通过微调、强化学习和蒸馏将有效策略内化。
- 提醒真实部署重点监控目标漂移、上下文污染、不可逆副作用、奖励投机及技能库安全。
[合并自 2026-08-25 harness]
- 为长程智能体建立统一分级标准,避免将长时间运行、自主执行和自进化混为一谈。
- 指导系统同时优化模型能力与运行时 Harness,而不是单纯扩大参数量或上下文窗口。
- 为软件工程、深度检索、GUI 操作和多模态任务设计持久记忆、断点恢复、中间验证及风险拦截机制。
- 提示研发团队重点评估长期执行中的目标漂移、成本失控、记忆污染、奖励投机和不可逆副作用。
📝 原始笔记(逐字保留)
DeepSeek、Llama、GLM、Qwen 底层架构演进详解
文章以 Llama 为基线,系统梳理 DeepSeek、GLM、Qwen 等主流大模型通过 MLA、稀疏注意力与 MoE 实现降本增效的架构演进。 [合并自 2026-08-25 deepseek-llama-glm-qwen] 文章以 Llama 为基线,系统梳理 DeepSeek、GLM、Qwen 等主流大模型在 MLA、稀疏注意力与 MoE 等方向上的架构效率革命。
模型开发 混合专家模型 长上下文 推理加速 参数高效微调 架构综述 缓存压缩 稀疏注意力 缓存优化
文章沿着一个 token 从分词、Embedding、归一化、残差连接到注意力与 FFN 的完整计算路径,解释现代 LLM 的基础结构。它对比了 LayerNorm 与 RMSNorm、Post-Norm 与 Pre-Norm,并说明主流模型为何更偏好训练稳定且计算更简洁的配置。注意力部分重点分析 MHA、MQA、GQA 与 MLA 如何逐步压缩 KV Cache,以及稀疏注意力如何降低长序列计算和显存带宽压力。文章还将 MoE 视为扩展模型容量的关键手段,通过稀疏激活实现总参数规模与单次计算成本的解耦。整体观点是,近年大模型并未彻底抛弃 Transformer,而是围绕训练、推理和长上下文成本持续进行架构优化。
[合并自 2026-08-25 deepseek-llama-glm-qwen] 文章沿着 Token 从分词、Embedding、归一化、残差连接到注意力与 FFN 的计算路径,解释主流大模型的底层结构。现代模型整体仍延续 Llama 式 Transformer 框架,主要变化集中在 RMSNorm、Pre-Norm、注意力机制和 MoE 等组件。MHA、MQA、GQA 到 MLA 的演进旨在压缩 KV Cache,缓解长上下文解码时的显存占用与带宽压力。DSA 等稀疏注意力降低长序列计算成本,MoE 则以稀疏激活分离模型容量与单次计算量,共同构成近年来大模型的效率革命。
- 可作为理解 Llama、DeepSeek、GLM、Qwen 架构差异的入门与复习材料。
- 为长上下文推理优化提供技术选型参考,可重点权衡 GQA、MLA 与稀疏注意力的质量、显存和吞吐表现。
- 启示模型架构实验应以单位训练时间内的收敛效果衡量价值,而不应只比较训练 Token 数。
- 有助于分析 MoE 如何在控制计算成本的同时扩大参数容量,以及专家负载均衡带来的工程挑战。
[合并自 2026-08-25 deepseek-llama-glm-qwen]
- 用作理解 Llama、DeepSeek、GLM、Qwen 架构差异的系统入门材料。
- 帮助分析 MLA、GQA、稀疏注意力和 MoE 对显存占用、吞吐量及模型容量的影响。
- 为长上下文推理部署、KV Cache 优化和模型架构选型提供技术参考。
- 提示架构实验应更多关注单位时间内的损失收敛与实际训推成本,而不只比较参数量或训练 token 数。
📝 原始笔记(逐字保留)
MemTrapBench:评测 LLM 记忆使用中的认知陷阱
MemTrapBench 揭示忠实且语义相关的记忆仍可能通过推理固着和信念扭曲损害当前任务表现,并提出推理时方法 AdaptiveMem 缓解该问题。
智能体记忆 记忆仲裁 失效模式分析 推理 认知陷阱 推理固着 信念扭曲
MemTrapBench 不再只考察记忆能否被正确提取、存储和检索,而是评估检索出的记忆如何重塑模型推理并影响当前任务。基准覆盖两类记忆诱发的认知陷阱:推理固着(Reasoning Fixation)与信念扭曲(Belief Distortion)。在两个模型家族和五种代表性记忆框架上,所有记忆策略均弱于无记忆设置,即使最强方法的性能也下降超过 10%。作者进一步提出推理时方法 AdaptiveMem,通过指示模型规避记忆陷阱,在缓解认知偏差的同时维持或提升标准记忆基准表现。
- 将记忆系统评测从“是否记住”扩展到“记忆是否干扰当前推理”,补足现有基准的关键盲区。
- 可用于测试长期记忆代理在历史经验与当前证据冲突时的稳健性和记忆仲裁能力。
- AdaptiveMem 表明无需重新训练,也可通过推理时干预降低有害记忆对模型判断的影响。
- 提醒记忆框架设计者:相关且准确的记忆并不必然有益,应加入动态抑制、冲突检测和按需调用机制。
📝 原始笔记(逐字保留)
SpaCellAgent:自进化多智能体自动完成单细胞轨迹推断
六校团队提出 SpaCellAgent,通过规划、执行、评估与报告智能体及双层记忆机制,自动选择和编排工具完成可验证、可复用的单细胞轨迹推断。 [合并自 2026-08-25 spacellagent] SpaCellAgent 通过规划、执行、评估与报告智能体组成闭环,并借助跨任务记忆和工具扩展机制,自动完成单细胞及空间组学的轨迹推断工作流。
多智能体系统 自进化 生物信息学 科学智能 工具调用 闭环科学研究 经验复用 单细胞分析 拟时序分析 工具路由 生物验证 科研工作流 轨迹推断 过程验证
SpaCellAgent 将单细胞轨迹分析拆分给 Planner、Executor、Evaluator 和 Reporter 四类 LLM 智能体,形成从自然语言需求到分析报告的闭环。Executor 可在 Python 与 R 生态间动态选择 PAGA、Monocle、Slingshot、DPT 等工具,并处理 AnnData、拟时序坐标及中间对象的跨生态流转。Evaluator 同时检查代码执行结果与生物学合理性,必要时检索 PubMed,并把错误上下文反馈给执行器进行自主修复。框架通过 Local Memory 保存任务内轨迹,通过 Global Memory沉淀已验证模板和“错误—修复”经验,还能验证并注册新工具;在六个异构数据集上多数指标领先,并将专家平均分析时间从 64.6 分钟缩短至 38.0 分钟。
[合并自 2026-08-25 spacellagent] SpaCellAgent 将单细胞轨迹分析拆分给 Planner、Executor、Evaluator 和 Reporter 四类 LLM 智能体,覆盖计划生成、工具选择、跨 Python/R 执行、结果验证及报告撰写。Evaluator 同时检查代码产物与生物学合理性,并可检索 PubMed 补充组织标志基因和相关先验,再将诊断反馈给 Executor 自动修复。框架通过 Local Memory 保存任务内轨迹,通过 Global Memory积累已验证代码模板和“错误—修复”经验,还能引入并注册新的分析工具。在六个异构数据集上,该框架多数指标排名第一,将专家平均分析时间从 64.6 分钟降至 38.0 分钟,并在多种底层大模型上保持稳定表现。
- 为单细胞与空间组学研究提供从自然语言需求到轨迹分析报告的自动化入口,降低算法选择和异构工具编排门槛。
- 展示“执行验证—错误修复—经验沉淀—跨任务复用”的 Harness 自进化路径,可迁移至其他科学计算工作流。
- 双层评估说明科研智能体不能只检查代码是否运行,还需结合领域先验验证结果的科学合理性。
- 动态注册新工具的机制可用于建设持续扩展的科研工具库,但仍需关注文献检索质量、生物先验偏差与复杂样本上的人工复核。
[合并自 2026-08-25 spacellagent]
- 为单细胞与空间组学研究提供从数据、自然语言问题到轨迹分析报告的一站式自动化方案。
- 展示了“执行验证+领域验证”双层评估对科学智能体可靠性的价值,避免仅以代码跑通作为成功标准。
- 双层记忆和动态工具注册机制可迁移到其他科研工作流,使系统持续积累可复用模板并扩展能力。
- 跨 Python/R 的多语言执行设计为异构科研软件生态中的智能体编排提供了参考。
📝 原始笔记(逐字保留)
FlowEvo:工作流与可执行技能协同进化的智能体
FlowEvo 在推理阶段将成功工作流编译为持久化技能,并依据下游效用持续筛选和复用,实现无需训练的工作流—技能协同进化。
智能体 技能演化 智能体技能库 经验复用 状态持久化 训练-推理对齐 流程协同演化
FlowEvo 是一个无需训练的智能体框架,让工作流与可执行技能在推理过程中协同进化。系统会把成功工作流编译为可调用技能并存入持久技能库,后续既可直接执行,也可作为构建新工作流的上下文。框架持续跟踪技能的下游效用,并抑制可能引发负迁移的技能。在统一使用 GPT-4o-mini 时,FlowEvo 在 ALFWorld、HumanEval、MBPP、GSM8K 和 MATH-500 上领先 8 个基线,其中 ALFWorld 达到 85.6%,且令牌开销约为最强基线的三分之一。
- 将一次性成功轨迹自动沉淀为可执行技能,避免智能体跨任务重复探索。
- 通过技能效用跟踪与负迁移抑制,为长期技能库的质量治理提供可操作机制。
- 展示训练外、推理时自进化路线,可用于降低智能体适配新任务的训练成本与令牌消耗。
- 为智能体脚手架演化提供工作流生成、技能编译、检索复用和效果反馈相结合的闭环范式。
📝 原始笔记(逐字保留)
JitRL:免梯度实现 LLM Agent 测试时持续学习
新加坡国立大学提出 JitRL,通过动态记忆检索与 logits 调整,让权重固定的 LLM Agent 在测试时持续优化策略,成本约为传统强化学习的三十分之一。 [合并自 2026-08-25 jitrl] 新加坡国立大学提出 JitRL,通过动态记忆检索与 logits 调整,使权重固定的 LLM 智能体无需梯度更新即可在测试时持续优化策略。
强化学习 持续学习 智能体 测试时计算 策略优化 智能体记忆 无梯度优化 成本优化 模型遗忘 即时强化
JitRL 面向部署后权重固定的 LLM 智能体,使其能够在动态环境中持续积累经验并减少重复错误。框架不执行反向传播或参数微调,而是维护动态记忆库,并结合经验检索对模型输出 logits 进行实时调整。该方法可实现接近传统强化学习的策略优化效果,同时避免高昂训练开销与灾难性遗忘。文中称其成本约为传统强化学习方法的三十分之一,适合资源受限的持续学习场景。
[合并自 2026-08-25 jitrl] JitRL 面向部署后权重固定、难以从交互经验中持续学习的 LLM Agent。该框架不执行梯度更新,而是维护动态记忆库,并结合经验检索与 logits 调整实时优化输出策略。其策略改进效果可媲美传统强化学习,同时将计算成本降至约三十分之一。由于不修改模型参数,JitRL 还能降低灾难性遗忘风险,适合动态环境和低资源部署场景。
- 为无法频繁微调权重的在线智能体提供轻量持续学习方案。
- 可将动态记忆与解码阶段策略调整结合,降低强化学习式优化的算力门槛。
- 为低资源 Agent 部署、长期运行系统和动态环境适应提供参考。
- 通过保持基础模型参数不变,降低持续更新导致灾难性遗忘的风险。
[合并自 2026-08-25 jitrl]
- 为无需微调的 Agent 在线适应提供轻量化实现路径。
- 可用于构建边运行、边积累经验、边修正策略的持续学习系统。
- 适合算力受限或不允许修改基础模型权重的部署环境。
- 表明外部记忆与解码阶段干预可以替代部分参数级强化学习。
📝 原始笔记(逐字保留)
PolicyGuide:面向全工作流的智能体策略合规引导
PolicyGuide 将组织策略编译为工作流图,并通过基于持久状态的主动验证器,在多步骤任务中持续引导 LLM 智能体满足动作限制与程序要求。
PolicyGuide 针对客服智能体仅检查单次动作、难以保障完整流程合规的问题,将领域策略编译成可执行的工作流图。系统在每个用户轮次边界调用主动验证器,依据持久化图状态核对未完成请求,并给出沿合规路径推进的步骤级修复建议。在 τ²-bench 的航空、零售和电信领域中,搭配 GPT-5.4 后平均 Pass⁴ 从 0.42 提升至 0.62,其中流程结构最强的电信领域由 0.19 提升至 0.61。同一套工作流还可迁移至 Claude Sonnet 4.6 和 Gemini 2.5 Pro,并在对抗攻击与程序合规评测中取得更优表现。
- 将安全防护从局部动作拦截扩展到端到端流程引导,适合客服、审批和交易等强策略约束场景。
- 利用持久化工作流状态识别身份验证、用户确认等被遗漏的程序步骤,降低“动作合法但流程违规”的风险。
- 策略图可跨不同基础模型复用,为模型无关的智能体合规中间层提供设计思路。
- 工作流级验证可作为运行时治理、红队测试和合规验收的新评测维度。
📝 原始笔记(逐字保留)
IAR:面向无检索文档知识内化的三阶段后训练
IAR通过知识注入、问答对齐和能力恢复三阶段后训练,将固定文档语料转化为模型参数知识,在提升无检索领域问答准确率的同时保持通用能力。
IAR将无检索文档问答定义为“文档知识内化”,目标是把固定语料库转换为语言模型可直接调用的参数知识。Inject阶段把源文档构造成续写、改写和指令条件重建任务,Align阶段利用仅答案式问答监督对齐模型行为,Recover阶段则与基础指令模型合并以恢复通用能力。实验覆盖Common Corpus、CCI以及Llama、Phi、Qwen和SmolLM等模型家族。与Vanilla SFT相比,IAR在8组数据集—模型设置中的7组全面改善四项指标,领域问答准确率平均提升3.6个百分点,IFEval、MMLU和MSBench通用性能均值平均提升12.1个百分点。
- 为无法在推理时接入检索系统的私有文档问答、端侧部署和离线应用提供参数化知识注入方案。
- 将知识学习、任务行为对齐和通用能力恢复解耦,有助于缓解领域后训练导致的灾难性遗忘。
- 续写、改写与指令条件重建可作为比传统持续预训练更具结构性的文档学习目标。
- 模型合并式Recover阶段为领域准确率与通用能力之间的权衡提供了低成本实现路径。
📝 原始笔记(逐字保留)
HSI:面向任务专属可进化智能体脚手架的层级自我改进
HSI 通过任务脚手架、进化器和元进化器三级自修改机制,在冻结大模型的前提下持续优化任务执行系统,并揭示其效果受反馈质量与底座能力共同限制。
HSI 为每类任务维护可热切换、可持续重写的专属执行脚手架,并通过固定的任务注入接口利用环境反馈推进演化。框架包含执行任务的脚手架、重写脚手架的进化器,以及改写进化策略代码的元进化器,三层均由同一个冻结 LLM 驱动。实验通过执行阶段关闭思考、自修改阶段开启思考,隔离并验证脚手架演化本身的贡献。在 BALROG 中,HSI 显著提升 BabyAI、Crafter、TextWorld 和 MiniHack 等中等难度任务,并在 BabaIsAI 未见划分上表现出较强泛化,但在超出底座能力的 NLE 上未取得改进。
- 为冻结模型提供一条无需更新权重、依靠执行脚手架持续演化的智能体改进路径。
- 可将任务级脚手架、进化策略和元策略分层管理,避免所有任务共享同一套固定工作流。
- 设计自进化系统时应优先保证奖励与环境反馈的真实性和信息量,否则选择过程难以产生有效改进。
- 脚手架优化不能突破底座模型的能力上限,因此部署前需区分可由系统设计弥补的问题与模型本身无法完成的问题。
📝 原始笔记(逐字保留)
GEN-1.5让机器人看数秒演示学会新动作
Generalist AI发布机器人基础模型GEN-1.5,可将3至12秒动作演示作为上下文,在无需微调或梯度更新的情况下执行新任务。
具身智能 上下文学习 小样本学习 仿真到现实迁移 组合泛化 模型开发 物理信息提示 模仿学习 零样本适应
- GEN-1.5经过大规模连续物理交互数据预训练,可把人类刚刚完成的动作视作“Physical Prompt”,并据此快速执行未训练的新任务。
- 模型支持组合多段演示,自主补全重新定位、抓法调整、姿势切换和失败恢复等未展示的衔接动作。
- 它还可读取模拟器脚本、强化学习智能体或遥操作产生的演示,并将所学行为直接迁移到真实机器人。
- 在10种任务上,仅提供一次演示且不更新梯度时平均成功率为59%;增加每项任务5分钟数据和10步梯度更新后,成功率提升至83%。
- 展示上下文学习从语言任务扩展至物理控制的可能路径,动作演示可成为机器人时代的提示词。
- 为低成本机器人技能部署提供思路:无需为每项新任务重新收集大量数据和完整微调。
- 连续物理轨迹中的重复操作、任务延续与失败恢复,可能是涌现单示例适应能力的重要数据结构。
- 当前能力主要覆盖短程、原子化操作,实际应用仍需提升稳定性、长程规划能力和安全保障。
📝 原始笔记(逐字保留)
深势科技发布玻尔·科学空间,AI接管科研全流程
深势科技发布玻尔·科学空间公开测试版,以多学科AI智能体贯通调研、假设、实验执行、结果分析、论文写作与审查等科研环节。
科学智能 智能体 科研工作流 闭环科学研究 桌面智能体 实验执行 多模态 长程任务 工具调用 自进化 湿实验
玻尔·科学空间是面向科研人员与AI科学家协作的桌面端环境,可将文献调研、假设生成、实验设计、计算验证、成果写作和审查组织为连续工作流。平台内置SciMaster、BioMaster、PharmMaster和MatMaster等学科智能体,覆盖生物医学、药物研发和材料科学,并可自动调用数据、模型、软件、算力及实验资源。其底层由多模态解析与知识组织、SciX智能体编排、隔离且可恢复的Sandbox,以及连接文献、计算工具和实验仪器的基础设施共同支撑。平台还通过EvoMaster积累科学家的修正、实验结果和失败经验,将验证过的方法沉淀为可复用、可追溯并能持续进化的科研能力。
- 将科研人员从跨库检索、环境配置、参数调试和结果整理等重复劳动中释放出来,使其聚焦问题提出与科学判断。
- 为自主科研智能体提供了“知识理解—任务规划—工具执行—结果校验—成果输出”的端到端产品范式。
- 通过隔离运行、故障恢复、证据溯源和关键节点校验,提高长程科研任务的可靠性与可复现性。
- 可帮助课题组和研发机构沉淀方法、参数、过程及失败经验,形成能够复用和迭代的组织级科研工作流。
- 湿实验仪器接入与持续反馈机制展示了从计算科研走向真实实验闭环和智能体自进化的路径。
📝 原始笔记(逐字保留)
玻尔·科学空间发布:桌面端 AI 接管科研全流程“体力活”
深势科技发布玻尔·科学空间公开测试版,以桌面端 AI 科学家连接文献、数据、软件、算力和实验资源,贯通科研调研、执行、验证与成果输出流程。
科学智能 自动化科学研究 科研工作流 闭环科学研究 桌面智能体 智能体 工具调用 人机协同决策 科研工作台 湿实验
玻尔·科学空间面向科研人员提供统一桌面环境,可由 SciMaster 检索文献与专利、解析多模态科学内容,并梳理研究共识、争议、空白和可检验假设。BioMaster、PharmMaster、MatMaster 等学科智能体分别支持生物医学分析复现、药物研发和材料设计模拟,将数据获取、环境配置、工具调用、故障处理及结果核验组织为可追溯工作流。平台通过 Science Navigator、DeployMaster、Uni-Parser、LKM 和 SciX 框架连接知识、模型、软件、异构算力及实验仪器,并利用沙箱实现隔离、恢复和任务调度。系统还提供论文写作与审查能力,并借助 EvoMaster 从科学家的修正、实验结果和失败经验中沉淀可复用流程,推动工具、智能体与人类协同进化。
- 为科研团队建设统一的 AI 工作台提供参考,减少跨数据库、代码仓库、计算环境和分析工具之间的切换成本。
- 展示科研智能体从“回答问题”转向长程执行的产品路径:任务拆解、资源调用、过程校验、故障恢复和成果交付。
- 可用于生物医药、材料等计算密集型领域的论文复现、实验设计、候选筛选和证据核验。
- 启示科研机构将方法、参数、过程、结果与失败经验沉淀为可追溯、可复用和可持续进化的组织资产。
📝 原始笔记(逐字保留)
流偏好优化中的流形漂移与奖励作弊
论文揭示流匹配模型的偏好更新会因终端位移包含流形法向分量而偏离预训练数据流形,并提出温度控制的 ThermoDPO 以缓解奖励作弊。
奖励作弊 价值对齐 后训练 流形几何 偏好优化 流匹配 流形漂移
论文将流匹配偏好优化中样本脱离预训练数据支持集的现象形式化为“流形漂移”,并指出这是奖励作弊的根源之一。理论分析表明,最优流匹配能够恢复终端数据分布,但当偏好更新诱导的终端位移具有非零法向分量时,生成结果就会离开预训练流形。作者提出 ThermoDPO,通过温度控制并锚定偏好样本,在不同温度下连接拒绝采样微调与 FlowDPO,同时约束基于逐点重建的流形距离代理。其加权版本 ThermoDPO-weighted 在玩具基准上取得 0.899 StrictScore,并在 SD3.5-M、CFG=4.5 设置下将 OCR 指标提升 47.5%、四项指标均值提升 16.0%。
- 为连续时间生成模型中的奖励作弊提供几何解释,可通过监测更新位移的流形法向分量诊断对齐失效。
- 表明偏好优化不能只追求奖励提升,还应显式约束样本对预训练数据流形的偏离。
- ThermoDPO 的温度参数可用于调节拒绝采样式微调与 FlowDPO 之间的权衡,加权版本则有助于恢复低温下减弱的训练信号。
- 可将重建误差等流形距离代理纳入生成模型后训练的安全评测与正则化设计。
📝 原始笔记(逐字保留)
Loreley:以质量多样性搜索实现仓库级程序演化
Loreley 将完整代码仓库状态保存在质量多样性档案中以复用非主线分支,虽验证了踏脚石式程序演化机制,但在固定 48 个任务预算下未显著优于顺序冠军编辑。
代码演化 SWE 软件工程 进化策略 并行搜索 人工智能辅助编程 多样性搜索 分支存档 进化搜索 仓库级代码生成
Loreley 使用质量多样性(QD)档案保留完整仓库状态,并将历史分支采样为后续编辑的父状态或作为代理上下文,避免顺序搜索过早丢弃备选分支。候选方案以隔离 Git worktree 中的提交表示,并由项目提供的评估器评分。研究在 Zstandard 上以 1,008 个候选任务比较 QD、顺序冠军编辑和独立根节点提案;每组 48 个任务时,QD 比顺序策略低 0.135%,比独立提案高 0.320%,两项差异均不足以证明显著优势,且顺序策略的均值与中位数最高。最终七个 QD 优胜方案中有四个继承了非当前冠军状态,计入灵感上下文后增至六个,说明档案确实支持了踏脚石复用,但尚未转化为固定预算下的终点收益。此前的能力实验还在两个 Python 库和一个 Zstandard 修订中产生了第四代、多文件改进。
- 为仓库级代码智能体提供一种保留完整候选分支、避免只围绕当前最优解局部搜索的演化框架。
- 提示质量多样性档案能够促进分支复用与谱系多样性,但搜索机制实际生效并不等同于有限预算下获得显著终点收益。
- Git 提交、隔离 worktree 与项目自定义评估器可作为并发代码演化实验的可复现执行底座。
- 评估此类系统时应同时报告终点性能、置信区间、分支谱系与上下文影响,并在更大预算、更长代际或更复杂仓库上验证长期价值。
📝 原始笔记(逐字保留)
StateMemBench:智能体记忆能否追踪演化状态?
StateMemBench 评测智能体记忆对多轮会话中事实、约束和决策变更的追踪能力,StateMem 通过显式建模信息替代关系与依赖关系显著提升当前状态准确率。
智能体记忆 版本状态管理 长上下文 依赖传播 模型评估 状态追踪 信息覆写 状态覆写
论文提出“状态追踪”能力,要求智能体在长期交互中区分当前有效信息与已被取代的旧信息,而非仅完成记忆召回。StateMemBench 包含 234 个跨多会话场景和两种对话长度设置,并采用封闭候选池评分,将当前状态、过期状态及其他错误明确分开;实验显示,现有记忆系统、检索增强方法和长上下文基线均难以可靠处理状态演化。作者提出 StateMem,通过显式记录状态替代关系和关系依赖,在 DeepSeek-V4-Flash 与 Qwen-3.5-9B 上分别达到最强同骨干基线的 1.8 倍和最强记忆系统的 1.6 倍当前状态准确率。作为单次调用的轻量封装器,该方法还可使六种记忆或检索后端的准确率提高 32~67 个百分点;成本匹配实验表明,其中 15~32 个百分点的增益来自状态结构本身。
- 为长期运行及高风险智能体提供区别于静态事实召回、更贴近真实需求的状态演化评测维度。
- 设计记忆系统时可显式维护事实版本、替代关系和依赖传播,降低智能体依据过期信息决策的风险。
- StateMem 可作为现有 RAG 或记忆后端的轻量封装层,以较低改造成本增强状态追踪能力。
- 封闭候选池评分有助于区分过期状态引用与一般问答错误,便于定位和修复记忆缺陷。
📝 原始笔记(逐字保留)
LifeMem:用纵向生命轨迹缓解 LLM 智能体身份本质主义
LifeMem 结合结构化生命事件检索与智能体专属参数记忆,持续整合纵向人生经历,减少静态人口标签引发的身份本质主义与群体内同质化,使社会模拟智能体更贴近真实人类的多样性和生命周期变化。
社会仿真 智能体 智能体记忆 群体行为建模 身份偏见 生命轨迹 身份本质主义 纵向记忆
研究发现,基于静态人口档案构造的 LLM 智能体容易将群体平均倾向视为个体特征,相较真实人群呈现更强的人口群体分离和群体内响应压缩,反映出身份本质主义倾向。其成因包括智能体表征稀疏且静态,以及仅依靠提示词的记忆难以持续整合个人经验。作者提出纵向记忆框架 LifeMem,将结构化生命事件检索与智能体专属参数记忆结合,以纵向人生经历塑造可动态演化的个体。基于 Add Health 和 Understanding Society 数据、跨三种 LLM 的实验表明,LifeMem 改善了响应分布、总体及群体内外多样性,并提升了个体跨生命阶段变化与真实人类数据的一致性。
- 为社会仿真智能体提供比静态人口标签更细粒度、动态且可信的个体建模方案。
- 提醒研究者避免将人口统计标签直接作为稳定人格代理,并通过纵向经历与持续记忆降低群体刻板化和个体同质化。
- 表明检索式生命事件记忆与参数化经验记忆具有互补价值,可支持智能体随生命周期持续演化。
- 可将总体分布一致性、群体内外多样性和个体跨阶段变化共同纳入社会模拟系统评测。
📝 原始笔记(逐字保留)
Forking Fast:高效估计文本生成的不确定性动态
论文通过对低样本推理轨迹数据进行统计平滑,以更低的重采样成本逼近大样本下稳定的不确定性动态。
LLM 推理具有随机性,需要分析同一问题下多条推理链的分布,才能识别决定最终答案的关键步骤。传统方法在推理链的每个 token 或句子处重复采样,计算成本很高。研究发现,随着样本增加,不确定性动态会收敛到稳定模式,低样本下的波动主要源于采样噪声,而非模型对每个局部步骤都高度敏感。作者据此建立统计模型,对低样本 rollout 数据进行平滑,使其更好地近似高样本分析结果并显著减少采样开销。
- 降低推理链分叉与重采样分析的计算成本,使大规模模型行为研究更可行。
- 帮助区分真实的推理敏感性与有限采样造成的表面噪声。
- 可用于定位影响答案形成的关键推理节点,并优化不确定性评测的采样预算。
📝 原始笔记(逐字保留)
TESTNAV:Pareto 引导的组合鲁棒性测试
TESTNAV 通过 Pareto 引导的双目标搜索,在有限评测预算下高效发现兼具高破坏性与现实性的组合扰动配置。
多目标优化 搜索效率 模型评估 形式化鲁棒性 组合扰动 鲁棒性测试 进化搜索
TESTNAV 面向亮度变化、运动模糊等多种扰动同时出现时产生的组合鲁棒性问题,避免穷举随扰动维度和强度等级增长而急剧扩大的离散空间。框架将测试建模为双目标优化:一方面最大化模型性能下降,另一方面利用 SSIM、KID、chrF 和 BERT-F1 等模态相关指标保持输入保真度。它采用 NSGA-II 近似搜索 Pareto 前沿,从而优先定位严重但仍符合现实分布的失效样本。在覆盖视觉、自然语言和代码生成的四项基准上,TESTNAV 相比搜索基线最快可将 Pareto 前沿恢复速度提升至 2.15 倍,仅需评估完整扰动空间的 35.8%–89.3%。
- 为有限测试预算下的模型鲁棒性评估提供多目标搜索方案,减少对组合扰动空间的穷举成本。
- 将失效严重度与输入现实性同时纳入优化,可过滤过度失真、缺乏实际诊断价值的极端样本。
- 可跨视觉、语言和代码任务应用于红队测试、失效诊断及上线前验收,并可通过替换保真度指标适配不同模态。
- Pareto 前沿能够展示性能退化与输入质量之间的权衡,为测试案例筛选和模型修复提供优先级依据。
📝 原始笔记(逐字保留)
聚合移动统计蒸馏为大型活动后人群仿真策略
研究将区域设备计数和 OD 流量等聚合移动统计蒸馏进语言模型人群智能体,在无个体轨迹且无需推理时额外校正的情况下,将大型活动后人群目的地占比误差降低 25%。
社会仿真 群体行为建模 智能交通 模型蒸馏 人群流动仿真 滑动窗口统计 后训练 群体移动 统计蒸馏
研究面向隐私受限、缺少个体轨迹的人群仿真场景,仅利用区域级设备计数和起讫点(OD)流量学习智能体行为。方法从 OD 流中提取前往各兴趣点的目标比例,并通过迭代比例拟合,将语言模型原有的目的地分布重加权至观测构成。针对微调会放大主导目的地类别的问题,作者依据校正后的训练数据组成重采样轨迹,再使用低秩适配器进行微调。基于两场棒球比赛移动网络计数的实验表明,微调后的智能体无需推理阶段额外校正即可将目的地占比误差降低 25%,同时保持与其他策略相近的网格相关性。
- 为仅有聚合统计、无法获取个体轨迹的城市人群仿真提供兼顾隐私保护与微观策略学习的技术路径。
- 展示将宏观 OD 分布蒸馏为可执行的个体智能体决策规则的方法,可用于大型活动散场、交通疏导、公共安全预案和设施容量评估。
- 提示参数高效微调可能进一步放大主导类别及分布偏移,需要通过训练数据组成校正与轨迹重采样进行预先补偿。
📝 原始笔记(逐字保留)
基于地理隔离的可扩展遥感自监督学习
论文以地理隔离度作为无需标签和图像解码的样本排序指标,为遥感自监督预训练构建低成本课程,并显著节省训练预算、提升下游性能。
遥感分析 课程学习 样本调度 数据策展 自监督学习 地理隔离
论文利用地理空间数据自带的定位元数据计算样本地理隔离度,并将其作为信息量的无标签代理来安排自监督学习课程。该指标的计算复杂度为 O(D log D),无需解码图像、获取模型反馈或进行人工标注,同时适用于对比式与重建式目标。作者将其集成至 MoCoV2 和 MAE,并在 CopernicusBench 的 BigEarthNet、DFC-2020 与 LCZ 三项任务上评估。该方法仅用 20% 的 MAE 训练预算或至多 40% 的 MoCo 预算即可达到基线最终轮性能,下游指标提升 1—5 个点,BigEarthNet 上最高提升 5 mAP。相比视觉复杂度课程,其预计算成本降低超过 140 倍,CKA 与有效秩分析还显示模型获得了维度更高、利用更均匀的嵌入空间。
- 为超大规模遥感数据提供无需视觉特征预计算的低成本课程排序方案。
- 可依据地理元数据优先调度稀有或孤立区域样本,减少自监督预训练所需算力。
- 表明非视觉元数据也能有效改善表征空间质量,可拓展到其他带位置或空间关系的数据集。
- 为课程学习策略提供了兼容对比学习与掩码重建的统一样本难度代理。
📝 原始笔记(逐字保留)
RecPFN:面向上下文序列推荐的先验拟合网络
RecPFN通过在结构因果先验生成的合成点击流上预训练,无需更新权重,仅凭少量目标域序列即可实现高效的零样本序列推荐。
上下文学习 小样本学习 数据合成 时序建模 贝叶斯方法 跨域泛化 零样本学习 序列推荐系统 先验拟合 推荐系统 点击序列建模
RecPFN将先验拟合网络(Prior-Fitted Network)与上下文学习引入序列推荐,训练数据完全来自广泛结构因果先验采样的合成点击流环境。模型采用轻量级仅解码器 Transformer,从少量目标域支持序列中摊销执行近似贝叶斯推断,并通过单次前向传播预测下一个物品,无需微调或更新权重。在八个公开基准上,RecPFN取得领先的零样本表现,并在低算力、低数据条件下与监督方法保持较强竞争力。相比依赖大规模真实交互语料的零样本基线,该方法部署效率更高,对领域偏移具有较好鲁棒性,并展现出向更丰富因果先验、长上下文和多模态推荐扩展的潜力。
- 为冷启动、快速跨域适配及无法频繁在线微调的场景提供即插即用的零样本推荐方案。
- 说明合成环境与结构化因果先验可降低通用推荐器对大规模真实用户交互数据的依赖。
- 将推荐任务转化为基于少量支持序列的上下文推断,并以轻量架构和单次前向推断降低新领域部署与适配成本。
- 可进一步研究更丰富的用户因果先验、长上下文支持集及多模态行为与物品信息对推荐泛化能力的影响。