2026-08-26 科研追新

当日精选(由提交工具自动创建)。

SSI首个模型传闻:以测试时训练实现“边想边学”

文章援引投资人与行业观察者的爆料,推测Ilya Sutskever创办的SSI将发布采用测试时训练、可在推理期间更新权重的首个模型,但相关能力与投资细节尚未获官方证实。

 测试时计算 持续学习 元优化 知识内化 模型开发 在线学习

文章称SSI可能于近期发布首个模型,其核心路线被推测为测试时训练(TTT),即模型在处理新资料时通过梯度更新改变权重,而非仅依赖长上下文保存信息。该思路把部署过程视为持续学习过程,目标是让模型内化新知识、快速适应岗位,并掌握获取新技能的方法。报道还称英伟达计划扩大SSI的算力供给,并可能投入50亿美元、开放Vera Rubin系统访问权限,但这些说法及模型发布日期均缺少SSI官方确认。文章将该路线与Ilya关于“预训练时代终结”和从Scaling转向Research的判断联系起来,认为它可能改变推理模型、长上下文和算力竞争的现有范式。

用途与启示
  • 关注测试时训练能否把推理阶段的计算从Token搜索扩展为参数更新,为EvolveLRM探索在线自我改进提供新路径。
  • 评估模型持续更新时的灾难性遗忘、数据投毒、权重漂移与回滚机制,避免“边用边学”放大安全风险。
  • 建立与长上下文、RAG及传统测试时计算的对照实验,比较知识保持、适应速度、推理成本和跨任务泛化。
  • 当前信息以行业爆料和推测为主,应等待SSI官方发布、技术报告及可复现实验后再判断其真实性与突破程度。
📝 原始笔记(逐字保留)
EvolveLRM | Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布https://mp.weixin.qq.com/s/gm2gvPsGVybsuNBUPrppGA

对话 Claude Code 之父:模型越聪明,工作流越应简化

Claude Code 核心开发者认为,随着模型能力持续增强,研发产品应减少复杂工作流与过度编排,让模型直接承担更多端到端任务。

 人工智能辅助编程 智能体 工具调用 默认设计 SWE 软件工程

文章围绕 Claude Code 的产品理念及 AI 编程工具设计展开,强调模型能力是产品体验的核心。随着模型越来越聪明,许多预设步骤、复杂代理编排和固定工作流可能迅速成为限制,而非优势。研发工具应提供简洁接口、充分上下文和可靠执行环境,让模型自主完成更多端到端工作。产品团队的重点应从堆叠流程转向识别真实需求、改善模型可用性并建立必要的安全边界。

用途与启示
  • 为 AI 编程产品设计提供“模型优先、流程从简”的思路。
  • 帮助研发团队审视复杂工作流是否真正提升效果,避免为编排而编排。
  • 提示产品架构保留弹性,以适应基础模型能力快速增长。
  • 可用于评估智能体脚手架、工具调用层和人工确认环节的必要性。
📝 原始笔记(逐字保留)
研发可用 | 对话Claude Code之父:当模型越来越聪明,还在设计复杂工作流的人只是在假装做产品https://m.huxiu.com/article/4885785.html

智能体 token 用量已达人类 5.2 倍

OpenRouter数据显示,智能体流量半年增长14倍、token用量达到人类的5.2倍,推动成本与缓存需求激增,也使人工验收成为新瓶颈。

 词元效率 智能体流量 智能体 前缀缓存 业务验收 成本优化

OpenRouter依据工具调用频率、响应间隔和对话轮数等行为信号,将API流量划分为Agentic、Mixed和Human三类。截至2026年8月10日,Agent类token用量由约0.51万亿增至7.3万亿,而人类用量约为1.4万亿,前者已是后者的5.2倍。智能体围绕目标持续读写上下文、调用工具和反复修改,单个任务可能产生远超普通聊天的模型调用,其中近70%的token来自缓存提示。尽管缓存降低了单位价格,持续运行仍会显著推高总成本与内存需求,而人工审批、结果验证和最终决策的扩容速度远落后于执行量增长。

用途与启示
  • 评估智能体产品时,应按完整任务轨迹而非单次请求核算token、缓存、内存和工具调用成本。
  • 通过技能复用、上下文缓存、模型路由和减少返工控制智能体的长期运行费用。
  • 为高风险动作设置人工审批、操作日志、异常告警和可回滚机制,避免无人验收造成业务损失。
  • 将验证、判断和最终拍板能力纳入智能体工作流设计,防止执行吞吐增长快于治理能力。
📝 原始笔记(逐字保留)
Groom | AI开始替人类调用AI!token用量已是人类5.2倍 https://mp.weixin.qq.com/s/RdBNDxIOUwlQvQP1C1bt3w

Claude辅助构造S⁶复结构,挑战78年数学悬案

哈佛数学家Levent Alpöge据称在Claude辅助下构造出与六维球面S⁶微分同胚的紧致复三维流形,为延续78年的S⁶复结构存在性问题给出肯定答案,但108页论证仍待数学界正式审查。

 科学发现 自动定理证明 数学直觉 自动化科学研究 多智能体系统 复几何学 微分拓扑学

研究采用(3,4,∞)三角群构造底空间,并在一般点上配置复2-环面纤维,再利用Mumford环面退化和Kodaira对数变换填补三个特殊纤维。通过选择扭转参数(ℓ₀,ℓ₁,ℓ₂)=(0,1,−1),作者将所构造流形X的基本群化为平凡群,并结合整同调、Hurewicz与Whitehead定理证明其为同伦六维球。随后借助Smale广义庞加莱猜想以及六维不存在怪球的Kervaire–Milnor结论,论证X与S⁶微分同胚,从而赋予S⁶复结构。报道声称Claude深度参与了三天内的构造过程,但完整证明尚需同行独立验证,原始论证文件位于https://alpo.ge/s6.pdf。

用途与启示
  • 展示大模型可能从检索既有结论迈向构造全新数学对象,拓展AI辅助数学发现的能力边界。
  • 为自主科研系统提供案例:组合文献检索、候选构造、符号计算、拓扑不变量验证与长证明写作。
  • 可据此设计分层验证流程,分别审查纤维化构造、局部填充、基本群与同调计算以及微分同胚结论。
  • 在正式同行评审前应将其视为待核验主张,避免仅凭模型审阅或媒体报道认定悬案已经终结。
📝 原始笔记(逐字保留)
有趣研究 | 菲尔兹奖得主都栽了!Claude终结78年悬案,或成最重要AI数学成果https://mp.weixin.qq.com/s/s0jREeAKJakWfixGfzTuNA

Anthropic 精选 6 个 Claude Code 创意项目

Anthropic 展示 6 个由普通用户借助 Claude Code 完成的创意项目,体现自然语言编程正从代码辅助走向完整产品构建。

 人工智能辅助编程 人工智能原生应用 代码可视化 三维生成 事实核查 创意编程 产品原型设计

Anthropic 精选的项目包括 JavaScript 人脸涂鸦、3D 颌骨 DICOM 查看器、动态代码库可视化、纯代码生成的可步行街景、延迟送达的信鸽短信应用,以及中文书法学习工具。DICOM 查看器仅通过两轮提示便完成文件识别、三视图联动、尺寸测量、对比度调节与本地离线处理,展示了 Claude Code 快速构建专业工具的能力。代码库动态图和纯代码街景则拓展了代码理解与交互场景生成的界面形式,但也暴露出可视化目标不清时容易“看起来很酷但不实用”的问题。这些案例表明,Claude Code 正从传统编程助手转向覆盖创意构思、实现、封装和发布的端到端产品原型工具。

用途与启示
  • 为自然语言驱动的快速原型开发提供案例,可用于验证小众工具、交互创意和个人需求。
  • 展示 AI 编程在医学影像、代码理解、三维场景和教育工具等垂直方向的应用潜力。
  • 提示开发者不仅要关注代码能否生成,还需提前明确可视化对象、交互目标、隐私约束与实际效用。
  • 说明单文件封装、本地离线运行和无需外部素材等约束,可以成为提升 AI 生成应用可交付性的有效提示策略。
📝 原始笔记(逐字保留)
有趣研究 | 6个Claude Code神作,Anthropic亲选https://mp.weixin.qq.com/s/-P7lfRxpPPYC70gcFi1HlQ

斯坦福 CS329A:自改进 AI Agent 课程公开

斯坦福公开 CS329A《Self-Improving AI Agents》课程,系统讲解智能体如何借助搜索、验证、环境反馈与强化学习形成持续自我改进闭环。

 智能体 自我改进 自进化 测试时计算 强化学习 过程验证 长程任务

CS329A 是斯坦福于 2025 年秋季开设的自改进 AI 智能体课程,共约 10 周、20 次课,课程主页、阅读清单和官方录像均已公开。课程将自我改进拆解为候选生成、搜索、结果或过程验证、环境反馈及训练信号回流,而非让 Agent 任意修改自身代码。前半程涵盖测试时算力扩展、弱验证器、ReAct、树搜索、多步规划和代码反馈强化学习,后半程讨论工具、记忆、多模态、训练时扩展与智能体评估。课程还覆盖 STaR、DeepSeekMath、DAPO、AI Scientist 和 AlphaEvolve,并延伸至代码仓库任务、长程 Agent 与机器人系统。

用途与启示
  • 可作为自改进智能体研究的系统化学习路线,串联测试时搜索、验证和训练时优化。
  • 为构建“生成—验证—反馈—再训练”闭环提供方法框架与论文阅读清单。
  • 有助于研究编码 Agent、长程任务记忆、多步规划及数小时到数天任务的评测方法。
  • 适合已掌握 Python、PyTorch、Transformer、监督微调和基础强化学习的进阶学习者。
📝 原始笔记(逐字保留)
学习 | 斯坦福最新课程发布:教 AI Agent 自我进化!https://mp.weixin.qq.com/s/BsHOmJeEMTemUAr43GrGxQ

EchoWM:开放可进入的全模态世界模型

EchoWM 将连续相机导航映射为统一的六自由度轨迹,可同步生成 720p 视频、环境声、音乐与语音,支持第一和第三人称的长时程交互式媒体体验。

 世界模型 多模态 视频生成 连续交互 空间智能 长程任务 交互式环境生成 视听共生

EchoWM 是面向“可进入生成媒体”的全模态世界模型,可响应连续导航并联合生成 720p 视频、环境声、音乐和语音。模型以相机意图组织交互,将离散命令和连续位姿统一映射至具有真实尺度的相对 6-DoF 轨迹,并通过数据集级校准保持异构数据中的运动幅度一致。它在第一人称场景中直接控制观察者运动,在第三人称场景中则从数据学习相机与角色的动态关系,无需针对不同视角设计专用控制器。训练采用互补数据引擎、渐进式训练及自回归后训练,在公开世界模型基准上展现出较强的轨迹跟随、视觉质量和长时程音画同步能力。

用途与启示
  • 为可连续探索的生成式游戏、虚拟空间和沉浸式内容提供统一的音视频世界模型底座。
  • 共享尺度的 6-DoF 轨迹表示可用于整合来源异构、控制形式不同的相机运动数据。
  • 相机意图驱动的交互范式有助于统一第一人称导航与第三人称角色演出。
  • 渐进训练结合自回归后训练,为提升长时程生成的一致性及音画同步提供了可借鉴路径。
📝 原始笔记(逐字保留)
[EchoWM:开放且可进入的全模态世界模型(43 ▲)](https://huggingface.co/papers/2608.23189?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-25)

MobilePA-Bench:复杂真实移动任务规划智能体基准

MobilePA-Bench 通过可执行、有状态的移动沙箱和证据验证,综合评测智能体在真实运行约束下的工具调用、长程规划、子代理协作、记忆及技能使用能力。

 智能体评估 工具调用 任务规划 子智能体 执行验证 移动智能体

MobilePA-Bench 面向移动端个人助理场景,弥补 GUI 操作基准忽略后台工具与长程规划、静态函数调用基准脱离真实运行环境的问题。基准构建了维护实时应用数据库并返回结构化反馈的可执行沙箱,覆盖 13 个功能领域和 212 个真实移动工具。除基础工具调用外,它还评测复杂任务分解与子代理委派、用户记忆和偏好调用,以及复合技能复用三项高级能力。实验显示,前沿大模型在严格工具顺序、权限限制和突发运行错误下性能显著下降,说明移动规划智能体的可靠性仍有较大提升空间。

用途与启示
  • 为移动规划智能体提供兼顾运行状态、工具约束与证据验证的系统化评测框架。
  • 可用于定位工具排序、权限处理、异常恢复、记忆利用和子代理协作等具体能力缺陷。
  • 其交互式沙箱可进一步作为智能体强化学习及可靠执行训练的环境底座。
  • 提示移动端智能体研发不能只优化离线 API 匹配或界面操作,还需覆盖真实运行时约束与长程任务规划。
📝 原始笔记(逐字保留)
[MobilePA-Bench:在复杂真实世界任务上对移动规划智能体进行基准测试(21 ▲)](https://huggingface.co/papers/2608.23035?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-25)

十亿级用户表示学习的行为致密化定律

论文提出用户行为致密化定律,量化数据规模与最低充分分词容量的关系,并以自适应变长分词方法 ALGN 改善十亿级用户表示学习的容量分配。

 用户画像 序列推荐系统 缩放定律 数据工程 参数高效微调 用户表征 行为词元化 致密定律

研究指出,单纯扩展原始文本形式的用户行为数据,在十亿级容量下会出现收益递减,而将行为序列分词后仍可持续获得性能提升。理论分析与系统实验显示,最低充分分词容量的对数与输入 token 数量的对数近似呈线性关系,其斜率会随分词方法和数据来源变化。该规律反映了不同用户行为表示空间的冗余程度与数据源内部独特性,可用于按数据规模选择分词配置。基于这一规律,作者提出自适应变长分词方法 ALGN,在多种数据源、分词方法和下游任务上优于现有基线。

用途与启示
  • 为大规模推荐与用户画像系统提供分词容量选型依据,避免盲目扩大原始行为输入。
  • 可依据数据规模预测最低充分表示容量,在效果、存储和计算成本之间进行权衡。
  • ALGN 展示了按行为特征自适应分配变长 token 容量的工程路径。
  • 该定律可作为检验不同数据源表示冗余和扩展效率的分析工具。
📝 原始笔记(逐字保留)
[迈向十亿级容量用户表示学习的致密化定律(19 ▲)](https://huggingface.co/papers/2608.23392?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-25)

ReWorld:具备长时记忆的交互式世界模型

ReWorld通过局部与全局混合注意力、位姿索引地标库及四步蒸馏,在固定推理预算下兼顾交互控制、分钟级场景记忆和实时视频生成。

 世界模型 智能体记忆 长程任务 视频生成 缓存优化 地标记忆

ReWorld将短时动作控制与长时场景记忆解耦训练,以混合注意力窗口让多数注意力头关注近期历史,少数全局头访问完整历史。推理时采用有界KV缓存与位姿索引地标库,根据当前相机位姿检索邻近地标,从而在固定显存预算下恢复早期场景。其数据引擎统一八类虚拟、游戏和真实视频源的物理动作尺度,并利用回文轨迹提供重访训练信号。模型还通过限制在LoRA适配器中的分布匹配蒸馏,将采样压缩至四步,在704×1280分辨率下兼顾高保真与实时交互模式。

用途与启示
  • 为需要持续探索和场景重访的交互式世界模型提供有界长时记忆方案。
  • 位姿索引地标库可替代无限增长的完整KV缓存,降低长序列推理的显存压力。
  • 局部与全局注意力头混合设计可用于平衡即时控制响应和远程信息召回。
  • 统一动作尺度与回文轨迹设计为跨数据源训练空间一致性和重访记忆提供参考。
  • LoRA局部蒸馏展示了同一主干模型兼容高质量多步生成与低延迟实时生成的路径。
📝 原始笔记(逐字保留)
[ReWorld:具有长时记忆的交互式世界模型(15 ▲)](https://huggingface.co/papers/2608.23565?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-25)

ARC:开放式交互中的公平相对优势比较

ARC通过按交互策略分组轨迹并结合混合奖励与熵正则,减少开放式交互中行为风格偏好对相对优势估计的扭曲。

 优势估计 强化学习 交互式评估 工具调用 响应模式 奖励公平性 策略分组

开放式真实世界交互允许直接回答、请求澄清、汇报进度或行动前确认等多种合理行为,导致组内强化学习所比较的轨迹未必具有行为可比性。论文将奖励模型偏爱特定交互风格、进而扭曲相对优势的问题形式化为“奖励公平”问题,并提出 ARC(Advantage Regularization via Conditioning)。ARC采用策略条件化的轨迹分组,并结合混合奖励和熵正则,使优势比较更多发生在可比行为之间。配套交互范式将用户可见通信与潜在推理、工具调用解耦,并构建策略标注的 INTER-86K 训练语料;实验在工具使用基准上取得提升,同时将首 token 延迟由 4.91 秒降至 1.27 秒。

用途与启示
  • 为开放式智能体的组内强化学习提供更公平的优势估计方法,避免模型仅迎合奖励模型偏好的交互风格。
  • 提示训练系统应按回答、澄清、确认和进度更新等行为策略对轨迹分组,而非直接比较所有采样结果。
  • 可用于训练响应及时、可引导且具备执行感知能力的工具型智能体。
  • INTER-86K 的策略标注与蒸馏流程可为监督微调和强化学习数据构建提供参考。
📝 原始笔记(逐字保留)
[ARC:开放式真实世界交互中的公平相对优势比较(15 ▲)](https://huggingface.co/papers/2608.13622?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-25)

GLM-5.3-Flash 开源:低成本原生多模态前沿模型

智谱发布并开源320B-A18B原生多模态模型GLM-5.3-Flash,以混合注意力和国产芯片推理优化实现接近顶尖模型的能力与显著更低的调用成本。

 模型开发 多模态 人工智能辅助编程 稀疏注意力 线性注意力 长上下文 国产算力 推理加速 视觉编码 混合注意力

GLM-5.3-Flash总参数量为320B、激活参数量为18B,在Artificial Analysis Intelligence Index中获得57分,官方称其编程能力与Claude Opus 4.8相当,而价格仅为后者的约1/40。模型采用线性注意力与稀疏注意力混合架构,并通过IndexPool压缩索引缓存,使注意力计算量和KV缓存相较GLM-5.3分别降低3.01倍和4.44倍。作为GLM-5系列首个原生多模态模型,它将视觉反馈引入代码、浏览器和GUI工作流,可在前端、游戏、3D仿真及Office文档任务中观察、验证并迭代改进输出。其大规模服务由国产芯片集群承载,结合EPD分离、ReplaySSM、W8A8量化及混合缓存量化等优化,端到端性能较初始基线提升3倍。模型现已开放API、在线体验和Hugging Face权重,并接入ZCode等Agent平台。

用途与启示
  • 为低成本部署前沿多模态模型提供架构参考,尤其适用于长上下文、高并发推理服务。
  • 展示视觉反馈、自我验证与测试时迭代在AI编程、GUI开发和专业文档生成中的应用价值。
  • 验证国产芯片集群通过模型架构、量化、并行和调度协同优化承载大规模前沿模型推理的可行性。
  • 为构建“模型辅助优化基础设施、基础设施反向支撑模型”的自动化系统研发闭环提供实践案例。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/O7RCVME1Kut-Z2oFYhgrkw

字节跳动 2027 校招重点 AI 岗位真题合集

字节跳动启动 2027 校招,并集中解析四类重点 AI 岗位的任职要求与面试真题。

 人工智能 人工智能辅助编程 智能体 人工智能应用 智能招聘

字节跳动 2027 校园招聘已正式启动,文章汇总了当前关注度较高的 AI 岗位机会。重点岗位包括大模型应用算法工程师、AI 全栈工程师、AI Agent 工程师和 AI 产品经理。内容围绕各岗位的能力要求展开,并提供面试真题拆解,帮助应届生针对性准备。候选人可通过文章“阅读原文”入口进行投递。

用途与启示
  • 帮助应届生了解字节跳动重点 AI 岗位及其能力要求。
  • 可依据面试真题制定大模型应用、全栈开发、Agent 工程和产品设计方向的备考计划。
  • 为 AI 人才需求和岗位结构变化提供一线招聘侧参考。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/FSjjm-2RztVXrU9to3bAhw?scene=1

RISE:世界动作模型的自适应想象与选择性推演

RISE依据继续想象的预期规划收益与计算成本动态决定推演或停止,在提升自动驾驶规划性能的同时减少不必要的世界模型展开。

 世界模型 自动驾驶 任务规划 停止策略 推理预算 反事实推理 想象门控 动作表征

RISE(Refining Imagination through Selective Rollout)将固定想象预算改为逐步自适应的 Roll/Stop 决策。潜在评估器根据当前前缀估计已暴露风险及继续推演可能带来的规划改进,推演门控器再权衡收益与额外计算成本。作者构建反事实数据集 CounterDrive,以多样化未来结果和风险等级弥补真实驾驶日志仅包含单一未来的局限,并由专家标注轨迹有效性、事故起点和因果类别。在 NAVSIM 与 nuScenes 上,RISE取得最佳综合规划表现,并展现出跨世界动作模型架构的插件式迁移能力。

用途与启示
  • 为世界模型提供按场景难度和风险动态分配想象计算量的机制。
  • 可将风险评估、规划收益预测与停止策略结合,降低自动驾驶推演延迟和算力浪费。
  • CounterDrive展示了利用反事实未来和局部风险监督增强安全关键规划训练数据的路径。
  • 插件式设计有助于将自适应推演门控迁移到不同世界动作模型架构。
📝 原始笔记(逐字保留)
[RISE:面向世界动作模型的自适应想象(24 ▲)](https://huggingface.co/papers/2608.20430?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-25)

“京彩就业”2027届高校毕业生高层次人才专场双选会邀请函

北京高校大学生就业创业指导中心将于2026年9月18日举办面向2027届硕博毕业生的免费高层次人才专场双选会,现邀请用人单位报名参会。

 智能招聘 校园招聘 毕业生就业

双选会定于2026年9月18日14:00—16:30在北京大学生就业之家举行,计划设置60家用人单位展位,参会免费。活动面向北京地区高校及科研院所2027届毕业生,重点覆盖博士、硕士研究生等高层次人才。用人单位需登录北京高校大学生就业创业信息网,完成实名认证、职位发布和场次报名,并等待审核。每家单位现场参会人数不超过2人,如需调整计划,应至少提前7日联系工作人员。

用途与启示
  • 为用人单位集中招募北京地区高校及科研院所的2027届硕博毕业生提供渠道。
  • 有助于高校毕业生了解高层次人才岗位,并与用人单位进行现场交流。
  • 参会单位应提前完成网上报名与职位发布,同时遵守招聘合规要求,不得收费、虚假招聘或委托招聘。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/lAN6fdRlgt3qme2CSA036Q?scene=1

Agent 自进化飞轮:评测、记忆、落地与控制

文章提出以可信评测为信号、治理型记忆为积累、Harness 更新为落地、人机协作为控制的 Agent 自进化工程闭环。

 自进化 闭环评估 智能体记忆 智能体脚手架 人在回路 技能治理 版本状态管理 闭环优化 记忆治理

文章将自进化区分为产物迭代、Harness 自改进和模型参数进化三层,认为当前最具性价比的是可即时生效、可回滚的 Harness 层。自进化飞轮由评测、记忆、工程落地和人机控制四个环节组成,关键不在单点能力,而在评测信号、经验沉淀与 Skill/Prompt 更新之间的数据通路。评测同时承担方向指引、质量门控和经验筛选职责,应结合规则校验、LLM Judge、失败案例细粒度归因及分层回归,并保持预算公平。记忆系统应重视版本控制、主动遗忘、冲突解决和来源溯源,所有自动生成的 Skill 或配置更新都需经过验证、灰度发布与可回滚控制。

用途与启示
  • 为生产级 Agent 建立从线上执行、评测归因、经验沉淀到 Skill/Prompt 更新的持续改进闭环。
  • 优先建设可信且分层的评测体系,避免弱裁判和预算不公平造成错误正反馈。
  • 将记忆视为需要版本、冲突、遗忘和溯源机制治理的长期资产,而非简单的向量存储。
  • 先从可观测、可验证、可回滚的 Harness 层推进自进化,再逐步扩大自动化范围并保留人工控制点。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/5VDN-T9K8Wr-DaQ15-I6CA?scene=1

Self-Harness 更新并开源:Agent 自主改进执行框架

上海 AI Lab 团队更新并开源 Self-Harness,通过弱点挖掘、修改提案和回归验证,让 Agent 针对自身失败模式自主优化 Harness,最高取得 132% 的相对性能提升。

 智能体 智能体脚手架演化 自我改进 智能体执行框架 软件修复评估 漏洞挖掘

Self-Harness 不依赖人工设计 Harness,也不采用强模型为弱模型设计 Harness 的 Meta-Harness 路线,而是让 Agent 自己充当 Harness Engineer。其流程包括从执行轨迹中挖掘模型特定的失败模式、生成最小且可执行的 Harness 修改,并通过回归测试筛除可能导致性能退化的提案。更新后的实验覆盖 Terminal-Bench-2.0、SWE-bench Verified 和 AppWorld,以及 MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5 三个模型家族。全部 9 个模型—基准组合的 held-in 与 held-out 性能均获得提升,最高相对增幅达到 132%。分析显示,其改进并非简单的 Prompt 模板,而是涉及执行控制、代码验证和应用状态检索等框架级机制。

用途与启示
  • 为不同模型自动发现并修复 Harness 层面的能力短板,减少人工调试成本。
  • 以 held-out 测试和回归验证约束自动修改,可降低局部优化导致整体性能退化的风险。
  • 说明 Agent 自我改进可以发生在执行框架层,而不必修改模型权重。
  • 可作为 Harness 自动演化、智能体系统持续优化及跨基准泛化研究的参考方案。
📝 原始笔记(逐字保留)
53 【Self harness更新并且开源了 - 胡舒悦 上海AI Lab | 小红书 - 你的生活兴趣社区】 😆 MvJjMOLFHEiHQqE 😆 https://www.xiaohongshu.com/discovery/item/6a87e1b10000000034009831?source=webshare&xhsshare=pc_web&xsec_token=CBYc_mhR00a7gs8MTBgKKHFACpxCJYkGJITZuahu0Jo3I=&xsec_source=pc_share

小宇宙《2026 AI趋势报告》:协作型AI、AI创作与办公升温

小宇宙报告显示,中文播客中的AI内容持续高速增长,讨论重心正从模型能力转向协作办公、内容创作、实际工作流及人的价值。

 人工智能 人工智能辅助编程 办公智能体 人机协同决策 创意写作 人工智能播客 内容生态

小宇宙发布《2026 AI趋势报告》,数据显示2025年平台AI内容创作者同比增长187%,相关节目数量增长239%。2026年以来,「协作型AI」相关搜索量、单集数和播放量分别同比增长227%、290%和207%,Agent能力正从Coding扩展到更广泛的工作场景。AI生成也在影响文字、图像、音乐、视频、表演与翻译,「AI×办公」搜索量增长105.4%,AI工作流和AI助手成为热门话题。随着生成门槛下降,讨论进一步转向真实经验、品味、责任、专注思考和最终判断等人的独特价值,播客则成为从业者分享一线经验的重要载体。

用途与启示
  • 反映AI应用关注点已由“模型能否使用”转向“AI如何参与并完成真实工作”。
  • 为办公代理、协作型Agent和AI原生工作流的产品规划提供需求信号。
  • 提示AI创作工具应强化人的品味、责任和最终决策权,而非只追求生成效率。
  • 可将播客长访谈作为追踪产业路线、创业实践和用户需求变化的一手信息源。
📝 原始笔记(逐字保留)
标题:小宇宙推出《AI趋势报告》:AI创作、AI办公、协作型AI等成讨论新趋势 来源:量子位(微信公众号) 链接:https://www.qbitai.com/2026/08/479811.html 摘要:AI内容创作者增长187%,相关节目数量增长239%

Recuris:面向长程智能体脚手架的递归经验—工作记忆演化

Recuris 通过耦合工作记忆与经验记忆,并由固定元智能体执行局部、验证门控的技能更新,构建可控的递归记忆演化闭环,显著提升长程任务成功率。 [合并自 2026-08-27 recuris] Recuris 通过耦合工作记忆与经验记忆,并利用验证门控的局部技能更新,让长时程智能体在受控递归循环中持续从执行经验改进自身。 [合并自 2026-08-28 recuris-skill-memory] Recuris 冻结基座模型与外层程序,通过递归演化外部 Skill Memory、验证任务状态并门控组件补丁,显著提升具有共享结构的长程 Agent 任务成功率。 [合并自 2026-08-29 recuris-skill-memory] Recuris 冻结基座模型与外层程序,通过递归演化外部 Skill Memory、验证工作状态并门控记忆补丁,显著提升长时程 Agent 的任务成功率。 [合并自 2026-08-30 recuris-agent] Recuris 通过经验记忆与工作记忆耦合、结构化轨迹诊断及验证门控的组件级递归演化,无需训练即可提升从 3B 小模型到 Claude Opus 5 的长程任务表现。

 长程智能体 内生记忆 技能演化 递归自我改进 自我改进 智能体脚手架 工作记忆 经验记忆 智能体 记忆演化 轨迹诊断 状态追踪 执行验证 记忆控制 补丁门控 验证棘轮 技能记忆 记忆补丁 长程任务 记忆耦合 组件修复

Recuris 将记忆拆分为跟踪任务进度的工作记忆和存储可调用技能的经验记忆,使技能选择依据当前任务状态,而非不断增长的完整交互历史。执行过程被转化为结构化证据,可将失败定位到具体记忆组件,再由固定 Meta-Agent 生成经过验证门控的局部技能记忆更新。该机制形成“执行—诊断—更新—再执行”的有界递归演化循环,在不改动基础模型的情况下持续重塑智能体行为。实验覆盖四个长时程基准和十个模型,在37个完成的模型—基准组合中有35个取得成功率提升;任务越长优势越明显,最长任务提升达32.2个百分点,常见长时程失败最多减少80%。

[合并自 2026-08-27 recuris] Recuris 使用工作记忆持续跟踪任务进度,并依据当前状态从经验记忆中选择技能,避免完整历史增长导致的状态模糊和技能调用错位。执行过程被转化为结构化证据,可将失败定位到具体记忆组件。固定的 Meta-Agent 根据这些证据,对技能记忆实施局部且经过验证门控的更新,从而形成有边界的递归演化循环。在四个长程基准和十个模型上,该方法在已完成的 37 个模型—基准组合中有 35 个取得提升,最长任务上的增益达到 32.2 个百分点,常见失败最多减少 80%。

[合并自 2026-08-28 recuris-skill-memory]

  • Recuris 将递归自我改进限制在外部 Skill Memory 层,以经验记忆提供技能、工作记忆跟踪已验证进度,并由调用策略和检查器控制检索与状态更新。
  • 系统利用结构化执行轨迹把失败归因到具体记忆组件,只在候选补丁修复源任务且不使留出开发集退化时才允许部署。
  • 在四个长程基准、十个模型的 37 个已完成模型—基准组合中,35 个组合的任务成功率提高;部分模型在 τ²-Retail 和 SkillFlow 上获得超过 15 个百分点的增益。
  • 跨任务演化依赖共享工具、策略或任务族;Terminal-Bench 2.1 缺少此类共享结构,十三轮均未接纳跨任务补丁,说明该方法存在明确适用边界。
  • 结构化轨迹将组件故障定位的宏平均召回率从仅看结局的 13.0% 提升至 64.8%,且演化后的记忆包可迁移到未参与演化的前沿模型。

[合并自 2026-08-29 recuris-skill-memory] Recuris 将 Skill Memory 拆为经验技能、工作状态模式、调用策略和检查器,依据环境观察更新已验证状态,而非直接把对话或口头确认视为任务进展。跨任务阶段,固定 Meta-Agent 根据结构化轨迹把失败归因到具体组件,仅修改相关部分,并要求补丁修复源任务且不导致留出开发集回退。四个长时程基准和十个模型的实验中,37 个已完成模型—基准组合有 35 个成功率提升,部分模型在 τ²-Retail 和 SkillFlow 上获得超过 15 个百分点的增益。该方法依赖任务族之间存在共享工具、策略或结构;Terminal-Bench 2.1 缺少这种共享结构,十三轮跨任务演化均未接纳补丁,收益主要来自多次尝试预算。

[合并自 2026-08-30 recuris-agent] Recuris 将递归自我改进引入智能体的记忆控制层,以紧凑、可靠的工作记忆持续追踪任务进度和未解决目标,并据此从经验记忆中选择技能。系统依据工具回执等环境证据验证状态变化,避免将对话中的自我声明误判为任务完成。其结构化轨迹显式关联任务状态、技能、动作与观测,使故障定位准确率达到 64.8%,显著高于仅观察最终成败或原始轨迹。Meta-Agent 只修补导致失败的具体记忆组件,补丁必须修复目标任务且不使留出集退化才能被接纳。该方法在四个长程基准和十个模型上均取得提升,且演化出的记忆能够跨任务、跨模型迁移。

用途与启示
  • 为长程智能体提供一种无需持续修改基础模型权重的递归自我改进路径。
  • 将任务状态跟踪、技能选择和失败归因统一到分层记忆架构中,降低长历史对执行的干扰。
  • 验证门控与局部更新可限制递归改进的风险,适合作为可审计的 Agent Harness 演化机制。
  • 结果表明,交互跨度越长,结构化工作记忆与经验记忆耦合的收益越明显。

[合并自 2026-08-27 recuris]

  • 为长时程智能体提供比完整历史堆叠更清晰的状态管理与技能调用机制。
  • 可将执行失败归因到具体记忆或技能组件,支持低风险、可验证的局部更新。
  • 为 Harness 自演化与递归自我改进提供无需持续修改基础模型的工程路径。
  • 提示智能体评测应重点考察交互时程增长下的记忆稳定性、技能匹配和失败恢复能力。

[合并自 2026-08-28 recuris-skill-memory]

  • 为长程 Agent 提供一种无需更新模型权重、只演化外部记忆与控制逻辑的低成本自我改进路线。
  • 将“口头声称完成”与环境证据分离,可减少过期状态、遗漏写操作和虚假进度对后续执行的污染。
  • 结构化轨迹、组件级归因和留出集验证门可用于构建更安全、可审计的 Agent harness 演化闭环。
  • 部署前应先判断任务间是否存在可复用的工具和策略结构,并持续监测多轮演化中的性能回退。

[合并自 2026-08-29 recuris-skill-memory]

  • 为长程 Agent 提供一种不更新模型权重、仅演化外部记忆与控制机制的低成本自我改进路线。
  • 将工作状态更新建立在可验证的环境观察上,可减少遗漏写操作、过期要求和虚假完成状态造成的执行失败。
  • 结构化记录状态、技能、动作和观察,有助于把故障定位到调用策略、工作记忆或检查器等具体组件,实现作用域受控的补丁。
  • 留出集验证门可阻止局部修复破坏既有能力,但多轮演化仍可能出现收益回吐,需要持续监控和回滚。
  • 适合具有共享工具与任务结构的场景;对于彼此孤立的终端任务,应优先采用任务内适应或增加试错预算。

[合并自 2026-08-30 recuris-agent]

  • 为长程 Agent 提供一种不依赖模型训练的记忆增强方案,可覆盖小型开源模型与前沿闭源模型。
  • 将记忆检索从膨胀的对话上下文转向经过验证的任务状态,有助于减少过期信息、执行噪声和技能调用错位。
  • 结构化记录状态、技能、动作和反馈,可把最终失败转化为组件级诊断证据,支持低风险的局部修补。
  • 验证集门控能够抑制递归自我改进中的能力回退,为可持续记忆演化提供安全边界。
  • 跨任务与跨模型迁移结果表明,演化后的记忆可作为可复用、相对模型无关的 Agent 资产。
📝 原始笔记(逐字保留)
标题:Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 来源:arXiv 链接:https://arxiv.org/abs/2608.24876 摘要:Recursive self-improvement (RSI) remains hard in long-horizon tasks, where growing histories obscure the task state and misalign skill invocation. We introduce Recuris, a recursive Experiential-Working Memory architecture for long-horizon agent harnesses, in which Working Memory tracks task progress and guides skill selection from Experiential Memory, grounding skill use in current needs rather than the full history. This coupling also turns execution into structured evidence that localizes failures to specific memory components. Across tasks, a fixed Meta-Agent turns that evidence into localized, validation-gated updates to Skill Memory that reshape execution and yield new evidence, forming a bounded recursive memory-evolution loop. Across four long-horizon benchmarks and ten models, Recu [合并自 2026-08-27 recuris] [面向长时程智能体框架的递归式经验工作记忆演化(20 ▲)](https://huggingface.co/papers/2608.24876?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-26) [合并自 2026-08-28 recuris-skill-memory] https://mp.weixin.qq.com/s/-k3GfpYRnBu11ozXmDwKyw [合并自 2026-08-29 recuris-skill-memory] https://mp.weixin.qq.com/s/-k3GfpYRnBu11ozXmDwKyw [合并自 2026-08-30 recuris-agent] MemoryEvolve|Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线https://mp.weixin.qq.com/s/KxtDYsPzxfKEdfFuu6is9w

BrowserForge:并行浏览器沙箱扩展网页交互轨迹

BrowserForge通过开放网页采集、并行浏览器沙箱和Proposer-Solver双代理闭环,生成覆盖20余万个不同网站的可验证视觉交互轨迹。

 智能体数据合成 数据合成 视觉指代消解 并发控制 安全沙箱 网页交互

BrowserForge面向纯截图操作的Web Agent,解决现有交互数据规模小、网站来源固定且多样性不足的问题。框架从开放网络获取网页,由沙箱集群并发调度数百个浏览器,再通过Proposer-Solver双代理循环生成可执行任务并收集验证后的轨迹。规则与模型结合的清洗流程会剔除失败样本,并将保留的推理过程统一改写为一致的思维链风格,页面结构信息仅在数据合成阶段使用。最终语料包含203,238条轨迹且每条来自不同网站,使紧凑多模态模型在Online-Mind2Web上的成功率由25.66%提升至33.33%。

用途与启示
  • 为视觉Web Agent提供可横向扩展的开放网页轨迹合成与清洗方案。
  • 表明网站覆盖广度和真实开放网络来源,是提升网页代理泛化能力的重要因素。
  • 可将并行沙箱调度与任务生成、执行验证闭环用于大规模智能体训练数据工厂。
  • 训练时可利用可访问性树等结构信号造数,同时保持部署模型仅依赖截图,降低HTML变化和令牌成本带来的影响。
📝 原始笔记(逐字保留)
标题:BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes 来源:arXiv 链接:https://arxiv.org/abs/2608.24848 摘要:Web agents that act from rendered pixels avoid the fragility and heavy token cost of reading a page's HTML or accessibility tree, but training them depends on large amounts of high-quality interaction trajectories, and how to produce such data at scale remains an open problem. Public datasets typically contain only a few thousand trajectories drawn from a fixed and narrow set of websites, and even recent automated synthesis pipelines stay bound to predefined site lists or tutorial sources, so the number of distinct websites the agent ever sees barely grows. We present BrowserForge, a framework that generates web interaction data at scale by driving many browser sandboxes in parallel over the open web. BrowserForge couples three components: an open-web sourcing stage that exposes the agent

双维度 LLM 框架自动分析大规模测评题项内容相似性

研究提出结合结构化分解与语义相关性的双维度 LLM 题项相似性分析框架,可更准确识别构念无关的内容冗余,并改善自适应测验的估计稳定性与偏差表现。

 构念效度 测量效度 语义链接 模型评估 题项相似度 测验编制 题库治理

研究面向大规模测评与自动题项生成中的附带内容冗余问题,即不同题项在措辞、情境框架等构念无关元素上出现非预期重复。AISA 框架通过“结构化分解”和“语义相关性”两个维度刻画题项相似度,以弥补 BLEU、余弦相似度等传统指标难以同时识别结构与语义冗余的不足。心理测量验证显示,LLM 指标与构念无关局部依赖的吻合度更高,也能形成更一致的题项参数分组。计算机化自适应测验模拟进一步表明,在选题时加入 LLM 相似性约束,可在仅付出较小效率代价的情况下提高估计稳定性并降低偏差。

用途与启示
  • 为自动生成题项提供比词面指标更细致的重复检测与质量控制机制。
  • 可用于大规模题库清理、内容感知的试卷组装及构念无关局部依赖审查。
  • 在自适应测验选题阶段加入相似性约束,有助于避免考生连续接触高度相似的题目。
  • 展示了将 LLM 语义判断与心理测量指标联合验证的可推广研究范式。
📝 原始笔记(逐字保留)
标题:A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments 来源:arXiv 链接:https://arxiv.org/abs/2608.24825 摘要:The rapid expansion of large-scale assessments and the growing adoption of automatic item generation have intensified concerns about incidental content redundancy, where construct-irrelevant elements such as wording or contextual framing become unintentionally repetitive across items. Traditional similarity metrics like BLEU or cosine similarity, often fail to capture the nuanced structural and semantic layers that drive perceived redundancy simultaneously. This study proposes a dual-dimensional framework for Automated Item Similarity Analysis (AISA) powered by Large Language Models (LLMs), operationalizing similarity through Structured Decomposition and Semantic Relatedness. Psychometric validation indicates that LLM-derived metrics align more closely with indicators of construct-irreleva

StarHarness:以分层搜索演化企业智能体脚手架

StarHarness在固定模型权重的前提下,通过分层任务搜索演进环境专用智能体脚手架,使企业基准性能提升20~35个百分点,并展现跨任务与跨模型泛化能力。 [合并自 2026-09-01 starharness] StarHarness 在固定模型权重的前提下,通过分层任务搜索演化企业环境专用智能体脚手架,使多个基准的整体性能提升20至35个百分点。

 智能体脚手架演化 进化搜索 智能体 接口错配 样本调度 分层搜索 工具调用 跨域泛化

StarHarness 可联合演化提示与任务框定、工具接口、技能、MCP 服务、子代理结构及代理循环配置。框架依据基线失败行为对任务分层,以构建紧凑的演化池,并将提议器可见的搜索任务与隐藏的筛选任务分开,同时保留留出任务评估泛化。在 ITBench SRE、EnterpriseOps-Gym ITSM 和 AutomationBench Finance 上,每个环境仅接受4至12项改动,就比默认脚手架提升20至35个百分点。改进可泛化至未参与演化的任务,并能在 GPT 与 Qwen 模型家族之间免重新演化迁移;轨迹分析表明收益主要来自接口修复、环境惯例和压缩搜索的操作知识。

[合并自 2026-09-01 starharness] StarHarness可联合演进提示与任务表述、工具接口、技能、MCP服务提供方、子智能体结构及智能体循环配置,而不修改模型权重。框架依据基线失败行为对任务分层,区分提议器可见的搜索任务与隐藏的选择任务,并使用留出任务评估泛化能力。在ITBench SRE、EnterpriseOps-Gym ITSM和AutomationBench Finance上,每个环境仅接受4~12项改动,完整基准性能便较默认脚手架提高20~35个百分点。改进可迁移至未参与演进的任务以及GPT、Qwen模型家族,轨迹分析表明收益主要来自接口修复、环境惯例和压缩搜索空间的运维知识。

用途与启示
  • 为固定权重模型提供一种低成本的环境适配路径,无需重新训练即可缓解模型与企业工具环境之间的长期错配。
  • 可将失败样本分层、搜索与隐藏筛选隔离、留出集验证等设计用于降低脚手架演化的过拟合风险。
  • 提示、工具接口、技能、子代理和循环配置可作为统一的联合搜索空间,适合 SRE、ITSM、金融自动化等工具密集型业务。
  • 跨 GPT 与 Qwen 的迁移结果说明,优质脚手架能够沉淀相对独立于底座模型的环境知识和操作规范。

[合并自 2026-09-01 starharness]

  • 为工具密集型企业智能体提供无需微调模型的环境适配方案。
  • 通过搜索任务、隐藏选择任务和留出任务的隔离,降低脚手架对演进样本过拟合的风险。
  • 可将接口修复、企业环境惯例和领域操作知识沉淀到脚手架中,减少误诊并缩短执行轨迹。
  • 跨模型迁移结果表明,环境专用脚手架可以作为独立于基础模型的可复用优化资产。
📝 原始笔记(逐字保留)
标题:StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments 来源:arXiv 链接:https://arxiv.org/abs/2608.24804 摘要:We present StarHarness, a framework for evolving environment-specific agent harnesses while keeping model weights fixed. The evolved harness can include prompt and task framing, tool interfaces, skills, MCP-backed providers, subagent structure, and agent-loop configuration. StarHarness constructs a compact evolution pool by stratifying tasks according to baseline failure behavior, separates proposer-visible search tasks from proposer-hidden selection tasks, and reserves held-out tasks for evaluating generalization. Across ITBench SRE, EnterpriseOps-Gym ITSM, and AutomationBench Finance, harness evolution improves full-benchmark performance by 20-35 percentage points over the default harness after 4-12 accepted changes per environment. These gains persist on tasks excluded from evolution an [合并自 2026-09-01 starharness] [StarHarness:通过分层搜索为企业环境演进测试框架(17 ▲)](https://huggingface.co/papers/2608.24804?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-08-31)

CAFE:搜索智能体与反馈批评器协同进化

CAFE让共享参数模型交替扮演搜索智能体与批评器,通过在线强化学习和离线偏好优化协同提升检索决策、轨迹纠错与反馈质量。

 智能体 开放式搜索 协同演化 经验反馈 强化学习 自我改进

CAFE将纠正性反馈视为搜索轨迹中的可学习干预,使智能体学习何时请求及采用反馈,批评器则从受最终结果混杂的轨迹中推断有效修正。框架先围绕基础智能体自身的失败轨迹训练反馈条件下的恢复能力,再联合在线与离线优化。在线阶段利用调用反馈与跳过反馈的成功率差塑造请求回报,并对反馈前后的 token 优势进行重加权;离线阶段则从匹配的成功和失败轨迹中构造偏好数据来优化反馈。七个智能体搜索基准显示,CAFE平均优于所评估的强化学习搜索智能体,在六个域外基准上保持增益并减少答案级幻觉;仅单独提升智能体或批评器会趋于平台,而交替更新可持续改进。

用途与启示
  • 将反馈从训练后的静态监督转化为运行中的纠错动作,可在错误累积前重定向搜索轨迹。
  • 智能体策略持续变化时,批评器也应随之更新,避免固定反馈模型因失败分布漂移而失效。
  • 可借鉴调用与跳过反馈的反事实成功差,为智能体是否请求反馈建立更准确的信用分配。
  • 在线轨迹优化与离线成功/失败偏好学习相结合,为构建可持续自我改进的搜索智能体提供了通用范式。
📝 原始笔记(逐字保留)
标题:CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 来源:arXiv 链接:https://arxiv.org/abs/2608.24794 摘要:Outcome-supervised search agents learn when and how to retrieve evidence, but terminal rewards neither localize intermediate errors nor redirect an ongoing trajectory before those errors compound. Treating corrective feedback as a learned in-trajectory intervention couples the two roles: the agent must decide when to request and use feedback, while the critic must infer useful corrections from outcome-confounded rollouts whose failure patterns shift as the agent improves. We introduce CAFE (Coupled Agent--Feedback Evolution), a framework in which a shared-parameter model alternates between search-agent and critic roles. CAFE initializes feedback-conditioned recovery from trajectories built around the base agent's own failures, then couples online and offline optimization. During online RL,

正确诊断,装饰性推理:医疗思维链扰动审计

研究通过临床扰动审计发现,14个大模型的医疗思维链普遍与答案决策解耦,可见推理更像事后说明而非真实诊断依据。

 临床推理 医疗人工智能 解释忠实性 过程评估 反事实实验 推理链-答案解耦

研究提出包含30种算子的医疗思维链扰动审计,同时修改推理链与问题,涵盖病情严重度反转、否定翻转、人口属性替换和证据消融等操作。作者在4个医疗问答基准、14个大模型上联合分析思维链是否更新及答案是否翻转,并以链路解耦率(CDR)划分失败模式。面对具有临床意义的破坏性编辑,模型整体CDR达到72.9%,且破坏思维链或移除CoT提示均未显著降低准确率。两名认证临床医生复核197个扰动问题,确认其中98.5%的原金标准答案仍具可辩护性;该解耦现象跨模型规模、医疗或推理微调方式持续存在。

用途与启示
  • 提醒医疗大模型评测不能将表面连贯的CoT直接视为模型真实采用的诊断依据。
  • 可使用CDR及“思维链更新×答案翻转”联合指标,区分推理链失敏、答案固着等不同失败模式。
  • 为临床AI验收提供面向医疗风险的反事实扰动测试,重点检查否定、严重度、人口属性和关键证据变化是否被模型正确吸收。
  • 在高风险场景中,应将CoT定位为待审计的说明文本,并结合答案稳定性、证据引用和临床专家复核验证其忠实性。
📝 原始笔记(逐字保留)
标题:Right Diagnoses, Decorative Reasoning:A Perturbation Audit of Medical Chain-of-Thought 来源:arXiv 链接:https://arxiv.org/abs/2608.24790 摘要:Clinicians read chain-of-thought (CoT) rationales as evidence of medical reasoning, but whether the visible chain plays that role is rarely tested. General-domain CoT-faithfulness probes ignore clinical cost, and medical LLM evaluations treat the chain as a black box. We close this gap with a medical perturbation audit: a 30-operator battery edits both the chain and the question with clinically motivated operators (severity reversal, negation flip, demographic swap, evidence ablation), paired with a chain-update times answer-flip joint analysis that classifies each model by its failure mode. Applied to 14 LLMs on four medical QA benchmarks, three independent tests converge: the Chain-Decoupling Rate (CDR; chain does not register the edit and the answer does not flip) is 72.9% panel-wide on

AtlasNav:持久语料导航缓解智能体证据盲视

AtlasNav通过一次性构建可复用的多视图语料图谱,将有限预算下的直接语料交互转化为持久导航,减少证据在发现、打开和片段定位各阶段的静默流失。

 智能体 开放式搜索 证据可见性 检索增强生成 工作空间 证据盲视 语料库导航 持续导航

论文提出“证据盲视”(Evidence Blindness),描述智能体在有限交互预算下未发现证据、未打开支持文档或未定位决定性片段的渐进式静默损失,并以分阶段证据实现率加以量化。AtlasNav预先将完整语料组织为可复用的多视图 Corpus Atlas,使不同查询能够自适应导航,而不必重复在线重建查询相关工作空间。在 BrowseComp-Plus 上,该方法取得 92.05% 的严格准确率,并相较此前动态工作空间方法降低 30.21% 的在线推理成本。在 PhantomWiki 的 1 万至 100 万规模实验及异构企业知识场景中,该表示原则也表现出扩展性和迁移能力。

用途与启示
  • 为智能体搜索系统提供分阶段证据诊断框架,区分“未发现、未打开、未定位片段”等失效环节。
  • 提示企业知识库应预先构建可复用的语料结构,以减少每次查询动态重建工作空间的成本。
  • 可用于优化有限工具调用或推理预算下的搜索路径,使关键证据更早、完整地被智能体利用。
  • 说明语料是否可访问并不足够,语料表示和导航结构同样决定智能体搜索效果。
📝 原始笔记(逐字保留)
标题:Evidence Blindness in Direct Corpus Interaction: Persistent Navigation with AtlasNav 来源:arXiv 链接:https://arxiv.org/abs/2608.24764 摘要:Large language model agents are moving beyond conventional retrieval-augmented generation toward direct interaction with external corpora. Direct Corpus Interaction (DCI) keeps the full corpus accessible, yet reachable evidence can remain unusable under finite interaction budgets. Required evidence may fail to surface, a surfaced supporting document may remain unopened, or an opened document may fail to expose its decisive fragment. We call this progressive silent loss Evidence Blindness and quantify it through stage-wise evidence realization. Within the DCI paradigm, raw interaction adds little reusable corpus organization, while dynamic-workspace methods reconstruct a query-conditioned interaction space from each query and trajectory. In both cases, useful structure is recovered largely

SkillForge:面向强化学习智能体的可验证技能演化

SkillForge通过显式技能调用、证据驱动验证和多路径技能归纳,使强化学习智能体能够跨回合持续积累、检验并优化可复用技能。

 技能演化 智能体技能库 强化学习 智能体 经验复用 技能验证 技能诱导

SkillForge针对传统强化学习智能体难以跨回合积累知识,以及既有技能库只增不验的问题,提出持续技能演化框架。框架在交互过程中显式建模技能调用,使强化学习能够联合优化环境动作与技能选择决策。其证据驱动的技能验证机制会依据环境交互结果评估和修正已有技能,多路径技能归纳则负责扩展技能库并维持质量。在ALFWorld、WebShop和AppWorld上的实验中,SkillForge持续优于SkillRL,表明经过持续验证的技能可提升LLM智能体能力。

用途与启示
  • 为长程智能体构建可维护的技能库,避免无效或过时技能长期累积。
  • 将技能调用纳入强化学习动作空间,可联合优化任务执行策略与经验复用方式。
  • 证据驱动的验证机制可用于技能治理、质量过滤和失败技能修复。
  • 多路径技能归纳为从不同成功轨迹中提炼、合并和扩展技能提供了通用思路。
📝 原始笔记(逐字保留)
标题:SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents 来源:arXiv 链接:https://arxiv.org/abs/2608.24747 摘要:Large language model (LLM) agents are trained with reinforcement learning (RL) for complex decision-making tasks. However, most RL-trained agents remain episodic and cannot accumulate reusable knowledge across episodes. Recent skill-based approaches, such as SkillRL, attempt to address this issue by extracting skills from raw trajectories, but treat the skill bank as an append-only repository without verifying whether stored skills remain effective. In this paper, we propose SkillForge, a framework for continuous skill evolution that enables skills to be verified and refined through environment interaction. By making skill usage explicit during agent interaction, RL can directly optimize both environment actions and skill invocation decisions. SkillForge further introduces evidence-based s

米哈游公布UE5写实奇幻新作《源初之结》

米哈游在2026科隆游戏展开幕夜首次公开UE5写实奇幻多人合作动作游戏《源初之结》(Nodusfall),标志着其产品线进一步走出二次元舒适区。

 人工智能 游戏产业 写实游戏 多人协同对战

《源初之结》是一款以多元神话和末世世界为背景的多人合作动作游戏,海外名称为 Nodusfall,玩家将组队挑战巨龙、泰坦等大型神话生物。新作采用UE5与写实暗黑奇幻风格,突出开放世界、多人联机、大型Boss战及全地形战斗,与米哈游以往的二次元卡通渲染产品形成明显差异。该项目此前已通过招聘信息、商标申请和全球测试广告留下线索,此次在2026科隆游戏展开幕夜正式亮相并进入公开宣发阶段。官网现已开放预约并启动全球测试招募,但正式上线日期尚未公布。

用途与启示
  • 观察米哈游从二次元RPG向写实奇幻、多人共斗等新品类扩张的产品战略。
  • 关注UE5开放世界、大型Boss与多人协作机制在高规格游戏中的落地效果。
  • 可将后续测试反馈用于评估米哈游跨画风、跨品类研发及全球化发行能力。
📝 原始笔记(逐字保留)
标题:米哈游半夜发布新游戏!3A写实大制作,logo一出现都不睡了 来源:量子位(微信公众号) 链接:http://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247915217&idx=2&sn=4862ccb4ab5707c111919534cdc3ccb2&chksm=e925be612b2717d7c52775f9df1696823d2a679b768b4dd335639b6b613c7acdc596ed4ddb6a&scene=0&xtrack=1#rd 摘要:

Shopify CEO质疑Claude Code不兼容AGENTS.md

Shopify CEO认为Claude Code仅采用CLAUDE.md等专属配置会使大型多工具团队承担规则同步成本,并考虑在其兼容AGENTS.md前停止使用。

 人工智能辅助编程 智能体兼容性 接口错配 文档工程 配置供应 智能体规范 配置同步

Shopify CEO Tobi Lütke 表示,可能在公司内部禁用 Claude Code,直到其支持 AGENTS.md、.agents/skills 等通用配置入口。Claude Code 当前主要读取 CLAUDE.md 和 .claude/skills,而 Codex、Cursor、Amp 等工具支持 AGENTS.md,可能导致同一仓库中的不同代理获得不一致的项目规则。软链接、文件引用和同步脚本可以暂时缓解问题,但在拥有数千名开发者的大型 monorepo 中会形成持续的维护复杂性。Claude Code 团队承认多套配置带来的额外成本,并表示正在提高产品灵活性,短期内可通过在 CLAUDE.md 中引用 @AGENTS.md 复用规则。

用途与启示
  • 提醒大型研发团队统一AI编程代理的仓库级指令来源,避免工具差异造成编码、测试和操作规范漂移。
  • 可在引入新代理前测试其对目录继承、技能文件和通用配置格式的兼容性。
  • 短期可使用引用或自动同步机制,长期则应推动跨工具的代理配置标准与一致性检查。
  • 评估AI编程工具时,应将配置维护成本和团队协作复杂度纳入采购与准入标准。
📝 原始笔记(逐字保留)
标题:Shopify CEO考虑禁用Claude Code,因其不兼容AGENTS.md 来源:机器之心(微信公众号) 链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651052471&idx=2&sn=e243403e1ae25a94cb0822e80332c0fc 摘要:
0%