2026-08-31 科研追新
当日精选(由提交工具自动创建)。
Claude Chat与Cowork打通共享记忆
Anthropic打通Claude Chat与云端Cowork的长期记忆,使聊天与任务执行共享可查看、编辑和删除的用户上下文。
- Claude Chat与云端Cowork开始共用记忆,Chat中积累的项目、偏好和协作对象等上下文可直接用于任务执行,Cowork产生的新信息也会回流至Chat。
- 记忆以按话题组织的Topics形式持续更新,用户可在设置中查看、修改、删除、暂停或彻底重置,并为不同项目维护相互隔离的记忆空间。
- 系统采用分层存储策略:常规工作上下文默认保存,健康、宗教和性别认同等敏感信息需主动开启,证件号码、金融账户等高风险信息永不保存。
- 共享机制目前仅适用于云端Cowork,不覆盖本地会话;组织管理员关闭记忆可能永久删除全组织条目,而删除原始对话不会自动清除已生成的记忆。
- 展示长期记忆如何从聊天功能升级为贯穿智能体任务执行的基础上下文层,降低跨场景协作的冷启动成本。
- 为记忆系统设计提供可借鉴的治理机制,包括项目隔离、条目可编辑、敏感信息分级和组织级权限控制。
- 提醒开发者将原始对话与派生记忆分别纳入数据生命周期管理,避免用户误以为删除会话即可清除全部信息。
- 表明智能体产品竞争正从单次任务能力转向持续理解用户、复用经验及降低迁移成本。
📝 原始笔记(逐字保留)
OpenAI Astra 一次生成类 GTA 游戏
消息称 OpenAI Astra 可一次生成类 GTA 游戏,展示了生成式 AI 在开放世界游戏内容构建方面的潜力。
消息标题指出,OpenAI Astra 能够一次生成类似《GTA》的游戏。该演示涉及生成式 AI 在游戏场景、内容与交互体验构建中的应用潜力。链接抓取正文未提供模型架构、生成流程或评测结果等进一步技术细节。
- 关注生成式模型从单一素材生成向完整可交互游戏生成的发展趋势。
- 可用于观察 AI 在游戏原型制作、场景生成和开发成本降低方面的应用潜力。
- 后续需核实 Astra 的具体技术方案、可玩性、生成一致性及是否支持持续交互。
📝 原始笔记(逐字保留)
AI4AI:强模型自动构建 Harness 向弱模型迁移能力
Salesforce AI 与 UIUC 提出 Strong-to-Weak Scaffolding,让强模型在测试时自动设计 Harness,将任务结构外化为程序、规则与状态表示,无需训练即可显著提升弱模型能力。 [合并自 2026-08-31 ai4ai-harness] Salesforce AI 与 UIUC 提出 Strong-to-Weak Scaffolding,让强模型自动为弱模型构建外部 Harness,在不更新参数的情况下通过规则、程序和状态管理显著提升其推理能力。
智能体脚手架演化 能力迁移 自进化 推理 人工智能辅助编程 智能体脚手架 自我改进
- Builder AI 在少量验证样本和智能体编程环境中分析 Target AI 的错误,自动构建包含任务路由、结构化抽取、确定性求解器、状态追踪及答案校验的 Harness,再在隐藏测试集上评估。
- GPT-5.4-mini 的四项心智理论任务平均准确率由 0.488 提升至最高 0.912,57 次自动脚手架构建均超过裸模型,并优于多个未经 Harness 增强的强模型。
- 性能提升主要来自认知负担外移:外部代码与规则承担工作的比例和准确率显著相关(r=0.72),而代码量本身的相关性较弱(r=0.22)。
- 可形式化的状态追踪与固定逻辑最容易被编译进 Harness,开放社会推理、深层信念递归和 Bayesian goal inference 等任务仍依赖模型本身的理解能力。
[合并自 2026-08-31 ai4ai-harness] 研究让强大的 Builder AI 在少量验证样本和智能编程环境中,为较弱的 Target AI 自动设计 Harness,并冻结后在隐藏测试集上评估。Harness 可组合任务路由、结构化输入输出、确定性求解器、显式状态追踪和答案校验,将适合形式化的认知负担外包给代码与工作流。GPT-5.4-mini 的四项心智理论任务平均准确率由 0.488 最高提升至 0.912,57 次自动脚手架构建实验均超过裸模型基线。结果显示,性能与被外部规则直接承担的工作比例显著相关,而与代码量或迭代次数关系较弱;开放社会推理和深层信念递归等任务仍难以完全规则化。
- 展示无需更新模型参数的强弱能力迁移路径,可用强模型的一次性元推理替代弱模型在每道题上的重复高成本推理。
- 为小模型部署提供系统优化思路:优先将稳定、机械、可验证的认知步骤外化为程序、规则、工具和显式状态。
- 提示 Harness 设计应以任务结构识别和认知负担分配为核心,而非简单增加思维链长度、采样次数或代码规模。
- 说明脚手架收益取决于目标模型的能力余量;对已有能力较强的模型,过度约束的 Harness 也可能成为性能瓶颈。
[合并自 2026-08-31 ai4ai-harness]
- 展示一种无需训练或修改权重的强到弱能力迁移路径,可用强模型的一次性元推理降低弱模型长期运行成本。
- 提示智能体系统应主动识别可形式化的任务结构,将机械推理编译为工具、状态机、规则和确定性程序。
- Harness 的效果取决于目标模型的能力缺口,部署时需防止过度约束较强模型,并针对不同模型单独优化脚手架。
- 可将隐藏测试、有限验证预算和冻结 Harness 的实验设置用于评估自动脚手架的泛化能力,避免验证集过拟合。
📝 原始笔记(逐字保留)
Meta^n:通过涌现深度实现递归自我改进
Meta^n 通过固定通用元操作递归处理求解轨迹与代码,以收敛性决定改进深度,并在八个模型家族及 ARC-AGI-2 上展现出优于既有自我改进智能体的表现。
Meta^n 使用固定的通用元操作 Ω,递归读取求解器运行轨迹及其生成代码,并构建下一层处理程序与可调用辅助函数库。固定元操作保障系统稳定,而持续增长的输入使后续层能够从更高元层级审视和改进此前过程。系统不预设递归深度,而是以收敛性作为停止依据,并通过演化档案搜索有效的图层链。实验显示,该方法在八个模型家族中均优于既有自我改进智能体,并成为 ARC-AGI-2 上唯一取得非零分数的系统;消融实验还表明,跨层条件传递是性能提升的主要来源,图层角色会随深度自然涌现。
- 将优化对象从最终答案扩展至生成答案的程序、轨迹和辅助工具,为智能体递归改进提供通用框架。
- 以固定元操作配合递归增长的输入,在维持稳定性的同时突破传统元系统约两层的深度限制。
- 可借鉴演化档案与收敛停止机制,构建无需预设深度的开放式智能体脚手架搜索流程。
- ARC-AGI-2 结果表明,该方法可能获得超越技能记忆的过程改进能力,适合用于检验真正的任务泛化。