2026-08-23 科研追新
当日精选(由提交工具自动创建)。
FreeToken:单卡消费级 GPU 高效运行满血 MoE 大模型
FreeToken 通过带宽自适应 CPU-GPU 调度、双缓冲预取和 Agent 状态复用,让消费级单卡配合大容量内存以交互速度运行完整 MoE 大模型。
端侧部署 混合专家模型 推理加速 异构计算 系统优化 状态复用 边缘推理 带宽调度 弹性显存管理
FreeToken 是 UC Berkeley、MIT 等机构联合推出的开源边缘端 MoE 推理系统,可让 RTX 4060 运行 Qwen3.6-35B,并让 RTX 5090 配合约 192GB 内存运行 284B 参数的 DeepSeek-V4-Flash。系统利用全层双缓冲,在 GPU 计算当前层时通过 PCIe 预取下一层专家权重,并根据实时总线带宽和 CPU 算力动态分配专家计算。其 Token 边界检查点与状态复用机制面向 Coding Agent 的上下文追加场景,可使后续多轮交互的首 Token 延迟降低 65%—80%。当显存被其他程序占用时,系统还能在线缩减 GPU 专家缓存、将计算转移至 CPU,实现不中断的弹性降级。
- 降低超大规模 MoE 模型本地部署的 GPU 显存与数据中心基础设施门槛。
- 为 Agent 的多轮工具调用和长上下文编辑提供低成本增量 Prefill 方案。
- 展示将 CPU、内存、PCIe 与 GPU 统一调度,可显著改善权重卸载的吞吐和首 Token 延迟。
- 为个人工作站上的私有化 AI 编程、研究代理和离线推理应用提供工程基础。
📝 原始笔记(逐字保留)
匿名模型 Ox Alpha 刷屏,代码能力逼近头部模型
OpenRouter 匿名模型 Ox Alpha 凭借百万 token 上下文、多模态与较强真实仓库编码能力引发关注,多项技术线索指向智谱 GLM-5.x,但其身份尚未得到官方确认。
模型开发 人工智能辅助编程 长上下文 多模态 工具调用 模型谱系 匿名评估
Ox Alpha 近日匿名上线 OpenRouter,提供 100 万 token 上下文,支持文本、图片、视频输入和工具调用,目前可免费使用。开发者将其接入编码 Agent 后,在一组 10 项 DeepSWE 真实软件工程任务中完成 8 项,另一组子集测试约为 63%,但受样本量和运行配置差异影响,暂不能据此确定排名。视频 token 消耗、文本 tokenizer、音频拒绝方式及 Agent 行为等线索均与智谱 GLM 系列高度接近,因此外界猜测它可能是 GLM-5.3 Flash 或其多模态版本。与此同时,Code Arena 还出现了身份未明的 korrine,显示匿名“挂马甲”测试正成为厂商发布前收集真实反馈、压力测试服务并制造市场讨论的常见方式。
- 可将匿名上线与真实仓库 Agent 测试作为新模型发布前的能力验证和服务压力测试手段。
- 评估编码模型时应扩大任务样本,并统一 Agent、工具、预算和运行配置,避免依据小规模结果下结论。
- 视频编码器 token、tokenizer 差异和工具调用轨迹可用于推测匿名模型谱系,但不能替代官方确认。
- 百万 token 上下文与多模态输入为长程软件工程任务提供潜力,仍需重点检查循环、跑偏及工具调用可靠性。
📝 原始笔记(逐字保留)
英伟达 AVO 在 ARC-AGI-3 通关 183 关并获满分
英伟达 AVO 通过持久记忆与监督器构成的模型外层 harness,使 Claude Opus 5 在 ARC-AGI-3 中以 6624 步通关全部 183 个关卡,并展示了同一长程自主架构跨游戏推理与 GPU 算子优化的迁移能力。
智能体 长程任务 状态持久化 过程监督 算子优化 经验学习 工具调用 进化搜索 盲编程 进化策略 世界模型评估
AVO 在 ARC-AGI-3 的 25 个陌生游戏环境中通关全部 183 个关卡,以 6624 步取得 100.00% RHAE,而 Claude Opus 5 单独参评时仅得 30.16%。系统不修改底层模型,主要依靠持久记忆跨上下文保存实现版本、评测结果与推理状态,并由轨迹监督器识别停滞或循环行为、推动策略切换;整个评测仅使用精确的 64×64 文本网格而非图像输入。AVO 最初面向 GPU 算子的自主进化搜索,可查阅 CUDA/PTX 文档、运行测试与 profiler、诊断故障并生成下一版内核,在 B200 上连续探索超过 500 个优化方向,其注意力内核据称最多超过 cuDNN 3.5%、超过 FlashAttention-4 10.5%。从算子优化迁移到像素游戏时,其核心循环基本不变,体现出长程能力更多来自记忆、工具、反馈和失败恢复共同组成的系统,而非模型本身。
- 说明提升智能体长程任务能力时,harness、持久状态、工具反馈和停滞检测可能比单纯更换基础模型更关键。
- 为 LogicEvolve 等自主演化系统提供可复用范式:提出假设、执行试验、保存证据、诊断失败,并支持回退与策略重定向。
- 展示通用智能体架构的跨领域迁移潜力,同一自主搜索循环可同时服务于陌生游戏探索和 GPU 内核优化。
- 提示评测应区分基础模型与外部脚手架的贡献,并记录步数、工具调用、恢复能力及跨上下文状态等系统级变量。
📝 原始笔记(逐字保留)
AxiomProver用Lean 4完成“246定理”形式化验证
Axiom Math的多智能体系统AxiomProver将素数间隙“246定理”的人类证明转化为Lean 4代码,并完成机器可检查的形式化验证。
形式化验证 自动定理证明 多智能体系统 证明合成 过程验证 素数间隙
AxiomProver并未发现新的素数定理,而是将Maynard、陶哲轩及Polymath8b团队推进的“无穷多素数对间距不超过246”证明形式化,并由Lean 4检查其逻辑正确性。系统由Auto-formalizer、Conjecturer、证明路径搜索引擎和Auto-informalizer组成,可补齐论文跳步、生成中间引理并将机器证明转回自然语言。形式化证明共14章、132页,覆盖GPY方法、多维筛及关键不等式 M₅₀,₁/₂₅ > 4.0043,最终仅将Bombieri–Vinogradov定理和带误差项的素数定理作为外部依赖。验证代码以PrimeGapsTheory和PrimeGapsCert两部分开源,用户可在本地复核运行结果。
- 展示多智能体系统将复杂自然语言数学证明转化为可执行形式证明的可行路径。
- 为自动补引理、证明搜索、自然语言与Lean代码双向转换等研究提供大型真实案例。
- 说明AI的近期高价值方向不必局限于创造新数学,也可聚焦对既有成果的严格验证。
- 形式化验真能力可迁移到金融、医疗和密码学等关键软件的代码正确性审查。
📝 原始笔记(逐字保留)
深势科技发布玻尔·科学空间,AI贯通科研全流程
深势科技发布玻尔·科学空间公开测试版,以学科智能体、科研工具和实验资源支撑从调研、假设与验证到写作审查的端到端科研工作流。
科研工作台 自动化科学研究 闭环科学研究 科学智能 实验执行 湿实验 智能体
玻尔·科学空间是面向科研人员与AI科学家协作的桌面端环境,研究者主要负责提出问题和确认关键结果,系统负责检索、规划、计算、分析与成果整理。平台内置SciMaster、BioMaster、PharmMaster和MatMaster等智能体,覆盖生物医学、药物研发和材料科学等真实任务。其底层连接超过2亿篇文献与专利、5万余个科学计算工具,并通过SciX框架、隔离可恢复的Sandbox及Uni-Lab-OS组织长程计算与湿实验执行。平台还提供论文写作、引用与数据审查能力,并借助真实任务反馈沉淀可复用流程,推动工具、智能体和科研人员协同进化。
- 为科研团队提供统一工作台,减少跨数据库检索、环境配置、软件切换和结果整理的成本。
- 将文献证据、实验设计、计算资源与湿实验设备纳入可追溯、可恢复的端到端科研闭环。
- 通过学科智能体执行可检查的长程任务,让科研人员把精力集中在问题选择、机制判断和关键决策上。
- 将成功流程、参数及失败经验沉淀为组织资产,为自主科研系统的持续学习与能力复用提供基础。
📝 原始笔记(逐字保留)
DeepSeek V4 Pro 与 Harness:后训练、缓存经济学及代理自进化
文章通过模型对比、编码实验、92 万 token 长上下文测试及近 20 万行 Harness 源码分析,解读 DeepSeek V4 Pro 的后训练提升、成本策略与代理自进化框架设计。
后训练 人工智能辅助编程 智能体 智能体脚手架 前缀缓存 长上下文
DeepSeek V4 Pro 在 Terminal Bench、DeepSWE 等代理式任务上较 Preview 大幅提升,作者据此推测其重新进行了面向任务闭环的后训练,但官方并未明确证实。其 1M 上下文由 64K 基础窗口借助 YaRN 外推而来,实测在约 92 万 token、最深约 90.2 万 token 的位置仍能准确召回信息,不过官方建议在 768K 时自动压缩。V4 Pro 的 token 单价偏高,但因任务路径较短且缓存命中率可达 93%~98%,单任务总成本仍具竞争力。Harness 在工具目录稳定、超长工具结果裁剪、内容落盘和输出限长等环节系统性维护前缀缓存,体现了以更少计算和上下文完成可靠代理任务的产品思路。
- 为评估代码代理模型提供“单任务总成本”而非单纯 token 单价的分析视角。
- 提示 Harness 与模型后训练高度耦合,替换第三方框架可能因提示词、工具协议和运行策略错配而导致能力下降。
- 长上下文应用可借鉴 768K 提前压缩、稳定请求前缀及大结果落盘等工程策略。
- 展示代理框架如何通过缓存约束、上下文治理和明确验收标准,为持续改进与代理自进化打基础。
📝 原始笔记(逐字保留)
Harness Continual Learning:让冻结模型通过脚手架持续学习
Harness Continual Learning 通过联合演化任务接口、经验记忆、能力地图和自适应路由,并以历史锚点回归测试门控更新,使冻结大模型在积累新能力的同时抑制脚手架级遗忘。
持续学习 智能体脚手架 脚手架遗忘 架构演化 经验复用 智能体脚手架演化
论文提出 Harness Continual Learning(HCL),将持续学习的对象从模型参数扩展到大模型外围的任务接口、经验记忆、能力地图和自适应路由,并对四类组件进行联合版本控制。系统先由 Continual Optimizer 根据任务反馈生成候选 Harness,再由 Continual Evaluator 检查当前任务增益、历史锚点退化数量及格式与执行合法性,全部达标后才提交更新。该机制将模型参数保持冻结,却能降低提示、记忆或路由变化造成的脚手架级遗忘,并通过历史损失预算调节稳定性与可塑性的权衡。实验覆盖 ALFWorld、Minecraft、文本推理和多模态感知任务流;文中报告 HCL 相对冻结模型基线获得超过 10% 的性能增益,并在 Minecraft 课程中完成全部 50 项任务。
- 为无法频繁微调底座模型的智能体提供一种通过外围 Harness 持续积累能力的路径。
- 可将历史锚点与准入门控引入智能体更新流程,把提示、记忆、技能和路由变更纳入类似软件回归测试的治理机制。
- 四元组联合版本控制有助于定位组件间依赖,支持候选更新隔离、失败回滚和稳定部署。
- 历史锚点只能保护已覆盖行为,实际应用仍需持续扩充代表性测试集,并审计未覆盖任务上的潜在退化。
📝 原始笔记(逐字保留)
Harness成为AI规模化落地新战场
DeepSeek、阿里、MiniMax等厂商密集推出Harness产品,试图以可审计、可复现、可回滚的执行框架推动Agent稳定进入企业生产流程。
智能体执行框架 智能体 智能体脚手架 人工智能辅助编程 业务集成
Harness正从工作流编排、提示词管理和模型评估工具,演变为连接大模型与Agent应用的“工程外壳”,形成“Model + Harness = Agent”的产品逻辑。DeepSeek、阿里Qoder和MiniMax等厂商相继开源或发布相关产品,并围绕开发者生态、企业场景和商业化入口展开竞争。其核心价值是沉淀可复用记忆与标准化执行链,使AI任务具备可审计、可复现、可追踪、可回滚和可管理能力。当前产品仍存在运行不稳定、配置复杂、复用性不足及评估标准缺失等问题,能否结合真实业务数据形成通用标准将决定其落地价值。
- 可将Harness视为模型能力产品化与Agent工程化之间的关键基础设施。
- 企业落地时应重点评估执行稳定性、审计追踪、状态回滚、配置成本和长期运行成本,而非只比较模型榜单性能。
- Harness研发可围绕可复用任务模板、记忆沉淀、工具编排、过程观测和失败恢复建立统一标准。
- 需要设计可复现的Harness评测体系,控制模型、Token预算和任务环境等变量,避免将脚手架增益误判为模型能力提升。
📝 原始笔记(逐字保留)
Agent-Reach:一句话部署智能体全网访问工具
Agent-Reach以统一调度层为命令行智能体接入多个内容平台,并提供自动安装、故障换路、连通诊断和本地凭证管理能力。
智能体 工具调用 自动化部署 信息源路由 配置安全 网页智能体 平台集成 全网检索
Agent-Reach面向Claude Code、Cursor、Windsurf等可运行命令行的智能体,统一接入YouTube、Twitter、Reddit、GitHub、B站和小红书等平台。项目底层调度yt-dlp、OpenCLI、bili-cli等开源工具,并在接入渠道失效时主动切换备选路由。用户可通过一句安装指令自动配置CLI、系统依赖、MCP语义搜索和智能体技能指南,再用agent-reach doctor检测各平台连通状态。Cookie与Token仅保存在本地配置文件中,卸载时可同步清理配置、技能文件及MCP注册项。
- 为研发智能体快速补充网页、社区、视频、播客及社交平台的信息获取能力。
- 用统一调度层屏蔽不同平台的工具选型、环境配置和接口失效问题,降低维护成本。
- 可作为深度调研、舆情追踪、视频字幕提取和跨平台资料汇总的联网基础设施。
- 涉及登录态平台时宜使用低权限或独立账号,并审查本地Cookie、Token及第三方CLI的安全性。
📝 原始笔记(逐字保留)
OriginFlow以神经肌电构建具身智能Human Tokens
OriginFlow通过非侵入式肌电腕带融合视觉与IMU信号,将人类姿态、接触力和肌腱发力编码为Human Tokens,为具身模型提供可跨机器人本体迁移的物理交互数据。
具身智能 主动数据采集 多模态 状态表征 能力迁移 数据策展 神经接口 肌电感知 动作表征
- OriginFlow提出NeuroScale体系,以16通道表面肌电腕带OriginKit Gen 1.0为入口,联合第一视角视觉和IMU持续采集人类自然操作数据。
- PULSE基座模型从多模态信号中重建Motion Space、Tactile Space和Tendon Space,将运动、接触与驱动力整理为机器可学习的Human Tokens。
- 其技术目标包括低干扰地扩大Human Data规模,以及借助多样化机器人数据建立对齐锚点,实现人与不同机器人之间的跨本体迁移。
- 配套Data Infra使用ORACLE自动标注动作、力和任务片段,并由CHORD完成肌电、视觉、语言及机器人状态的时序与表征对齐,再通过真机评测筛选有效数据。
- 为具身智能补充传统遥操作、第一视角视频和仿真数据难以直接观测的肌肉激活、驱动力与细粒度接触信息。
- 将动作离散或压缩为统一Physical Tokens,可能成为训练通用机器人基础模型的新型数据接口。
- 跨本体共享表征可降低人类示范向不同自由度、不同驱动结构机器人迁移的成本。
- 规模化落地仍需验证个体校准、运动伪迹抑制、动作与力标注、隐私治理及真机任务收益。