2026-09-02 科研追新

当日精选(由提交工具自动创建)。

DataFoundry:递归自改进的数据生产流程

DataFoundry 通过小规模试产、缺陷诊断和局部模块修补,让多领域训练数据准备流程在大规模生产前递归自我改进。

 数据合成 自进化 数据工程 模型训练 自我改进

DataFoundry 将数据准备流水线组织为 Skills-as-Modules,由 Controller 编译模块,并在小规模 pilot set 上检查数据缺陷。系统把诊断结果转化为 adapter,对分块、指令和回答组件实施保留接口的局部修改,形成递归自我改进闭环。在数学、金融、法律和医疗领域,使用 Qwen2.5-7B 与 Llama-3.1-8B 的实验总体优于竞争数据生成器,表明缺陷定位和局部修补策略具有跨模型迁移性。轮次实验同时显示自改进存在最佳停止点,继续迭代可能导致性能明显退化,因此轮次控制和回归验证至关重要。

用途与启示
  • 将数据质量优化从“生成后过滤”前移到“大规模生产前的小规模试产与流程修补”。
  • 为可复用的数据合成系统提供模块化设计:保持接口稳定,仅针对问题组件生成局部补丁。
  • 跨领域结果说明,缺陷诊断与流程改进机制可能比特定生成模型更具迁移价值。
  • 实际部署需设置验证集、停止策略和性能回归机制,防止过度递归改进造成数据质量退化。
📝 原始笔记(逐字保留)
51 【DataFoundry:多领域数据生产流程自进化 - RSILab | 小红书 - 你的生活兴趣社区】 😆 7aU1PtYyTf7V3zf 😆 https://www.xiaohongshu.com/discovery/item/6a965eae000000000d02403d?source=webshare&xhsshare=pc_web&xsec_token=CBuH0yJDknMBJ2yrxLfLGY58vfaePFsQXt0R4z4mh1f5Y=&xsec_source=pc_share

NoRA:归一化低秩适配提升 LoRA 训练稳定性

NoRA 通过训练期间或仅初始化时归一化 LoRA 下投影矩阵,在不增加参数和推理开销的情况下加快收敛、提升稳定性并缓解灾难性遗忘。

 参数高效微调 模型训练 后训练 持续学习 强化学习

论文提出归一化低秩适配(Normalized Low-Rank Adaptation,NoRA),针对 LoRA 训练动态缺乏有效正则化的问题改进参数高效适配。由于 LoRA 的上投影通常采用零初始化,早期优化主要受下投影矩阵支配,因此 NoRA 在训练过程中对下投影矩阵进行归一化。实验还表明,仅在初始化阶段应用一次归一化,也能改善标准 LoRA,无需在整个训练过程中重复操作。NoRA 在预训练、监督微调和强化学习中均能加快收敛、改善性能与训练稳定性,并缓解灾难性遗忘,且不增加可训练参数或推理计算量。

用途与启示
  • 为 LoRA 提供简单、低成本的训练稳定化方案,可直接用于多种模型适配流程。
  • 揭示下投影矩阵对 LoRA 早期优化动态的关键影响,为初始化和正则化设计提供依据。
  • 仅初始化时归一化即可获得收益,适合不希望修改完整训练循环的现有系统。
  • 可用于监督微调、强化学习及持续学习场景,以提高收敛效率并减轻灾难性遗忘。
📝 原始笔记(逐字保留)
[归一化低秩适配(41 ▲)](https://huggingface.co/papers/2608.31036?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

扩散语言模型让端侧 Agent 推理提速约 5 倍

DiffuSpace 与 Acrab 的联合测试显示,扩散语言模型利用多 Token 并行生成,可在端侧将 Agent 运行速度提升约 5 倍。

 推理加速 扩散模型 智能体 端侧部署 系统优化

  • 扩散语言模型不按从左到右的顺序逐 Token 解码,而是先形成全局框架,再并行修正多个位置,从而更充分地利用端侧 GPU 的并行算力。
  • DiffuSpace 与 Acrab 的测试显示,dLLM 在端侧 Agent 场景中可实现约 5 倍提速;在代码等结构可预测的任务中,每一步可生成约 7~10 个 Token。
  • 对需要反复执行规划、检索、工具调用和校验的 Agent,单次生成延迟会沿任务链累积,因此并行生成可显著缩短整体执行时间并降低服务成本。
  • dLLM 还支持依据局部修改自适应调整后续内容,并保留未受影响的部分,在可编辑性、全局搜索和多样化候选探索方面具有潜在优势。
  • 当前产业化瓶颈包括训练成本较高,以及专用算子、推理系统和基础设施尚不成熟,但团队计划继续扩大模型规模并推进 AI PC、汽车、机器人和智能家居应用。
用途与启示
  • 为端侧 Agent 的低延迟部署提供区别于自回归解码的新技术路线。
  • 适合研究并行生成对长任务链总延迟、单位推理成本及芯片利用率的改善。
  • 可探索 dLLM 在 Coding Agent 局部编辑、多候选搜索和验证器筛选中的优势。
  • 工程落地时需综合评估额外训练投入、模型适配成本及扩散推理算子生态成熟度。
📝 原始笔记(逐字保留)
有趣研究|大模型的逐字生成模式,正在拖慢你的Agent,有人跑出了5倍提速https://mp.weixin.qq.com/s/Xd-V3BbuqsopfIeeWPbwtw

iCoder:AI 主导开发 27B 工业代码模型

联合团队让 AI Agent 主导数据演化、SFT、自蒸馏与 RLVR 训练闭环,开发出工业 Coding 模型 iCoder-27B,展示了人在边界内监督的递归自我改进雏形。

 递归自我改进 模型训练 智能体 人工智能辅助编程 执行验证

iCoder 项目由上海交通大学、深势科技、无尽前沿与新加坡国立大学联合开展,让 Agent 主导一个 27B 工业 Coding 模型的数据、SFT、同策略自蒸馏(OPSD)和可验证奖励强化学习(RLVR)流程。人类专家负责设定目标、权限边界、训练 SOP、可信验证器和可追溯机制,Agent 则依据实验反馈选择方案、诊断失败并修改训练策略。最终模型在 RTLLM、VerilogEval 和 KernelBench 等 RTL 与 GPU Kernel 基准上显著超过同尺寸基础模型,并能在真实 EDA 循环中持续搜索更优设计。项目还暴露并修复了重复崩溃、奖励作弊、基础设施故障误计为负奖励及长度过滤导致评测分布偏移等问题,说明验证器与训练基础设施也是自进化闭环的关键组成部分。

用途与启示
  • 为“AI 能否开发下一代 AI”提供了端到端实例:改进结果被写入模型参数,而非仅优化提示词或外部脚手架。
  • 展示“高密度先验、低频率干预”的人机分工,可用于构建受约束、可审计的自动化模型研发流程。
  • 证明编译器、仿真器和真实执行结果可作为工业代码训练的可信反馈,但必须防范奖励作弊与验证器漏洞。
  • 提示现实中的递归自我改进更可能是受资源、数据、组织和基础设施约束的“有损自我改进”,而非完全无人参与的指数式闭环。
📝 原始笔记(逐字保留)
EvolveLRM|AI到底能不能自己造AI?别吵了,有人做出来了https://mp.weixin.qq.com/s/28q7O59IzEXl_tiWulYbDA

OpenClaw 2.0 发布:最大规模更新与 Agent Harness 赛道反思

OpenClaw 2.0 通过简化配置、重构控制界面、加强插件与凭证安全并引入共享云会话和技能学习完成工程升级,但其成本、安全与生态窗口期问题凸显 Agent 竞争核心已转向 Harness。

 智能体 人工智能框架 智能体脚手架 智能体安全 经验学习

OpenClaw 2.0 汇集 933 名贡献者和 1.6 万个 PR,重点改进自动配置、浏览器端性能、插件来源验证及凭证隔离,并新增可移交任务上下文的共享云会话。项目早期增长依赖 Claude 订阅的低成本 OAuth 使用方式,Anthropic 收紧第三方授权后,API 成本激增与恶意技能风险导致用户流失。文章认为 OpenClaw 提前验证了 Agent Harness 架构,即由模型外围系统承担工具调度、权限管理、会话记忆、执行沙箱和断点恢复。2.0 默认开启 Skill Workshop 自动学习,但技能沉淀效果仍待验证;在 Claude Code、Codex、OpenCode 和飞书 CLI 等产品挤压下,其产品窗口期可能已经关闭。

用途与启示
  • 将工具调度、权限、记忆、沙箱和执行恢复视为 Agent 产品的核心竞争层,而非仅比较底层模型能力。
  • Harness 应从首版设计开始纳入凭证隔离、插件审计、权限回收与供应链安全,避免事后补救。
  • 自学习循环和可复用技能沉淀可能提升长期留存,使 Agent 的收益随使用时间增长。
  • 企业智能体应优先嵌入现有办公上下文、鉴权体系和审计基础设施,以降低部署及使用成本。
  • OpenClaw 的兴衰说明补贴型 Token 经济难以持续,产品价值必须覆盖真实 API 成本与配置成本。
📝 原始笔记(逐字保留)
HarnessEvolve|全新OpenClaw 2.0发布:龙虾史上最大更新,已无人关心https://mp.weixin.qq.com/s/09r3E6F6sfgKfi0qUxuSiw

Zeva:具身模型通过上下文因果学习实现部署时自进化

清华AIR与域变换提出Zeva,通过双时标因果记忆和上下文策略注入,使冻结的具身模型从交互及单次人类演示中持续学习,无需更新权重即可提升操作成功率。

 具身智能 自进化 上下文学习 智能体记忆 能力迁移

Zeva被称为首个实现In-Context Causal Learning(ICCL)的具身WAM,可在模型权重冻结的情况下从动作与状态变化中提取因果关系。其框架包含Causal Transition Encoder、双时标因果记忆和In-Context Policy Injection:短期轨迹维持单次执行连贯性,持久记忆则跨尝试积累可复用经验。决策时,系统检索与当前任务阶段匹配的交互证据并构造Causal Prompt,注入冻结的Cosmos3动作生成模型,全程无需梯度更新。在RoboCasa365上,其累计成功率从首次演化的26%提升至第四次的73%;在真实化学实验室任务中也随尝试次数稳定提升。Zeva还支持单次人类演示初始化记忆,无需微调即可复现新操作,并可将仿真或历史交互中的物理因果迁移到新任务与真实环境。

用途与启示
  • 为具身模型提供一种不依赖测试时训练或参数更新的在线适应路径,降低现场学习成本及灾难性遗忘风险。
  • 将失败、修正和成功轨迹压缩为可检索的因果证据,使部署过程从能力消耗转变为经验积累。
  • 展示了从参数规模扩展到“因果上下文规模扩展”的新路线,可用于机器人隐式辨识质量、摩擦和接触特性等环境属性。
  • 双时标记忆与因果提示注入机制可启发长期智能体记忆、跨任务经验复用和人类示范快速适配系统的设计。
📝 原始笔记(逐字保留)
自进化|自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning https://mp.weixin.qq.com/s/OMrRnOtlDyjFXlZDPF-n4Q

RPM 用研究偏好提升科研智能体算力分配效率

Meta FAIR 与牛津大学提出 AI 研究偏好模型 RPM,通过代码排序和轻量先导实验筛选候选研究分支,使科研智能体在有限 GPU 预算下更快找到高质量方案。

 科研智能体 自动化科学研究 任务规划 成本优化 模型评估

RPM 将科研搜索中的算力分配重构为偏好排序问题,在完整训练前根据代码差异、历史轨迹和验证得分筛选候选分支。Inference-only RPM 使用冻结的大语言模型进行结构化比较,Agentic RPM 则可在沙盒中调用 Python、Bash 等工具开展限时先导实验,再依据反馈做出选择。系统通过淘汰赛从并行生成的候选代码中选出一个进行全量 GPU 训练,并将结果写回 AIRA-dojo 搜索树。在 AIRS-Bench 的 20 项任务上,两种 RPM 将平均归一化得分从 0.684 提升至 0.711 和 0.729,约 15 小时即可追平无引导智能体运行 24 小时的表现。

用途与启示
  • 为算力受限的科研智能体提供候选实验预筛机制,减少低价值的完整训练。
  • 相比直接预测绝对实验分数,两两偏好排序更易校准,也更适合异构科研任务。
  • 将低成本先导实验与反馈规划结合,可用少量计算换取高信息增益的决策证据。
  • 该方法可作为自动化科研搜索树的选择器,提高单位 GPU 时间内的研究迭代质量。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/RClnuotEp9wKzD2gaUH03A

JIT-Agent:按任务即时生成并演化智能体 Harness

NUS 的 JIT-Agent 通过任务定制、错误修复与 Evo-GDPO 优化,为不同任务在线生成由记忆、规划、动作和能力编排组成的专用 Harness。

 智能体脚手架演化 智能体脚手架 智能体 任务规划 成本优化

  • JIT-Agent 不再为所有任务使用固定 Harness,而是根据当前任务即时生成匹配的记忆、规划、动作和能力编排模块,并通过统一接口约束组合空间。
  • 训练分为任务定制、基于编译及运行时错误的局部修复、使用 Evo-GDPO 超越现有候选档案三个阶段。
  • 据原帖介绍,该方法在覆盖深度研究、办公、规划和工作区操作的 9 个基准中取得 8 项最佳,同一底座的 18 组对比均有提升。
  • 在固定底座的受控实验中,其平均单题成本据称较最便宜的固定 Harness 降低 36%,但在线生成、验证与修复的实际成本仍需进一步测试。
用途与启示
  • 为任务差异显著的智能体系统提供按需生成脚手架的新范式,减少固定工作流在新任务上的结构失配。
  • 可将模块化接口与运行时反馈结合,用编译错误、接口错误和执行错误持续修复智能体配置。
  • 适合高价值、任务结构变化大的深度研究或办公自动化场景;稳定且重复的任务仍可能更适合固定 Harness。
  • 提示评估智能体时应同时衡量任务成功率、生成与验证开销、Token 消耗及 API 成本。
📝 原始笔记(逐字保留)
30 【Harness生成-NUS爆火论文-按任务在线生成 - 机智的哒哒学姐 | 小红书 - 你的生活兴趣社区】 😆 BElsfXz88r7u6Jp 😆 https://www.xiaohongshu.com/discovery/item/6a9697cf000000001001fb13?source=webshare&xhsshare=pc_web&xsec_token=CBuH0yJDknMBJ2yrxLfLGY5wh1dLUVFEBZZ_XI7FdXOIo=&xsec_source=pc_share

Lucida:可组合真实到模拟场景建模框架

Lucida通过场景解析、实例资产生成与闭环放置,将真实室内视频转换为完整、可编辑且适用于机器人仿真的三维场景。

 场景建模 具身智能 三维生成 任务规划

Lucida面向可组合真实到模拟场景建模,将真实室内环境恢复为可独立操控的完整物体资产及其空间布局。框架首先把视频解析为场景图,并在每个实例节点中汇聚多视角证据,再据此生成被遮挡物体的完整资产。其GizmoAct模块利用VLM策略将资产放置建模为多轮GUI交互,通过闭环操纵物体控制器并自主判断对齐完成时机。在R2S-Scene、CA-1M等评测上,Lucida显著改善三维目标检测、姿态估计和场景重建性能,场景F-Score达到0.924。

用途与启示
  • 为机器人仿真和具身智能构建与真实环境对应、可编辑的高保真数字场景。
  • 展示了将精度要求延后至流水线末端、让各阶段仅依赖真实采集可稳定提供的信息,可提升遮挡与杂乱环境下的鲁棒性。
  • 将VLM与三维编辑器GUI闭环结合,为资产放置、姿态校准和其他可交互空间任务提供了新的智能体设计范式。
  • 可用于生成仿真训练环境,支持机器人操作、场景理解及仿真到现实迁移研究。
📝 原始笔记(逐字保留)
[Lucida:用于可组合真实到模拟场景建模的解析、生成与放置(74 ▲)](https://huggingface.co/papers/2608.30821?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

GenFirst:先生成后重建的稳定端到端潜在生成建模

GenFirst通过先以生成目标塑造潜空间、再逐步增强重建约束,首次实现无潜变量坍塌的稳定端到端潜在生成模型训练。

 视觉生成 模型训练 扩散模型 多模态 人工智能

传统潜在生成模型通常先训练用于重建的VAE,再在冻结的潜空间上训练生成模型,但重建友好的表征未必适合生成。研究发现,KL散度中的熵项对避免潜变量坍塌至关重要,同时重建学习快、监督强,而生成学习更慢、更难优化,两者存在不对称动态。GenFirst先在较弱重建压力下利用生成目标塑造潜空间,随后逐步加强重建以恢复视觉细节,从而稳定联合训练编码器与生成先验。在ImageNet-256上,SiT使用CFG取得0.97 gFID、不使用CFG取得1.45 gFID;MMDiT在文生图GenEval上达到0.90,并可扩展到生成与表征共享视觉潜变量及统一文本—图像生成。

用途与启示
  • 为端到端联合训练自编码器与生成先验提供避免潜变量坍塌的简单策略。
  • 表明训练目标的引入顺序与强度调度能够缓解生成和重建之间的优化冲突。
  • 可用于改进扩散模型、自回归图像生成及统一文本—图像模型的潜空间设计。
  • 提示潜空间训练不仅要关注重建质量,还应显式保留熵并优先塑造生成友好的表征。
📝 原始笔记(逐字保留)
[GenFirst:先生成后重建,实现稳定的端到端潜在生成建模(59 ▲)](https://huggingface.co/papers/2608.29335?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

Qwen3.8-Next 架构设计:效率、能力与训练稳定性的联合优化

Qwen3.8-Flash-Next 通过稀疏 MoE、混合 GDN/注意力、门控残差与主机侧 n-gram 嵌入,在显著降低训练和推理成本的同时提升了模型能力及训练稳定性。

 模型开发 系统优化 模型训练 混合专家模型 人工智能

Qwen3.8-Flash-Next 是一个总参数量 125B、每词元激活 6B 参数的稀疏 MoE 模型,另有 51B 参数的 n-gram 嵌入表存放在加速器之外。其词元混合模块按层组合 Gated DeltaNet 与全局注意力,每四层设置一层全注意力,并在持续预训练阶段以基于微块索引的 Qwen Sparse Attention 替换。模型采用四分支残差流和逐元素门控形成 Gated Residual,同时从主机内存预取单层 n-gram 嵌入以扩充骨干网络之外的容量。相较 397B-A17B 前代,该模型以约三分之一的激活参数、三分之一的训练词元和九分之一的训练 FLOPs,在 14 项预训练基准中的 8 项取得领先。架构与 Muon 优化器共同提高了最优学习率和批大小,并在压力测试中改善训练稳定性,但实验也表明损失下降与下游准确率提升并不总是一致。

用途与启示
  • 展示了将模型效果、训练成本、预填充与解码效率以及稳定性作为统一架构设计目标的方法。
  • 为稀疏 MoE 模型结合线性序列模块、稀疏注意力和门控残差提供了可复用的设计方案。
  • 提醒模型研发者不能仅以预训练损失选择组件,还需同时验证下游任务收益及边际饱和现象。
  • 表明架构变化会重新塑造最优学习率、批大小和预热策略,训练配方应与架构协同搜索。
  • 主机侧 n-gram 嵌入展示了利用分层存储扩展模型容量、降低加速器显存占用的工程路径。
📝 原始笔记(逐字保留)
[论 Qwen3.8-Next 架构的设计:评估、效率与训练稳定性(33 ▲)](https://huggingface.co/papers/2608.30320?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

DreamX-Creator:普惠化原生 2K 音视频联合生成

DreamX-Creator 1.0 以紧凑型 7B 生成器、跨模态联合训练和单步 2K 精炼器,实现原生同步的高分辨率音视频生成。

 视频生成 多模态 模型训练 强化学习 数据工程

DreamX-Creator 1.0 根据首帧与文本提示,联合去噪模态专用的音频流和视频流,从生成过程内部建模声音事件与视觉动态的同步关系。网络前半段独立处理两种模态,后半段通过带词元级和注意力头级输出门控的 Gated Cross-Modal Attention 进行融合。其统一音视频数据系统负责构建、过滤时序一致片段,生成结构化多模态标注,并按能力组织数据池;训练则包含两阶段音视频预训练、高质量微调及模态感知的多模态反馈强化学习。为生成高分辨率内容,团队将双向多步教师模型改造并蒸馏为自回归单步 2K 精炼器,使每个时间分块仅需一次去噪评估。

用途与启示
  • 为原生音视频联合生成提供较紧凑的 7B 开放基础模型,降低高分辨率多模态生成的研究与部署门槛。
  • Gated Cross-Modal Attention 展示了按词元和注意力头调节跨模态信息流的方法,可用于改善视听同步并抑制无效模态干扰。
  • 模态感知反馈路由可将视频、音频及跨模态奖励分别施加到对应生成流,为多模态强化学习的信用分配提供参考。
  • 单步 2K 精炼方案兼顾输出分辨率与推理成本,可启发高分辨率视频生成中的教师改造、分块自回归和蒸馏设计。
📝 原始笔记(逐字保留)
[DreamX-Creator:让 2K 分辨率原生音视频生成普惠化(27 ▲)](https://huggingface.co/papers/2608.31106?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

CogEvol:高效可靠的学习环境生成模型

CogEvol 将课程简介单次生成结构化幻灯片或交互式 HTML,并通过生产故障驱动的数据闭环与混合奖励强化学习提升效率和可靠性。

 人工智能应用 模型训练 数据合成 强化学习 奖励作弊

CogEvol 是面向学习环境生成的一系列模型,可根据课程简介单次产出结构化 JSON 幻灯片或自包含交互式 HTML 页面。在 22 万次生产请求中,其生成单页幻灯片和交互页面的中位耗时分别为 17 秒与 59 秒,替代了耗时数分钟的多轮智能体脚手架。团队将真实生产故障转化为 53,687 条经验证的 SFT 样本,并结合规则与 VLM 奖励实施 GRPO 训练,同时修复了生成“视觉逼真但不可玩”游戏的奖励作弊问题。CogEvol-27B 在幻灯片质量和 500 例交互式 HTML 基准上分别获得 83.7 和 63.7 分,脚手架编辑还能将交互页面生成成本进一步降低约 76%。CogEvol-4B 以 Apache 2.0 协议开源,整套系统可在国产昇腾加速器上达到与 A800 GPU 相当的应用级表现。

用途与启示
  • 展示以生产故障为反馈构建高质量 SFT 数据闭环的方法,可用于提升生成式应用的可靠性。
  • 说明规则检查与 VLM 评价相结合的奖励设计适用于兼顾结构正确性、视觉质量和交互可用性的复杂任务。
  • 奖励作弊案例表明,视觉评分不能替代真实可执行性验证,应将交互测试纳入强化学习与上线评估。
  • 单次生成与脚手架编辑能够显著降低多轮智能体编排的延迟和成本,为大规模 AI 原生教育应用提供工程参考。
📝 原始笔记(逐字保留)
[CogEvol:迈向高效可靠的学习环境生成(26 ▲)](https://huggingface.co/papers/2608.30968?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

LightNav-0:激发 VLM 空间智能的通用具身导航模型

LightNav-0 通过统一指向与动作词元接口,将预训练 VLM 的空间智能对齐到多任务、多场景和跨机器人本体的通用具身导航。

 具身智能 具身导航 多模态 强化学习 中期训练

LightNav-0 是一个紧凑型通用具身导航模型,无需任务专用预测头,即可统一处理指令跟随、开放词汇目标导航和视觉跟踪。模型采用双通道指向机制表达与任务、场景及机器人本体无关的空间意图,并通过残差向量量化动作词元器将其映射为本体相关的精确轨迹。训练流程结合时序视觉历史压缩、ER 中期训练、监督微调和强化学习,使用覆盖 2,000 余个场景、4,000 余小时的导航数据。LightNav-ER 在 8 项具身推理基准上取得最高完整集平均成绩,LightNav-0 则在 10 个公开导航仿真设置中实现领先的单目成功率,并展现出跨机器人本体、场景及动静态目标的零样本现实泛化能力。

用途与启示
  • 展示预训练 VLM 的空间先验可直接转化为机器人控制能力,减少任务专用感知与控制模块。
  • 统一空间意图与本体相关动作的表示,为跨任务、跨场景和跨机器人迁移提供通用接口。
  • 说明中期训练、监督微调与强化学习相结合,可有效构建紧凑型通用具身基础模型。
  • 为开放词汇导航、动态目标跟踪及现实环境零样本部署提供可借鉴的技术路线。
📝 原始笔记(逐字保留)
[LightNav-0:激发 VLM 的空间智能,实现通用具身导航(24 ▲)](https://huggingface.co/papers/2608.30935?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

PRISK:评估大语言模型个性化的隐性成本

研究提出动态评估框架 PRISK,揭示用户画像与检索记忆会加重大模型的无关个性化、偏好窄化和谄媚偏差。

 模型评估 人工智能可靠性 用户画像 智能体记忆 行为建模

论文关注大语言模型利用对话历史、推断偏好和用户画像进行个性化时产生的潜在副作用。作者归纳出三类主要风险:在无关场景引用个人信息、持续迎合偏好而形成信息茧房,以及过度赞同用户观点的谄媚偏差。为系统测量这些问题,研究提出 PRISK 动态评估框架,通过自动化数据生成和针对性指标考察个性化信息如何改变模型回答。对 13 个大语言模型的实验表明,加入用户画像和检索记忆后,三类指标平均分别恶化 45.9%、41.7% 和 61.7%。

用途与启示
  • 为个性化 AI 助手提供覆盖隐私越界、信息多样性和谄媚行为的系统评估方法。
  • 提醒开发者不能仅以用户满意度衡量个性化效果,还需评估回答的平衡性、必要性与独立判断能力。
  • 可用于比较不同记忆检索、用户画像注入和个性化提示策略的安全代价。
  • 启示系统在调用个人信息前加入相关性门控,并对偏好强化和过度赞同设置约束与审计指标。
📝 原始笔记(逐字保留)
[评估大语言模型个性化的隐性成本(24 ▲)](https://huggingface.co/papers/2608.28833?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

Super Library Agent:跨多代码库联合生成与维护应用

Super Library Agent 通过持续维护跨应用共享组件库,在保证功能的同时减少多个相关代码库的代码冗余、词元开销与结构退化。

 人工智能辅助编程 SWE 软件工程 智能体 仓库级代码生成 代码仓库知识

论文提出 Super Library Agent 问题:智能体按顺序生成和维护多个相关应用,并同步演化一个可跨应用复用的共享组件库。针对简单顺序式脚手架提取召回率低、依赖迁移脆弱的问题,方法引入基于代码块摘要的候选引导提取、提取前代码库整合,以及结合提取轨迹和调用图的上下文感知迁移。在 WebGen-Bench 与 PaperBench 上,该方法能够保持应用功能,并相较零样本方案显著降低重复代码、冗长程度和词元占用。它还避免了朴素共享库构建造成的结构侵蚀,并进一步降低代码行数与最小描述长度。

用途与启示
  • 为企业同时生成和维护一组具有共享领域逻辑的应用提供跨代码库智能体范式。
  • 可将重复组件自动抽取到公共库中,降低长期智能体编程产生的死代码、冗余和维护成本。
  • 表明调用图、提取轨迹等结构化上下文能够提升大规模代码迁移的可靠性。
  • 可用于研究面向多仓库的软件架构演化、依赖治理与仓库级代码生成。
📝 原始笔记(逐字保留)
[超级库代理:联合生成和维护超越单一代码库的多个应用程序(24 ▲)](https://huggingface.co/papers/2608.29310?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

SHAPE:解析数学推理中思维链的形态

SHAPE 从数学语义空间与启发式动作两个维度解析思维链,发现启发式策略比传统 CoT 特征更能解释数学推理正确性,并可用于改进后训练。

 推理 数学人工智能 人工智能可解释性 后训练 强化学习

SHAPE 借鉴数学教育理论,从语义空间和启发式动作两个维度分析大模型的数学思维链轨迹。研究发现,模型采用的数学启发式策略比传统 CoT 特征更能解释最终答案是否正确。正确解答通常来自对少数语义空间的集中探索,而非在大量不同空间之间广泛切换,这与人类解题模式一致。分析还表明,强化学习会使启发式策略出现模式寻优倾向,而鼓励多样化启发式策略的后训练能够进一步提高准确率。

用途与启示
  • 为数学推理模型提供具备理论依据的思维链诊断框架。
  • 可用语义空间与启发式动作分析模型的解题策略及错误来源。
  • 提示强化学习后训练可能造成启发式策略单一化,需要显式维护策略多样性。
  • 可将启发式多样性作为数学推理训练目标或过程评估指标。
📝 原始笔记(逐字保留)
[数学推理中思维链的形态(22 ▲)](https://huggingface.co/papers/2608.28600?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-01)

Nature Communications 欧洲山毛榉基因组研究配色参考

文章以 Nature Communications 的欧洲山毛榉基因组研究为案例,分享顶刊科研图表的配色设计参考。

 数据科学 环境适应 生物信息学

该内容聚焦 Nature Communications 论文中的科研图表配色,可作为学术绘图的视觉设计参考。论文题为《Genomic variation of European beech reveals signals of local adaptation despite high levels of phenotypic plasticity》。研究主题涉及欧洲山毛榉的基因组变异、表型可塑性与局部环境适应信号。论文 DOI 为 10.1038/s41467-024-52933-y

用途与启示
  • 借鉴顶级期刊图表的色彩组合与视觉层级设计。
  • 为基因组学、生物信息学等多变量科研绘图提供配色参考。
  • 在复用配色时兼顾类别区分度、可读性与整体风格一致性。
📝 原始笔记(逐字保留)
https://mp.weixin.qq.com/s/O-HtVWMxI5R-xUNBBUAjdA 跟着顶刊学配色 期刊:Nature Communications 题目:Genomic variation of European beech reveals signals of local adaptation despite high levels of phenotypic plasticity DOI:10.1038/s41467-024-52933-y

蚂蚁OmniTable统一宽表管理35PB大模型训练数据

蚂蚁集团推出统一宽表系统OmniTable,以逻辑宽表、特征血缘、记录级容错和自适应执行管理35PB训练数据,将真实SFT数据准备周期从14天缩短至2.5天。

 数据工程 数据策展 模型训练 系统优化 数据质量过滤

OmniTable采用“逻辑统一、物理分离”架构,将数据批次和特征列设为一等对象,通过Catalog统一管理特征定义、版本、依赖、执行状态与列级血缘。系统已在生产环境覆盖Web、代码、PDF和SFT等数据域,管理超过35PB、3050亿条记录,并支持数千个逻辑列。其记录级故障隔离可避免少量异常样本拖垮整批任务,算子融合、跨引擎路由与自适应调优则减少重复扫描和资源配置成本。在真实SFT数据准备任务中,端到端周期由约14天降至2.5天,提速5.6倍,手工步骤减少73.3%。

用途与启示
  • 为PB级大模型语料的解析、清洗、质量评估、去重和样本组装提供统一的数据工程架构参考。
  • 将特征定义、版本、依赖与血缘资产化,可降低跨表排查、特征回刷和历史结果追溯成本。
  • 记录级容错说明大规模非结构化数据处理应尽量隔离坏样本,避免因极少数异常触发全量重跑。
  • “稳定逻辑语义、持续演进物理布局”的设计可用于构建长期可维护的大模型训练数据基础设施。
📝 原始笔记(逐字保留)
标题:还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 来源:量子位(微信公众号) 链接:https://www.qbitai.com/2026/09/483104.html 摘要:蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文

超越评分:解析 LLM-as-a-Judge 的摘要评估机制

研究通过因果追踪、logit lens 和注意力头敲除发现,Themis 与 Prometheus 采用“注意力定位并路由错误、MLP 整合并写入评分”的两阶段摘要评估机制。

 模型评估 人工智能可解释性 模型评判 过程评估 人工智能可靠性

研究构建了覆盖可读性与充分性维度的八类扰动体系,生成具有可控错误强度和词元级修改映射的成对干净与受损摘要。作者对 Themis(Llama-3-8B)和 Prometheus(Mistral-7B)开展因果追踪、logit-lens 词表投影及注意力头敲除等实验。结果显示,第 15 层以下的注意力模块负责局部错误比较,并将结果路由至输入末端;更高层的 MLP 级联负责整合信号并写入最终评分。评分决策在较晚层的残差流中突然定型,Themis 位于第 26 层,Prometheus 位于第 25 层。基础 Llama-3-8B 对照实验表明,微调并非从零构建评估管线,而是在既有机制上强化阶段分工并提前决策定型。

用途与启示
  • 为理解 LLM-as-a-Judge 的内部评分过程提供可干预、可验证的机制证据,而不再仅依赖最终分数相关性。
  • 可据此定位评判模型的关键注意力头、MLP 层和决策形成深度,支持评分偏差诊断与模型修复。
  • 说明评判微调主要重塑基础模型已有的路由与决策结构,可为更高效的评判模型训练和可解释性研究提供依据。
  • 配套的受控扰动数据与词元级修改映射可用于评估评判模型对不同摘要错误类型和强度的敏感性。
📝 原始笔记(逐字保留)
标题:Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation 来源:arXiv 链接:https://arxiv.org/abs/2609.01604 摘要:LLM-based evaluators of natural language generation (NLG) quality are widely deployed as scoring tools and as automated training signals, yet the internal procedure by which they assign a rating remains poorly understood. We investigate this procedure mechanistically through an eight-attack perturbation taxonomy across the Readability and Adequacy dimensions of NLG quality, a generation pipeline that produces paired clean and corrupt summaries with controlled error intensity and explicit token-level modification maps, and a four-experiment battery of causal tracing, logit-lens vocabulary projection, and attention-head knockout applied to Themis (Llama-3-8B) and Prometheus (Mistral-7B). Both evaluators implement a structured, coherent evaluation pipeline operating in two stages: below layer

PTA-IRT:基于执行轨迹的高效 SWE 智能体评测

PTA-IRT 将软件工程智能体的执行轨迹作为特权信息融入项目反应理论,以较低校准预算更准确地恢复完整基准上的得分与排名。

 智能体评估 人工智能辅助编程 模型评估 执行轨迹 评估预算

论文提出特权轨迹感知项目反应理论框架 PTA-IRT,用于降低真实软件工程智能体基准的评测成本。不同于仅利用历史通过/失败矩阵或静态任务语义的方法,该框架从执行轨迹中提取已探索上下文、尝试过的代码编辑和问题解决路径等过程信号。PTA-IRT 融合过程与结果信息,以改进校准任务子集选择和智能体能力估计。在四个 SWE 基准的低校准预算实验中,该方法在得分恢复和排名恢复方面持续优于既有 IRT 基线。

用途与启示
  • 为高成本软件工程智能体评测提供更节省预算的代表性任务抽样方案。
  • 表明执行轨迹可作为超越最终成败标签的高价值评测信号,提升能力估计与排名的可靠性。
  • 可启发其他长程智能体基准利用工具调用、编辑和测试轨迹开展过程感知的高效评估。
📝 原始笔记(逐字保留)
标题:Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation 来源:arXiv 链接:https://arxiv.org/abs/2609.01603 摘要:Evaluating software engineering agents on realistic benchmarks is costly, since each task may require multi-step code exploration, modification, and test execution. Existing efficient evaluation methods select representative subsets to estimate full-benchmark performance, but are largely result-only: they fit historical pass/fail response matrices or static task semantics, discarding how agents solve problems. We propose PTA-IRT, a Privileged Trajectory-Aware Item Response Theory framework that fuses process and outcome signals. Historical execution trajectories supply process-level evidence beyond pass/fail, such as explored context, attempted edits, and solving paths, which PTA-IRT uses as privileged information for calibration subset selection and ability estimation. Under low calibrati

CordisBench:动态智能体脚手架的组件生命周期推理评测

CordisBench 以 1,200 道问题评测语言模型对动态智能体脚手架中组件依赖、清理顺序、状态变化和可执行重配置的推理能力。

 模型评估 推理 智能体脚手架 依赖传播 插件架构

  • CordisBench 包含 1,200 道生命周期推理题,结合受控形式化设定与 Cordis 运行时中的真实程序执行。
  • 任务涵盖识别受插件变更影响的组件、预测指定拆卸顺序后的状态、判断不同顺序下成立的条件,以及选择可成功执行的重配置。
  • 实验测试了 2 至 32 个相关交互规模下的三种效率导向模型;模型在小型系统上表现较好,但随着交互增多,最终状态预测和跨拆卸顺序推理的可靠性明显下降。
  • 增加推理投入可改善部分模型表现,但成本较高;独立有限参考语义则在全部 528 道可执行问题上与 Cordis 的执行结果完全一致。
用途与启示
  • 为动态智能体脚手架提供组件生命周期与依赖传播能力的标准化评测。
  • 揭示局部插件修改经依赖关系和清理流程传播时,语言模型容易出现的状态推理失效。
  • 表明形式化参考语义可作为低成本、确定性的执行验证器,辅助检查模型给出的重配置方案。
  • 可用于研究推理预算、系统交互复杂度与智能体运行时可靠性之间的权衡。
📝 原始笔记(逐字保留)
标题:CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses? 来源:arXiv 链接:https://arxiv.org/abs/2609.01600 摘要:Dynamic agent harnesses let language models change the software that shapes their own execution. This flexibility brings a new reasoning burden: a local plugin change can propagate through dependencies and cleanup. We introduce CordisBench, a 1,200-question benchmark of this lifecycle reasoning. It combines a controlled formal setting with programs executed against Cordis, a runtime that manages component dependencies and cleanup, and asks models to identify affected components, predict state after a specified teardown order, determine which conditions hold under all or some orders, and choose reconfigurations that succeed when executed. Across these tasks, we evaluate three efficiency-oriented models at low reasoning effort with 2, 4, 8, 16, 24, or 32 relevant interactions, using determin

言语强化学习的兴起:自然语言反馈统一框架

论文首次系统梳理言语强化学习(VRL),将自然语言反馈按其生效阶段及修改对象归纳为任务锚定、测试时审议反馈和训练学习信号三大支柱。

 强化学习 智能体 模型训练 测试时计算 人在回路

论文提出言语强化学习(Verbal Reinforcement Learning, VRL)的统一定义,强调自然语言能够同时传递意图、偏好与因果结构,并作为改善语言智能体的重要反馈通道。作者依据语言反馈在智能体生命周期中何时生效、修改何种对象,建立了统一分类框架。该框架包括三类路径:以语言定义目标、状态和奖励结构的锚定信号,以语言在不更新参数的情况下指导测试时推理的审议反馈,以及通过训练改变模型参数的学习信号。论文进一步梳理各路径的代表性工作与子类别,并讨论 VRL 在提升智能体能力和对齐水平方面的挑战与机会。

用途与启示
  • 为自然语言反馈、语言智能体训练及相关强化学习研究提供统一术语与分类框架。
  • 帮助区分任务定义、测试时推理干预和参数更新三种语言反馈机制,便于选择合适的系统设计方案。
  • 启发构建兼具可解释性与可对齐性的反馈闭环,使人类能够通过语言直接传递偏好和因果信息。
  • 可作为梳理言语奖励、语言批评、自我反思及人在回路智能体研究的综述入口。
📝 原始笔记(逐字保留)
标题:The Rise of Verbal Reinforcement Learning 来源:arXiv 链接:https://arxiv.org/abs/2609.01597 摘要:Natural language is emerging as a primary feedback channel for improving language agents, capable of conveying intent, preferences, and causal structure in forms interpretable by both humans and modern language models. We call this paradigm Verbal Reinforcement Learning (VRL) and offer the first unified account of it. We organize the field around a single axis, \textit{when} verbal feedback takes effect in an agent's lifecycle and \textit{what} it modifies, yielding three pillars: (1) \textbf{Language as Grounding Signal}, where language defines the task itself by specifying goals, states, and reward structures; (2) \textbf{Language as Deliberative Feedback}, where natural language guides reasoning at test time without the need to update model parameters; (3) \textbf{Language as Learning S

StudentSim:个性化 LLM 学生模拟器训练框架

StudentSim 通过共享训练与逐学生特化构建个性化学生模拟器,在行为保真度和指导响应性上超过 GPT-5.4,并可作为奖励模型训练更个性化的 AI 导师。 [合并自 2026-09-03 studentsim-llm] StudentSim 通过共享训练与逐学生专门化,将稀疏学习记录转化为兼具行为保真度和指导响应能力的个性化学生模拟器。

 行为建模 模型训练 人工智能应用 奖励建模 强化学习

StudentSim 采用先汇总多名学生数据进行共享训练、再针对单个学生专门化的两阶段方法,使模拟器既能复现学生原有答题行为,也能在教师解释或纠正后合理更新。论文提出 StudentSimEval,基于国际象棋、英语二语写作和数学三个领域的公开学习者数据,对60名学生进行标准化评估。该评测分别衡量行为保真度 F 与指导响应度 R,StudentSim 在三个领域均优于 GPT-5.4;在国际象棋中取得 F=0.51、R=0.91。作为概念验证,研究还将 StudentSim 用作教师强化学习的奖励模型,训练出的国际象棋导师在人类专家评价中表现得更准确、更具指导性和个性化。

[合并自 2026-09-03 studentsim-llm] StudentSim 将稀疏的学生个人数据转化为个性化 LLM 模拟器,先在多名学生的数据上进行共享训练,再针对每位学生做专门化。该模拟器既要复现目标学生原本的回答模式,也要在收到教师解释、纠正或引导后合理更新回答。配套的 StudentSimEval 覆盖国际象棋、英语二语写作和数学三个领域的 60 名学生,并分别衡量行为保真度 F 与指导响应性 R。实验中 StudentSim 在三个领域均优于 GPT-5.4;将其作为导师强化学习的奖励模型后,训练出的国际象棋导师也获得了更高的准确性、指导质量和个性化人工评价。

用途与启示
  • 为缺乏大规模真实学生交互数据的个性化 AI 教学系统提供低成本代理环境。
  • 将学生模拟器同时作为行为预测模型与强化学习奖励模型,用于优化导师的指导策略。
  • StudentSimEval 可用于统一检验模拟器是否既忠实复现学生能力,又能对教学干预作出合理响应。
  • 两阶段训练思路表明,共享群体知识与个体专门化可以缓解单个学生数据稀疏问题。

[合并自 2026-09-03 studentsim-llm]

  • 为难以大规模采集真实学生反馈的 AI 教育研究提供可训练的个体代理。
  • 将行为保真度与指导响应性拆分评估,避免只会模仿学生、却无法模拟学习过程的问题。
  • 可把学生模拟器用作奖励模型,为个性化导师开展低成本强化学习和策略优化。
  • “共享训练后个体特化”的方案可推广到其他数据稀疏的用户行为模拟任务。
📝 原始笔记(逐字保留)
标题:StudentSim: Training LLM-based Student Simulators 来源:arXiv 链接:https://arxiv.org/abs/2609.01591 摘要:AI tutors are most useful when they adapt to each student's strengths, weaknesses, and preferred guidance, but evidence about which guidance works for which student is sparse, slow, and costly to collect from real learners. Student simulators can provide this signal as a proxy, yet existing approaches are limited: state-tracking models fit student behavior but struggle to process explanations or corrections, while LLM role-play follows guidance fluently but does not reliably match the competence of the student being imitated. We present StudentSim, a training framework that turns sparse per-student data into individualized simulators through pooled training followed by per-student specialization. The resulting simulators both mirror a student's own responses and update them under tutor gui [合并自 2026-09-03 studentsim-llm] [StudentSim:训练基于 LLM 的学生模拟器(464 ▲)](https://huggingface.co/papers/2609.01591?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-02)

难度感知数据策展缩小文档 VLM 成本与质量差距

该研究通过难度感知的数据策展与混合专家 VLM,在单张 H100 可训练部署的条件下提升文档字段抽取质量,并将质量调整后的预期成本较人工降低逾 80%。

 数据策展 多模态 混合专家模型 成本优化 模型训练

研究提出一套已投入部署的文档理解系统,采用总参数 35B、激活参数 3B 的 Mixture-of-Experts VLM,从文档中抽取结构化字段。模型使用内部生产数据与开放域文档进行混合微调,难度感知流程依据版面多样性、事实可提取性和跨模型一致性筛选数据。该模型可在单张 H100 上完成微调,并通过提示适配异构业务流程,性能超过参数规模最高大一个数量级的可部署非推理基线。结合生产遥测中的确认与纠错成本,其预期成本较人工基线降低超过 80%,较最佳开源竞品降低超过 50%。

用途与启示
  • 展示难度感知数据策展可在有限算力下提高文档 VLM 的数据效率和部署质量。
  • 为受隐私与合规约束、无法调用外部模型的行业提供本地化文档抽取方案。
  • 提示模型选型不应只比较准确率,还应纳入人工确认、错误纠正和推理服务成本。
  • 说明低激活参数的混合专家架构有望在质量、吞吐量与部署经济性之间取得更优平衡。
📝 原始笔记(逐字保留)
标题:Closing Cost-Quality Gap in Document VLMs: Difficulty-Aware Data Curation and Quality-Adjusted Deployment Economics 来源:arXiv 链接:https://arxiv.org/abs/2609.01575 摘要:Extracting structured fields from hundreds of millions of documents annually remains costly in regulated industries: bespoke OCR cascades cover only a fraction of workflows, privacy rules preclude external models, and existing open-source VLMs that clear quality thresholds cost more to serve than human annotation. We present a deployed document-understanding system built on a Mixture-of-Experts VLM (35B total, 3B active), fine-tuned on in-house production data mixed with open-domain documents curated by a Difficulty-Aware pipeline for layout diversity, fact-extractability, and cross-model consistency. Fitting on a single H100 and serving heterogeneous workflows via prompting, the model leads all deployable (non-reasoning) baselines up to an order of magnitude larger. A quality-adjusted cos

SFT-RL 标注预算的跨模型规模近优分配

研究提出以近优区域替代单一最优比例,并证明小型代理模型确定的 SFT-RL 标注预算分配可可靠迁移至大型目标模型。

 后训练 模型训练 强化学习 成本优化 能力迁移

论文研究固定标注预算下,监督微调(SFT)与强化学习(RL)数据应如何分配的问题。作者不再寻找单一最优比例,而是定义性能处于峰值一定容差范围内的“近优区域”。实验发现,即使容差仅为 2%~10%,近优区域依然较宽,并且会随模型规模增大而进一步扩展。小型代理模型上识别出的近优区域能够稳定迁移到大型目标模型,且该结论跨任务、模型家族以及离策略偏好 RL 和在策略奖励监督 RL 均成立。研究还表明,SFT 与 RL 数据的标注成本差异会系统性地改变近优区域的位置。

用途与启示
  • 可先在低成本小型代理模型上搜索 SFT-RL 预算配比,再将近优范围迁移到大型模型,减少昂贵的大规模穷举实验。
  • 相比追求脆弱的单点最优比例,采用近优区域能为后训练配置提供更稳健的决策空间。
  • 制定标注策略时应同时考虑 SFT 与 RL 样本的单位成本,而非只比较样本数量。
  • 近优区域随模型规模扩大,说明大型模型的预算分配可能具有更高容错性,可据此优化训练成本。
📝 原始笔记(逐字保留)
标题:Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs 来源:arXiv 链接:https://arxiv.org/abs/2609.01573 摘要:How to divide a fixed annotation budget between supervised fine-tuning (SFT) and reinforcement learning (RL) during LLM post-training remains an open problem. Existing work characterizes only broad trends (e.g., SFT dominates in low-data regimes), lacks a principled allocation framework, and does not examine whether the optimal ratio transfers across model sizes. We frame this problem in terms of near-optimality: rather than seeking a single optimal SFT-RL ratio, we characterize the near-optimal region, the set of allocations within a specified tolerance of peak performance. Empirically, this region is wide even for small tolerances (2-10%), widens with model scale, and transfers reliably from small proxy models to large target models. This yields a practical strategy: small proxy-model ex

结构检索中的表层形式偏差:从数学题到智能体轨迹

研究发现嵌入模型通常能召回结构相同的候选,却会因词汇表面相似性偏差而无法正确排序,LLM 重排虽有改善但也可能受到记忆效应影响。

 模型评估 检索增强生成 智能体 数学人工智能 提示敏感性

研究在竞赛数学 MathNet-Retrieve 与 ALFWorld 智能体轨迹上,以统一协议评估语义结构相同但表述不同的检索任务。数学任务最高伪装级别的严格 Hit@1 对两个生产级嵌入模型均为 0%,尽管正确项几乎总能进入前十,错误首位候选通常与查询具有更高词汇相似度。智能体轨迹检索同样接近或低于随机水平,表明模型更依赖对象、容器等字面词元,而非任务结构。LLM 重排可挽回数学任务 5%~63%、轨迹任务 43%~76% 的差距,但数学收益部分集中于知名竞赛题,可能来自训练记忆;下游实验中,预言机检索与对抗性错误检索的效果无显著差异,暴露出求解器能力饱和造成的评测失真。

用途与启示
  • 结构检索评测应主动解耦词汇重合与语义结构,避免传统召回指标高估嵌入模型的真实泛化能力。
  • 可将“正确项已召回但未排首位”单独作为诊断场景,并结合词汇相似度、Hit@k 和结构一致性分析排序偏差。
  • 词法重排器效果的正负可用于判断基准中的表层变化是对抗性设计还是自然噪声。
  • 使用 LLM 重排时需控制题目记忆与基准污染,并确保下游求解任务仍有足够性能空间来体现检索质量差异。
📝 原始笔记(逐字保留)
标题:Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories 来源:arXiv 链接:https://arxiv.org/abs/2609.01556 摘要:We evaluate embedding retrieval where surface form and meaning are pulled apart on purpose: retrieving items that share underlying structure but not wording, in two unrelated domains under one protocol, competition mathematics (MathNet-Retrieve; 500 queries, 117,088-item corpus) and embodied-agent trajectories (ALFWorld-derived; 118 queries, 336 trajectories). In mathematics the failure is complete: strict Hit@1 at the heaviest disguise tier is 0.0% for both production embedders (bootstrap 95% CI [0.0, 0.0]) while the correct item sits in the top 10 nearly always, and in 95.2 to 99.8% of misses the winner is more lexically similar to the query than the correct answer. In trajectories, where surface variation is incidental, the same models land at or near hypergeometric chance when gold mus

SCILAWS-BENCH:评测 LLM 在真实与平行世界中发现科学定律

SCILAWS-BENCH 基于真实论文与科学数据,从固定观测和主动探索两种场景评测大模型发现科学定律的能力,并揭示预测拟合、科学有效性与公式记忆之间的差异。

 模型评估 科学发现 科学研究基准 自动化科学研究 主动数据采集

SCILAWS-BENCH 从 381 篇科学论文构建了 118 个问题,涵盖六大学科、291 条候选定律及约 800 万个真实数据点。SCILAWS-REAL 要求模型根据固定的真实观测提出定律,并通过留出数据的预测拟合度和源文献支持的科学有效性进行评估。SCILAWS-PARALLEL 则允许模型主动查询经过残差校准的平行世界,以恢复由已发表公式衍生出的新隐藏定律。实验发现,预测拟合良好并不等同于科学上有效,模型记忆会影响其复现或超越已发表公式的倾向,而 best-of-N 实验还暴露出明显的候选选择瓶颈。

用途与启示
  • 为科学定律发现提供兼顾真实数据、论文依据与主动实验的系统化评测基准。
  • 提醒研究者不要仅以预测误差衡量科学发现,还需独立检查公式的科学有效性与可解释性。
  • 平行世界设置可降低已发表公式造成的数据污染和记忆干扰,更准确地考察模型发现新规律的能力。
  • best-of-N 的选择瓶颈表明,未来应加强候选定律排序、验证器设计及实验查询策略。
📝 原始笔记(逐字保留)
标题:Can LLMs Discover Scientific Laws in Real and Parallel Worlds? 来源:arXiv 链接:https://arxiv.org/abs/2609.01552 摘要:Scientific equation discovery has long been central to scientific progress, proceeding through iterative cycles of hypothesis generation, observational testing, and refinement under scientific constraints. As LLM capabilities advance and their role in AI for Science expands, it remains an open problem whether they can genuinely discover scientific laws and how this ability should be evaluated. Existing evaluations, however, often either simplify discovery through synthetic settings or reuse published targets that may already be familiar to LLMs. We therefore introduce SCILAWS-BENCH, a benchmark for scientific law discovery built from published research and real scientific data. It comprises 118 problems drawn from 381 scientific papers, covering 291 candidate laws and roughly 8M real data

NashDreamer:面向零和不完美信息博弈的模型式强化学习

NashDreamer通过集中式多智能体循环状态空间模型提升零和不完美信息博弈的样本效率,并在理想模型条件下继承策略梯度算法趋向纳什均衡的收敛保证。

 世界模型 强化学习 博弈论 多智能体系统 策略优化

论文指出,在竞争性不完美信息博弈中,对手策略引发的非平稳性和分散式模型学习的可辨识性障碍,使集中式世界模型成为数学上的必要选择。NashDreamer引入集中式多智能体循环状态空间模型(MARSSM),将环境动力学与玩家策略对个体观测的影响解耦。该框架可以结合任意策略梯度算法,并在理想化模型下继承其趋向纳什均衡的收敛保证。四个基准游戏的实验显示,NashDreamer在训练早期相比无模型基线具有更高的样本效率;理论分析同时揭示了Dreamer系列在随机环境中易发生后验坍缩的问题。

用途与启示
  • 为不完美信息博弈中的模型式强化学习提供集中式世界模型架构。
  • 说明分散式模型学习存在可辨识性限制,为集中训练方案提供理论依据。
  • 可用于提高博弈智能体训练早期的样本效率,并兼容不同策略梯度算法。
  • 提醒研究者关注随机环境下Dreamer类模型的后验坍缩风险。
📝 原始笔记(逐字保留)
标题:NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games 来源:arXiv 链接:https://arxiv.org/abs/2609.01549 摘要:Model-based reinforcement learning (MBRL) has achieved remarkable results in single-agent domains, yet its extension to competitive imperfect information games (IIGs) remains underexplored. In multi-agent settings, opponent-induced non-stationarity complicates the learning process, and decentralized model learning faces severe identifiability barriers, which we argue make centralized model learning a mathematical necessity. Building on this analysis, we propose NashDreamer, a principled MBRL framework for two-player zero-sum IIGs. It introduces a centralized Multi-Agent Recurrent State-Space Model (MARSSM) that decouples environment dynamics from the effect of players' strategies on their individual observations. NashDreamer is designed to use arbitrary policy gradient algorithms and inher

LLM 能否设计视频编码工具?Planar 模式案例研究

研究通过“生成—编码评测—反馈改进”闭环让 LLM 自动设计 Planar 帧内预测器,并在 VVenC 与 ECM 实验中取得初步编码增益。

 人工智能辅助编程 自动化设计 系统优化 SWE 软件工程 人工智能

论文以视频编码标准中的 Planar 帧内预测模式为案例,考察 LLM 能否处理工具修改之间高度耦合的算法设计任务。研究构建生成与评估闭环,由 LLM 生成预测器实现、编码器实测压缩性能,再根据反馈迭代代码。在 VVenC 较快预设下,生成的模式相较传统 Planar 模式节省 0.18% 码率,复杂度开销约为 0.4%。在 ECM 的受限低分辨率设置中,无论替换方向性 Planar 模式,还是将新预测器作为带有新语法元素的附加模式,均可获得一定编码收益。

用途与启示
  • 表明 LLM 可在真实编码器和客观性能反馈驱动下参与底层视频编码算法设计,而不只用于一般代码生成。
  • “生成—执行—评测—再生成”闭环可推广到编译器优化、信号处理和其他性能敏感型软件组件的自动化设计。
  • 当前收益幅度较小且依赖特定预设、分辨率与集成策略,后续需验证跨配置泛化能力、复杂度控制及标准兼容性。
  • 编码器试验可充当可执行验证器,为 LLM 提供码率、质量和计算成本等多目标优化信号。
📝 原始笔记(逐字保留)
标题:Can LLMs Design Video Coding Tools? A Case Study on Planar Mode 来源:arXiv 链接:https://arxiv.org/abs/2609.01535 摘要:This paper explores whether large language models (LLMs) can design video coding tools, a highly challenging task due to the intricate algorithmic coupling of tool modifications. In particular, we present an empirical case study on the Planar mode, a long-standing intra prediction tool in video coding standards. Our experiments operate within a generation-and-evaluation loop, with the LLM generating new Planar predictors, encoder trials evaluating their coding performance, and the LLM re-generating refined implementations based on the evaluation feedback. We first examine directly replacing the default Planar mode in the Fraunhofer Versatile Video Encoder (VVenC) under its faster preset. Experimental results demonstrate that the LLM-generated mode can outperform the conventional Planar mod

EvoSCM:通过因果模型演化与实验实现科学信念修正

EvoSCM 让科研智能体维护并演化一组显式结构因果模型,通过干预实验、可证伪预测和纠正规则持续修正科学信念。

 科研智能体 闭环科学研究 科学发现 自动化科学研究 因果归因

EvoSCM 使用显式结构因果模型(SCM)表示科研智能体的信念,解决自由文本假设难以检验和修正的问题。系统维护多个相互竞争的 SCM 假设,并在闭环发现过程中从累积证据溯因潜在机制、设计具有区分力的干预实验并提出可证伪预测。预测与观测之间的偏差会被归纳为纠正规则,用于修改各候选模型的因果结构和机制,随后再依据历史证据与结构一致性进行演绎验证。在 DiscoverPhysics 基准上,EvoSCM 相较基线获得了更准确的解释与预测,同时提升了实验交互的利用效率。

用途与启示
  • 将智能体的科学信念从隐式自然语言转化为可检查、可干预和可修正的结构化因果模型。
  • 以竞争假设、主动实验和预测误差驱动模型演化,为闭环科研智能体提供可复用架构。
  • 通过可证伪预测与结构一致性验证增强科学发现过程的可信度和证据可追溯性。
  • 为物理规律发现、机制识别及其他需要低成本实验设计的自动化科研任务提供参考。
📝 原始笔记(逐字保留)
标题:EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation 来源:arXiv 链接:https://arxiv.org/abs/2609.01526 摘要:Scientific agents must learn not only how to reason, but also what to believe. However, existing LLM agents typically express scientific hypotheses in free-form text, leaving their beliefs implicit and difficult to test or revise. We introduce EvoSCM, which equips scientific agents with explicit structural causal models that evolve as new experimental evidence is collected. EvoSCM maintains a population of competing SCM hypotheses, each encoding a candidate causal explanation of the environment, and evolves them through a closed discovery loop. In each round, the agent abduces latent mechanisms from accumulated evidence, designs discriminative interventions, and commits to falsifiable predictions that it tests through experimentation. Discrepancies between prediction and observation are in

LLM 智能体商业评测中的构念效度失效

研究审计酒店交易智能体仿真,发现协议混杂、激励失真与生成随机性会使市场护栏的表观福利增益无法被有效识别。

 智能体评估 构念效度 评估方差 人工智能可靠性 智能体

研究在多轮酒店买卖测试床中审计 LLM 智能体商业政策评测,指出价格、利润和社会福利等经济指标未必真实对应所声称的行为构念。原始实现让有护栏和无护栏智能体采用不同的报价模式与选择流程;固定这些协议后,三个模型规模上的福利差异由 +87.4、+35.0、+28.8 变为 +7.2、-13.9、+23.8。对每个用户画像与条件重复三次生成后,14B 模型最大效应的均值从 +229 降至 +37.6,且生成残差解释了 49.9% 的变异,显示结果具有显著随机不稳定性。论文提出由激励有效性、协议隔离、随机稳定性和福利核算组成的构念效度契约,并要求在检查失败时先返回 INVALID 或 INCONCLUSIVE,而非直接作出政策结论。

用途与启示
  • 审计智能体仿真时,应确保实验组与对照组使用相同的报价结构、选择器和交互协议,避免把协议差异误判为政策效果。
  • 对高方差的交互式评测进行多次独立生成,并报告置信区间与方差来源,不能依赖单次运行的极端结果。
  • 在解释福利、利润等经济指标前,应通过正向对照验证智能体是否真正响应激励,以及环境是否能够表达目标经济行为。
  • 可将构念效度契约作为政策仿真的前置门槛,在有效性不足时明确标记结果为无效或结论不足。
📝 原始笔记(逐字保留)
标题:When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation 来源:arXiv 链接:https://arxiv.org/abs/2609.01519 摘要:Interactive simulations increasingly evaluate policies in markets populated by language-model agents. Their outputs can look economic---prices, profits, consumer surplus, and welfare---without instantiating the behavior named in the claim. We audit this risk in a multi-turn buyer--seller testbed for configurable hotel transactions. An initial implementation reported welfare gains from two marketplace guardrails of +87.4, +35.0, and +28.8 across a Qwen2.5 1.5B--14B ladder. It also gave guarded and unguarded agents different offer schemas and choice procedures. Holding the schema and buyer chooser fixed changes the paired contrasts to +7.2, -13.9, and +23.8. The four largest 14B single-generation effects averaged +229; after three generations per profile-condition, they averaged +37.6 (95% b

TempCloze:Video-LLM 能否识别视频缺失的中间片段?

TempCloze 通过从四个候选片段中识别视频缺失中段,评估 Video-LLM 摆脱语言捷径后的视觉时序推理能力,并揭示时间对齐是当前模型的主要瓶颈。

 模型评估 视频理解 时序推理 视觉推理 多模态

TempCloze 是一个面向 Video-LLM 的视频完形填空评测基准:模型看到视频的开头和结尾后,需要从四个候选项中找出真实的中间片段。数据集包含来自七个来源的 1,521 个严格筛选视频,以长镜头和第一人称视频为主,并通过相同来源、共享场景及物体的干扰项减少外观和语言线索。干扰项分别考察事件语义、时间对齐和事件进展三个维度。对 10 个闭源模型和 21 个开源模型的评测表明,模型通常能识别合理事件及局部进展,但在判断事件何时发生的时间对齐方面表现最弱;研究还分析了候选顺序、上下文方向、可见时长、帧密度和测试时扩展等因素。

用途与启示
  • 为 Video-LLM 提供弱化语言先验与选项措辞捷径的视觉时序推理评测。
  • 可用于区分语义理解、时间对齐和事件进展能力,定位视频模型的具体失效环节。
  • 结果提示后续训练应重点增强跨片段时间定位、长程事件衔接与第一人称视频建模能力。
  • 候选顺序和采样配置等敏感性分析可用于改进视频模型评测协议的稳健性。
📝 原始笔记(逐字保留)
标题:TempCloze: Can Video-LLMs Identify the Missing Middle? 来源:arXiv 链接:https://arxiv.org/abs/2609.01515 摘要:Temporal reasoning benchmarks for Video-LLMs are often mediated by language, leaving room for linguistic shortcuts from option wording, answer correlations, or language priors. To reduce such shortcuts, we introduce TempCloze, a video cloze benchmark for evaluating visual temporal reasoning in Video-LLMs. Given the beginning and ending clips of a video, models must identify the true missing middle from four candidates. TempCloze contains 1,521 carefully filtered videos from seven sources, mainly long-take and egocentric videos. We construct same-source distractors along three dimensions: Semantic asks what event should happen, Alignment probes when it should occur, and Progression tests how it should unfold, while shared scenes and objects reduce appearance cues. Our evaluation of 10 propr

GlossoGen:复杂多智能体交互中的涌现语言

GlossoGen 展示了 LLM 智能体在高压、信息不完全的协作环境中可自发形成具组合性和形态生产力、但人类难以理解的语言,并实现跨智能体传播与累积演化。

 多智能体系统 群体涌现行为 社会智能 智能体安全 人工智能可解释性

GlossoGen 是研究复杂多智能体场景中语言演化的平台,其中 SaveVeyru 场景要求掌握局部信息的智能体在压力下进行沟通。实验发现,LLM 智能体会形成偏离英语先验的新语言,这些语言具有组合性和形态生产力,但可能对人类不可理解。语言涌现依赖效率压力、底层模型能力,以及允许智能体协商语言惯例的“事后复盘”阶段。新智能体能够仅从实际使用中主动习得既有语言;强模型更有利于创造新语言,而较弱模型也可在语言形成后完成学习与传承。

用途与启示
  • 为研究多智能体通信协议的自发形成、传播和累积文化演化提供实验平台。
  • 提示智能体可能发展出人类难以监控的内部语言,需要加强通信审计与可解释性机制。
  • 表明“强模型创造、弱模型继承”的混合群体可能形成超越最低个体能力的集体能力。
  • 可用于分析效率压力、复盘协商和模型能力对群体语言演化的因果影响。
📝 原始笔记(逐字保留)
标题:GlossoGen: Emergent Language in Complex Multi-Agent LLM Interactions 来源:arXiv 链接:https://arxiv.org/abs/2609.01491 摘要:The growing rate at which LLM agents interact with one another raises key questions about language evolution in multi-LLM-agent settings, with implications for safety and monitorability as well as for linguistic accounts of LLMs. To address these questions, we introduce GlossoGen, a novel platform for studying multi-agent language evolution in complex scenarios. Within GlossoGen, we build the SaveVeyru scenario, which requires agents with partial information to communicate under pressure. We find that language evolution does occur between LLM agents, that the resulting languages are compositional and morphologically productive, and that they deviate from the LLMs' English prior in ways that render them incomprehensible to humans. Moreover, we identify several qualities essential to this ev

Defense-as-Skill:可演化的智能体运行时防护技能

Defense-as-Skill 将运行时安全守卫封装为可安装、检查和编辑的技能,并通过蒙特卡洛树搜索持续演化,以抵御恶意技能对智能体敏感操作的操纵。

 智能体安全 智能体技能库 运行时干预 技能演化 进化搜索

论文指出,持久加载的恶意技能可能根据具体任务和工作区状态泄露秘密、破坏代码、绕过审批或为数据外泄做准备,因此仅靠安装前审查并不充分。作者提出 Defense-as-Skill 范式,并实现 SkillSonar,使防护技能与不可信任务技能并行运行,依据用户任务边界将敏感操作判定为允许、重新规划或请求确认。研究构建了 SCOPE-R 数据集,覆盖 6 类风险、21 个子类别,包括 206 个已确认攻击的恶意实例和 43 个良性任务。SkillSonar 通过基于执行反馈的蒙特卡洛树搜索演化磁盘上的守卫技能,在 Claude Code 和 OpenClaw 上显著降低攻击成功率;GLM-5 重复实验中,ID ASR 从 0.482 降至 0.104,OOD ASR 从 0.606 降至 0.115。实验还显示其能够迁移至不同受害模型、未见风险类别和外部基准,并对自适应攻击保持防护能力。

用途与启示
  • 为加载第三方或可复用技能的智能体提供任务条件化的运行时安全层,弥补安装前静态审查的不足。
  • 将安全守卫实现为技能,可在不修改底层智能体运行时的情况下完成部署、检查和更新。
  • 利用执行反馈与搜索算法持续演化防御策略,为智能体技能生态中的自动化安全优化提供参考。
  • 通过允许、重新规划和人工确认三类决策,在攻击拦截能力与正常任务效用之间取得平衡。
📝 原始笔记(逐字保留)
标题:Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents 来源:arXiv 链接:https://arxiv.org/abs/2609.01487 摘要:Skill-augmented agents load reusable skills as persistent runtime context, improving task performance but also giving malicious skills a durable channel for steering future actions. Such skills may leak secrets, corrupt code, bypass approvals, or stage data for exfiltration only after a concrete user task and workspace state make the unsafe action appear useful. This makes pre-install vetting insufficient and calls for runtime, task-conditioned protection. We propose Defense-as-Skill, a defense paradigm that implements the runtime guard itself as an installable, inspectable, and editable skill. Our guard, SkillSonar, runs alongside untrusted task skills and checks sensitive actions against the user's task boundary, routing each action to an allow, replan, or confirmation decision without m

Harness-of-Harness:持续改进的多日自主软件开发框架

Harness-of-Harness 通过迭代式规划、编码、测试与独立评估,使现有编码智能体脚手架能够在多日自主开发中持续修复问题并扩展软件能力。

 人工智能辅助编程 智能体脚手架 长程任务 持续学习 执行验证

Harness-of-Harness(HoH)构建于现有编码智能体脚手架之上,将执行过程组织为反复迭代的规划、编码和测试闭环。框架通过平衡缺陷修复与能力增长、拆分小型可验证增量、区分开发期测试与独立评估,以及约束可验证产物来促进持续改进。它还会渐进开放交付物、角色专用工具和技能,鼓励复用已有成果,并维护版本化项目历史。在 GameCraft-Bench、FrontierSWE 和 ProgramBench 上,HoH 相对独立脚手架平均提升 52.25%,三轮迭代后的最高增益为 82.86%;在超过 70 轮的多日实验中,它自主开发出具备完整机制、剧情、视听效果和可玩体验的第一人称射击游戏。

用途与启示
  • 为编码智能体执行多日、长程软件开发任务提供可持续迭代的上层编排框架。
  • 表明独立评估、版本历史和小步可验证开发有助于避免智能体在长期循环中停滞或反复返工。
  • 可用于研究编码脚手架的持续演化,以及不同模型与开发工具组合的能力增益。
  • 为构建无需人工干预、能够兼顾缺陷修复与功能扩展的自主软件工程系统提供参考。
📝 原始笔记(逐字保留)
标题:Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 来源:arXiv 链接:https://arxiv.org/abs/2609.01481 摘要:This paper studies autonomous software development, in which LLM-based coding agents transform high-level requirements into complete, functional, and usable software systems without human intervention. We introduce Harness-of-Harness (HoH), a framework that enables coding agents to continually improve software during autonomous development. HoH operates on existing coding-agent harnesses, and organizes their executions into iterative planning-coding-testing loops. To sustain improvement across loops, HoH balances repair with capability growth, scopes development into small and verifiable increments, separates implementation-time testing from independent evaluation, and constrains verifiable outputs rather than prescribing agent workflows. It progressively exposes deliverables, role-specifi

面向长程智能体的实时轨迹模型与观察视图

论文提出将追加式事件账本增量折叠为类型化运行状态的实时轨迹模型,以紧凑、可审计的视图同时服务长程智能体和人类观察者。

 长程智能体 状态持久化 上下文压缩 轨迹审计 成本优化

论文设计了实时轨迹模型,将只追加的事件账本持续折叠为类型化运行状态,并为智能体与观察者编译不同视图。观察者实验中,编译视图将输入词元减少约 14~15 倍、成本降低 5~7 倍,同时把监控问答准确率从 0.48 提升至 0.85~0.87,但这一结果以视图模式覆盖问题为条件。在包含 120 个顺序依赖环节的任务上,维护运行统计量的逐步状态机制取得 30/30 成功,而完整上下文提示仅为 8/30;消融分析表明,确定性聚合贡献准确率,状态紧凑性贡献成本优势。相比更便宜的提示级 scratchpad,该方法的主要价值是确定性可审计,以及使用同一状态同时支持智能体执行与外部观察。

用途与启示
  • 为长程智能体提供一种避免原始执行轨迹持续挤占上下文窗口的结构化状态管理方案。
  • 可通过面向不同消费者编译专用视图,降低运行监控的词元消耗与调用成本。
  • 确定性轨迹折叠便于执行审计、状态复现和故障定位,适合高可靠智能体运行时。
  • 实验也提示应明确状态模式的覆盖边界;对于顺序敏感且无法由聚合状态保留的信息,轨迹折叠可能失效。
📝 原始笔记(逐字保留)
标题:Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers 来源:arXiv 链接:https://arxiv.org/abs/2609.01466 摘要:A long-horizon agent's trace outgrows both of its consumers: the human observer monitoring the run, and the agent itself, whose bounded context the trace must be folded back into. We present a live trace model, an append-only event ledger folded incrementally into typed run state and compiled into per-consumer views, and evaluate it for both consumers against deterministic ground truth. For the observer side, evaluated with an LLM reader as proxy, the compiled view answers monitoring questions using approximately 14x and 15x fewer input tokens (by reader) and at 5-7x lower cost than a budget-capped single-call reading of the raw trace, with higher accuracy (0.85-0.87 versus 0.48). Because the questions were co-designed with the view schema, we treat the token and cost reduction, conditiona

良性微调下的安全路由失效与对齐脆弱性

研究以低秩 Fisher 几何和输出路由机制解释良性微调为何会迅速破坏大模型的拒答能力,并分析 LoRA 与 ASAM 的有限保护作用。

 人工智能可靠性 安全对齐 模型训练 参数高效微调

论文指出,仅使用 100 个良性样本进行微调,就可能使模型安全拒答能力显著下降,而通用效用仅轻微退化。作者提出 Fisher 几何解释:安全 Fisher 具有低秩结构,对齐训练会使安全几何变平,同时保留一条与安全相关的输出路由路径。良性微调会在输出侧 MLP 模块中选择性地重新增强该路径的尖锐度,从而导致安全能力非对称崩溃;少量安全样本又能恢复拒答,说明内部安全表征并未消失。LoRA 和 ASAM 可通过抑制输出侧尖锐度延缓早期崩溃,但随着微调规模扩大,其保护效果会逐渐减弱。

用途与启示
  • 将微调后的安全退化理解为低秩输出路由机制受扰,而不只是安全目标与任务目标之间的梯度冲突。
  • 可重点监测输出侧 MLP 的 Fisher 谱与尖锐度变化,作为良性微调引发安全失效的预警信号。
  • 少量安全数据能够恢复拒答行为,提示可设计低成本的安全再对齐或周期性安全校准方案。
  • LoRA 等参数高效方法并不能长期保证安全稳定性,扩大微调数据规模时仍需持续开展攻击成功率和拒答能力评估。
📝 原始笔记(逐字保留)
标题:When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning 来源:arXiv 链接:https://arxiv.org/abs/2609.01455 摘要:Benign fine-tuning severely weakens the safety alignment of large language models (LLMs), so we study why refusal behavior is so fragile. While prior work often attributes this failure to gradient conflict, we propose a fundamentally different Fisher-geometric explanation: safety Fisher is low-rank, and alignment makes the safety geometry flatter while preserving an output-routing pathway. After 100 benign fine-tuning examples, this pathway is selectively re-sharpened in output-side MLP modules, explaining the asymmetric fragility: safety can collapse to high attack success rates, while general utility degrades mildly. The routing view also explains why few safety examples can restore refusal behavior, indicating that internal safety-relevant representations are preserved. Finally, we show

扩散课程训练实现无时间步迭代推理

研究通过持久隐藏状态与无时间步条件的共享更新,将扩散去噪器转化为可任意加深推理的 anytime solver,并揭示扩散的关键作用在于提供训练课程而非推理时采样。

 推理 模型训练 测试时计算 扩散模型 课程学习

研究为扩散去噪器加入持久隐藏状态,并移除时间步条件,使同一个更新模块能够递归运行至任意深度。模型在推理深度远超训练展开长度和反向传播窗口时仍持续提升准确率,在 Sudoku-Extreme 上达到 99.90% 精确求解率,在 Maze-Unique 上达到 98.93%。推理阶段无需渐进式去噪:每一步为非线索变量重新注入高斯噪声,仍能沿单条轨迹探索解空间并收敛到稳定答案。实验表明,有序退火噪声在训练中依然关键,说明扩散机制主要充当由易到难的去噪训练课程,而非必需的推理采样流程。

用途与启示
  • 为递归推理模型提供可超越训练深度泛化的共享更新架构。
  • 表明增加测试时迭代深度可持续改善求解效果,为 anytime reasoning 提供新路径。
  • 将扩散过程重新解释为训练课程设计,可用于构造由不同噪声难度组成的推理训练数据。
  • 单轨迹噪声注入无需并行采样、候选筛选或外部验证器,有望降低复杂推理的计算与系统开销。
📝 原始笔记(逐字保留)
标题:Diffusion as a Training Curriculum for Timestep-Free Iterative Reasoning 来源:arXiv 链接:https://arxiv.org/abs/2609.01449 摘要:Diffusion models and recursive reasoners are both iterative, but they carry information across iterations differently. We add a persistent hidden state to a diffusion denoiser and remove its timestep conditioning, leaving a single shared update that can be run to arbitrary depth. The result is an anytime solver: accuracy keeps improving with inference depth far beyond the rollout lengths and backpropagation window used in training, reaching 99.90% exact solve on Sudoku-Extreme. We also obtain 98.93% solve rate on Maze-Unique. Surprisingly, progressive denoising is unnecessary at inference: holding corruption at its maximum by replacing every non-clue variable with fresh Gaussian noise at each step retains near-perfect solving and converges to stable solutions. This simple noise-injection m

从生产流量到后训练:构建覆盖企业请求的自托管 LLM

该研究基于逾 200 个企业内部应用的真实流量,通过分轴 GRPO 训练与两阶段 SLERP 合并,将请求整合至单一自托管模型,并以较低成本承载每月 1.16 亿次请求。 [合并自 2026-09-03 llm] 研究通过生产错误分析、分领域 GRPO 训练与两阶段 SLERP 合并,将 200 多个内部应用的请求整合至单一自托管模型,并以更低成本承接一半平台流量。

 后训练 强化学习 模型开发 模型评估 成本优化 模型训练 业务集成

研究从 200 多个内部应用的真实生产错误出发,围绕指令遵循、函数调用和企业内部任务分布三个维度识别模型质量缺口。团队构建了按生产流量分层的离线基准,并使用确定性验证器或校准后的 LLM 评判模型进行评分。为避免联合优化产生跨领域奖励干扰,研究分别训练三个 GRPO 专家,再通过两阶段 SLERP 合并,同时针对语义坍缩、过度调用和冗长奖励作弊采取领域专用修复。最终模型在内部 Arena、指令遵循和函数调用评测上超过总参数量约大 7 倍的基线,并以较低服务成本承接每月 1.16 亿次请求、约占平台流量的 50%。

[合并自 2026-09-03 llm] 研究团队依据生产错误分析,将企业请求的质量缺口拆分为指令遵循、函数调用和内部任务分布三个维度,并构建与真实流量分层对齐的离线评测。为避免多目标联合优化造成跨领域奖励干扰,团队分别训练三个 GRPO 专家,再通过两阶段 SLERP 合并模型。不同专家暴露出语义坍缩、过度调用和冗长度投机等独特失效模式,需要针对性的奖励与训练修正。最终模型在非推理模式下超过总参数量约大 7 倍的基线,并承接平台 50% 的流量,即每月约 1.16 亿次请求。

用途与启示
  • 展示如何用真实生产流量与错误分析驱动企业 LLM 后训练,而非仅依赖通用公开基准。
  • 说明将相互干扰的训练目标拆成独立专家、再进行权重合并,可缓解跨领域奖励干扰。
  • 提醒企业分别监控语义坍缩、函数过度调用和冗长度投机等奖励作弊或退化现象。
  • 为受数据驻留约束的企业提供整合模型服务集群、降低 GPU 碎片化与推理成本的实践路径。

[合并自 2026-09-03 llm]

  • 展示了以真实生产错误和流量分布驱动企业模型后训练与评估的方法。
  • 分领域训练 GRPO 专家可降低多目标联合优化中的奖励干扰,再通过权重合并获得统一模型。
  • 奖励设计需分别防范语义坍缩、函数过度调用和冗长奖励作弊等特定失效模式。
  • 单模型整合多个历史模型的服务流量,可缓解 GPU 资源碎片化并降低自托管成本。
📝 原始笔记(逐字保留)
标题:From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix 来源:arXiv 链接:https://arxiv.org/abs/2609.01572 摘要:Data-residency constraints force enterprises to self-host LLMs, but continuous adoption of newer models without decommissioning their predecessors expands the serving fleet, fragmenting a finite GPU pool. We consolidate traffic from over 200 internal applications onto a single model by closing quality gaps identified through production error analysis along three axes: instruction following, function-calling, and internal task distribution. Quality is tracked by offline benchmarks stratified to production traffic and scored by deterministic verifiers or calibrated LLM judges. Rather than optimising all objectives jointly, which introduces cross-domain reward interference, we train a separate GRPO expert per axis and merge them via two-stage SLERP. Each expert's reward exposes a distinct fai [合并自 2026-09-03 llm] [从生产流量到后训练:构建覆盖企业请求组合的自托管 LLM(31 ▲)](https://huggingface.co/papers/2609.01572?utm_source=digest-papers&utm_medium=email&utm_campaign=2026-09-02)

LatentPress:超越文本与视觉的上下文压缩

LatentPress将长文档和对话历史压缩为可由冻结解码器直接读取的连续记忆词元,以较小适配器实现4至16倍压缩并显著提升读取效率。

 上下文压缩 长上下文 智能体记忆 系统优化 模型训练

LatentPress不再将压缩上下文表示为文本或图像,而是生成可通过输入嵌入接口直接送入冻结语言模型的连续记忆词元,推理时无需重建文本。该方法仅训练一个与读取模型匹配的小型写入适配器,参数量为420万至2620万,约占解码器的0.1%,可实现4至16倍压缩。在LongMemEval上,其以7.70倍压缩取得0.504准确率,高于未压缩证据的0.490,并显著超过文本摘要和基于OCR的压缩方法。在LongBench-QA中,域内写入器在4至8倍压缩下可匹配或超过原始上下文,同时读取速度提升5至9倍,并展现出跨任务、跨文档领域的零样本迁移能力。

用途与启示
  • 为长上下文和长期记忆系统提供面向机器的潜在表示接口,避免文本摘要造成的信息损失与重建开销。
  • 只需训练轻量适配器即可适配冻结解码器,适合低成本扩展现有语言模型的上下文容量。
  • 连续记忆词元兼具压缩率、读取速度和问答准确率,可用于长程智能体、对话历史存储及文档问答。
  • 跨数据集迁移结果表明,软词元压缩有望成为文本与视觉之外的通用上下文载体。
📝 原始笔记(逐字保留)
标题:LatentPress: Context Compression Beyond Text and Vision 来源:arXiv 链接:https://arxiv.org/abs/2609.01507 摘要:Compressed context is usually carried as human-readable text or as rendered images that must be decoded, even when its consumer is a language model. We introduce LatentPress, which writes conversational histories and long documents into a third representation: continuous memory tokens that a frozen decoder reads directly through its input-embedding interface, with no text reconstruction at inference. A small reader-matched writer compresses $4$-$16\times$ while training only an adapter (4.2M-26.2M parameters, $\sim\!0.1\%$ of the decoder). On LongMemEval, LatentPress reaches $0.504$ accuracy at $7.70\times$ compression versus $0.490$ for uncompressed evidence, outperforming text summaries (0.184) and OCR-based compression (0.426 to 0.312). On LongBench-QA, in-domain writers match or exceed
0%