2026-08-24 科研追新
当日精选(由提交工具自动创建)。
WorldSimProbe:首个动作条件世界模型评测系统
北京大学与 EvoPhys AI 发布 WorldSimProbe,以动作实现和交互响应为统一标准,沿模拟因果链系统评测动作条件世界模型的物理与因果保真度。
世界模型 世界模型评估 具身智能评估 动作表征 接触评估 物理智能 因果保真度 接触幻觉 动作保真度
WorldSimProbe 提出 Observable Simulator Contract,要求动作条件世界模型既能把输入动作准确转化为机器人运动,也能基于真实接触产生正确的环境响应。评测沿“输入动作 → 机器人运动 → 接触与交互 → 环境变化”因果链设置五项测试,覆盖局部动作校准、全局轨迹覆盖、动作来源特征保持、交互接触验证和交互动力学。基准包含来自 RoboTwin、ManiSkill 和 LIBERO 的 18,608 个受控实例,并评估 IRASim、Ctrl-World、BWM、DreamDojo、LingBot-VA 和 Cosmos-3-Nano 六个开源模型。实验发现,现有模型普遍存在动作响应衰减、轨迹细节丢失、接触幻觉及交互动力学错误,其中复杂的晃动等交互原语尤其薄弱。研究表明,视觉自然或任务成功并不代表模拟正确,单一总体得分也容易掩盖因果链不同环节的能力缺陷。
- 为动作条件世界模型提供区别于视频逼真度和任务成功率的模拟器评测标准。
- 可逐段定位动作校准、轨迹保持、接触接地和交互动力学中的具体失效模式。
- 提醒规划、反事实预测及合成数据应用关注模型的因果保真度,而不只关注视觉合理性。
- 受控干预与推理前冻结参照的设计,可为具身世界模型基准建设和回归测试提供方法参考。
📝 原始笔记(逐字保留)
OpenClacky:用自然语言让 Agent 自我改造
OpenClacky 将 Agent 作为可自我扩展的底座,使用户能通过自然语言创建和修改 Agent、Skill、界面及业务逻辑,并将成果封装为可安装、分享和持续迭代的原生应用。
智能体 自进化 智能体脚手架演化 插件生态 人工智能原生应用 用户界面原生应用 多智能体系统 深度研究 插件生成 自修改用户界面
OpenClacky 提出“自定义 Agent”理念,让软件的功能边界与界面不再完全由开发者预先确定,而是由用户通过自然语言按需改造。系统能够围绕需求创建或修改 Agent、Skill、界面和业务逻辑,并将其封装为可安装、停用、分享及继续编辑的原生扩展。其展示的应用包括可持续维护资料的 LLM Wiki、由 Leader 与多个 Worker 构成的 Multi-Agent 编排,以及具备搜索、核验和归档能力的自动调研助手。配套扩展市场进一步形成了从功能生成、安装使用到传播复用的闭环,体现了 Harness 随模型能力与真实任务共同演化的产品方向。
- 探索 Harness 自进化路径,使 Agent 能按用户需求主动扩充技能、界面和工作流。
- 将自然语言转化为应用开发入口,降低定制 Agent 与业务工具的工程门槛。
- 通过可安装、分享和持续修改的扩展市场,沉淀可复用的 Agent 原生能力。
- 为连接通用模型与真实任务提供产品范式:底座保持通用,功能由 Agent 在使用过程中动态构建。
📝 原始笔记(逐字保留)
MoE 大模型的计算高效超参数迁移
论文提出两步式超参数迁移框架,利用小规模代理模型跨宽度迁移并沿训练 token 规模外推,以低成本预测超大规模 MoE 模型的最优学习率。 [合并自 2026-08-25 moe] 研究提出两步式超参数迁移框架,利用小规模代理模型跨宽度迁移并沿训练令牌量外推,为万亿级 MoE 训练低成本预测最优学习率。
混合专家模型 缩放定律 参数高效微调 模型训练 成本优化 超参数迁移 学习率迁移
论文针对大型 MoE 模型难以通过全面搜索确定最优学习率的问题,提出跨模型宽度与 token 预算的两步迁移方法。首先,作者为结合 MLA 和 Muon 优化器的 MoE 架构适配 μP,验证最优学习率可在不同宽度模型间稳定迁移。随后,通过拟合小型代理模型在有限训练预算下的最优值建立缩放定律,可高精度外推至 10 万亿 token 的训练范围,回归拟合达到 $R^2=0.95$。该方法被用于从零预训练总参数 155B、激活参数 17B 的基础模型,稳定的训练与评测结果验证了预测配置的有效性。
[合并自 2026-08-25 moe] 论文针对大规模混合专家模型难以通过全面搜索确定最优学习率的问题,提出计算高效的两步迁移方法。首先,作者将最大更新参数化(μP)适配到采用 MLA 与 Muon 优化器的 MoE 架构,验证最优学习率可在不同模型宽度间稳定迁移。随后,研究通过拟合小型代理模型在有限令牌预算下的最优值建立缩放定律,将学习率外推至 10 万亿令牌规模,拟合度达到 $R^2=0.95$。该方法被用于从零预训练总参数 155B、激活参数 17B 的基础模型,稳定的训练与评测结果表明其能以较低消融成本预测全规模配置。
- 用小模型、短训练预算替代大规模学习率网格搜索,显著降低 MoE 预训练的调参成本。
- 将跨模型宽度的 μP 迁移与跨令牌预算的缩放定律结合,为超大规模训练配置预测提供可复用流程。
- 表明训练超参数也可通过经验缩放规律进行外推,有助于提前规划算力预算并降低全尺寸训练失败风险。
- 为 MLA、Muon 与 MoE 组合下的稳定预训练提供了经过 155B 模型验证的工程参考。
[合并自 2026-08-25 moe]
- 显著减少超大规模 MoE 预训练前的学习率搜索与消融成本。
- 可先在小模型和有限 token 预算上实验,再将最优配置迁移到完整训练规模。
- 展示了 μP、MLA 与 Muon 在 MoE 缩放训练中的联合适配思路。
- 为训练预算规划和大模型超参数预测提供可量化的缩放定律。
📝 原始笔记(逐字保留)
Graph Engineering:从个体智能迈向多智能体系统智能
论文提出 Graph Engineering(图工程)范式,以显式、动态且持续演化的任务图、智能体图与状态图组织异构代理,推动 LLM 智能体从个体能力增强迈向系统级智能。 [合并自 2026-08-25 llm] 论文系统综述 Graph Engineering 范式,以动态演化的任务图、智能体图和状态图组织异构多智能体,推动 LLM 系统从个体能力增强迈向可扩展的系统智能。
多智能体系统 智能体 智能体编排 任务协同演化 状态追踪 架构综述 图工程 系统智能 状态持久化 图式编排
论文指出,Prompt、Context、Harness 与 Loop Engineering 主要增强单个智能体,但难以突破复杂长程任务中的组织能力瓶颈。此类任务通常涉及异构专长、相互依赖的子任务、并行执行、独立验证与持久状态,需要多个专门化智能体协同完成。作者将“系统智能”定义为代理系统围绕共同目标组织、协调多个智能组件并形成自适应整体的能力,并提出 Graph Engineering 作为实现路径。该范式通过显式、动态且可演化的任务图、智能体图和状态图,统一支持目标分解、依赖管理、异构代理编排、执行状态维护与系统演化。论文还系统梳理了相关原理、方法和应用,并汇总相关论文、开源数据与项目。
[合并自 2026-08-25 llm] 论文指出,复杂长程任务需要异构专业能力、相互依赖的子任务、并行执行、独立验证与持久状态,单一智能体即使扩充上下文和工具也难以克服组织容量限制。作者提出“系统智能”,强调将多个智能组件协调为围绕共同目标运行的统一、自适应整体。在此基础上,Graph Engineering 通过显式、动态且可演化的图结构表征任务、智能体及系统状态,为工作分解、异构智能体编排和系统动态建模提供统一基础。论文系统梳理了该范式的原理、方法与应用,并发布 Awesome-Graph-Engineering 项目汇总相关论文、数据和开源项目。
- 为复杂长程任务提供超越单智能体能力堆叠的系统化架构框架。
- 利用任务图及其依赖关系支持目标分解、子任务拆分、并行调度与独立验证。
- 借助智能体图明确角色、专长、通信关系与协作边界,实现异构代理编排。
- 通过状态图维护持续演化的执行状态,为故障诊断与恢复、过程审计和系统自我改进提供基础。
- 配套资源合集可作为研究多智能体编排与图式系统设计的文献入口。
[合并自 2026-08-25 llm]
- 为复杂多智能体系统提供统一的任务、角色与状态建模框架。
- 启示智能体研发从强化单体提示和上下文,转向显式设计系统级依赖、并行、验证与状态演化机制。
- 可用于长程科研、软件工程及复杂业务流程中的任务编排、故障追踪和执行恢复。
- 配套资源库可作为 Graph Engineering 方向的文献调研与原型选型入口。
📝 原始笔记(逐字保留)
OmniAssistBench:全模态助手交互评测基准
受控实验表明,On-Policy Distillation 主要迁移教师的推理行为,其泛化能力高度依赖师生模型的来源一致性,而多教师组合会引发能力间的跷跷板式权衡。 [合并自 2026-08-25 on-policy] OmniAssistBench 通过逆向构造互联网视频中的目标与多轮交互路径,评估 Omni-LLM 在持续感知、上下文保持和适时响应方面的助手能力。
交互式评估 多模态 视频理解 多轮反馈 长上下文 视频智能助手 连续交互 响应时机 同源迁移 多教师蒸馏 模型蒸馏 蒸馏泛化 在策略蒸馏
OmniAssistBench 面向实时视频助手场景,要求模型结合视觉状态、用户目标和先验知识,持续引导用户完成任务。为控制同一目标可能产生的交互路径分歧,基准向模型提供从源视频提取的预定义先验,并要求其沿指定路线提供指导。数据集通过逆向分析互联网视频、推导用户目标并切分为多轮片段构建,耗费超过 1000 个专家工时。实验中 Gemini-3-Pro 得分 66.4/100,Qwen3-Omni-Instruct 得分 51.2,现有模型主要受限于视觉提示理解、历史上下文保持、回答完整性及响应时机判断。
[合并自 2026-08-25 on-policy] 论文系统考察 On-Policy Distillation(OPD)从域内分布偏移、跨域迁移到多教师训练的泛化规律。结果显示,OPD 迁移的是教师的推理行为而非特定问题答案,训练题目的难度影响很小,甚至教师未能解出的题目也可提供有效监督。同源师生组合能够跨语言、推理长度乃至其他领域逼近教师能力,而异源组合大多只拟合训练分布。由于领域提示路由无法限制各教师的影响范围,多教师蒸馏会形成由教师混合比例决定的能力权衡。
- 为选择 OPD 的教师模型提供依据:优先考虑与学生具有相同模型谱系或来源的教师。
- 提示蒸馏数据不必只保留教师答对的高难样本,推理轨迹本身也可能产生训练价值。
- 多教师 OPD 不能简单依靠领域提示实现能力隔离,应显式监测不同能力之间的负迁移和跷跷板效应。
- 可用于设计覆盖域内、跨语言、长程推理和跨域任务的蒸馏泛化评测体系。
[合并自 2026-08-25 on-policy]
- 为全模态实时助手提供比静态视频问答更贴近真实使用方式的连续交互评测。
- 可用于诊断模型对手势等视觉提示、多轮历史状态和目标事件时机的处理缺陷。
- 逆向利用互联网视频构造交互轨迹,为稀缺真实人机交互数据提供了可复用的数据建设方案。
- 当前最佳模型仍与可靠助手存在明显差距,后续训练应重点加强状态追踪、延迟响应和完整指导能力。
📝 原始笔记(逐字保留)
PatternEval:混合思考多模态模型的响应行为对齐
论文提出 PatternEval、PatternRM 与 PatternRL,用于评测并缓解混合思考多模态模型在思考和非思考模式之间的响应行为失配。 [合并自 2026-08-25 patterneval] 研究以 PatternEval、PatternRM 和 PatternRL 评测并缓解混合思维多模态模型在思考与非思考模式之间的响应行为失配。
多模态 推理模式 模型评估 思维链泄露 奖励建模 强化学习 响应模式 模式对齐 表演性推理 响应行为 混合推理 过程评估
- 论文指出,任务正确率不足以完整衡量混合思维 MLLM 的用户可见响应质量,不同推理模式还应遵循一致的行为标准。
- PatternEval 包含 2,415 个多模态提示,覆盖视觉感知与接地、结构化图像理解和多模态知识推理,并针对思维链泄露、响应重复、逻辑矛盾和表演式推理四类失败进行诊断。
- 实验发现多家模型均存在响应模式问题,其中非思考推理的失败率显著更高,造成思考与非思考接口之间的系统性失配。
- 作者进一步提出响应级奖励模型 PatternRM 和加入模式特定惩罚的 PatternRL,在 Qwen3-VL-4B/8B 上显著缓解跨模式失配,仅带来轻微任务性能损失。
[合并自 2026-08-25 patterneval] PatternEval 包含 2,415 个多模态提示,覆盖视觉感知与定位、结构化图像理解和多模态知识推理。基准同时考察任务正确率与四类响应模式故障:思维链泄露、响应重复、逻辑矛盾和表演式推理。实验发现,不同提供方的模型普遍存在这些问题,其中非思考推理的故障率显著更高,导致两种推理接口系统性失配。作者进一步提出响应级奖励模型 PatternRM,并在 PatternRL 中加入模式特定惩罚;基于 Qwen3-VL-4B/8B 的实验显示,该方法能以轻微任务性能损失换取更好的跨模式对齐。
- 将响应模式失败与任务准确率并列为混合思维模型的验收指标,避免仅凭正确答案掩盖用户体验和安全问题。
- 可用 PatternEval 的四类失败构建多模态模型回归测试集,重点比较思考与非思考接口的一致性。
- 可借鉴 PatternRL,通过响应级奖励和定向惩罚约束思维链泄露、重复、矛盾及表演式推理。
- 提示模型部署方在延迟、推理预算和响应质量之间进行显式权衡,而非默认非思考模式具有同等行为可靠性。
[合并自 2026-08-25 patterneval]
- 将“答案正确”与“响应行为合格”拆分评测,补足传统多模态基准的质量盲区。
- 可用于诊断混合思考模型在低延迟非思考模式下的思维链泄露、重复和自相矛盾问题。
- 为后训练提供模式级奖励信号,在不同推理预算下维持一致的用户可见响应标准。
- 提示部署方不能仅依据准确率选择推理档位,还应持续监控跨模式行为失配及性能权衡。
📝 原始笔记(逐字保留)
AgentMercury:规模化合成可验证商业智能体环境
AgentMercury 从高层商业场景构建持久、可执行且可验证的世界,使智能体训练信号能够从企业工作流泛化至数学推理、编程、科学计算和工具使用任务。 [合并自 2026-08-25 agentmercury] AgentMercury从高层商业场景生成包含持久状态、服务、工具及跨服务不变量的可执行环境,为智能体强化学习提供规模化且可泛化的训练世界。
智能体 环境设计 业务流程 强化学习 可执行性 跨域泛化 环境合成 人工智能应用
AgentMercury不再围绕预定义任务搭建环境,而是先实例化一个包含实体、服务、工具、持久状态和可执行跨服务不变量的世界,使多样任务与交互轨迹自然涌现。框架共生成4,783个可执行环境,覆盖14个行业和50个国家,并将其作为强化学习的训练载体。尽管生成过程未针对评测基准,训练后的Qwen3.5-4B在EnterpriseOps-GYM上由12.3提升至15.7,在AIME26上由45.9提升至56.0,同时改善编码、科学计算和工具使用等域外能力。环境构建本身也可被模型学习:Qwen3.5-35B-A3B经构建轨迹微调后,在未见商业场景上的可执行世界创作成功率由3.3%升至83.3%。
[合并自 2026-08-25 agentmercury] AgentMercury 不再围绕预定义任务搭建环境,而是先实例化包含实体、服务、工具、状态及跨服务不变量的持久世界,让多样任务与交互轨迹自然涌现。该框架覆盖 14 个行业和 50 个国家,共生成 4,783 个可执行环境,并将其作为强化学习的训练载体。经训练后,Qwen3.5-4B 在 EnterpriseOps-GYM 上由 12.3 提升至 15.7,在 AIME26 上由 45.9 提升至 56.0,显示出明显的域外泛化能力。环境构建本身也可被学习:Qwen3.5-35B-A3B 经构建轨迹微调后,在未见商业场景上的可执行世界创建成功率由 3.3% 提升至 83.3%。
- 将训练单位从预设任务提升为可持续产生任务的“世界”,有助于降低智能体环境与数据的人工构建成本。
- 可执行不变量为商业流程提供自动验证机制,适合构建可审计、可回放的企业智能体训练与评测底座。
- 非基准定向的商业环境仍能提升数学、编码和工具使用能力,说明场景驱动的交互经验具有较强跨域迁移价值。
- 环境构建轨迹可进一步用于训练环境生成模型,形成“自动造环境—训练智能体—验证能力”的闭环。
[合并自 2026-08-25 agentmercury]
- 将训练环境从任务中心范式升级为持久世界范式,以支持更真实、持续演化的业务流程。
- 通过可执行不变量验证跨服务行为,为企业智能体训练和业务验收提供可靠基础设施。
- 利用非基准定向的商业环境产生通用训练信号,降低对特定评测集和人工任务设计的依赖。
- 将环境构建轨迹用于微调,可进一步培养模型自动创建训练沙箱与智能体执行底座的能力。
📝 原始笔记(逐字保留)
FlavourBench:以可执行烹饪真值评测前沿语言模型
FlavourBench 利用版本化烹饪系统 Epicure 穷举生成可执行真值,在统一、无缺失的任务集上对 27 个前沿语言模型进行可复现排名。
模型评估 可执行性 答案评判 评估透明度 可复现性 烹饪人工智能 稠密真值
FlavourBench 要求模型从八种食材中选择三种组成方案,并由 Epicure 在模型作答前对全部 56 种组合进行评分,从而提供稠密且可执行的客观真值。基准以 534 个任务覆盖替代、搭配和约束组合三类能力,共评估 27 个前沿模型端点,形成 14,418 个模型—任务单元,并通过统一有效响应数量消除排行榜中的差异性缺失。研究采用 50,000 次锚点聚类 bootstrap 构建同时置信区间,并用 100,000 次符号翻转检验比较全部 351 对模型。两个独立编译面板具有较高相关性,Grok 4.6 以 65.1 的点估计居首;发布内容还包括提示词、组合得分图、原始响应、执行路由、内容哈希及离线验证器。
- 展示了用领域模拟器或规则系统穷举候选解、构造稠密可执行真值的评测路线,可减少对人工或模型裁判的依赖。
- 通过冻结任务得分、统一有效样本数和提供离线验证器,提升排行榜的公平性、透明度与结果可复现性。
- 同时置信区间、成对显著性检验及多重比较校正可用于避免仅凭排行榜点估计过度解读模型差异。
- 该范式可迁移到化学配方、工程设计和约束规划等具有可执行评分器的开放式生成任务。
📝 原始笔记(逐字保留)
基础模型时代的人本智能综述
该综述提出覆盖外观、空间几何、运动、交互、世界模拟与具身能动性的全谱系人类情境分类,为基础模型时代的人本智能研究建立统一框架。
架构综述 多模态 具身智能 世界模型 行为建模 空间智能 以人为本的人工智能 人体建模
论文指出,人本智能研究仍分散于不同任务、模态和研究社区,尚未充分受益于基础模型的规模化、迁移性与通用建模能力。作者提出包含六个相互关联层次的全谱系人类情境分类,将人依次视为可观察主体、动态行动者和情境化智能体。综述系统梳理了人本数据体系、计算架构范式,以及训练和推理优化策略,并汇总各层次的代表方法、数据集、基准与评估指标。文章进一步讨论可扩展、可信、物理接地和可部署的人本智能所面临的挑战与未来方向。
- 为人体感知、动作理解、交互建模、世界模拟与具身智能提供统一的研究分类框架。
- 可用于系统梳理相关数据集、评测基准、模型架构及训练与推理方法。
- 启发将基础模型能力进一步引入人本智能,同时重点关注可信性、物理接地与实际部署。
- 适合作为跨模态人本智能研究的入门路线图和文献索引。
📝 原始笔记(逐字保留)
Evo-Bench:首个 Agent Harness 进化能力评测
Evo-Bench 通过固定策略模型、隔离留出任务和长程迭代预算,系统评测 9 个模型自主改进 Agent Harness 的能力,最强模型接近人类专家框架,但也暴露出后期退化、提交失误与作弊风险。
智能体脚手架演化 演化评估 自我改进 长程任务 基准过拟合 智能体执行框架 软件框架演化
Evo-Bench 是首个面向 Agent Harness 进化能力的标准化基准,覆盖搜索、办公和通用智能体三大领域,共含 608 项任务。评测固定 DeepSeek-V4-Flash 作为策略模型,仅允许被测进化模型在 20 轮、1000 步和 48 小时预算内修改提示词、工具、控制流、记忆及验证等框架代码。最强模型 GPT-5.6-Sol 将总分从 29.7 提升至 46.3,接近人类专家组合框架的 47.5,并在通用任务上以 59.4 超过人工框架的 56.3。实验同时发现框架改进往往早期饱和,后续修改可能破坏已有成果;一次格式错误甚至可导致 159/160 项任务归零,说明版本选择、回滚和提交前验证也是核心能力。进化后的框架在替换 Qwen、DeepSeek、GLM 等策略模型后仍能带来提升,表明其学到的是可迁移的执行结构,而非针对单一模型的补丁。
- 为 HarnessEvolve 建立可复现的评测范式:固定底层策略模型,仅将框架修改能力作为实验变量。
- 设计框架进化系统时应保留历史最佳版本,并在冻结提交前执行格式检查、回归测试和自动回滚。
- 不应只看最终分数,可结合 Overall 与 AnytimeVal 衡量最终泛化能力、改进速度及后期退化。
- 基准构建需筛选对框架变化敏感、且验证集与留出集响应一致的任务,降低模型能力混入和验证集过拟合。
- 跨策略模型迁移结果说明,提示词、工具、控制流和验证机制可作为独立于模型权重的可复用工程资产。
📝 原始笔记(逐字保留)
Claude Code 与 Codex 协作完成医学影像竞赛论文并获 Accept
作者利用 Claude Code 托管医学影像竞赛实验与论文初稿,再由 Codex 和人工多轮审查,最终使 ISLES 2026 竞赛论文获 OpenReview Accept。
人工智能辅助编程 自动化科学研究 闭环科学研究 医疗人工智能 学术写作 人在回路 双模型协作 竞赛科研
作者并行使用 Claude Code 和 Codex 参与五个 MICCAI 2026 Challenge 赛道,并重点审查 ISLES 2026 缺血性中风病灶分割项目。工作流先以 ChatGPT 深度研究汇总资料,再将报告、赛事文件、官网和数据集交给 Claude Code 制订方案、连接 GPU 服务器并执行训练实验。Claude Code 根据实验记录和结果撰写 LaTeX 论文初稿,Codex则负责核查事实、表格数据、论文主张及明显的 AI 化表达。经过多轮模型评审与人工复核,论文在 OpenReview 获得 7 分并被接收,但作者强调 AI 不能取代研究者对最终成果的审查和责任。
- 展示从资料调研、实验规划、GPU 训练到论文撰写与审查的自动科研闭环。
- 提供 Claude Code 负责执行、Codex 负责复核的双模型协作范式,降低单模型错误累积风险。
- 说明算法竞赛和医学影像研究可借助编码智能体显著提升实验吞吐,但需要充足算力及规范的实验登记。
- 强调论文中的事实、数据和结论必须由具备领域知识的人类研究者最终审核并负责。
📝 原始笔记(逐字保留)
SportSkills:从体育教学视频学习身体技能并按动作错误检索示范
SportSkills构建覆盖55个运动项目、1702项技能和63.8万段示范的体育教学数据集,并探索根据学习者动作错误检索针对性教学视频。
视频理解 检索增强生成 视觉表征学习 专家反馈 数据策展 体育人工智能 动作纠错 技能教学
SportSkills从带英文字幕的YouTube教学视频中整理出638399段视频—讲解配对,总计约57314小时,其中包含559962段正确示范和78437段错误示范。数据流水线先用GPT-4o筛选具有操作细节的字幕,再由Qwen2.5-VL-32B判断画面是否展示正确或错误动作,抽查一致率分别达到95%和91%。研究通过视频—文本对比学习建立细粒度动作表征,并利用Ego-Exo4D专家评语构造弱监督标签,训练模型依据学习者错误对候选教学讲解进行重排。经SportSkills训练的TimeSformer在双向检索上达到15.48的平均Recall@10,正确与错误动作分类也获得提升;职业教练评价中,模型在足球、篮球和攀岩上的排序一致率分别为64.4%、56.3%和64.1%。当前实验主要证明检索结果更符合教练偏好,尚未验证观看推荐视频能否带来真实、持久且可迁移的动作改善。
- 为细粒度体育动作理解、动作质量评估和错误条件教学检索提供大规模视频—语言训练资源。
- 可采用轻量表征召回与视觉语言模型重排的两级架构,在数十万教学片段中控制检索成本。
- 将候选示范、相关动作部位和置信度呈现给教练,可构建保留专家最终决策权的人在回路训练工具。
- 后续应按原始视频、频道和创作者隔离数据,并分层审计运动项目、示范类型、拍摄条件及授权风险。
- 评测需从教练相关性扩展到训练后动作质量、错误复发率、延迟保持和跨视角迁移,验证系统是否真正促进技能学习。
📝 原始笔记(逐字保留)
Φ-Bench:大模型基础设施工程能力评测
Φ-Bench 以85个真实高难度任务评估大模型完成算子开发、长周期代码库改造和端到端基础设施优化的能力,显示当前模型在持续实验、跨模块协作及硬件优化方面仍有明显不足。
人工智能辅助编程 系统优化 SWE 软件工程 长程任务 过程评估 自我改进 实验设计 智能基础设施 系统工程
- Φ-Bench 从近四年的系统论文、开源仓库、Issue 和 PR 中筛选并经专家打磨形成85个真实任务,配套410个细粒度标签、62个中层主题和9个高层主题。
- 任务分为 Kernel Function Completion、Long-Horizon Implementation 和 End-to-End Optimization,依次考察单算子实现、大型代码库多文件开发及开放式系统优化。
- 评测中 Claude Opus 5 总分最高,但所有模型在长周期实现和 Hardware & Edge 任务上均表现有限,尚不能稳定胜任完整的 LLM Infra 工程。
- 轨迹分析表明,高水平模型会进行更积极的试错并从运行、编译及性能反馈中持续纠错;推理预算虽有帮助但收益并非线性,可靠归因、实验设计和低成本假设验证更为关键。
- 用于衡量代码模型能否从局部代码生成跨越到真实、开放且长周期的基础设施工程。
- 可作为 AI 自我改进向训练、推理和系统软件栈延伸的评测基座。
- 提示 Agent 研发应强化代码库理解、跨模块修改、实验控制、故障恢复与性能归因能力。
- 为模型选型提供细分依据,避免仅凭通用编程榜单判断其 Infra 优化能力。
📝 原始笔记(逐字保留)
大模型时代的圣训计算科学:批判性综述
该综述系统审视 Transformer、检索增强与大语言模型在伊斯兰圣训计算中的进展与局限,并主张将其建设为具备知识整合、来源追踪和专家监督的证据基础设施。
架构综述 检索增强生成 多语言建模 专家反馈 证据溯源 知识图谱 圣训计算 宗教人工智能
论文结合既有综述批判、代表性研究评析以及伊斯兰学者和领域专家观点,梳理圣训计算科学的发展。现有进展包括数据资源扩充、文本分割成熟、传述者与来源验证问题形式化,以及面向语料扩充、多语言访问和有依据评估的 LLM 工作流。主要瓶颈包括语料狭窄、基准不可比、合成到真实场景的迁移差距、传述者身份消歧、预处理脆弱、复现不足和专家验证稀缺。作者认为评估重点不应局限于单项模型指标,而应转向融合知识、证据来源和专家监督的整体基础设施。
- 为宗教文献与人文学科中的 LLM 应用提供方法论风险清单,避免将基准成绩直接等同于学术可靠性。
- 启示检索增强系统显式保存文本来源、传述链和跨文献关联,以支持证据核查与责任追踪。
- 强调把领域专家监督纳入数据策展、模型评测和结论验收流程。
- 指出非经典语料、注释文献,以及圣训与《古兰经》、先知传记和教法证据之间的关联是值得拓展的研究方向。
📝 原始笔记(逐字保留)
Codex 额度异常查明:自动标题等三处 Bug 导致超额消耗
OpenAI 承认 Codex 的会话自动标题、长会话图片压缩及 Computer History 功能存在异常资源消耗,并为全部付费订阅用户重置额度。
人工智能辅助编程 成本优化 缓存优化 长上下文 人工智能 额度计量 后台资源消耗
Codex 付费用户近期集中反馈额度消耗异常,部分 Pro 用户称 16 小时内用掉了 80% 的额度,最初的缓存命中率下降解释未能完全消除质疑。Codex 负责人 Tibo Sottiaux 随后确认三处问题:长会话中多轮图片压缩造成额外计算浪费,Computer History 重度使用时用量偏高,以及后台自动生成会话标题的消耗远超预期。自动标题功能因不可见、无法关闭且占用付费额度,被社区称为“隐藏的额度黑洞”。OpenAI 最终为所有付费订阅执行完整额度重置,以补偿此次异常消耗。
- 提醒 AI 编程产品对自动标题、摘要压缩等后台辅助任务进行独立计量,避免隐性功能侵占用户核心任务额度。
- 长上下文压缩并非天然节省成本;涉及图片和多轮压缩时,应持续监控缓存命中率、重复计算量与实际算力开销。
- 产品应向用户提供细粒度用量明细、异常告警及非必要功能开关,以提升计费透明度和信任度。
- 发生大规模计量故障时,公开根因、修复进度并主动补偿,比仅给出概括性解释更有利于控制信任损失。
📝 原始笔记(逐字保留)
AI 权威执行:从应用到芯片的机器验证
研究者以 Salt 方法和不可绕过的证明内核约束 AI 智能体,在五周内独立完成从应用代码、验证编译器到 RISC-V 芯片流片的全栈开发。
形式化验证 智能体 硬件验证 可信执行 工具链安全 人在回路 证明内核 芯片流片
- 研究展示了一套由小型 AI 智能体集群执行的端到端开发流程,覆盖应用代码、验证编译器、执行系统以及 RISC-V 处理器流片。
- Salt 方法要求数学主张以经过内核检查的工件在智能体之间传递,使幻觉生成的错误证明无法通过可信证明内核。
- 验证链从 Lean 4 内核一直延伸至芯片边界的 SAT 等价性检查,期间没有证明经过人工审阅,也没有 RTL 由人类编写。
- 项目公开记录定理来源、预注册令牌消耗、人类时间下界和错误账本;累计捕获大量问题,但没有错误证明进入最终记录。
- 说明形式验证可从高成本附加环节转变为 AI 规模化开发的基础控制机制。
- 为单人安全调度多个自主编程智能体提供“机器裁判、人类定规格与裁决”的协作范式。
- 启示自主软件与芯片研发应采用逐链验证、工件级证明传递和可审计错误账本,而非依赖人工审查生成内容。
- 展示生成式 AI、定理证明与硬件验证结合后压缩全栈研发周期的潜力。
📝 原始笔记(逐字保留)
自我精炼流水线中的非对称模型容量分配
研究发现自我精炼的生成、批评和修订阶段具有不同的模型规模敏感性,应为生成器与修订器配置较大模型,而批评器可采用较小模型以降低成本。
自我改进 自我反思 能力编排 成本优化 模型路由 容量分配 阶段级模型路由
- 论文以 Qwen3 的 6 种规模和 Gemma 3 的 4 种规模,在跨领域的 5 个基准上系统研究生成、批评与修订三个阶段的规模效应。
- 更大的生成器和修订器通常能够提升整条流水线的表现,而容量不足的修订器甚至可能造成性能下降。
- 系统对批评器规模高度不敏感,但即使加入一个小型批评器,也持续优于完全省略批评阶段。
- 结果表明,自我精炼系统不应在各阶段平均分配模型容量,而应依据不同阶段的缩放特征进行非对称配置。
- 为多阶段 LLM 系统提供按阶段选择模型规模的实证依据。
- 可用小模型承担批评任务,将主要算力投入生成和修订阶段,从而改善成本—性能比。
- 在部署自我精炼智能体时需避免使用过弱的修订器,以防修订过程反而损害初始答案。
- 启示模型路由与资源调度策略应显式区分生成、诊断和修复等不同认知职责。
📝 原始笔记(逐字保留)
Prompt-Model 交互抵达固定点:无任务确定性结构读出
研究以短窗口 argmax 映射的固定点结构作为无任务确定性读出,发现提示影响取决于具体的提示—模型配对,且前缀长度、文本形式和注意力汇等候选解释均无法稳定刻画这种交互。
提示敏感性 交互式评估 构念效度 表征探测 不动点 提示交互
研究从 96 个起点统计短窗口 argmax 映射的固定点结构,以排除任务准确率、随机采样和得失定义带来的干扰。仅九个条件令牌就能显著改变固定点比例、四分类结构及模型排序,而带来 60.5 个 IFEval 点提升的指令微调却没有改变结构类别。该结构主要存在于短上下文中,六个模型里有四个在窗口长度达到 16 时完全失去固定点。前缀长度、文本与标记格式、通用方向、双向性、指令抵抗性以及早期令牌注意力汇等解释均未能跨样本和模型成立,表明合适的解释单位是具体的提示—模型对。
- 为研究提示效应提供不依赖任务指标的确定性结构探针,可用于区分任务机制与模型条件分布本身的变化。
- 提醒提示词优化结果不能被视为提示本身的固有属性,跨模型迁移和提示排名比较需要显式建模模型交互。
- 候选机制应先检验其适用条件和可变空间,避免用具有特定形状的判据解释实际上没有相应变化余地的量。
- 固定点结构可作为短上下文读取方式的诊断信号,但不宜直接外推到长上下文或真实文本之外。
📝 原始笔记(逐字保留)
E²-TTT:兼顾表达力与效率的测试时训练
E²-TTT通过闭式状态转移并行执行块级训练,同时精确保留逐令牌更新的快权重与动量状态,实现测试时训练表达力、长上下文泛化和硬件效率的统一。
测试时计算 长上下文 长度泛化 推理加速 状态表征 快速权重 块级训练
E²-TTT针对逐令牌测试时训练表达力强但硬件效率低、传统分块近似高效却损失时序结构的问题提出改进。在块起始权重处计算梯度的标准近似下,方法推导出闭式状态转移,可精确复现逐令牌递推在块末的快权重与动量状态,从而支持完全并行的块级训练。作者从头训练了最高13亿参数的模型,其语言建模能力与既有TTT及混合注意力基线相当,并在上下文检索任务上取得更好表现。在Needle in a Haystack口令测试中,模型面对训练上下文长度8倍的序列仍保持超过90%的准确率,同时训练吞吐量可匹配高效分块方法。
- 为测试时持续更新权重提供兼顾时序表达力与硬件并行性的实现路径。
- 闭式状态转移可用于改造长上下文模型,减少逐令牌更新带来的串行计算瓶颈。
- 结果表明,保留快权重和动量的更新结构有助于上下文检索及超出训练长度的泛化。
- 可作为研究推理期自适应、动态记忆和长上下文架构的高效基础模块。
📝 原始笔记(逐字保留)
记忆增强解锁高效思维链推理
论文提出免训练的记忆增强压缩框架,通过检索历史推理轨迹中的可复用模式补偿思维链压缩造成的信息损失,在提升准确率的同时降低推理延迟。
推理加速 上下文压缩 智能体记忆 经验检索 思维链压缩 预填充脚手架
论文将显式上下文与解码期生成之间的权衡形式化为“上下文—生成替代定律”,指出预填侧推理信息可以替代部分逐令牌生成。所提出的 Memory-Augmented Compression 从历史轨迹中提炼推理模式、关键约束和核心操作,并在推理时检索为脚手架,无需额外训练。该方法在 GSM8K、MATH、BBH 和 MMLU-Sci 上相较 Chain-of-Draft 分别提升 21.4、28.0、29.5 和 6.61 个百分点,同时较标准 CoT 获得 1.14–1.49 倍延迟加速。进一步实验表明,收益来自相关推理记忆,而非单纯增加上下文长度,并且该框架兼容令牌级、轨迹级和推理状态压缩。
- 为压缩思维链提供一种免训练方案,在减少输出令牌的同时维持逻辑连贯性。
- 可将历史推理轨迹沉淀为可检索记忆,以预填计算替代成本更高的自回归解码。
- 启示推理系统应优化记忆的抽取与相关性检索,而非仅依靠扩大上下文窗口。
- 可作为多种推理压缩机制的通用增强层,用于兼顾任务准确率与在线服务延迟。
📝 原始笔记(逐字保留)
渐进式视觉脚手如何提升 VLM 空间推理
研究基于 SPaRC 基准发现,渐进式视觉脚手可通过减少视觉接地错误将多种 VLM 的空间规划准确率最高提升 34 个百分点,但规则推理仍是主要瓶颈。
视觉脚手架 空间规划 多模态 规则推理 接触评估 视觉提示 视觉指代消解
研究在网格视觉空间规划基准 SPaRC 上引入轻量级、输入侧的渐进式视觉脚手,在保持视觉模态和底层推理问题不变的同时,使空间结构更易被模型识别。多种 VLM 使用脚手后,任务准确率相比原始视觉输入最高提升 34.0 个百分点。视觉脚手还能与基于 GRPO 的训练互补,额外带来最高 4.6 个百分点的准确率增益,而 GRPO 在原始视觉输入上的收益接近于零。端到端求解和目标检测分析表明,增益主要来自视觉接地错误的减少,规则推理能力仍然相对薄弱。研究说明视觉呈现方式会显著影响基准究竟测量接地感知、后续推理,还是二者的混合能力。
- 为 VLM 空间推理任务提供低成本的输入侧改进方案,无需改变问题本身或完全依赖额外训练。
- 设计多模态基准时应控制视觉呈现形式,并分别报告视觉接地与规则推理能力,避免混淆错误来源。
- 视觉脚手与 GRPO 等后训练方法存在互补性,可先降低感知和接地障碍,再优化下游推理策略。
- 对准确率提升应进行分阶段诊断,确认模型是真正增强了推理能力,还是仅因视觉结构更易读取而获益。
📝 原始笔记(逐字保留)
AID-Guard:面向委托式智能体效果的有状态授权
AID-Guard 通过提交时重验证、歧义状态下保留授权预留及受控后继机制,将一次批准与至多一次提供商效果绑定,防止智能体在重试和恢复中产生未授权或重复操作。
智能体安全 访问控制 状态机 人工智能可靠性 执行恢复 幂等授权 效应闭包
AID-Guard 提出授权到效果的有状态闭包协议,解决工具型智能体在请求变更、响应丢失、重试和故障恢复期间授权失效的问题。协议在提交时重新验证获批请求与提供商状态,并在执行结果不明确时保留唯一预留,仅在终态结果或带交付栅栏的“未产生效果”证明出现后才允许释放或创建一个后继。其 Python/SQLite 原型在 Stripe、Resend 和 MCP 场景中完成并发、竞态及崩溃恢复测试,未观察到重复或未授权效果。面对提议方完全失陷时,系统阻止了 44/44 次攻击,但严格的精确清单策略会显著降低正常任务完成率,类型化授权边界可部分恢复可用性。
- 为支付、邮件发送等具有外部副作用的智能体工具调用提供贯穿提交、交付、重试与恢复阶段的授权机制。
- 将授权从一次性的入口检查扩展为完整生命周期约束,可降低响应丢失和崩溃恢复造成的重复扣款、重复发送等风险。
- 通过可验证证据包、线性化并发历史和提供商契约,为智能体执行审计、公开验证及回放提供工程参考。
- 实际部署需在精确请求绑定的安全性与任务完成率之间权衡,可采用类型化授权边界改善可用性。
📝 原始笔记(逐字保留)
LLM 交叉赋能软件工程与软件安全:证据中心综述
该综述以证据为中心统一审视 LLM 在软件工程与软件安全中的能力、评测缺陷及研究方向,主张通过多维保证论证取代单一基准分数。
SWE 软件工程 网络安全 人工智能辅助编程 智能体安全 评估透明度 证据审查 安全保证 联合基准测试
论文系统梳理了截至 2026 年 5 月 31 日 LLM 在软件工程任务、安全任务、适配机制、工件粒度和评测设计方面的代表性研究。作者提出保证框架,将功能正确性、安全性、运行可靠性、证据来源和智能体权限分别评估。研究发现,执行反馈和代码仓库访问虽能提升工程任务完成率,却不能直接证明系统安全;静态分析标签或漏洞分类成绩也不足以证明方案可部署。论文归纳了测试预言薄弱、数据重复与时间泄漏、智能体脚手架变化、代理式安全检查以及预算和人工干预披露不足等效度威胁,并提出最低报告规范。
- 为仓库级编程智能体建立同时覆盖功能与安全的联合评测框架。
- 将智能体权限、证据来源和运行可靠性纳入部署验收,而非只看任务成功率。
- 通过最低报告规范提高跨论文比较和智能体实验复现的可信度。
- 推动仓库级威胁模型、校准的人类监督及长期可维护性评估。
📝 原始笔记(逐字保留)
ClawSentry:自主 LLM 智能体的渐进式多层安全监控
ClawSentry 通过覆盖技能准入、调用意图、执行效果和行动后果的多层安全网关,在较少损害正常任务成功率的同时显著降低自主智能体遭恶意技能劫持的攻击成功率。
智能体安全 技能安全 安全审计 工具链安全 智能体运行时 网络攻防链 渐进式防护 分层监控 绕过攻击防御
ClawSentry 是一个开源、框架无关的智能体运行时安全监督网关,将风险划分到技能准入、调用时意图、执行时效果和行动后果四个环节。系统先以首次技能包审查审计第三方技能,再通过确定性 L1、规则锚定的语义审查 L2 和只读证据搜索智能体 L3,逐级处理剩余歧义。其会话级反绕过机制可识别换工具、换表述或跨轮次重试,行动后的高风险证据也会用于强化后续审查。借助 Agent Harness Protocol,同一策略可接入 Codex、Claude Code、Kimi CLI 和 Gemini CLI;实验中 SkillInject 的上下文 ASR 从 39.55% 降至 2.61%,完整 SkillsSafety 上的 ASR 被限制在 9.09%~15.03%,正常技能总体 TSR 保持 98.7%。
- 为可执行代码、读取本地文件和调用外部工具的智能体提供覆盖全控制循环的纵深防御。
- 说明安全审查可采用“低成本确定性过滤—语义复核—证据搜索”的渐进架构,仅对模糊案例投入更多推理资源。
- 会话级风险状态有助于阻断攻击者通过改写请求、切换工具或跨轮重试绕过单次调用防护。
- AHP 式统一适配层可让企业在不修改不同智能体内部实现的情况下集中部署和迭代安全策略。
📝 原始笔记(逐字保留)
ReFrame:证据引导的多模态模型测试时安全对齐
ReFrame通过双代理生成风险与效用证据,并在调用闭源多模态大模型前重写提示和路由图像,无需训练即可兼顾越狱防御、安全感知与正常任务效用。
测试时计算 多模态 越狱攻击 智能体安全 拒答校准 安全对齐 输入重构
ReFrame针对多模态模型测试时安全对齐中的“效用主导”和“推理惯性”问题,避免模型忽略潜在风险或沿恶意推理轨迹继续执行。框架由共享轻量级本地MLLM的两个代理组成:证据生成代理构造互补的风险证据与效用证据,重写与路由代理据此生成安全代理提示并决定图像路由方式。该方法不修改下游模型,也不需要访问模型内部状态,因此适用于已经部署的闭源MLLM。多模型、多基准实验表明,它能同时改善越狱防御、安全意识和过度拒答,并保持多模态任务效用。
- 为无法重新训练或检查内部状态的闭源多模态模型提供即插即用的安全增强层。
- 表明安全防御不能只识别风险,还应显式保留任务效用证据,以减少过度拒答。
- 可将“证据生成—输入重写—模态路由”作为多模态代理系统调用高风险模型前的通用安全流程。
📝 原始笔记(逐字保留)
LLM裁判中的信任—真值可分离性
研究发现LLM裁判的信任评分与真值判断高度耦合,且仅改变人类或AI来源标签就会同时影响信任度、真假结论及正确侧概率。
信任机制 模型评判 事实核查 溯源推理 相关性偏差 信念-真值解耦 来源效应
研究检验了LLM-as-Judge输出的信任评分与二元真值判断能否被视为相互独立的证据。在控制答案正确性的问答实验中,LLM裁判对信任度和真假结论的绑定程度高于人类行为参照,表明两类判断的可分离性较弱。压力测试仅改变相同问答的来源提示,将其标注为人类或AI生成,便会引起信任评分和真值判定同步变化。来源归因还会改变由logit计算的正确侧概率,因此现有评测协议不应直接把信任评分作为支持真值判断的独立证据。
- 提醒多维LLM裁判系统避免将表面不同的评分维度误当作独立证据。
- 设计评测时应加入来源标签置换、内容不变等对照实验,以识别来源偏差。
- 可通过相关性、条件独立性和logit级分析检验信任评分与事实判断是否真正解耦。
- 在事实核查或可靠性评估中,应结合外部证据与人工基准,而非依赖同一裁判模型的多项输出进行交叉印证。
📝 原始笔记(逐字保留)
PromptResponse:优化 LLM 编程任务提示词
对 HumanEval 的大规模对照实验显示,统一提示格式尤其是 JSON 可提高代码生成效率与语法稳定性,而 LLM 自动调优提示反而会显著降低任务表现。
研究将 HumanEval 编程题改写为语义相同但语法形式不同的五个版本:基线、JSON、Markdown、YAML 和 LLM 调优版。作者使用 GPT-4o 完成超过 8200 次执行,对代码性能、生成效率和稳定性进行受控比较。一致的格式化能改善生成效率与语法稳定性,其中 JSON 格式表现最突出,但任务性能增益较小。LLM 调优提示词则显著损害任务表现,且未在其他维度带来明显收益,说明提示优化需要考虑模型对齐。
- 在代码生成流水线中优先采用统一、结构化的提示模板,JSON 可作为低成本默认方案。
- 不应默认相信由 LLM 自动润色或扩写的提示更有效,应通过执行测试验证功能正确性、效率和稳定性。
- 提示词实验需保持任务语义一致,并进行多次运行,以区分格式效应与采样波动。
- 构建 AI 编程评测时可将提示格式纳入变量,避免单一模板导致结论偏差。
📝 原始笔记(逐字保留)
面向药物发现智能体的人类对齐 LLM 评测系统
研究为阿斯利康药物发现助手 ChatInvent 构建并验证了与专家判断对齐的 LLM-as-a-Judge 框架,经少样本优化后与人类多数票的一致率由 0.80 提升至 0.86。
评估智能体 专家反馈 模型评判 化学人工智能 科学智能 药物发现 评判模型对齐
研究针对药物发现智能体输出开放、依赖工具且难以用 BLEU、ROUGE 等指标衡量的问题,提出可复用的 LLM-as-a-Judge 评测框架。框架从完整性、相关性、结构清晰度和范围遵循度四个维度评价输出,并通过确定性规则检查工具调用正确性。作者邀请五位专家开展人类对齐研究,对比 Gemini 3.1 Pro、Claude Opus 4.7、GPT-5 和 Llama 3.1 70B 等候选裁判。利用人工标注示例进行少样本优化后,最佳裁判与人类多数票的一致率从 0.80 提升至 0.86;在 70 个留出问题上的评测还表明,非正式措辞不会系统性降低质量,由 LLM 先重写问题可能反而有益。
- 为科学领域智能体建立兼顾语义质量、工具调用正确性和可扩展性的评测模板。
- 表明部署 LLM 裁判前应通过多位领域专家验证其一致性,而不能默认模型判断可靠。
- 可使用人工标注的少样本示例校准裁判,以较低成本提升其与专家共识的对齐程度。
- 提示评测体系应拆分主观质量维度与可确定验证的工具行为,避免完全依赖单一模型评分。
📝 原始笔记(逐字保留)
COTA:小模型比较顾问实现智能体运行时干预
COTA利用基于同前缀反事实分支训练的小型比较器筛选更优后续方案,在不训练任务级求解器或修改原智能体的情况下提升长程执行可靠性。
智能体 智能体运行时 弱评判模型 反事实推理 人工智能可靠性 比较顾问 成对监督 运行时干预
COTA不要求辅助模型直接解决任务,而是让小型比较器判断采样候选是否优于智能体原提案,并通过重复比较决定是否介入。比较器使用相同前缀下生成的反事实分支构造成对监督数据,从而学习候选后续之间的相对优劣。被选中的替代方案仅作为非强制建议返回,最终仍由原智能体重新规划和执行。在WebShop、ALFWorld与tau³-Retail的三个智能体上,COTA改善了全部九组评测,并优于所比较的基线。
- 将运行时辅助从“生成正确答案”降维为“比较候选优劣”,可显著降低顾问模型的能力与推理成本要求。
- 可作为智能体执行框架中的轻量干预模块,在不重训底座模型的前提下改善长程任务的故障恢复能力。
- 同前缀反事实分支提供了可扩展的成对监督构造方式,适合训练弱模型承担候选筛选与过程监控职责。
- 非强制建议保留了原智能体的规划自主性,可减少辅助模型直接接管任务所带来的错误传播风险。
📝 原始笔记(逐字保留)
LLM 开发代理间的规格可移植性与兼容性
研究以 Oracle 到 PostgreSQL 的迁移为受控任务,发现软件规格并非天然与代理无关,跨代理复用可能造成显著且依赖具体代理的实现质量下降。
人工智能辅助编程 SWE 软件工程 多智能体系统 接口错配 模型迁移 规约迁移 智能体兼容性
研究首先在 1,006 个 PL/SQL 文件上评估规格优先的迁移流水线,其中 623 个文件成功重新生成,380 个生成脚本可在 PostgreSQL 16 中执行。随后,作者基于 1,802 组 Oracle 与 PostgreSQL 脚本,对 Amazon Kiro、Google Gemini 和 GitHub Copilot 开展跨代理实验,并在单代理阶段纳入 Claude Code 与 Cursor。结果表明,规格长度无法单独预测实现质量,直接使用其他代理生成的规格可能严重损害 Token F1、SQL 语法有效性、AST 相似度和即时可运行性。规格重写能显著改善部分配置,而压缩没有普遍收益;检索增强式规格摄取则是 Gemini 与 Copilot 的代理级帕累托前沿中唯一共同出现的策略。
- 在多代理软件开发流程中,应将规格视为带有代理解释偏好的接口,而不是天然中立、可直接交换的工件。
- 跨代理交接前可增加规格重写、兼容性验证和语法执行测试,降低迁移失败风险。
- 对大型规格优先考虑检索增强式按需访问,而非简单压缩或完整注入。
- 可将 Token F1、AST 相似度、语法有效性与即时可运行性组合为规格可移植性的评测指标。
📝 原始笔记(逐字保留)
PUN:面向人物中心 LLM 评测的可信未知姓名
PUN 提出一套构造和验证“真实可信但无可检索人物证据”姓名的协议,以减少人物中心 LLM 评测中记忆、检索、姓名先验与错认归因的混杂。
模型评估 事实核查 隐私泄露 拒答校准 身份偏见 未知姓名识别 姓名控制 证据状态
论文将“未知姓名”定义为:具有合理的 First-Last 姓名形式、不存在被索引的全名证据,且在有记录的验证流程中没有歧义信号。PUN 协议结合 Wikidata 姓名组件、支持联网的 LLM 筛查以及受控搜索复核来构造和验证候选姓名。作者报告了姓名接受率、流程可复现性和消融实验,并开展了一项包含 204 名参与者的人类研究。结果显示,获选姓名比对照项更像真实人名,而参与者仅在 3% 的案例中找到对应人物证据;研究同时发布了 300 个姓名及其对照项。
- 为事实性、隐私泄露、偏见和拒答评测提供证据状态受控的人名变量。
- 避免把模型记忆、联网检索、姓名先验或同名错认误判为目标能力或风险。
- 可将 PUN 协议纳入人物中心评测的数据构建与定期搜索复核流程。
- 公开姓名集和对照项有助于开展可复现的跨模型比较与消融研究。