2025-07-03 科研追新

当日精选(由提交工具自动创建)。

纯视觉范式下的通用视觉模型研究回顾与总结

文章回顾并总结纯视觉范式下通用视觉模型的研究进展与发展方向。

 多模态 模型开发 人工智能

文章围绕纯视觉范式下的通用视觉模型展开研究回顾。内容重点梳理该方向的代表性进展,并总结通用视觉能力的发展脉络。相关讨论可为理解纯视觉模型与多模态模型之间的技术联系及范式差异提供参考。

用途与启示
  • 了解纯视觉通用模型的研究进展与演化路径
  • 对比纯视觉范式和多模态范式的能力边界
  • 为通用视觉模型的选型与后续研究提供参考
📝 原始笔记(逐字保留)
2025-07-03 09:45:11 Thursday | 回顾并总结纯视觉范式下的通用视觉模型研究 https://mp.weixin.qq.com/s/yJ6U367pd1o6pqzEs1xi_Q

LIFT:冻结LLM文本编码器,准确率超CLIP 11%

伯克利与香港大学提出LIFT,通过冻结预训练LLM文本编码器、仅训练图像编码器,揭示LLM促进文本—视觉对齐的机制并简化对比学习流程。

 多模态 模型训练 人工智能 系统优化

UC伯克利与香港大学团队提出LIFT(Language-Image Alignment with Fixed Text Encoders),系统研究预训练LLM作为文本编码器时带来的多模态性能增益。该工作分析了LLM文本表征增强了哪些能力、适合哪些训练数据,以及影响跨模态对齐的关键设计选择。LIFT采用极简训练范式:冻结预训练LLM,仅优化图像编码器,从而降低文本—视觉对齐的训练复杂度。报道显示,该方法在相关任务上的准确率较CLIP提升11%。

用途与启示
  • 帮助理解LLM文本编码器提升视觉—语言分类与检索性能的深层原因
  • 为不同类型训练数据选择合适的文本编码器提供依据
  • 通过冻结LLM、仅训练图像编码器降低多模态对齐成本
  • 为简化传统图文对比学习框架提供新的研究路径
📝 原始笔记(逐字保留)
2025-07-03 11:28:29 Thursday | 超CLIP准确率11%!伯克利港大阐明「LLM文本-视觉」对齐深层机制 https://mp.weixin.qq.com/s/YCOGZBHbkdmcUF92xHOHYQ 近期,相关工作尝试将预训练的大语言模型(LLM)作为文本编码器融入多模态对齐框架,并在分类和检索任务上观察到性能提升。 然而,性能提升背后的机制尚不清晰,几个关键问题仍未得到系统解答: * 能力提升的本质:LLM文本编码器的加入究竟增强了多模态模型的哪些具体能力? * 数据特征的适配:在哪些类型的训练数据上,LLM文本编码器表现更优,原因为何? * 关键组件的贡献:LLM文本编码器的哪些设计选择对跨模态对齐至关重要? * 训练流程的简化:若使用LLM作为固定文本编码器,传统对比学习框架能否进一步优化? 来自UC伯克利和香港大学的研究团队在最新工作LIFT(Language-Image Alignment with Fixed Text Encoders)中,对上述问题进行了系统性解答。 论文链接:https://arxiv.org/pdf/2506.04209 项目代码:https://github.com/Jingfeng0705/LIFT 该方法采用极简训练范式——直接冻结预训练LLM作为文本编码器,仅优化图像编码器。

字节跳动开源轨迹可控视频生成框架 ATI

字节跳动推出并开源 ATI,通过用户在图像上绘制的任意轨迹统一控制物体及摄像机运动,实现直观、精细的可控视频生成。

 多模态 模型开发 智能体工具 人工智能应用

ATI(Any Trajectory Instruction)是一种以轨迹为指令的可控视频生成框架。用户可以直接在输入图像上手绘任意轨迹,将其转化为驱动物体和摄像机运动的显式控制信号。框架采用统一的潜在空间建模方式,将轨迹控制注入视频生成过程,从而实现更直观的帧级运动控制。项目已开放论文、代码、Hugging Face 模型与 ComfyUI 集成,项目主页为 https://anytraj.github.io/

用途与启示
  • 降低可控视频生成的交互门槛,以手绘轨迹替代复杂参数配置。
  • 支持物体运动与镜头运动的统一控制,适用于动画制作、广告创意和影视预演。
  • 可借助开源模型及 ComfyUI 集成快速搭建轨迹驱动的视频生成工作流。
  • 为多模态生成模型探索更直观、可解释的空间运动控制接口。
📝 原始笔记(逐字保留)
2025-07-03 10:24:07 Thursday | 画到哪,动到哪!字节跳动发布视频生成「神笔马良」ATI,已开源! https://mp.weixin.qq.com/s/plT9DzxmpAjQv8u87S8wlQ 字节跳动提出了 **ATI** ——一种全新的、以「轨迹为指令」的可控视频生成框架。ATI 的核心理念是: **将用户在输入图像上手绘的任意轨迹,转化为驱动物体与摄像机运动的显式控制信号,并以统一的潜在空间建模方式注入视频生成过程。** 这使得视频创作从「参数调控」转变为「可视化创意」,让用户「画到哪,动到哪」,以直观方式实现帧级精准控制。 Title:ATI: Any Trajectory Instruction for Controllable Video Generation Paper:https://arxiv.org/pdf/2505.22944 Project page:https://anytraj.github.io/ Github:https://github.com/bytedance/ATI Hugging Face:https://huggingface.co/bytedance-research/ATI ComfyUI:https://github.com/kijai/ComfyUI-WanVideoWrapper

百度搜索十年来最大改版,MuseSteamer 与 AI 视频平台「绘想」上线

百度全面升级搜索产品与生态,并推出多模态视频生成大模型 MuseSteamer 及 AI 视频创作平台「绘想」。

 智能体工具 多模态 模型开发 人工智能应用 人工智能

百度搜索宣布进行十年来最大规模的改版,升级范围覆盖搜索框、搜索结果和搜索生态。百度商业研发团队同时发布自研多模态生成大模型 MuseSteamer,重点面向高质量 AI 视频生成。基于该模型的 AI 视频创作平台「绘想」同步上线,为用户提供电影级视频内容生产工具。平台入口为 https://huixiang.baidu.com

用途与启示
  • 为营销、影视和内容创作者提供高质量 AI 视频生成能力
  • 展示多模态生成模型与搜索生态、商业内容生产结合的新路径
  • 降低专业视频制作门槛,提升创意素材的生产效率
📝 原始笔记(逐字保留)
2025-07-03 11:32:42 Thursday | 百度搜索宣布进行十年来最大改版,从搜索框、搜索结果到搜索生态全面革新。百度商业研发团队自研的多模态生成大模型「MuseSteamer」震撼登场,搭配AI视频平台「绘想」同步上线,让视频创作直接迈入电影级AI时代。 https://mp.weixin.qq.com/s/TwfXcyWaj1Hvmkx54-hEFA 传送门:https://huixiang.baidu.com

HeyGen:一键生成多语言数字人视频

HeyGen 是一款专注于数字人视频制作的 AI 平台,可根据文本脚本一键生成支持多种语言和方言的虚拟人像视频。

 智能体工具 多模态 人工智能应用

HeyGen 是一款面向数字人场景的 AI 视频生成平台,与可灵、即梦和 Runway 等通用视频生成工具定位不同。用户输入文本脚本后,即可一键生成高质量的虚拟人像视频。平台支持多种语言和方言,适用于跨语言内容生产与传播。

用途与启示
  • 快速制作数字人口播、营销宣传和培训讲解视频
  • 降低真人出镜、拍摄及后期制作的成本
  • 支持多语言和方言内容生成,提升全球化传播效率
📝 原始笔记(逐字保留)
2025-07-03 10:15:42 Thursday | HeyGen 是一款 AI 视频生成平台,但与可灵、即梦、Runway 等不同,它专注于数字人视频的制作。用户只需输入文本脚本,就能一键生成高质量的虚拟人像视频,并支持多种语言和方言。 https://mp.weixin.qq.com/s/ifUdL6mig874aAiwKIUF4w

LLM 中理解与说服之间的细线

研究发现,LLM 即使无法证明自己真正理解对话结构与语用背景,仍能维持连贯且具有信念影响力的辩论。

 人工智能应用 模型评估 推理 人工智能

研究评估了 LLM 维持辩论及说服参与者和听众的能力,并考察这种能力与其对对话结构、语用上下文的理解有何关联。实验表明,LLM 能生成连贯且有说服力的论证,甚至改变人类参与者与旁观者的信念。若人们知道或怀疑对话者是 AI,通常会更批判地审视其论点。然而,LLM 在接受进一步询问时无法证明自己真正理解相关语境,说明语言说服力并不等同于理解能力。

用途与启示
  • 提醒心理健康、同行评审等敏感应用不要将表达流畅或说服力误判为真实理解。
  • 为 LLM 评估体系加入对话结构、语用语境和元理解能力的独立测试。
  • 在决策支持场景中明确披露 AI 身份,并设计机制鼓励用户核查论点与证据。
  • 研究结果可用于分析 LLM 作为评估者或辩论代理时的可靠性与操纵风险。
📝 原始笔记(逐字保留)
1. 2025-07-03 11:37:35 Thursday | **[LLM 中理解和说服之间的细线](https://papers.cool/arxiv/2507.01936)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Adrian de Wynter](https://arxiv.org/search/?searchtype=author&query=Adrian%20de%20Wynter), [Tangming Yuan](https://arxiv.org/search/?searchtype=author&query=Tangming%20Yuan) 大型语言模型 (LLM) 在维护高层次、令人信服的对话方面非常出色。它们正在被快速部署为敏感领域的聊天机器人和评估器,例如同行评审和心理健康应用程序。这一点,以及关于他们推理能力的不同描述,需要对 LLM 及其对对话的理解进行更仔细的检查。在这项工作中,我们首先评估了 LLM 维持辩论的能力——这是人类交流的最纯粹但最复杂的形式之一。然后我们衡量这种能力如何与他们对所谈论内容的理解相关,即他们对对话结构和语用上下文的理解。我们发现 LLM 能够保持连贯、有说服力的辩论,经常动摇参与者和听众的信念。我们还注意到,对 AI 参与的认识或怀疑会鼓励人们对所提出的论点持更多批评态度。然而,当对 LLM 进行民意调查时,他们无法证明这种理解。我们的研究结果将 LLM 作为评估者的缺点与他们理解上下文的(不)能力联系起来。更广泛地说,对于论证论领域,我们假设,如果一个代理人能够令人信服地维持对话,那么它就没有必要知道它在说什么。因此,语用背景和连贯性的建模是次于有效性的。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [计算机与社会](https://papers.cool/arxiv/cs.CY) ### 决策

面向决策的文本评估

该研究提出以实际决策结果衡量生成文本价值的评估框架,并发现丰富的分析文本能够促进人类与 LLM 协作决策。

 人工智能应用 模型评估

论文提出一种面向决策的 NLG 评估框架,不再依赖 n-gram 重叠或句子合理性等内在指标,而是直接测量生成文本对人类和 LLM 决策结果的影响。研究以市场早间摘要和收盘分析为测试材料,根据参与者据此执行交易后的财务表现评估文本质量。实验显示,仅依赖简短摘要时,人类和 LLM 智能体均无法稳定超越随机基线。相比之下,更丰富的分析评论可使人类与 LLM 协作团队显著优于单独的人类或智能体,表明协同决策能力应成为生成文本的重要评估维度。

用途与启示
  • 为金融、医疗等高风险领域的生成文本提供面向真实任务结果的评估方法
  • 揭示传统文本相似度与流畅性指标难以反映实际决策价值
  • 启发应用开发者通过人机协作表现衡量分析型文本和摘要系统的有效性
📝 原始笔记(逐字保留)
3. 2025-07-03 11:38:51 Thursday | **[面向决策的文本评估](https://papers.cool/arxiv/2507.01923)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Yu-Shiang Huang](https://arxiv.org/search/?searchtype=author&query=Yu-Shiang%20Huang), [Chuan-Ju Wang](https://arxiv.org/search/?searchtype=author&query=Chuan-Ju%20Wang), [Chung-Chi Chen](https://arxiv.org/search/?searchtype=author&query=Chung-Chi%20Chen) 自然语言生成 (NLG) 越来越多地部署在高风险领域,但常见的内在评估方法,如 n-gram 重叠或句子合理性,与实际决策效率的相关性很弱。我们提出了一个以决策为导向的框架,通过直接测量其对人类和大型语言模型 (LLM) 决策结果的影响来评估生成的文本。使用市场摘要文本(包括客观的早间总结和主观的收盘钟分析)作为测试案例,我们根据人类投资者和独立 LLM 代理人执行的交易的财务表现来评估决策质量,这些交易仅由这些文本提供信息。我们的研究结果表明,当仅依赖摘要时,人类和 LLM 代理都没有始终超过随机性能。然而,更丰富的分析评论使协作的人类 LLM 团队能够显著优于个人人类或代理基线。我们的方法强调了通过促进人类和 LLM 之间协同决策的能力来评估生成文本的重要性,突出了传统内在指标的关键局限性。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** ## 选型

周志华团队理论证明:LLM中可挖掘内源性通用奖励模型

南京大学团队证明,可从语言模型的下一个 Token 预测目标中恢复内源性奖励函数,为强化学习应用于 LLM 提供理论依据。

 强化学习 模型训练 推理 人工智能

南京大学研究团队提出“内源性奖励”观点,认为经过标准下一个 Token 预测训练的语言模型内部已经潜藏通用奖励模型。论文从理论上证明,可由预训练和监督微调目标恢复一种特定形式的离线逆强化学习奖励函数,从而提取模型隐式学习的偏好。实验显示,该方法无需额外训练,其效果优于多种 LLM-as-a-Judge 方法,并可超过依赖昂贵人工标注数据训练的显式奖励模型。该研究为强化学习提升大语言模型能力提供了原则性解释与理论基础。

用途与启示
  • 从现有 LLM 中直接挖掘奖励信号,降低奖励模型的训练与人工标注成本。
  • 为预训练、监督微调与强化学习之间的联系提供统一的理论解释。
  • 可用于回答评估、候选结果排序、推理搜索及后训练奖励设计。
  • 启示研究者进一步探索内源性奖励的稳定性、泛化能力及奖励博弈风险。
📝 原始笔记(逐字保留)
2025-07-03 10:18:33 Thursday | 周志华团队新作:LLM中存在奖励模型,首次理论证明RL对LLM有效性 https://mp.weixin.qq.com/s/OOoAqaT_hnfh2rcKkxrZWw 来自南京大学的研究者发现, **一个强大的通用奖励模型并非需要构建,而是可以挖掘出来的** , 因为它已经潜在地存在于通过标准的下一个 Token 预测训练的任何语言模型中,称之为「内源性奖励(endogenous reward)」。 本文的核心贡献是为这一观点提供严格的理论基础。本文证明了可以从标准的下一个 Token 预测目标中恢复出一种特定形式的离线逆强化学习(IRL)奖励函数,该目标用于预训练和监督微调(SFT)。这一见解能够超越启发式方法,并建立一种原则性的方法,来引出语言模型在训练过程中隐式学习到的奖励函数。 据了解,这是首次理论证明强化学习在 LLM 中的有效性。广泛实验验证了这一理论,表明 **这种内源性奖励不仅优于现有的 LLM-as-a-judge 方法** ,**而且可以超越那些通过昂贵的人类标注数据显式训练的奖励模型的表现。** 论文标题: GENERALIST REWARD MODELS: FOUND INSIDE LARGE LANGUAGE MODELS 论文链接:https://arxiv.org/pdf/2506.23235 由于本评估的方法无需训练,因此本评估将其与其他无需训练的方法进行对比:生成式验证器(Generative Verifier)、GenRM-Pairwise 和 GenRM-Pointwise 。 ### 过程奖励模型PRM https://arxiv.org/abs/2504.16828 具有思考能力的流程奖励模型 [穆罕默德·哈利法 ](https://arxiv.org/search/cs?searchtype=author&query=Khalifa,+M)、[ 里沙布·阿加瓦尔 ](https://arxiv.org/search/cs?searchtype=author&query=Agarwal,+R)、[ 拉贾努根·洛格斯瓦兰 ](https://arxiv.org/search/cs?searchtype=author&query=Logeswaran,+L)、[ 金在谦 ](https://arxiv.org/search/cs?searchtype=author&query=Kim,+J)、[ 彭浩 ](https://arxiv.org/search/cs?searchtype=author&query=Peng,+H)、[ 李文泰 ](https://arxiv.org/search/cs?searchtype=author&query=Lee,+M)、[ 李洪乐 ](https://arxiv.org/search/cs?searchtype=author&query=Lee,+H)、[ 王璐](https://arxiv.org/search/cs?searchtype=author&query=Wang,+L) > 逐步验证器——也称为过程奖励模型(PRMs)——是测试时扩展的关键要素。PRMs 需要步骤级监督,导致其训练成本高昂。本研究旨在构建数据高效的 PRMs,将其表述为可生成验证思维链(CoT)的逐步骤奖励模型,以验证解决方案中的每个步骤。我们提出 ThinkPRM,这是一种长思维链验证器,其微调所需的过程标签数量比判别式 PRMs 少几个数量级。该方法充分发挥了长 CoT 模型固有的推理能力,在仅使用 PRM800K 中 1%过程标签的情况下,于多个具有挑战性的基准测试中超越了 LLM-as-a-Judge 和判别式验证器。具体而言,ThinkPRM 在 ProcessBench、MATH-500 和 AIME '24 的最佳 N 选择和奖励引导搜索中均优于基线模型。在 GPQA-Diamond 子集和 LiveCodeBench 的跨领域评估中,我们的 PRM 分别以 8%和 4.5%的优势超越了使用完整 PRM800K 训练的判别式验证器。 最后,在相同 token 预算下,ThinkPRM 相比 LLM-as-a-Judge 能更高效地扩展验证计算能力,在 ProcessBench 子集上以 7.2%的优势超越后者。我们的工作凸显了生成式长链思维过程奖励模型的价值——这类模型既能扩展测试时的验证计算,又只需极少的训练监督。代码、数据和模型将在[此 https 网址](https://github.com/mukhal/thinkprm)发布。 > **会议主题** :奖励模型验证器研讨 > > #### 一、验证器类型 > > 1. **结果验证器(Outcome Verifiers)** > 1. 验证完整解决方案的最终答案,通过花费更多计算资源采样并验证解决方案,构建可扩展的计算系统。 > 2. 例如:验证叠加态结果或最终答案的正确性。 > 2. **过程验证器(Process Verifiers)** > 1. 核心为“过程奖励模型(Process Reward Model)”,在推理步骤级别区分正确与错误,而非完整解决方案级别。 > 2. 可通过回溯或树搜索(如MCTS、波束搜索)实现计算扩展,OpenAI的相关研究表明,细粒度训练的过程验证器性能显著优于仅基于结果训练的模型。 > > #### 二、过程验证器的训练挑战 > > 3. **标注成本高昂** > 1. 需步骤级二元标签(正确/错误),例如OpenAI曾邀请数学专家对解决方案逐步骤标注至首次错误,过程繁琐且成本极高,严重限制了PRM的可扩展性。 > 4. **数据依赖问题** > 1. 传统判别式PRM需大量标注数据,而人工标注难以满足大规模需求。 > > #### 三、步骤标签获取方案 > > 5. **对齐法(Alignment Approach)** > 1. 通过对齐正确与错误解决方案,定位不匹配的步骤并标注为“错误”。 > 2. 例如:对比正确解与错误解的步骤,不匹配处即为错误步骤,可用于训练验证器。 > 6. **概率法(Probabilistic Approach)** > 1. 基于步骤生成完整推导路径,计算到达正确答案的概率,以此评估步骤正确性。 > 2. 问题:依赖模型推导能力,若模型本身性能不足,可能误判正确步骤为错误,引入标签噪声。 > > #### 四、生成式验证器(GenRM)的进展与局限 > > 7. **核心机制** > 1. 通过训练生成模型(如微调的聊天机器人)生成验证思维链,提取“正确/错误”概率作为评分。 > 2. 优势:相比判别式模型,推理计算扩展性更强(如相同采样预算下性能更优)。 > 8. **局限性** > 1. 仅支持结果验证,无法用于树搜索等需要部分解的场景; > 2. 需数千个黄金解决方案用于训练,且缺乏跨领域泛化能力(仅在基础数学等简单任务上验证)。 > > #### 五、Think PRM:生成式过程验证器的改进 > > 9. **模型设计** > 1. 输入问题与候选解,生成细粒度的验证思维链,逐步骤判断正确性(区别于仅输出最终标签的结果验证器)。 > 10. **关键实验结论** > 1. **数据效率** :仅用8000个步骤标签训练的Think PRM(14B模型),性能优于使用70万标签训练的判别式PRM; > 2. **计算扩展性** :在“最佳N选”(Best of N)场景中,通过加权多数投票排序解决方案,准确率超越基线模型; > 3. **跨领域泛化** :在物理问答(GPQA)、编程评估(CodeBench)等领域表现优于判别式PRM。 > 11. **局限性** > 1. 推理效率低于判别式模型(需生成较长思维链); > 2. 存在“过度自信”问题(评分集中于0或1,缺乏不确定性表征); > 3. “步骤标签干扰”:前一步骤的判断可能偏置后续标签(如首步错误易导致后续误判)。 > > #### 六、未来方向 > > 12. **强化学习(RL)优化** > 1. 通过RL或偏好学习进一步提升验证器性能,但需设计可靠的奖励信号以避免“奖励博弈”。 > 13. **混合策略** > 1. 根据问题难度动态切换判别式与生成式PRM,平衡效率与准确性。 > > #### 七、问答环节 > > * 提问:是否考虑用RL训练验证器? > * 回答:RL是自然下一步,近期已有研究尝试,关键在于定义有效奖励信号,预计可优化搜索策略与验证思维。 > > #### 八、结语 > > * 说话人A邀请参会者通过邮件进一步讨论,或在10月加拿大语言建模会议(Callum)的工作坊面聊。 > * 说话人B邀请说话人A访问北京,期待线下交流。 https://arxiv.org/abs/2305.14934 GRACE:基于判别器引导的思维链推理 [穆罕默德·哈利法 ](https://arxiv.org/search/cs?searchtype=author&query=Khalifa,+M), [拉贾努根·洛格斯瓦兰 ](https://arxiv.org/search/cs?searchtype=author&query=Logeswaran,+L), [文泰·李 ](https://arxiv.org/search/cs?searchtype=author&query=Lee,+M), [洪乐·李 ](https://arxiv.org/search/cs?searchtype=author&query=Lee,+H), [陆望](https://arxiv.org/search/cs?searchtype=author&query=Wang,+L) > 在多步推理任务中(例如思维链推理),语言模型(LM)很容易为错误的推理步骤分配高概率。因此,优化解可能性的解码策略往往会产生错误答案。为解决这一问题,我们提出了一种基于正确性判别器引导的思维链推理方法(GRACE),这种逐步解码方法能引导解码过程生成正确的推理步骤。GRACE 采用了一个通过对比正确与错误步骤训练的判别器,在解码过程中根据候选步骤的正确性进行评分。值得注意的是,GRACE 仅需对语言模型进行采样,无需训练或微调语言模型。基于 FLAN-T5 和 LLaMA 系列模型的实验表明,在四项数学推理和两项符号推理任务中,GRACE 在多数情况下相比贪婪解码、验证器和自一致性方法都取得了显著性能提升。当与自一致性方法结合使用时,GRACE 以较大优势超越了所有基线方法。 人类与 LLM 在 GSM8K 上的评估表明,GRACE 不仅提高了最终答案的准确率,还提升了中间推理的正确性。我们的实现代码可通过\url{[ 此链接 ](https://github.com/mukhal/grace)}获取。 https://arxiv.org/abs/2312.08935 Math-Shepherd:无需人工标注逐步验证与强化 LLMs 王培毅、李磊、邵志宏、徐瑞祥、戴大迈、李逸飞、陈德利、吴洋、隋志芳 > 本文提出了一种创新的过程导向型数学过程奖励模型\textbf{Math-Shepherd},该模型能够为数学问题解答的每个步骤分配奖励分数。Math-Shepherd 的训练通过自动构建的过程监督数据实现,突破了现有工作中对人工标注高度依赖的瓶颈。我们探索了 Math-Shepherd 在两种场景下的有效性:1)\textit{验证}:利用 Math-Shepherd 对大型语言模型(LLMs)生成的多个输出进行重排序;2)\textit{强化学习}:采用 Math-Shepherd 通过逐步近端策略优化(PPO)来增强 LLMs。实验表明,结合 Math-Shepherd 的一系列开源 LLMs 展现出卓越性能。例如,采用 Math-Shepherd 的逐步 PPO 显著提升了 Mistral-7B 的准确率(GSM8K 数据集从 77.9\%提升至 84.1\%,MATH 数据集从 28.6\%提升至 33.0\%)。若进一步通过 Math-Shepherd 进行验证,在 GSM8K 和 MATH 数据集上的准确率可分别提升至 89.1\%和 43.5\%。我们相信,自动化的过程监督对 LLMs 的未来发展具有重要潜力。 https://arxiv.org/abs/2408.15240 生成式验证器:将奖励建模视为下一词元预测 张伦君,阿里安·侯赛尼,赫里蒂克·班萨尔,梅兰·卡泽米,阿维拉尔·库马尔,里沙布·阿加瓦尔 > 验证器或奖励模型常被用于提升大语言模型(LLMs)的推理性能。常见的方法是 Best-of-N 策略,即由 LLM 生成 N 个候选解决方案,经验证器排序后选择最优解。虽然基于 LLM 的验证器通常被训练为判别式分类器来评分解决方案,但这种方式并未充分利用预训练 LLMs 的文本生成能力。为突破这一限制,我们提出改用普遍采用的下一词预测目标来训练验证器,使其同时具备验证和解决方案生成能力。与标准验证器相比,这类生成式验证器(GenRM)能继承 LLMs 的多种优势:它们与指令微调无缝集成,支持思维链推理,并能通过多数表决机制利用额外测试时计算资源来优化验证效果。实验表明,GenRM 在判别式验证器、DPO 验证器和 LLM-as-a-Judge 等基准上均表现更优,使用 Best-of-N 策略时性能提升显著——算法任务达到 5% 45.3%,GSM8K 数学题达到 73% 93.4%。 在易到难的泛化场景中,我们观察到 MATH 数据集上准确率提升 28%至 44.6%,MMLU 抽象代数部分提升 37.9%至 53.5%。此外,研究发现使用合成验证原理训练 GenRM 足以识别数学问题中的细微错误。最后,我们证明 GenRM 的扩展性在模型规模和测试计算量方面表现优异。 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=ZmZkZjQ4ZjcyMDZlMDMxNmU4NmZjYjk5MDJlY2QzYjhfMUtQZW9NOUpmZHFKRnZLNGMyMHJIMkd1RFhMQUEzdFRfVG9rZW46S0lPcGJxVGc0b0JWMDd4djJkYmNqRGI3bmxmXzE3NTQ1NDE0MDA6MTc1NDU0NTAwMF9WNA) ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=ODRiYjdlZWViZTdhNTcyODljNjkwNjI1Njg3MTllMWRfZlM4ZDFudDFJaUduTE1PczFNdjVWSlQ0Nms2NWlTYmlfVG9rZW46VXhSemIwZkppb0owazh4MHJMSGNqWXc1bkJjXzE3NTQ1NDE0MDA6MTc1NDU0NTAwMF9WNA) ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=MzRiODRmYzliN2M0M2ZlMTkzOGMzNTM3ZGI5ZDU4YjBfZXpZT2xkblJjZFduejdoc0JUWmQzdFRyR1VJTGlnNFBfVG9rZW46TmN5UmJhdFFvb2JtV1J4QlAza2NmYjhpbkpjXzE3NTQ1NDE0MDA6MTc1NDU0NTAwMF9WNA) ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=MTM3ZjAyNTIzYTRiNmQyM2U3OTc5M2RmZTVlN2M4MDdfZVdmTml6NW8xcXphWXo1ZFozdUtlMUtyYUVIbG9iWnVfVG9rZW46SVBHNmJ4SWRsb1B1bmV4am1xM2NONTFVbk5mXzE3NTQ1NDE0MDA6MTc1NDU0NTAwMF9WNA) ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=MjczNmYxOGExMzU4MjQxMTJmM2YyZTI3ZDRkMDk5MDhfYlJqaXJWVFNZT3I2QVdnVTlsQVpScW5iOTZaa3I2QlhfVG9rZW46V1F3UmJMZDJibzBZb3Z4Sm9ndWMwb2ZrbjE0XzE3NTQ1NDE0MDA6MTc1NDU0NTAwMF9WNA) ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=M2Q3NGFmMDYxYThlYjMyZGViNWEzN2RlYzZjMDUyOWRfdTBjbjRTa1pmTm9GWjVWSVZ2WnVtWlpzbk15WnJVQ0RfVG9rZW46Rk1aZ2JDeDBzb1pldGR4aVJXU2M5ZEtobmloXzE3NTQ1NDE0MDA6MTc1NDU0NTAwMF9WNA)

Bengio等质疑CoT忠实度:语言化步骤未必反映LLM真实推理

研究指出,Transformer的分布式并行计算与CoT的顺序语言表达存在固有错位,因此思维链可能只是事后合理化,而非模型真实推理过程。

 推理 逻辑推理 模型评估 人工智能

CoT虽然以逐步文本呈现答案,但不一定忠实反映模型内部的真实计算过程。研究总结了四类关键现象:偏见驱动的合理化与动机性推理、隐性错误纠正、不忠实的非逻辑捷径,以及仅依靠填充词元完成计算。机制可解释性研究显示,Transformer通常由多个组件分布式、并行地处理信息,而非严格遵循CoT所展示的顺序步骤。模型内部计算机制与外部语言解释之间的架构性差异,可能从根本上限制CoT的忠实度。

用途与启示
  • 提醒研究者不要将CoT直接视为模型内部推理轨迹或可靠解释。
  • 评估推理能力时,应区分答案正确性、过程合理性与过程忠实度。
  • 可结合机制可解释性、干预实验和反事实测试验证思维链是否真正影响答案。
  • 在高风险应用中,不应仅凭流畅的CoT判断模型决策是否可信。
📝 原始笔记(逐字保留)
4. 2025-07-03 11:22:43 Thursday | Bengio亲手戳穿CoT神话!LLM推理是假象,25%顶会论文遭打脸 https://mp.weixin.qq.com/s/4mJm30w6v9mcPujWX02_mA CoT看似一步步给出答案,实则并不一定是其真实的推理过程。 论文地址:https://www.alphaxiv.org/abs/2025.02。 https://arxiv.org/abs/2505.00875 研究人员推测,简洁的CoT无法完全捕捉基Transformer大模型中存在的分布式并行计算过程。 研究人员也总结了4项关键发现:偏见驱动的合理化与动机性推理、隐性错误纠正(Silent Error Correction)、不忠实的非逻辑捷径(Unfaithful Illogical Shortcuts)、填充词元 (Filler Tokens)。 「机制可解释性」研究表明,Transformer架构可能从根本上限制了CoT的忠实度。 基于Transformer搭建的LLM,通常以分布式方式同时通过多个组件处理信息,而不是CoT呈现的顺序步骤。 正是因为这种架构差异,导致了模型计算方式与语言表达方式之间,存在固有的不匹配。 为此,他们提出了以下几点建议:

NaturalThoughts:为通用推理任务选择和提炼推理轨迹

研究通过筛选教师模型的高质量推理轨迹构建 NaturalThoughts,发现困难且需要多样化策略的样本能更高效地向学生模型迁移通用推理能力。

 推理 模型训练 数据工程 逻辑推理

该研究围绕 NaturalReasoning 中的大量问题,从强教师模型生成的轨迹中筛选并整理出高质量推理数据 NaturalThoughts。作者系统分析了数据规模、样本效率、任务难度和推理策略多样性对蒸馏效果的影响。实验发现,随机增加训练数据量是稳定有效的强基线,而选择更困难、需要更多不同推理策略的样本具有更高的迁移效率。在 Llama 和 Qwen 模型上的实验中,NaturalThoughts 在 GPQA-Diamond、MMLU-Pro 和 SuperGPQA 等 STEM 推理基准上优于 OpenThoughts、LIMO 等现有数据集。

用途与启示
  • 为通用推理模型的监督微调提供推理轨迹筛选与数据策划方法。
  • 表明数据规模仍是可靠基线,但高难度和策略多样性可显著提高蒸馏的样本效率。
  • 启示推理数据构建应从单纯追求数量转向兼顾难度、覆盖度与推理策略多样性。
📝 原始笔记(逐字保留)
2025-07-03 11:39:50 Thursday | **[NaturalThoughts:为一般推理任务选择和提炼推理轨迹](https://papers.cool/arxiv/2507.01921)** **[PDF(3)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Yang Li](https://arxiv.org/search/?searchtype=author&query=Yang%20Li), [Youssef Emad](https://arxiv.org/search/?searchtype=author&query=Youssef%20Emad), [Karthik Padthe](https://arxiv.org/search/?searchtype=author&query=Karthik%20Padthe), [Jack Lanchantin](https://arxiv.org/search/?searchtype=author&query=Jack%20Lanchantin), [Weizhe Yuan](https://arxiv.org/search/?searchtype=author&query=Weizhe%20Yuan), [Thao Nguyen](https://arxiv.org/search/?searchtype=author&query=Thao%20Nguyen), [Jason Weston](https://arxiv.org/search/?searchtype=author&query=Jason%20Weston), [Shang-Wen Li](https://arxiv.org/search/?searchtype=author&query=Shang-Wen%20Li), [Dong Wang](https://arxiv.org/search/?searchtype=author&query=Dong%20Wang), [Ilia Kulikov](https://arxiv.org/search/?searchtype=author&query=Ilia%20Kulikov), [Xian Li](https://arxiv.org/search/?searchtype=author&query=Xian%20Li) 最近的研究表明,通过监督微调从较大的教师模型中提炼推理痕迹优于单独使用较小学生模型的强化学习(Guo 等人,2025 年)。然而,还没有系统地研究老师的什么样的推理演示对提高学生模型的推理能力最有效。在这项工作中,我们根据 NaturalReasoning 的大量问题,从强大的教师模型中选择推理轨迹,从而策划高质量的 “NaturalThoughts” (Yuan et al. 2025)。我们首先对影响蒸馏推理能力的因素进行系统分析,包括一般推理任务的样本效率和可扩展性。我们观察到,简单地通过随机采样来增加数据大小是一个强大的基线,可以稳定地提高性能。此外,我们发现,选择需要更多不同推理策略的困难例子,对转移教师模型的推理技能来说,样本效率更高。在 Llama 和 Qwen 模型上进行评估,使用 NaturalThoughts 进行训练在一般 STEM 推理基准(包括 GPQA-Diamond、MMLU-Pro 和 SuperGPQA)上优于现有的推理数据集,例如 OpenThoughts、LIMO 等。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** ## (推理的)泛化性

Grok 4 与 Grok 4 Code 发布:强化推理与编程能力

xAI 推出旗舰推理模型 Grok 4 及面向代码任务与编辑器集成的 Grok 4 Code。

 模型开发 推理 人工智能辅助编程

Grok 4(grok-4-0629)是一款规模更大、能力更强的 Thinking 模型。官方将其定位为最新旗舰模型,并强调其在自然语言、数学和推理任务上的表现。Grok 4 Code(grok-4-code-0629)则针对编程场景优化,可用于回答代码问题。该模型还支持嵌入代码编辑器,并可在 Cursor 中快捷使用。

用途与启示
  • Grok 4 可用于复杂数学、自然语言理解及多步推理任务。
  • Grok 4 Code 适合代码问答、辅助开发和编辑器内编程。
  • 两款模型的差异化定位体现了通用推理模型与垂直代码模型并行发展的趋势。
📝 原始笔记(逐字保留)
2. 2025-07-03 11:20:12 Thursday | https://mp.weixin.qq.com/s/__VhGST5Qm_KI8yoc_d68A Grok 4 (grok-4-0629),则是一个更大、更智能的Thinking模型。官方宣称,这是他们最新、最强大的旗舰模型,在自然语言、数学和推理上性能无与伦比,是用户的最佳选择。 而Grok 4 Code(grok-4-code-0629)则专为编程而打造。你可以向它询问代码问题,甚至直接把它嵌入到自己的代码编辑器中,还可以一键在Cursor上使用。

OpenRouter 神秘模型 Cypher Alpha 上线

OpenRouter 上线神秘模型 Cypher Alpha,支持免费使用、百万 token 上下文与推理能力。

 模型开发 人工智能 推理

OpenRouter 平台出现了一款名为 Cypher Alpha 的神秘模型。目前该模型可以免费使用,并支持高达 100 万 token 的上下文窗口。模型还具备推理能力,但其开发者、技术架构和具体性能尚未披露。

用途与启示
  • 可用于长文档分析、超长对话和大规模代码上下文处理
  • 为低成本测试百万 token 上下文及推理能力提供入口
  • 值得持续关注其真实来源、基准表现和后续定价策略
📝 原始笔记(逐字保留)
3. 2025-07-03 10:27:17 Thursday | OpenRouter 上出现了一个神秘模型,该模型被命名为「Cypher Alpha」。其可以免费使用,100 万 token 上下文,还具有推理能力。 https://mp.weixin.qq.com/s/lmIQhT7uI9etjxGgIYqLoA

智谱开源 GLM-4.1V-9B-Thinking:9B 参数模型斩获 23 项 SOTA

智谱发布并开源 GLM-4.1V-9B-Thinking,通过思维链与课程采样强化学习提升推理能力,以 9B 参数规模在多项评测中超过更大模型并取得 23 项 SOTA。

 模型开发 多模态 推理 强化学习 模型训练

智谱发布并开源了仅有 9B 参数的 GLM-4.1V-9B-Thinking。该模型引入思维链(Chain-of-Thought)机制,以增强复杂任务中的推理能力。训练阶段采用课程采样强化学习(RLCS),让模型从简单任务逐步过渡到更高难度任务。经过大规模强化训练后,模型在实用性、准确性和稳定性方面均获提升,并在多项评测中超越参数规模约为其 8 倍的模型。

用途与启示
  • 为资源受限场景提供兼顾模型规模与推理性能的开源方案。
  • 展示课程学习与强化学习结合在提升小参数模型能力方面的潜力。
  • 可用于多模态理解、复杂推理及对部署成本敏感的实际应用。
📝 原始笔记(逐字保留)
2025-07-03 10:59:19 Thursday | 9B“小”模型干了票“大”的:性能超8倍参数模型,拿下23项SOTA | 智谱开源 https://mp.weixin.qq.com/s/5jcSAR6I7MyHc4INo7f9BQ **智谱发布并开源了一个仅9B大小的模型——GLM-4.1V-9B-Thinking** 引入了 **思维链** (Chain-of-Thought)推理机制,并通过 **课程采样强化学习** (RLCS,Reinforcement Learning with Curriculum Sampling)来全面提升模型能力。 团队采用“课程学习”的方式进行大规模强化训练,也就是先让模型从简单任务开始,逐步挑战更难的任务。通过这种由浅入深的训练策略,模型在实用性、准确性以及稳定性方面都有了明显的提升。

字节发布多主体可控生成模型 XVerse

字节推出 XVerse,通过学习 DiT 文本流调制机制中的偏移量,实现多个主体身份与语义属性的一致、精确控制,同时保持图像生成质量。

 模型开发 多模态

字节最新发布多主体控制生成模型 XVerse,支持对预先设定的每个主体进行精确控制。该模型在增强可控性的同时,尽可能避免破坏图像生成质量。其核心方法是学习 DiT 文本流调制机制中的偏移量,从而统一控制多个主体的身份及语义属性。XVerse 重点解决多主体生成中身份一致性和属性控制相互干扰的问题。

用途与启示
  • 提升多角色、多对象图像生成中的身份一致性与属性可控性
  • 为广告设计、影视创作和个性化内容生产提供更稳定的生成能力
  • 展示通过轻量调节 DiT 内部调制机制增强多主体控制的新思路
📝 原始笔记(逐字保留)
2. 2025-07-03 11:01:58 Thursday | 字节最新发布多主体控制生成模型 **Xverse** —— 既可以对设定好的每个主体进行精确控制,也不会破坏图像的生成质量 https://mp.weixin.qq.com/s/JzuyHDfRGd-hFoL_VOXCAg XVerse的核心是通过学习DiT(Diffusion Transformer,一种扩散模型和Transformer架构的生成模型)中文本流调制机制中的偏移量,**实现对多个主体身份和语义属性的****一致控制**。 ### 音频

青年科研人看过来!2025“蚂蚁InTech奖”启动

2025年“蚂蚁InTech奖”正式发布,面向青年科研人才提供奖项申报与发展支持。

 人工智能

2025年“蚂蚁InTech奖”于7月3日发布,重点关注具有创新潜力的青年科研人才。该奖项旨在发现和支持科技领域的优秀青年研究者,鼓励前沿探索与技术创新。有意申报者可通过官方微信公众号文章了解参评条件、申报流程及时间安排。

用途与启示
  • 为青年科研人员提供奖项申报和成果展示机会
  • 帮助研究者关注产业界支持前沿科研的人才计划
  • 可用于跟踪年度科研奖励、资助与人才发展信息
📝 原始笔记(逐字保留)
1. 2025-07-03 10:44:00 Thursday | 青年科研人看过来!2025“蚂蚁InTech奖”来了 https://mp.weixin.qq.com/s/56rsuKL5PwuGGCJxjpNHug

OS-Kairos:以置信度机制避免 GUI 智能体“过度执行”

上海交大与 Meta 联合提出 OS-Kairos,通过置信度预测和自适应求助机制提升 GUI 智能体执行过程的可控性。

 智能体 多模态 人工智能框架 数据合成 模型训练 模型评估

OS-Kairos 是一种面向多模态大模型 GUI 智能体的自适应交互系统,可在每一步操作中预测执行置信度,并判断是否需要人类或更高级模型介入。系统设计了协同探测框架,利用 GPT-4o 与界面解析模型共同评估交互步骤,自动构建带有置信度标注的高质量操作轨迹。其置信驱动交互策略通过监督学习将置信判断能力整合到智能体中,并利用阈值动态调节自主执行程度。实验显示,该系统在复杂场景数据集和移动端基准上优于现有模型,兼具有效性、通用性、可扩展性与效率。

用途与启示
  • 降低 GUI 智能体因置信度不足却持续操作而产生的误执行风险。
  • 为“自主执行—模型协助—人工接管”提供可调节的分级控制机制。
  • 展示如何利用强模型与界面解析器协同生成置信度监督数据。
  • 可用于移动设备自动化、桌面操作助手及高风险业务流程中的可控智能体设计。
📝 原始笔记(逐字保留)
2025-07-03 10:32:46 Thursday | 让GUI智能体不再「过度执行」,上海交大、Meta联合发布OS-Kairos系统 https://mp.weixin.qq.com/s/KVEyNTGEq0ykW0en8Xo3Gw 本论文提出了 OS-Kairos,一种具有自适应交互能力的新型 GUI 智能体系统,其主要贡献如下: (i)引入置信度预测机制,让 GUI 智能体能够在每一步操作中评估自身执行的信心,并据此决定是否调用人类或高级模型介入,实现真正的 “可控自主”。 (ii)设计了协同探测框架(Collaborative Probing Framework),通过 GPT-4o 与界面解析模型协同,为每一个交互步骤自动打分,生成高质量的含置信度标注的操作轨迹数据集。 (iii)提出置信驱动交互策略(Confidence-driven Interaction),将置信度评分作为模型训练的一部分,通过监督学习将置信判断能力整合进 GUI 智能体本身,并通过阈值实现自适应调节。 (iv)OS-Kairos 在我们精选的复杂场景数据集和完善的移动基准上都远远优于现有模型,具有有效性、通用性、可扩展性和效率的优点。 论文标题:OS-Kairos: Adaptive Interaction for MLLM-Powered GUI Agents 论文链接:https://arxiv.org/abs/2503.16465 论文代码:https://github.com/Wuzheng02/OS-Kairos

LLM 智能体与传统聊天机器人的本质区别及科学评测

该综述从演化视角区分 LLM 智能体与传统聊天机器人,并系统探讨具备自主能力的智能体应如何进行科学评测。

 智能体 模型评估 人工智能

论文《Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey》将 AI Agent 视为人工智能发展的新阶段。与主要围绕人机对话和内容生成的传统聊天机器人不同,智能体能够面向目标与环境采取更自主的行动。论文从五个演化维度分析这种能力变化,并据此讨论现有评测方式的适用性与不足。该综述旨在为 LLM 智能体建立更系统、科学的评估框架。

用途与启示
  • 帮助研究者从自主性与环境交互等角度区分智能体和传统聊天机器人
  • 为设计覆盖多维能力的智能体评测体系提供参考
  • 提醒开发者避免仅用对话质量或静态问答指标衡量智能体能力
📝 原始笔记(逐字保留)
2025-07-03 10:11:22 Thursday | AI Agent 到底和传统聊天机器人有何本质区别?又该如何科学评测 AI Agent?https://mp.weixin.qq.com/s/vu2g68KB3cYhryOtggtj4w 论文标题:Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey 论文链接:https://arxiv.org/pdf/2506.11102 论文指出,AI Agent 的出现是 AI 发展的新阶段。它们不仅仅回复人类对话,还具备了五个维度的进化:

SRFT:单阶段融合监督与强化学习的大模型微调方法

中科院自动化所与美团提出SRFT,通过熵感知动态加权在单阶段内协同监督微调与强化学习,提升模型推理能力和泛化表现。

 模型训练 强化学习 推理 人工智能

中国科学院自动化研究所深度强化学习团队联合美团提出单阶段监督-强化微调方法 SRFT(Supervised Reinforcement Fine-Tuning)。该方法同时利用演示数据和模型自生成的探索试错数据,避免将监督微调与强化学习割裂为两个训练阶段。SFT负责粗粒度的行为策略逼近,RL负责细粒度的策略精化。SRFT进一步采用基于熵的动态加权机制平衡监督信号与强化信号,从而改善推理能力与泛化表现。

用途与启示
  • 将SFT与RL整合为单阶段流程,简化大模型后训练范式。
  • 动态协调演示学习和自主探索,降低两类训练信号之间的冲突。
  • 为兼顾训练稳定性、推理能力和泛化性能的微调方案提供参考。
📝 原始笔记(逐字保留)
2025-07-03 10:51:03 Thursday | 同时监督和强化的单阶段大模型微调,告别“先背书再刷题”,推理泛化双提升|中科院&美团等 https://mp.weixin.qq.com/s/9dTE8dtVIO1TE0Xy3vUReQ **中国科学院自动化研究所深度强化学习团队**联合 **美团** ,提出一种 **单阶段监督-强化微调方法——SRFT (Supervised Reinforcement Fine-Tuning)** 。该方法通过基于熵的动态加权机制,将两种训练范式结合。 ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=ZTA1MWVmMWNiYjQ2NmUyMDdjZTg4ZGM1NDllNjFmNTZfcE1vVU5rdkZtemU0Mm1xcVpXZ0pLdXBMWVc3R3NvOFVfVG9rZW46UEsxVmJrcGNQbzNIRnR4cXQ3SmNQZ0xOblNoXzE3NTQ1MzkzMjQ6MTc1NDU0MjkyNF9WNA) 图注:SRFT方法示意图,展示了对探索试错(rollout)数据和演示(demonstration)数据的协同学习,以及平衡监督和强化信号的熵感知策略更新。 SRFT的核心在于其单阶段学习机制:通过SFT实现 **粗粒度行为策略逼近** ,通过RL实现 **细粒度策略精化** ,借助于 **单阶段训练** ,将微调同时应用于演示数据和自生成的试错数据。

华为 CloudMatrix 384 超节点很强,但它的“灵魂”在云上

文章认为,华为 CloudMatrix 384 的价值不仅在于超节点硬件能力,更在于云上资源调度与系统协同。

 模型训练 系统优化 人工智能

文章围绕华为 CloudMatrix 384 超节点展开,关注其在大模型训练等高性能计算场景中的潜力。标题强调,硬件规模与算力只是基础,真正决定使用效率的是云端的软件、调度和服务能力。其核心启示是,应从软硬件协同和云上系统能力的角度评价 AI 算力基础设施。

用途与启示
  • 了解超节点在大模型训练基础设施中的定位
  • 关注云端调度、资源管理与软硬件协同能力
  • 为训练集群选型和系统优化提供参考
📝 原始笔记(逐字保留)
2025-07-03 10:45:43 Thursday |华为CloudMatrix384超节点很强,但它的「灵魂」在云上 https://mp.weixin.qq.com/s/OG2-0xvgynUXzJouGeIYnw

MIT研究:大语言模型自主操控飞船,Llama实现零失败率

MIT研究展示了大语言模型通过文本状态理解、决策生成与代码执行自主控制飞船的能力,其中开源Llama在太空追逐任务中实现零失败率。

 逻辑推理 智能体 任务规划 人工智能应用 人工智能

MIT研究团队让大语言模型直接参与宇宙飞船追踪卫星的导航与控制挑战。系统采用“文本状态输入—语言模型决策—代码执行”的三阶段流程,将飞船状态转化为文字,并由模型生成控制动作。实验中,经过少量调整的ChatGPT取得第二名,而开源Llama凭借提示词实现精准追踪、燃料优化和零失败率。结果表明,LLM可利用已有知识在小数据条件下适应复杂航天任务,但其幻觉与可靠性风险仍需进一步解决。

用途与启示
  • 探索将LLM作为高层决策器,用于自主航天器的导航、追踪与控制。
  • 说明提示工程和少量适配可能在低数据、训练成本受限的场景中取得良好效果。
  • 为通用智能体连接仿真环境、控制代码和真实执行系统提供参考架构。
  • 在实际部署前仍需加入形式化验证、安全约束和故障回退机制,以降低幻觉带来的风险。
📝 原始笔记(逐字保留)
20250703|ChatGPT惨败Llama!MIT官宣AI开飞船0%失败率,马斯克火星殖民不再是梦 https://mp.weixin.qq.com/s/0yJoWLj8_cVQPsEe9X_MDA MIT最新研究让LLM直接操控宇宙飞船进行太空追逐挑战赛:ChatGPT少量微调即获第二,开源Llama更胜一筹,凭提示词精准追踪卫星、节省燃料,更是0%失败率,验证AI小数据高效与自主航天可行,为未来的太空漫游铺路。 整个系统由文本状态输入→语言模型决策→代码执行三步组成,展现出LLM模型强大的泛化与适应能力。 论文地址:https://arxiv.org/pdf/2505.19896 研究亮点速览: * ChatGPT用文字指令 **完成飞船导航、控制决策** ,表现远超预期; * 研究 **无需大规模训练** ,充分利用LLM已有知识与语言理解; * 虽仍有「幻觉」等风险,但自主化航天已从幻想变为可行路线。

MetaExplainer:生成多类型、以用户为中心的人工智能解释框架

MetaExplainer 通过大模型、解释本体与模型解释器组成的三阶段神经符号流程,为用户生成可追溯、多类型且问题驱动的自然语言解释。

 元学习 人工智能框架 推理 人工智能应用

MetaExplainer 是一个面向可信人工智能的神经符号框架,用于缩小模型现有解释与用户实际解释需求之间的差距。框架首先利用大语言模型将用户问题转换为机器可读形式,随后调用适当的模型解释方法,最后将解释器输出合成为自然语言,并以解释本体约束整个过程。在 PIMA Indian 糖尿病表格数据集上的实验中,其问题重构 F1 为 59.06%,模型解释忠实度为 70%,自然语言合成的上下文利用率为 67%。该框架支持对比、反事实、基本原理、案例和数据等多种解释类型,用户研究也显示其生成结果具有较好的创造性与全面性。

用途与启示
  • 为不同用户按问题生成定制化、多类型的模型解释。
  • 通过解释本体连接大语言模型与传统解释器,提高解释过程的可追溯性。
  • 可用于医疗等高风险场景,辅助提升人工智能系统的透明度、可信度与可审计性。
  • 展示神经符号方法在统一调度多种可解释人工智能技术方面的潜力。
📝 原始笔记(逐字保留)
2025-07-03 11:44:30 Thursday| **Authors** : [Reza Arabpour](https://arxiv.org/search/?searchtype=author&query=Reza%20Arabpour), [Haitz Sáez de Ocáriz Borde](https://arxiv.org/search/?searchtype=author&query=Haitz%20S%C3%A1ez%20de%20Oc%C3%A1riz%20Borde), [Anastasis Kratsios](https://arxiv.org/search/?searchtype=author&query=Anastasis%20Kratsios) 低秩适配器 (LoRA) 通过实现参数高效的更新,改变了大型语言模型 (LLM) 的微调。然而,由于依赖基于 GPU 的训练,它们的广泛采用仍然受到限制。在这项工作中,我们提出了一种以理论为基础的 LoRA 微调方法,专为计算资源有限的用户设计,特别是那些仅限于标准笔记本电脑 CPU 的用户。我们的方法学习了一个 **元运算符,该元运算符通过利用 Mistral-7B-Instruct-v0.2 模型的大量预训练适配器,将任何表示为概率分布的输入数据集映射到一组 LoRA 权重** 。我们的管道不是执行新的基于梯度的更新,而是直接在 CPU 上通过现有 LoRA 的轻量级组合来构建适配器。虽然生成的适配器的性能与 GPU 训练的适配器不匹配,但它们在下游任务上始终优于基本 Mistral 模型,为传统的基于 GPU 的微调提供了一种实用且可访问的替代方案。 **科目** : **[机器学习](https://papers.cool/arxiv/cs.LG)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算和语言](https://papers.cool/arxiv/cs.CL), [机器学习](https://papers.cool/arxiv/stat.ML) **发布** : 2025-07-02 15:24:47 UTC #### [MetaExplainer:为人工智能系统生成多类型、以用户为中心的解释的框架](https://papers.cool/arxiv/2508.00300) 解释对于构建值得信赖的人工智能系统至关重要,但模型提供的解释与用户所需的解释之间往往存在差距。为了解决这一差距,我们推出了 MetaExplainer,这是一个神经符号框架,旨在生成以用户为中心的解释。 我们的方法采用三阶段过程:首先,我们使用最先进的大型语言模型 (LLM) 将用户问题分解为机器可读的格式;其次,我们将生成系统建议的任务委托给模型解释器方法;最后,我们合成自然语言解释来总结解释器输出。在整个过程中,我们利用解释本体来指导语言模型和解释方法。通过利用法学硕士和结构化的解释生成方法,MetaExplainer 旨在增强人工智能系统在各种应用程序中的可解释性和可信度,为用户提供量身定制的、问题驱动的解释,更好地满足他们的需求。对 MetaExplainer 的全面评估表明,在评估和利用当前最先进的解释框架方面迈出了一步。 我们的结果显示,在所有阶段都表现出色,问题重构的 F1 得分为 59.06%,模型解释的忠实度为 70%,自然语言合成的上下文利用率为 67%。用户研究证实了这些发现,强调了生成解释的创造性和全面性。MetaExplainer 在糖尿病 (PIMA Indian) 表格数据集上进行测试,支持多种解释类型,包括对比解释、反事实解释、基本原理解释、基于案例解释和数据解释。该框架的多功能性和可追溯性,从使用本体来指导法学硕士,表明在测试场景之外具有广泛的适用性,将 MetaExplainer 定位为增强各个领域的人工智能可解释性的有前途的工具。
0%