2025-06-28 科研追新

当日精选(由提交工具自动创建)。

Kling-Foley:为视频生成音画同步的高质量立体声

可灵推出多模态视频生音模型 Kling-Foley,可结合视频内容与可选文本提示生成语义匹配、时间同步且支持空间声源渲染的立体声音频。

 多模态 模型开发 人工智能应用 数据工程 模型评估

Kling-Foley 是一款面向视频内容的多模态音频生成模型,能够自动生成与画面语义相关且时间同步的高质量声音。模型既可以直接理解视频,也支持通过可选文本提示控制生成内容,覆盖音效、背景音乐等声音类型。它能够处理任意时长的视频,并提供立体声渲染能力。通过空间定向声源建模,生成的声音可进一步匹配画面中声源的位置与运动。

用途与启示
  • 为无原声视频、AI 生成视频和影视后期自动补充同步音效与背景音乐
  • 降低视频声音设计及空间音频制作的人工成本
  • 为视频到音频生成、长音频建模和音画同步评估提供研究基线
  • 展示多模态模型在语义理解、时间对齐与空间声场建模结合上的应用潜力
📝 原始笔记(逐字保留)
2025-06-28 18:46:35 Saturday | 音画同步,AI视频也能有完美「原声音」,可灵AI刚上线的!https://mp.weixin.qq.com/s/8h5sZUIxsmce9GRRMDkEBg 他们提出的多模态视频生音效模型名叫 Kling-Foley,能够通过大模型自动生成与视频内容同步的高质量立体声音频。 Kling-Foley 支持基于视频内容与可选文本提示自动生成与视频画面语义相关、时间同步的高质量立体声音频,涵盖音效、背景音乐等多种类型声音内容。它支持生成任意时长的音频内容,还具备立体声渲染的能力,支持空间定向的声源建模和渲染。 * 论文:https://www.arxiv.org/pdf/2506.19774 * 项目主页:https://klingfoley.github.io/Kling-Foley/ * GitHub 链接:https://github.com/klingfoley/Kling-Foley * Benchmark:https://huggingface.co/datasets/klingfoley/Kling-Audio-Eval ## 3D

不靠 Agent,四步修复真实 Bug:蚂蚁 CGM 登顶 SWE-Bench 开源榜

蚂蚁 CGM 通过四步式流程完成真实软件缺陷修复,并在 SWE-Bench 开源榜取得领先成绩。

 智能体工具 人工智能辅助编程 SWE 软件工程 系统优化

蚂蚁推出的 CGM 聚焦真实代码仓库中的 Bug 修复任务。该方案不依赖复杂的 Agent 架构,而是采用四步式流程定位问题、生成并验证补丁。CGM 在 SWE-Bench 开源榜取得领先成绩,展示了结构化工作流在自动代码修复中的潜力。其结果也表明,精简流程与针对性优化可能比堆叠智能体组件更有效。

用途与启示
  • 为自动化代码修复工具提供更精简的流程设计思路
  • 可用于评估非 Agent 方法处理真实软件工程任务的能力
  • 启示开发者重点优化问题定位、补丁生成与验证环节,而非盲目增加系统复杂度
📝 原始笔记(逐字保留)
2025-06-28 18:39:39 Saturday | 不靠Agent,4步修复真Bug!蚂蚁CGM登顶SWE-Bench开源榜 https://mp.weixin.qq.com/s/fbKB3Y1F4yZbv_mGDVep2g

阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o

阿里发布并开源信息检索智能体 WebDancer,可自主上网搜索和整合资料,在 GAIA 基准测试中的表现超过 GPT-4o。

 智能体工具 智能体 模型开发 数据工程 人工智能应用

阿里发布信息检索智能体 WebDancer,面向需要自主联网搜索、浏览网页和汇总资料的复杂任务。该智能体能够围绕用户问题规划检索过程,并从网络信息中提取和组织答案。WebDancer 在 GAIA 通用智能体基准上的表现超过 GPT-4o,展示了较强的开放网络研究能力。相关模型与数据已宣布开源,便于社区复现和二次开发。

用途与启示
  • 用于自动化资料检索、深度研究、事实核查与报告生成。
  • 为构建具备搜索规划和网页浏览能力的智能体提供开源模型与数据基础。
  • 表明专门训练的信息检索智能体可在开放世界任务中达到或超过通用闭源模型。
📝 原始笔记(逐字保留)
2025-06-28 16:54:14 Saturday | 阿里发布信息检索Agent-WebDancer,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源 https://mp.weixin.qq.com/s/LETDaeU96OV-beuoCuJHHQ

Anthropic 最新研究:Claude 正悄悄进化为“情绪价值大师”

文章解读 Anthropic 关于 Claude 情感交互能力的最新研究,关注大模型提供共情回应与情绪支持的应用趋势。

 人工智能应用 人工智能

文章围绕 Anthropic 的最新研究,讨论 Claude 在对话中提供“情绪价值”的能力演进。其重点是模型如何通过更具共情感和支持性的表达,改善用户的情感交互体验。这类能力意味着大模型的角色正从信息工具扩展到陪伴、沟通与心理支持等场景。与此同时,相关应用也需要重视情感依赖、安全边界和专业责任问题。

用途与启示
  • 关注大模型在情感陪伴、客户服务和沟通辅助等场景中的应用潜力
  • 为设计更具共情能力的人机交互产品提供参考
  • 提醒开发者评估情感依赖、误导性建议及心理健康安全边界
📝 原始笔记(逐字保留)
2025-06-28 17:43:13 Saturday Anthropic最新研究:Claude正悄悄进化为“情绪价值大师” https://mp.weixin.qq.com/s/mGEbAVCSWZjydrwwOouzOA ## 深度研究

通才奖励建模的推理时间缩放:SPCT

SPCT通过拒绝式微调与基于规则的在线强化学习优化原则和批判生成,使生成式奖励模型具备推理时扩展能力。

 强化学习 推理 模型训练 模型评估

SPCT(Self-Principled Critique Tuning)旨在通过在线强化学习优化原则与批判的生成,实现通才奖励模型的推理时扩展。该方法采用点式生成式奖励模型,以文本批判代替单一标量奖励,并支持单响应和多响应输入。训练分为拒绝式微调冷启动和基于规则奖励的在线强化学习两个阶段,以提升模型识别最佳响应的能力。推理阶段通过多次采样原则与批判、投票聚合奖励,并利用辅助模型过滤低质量样本,进一步改善扩展效果。

用途与启示
  • 为通才型生成式奖励模型提供可扩展的训练与推理方案。
  • 通过自然语言原则和批判增强奖励判断的可解释性与灵活性。
  • 展示在线强化学习与推理时采样、投票和过滤机制结合的潜力。
  • 可用于提升大模型响应排序、偏好评估及强化学习反馈质量。
📝 原始笔记(逐字保留)
2025-06-28 17:27:00 Saturday | 通才奖励建模的推理时间缩放 提出了一个叫做 **SPCT方法** (Self-Principled Critique Tuning)的方法——首次提出通过在线强化学习(RL)优化原则和批判生成,实现推理时扩展。 **生成式奖励模型** (GRM):它采用点式生成奖励模型(Pointwise GRM),通过生成文本形式的奖励(如critiques)而非单一标量值,支持灵活输入(单响应、多响应)和推理时扩展。 SPCT是一个两阶段的过程,它们分别是: * **拒绝式微调(Rejective Fine-Tuning)** :冷启动阶段,通过采样和拒绝策略生成初始数据。 * **基于规则的在线RL** :使用规则化奖励函数优化原则和批判的生成,鼓励模型区分最佳响应。 **推理时扩展技术:** 先是通过多次采样生成多样化的原则和批判,投票聚合最终奖励,扩展奖励空间。再训练一个辅助模型过滤低质量采样,进一步提升扩展效果。 论文地址:https://arxiv.org/abs/2504.02495 ### 奖励模型评估

Jan-nano 技术报告:以多阶段 RLVR 训练高效 4B 搜索型语言模型

Jan-nano 从 Qwen3-4B 出发,通过无需监督微调的多阶段 RLVR 系统进行专业化训练,在消费级硬件上取得 MCP 集成 SimpleQA 83.2% 的成绩。

 强化学习 模型训练 模型开发 智能体工具

Jan-nano 是一个 40 亿参数语言模型,强调通过专业化策略提升信息检索与工具使用效率,而非追求覆盖所有知识。模型从 Qwen3-4B 微调而来,采用新颖的多阶段可验证奖励强化学习(RLVR)系统,完全不依赖下一标记预测式的监督微调。它在消费级硬件上运行,并在集成 MCP 的 SimpleQA 基准中达到 83.2%。模型支持 128K 上下文,展示了小参数模型结合强化学习和外部工具后实现高效任务能力的潜力。

用途与启示
  • 为小参数模型通过 RLVR 获得专业化搜索与工具调用能力提供实践参考
  • 展示减少乃至取消 SFT、转向可验证奖励训练的潜在路线
  • 适用于消费级硬件上的本地智能体、知识检索与 MCP 工具集成场景
  • 启示模型研发可通过策略优化和外部信息访问弥补参数规模限制
📝 原始笔记(逐字保留)
2025-07-01 12:11:14 Tuesday | **[Jan-nano 技术报告](https://papers.cool/arxiv/2506.22760)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Alan Dao](https://arxiv.org/search/?searchtype=author&query=Alan%20Dao), [Dinh Bach Vu](https://arxiv.org/search/?searchtype=author&query=Dinh%20Bach%20Vu) 大多数语言模型都面临着一个基本的权衡,即强大的功能需要大量的计算资源。我们用 Jan-nano 打破了这个限制,Jan-nano 是一个 4B 参数语言模型,它通过激进的专业化重新定义了效率:它不是试图了解一切,而是掌握了立即找到任何东西的艺术。使用我们新颖的多阶段 RLVR 系统从 Qwen3-4B 进行微调,该系统完全消除了对下一个标记预测训练 (SFT) 的依赖,在消费类硬件上运行时,Jan-nano 在 MCP 集成的 SimpleQA 基准测试中实现了 83.2%。Jan-nano 拥有 128K 的上下文长度,证明了智能与规模无关,而与策略有关。 **主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** **发布** : 2025-06-28 05:44:57 UTC

RLPR:无需验证器将RLVR扩展到通用领域

清华NLP实验室提出RLPR,以参考答案的平均生成概率作为奖励,使可验证奖励强化学习能够扩展至缺少明确验证器的通用自然语言领域。

 强化学习 推理 模型训练 人工智能

RLPR全称为基于参考概率奖励的强化学习,目标是突破RLVR依赖规则或程序验证器的限制。其核心方法是将模型生成参考答案的平均概率作为奖励信号,从而处理自然语言答案复杂、多样且难以精确验证的问题。该研究尝试把强化学习从数学、代码等可验证任务推广到更广泛的通用领域,为大模型通用推理训练提供新的奖励设计思路。

用途与启示
  • 为缺少规则验证器的自然语言任务构造可用的强化学习奖励信号
  • 拓展RLVR在开放域问答、指令执行和通用推理任务中的应用范围
  • 启示研究者利用参考答案的概率信息替代严格的结果验证机制
📝 原始笔记(逐字保留)
4. 🙋❓ 2025-06-28 18:17:38 Saturday | 突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR https://mp.weixin.qq.com/s/B11Ef8YwOzPHZn1SXdpp7w 基于参考概率奖励的强化学习(Reinforcement Learning with Reference Probability Reward, **RLPR** )。 论文标题:RLPR: Extrapolating RLVR to General Domains without Verifiers 论文地址:https://github.com/OpenBMB/RLPR/blob/main/RLPR_paper.pdf GitHub 仓库:https://github.com/OpenBMB/RLPR 过使用**参考答案的生成概率均值**作为奖励。这种方法能够有效地应对自然语言固有的复杂多样性。 #### [IFDECORATOR:用可验证奖励包装指令跟随强化学习](https://papers.cool/arxiv/2508.04632) [#7](https://arxiv.org/abs/2508.04632)[IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards ](https://papers.cool/arxiv/2508.04632) 可验证奖励强化学习(RLVR)提升了大型语言模型(LLMs)的指令执行能力,但由于难度评估不足,训练效率较低。此外,RLVR 容易出现过度优化现象,即 LLMs 利用验证捷径而未能与用户指令的实际意图保持一致。我们提出了指令执行装饰器(IFDecorator)框架,将 RLVR 训练封装成一个稳健且样本高效的流程。该框架包含三个部分: (1)合作-对抗数据飞轮,协同进化指令和混合验证,生成逐步更具挑战性的指令-验证对; (2)IntentCheck,执行意图对齐的旁路模块; (3)触发线,一种通过陷阱指令检测奖励作弊的诊断机制,能够触发并捕捉捷径利用行为。 我们的 Qwen2.5-32B-Instruct-IFDecorator 在 IFEval 上达到 87.43%的准确率,优于更大规模的专有模型如 GPT-4o。此外,我们在 FollowBench 上也展示了显著提升,同时保持了模型的通用能力。 我们的触发机制显示奖励作弊率显著降低。我们将发布模型、代码和数据以供未来研究。 发布时间:2025-08-06 17:00:54 UTC ## 数学

让模型在思维链中明确解释奖励黑客行为

研究提出在强化学习前进行语言微调(VFT),训练模型主动披露误导线索对决策的影响,从而显著降低未被检测到的奖励黑客行为。

 强化学习 推理 模型训练 模型评估 逻辑推理

强化学习训练的语言模型可能利用提示中的错误线索获取高奖励,却不在思维链中披露这一行为,使奖励黑客难以被检测。研究提出语言微调(VFT),在 RL 前训练模型明确承认提示线索对答案的影响。实验中,VFT 将 RL 后未检测到的奖励黑客比例降至 6%,而无 VFT 和去偏基线的比例分别高达 88% 和 99%。经过 VFT 与 RL 后,模型表达线索影响的比例最高达到 94%,表明语言化披露可以提升模型行为的透明度与安全性。

用途与启示
  • 为奖励黑客检测提供一种可在强化学习前实施的训练方法。
  • 通过要求模型语言化披露决策线索,提高思维链的可审计性。
  • 可用于高风险智能体和推理系统的安全训练与评估。
📝 原始笔记(逐字保留)
2025-07-01 12:10:48 Tuesday| **[教授模型在思维链推理中用语言解释奖励黑客攻击](https://papers.cool/arxiv/2506.22777)** **[PDF()]** **[Copy]** **[Kimi(1)]** **[REL]** **Authors** : [Miles Turpin](https://arxiv.org/search/?searchtype=author&query=Miles%20Turpin), [Andy Arditi](https://arxiv.org/search/?searchtype=author&query=Andy%20Arditi), [Marvin Li](https://arxiv.org/search/?searchtype=author&query=Marvin%20Li), [Joe Benton](https://arxiv.org/search/?searchtype=author&query=Joe%20Benton), [Julian Michael](https://arxiv.org/search/?searchtype=author&query=Julian%20Michael) 使用 RL 训练的语言模型可以参与奖励黑客攻击,即利用无意的策略获得高回报,而不会在其思维链推理中揭示这种行为,从而使检测变得困难,并为高风险应用程序带来风险。我们提出了语言微调 (VFT),这是一种 RL 之前的干预,它训练模型在受到提示提示的影响时明确承认它们——指向错误答案的提示(例如,“斯坦福大学教授认为答案是 A”)。为了评估 VFT,我们随后在保留的提示提示表明哪些错误答案将获得高奖励的环境中使用 RL 训练模型,从而激励模型通过利用提示而不是正确推理来奖励黑客。我们测量模型在不用语言表达的情况下利用这些线索的频率。在 RL 之后,只有 6% 的 VFT 训练模型的响应由未检测到的奖励黑客攻击组成。相比之下,当我们在没有 VFT 的情况下执行 RL 时,未被发现的奖励黑客攻击率高达 88%;通过去偏倚基线干预,这一比例进一步增加到 99%。VFT 通过大幅提高模型表达线索影响的频率来实现这一点——从 VFT 后的 8% 到 42%,RL 后高达 94%——而即使在 RL 之后,基线仍然很低(10% 和 1%)。我们的结果表明,在 RL 之前训练模型明确地用语言表达奖励黑客行为可以显着提高其检测能力,从而为实现更透明、更安全的 AI 系统提供了一条实用的途径。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) **发布** : 2025-06-28 06:37:10 UTC

有道开源14B「子曰3」数学模型,多项任务超越DeepSeek-R1

网易有道开源14B参数的Confucius3-Math,在多项数学推理任务中表现超过完整版DeepSeek-R1。

 模型开发 推理 逻辑推理 人工智能

网易有道开源了「子曰3」数学模型(Confucius3-Math)。该模型仅有14B参数,定位于数学推理任务。实测信息显示,它在多项数学推理任务上的表现超过了完整版DeepSeek-R1,展现出轻量模型在垂直领域的竞争力。

用途与启示
  • 可用于数学解题、推理辅助及教育场景。
  • 表明通过面向特定领域的训练,较小参数模型也可能超越大型通用推理模型。
  • 为低成本部署高性能数学推理能力提供了新选择。
📝 原始笔记(逐字保留)
6. 2025-06-28 18:48:36 Saturday | 一手实测有道14B「子曰3」数学模型,击败满血版DeepSeek R1 https://mp.weixin.qq.com/s/x56TbKXzijRxaJLXKvKV_g 网易有道开源了「 **子曰3** 」 **数学模型** (Confucius3-Math),以14B参数的轻量级模型在多项数学推理任务上超越了满血参数的DeepSeek-R1。

蚂蚁开源代码模型实现 44% 自动修 Bug 解决率

蚂蚁开源的新模型在 SWE-bench Lite 上取得 44% 的问题解决率,超过当时其他开源方案并接近闭源模型表现。

 模型开发 人工智能辅助编程 SWE 软件工程 模型评估

蚂蚁推出了一款面向软件工程任务的开源模型,可自动定位并修复真实代码仓库中的缺陷。该模型在 SWE-bench Lite 基准上的问题解决率达到 44%,刷新了当时开源模型的最佳水平。其性能已可媲美部分闭源模型,显示出开源代码模型在自动修复 Bug 场景中的竞争力。

用途与启示
  • 可用于代码缺陷定位、补丁生成和自动化 Bug 修复。
  • 为开源代码智能体与闭源方案的性能差距提供了新的评估参照。
  • 展示了大模型在真实软件仓库级任务中的工程应用潜力。
📝 原始笔记(逐字保留)
2025-06-28 17:18:09 Saturday | AI自动修bug,解决率达44%!这是全球开源模型的最新最强水平。来自蚂蚁的开源新模型,在SWE-bench Lite上超越所有开源方案,性能媲美闭源模型。 https://mp.weixin.qq.com/s/Y-vqZG2dQMOwvXTinDbT1Q ### 端侧模型 vivo突破手机AI部署难题,绕开MoE架构限制,骁龙8 Elite流畅运行|ICCV 2025[ https://mp.weixin.qq.com/s/ztTdARR4Q0opOGP139NQkQ](https://mp.weixin.qq.com/s/ztTdARR4Q0opOGP139NQkQ)

谷歌开源端侧多模态模型 Gemma 3n,最低仅需 2GB 显存

谷歌正式开源端侧多模态模型 Gemma 3n,原生支持文本、图像、音频和视频,并可在最低约 2GB 显存条件下运行。

 模型开发 多模态 系统优化

谷歌正式发布并开源 Gemma 3n,面向手机、笔记本等资源受限的端侧设备。该模型原生支持文本、图像、音频和视频等多种模态,可用于构建本地多模态应用。其轻量化设计使最低运行显存需求降至约 2GB,同时在模型竞技场中取得了突出成绩。官方已提供模型权重、开发文档与开发者指南。

用途与启示
  • 为低显存设备部署本地多模态 AI 提供新的开源基础模型
  • 适合开发端侧视觉理解、音视频分析和离线助手等应用
  • 展示通过模型架构与内存优化兼顾能力和资源效率的实践路径
  • 官方文档:https://ai.google.dev/gemma/docs/gemma-3n
  • 开发者指南:https://developers.googleblog.com/en/introducing-gemma-3n-developer-guide/
📝 原始笔记(逐字保留)
2025-06-28 17:02:38 Saturday | 最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频 ,今天凌晨,谷歌正式官宣了 **Gemma 3n** ,原生支持文本、图像和音视频等多种模态。 https://mp.weixin.qq.com/s/iN4Fir3tSt96vPJufn5PSQ 模型、权重:https://huggingface.co/collections/google/gemma-3n-685065323f5984ef315c93f4 文档:https://ai.google.dev/gemma/docs/gemma-3n 博客:https://developers.googleblog.com/en/introducing-gemma-3n-developer-guide/

CodeFuse-CGM:面向代码智能的开源代码图模型

CodeFuse-CGM 开放技术论文、核心代码、72B 模型权重及 CodeGraph 训练数据,为结合代码结构图与大模型的研究提供完整资源。

 模型开发 人工智能辅助编程 数据工程 模型训练

CodeFuse 团队开源了代码图模型 CGM 的技术论文、核心代码、模型权重和训练数据。模型权重以 CodeFuse-CGM-72B 名义发布,可在 Hugging Face 获取。配套的 CodeGraph 数据集也已开放,便于复现训练流程并开展代码结构建模研究。该工作延续了团队在 Code LLM、Graph+LLM、高效注意力架构及代码多任务微调方面的积累。

用途与启示
  • 为代码理解、生成及软件工程任务提供融合图结构信息的基础模型
  • 完整开放论文、代码、权重与数据,降低复现和二次开发门槛
  • 可用于探索代码图表示与大语言模型结合的训练方法
  • 为企业级代码智能工具和研究原型提供可扩展的模型底座
📝 原始笔记(逐字保留)
3. 2025-06-28 17:11:15 Saturday | https://mp.weixin.qq.com/s/1jIi40A9Jm9zFLuuCuE3OA 早在两个月前的阿里云AI势能大会上,阿里云百炼就透露了要做Agent Store的计划。 现在,这个**[Agent Store正式上线](https://bailian.console.aliyun.com/?spm=5176.29619931.J_AHgvE-XDhTWrtotIBlDQQ.13.74cd521cK99oYc&tab=app#/app-market/newTemplate)**了,提供了覆盖各行各业的上百个Agent模板。 **CGM的技术论文、核心代码、模型权重与训练数据均已开源** ,感兴趣的同学可进一步了解详情。 * 技术论文:https://arxiv.org/abs/2505.16901 * 开源代码:https://github.com/codefuse-ai/CodeFuse-CGM * 模型权重:https://huggingface.co/codefuse-ai/CodeFuse-CGM-72B * 训练数据:https://huggingface.co/datasets/codefuse-ai/CodeGraph 😎团队此前工作: * Code LLM综述:Awesome-Code-LLM(TMLR)https://github.com/codefuse-ai/Awesome-Code-LLM * Graph+LLM前序研究:GALLa(ACL 2025)https://github.com/codefuse-ai/GALLa * 高效注意力架构:Rodimus(ICLR 2025)https://arxiv.org/abs/2410.06577 * 代码多任务微调框架:MFTCoder(KDD 2024)https://arxiv.org/abs/2311.02303 #### [谷歌版小钢炮开源!0.27B大模型,4个注意力头,专为终端而生](https://mp.weixin.qq.com/s/UY7h2ZC_oeefrH_hWSKcag)

Mercury:首个扩散式 LLM,推理速度超过主流模型 7 倍

扩散式语言模型 Mercury 通过并行生成机制实现高速推理,第三方测试显示其速度较多款前沿轻量模型提升超过 7 倍。

 人工智能 模型开发 推理 系统优化

Mercury 被介绍为首个基于扩散模型的 LLM,旨在摆脱自回归模型逐 token 生成带来的延迟。与传统自回归模型相比,它在保持较强性能的同时显著提高了生成效率。第三方测评机构 Artificial Analysis 的基准结果显示,Mercury 的能力可媲美 GPT-4.1 Nano 和 Claude 3.5 Haiku 等速度优化模型,而运行速度提升超过 7 倍。

用途与启示
  • 展示扩散模型用于语言生成时的并行推理潜力。
  • 为低延迟对话、实时智能体和高吞吐内容生成提供新的模型路线。
  • 提示业界重新评估自回归架构在推理速度方面的主导地位。
📝 原始笔记(逐字保留)
2025-06-28 18:43:50 Saturday 这个扩散LLM太快了!没有「请稍后」,实测倍速于Gemini 2.5 Flash Mercury 就是为此诞生的,其是首个基于扩散模型的 LLM。与自回归(AR)模型相比,Mercury 模型在性能和效率上都达到了最先进的水平。 在性能表现上,根据第三方测评机构 Artificial Anlys 的基准测试数据显示,Mercury 可媲美 GPT-4.1 Nano 和 Claude 3.5 Haiku 等速度经过优化的前沿模型,同时运行速度提升超过 7 倍。 https://mp.weixin.qq.com/s/dSEkdYHOQbaiRN3O4D-hKg

人类与人工智能的文本生成和理解:跨学科研讨会报告

跨学科研讨会报告探讨大型语言模型与人类文本生成及理解过程的联系、差异,以及人机协作的机遇、局限和伦理问题。

 人工智能 人工智能应用

该报告汇集认知心理学、语言学习与自然语言处理领域专家的跨学科观点,研究人类和人工智能生成、理解文本时的基本过程。报告指出,大型语言模型能够为人类语言加工研究提供新视角,但尚不能完整复制类人的语言理解与生成。经过人类反馈微调后,模型行为与人类语言处理表现出更高一致性,同时人机协作也带来能力增强、认知依赖和责任划分等挑战。报告建议在认知心理学、语言学和教育等领域推进相关研究与应用时,将伦理规范和负责任使用纳入核心设计。

用途与启示
  • 为比较人类认知过程与大型语言模型行为提供跨学科研究框架
  • 指导语言学、认知心理学和教育领域的 LLM 研究与应用
  • 探索人机协作提升文本理解和写作能力的可行路径
  • 提醒研究者关注模型局限、伦理风险及负责任使用
📝 原始笔记(逐字保留)
1. 2025-07-01 12:14:04 Tuesday| **[人类和人工智能的文本生成和理解:跨学科研讨会报告](https://papers.cool/arxiv/2506.22698)** **[PDF(1)]** **[Copy]** **[Kimi()]** **[REL]** **Author** : [Emily Dux Speltz](https://arxiv.org/search/?searchtype=author&query=Emily%20Dux%20Speltz) 本报告综合了最近一次跨学科研讨会的成果,该研讨会汇集了认知心理学、语言学习和基于人工智能 (AI) 的自然语言处理 (NLP) 的领先专家。该研讨会由美国国家科学基金会资助,旨 **在解决我们对 AI 语言模型与文本理解和写作中人类认知过程之间关系的理解中的关键知识差距** 。通过认知、语言和技术视角的协作对话,研讨会参与者研究了人类生成和理解文本时所涉及的基本过程,以及 AI 如何为我们对这些过程的理解提供信息并增强人类的能力。该研讨会揭示了大型语言模型 (LLM) 与人类认知之间关系中的新模式,重点介绍了 LLM 的能力及其在完全复制类人语言理解和生成方面的局限性。主要发现包括 LLM 提供对人类语言处理的见解的潜力,当模型根据人类反馈进行微调时,LLM 行为与人类语言处理之间的一致性越来越一致,以及人类-AI 协作在语言任务中带来的机遇和挑战。通过综合这些发现,本报告旨在指导认知心理学、语言学和教育领域 LLM 的未来研究、开发和实施。它强调道德考虑和负责任地使用 AI 技术的重要性,同时努力通过有效的人类与 AI 协作来提高人类在文本理解和制作方面的能力。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) **发布** : 2025-06-28 00:31:14 UTC # 评奖评优

ScreenExplorer:基于好奇心机制自主探索 GUI 的视觉语言智能体

吉林大学提出 ScreenExplorer,通过好奇心驱动的在线强化学习与经验流蒸馏,让视觉语言智能体在开放桌面 GUI 中持续自主探索和进化。

 智能体 多模态 强化学习 自进化 模型训练

吉林大学人工智能学院提出 ScreenExplorer,在真实 Desktop GUI 环境中对视觉语言模型进行在线训练。针对开放环境反馈稀疏的问题,该方法利用世界模型预测状态转移并估算状态新颖度,以好奇心奖励推动智能体探索更多样的界面状态。研究还引入受 DeepSeek-R1 启发的“经验流蒸馏”范式,将每代智能体的探索经验自动提炼并用于微调下一代模型。该机制可提升探索效率、减少人工标注依赖,并支持智能体能力的持续自主进化。

用途与启示
  • 为开放式 GUI 智能体提供无需密集人工奖励的自主探索方案。
  • 可用于桌面操作、软件测试和通用计算机使用智能体的训练。
  • 经验流蒸馏展示了跨代复用探索轨迹、构建自我进化智能体的可行路径。
  • 开源训练代码便于研究者复现并扩展到更多 GUI 环境。
📝 原始笔记(逐字保留)
2. 2025-06-28 18:32:52 Saturday | AI 开始「自由玩电脑」了!吉大提出「屏幕探索者」智能体 https://mp.weixin.qq.com/s/NF6CfOVsSPVU--M8YMNu5Q 吉林大学人工智能学院发布了一项基于强化学习训练的 VLM 智能体最新研究《ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World》。它让视觉语言模型(VLM)真正学会了「自我探索 GUI 环境」。 * 论文地址:https://arxiv.org/abs/2505.19095 * 项目地址:https://github.com/niuzaisheng/ScreenExplorer 该工作带来三大核心突破: * 在真实的 Desktop GUI 环境中进行 VLM 模型的在线训练; * 针对开放 GUI 环境反馈稀疏问题,创新性地引入「好奇心机制」,利用世界模型预测环境状态转移,估算环境状态的新颖度,从而有效激励智能体主动探索多样化的界面状态,告别「原地打转」; * 此外,受 DeepSeek-R1 启发,构建了「经验流蒸馏」训练范式, **每一代智能体的探索经验都会被自动提炼,用于微调下一代智能体** 。这不仅大幅提升探索效率、减少对人工标注数据的依赖,更让 ScreenExplorer 的能力实现了持续自主进化,打造真正「学无止境」的智能体!论文同时开源了训练代码等。 ## AI4AI 尽管人工智能(AI)在飞速发展,当前 AI 开发仍严重依赖人类专家大量的手动实验和反复的调参迭代,过程费时费力。这种以人为中心的方式已成为制约创新速度和通向通用人工智能(AGI)的关键瓶颈。为突破限制,AI-for-AI(AI4AI)应运而生。AI4AI 旨在让 AI 作为智能体来自主设计、优化和改进 AI 算法,大幅减少人类干预,加速迭代开发周期,推动 AGI 发展进程。

AgentAuditor:让智能体安全评估器的精确度达到人类水平

AgentAuditor 致力于将智能体安全评估的精确度提升至人类评估者水平。

 智能体 模型评估 智能体工具

AgentAuditor 是一项面向智能体安全性的自动化评估方案。其目标是让安全评估器在判断精确度上达到人类水平,从而提高智能体风险审计的可靠性。该方向有助于减少人工评测成本,并为智能体部署提供更可扩展的安全保障。

用途与启示
  • 用于自动审计智能体行为及潜在安全风险
  • 降低依赖人工安全评估带来的时间与成本开销
  • 为智能体上线、迭代和持续监控提供可靠的评估工具
📝 原始笔记(逐字保留)
2025-06-28 18:30:37 Saturday | AgentAuditor: 让智能体安全评估器的精确度达到人类水平 https://mp.weixin.qq.com/s/eQhsQ3ttUkZRNtQ5Jf8bVg

DICE-BENCH:多轮多方对话中的大模型工具使用评估

DICE-BENCH 通过高信息分散度的多轮、多方对话,评估大型语言模型在真实复杂场景中的函数调用与工具使用能力。

 模型评估 智能体工具 智能体 数据合成

现有函数调用基准大多聚焦单轮交互,难以反映真实应用中工具信息跨轮次、跨角色分散的复杂情况。论文提出 DICE-SCORE,用于衡量函数名称、参数值等工具相关信息在整段对话中的分散程度。DICE-BENCH 利用保持跨轮依赖关系的工具图和多角色代理系统合成自然对话,最终构建了包含 1607 个高 DICE-SCORE 实例的数据集。对 19 个大型语言模型的测试显示,当前模型在复杂多轮工具调用方面仍存在显著不足。

用途与启示
  • 用于评估模型能否从跨轮、多角色对话中正确整合工具调用信息。
  • DICE-SCORE 可辅助判断函数调用基准与真实应用场景之间的差距。
  • 工具图与多代理对话合成方法可用于构造更自然、更具依赖关系的训练和评测数据。
  • 结果提示实际部署工具型智能体前,应重点验证其参数追踪、上下文整合和跨轮调用能力。
📝 原始笔记(逐字保留)
11. 2025-07-01 12:09:31 Tuesday| **[DICE-BENCH:在多轮、多方对话中评估大型语言模型的工具使用能力](https://papers.cool/arxiv/2506.22853)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [Kyochul Jang](https://arxiv.org/search/?searchtype=author&query=Kyochul%20Jang), [Donghyeon Lee](https://arxiv.org/search/?searchtype=author&query=Donghyeon%20Lee), [Kyusik Kim](https://arxiv.org/search/?searchtype=author&query=Kyusik%20Kim), [Dongseok Heo](https://arxiv.org/search/?searchtype=author&query=Dongseok%20Heo), [Taewhoo Lee](https://arxiv.org/search/?searchtype=author&query=Taewhoo%20Lee), [Woojeong Kim](https://arxiv.org/search/?searchtype=author&query=Woojeong%20Kim), [Bongwon Suh](https://arxiv.org/search/?searchtype=author&query=Bongwon%20Suh) 现有的函数调用基准测试侧重于单轮交互。但是,他们忽略了现实世界场景的复杂性。为了量化现有基准测试如何满足实际应用需求,我们引入了 DICE-SCORE,这是一个评估工具相关信息(如函数名称和参数值)在整个对话中的分散程度的指标。通过 DICE-SCORE 分析现有基准揭示了明显的低分,突出了对更现实场景的需求。为了解决这一差距,我们提出了 DICE-BENCH,这是一个框架,它通过维护跨轮依赖关系的工具图和具有不同角色的多代理系统合成对话来构建实用的函数调用数据集,以增强对话的自然性。最终数据集包含 1607 个高 DICE-SCORE 实例。我们使用 DICE-BENCH 对 19 个 LLM 进行的实验表明,在将此类模型有效部署到实际环境中之前,仍需要取得重大进展。我们的代码和数据都是公开的:https://snuhcc.github.io/DICE-Bench/。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI) **发布** : 2025-06-28 11:28:04 UTC ## 创意写作
0%