2025-06-15 科研追新

当日精选(由提交工具自动创建)。

隐式奖励作为桥梁:SFT 与 DPO 连接的统一视图

论文从隐式奖励学习视角统一监督微调与直接偏好优化,并通过学习率降低及基于 f-散度的新目标改善训练后模型性能。

 强化学习 模型训练 推理 人工智能

论文提出统一理论框架,证明 SFT 与 DPO 等偏好学习方法运行于相同的最优策略奖励子空间,并将 SFT 解释为隐式奖励学习的特殊情形。分析指出,传统 SFT 在优化时的 KL 散度项相对于策略成为常量,因此难以有效约束模型更新。作者提出降低学习率的简单方案,在指令跟随任务上取得 25% 的相对增益和 6% 的绝对胜率提升。研究还从多种 f-散度推导出可保留 KL 约束的替代 SFT 目标,并将语言模型 logits 与 Q 函数的理论联系扩展到 SFT 场景。

用途与启示
  • 为统一理解监督微调与基于偏好的强化学习提供理论基础。
  • 揭示传统 SFT 中 KL 约束失效的原因,为训练稳定性分析提供新视角。
  • 可通过降低学习率或采用基于 f-散度的新目标,提升后训练及后续 DPO 的效果。
  • 为研究语言模型 logits、隐式奖励与 Q 函数之间的关系提供可验证框架。
📝 原始笔记(逐字保留)
4. 2025-07-02 17:21:08 Wednesday| **[隐式奖励作为桥梁:SFT 和 DPO 连接的统一视图](https://papers.cool/arxiv/2507.00018)** **[PDF(16)]** **[Copy]** **[Kimi(11)]** **[REL]** **Authors** : [Bo Wang](https://arxiv.org/search/?searchtype=author&query=Bo%20Wang), [Qinyuan Cheng](https://arxiv.org/search/?searchtype=author&query=Qinyuan%20Cheng), [Runyu Peng](https://arxiv.org/search/?searchtype=author&query=Runyu%20Peng), [Rong Bao](https://arxiv.org/search/?searchtype=author&query=Rong%20Bao), [Peiji Li](https://arxiv.org/search/?searchtype=author&query=Peiji%20Li), [Qipeng Guo](https://arxiv.org/search/?searchtype=author&query=Qipeng%20Guo), [Linyang Li](https://arxiv.org/search/?searchtype=author&query=Linyang%20Li), [Zhiyuan Zeng](https://arxiv.org/search/?searchtype=author&query=Zhiyuan%20Zeng), [Yunhua Zhou](https://arxiv.org/search/?searchtype=author&query=Yunhua%20Zhou), [Xipeng Qiu](https://arxiv.org/search/?searchtype=author&query=Xipeng%20Qiu) 训练后过程是将预先训练的语言模型与实际任务相结合的重要阶段,从演示或偏好信号中学习在这种适应中起着至关重要的作用。我们提出了一个统一的理论框架,在大型语言模型 (LLM) 训练后桥接监督微调 (SFT) 和偏好学习。通过严格的数学推导,我们证明了 SFT 和偏好学习方法(如直接偏好优化 (DPO))都在相同的最优策略奖励子空间内运行,其中 SFT 代表了隐式奖励学习的一种特殊情况。我们的分析揭示了传统 SFT 的一个关键限制:在优化期间,分布匹配中的 KL 散度项相对于策略变得恒定,无法限制模型更新。为了解决这个问题,我们提出了一种简单而有效的学习率降低方法,该方法可以显著提高性能(在教学后续任务中提高 \textbf{25\%} 相对增益和 \textbf{6\%} 绝对胜率增加)。此外,我们 **从各种 f 发散函数中推导出替代 SFT 目标** ,这些函数在优化过程中保留 KL 项,进一步提高了 DPO 后模型的性能。最后,我们将 LLM logits 和 Q-functions 之间的理论关系从偏好学习扩展到 SFT 上下文,提供数学推导和实验验证。 **科目** : **[机器学习](https://papers.cool/arxiv/cs.LG)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算和语言](https://papers.cool/arxiv/cs.CL) **发布** : 2025-06-15 05:42:29 UTC

首个 AI 原生浏览器 Dia 正式启动内测

AI 原生浏览器 Dia 启动内测,尝试将人工智能能力深度融入网页浏览与信息处理流程。

 智能体工具 人工智能应用 智能体 人工智能

AI 原生浏览器 Dia 正式启动内测。该产品尝试把 AI 交互融入浏览器,使用户能够在网页环境中完成信息理解、内容生成和任务辅助。原文仅提供了简短标题,未披露具体功能、测试范围及获取方式。

用途与启示
  • 关注浏览器从网页入口向 AI 任务执行平台演进的趋势
  • 可用于探索网页检索、内容总结与跨页面操作等智能化场景
  • 为开发浏览器智能体及相关应用提供产品形态参考
📝 原始笔记(逐字保留)
2. 2025-06-15 |首个AI原生浏览器Dia正式启动内 ### 综述生成
0%