2025-06-29 科研追新
当日精选(由提交工具自动创建)。
SoMi-ToM:评估具身社会互动中的多视角心智理论
SoMi-ToM 通过第一人称与第三人称多模态任务评估具身社会互动中的心智理论能力,揭示当前大型视觉语言模型与人类之间仍有显著差距。
SoMi-ToM 是一个面向具身多智能体复杂社会互动的多视角心智理论评估基准,数据由交互环境 SoMi 生成。它同时提供第一人称的视觉、对话和动作输入,以及第三人称的完整视频与文本记录,用于评估实时状态、目标和行为推理。数据集包含 35 个第三人称视频、363 张第一人称图像和 1225 道专家标注的三选一问题。实验显示,大型视觉语言模型明显落后于人类,第一人称和第三人称评估中的平均准确率差距分别为 40.1% 和 26.4%。
用途与启示
- 为具身智能体在动态社会互动中的心智理论能力提供更贴近现实的评估方法。
- 支持从主观即时体验与客观全局观察两个视角分析模型的社会推理能力。
- 结果表明,当前视觉语言模型在多模态状态理解、目标推断和行为预测方面仍有较大提升空间。
📝 原始笔记(逐字保留)
2. 2025-07-01 12:07:34 Tuesday |
**[SoMi-ToM: 评估具身社会互动中的多视角心智理论](https://papers.cool/arxiv/2506.23046)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]**
**Authors** : [Xianzhe Fan](https://arxiv.org/search/?searchtype=author&query=Xianzhe%20Fan), [Xuhui Zhou](https://arxiv.org/search/?searchtype=author&query=Xuhui%20Zhou), [Chuanyang Jin](https://arxiv.org/search/?searchtype=author&query=Chuanyang%20Jin), [Kolby Nottingham](https://arxiv.org/search/?searchtype=author&query=Kolby%20Nottingham), [Hao Zhu](https://arxiv.org/search/?searchtype=author&query=Hao%20Zhu), [Maarten Sap](https://arxiv.org/search/?searchtype=author&query=Maarten%20Sap)
人类通过在动态的现实世界社交互动中感知周围的环境,不断推断他人的状态、目标和行为。但是,大多数 Theory of Mind (ToM) 基准测试仅评估基于文本的静态场景,与真实交互相比,这些场景存在很大差距。我们提出了 SoMi-ToM 基准,旨在评估具身多智能体复杂社交互动中的多视角 ToM。该基准测试基于交互环境 SoMi 生成的丰富多模态交互数据,涵盖不同的制作目标和社交关系。我们的框架支持多层次评估:(1) 第一人称评估在任务期间提供来自第一人称视角的多模态(视觉、对话、动作等)输入,以进行实时状态推理,(2) 第三人称评估在任务后提供完整的第三人称视角视频和文本记录,用于目标和行为推理。这种评估方法允许从主观即时体验和客观的全局观察中更全面地检查模型的 ToM 能力。我们构建了一个具有挑战性的数据集,其中包含 35 个第三人称视角视频、363 个第一人称视角图像和 1225 个专家注释的多项选择题(三个选项)。在这个数据集上,我们系统地评估了人类受试者和几个最先进的大型视觉语言模型 (LVLM) 的表现。结果表明,LVLM 在 SoMi-ToM 上的表现明显差于人类:人类与模型之间的平均准确率差距在第一人称评估中为 40.1%,在第三人称评估中为 26.4%。这表明未来的 LVLM 需要进一步提高他们在具体、复杂的社交互动中的 ToM 能力。
**科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI), [计算机视觉和模式识别](https://papers.cool/arxiv/cs.CV), [机器人](https://papers.cool/arxiv/cs.RO)
**发布** : 2025-06-29 00:54:13 UTC
通才奖励模型:从大型语言模型中发现内生奖励
研究证明标准预训练语言模型中天然存在等价于离线逆强化学习所得奖励函数的内生奖励,可免训练提供高质量反馈并改善后续强化学习策略。
论文指出,通过标准下一词元预测训练的基础语言模型中,已经潜藏着可直接使用的通才奖励模型。作者从理论上证明,这种内生奖励等价于通过离线逆强化学习学习到的奖励函数,无需额外的人类偏好数据或奖励模型训练。进一步分析表明,使用该奖励开展强化学习,可获得相比基础模型具有更优误差边界的策略。实验中,该方法优于现有的 LLM-as-a-Judge 方法,甚至能够超过显式训练的奖励模型,并有望扩展至多模态模型对齐。
用途与启示
- 降低依赖昂贵人类偏好数据训练奖励模型的成本。
- 为语言模型强化学习的有效性提供理论依据与可证明的策略改进边界。
- 可直接从预训练或监督微调模型中提取奖励信号,简化对齐流程。
- 为更高效、可扩展的语言模型及多模态模型对齐提供新范式。
📝 原始笔记(逐字保留)
6. 2025-07-01 12:05:40 Tuesday |
**[通才奖励模型:在大型语言模型中发现](https://papers.cool/arxiv/2506.23235)** **[PDF(7)]** **[Copy]** **[Kimi(7)]** **[REL]**
**Authors** : [Yi-Chen Li](https://arxiv.org/search/?searchtype=author&query=Yi-Chen%20Li), [Tian Xu](https://arxiv.org/search/?searchtype=author&query=Tian%20Xu), [Yang Yu](https://arxiv.org/search/?searchtype=author&query=Yang%20Yu), [Xuqin Zhang](https://arxiv.org/search/?searchtype=author&query=Xuqin%20Zhang), [Xiong-Hui Chen](https://arxiv.org/search/?searchtype=author&query=Xiong-Hui%20Chen), [Zhongxiang Ling](https://arxiv.org/search/?searchtype=author&query=Zhongxiang%20Ling), [Ningjing Chao](https://arxiv.org/search/?searchtype=author&query=Ningjing%20Chao), [Lei Yuan](https://arxiv.org/search/?searchtype=author&query=Lei%20Yuan), [Zhi-Hua Zhou](https://arxiv.org/search/?searchtype=author&query=Zhi-Hua%20Zhou)
大型语言模型 (LLM) 的对齐在很大程度上取决于在昂贵的人类偏好数据上训练的奖励模型。虽然最近的工作探索了通过 AI 反馈绕过这一成本,但这些方法通常缺乏严格的理论基础。在本文中,我们发现一个强大的通才奖励模型已经潜伏在任何通过标准下一个代币预测训练的 LLM 中。我们证明,这种内生奖励不是启发式的,而是理论上等同于通过离线逆强化学习学习的奖励函数。这种连接使我们能够直接从基础(预先训练或监督微调)模型中获得高质量的奖励信号,而无需任何进一步的训练。至关重要的是,我们还证明,与基本模型相比,使用这种内生奖励的后续强化学习会导致具有可证明的更优越误差边界的策略。据我们所知,这是强化学习对 LLM 有效性的第一个理论证明。我们的实验验证了这一理论,表明我们的方法不仅优于现有的 LLM as-a-judge 方法,而且还可以超越明确训练的奖励模型。这些发现表明,奖励建模阶段可以被一种有原则的方法所取代,该方法可以获取在预训练期间已经捕获的知识,这预示着 LLM 对齐和多模态模型的更高效、更强大和可扩展的范式。
**主题** : **[计算和语言](https://papers.cool/arxiv/cs.CL)**
**发布** : 2025-06-29 13:45:54 UTC