2025-06-11 科研追新

当日精选(由提交工具自动创建)。

提示词自动优化网站

一个用于自动优化提示词的网站,可辅助用户提升提示词的清晰度与使用效果。

 智能体工具 人工智能应用 智能体

该消息介绍了一个提示词自动优化网站,并提供了微信公众号原文链接。用户可借助此类工具改写和完善提示词,降低手动调试成本。它可用于大模型对话、内容生成及智能体任务中的提示设计。原始文本未提供网站名称、具体功能或效果评测等更多信息。

用途与启示
  • 自动改写和优化提示词
  • 辅助大模型与智能体的提示设计
  • 减少提示词反复试验的时间成本
📝 原始笔记(逐字保留)
2. 2025-06-11 17:37:53 Wednesday | 提示词自动优化网站 https://mp.weixin.qq.com/s/Y0X3z-ARRcPgEDCZffiNfg ### Agent工具

面向未来的基准:预测智能体的 Pastcasting 基准

Bench To the Future(BTF)通过已知结果的历史预测问题和大规模离线网页语料,为 LLM 预测智能体提供真实、封闭且可重复的评估环境。

 人工智能应用 智能体 模型评估 推理

论文提出 Bench To the Future(BTF),以“Pastcasting”方式让模型在隔离环境中预测已经发生、但对模型上下文暂时未知的历史事件。基准包含数百个高质量问题,每题配有数万篇相关网页组成的离线语料库,从而避免实时互联网变化和等待事件揭晓带来的评估困难。研究使用包括 Claude 4 在内的多个 LLM,对智能体式检索和思维链预测方法进行了测试,结果与真实互联网环境下的未决事件预测具有可比性。BTF 计划持续加入新问题,以适应模型训练数据截止日期不断后移的情况,并长期跟踪预测能力进展。

用途与启示
  • 为预测智能体建立封闭、真实且可重复的实验环境。
  • 支持比较智能体检索、思维链等不同预测方法的效果。
  • 通过持续更新历史问题,降低训练数据泄漏和模型记忆答案对评估的影响。
  • 可用于研究 LLM 的信息搜集、证据整合、概率判断及预测校准能力。
📝 原始笔记(逐字保留)
10. 2025-06-30 19:59:32 Monday | **[面向未来的基准:预测代理的 Pastcasting 基准](https://papers.cool/arxiv/2506.21558)** **[PDF()]** **[Copy]** **[Kimi()]** **[REL]** **Authors** : [FutureSearch](https://arxiv.org/search/?searchtype=author&query=FutureSearch): [Jack Wildman](https://arxiv.org/search/?searchtype=author&query=Jack%20Wildman), [Nikos I. Bosse](https://arxiv.org/search/?searchtype=author&query=Nikos%20I.%20Bosse), [Daniel Hnyk](https://arxiv.org/search/?searchtype=author&query=Daniel%20Hnyk), [Peter Mühlbacher](https://arxiv.org/search/?searchtype=author&query=Peter%20M%C3%BChlbacher), [Finn Hambly](https://arxiv.org/search/?searchtype=author&query=Finn%20Hambly), [Jon Evans](https://arxiv.org/search/?searchtype=author&query=Jon%20Evans), [Dan Schwarz](https://arxiv.org/search/?searchtype=author&query=Dan%20Schwarz), [Lawrence Phillips](https://arxiv.org/search/?searchtype=author&query=Lawrence%20Phillips) 预测是一项具有挑战性的任务,它为研究 AI 系统提供了一种明确可衡量的方法。预测需要在互联网上进行大量研究,而评估需要时间让事件发生,这使得预测基准的开发具有挑战性。迄今为止,还没有预测基准为 LLM 预测者提供真实、封闭和可重复的环境。我们介绍了 Bench To the Future (BTF),这是一个“pastcasting”基准测试,其中包含数百个高质量的问题,其解决方案已经已知。每个问题都伴随着一个包含数万个相关网页的大型离线语料库,从而能够从 LLM 中得出对过去事件的现实“预测”。结果表明,我们的过去广播环境可以产生与基于使用互联网对当时未解决的问题的预测的结果相当的结果。我们使用多个 LLM(包括最近发布的 Claude 4 模型)展示了对代理和思维链预测方法的结果,并展示了 BTF 随着时间的推移跟踪稳定预测能力进展的能力。我们打算将其作为一个活的基准,不断添加新问题,以解决不断增加的训练数据截止日期的问题。我们邀请研究人员通过 hello@futuresearch.ai 与我们联系,以利用我们的基准测试或工具进行自己的研究。 **科目** : **[计算和语言](https://papers.cool/arxiv/cs.CL)** , [人工智能](https://papers.cool/arxiv/cs.AI), [机器学习](https://papers.cool/arxiv/cs.LG) **发布** : 2025-06-11 16:18:40 UTC ## 健身 ###### [#26](https://arxiv.org/abs/2509.11698)https://arxiv.org/abs/2509.11698[CoachMe:使用基于参考的教练指导生成模型解码运动元素](https://papers.cool/arxiv/2509.11698) [PDF] [Copy] [Kimi] [REL] **Authors**: [Wei-Hsin Yeh](https://arxiv.org/search/?searchtype=author&query=Wei-Hsin%20Yeh), [Yu-An Su](https://arxiv.org/search/?searchtype=author&query=Yu-An%20Su), [Chih-Ning Chen](https://arxiv.org/search/?searchtype=author&query=Chih-Ning%20Chen), [Yi-Hsueh Lin](https://arxiv.org/search/?searchtype=author&query=Yi-Hsueh%20Lin), [Calvin Ku](https://arxiv.org/search/?searchtype=author&query=Calvin%20Ku), [Wen-Hsin Chiu](https://arxiv.org/search/?searchtype=author&query=Wen-Hsin%20Chiu), [Min-Chun Hu](https://arxiv.org/search/?searchtype=author&query=Min-Chun%20Hu), [Lun-Wei Ku](https://arxiv.org/search/?searchtype=author&query=Lun-Wei%20Ku) **动作指导是一项至关重要的任务,它通过分析动作和提供纠正指导来帮助运动员完善技术。尽管多模态模型的最新进展提高了运动理解能力,但由于运动具有高度特定领域的性质以及对信息指导的需求,生成精确且针对特定运动的指令仍然具有挑战性。我们提出了 CoachMe,这是一种基于参考的模型,用于分析学习者的运动与参考在时间和物理方面的差异。这种方法既可以学习领域知识,也可以获得类似教练的思维过程,可以有效识别运动错误并提供反馈来解释如何改进。在本文中,我们说明了 CoachMe 如何通过从一般动作中学习,然后利用有限的数据来很好地适应滑冰和拳击等特定运动。实验表明,CoachMe 提供高质量的指导,而不是仅仅以教练的语气提供指导,但没有关键信息。CoachMe 在花样滑冰方面的 G-Eval 中比 GPT-4o 高出 31.6%,在拳击方面比 GPT-4o 高出 58.3%。分析进一步证实,它详细阐述了生成指令中的错误及其相应的改进方法。你可以在这里找到 CoachMe: **[https://motionxperts.github.io/](https://motionxperts.github.io/) **科目**: [计算和语言](https://papers.cool/arxiv/cs.CL), [人工智能](https://papers.cool/arxiv/cs.AI), [计算机视觉和模式识别](https://papers.cool/arxiv/cs.CV), [机器学习](https://papers.cool/arxiv/cs.LG) **发布**: 2025-09-15 09:01:39 UTC ## 科学研究

我们离最佳推理效率还有多远?

论文从问题复杂性出发,研究推理模型与最佳推理效率之间的差距,并分析其优势与局限。

 推理 模型评估 系统优化 逻辑推理

论文探讨当前推理模型距离最佳推理效率还有多远。研究以问题复杂性为切入点,考察模型推理表现、计算开销与任务难度之间的关系。其核心关注点是推理模型的能力提升是否伴随着必要且有效的计算,以及这些优势在不同复杂度问题上的边界。该视角有助于理解所谓“思考”的实际收益与局限。

用途与启示
  • 为衡量推理模型的计算效率与性能收益提供分析视角
  • 帮助识别不同问题复杂度下推理模型的能力边界
  • 为减少冗余推理、优化测试时计算预算提供参考
📝 原始笔记(逐字保留)
7. 2025-06-11 11:44:33 Wednesday | How Far Are We from Optimal Reasoning Efficiency? **标题** : 我们离最佳推理效率还有多远? **链接** :https://arxiv.org/abs/2506.07104 **作者** : Jiaxuan Gao, Shu Yan, Qixin Tan, Lu Yang, Shusheng Xu, Wei Fu, Zhiyu Mei, Kaifeng Lyu, Yi Wu #### 🌈 🌈 🌈 思考的错觉:通过问题复杂性的视角理解推理模型的优势和局限性

思考的错觉:从问题复杂性理解推理模型的优势与局限

苹果研究团队通过可控复杂度的游戏谜题发现,推理模型只在中等复杂度问题上表现出优势,并会在高复杂度下出现准确率与推理投入同步崩溃。

 推理 逻辑推理 模型评估 人工智能

论文使用复杂度可控的游戏谜题,系统比较大型推理模型与标准语言模型在不同难度下的表现。实验呈现三个阶段:低复杂度时标准模型可能更高效,中等复杂度时推理模型占优,而高复杂度时两类模型都会崩溃。研究还发现,推理模型的思考 token 会随难度增加而增长,但在接近能力上限时反而下降,即使仍有充足的计算预算。结果表明,显式思维链并不等同于稳定的算法推理能力,当前模型在精确计算与跨复杂度泛化方面仍存在根本限制。

用途与启示
  • 为评估推理模型提供基于问题复杂度分层的实验框架,避免只看最终准确率。
  • 提醒开发者根据任务难度选择普通模型或推理模型,平衡效果、延迟与计算成本。
  • 启发后续研究关注高复杂度下推理投入提前下降、算法执行不稳定及泛化失败等问题。
📝 原始笔记(逐字保留)
2025-06-11 11:45:12 Wednesday |Apple| The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity **标题** : 思考的错觉:通过问题复杂性的视角理解推理模型的优势和局限性 **链接** :https://arxiv.org/abs/2506.06941 **作者** : Parshin Shojaee, Iman Mirzadeh, Keivan Alizadeh, Maxwell Horton, Samy Bengio, Mehrdad Farajtabar **备注** :preprint #### 🌈 玩一般化:通过游戏学习推理

以玩促泛化:通过游戏学习推理

该工作探讨通过游戏过程训练模型的推理能力,并提升其在不同任务中的泛化表现。

 推理 博弈论 强化学习 逻辑推理

《Play to Generalize: Learning to Reason Through Game Play》关注如何借助游戏学习培养推理能力。其核心思路是利用游戏中的规则理解、策略选择和多步决策,为模型提供结构化的推理训练环境。标题显示,该研究尤其关注从游戏经验中获得可迁移能力,以改善模型在新任务或新情境下的泛化表现。

用途与启示
  • 将游戏作为训练和评估多步推理能力的可控环境
  • 探索博弈策略学习向通用推理任务迁移的可能性
  • 为结合强化学习与推理能力训练提供研究思路
📝 原始笔记(逐字保留)
2025-06-11 11:46:49 Wednesday| Play to Generalize: Learning to Reason Through Game Play

设计合成:通过结构引导控制数据生成

该论文研究如何利用结构化引导机制控制数据生成过程,以提升合成数据的可控性。

 数据合成 数据工程 模型训练

论文提出一种通过结构引导实现可控数据生成的方法。其核心思路是在合成过程中引入明确的结构约束,使生成结果更符合预设要求。该研究聚焦于改善合成数据的可控性,为按需构造训练与评估数据提供了新思路。作者包括 Lei Xu、Sirui Chen、Yuxuan Huang 和 Chaochao Lu。

用途与启示
  • 为特定任务按结构要求生成可控的合成数据
  • 减少无约束数据生成带来的偏差与噪声
  • 为模型训练、数据增强和评估集构建提供方法参考
📝 原始笔记(逐字保留)
3. 2025-06-11 11:43:26 Wednesday | Synthesis by Design: Controlled Data Generation via Structural Guidance **标题** : 设计合成:通过结构引导控制数据生成 **链接** :https://arxiv.org/abs/2506.07664 **作者** : Lei Xu, Sirui Chen, Yuxuan Huang, Chaochao Lu

通过联合叙事与难度控制推进问题生成

该研究探索联合控制叙事内容与问题难度的问题生成方法,以提升合成问题的可控性和教育应用价值。

 数据合成 数据工程 模型训练 人工智能应用

论文研究如何在自动问题生成过程中同时控制叙事信息和问题难度。联合控制机制有望生成更符合指定语境及学习者能力水平的合成问题,从而增强教育数据的针对性。该工作由 Bernardo Leite 和 Henrique Lopes Cardoso 完成,论文为预印本,并已被 ACL 的 BEA 2025 Workshop 接收。

用途与启示
  • 为教育场景构造叙事一致、难度可控的合成问题
  • 支持按学习者水平生成训练与评估材料
  • 为可控数据合成提供联合条件建模思路
📝 原始笔记(逐字保留)
4. 2025-06-11 11:44:02 Wednesday | Advancing Question Generation with Joint Narrative and Difficulty Control **标题** : 通过联合叙述和难度控制推进问题生成 **链接** :https://arxiv.org/abs/2506.06812 **作者** : Bernardo Leite, Henrique Lopes Cardoso **备注** :Preprint. Accepted to the BEA 2025 Workshop (ACL)

OpenAI 发布 o3-pro,引入严格的“4/4 可靠性”评估

o3-pro 发布并采用“4/4 可靠性”标准,要求模型连续四次尝试均正确才计为成功。

 模型开发 模型评估 推理

OpenAI 推理模型 o3-pro 于 2025 年 6 月 11 日发布。其评估采用严格的“4/4 可靠性”指标:同一道问题进行四次独立尝试,只有四次全部回答正确才视为成功。相比仅考察单次正确率,这一标准更强调模型输出的稳定性与可重复性。

用途与启示
  • 适合衡量模型在高可靠性任务中的稳定表现,而非偶然答对的能力。
  • 提示开发者在选型与部署时关注多次运行的一致性。
  • 可为推理模型建立比单次准确率更严格的评估基准。
📝 原始笔记(逐字保留)
16. 2025-06-11 11:15:20 Wednesday|o3-pro发布,严格的「4/4 可靠性」评估,即只有在四次尝试中(而不仅仅是一次)正确回答问题,模型才被视为成功

大型语言模型在框架与符号落地问题上的零样本评估基准

该研究提出零样本基准,用于评估大型语言模型处理框架问题与符号落地问题的能力。

 逻辑推理 推理 模型评估

该论文关注大型语言模型在框架问题和符号落地问题上的表现。研究通过零样本基准考察模型能否在缺少任务示例的情况下完成相关推理。该评估有助于揭示语言模型在抽象符号与现实语义建立联系时的能力边界。论文可通过 arXiv 编号 2506.07896 获取。

用途与启示
  • 为大语言模型的符号推理与语义落地能力提供专项评估工具
  • 帮助识别模型在零样本条件下处理框架问题的局限
  • 为改进神经模型与符号推理方法的结合提供参考
📝 原始笔记(逐字保留)
6. 2025-06-11 11:19:47 Wednesday |Evaluating Large Language Models on the Frame and Symbol Grounding Problems: A Zero-shot Benchmark **标题** : 基于框架和符号基础问题的大型语言模型评估:Zero-Shot基准 **链接** :https://arxiv.org/abs/2506.07896

思想定理:面向溯因、演绎与归纳推理的多智能体框架

Theorem-of-Thought 提出一个多智能体框架,用于协同增强语言模型的溯因、演绎和归纳推理能力。

 逻辑推理 推理 智能体 人工智能框架

Theorem-of-Thought 面向语言模型中的多类型逻辑推理,覆盖溯因、演绎和归纳三种范式。该方法采用多智能体框架,使不同智能体参与推理过程并协同形成结论。其核心价值在于将多种推理机制纳入统一框架,为提升语言模型的综合逻辑推理能力提供新思路。

用途与启示
  • 为需要同时处理溯因、演绎与归纳任务的语言模型提供统一框架
  • 探索利用多智能体分工与协作增强复杂逻辑推理
  • 为构建可组合、可扩展的推理系统提供研究参考
📝 原始笔记(逐字保留)
7. 2025-06-11 11:20:50 Wednesday | Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models **标题** : 思想定理:语言模型中溯因、演绎和归纳推理的多Agent框架 **链接** :https://arxiv.org/abs/2506.07106

不完全是夏洛克·福尔摩斯:语言模型无法可靠区分不可能与不太可能的事件

研究发现,语言模型对事件可能性的预测无法稳定地区分逻辑上不可能的事件与仅仅概率较低的事件。

 逻辑推理 推理 模型评估

该论文考察语言模型能否区分“不可能发生”和“发生概率较低”的事件。研究指出,模型的预测在这两类事件之间缺乏可靠区分,反映出其概率判断与逻辑约束理解仍有不足。这一发现提示,语言模型给出的低概率预测未必代表其真正识别了事件的不可能性。论文已被 ACL 2025 Findings 接收。

用途与启示
  • 用于评估语言模型对逻辑不可能性与统计低概率的辨别能力
  • 为概率推理、常识推理及模型校准基准的设计提供参考
  • 提醒应用开发者不要将模型的低置信度直接解释为对逻辑矛盾的识别
📝 原始笔记(逐字保留)
8. 2025-06-11 11:22:43 Wednesday | Not quite Sherlock Holmes: Language model predictions do not reliably differentiate impossible from improbable events **标题** : 不完全是夏洛克·福尔摩斯:语言模型预测并不能可靠地区分不可能的事件和不可能的事件 **链接** :https://arxiv.org/abs/2506.06808 **作者** : James A. Michaelov, Reeka Estacio, Zhien Zhang, Benjamin K. Bergen **备注** :Accepted to Findings of ACL 2025
0%