2025-06-04 科研追新

当日精选(由提交工具自动创建)。

ALITA:最小预定义+最大自进化的通用智能体

极简即复杂:通用智能体按需自创、优化、复用 MCP 工具,实现自我进化。

 智能体 自进化

Alita 秉持「极简即极致复杂」,通过「最小化预定义」与「最大化自进化」范式,让智能体自主思考、搜索和创造所需的 MCP 工具。

用途与启示
  • 通用智能体的可扩展/创造力设计范式
  • MCP 工具的按需自创与复用

ChatGPT 向普通会员开放 Codex

ChatGPT 开始支持普通会员使用 Codex,进一步扩大 AI 编程工具的可用范围。

 智能体工具 人工智能辅助编程 人工智能 人工智能应用

ChatGPT 于 2025 年 6 月 4 日起支持普通会员使用 Codex。此次调整降低了用户体验 AI 编程能力的门槛,使更多开发者能够在 ChatGPT 中完成代码生成、理解与修改等任务。Codex 的开放有助于推动 AI 编程工具从专业场景走向更广泛的日常开发流程。

用途与启示
  • 降低 AI 编程助手的使用门槛
  • 帮助开发者完成代码生成、解释与修改
  • 推动 Codex 融入日常软件开发工作流
📝 原始笔记(逐字保留)
4. 20250604|chatgpt支持普通会员使用codex

浏览器智能体 Fellou 2.0 发布

浏览器智能体 Fellou 推出 2.0 版本,进一步强化基于浏览器的智能任务执行能力。

 智能体工具 智能体 人工智能应用 人工智能

Fellou 2.0 是一款新发布的浏览器智能体工具。它以浏览器为主要操作环境,可用于辅助用户完成网页浏览及相关任务。原始文本未提供具体功能更新、性能指标和获取地址。

用途与启示
  • 关注浏览器智能体在网页操作与任务自动化场景中的应用
  • 可用于考察智能体与浏览器环境结合的产品形态
  • 后续可跟踪其具体能力、评测结果及使用入口
📝 原始笔记(逐字保留)
1. 20250604|新出了浏览器智能体fellou2.0

PosterAgent:一键将论文生成顶会级学术海报

开源框架 PosterAgent 可自动将论文内容转化为专业学术海报,降低信息提炼、排版与视觉设计成本。

 智能体工具 人工智能框架 智能体 人工智能应用

PosterAgent 是一款面向科研场景的开源学术海报生成框架。用户可输入论文,由系统完成核心内容提炼、版面组织和视觉呈现,快速生成接近顶会风格的 Poster。该工具将原本需要人工反复调整的内容策划与排版流程自动化,可用于会议展示和科研成果传播。

用途与启示
  • 快速将论文转换为结构清晰的会议学术海报
  • 减少科研人员在内容提炼、视觉设计和排版上的时间投入
  • 展示了智能体工具在科研内容生产与传播环节的应用潜力
📝 原始笔记(逐字保留)
20250604|论文秒变海报!开源框架PosterAgent一键生成顶会级学术Poster [https://mp.weixin.qq.com/s/XF-huJzUkA2giNXrsLg6Zw](https://mp.weixin.qq.com/s/XF-huJzUkA2giNXrsLg6Zw)

从数学推理到代码:测试时扩展中过程奖励模型的泛化

研究过程奖励模型能否从数学推理泛化至代码任务,并支持测试时计算扩展。

 强化学习 推理 人工智能辅助编程 模型评估

该论文关注过程奖励模型在不同推理领域之间的泛化能力,研究其能否从数学推理迁移到代码任务。工作将过程级反馈与测试时扩展结合,用奖励信号筛选或引导候选推理轨迹。研究有助于理解过程监督在跨任务场景中的有效性及局限。

用途与启示
  • 为过程奖励模型的跨领域迁移与泛化研究提供参考
  • 探索通过过程级评分提升代码生成和推理表现
  • 为测试时增加计算量、筛选高质量推理轨迹提供方法启示
📝 原始笔记(逐字保留)
8. 20250604|From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling 1. 标题: 从数学推理到代码:测试时间缩放中过程奖励模型的推广 2. 链接:[https://arxiv.org/abs/2506.00027](https://arxiv.org/abs/2506.00027)

RewardBench 2:推进奖励模型评估

RewardBench 2 聚焦奖励模型的系统化评估,旨在推动强化学习训练中奖励信号质量的可靠衡量。

 强化学习 模型评估 模型训练

RewardBench 2 是面向奖励模型的新一代评估基准。它关注如何更全面、可靠地区分不同奖励模型的能力与局限。该工作可为基于人类反馈的强化学习及相关对齐训练提供模型选择和效果验证依据。原始文本未提供具体实验结果、数据集组成或实现链接。

用途与启示
  • 用于比较和筛选奖励模型
  • 帮助诊断奖励信号的偏差与能力短板
  • 为强化学习及对齐训练建立更可靠的评估依据
📝 原始笔记(逐字保留)
20250604|RewardBench 2: Advancing Reward Model Evaluation

大语言模型在线强化学习仅需响应级奖励:数学视角

该研究从数学角度探讨在大语言模型在线强化学习中仅使用响应级奖励的可行性。

 强化学习 模型训练 模型开发

论文聚焦大语言模型的在线强化学习,研究响应级奖励是否足以提供有效训练信号。其核心观点是,无需更细粒度的奖励设计,也可能完成策略优化。文章从数学视角分析这一方法的理论依据与适用条件。原始文本未提供具体实验结果、论文链接或实现信息。

用途与启示
  • 简化大语言模型在线强化学习的奖励设计流程
  • 为响应级奖励的有效性提供理论分析视角
  • 降低细粒度奖励标注或过程奖励建模的潜在成本
📝 原始笔记(逐字保留)
20250604|Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective

Critique-GRPO:利用自然语言与数值反馈推进大模型推理

Critique-GRPO将自然语言批评与数值奖励引入在线强化学习,在多类推理任务上显著提升大模型表现。

 强化学习 推理 模型训练 逻辑推理

论文指出,仅依赖标量奖励的强化学习容易遭遇性能平台、自我反思效果有限和持续失败等问题。为此,作者提出 Critique-GRPO,让模型同时从初始回答和自然语言批评指导下的改进回答中学习,并在策略优化过程中保持探索。基于 Qwen2.5-7B-Base 和 Qwen3-8B-Base 的实验显示,该方法在八项数学、STEM及通用推理任务上持续优于监督微调和强化学习基线,平均 pass@1 分别提升约 4.5% 和 5%。研究还发现,更高的策略熵和更长的回答并不必然带来更有效的探索。

用途与启示
  • 为突破纯标量奖励造成的强化学习性能平台提供自然语言反馈方案
  • 可用于增强大模型在数学、STEM和通用推理任务中的训练效果
  • 提示策略探索应关注反馈质量与学习有效性,而非单纯提高熵或增加回答长度
📝 原始笔记(逐字保留)
2. 20250604|Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback **标题** : Critique-GRPO:利用自然语言和数字反馈推进LLM推理 **链接** :https://arxiv.org/abs/2506.03106 **摘要** :最近,带有数值反馈的强化学习(RL)的进展,如标量奖励,显着增强了大型语言模型(LLM)的复杂推理能力。尽管取得了这一成功,我们确定了RL遇到的三个关键挑战, **只有数字反馈** :性能高原, **自我反思的有效性有限** ,和 **持续的失败** 。然后,我们证明,RL微调模型,即使表现出性能平台,可以产生正确的改进持续失败的问题,通过利用自然语言反馈的形式的批评。基于这一见解,我们提出了Critique-GRPO,这是一个在线RL框架,它集成了自然语言和数值反馈,以实现有效的策略优化。CRitique-GRPO使LLM能够在保持探索的同时 **从初始响应和批评指导的改进中学习** 。使用**Qwen2.5- 7 B-Base**和Qwen 3 -8B-Base进行的大量实验表明,Critique-GRPO在8个具有挑战性的数学、STEM和一般推理任务中始终优于基于监督学习和基于RL的微调方法,分别将平均pass@1分数提高了约4.5%和5%。值得注意的是,Critique-GRPO超越了在线RL中包含专家演示的强大基线。进一步的分析揭示了关于策略探索的两个关键见解:(1)更高的熵并不总是保证从探索中有效学习,(2)更长的响应不一定会导致更有效的探索。

General-Reasoner:面向跨领域泛化的推理框架

General-Reasoner 提出一种面向跨领域任务的新型推理框架,旨在提升模型在不同领域中的推理泛化能力。

 推理 人工智能框架 逻辑推理 人工智能

General-Reasoner 是一个聚焦跨领域泛化能力的推理框架。其目标是让模型将已有推理能力迁移至不同领域,而非局限于特定任务或数据分布。该方向关注通用推理方法在未知场景中的适应性与稳定性。

用途与启示
  • 为构建具备跨任务、跨领域迁移能力的通用推理系统提供参考
  • 可用于研究模型在分布变化和未知领域下的推理泛化表现
  • 启发减少针对单一领域定制推理流程的依赖
📝 原始笔记(逐字保留)
5. 20250604|新泛化跨领域推理框架:General-Reasoner [https://mp.weixin.qq.com/s/GDe5Dm17ekCCbUwKO475iA](https://mp.weixin.qq.com/s/GDe5Dm17ekCCbUwKO475iA)

Auto-Patching:增强语言模型的多跳推理能力

Auto-Patching 方法旨在通过自动修补推理过程,提升语言模型处理多跳推理任务的能力。

 推理 逻辑推理 模型开发

该工作提出 Auto-Patching,以增强语言模型在多跳推理任务中的表现。其核心思路是自动识别并修补推理链中的薄弱或错误环节,降低中间错误逐步累积对最终答案的影响。该方法关注复杂问题中多个推理步骤之间的衔接与一致性。原始文本未提供具体实验结果、论文链接或实现细节。

用途与启示
  • 为语言模型的推理链纠错提供自动化思路
  • 提升复杂问答与多步骤逻辑任务的可靠性
  • 可用于研究推理过程中的错误定位、修复与一致性控制
📝 原始笔记(逐字保留)
20250604|Auto-Patching: Enhancing Multi-Hop Reasoning in Language Models

CoT-Bridge:为模型补上思维跳跃的“桥梁”

CoT-Bridge 旨在补全思维链中的隐含推理步骤,为模型跨越逻辑跳跃提供更连贯的推理桥梁。

 推理 逻辑推理 人工智能

CoT-Bridge 聚焦大模型思维链中推理步骤缺失或跨度过大的问题。其核心思路是在前后推理节点之间补充必要的中间过程,降低模型因“思维跳跃”产生错误结论的风险。该方向有助于提升复杂任务中的推理连贯性、可解释性与结果可靠性。

用途与启示
  • 用于发现并补全思维链中的隐含推理步骤
  • 为复杂逻辑推理提供更细粒度的过程监督
  • 启发通过中间步骤生成与验证提升模型推理稳定性
📝 原始笔记(逐字保留)
6. 20250604|CoT-Bridge:为模型补上思维跳跃的 “桥梁” [https://mp.weixin.qq.com/s/Gjz9CLEGngOBpKRnZ_GC_A](https://mp.weixin.qq.com/s/Gjz9CLEGngOBpKRnZ_GC_A)

答案收敛可作为推理早停信号

研究发现大模型在数学任务约完成60%推理步骤时答案便趋于稳定,并提出三种早停策略以显著降低令牌消耗且基本不损失准确率。

 推理 系统优化 人工智能

思维链提示虽能增强大模型推理能力,却常产生冗长、重复的推理内容并增加推理成本。研究发现,在数学推理任务中,模型通常经过约60%的推理步骤后就已收敛到最终答案,后续生成存在明显冗余。基于这一现象,作者提出答案一致性早停、提高推理结束信号概率,以及利用内部激活监督学习停止时机三种策略。在五个基准和五个开放权重模型上的实验显示,这些方法可大幅减少令牌使用且几乎不降低准确率,其中答案一致性策略在 NaturalQuestions 上节省超过40%的令牌并提升了准确率。

用途与启示
  • 将答案收敛程度作为推理过程是否继续的低成本判断信号
  • 降低长思维链带来的令牌消耗、延迟与部署成本
  • 为基于模型内部激活训练自适应停止机制提供研究方向
  • 适用于对吞吐量和响应时间敏感的现实推理系统
📝 原始笔记(逐字保留)
7. 20250604|Answer Convergence as a Signal for Early Stopping in Reasoning **标题** : 答案收敛是早期停止推理的信号 **链接** :https://arxiv.org/abs/2506.02536 **摘要** :思想链(CoT)提示增强了大型语言模型(LLM)中的推理,但通常会导致冗长和冗余的输出,从而增加推理成本。我们假设许多推理步骤对于产生正确答案是不必要的。为了研究这一点,我们从一个系统的研究开始,研究模型达到稳定决策所需的最低推理是什么。我们发现,在数学推理任务中,模型通常在60%的推理步骤后收敛到最终答案,这表明剩余内容存在大量冗余。基于这些见解,我们提出了三种推理时间策略来提高效率:(1)通过答案一致性提前停止,(2)提高生成推理结束信号的概率,以及(3)基于内部激活学习何时停止的监督方法。在五个基准测试和五个开放权重LLM上的实验表明,我们的方法显着减少了令牌的使用,几乎没有或没有准确性下降。特别是在NaturalQuestions上,Answer Consistency将令牌减少了40%以上,同时进一步提高了准确性。我们的工作强调了在推理时操作的具有成本效益的推理方法的重要性,为现实世界的应用提供了实际的好处。

SynthRL:以可验证数据合成扩展视觉推理

SynthRL 通过合成可自动验证的训练数据,探索规模化提升模型视觉推理能力的方法。

 数据合成 多模态 强化学习 推理 模型训练

SynthRL 面向视觉推理任务构建可验证的合成数据,以降低高质量人工标注的成本。其核心思路是利用能够自动判定正确性的样本,为强化学习提供稳定且可扩展的奖励信号。随着合成数据规模扩大,模型可获得更丰富的视觉理解与推理训练。该工作展示了数据合成与强化学习结合在扩展多模态推理能力方面的潜力。

用途与启示
  • 为视觉推理模型低成本生成大规模、可验证的训练数据
  • 利用自动验证机制改善强化学习奖励的可靠性
  • 启发多模态系统通过“数据合成 + 强化学习”持续扩展推理能力
📝 原始笔记(逐字保留)
20250604|SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis

普林斯顿 Alita 开启通用智能体自主进化新范式

普林斯顿提出 Alita 通用智能体,主打自主进化能力,并在 GAIA 基准测试中展现出竞争力。

 智能体 自进化 模型开发 模型评估 人工智能

普林斯顿团队推出通用智能体 Alita,尝试突破依赖固定工具与人工预设流程的传统智能体范式。其核心方向是让智能体根据任务需求自主扩展能力并持续进化。标题信息显示,Alita 在通用智能体评估基准 GAIA 上取得了具有竞争力的表现,可能推动该榜单进入新的能力阶段。

用途与启示
  • 为构建能够自主获取、组合和改进能力的通用智能体提供参考
  • 展示自我进化机制在开放任务与通用智能体评估中的应用潜力
  • 促使智能体研究从固定工作流转向动态能力扩展
📝 原始笔记(逐字保留)
20250604|开启 AI 自主进化时代,普林斯顿Alita颠覆传统通用智能体,GAIA榜单迎来终章

清华推出“AI数学家”:可自主调用定理并构建证明思路

清华推出面向数学研究的智能体系统,可自主调用基础定理、规划证明路径并尝试解决数学理论难题。

 智能体 逻辑推理 推理 任务规划 人工智能

清华推出了一款“AI数学家”,目标是独立处理具有挑战性的数学理论问题。该系统能够自动调用基础定理,并围绕问题构建证明思路,体现了智能体在工具使用与长程推理方面的能力。其核心方向是将定理检索、证明规划和逻辑推演整合为自主求解流程。相关成果显示,智能体正从辅助计算工具向数学研究伙伴演进。

用途与启示
  • 探索智能体在自动定理证明和数学研究中的应用潜力
  • 为长链条逻辑推理、证明规划与工具调用提供系统设计参考
  • 推动 AI 从给出答案转向生成可检验的证明过程
📝 原始笔记(逐字保留)
20250604|清华推出AI数学家!独立完成数学理论难题,自动调用基本定理、构建证明思路

BenchHub:面向整体与可定制 LLM 评估的统一基准套件

BenchHub 提供统一的基准套件,支持对大语言模型进行整体化与可定制的评估。

 模型评估 智能体工具 人工智能框架

BenchHub 是一个面向大语言模型的统一评估基准套件。它强调评估的整体性,旨在通过统一框架组织和执行多方面的模型测评。同时,套件支持按需求定制评估内容,有助于适配不同模型、任务与应用场景。

用途与启示
  • 为大语言模型提供统一、系统的评估入口
  • 支持按具体任务和需求定制评测方案
  • 降低多基准整合与横向比较的实施成本
📝 原始笔记(逐字保留)
2. 20250604|BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation 1. 标题: BenchHub:用于整体和可定制LLM评估的统一基准套件 2. 链接:[https://arxiv.org/abs/2506.00482](https://arxiv.org/abs/2506.00482)

探索真理的几何学:LLM 真值方向在逻辑变换与问答任务中的一致性和泛化性

该研究探究大语言模型内部表征真假的“真值方向”,分析其能否跨逻辑变换和问答任务保持一致并实现泛化。

 逻辑推理 推理 模型评估 人工智能

论文从表征几何视角研究大语言模型如何在内部编码命题的真实性。作者重点考察所谓“真值方向”在不同逻辑变换下是否保持一致,以及从一种任务中识别出的方向能否迁移到其他问答任务。研究将一致性与跨任务泛化作为判断真值表征是否具有通用性的关键指标。这为理解模型的逻辑推理机制及其内部真假判断提供了新的分析路径。

用途与启示
  • 帮助研究者定位和解释大语言模型内部与真假判断相关的表征。
  • 为评估模型在逻辑变换下的一致性提供几何分析思路。
  • 可用于探索跨任务真值检测、幻觉识别及推理可靠性评估方法。
📝 原始笔记(逐字保留)
4. 20250604|Probing the Geometry of Truth: Consistency and Generalization of Truth Directions in LLMs Across Logical Transformations and Question Answering Tasks 1. 标题: 探索真理的几何学:跨逻辑转换和问题解答任务的LLM中真值方向的一致性和概括性 2. 链接:[https://arxiv.org/abs/2506.00823](https://arxiv.org/abs/2506.00823)
0%