2025-07-18 科研追新

当日精选(由提交工具自动创建)。

OpenAI 通用智能体 ChatGPT Agent 正式发布

OpenAI 正式推出 ChatGPT Agent,使 ChatGPT 能够调用工具并自主执行多步骤任务。

 智能体工具 智能体 人工智能应用 人工智能

OpenAI 发布通用智能体 ChatGPT Agent,将信息检索、推理和工具操作整合到统一系统中。它可以围绕用户目标规划并执行多步骤任务,而不再局限于生成文本或提供建议。该产品体现了 ChatGPT 从对话助手向可实际操作数字环境的智能体演进。

用途与启示
  • 用于自动完成信息搜集、分析整理及跨工具操作等复杂任务
  • 展示通用智能体产品化与大规模落地的新进展
  • 为智能体的任务规划、工具调用和安全权限设计提供参考
📝 原始笔记(逐字保留)
2025-07-18 14:11:00 Friday | 刚刚,OpenAI通用智能体ChatGPT Agent正式登场 https://mp.weixin.qq.com/s/4xJGBr1dXdIPHgSrPpwW5w kimi-dev

实测9款AI:Agent究竟如何改变PPT制作?

文章实测9款AI工具,考察所谓Agent在PPT生成与制作中的实际效果。

 智能体工具 智能体 人工智能应用 模型评估

文章围绕AI Agent制作PPT的能力展开横向实测,共涉及9款AI产品。评测重点关注这些工具能否将用户需求转化为结构合理、内容可用且视觉效果合格的演示文稿。文章通过实际生成结果审视“Agent”概念在PPT场景中的落地表现,并揭示宣传定位与真实产出之间可能存在的差距。

用途与启示
  • 为选择AI PPT工具提供横向评测参考
  • 帮助判断Agent在内容组织、版式生成和任务执行方面的实际能力
  • 提醒用户关注生成结果的可编辑性、准确性与人工修订成本
📝 原始笔记(逐字保留)
1. 2025-07-18 14:10:37 Friday | 我测了9款AI,只想问:所谓的Agent,到底把PPT变成了什么鬼东西? https://mp.weixin.qq.com/s/L7TzaV6uHaP6r67PkzxR5Q ## 科研工具

真相大白!RL不是魔法,随机奖励有效只是由于数据泄露

文章指出强化学习中随机奖励看似有效的现象可能源于数据泄露,而非算法真正获得了可泛化的学习能力。

 强化学习 数据工程 模型训练 模型评估

文章质疑“随机奖励也能提升模型表现”这一反常结论,并认为其背后并非强化学习的神奇能力。相关实验结果可能受到训练数据与评测信息泄露的影响,使模型获得了隐性的正确答案信号。该观点提醒研究者重新审视奖励设计、数据隔离和实验对照,避免将评测污染误判为算法进步。

用途与启示
  • 强调强化学习实验中训练集、验证集和测试集的严格隔离
  • 提醒研究者排查奖励信号中的隐性信息与数据泄露
  • 为评估随机奖励等反常实验结果提供更审慎的解释框架
📝 原始笔记(逐字保留)
1. 2025-07-18 20:24:54 Friday | 真相大白!RL不是魔法,随机奖励有效只是由于数据泄露! https://mp.weixin.qq.com/s/J7dzjfHMHyvQNpKQFpoq7w

两篇 ICLR 论文破解强化学习的两个关键难题

文章介绍两篇 ICLR 论文针对强化学习中的两个关键痛点提出的解决方案及其研究价值。

 强化学习 模型训练 人工智能

文章聚焦强化学习研究与训练中的两个关键难题,并解读两篇 ICLR 论文给出的解决思路。相关工作旨在改善强化学习方法的训练效果或稳定性,为突破现有技术瓶颈提供新路径。由于原始条目仅包含标题和链接,具体问题定义、算法设计与实验结论需参阅原文。

用途与启示
  • 了解强化学习训练中的典型瓶颈及最新解决思路
  • 跟踪 ICLR 相关研究进展,辅助筛选值得精读的论文
  • 为强化学习算法设计与训练优化提供研究线索
📝 原始笔记(逐字保留)
2. 🌈 2025-07-18 14:07:23 Friday|强化学习的两个「大坑」,终于被两篇ICLR论文给解决了 https://mp.weixin.qq.com/s/myqak4eAAQ7ONKJKOFxk8g

Goedel-Prover-V2开源:72B模型定理证明超越DeepSeek-Prover-V2 671B

普林斯顿大学联合多所高校与企业推出开源数学定理证明模型Goedel-Prover-V2,其72B版本在相关基准上超越DeepSeek-Prover-V2 671B并取得SOTA表现。

 推理 逻辑推理 模型开发 模型训练

普林斯顿大学牵头,联合清华大学、北京大学、上海交通大学、斯坦福大学,以及英伟达、亚马逊和Meta FAIR等机构推出Goedel-Prover-V2。该模型面向形式化数学与自动定理证明,并以开源方式发布。据原文介绍,其72B版本在定理证明任务上超过DeepSeek-Prover-V2的671B版本,实现SOTA表现。该成果显示,针对数学证明场景进行专门训练,有望以更小参数规模获得更强的形式化推理能力。

用途与启示
  • 用于形式化数学、自动定理证明及证明辅助系统研究
  • 为比较模型规模与专门化训练对推理能力的影响提供案例
  • 可作为数学推理智能体、证明搜索与验证工具的基础模型
  • 展示小规模专用模型超越超大通用模型的潜力
📝 原始笔记(逐字保留)
2025-07-18 14:06:45 Friday | 近日,由普林斯顿大学牵头,联合清华大学、北京大学、上海交通大学、斯坦福大学,以及英伟达、亚马逊、Meta FAIR 等多家顶尖机构的研究者共同推出了新一代开源数学定理证明模型——Goedel-Prover-V2。https://mp.weixin.qq.com/s/MMBc9dUEg8Kzv6CzXcyLUQ ##### **Kimi新模型数学超越DeepSeek了** ,在定理证明这块,即便模型参数72B也能超越DeepSeek-Prover-V2的671B版本,实现SOTA。

清华大学与智谱联合培养博士后招聘启事

清华大学与智谱发布联合培养博士后招聘启事,面向相关研究方向招募科研人才。

 人工智能

清华大学与智谱发布联合培养博士后招聘启事。该项目依托高校与人工智能企业的协同培养机制,为博士后研究人员提供产学研结合的科研环境。具体研究方向、申请条件及招聘流程以原文公告为准。

用途与启示
  • 为有意从事人工智能研究的博士毕业生提供博士后岗位信息
  • 展示高校与企业联合培养高层次科研人才的合作模式
  • 可通过原文了解研究方向、申请要求及联系方式
📝 原始笔记(逐字保留)
2025-07-18 14:11:21 Friday | 清华+智谱联合培养 | 博士后招聘启事 https://mp.weixin.qq.com/s/T2dt_TVkH_dcOH4m4VfQRw

Chain-of-Action:通过轨迹自回归实现动作推理的模仿学习新范式

Chain-of-Action 提出一种模仿学习新范式,通过自回归建模动作轨迹来增强智能体的动作推理与决策能力。

 智能体 具身智能 推理 模型训练 任务规划

Chain-of-Action 将动作轨迹视为可自回归生成的序列,使智能体能够基于历史状态和动作逐步推导后续行为。该方法把轨迹建模与动作推理结合,为传统模仿学习提供了新的训练思路。其核心价值在于显式利用动作之间的时序依赖,从而支持更连贯的规划与决策。该范式可用于具身智能、机器人控制及其他需要长程动作生成的智能体任务。

用途与启示
  • 为模仿学习引入类似序列生成的动作轨迹建模方式。
  • 启发智能体通过显式动作链提升长程规划和决策连贯性。
  • 可作为具身智能与机器人策略训练的新研究方向。
📝 原始笔记(逐字保留)
2025-07-18 14:05:54 Friday | 模仿学习新范式,Chain-of-Action:轨迹自回归实现动作推理 https://mp.weixin.qq.com/s/fJXWvpC1s_2FkoUYhnmTCg

ACL 2025 Oral:Evaluation Agent,懂模型的智能评测搭子

ACL 2025 Oral 工作 Evaluation Agent 探索利用智能体辅助模型评测,让评估过程更贴合模型与用户需求。

 智能体 模型评估 智能体工具

该消息介绍了一项入选 ACL 2025 Oral 的 Evaluation Agent 工作。其核心方向是将智能体引入 AI 模型评测,使评测流程能够更好地理解模型表现与用户需求。原文发布于微信公众号,当前摘录未提供论文、代码或数据集地址。

用途与启示
  • 为大模型建立更自动化、智能化的评测流程
  • 探索评测智能体在模型分析和效果反馈中的应用
  • 为面向真实用户需求的动态评估提供研究思路
📝 原始笔记(逐字保留)
2025-07-18 14:08:03 Friday| ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI https://mp.weixin.qq.com/s/FGsbKfmdFi_ZKEaAiEZXkg ## Tool #### 🌈 AI项目:可丝滑控制鼠标、键盘,模拟人类操作 https://mp.weixin.qq.com/s/iyiWwgNEsr4Si1WQQlJOxw

Cradle:赋能基础智能体实现通用计算机控制

Cradle 通过截图输入和键鼠输出的统一接口,使基础智能体无需内置 API 即可操作游戏与日常软件并执行长时序复杂任务。

 智能体 多模态 人工智能框架 任务规划 人工智能应用 模型评估

论文提出通用计算机控制(GCC)设定,以屏幕截图作为智能体输入,并以键盘和鼠标操作作为统一输出,从而消除不同软件封装及手工观察、动作空间带来的差异。Cradle 是一个模块化的大模型智能体框架,可理解截图、执行高层规划,并生成可运行的低级键鼠控制代码,无需依赖软件内置 API。实验覆盖四款商业游戏、五款软件应用和 OSWorld 基准,展示了较强的跨环境泛化能力。系统还在《荒野大镖客 2》中完成了约 40 分钟的真实任务,并可操作 Chrome、Outlook、飞书、美图秀秀和剪映等软件。

用途与启示
  • 为跨软件、跨游戏的通用智能体提供统一且贴近真实用户的交互接口。
  • 支持将任意软件转化为智能体能力评估与数据收集环境。
  • 展示截图理解、长程规划和低级动作执行相结合的通用计算机控制路线。
  • 为不依赖专用 API 的桌面自动化和复杂软件操作提供框架参考。
📝 原始笔记(逐字保留)
2025-07-18 17:11:37 Friday | https://arxiv.org/abs/2403.03186 Cradle:赋能基础代理实现通用计算机控制 [谭伟豪 ](https://arxiv.org/search/cs?searchtype=author&query=Tan,+W),[ 张文涛 ](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+W),[ 徐欣润 ](https://arxiv.org/search/cs?searchtype=author&query=Xu,+X),[ 夏浩冲 ](https://arxiv.org/search/cs?searchtype=author&query=Xia,+H),[ 丁子洛 ](https://arxiv.org/search/cs?searchtype=author&query=Ding,+Z),[ 李博宇 ](https://arxiv.org/search/cs?searchtype=author&query=Li,+B),[ 周博涵 ](https://arxiv.org/search/cs?searchtype=author&query=Zhou,+B),[ 岳俊鹏 ](https://arxiv.org/search/cs?searchtype=author&query=Yue,+J),[ 姜杰川 ](https://arxiv.org/search/cs?searchtype=author&query=Jiang,+J),[ 李业文 ](https://arxiv.org/search/cs?searchtype=author&query=Li,+Y),[ 安如意 ](https://arxiv.org/search/cs?searchtype=author&query=An,+R),[ 秦墨雷 ](https://arxiv.org/search/cs?searchtype=author&query=Qin,+M),[ 宗楚乔 ](https://arxiv.org/search/cs?searchtype=author&query=Zong,+C),[ 郑龙涛 ](https://arxiv.org/search/cs?searchtype=author&query=Zheng,+L),[ 吴宇杰 ](https://arxiv.org/search/cs?searchtype=author&query=Wu,+Y),[ 柴晓强 ](https://arxiv.org/search/cs?searchtype=author&query=Chai,+X),[ 毕一飞 ](https://arxiv.org/search/cs?searchtype=author&query=Bi,+Y),[ 谢天宝 ](https://arxiv.org/search/cs?searchtype=author&query=Xie,+T),[ 顾鹏杰 ](https://arxiv.org/search/cs?searchtype=author&query=Gu,+P),[ 李熙云 ](https://arxiv.org/search/cs?searchtype=author&query=Li,+X),[ 张策尧 ](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+C),[ 田龙 ](https://arxiv.org/search/cs?searchtype=author&query=Tian,+L),[ 王超杰 ](https://arxiv.org/search/cs?searchtype=author&query=Wang,+C),[ 王欣润 ](https://arxiv.org/search/cs?searchtype=author&query=Wang,+X),[Börje F. Karlsson](https://arxiv.org/search/cs?searchtype=author&query=Karlsson,+B+F),[ 安博 ](https://arxiv.org/search/cs?searchtype=author&query=An,+B),[ 闫水成 ](https://arxiv.org/search/cs?searchtype=author&query=Yan,+S),[ 卢宗庆](https://arxiv.org/search/cs?searchtype=author&query=Lu,+Z) > 尽管在特定场景中取得了成功,现有的基础智能体仍难以在各种虚拟场景中实现泛化,主要原因在于环境的封装方式差异巨大,且观察空间和动作空间多为手工设计。 > > 为了解决这一问题,我们提出了通用计算机控制(GCC)设置,限制基础智能体通过最统一和标准化的接口与软件交互,即以截图作为输入,以键盘和鼠标操作作为输出。 > > 我们引入了 Cradle,一个模块化且灵活的基于大型语言模型(LMM)的框架,作为迈向 GCC 的初步尝试。 > > Cradle 通过六个关键模块的增强,能够理解输入的截图,并在高层规划后输出可执行的低级键盘和鼠标控制代码,从而使 Cradle 能够与任何软件交互,完成长时序复杂任务,而无需依赖任何内置 API。 > > 实验结果表明,Cradle 在四款此前未探索的商业视频游戏、五款软件应用以及综合基准 OSWorld 中展现出卓越的泛化能力和令人印象深刻的性能。 > > Cradle 是首个能够让基础智能体遵循主线剧情并完成复杂大型游戏《荒野大镖客 2》(RDR2)中长达 40 分钟真实任务的系统。Cradle 还可以在《城市:天际线》中创建一个拥有千人的城市,在《星露谷物语》中种植和收获欧防风,并在《Dealer's Life 2》中进行交易和讨价还价,最高周总利润达 87%。Cradle 不仅能操作日常软件,如 Chrome、Outlook 和飞书,还能使用美图秀秀和剪映进行图像和视频编辑。Cradle 通过轻松将任何软件,尤其是复杂游戏,转化为评估智能体各种能力的基准,并促进进一步的数据收集,极大地扩展了基础智能体的应用范围,为通用智能体铺平了道路。(https://baai-agents.github.io/Cradle/) ![](https://zhipu-ai.feishu.cn/space/api/box/stream/download/asynccode/?code=NTc5MjgwMjZlNDkwYjQ5ZWZiYTM5MDgyNDNhOGVkNjRfR0Y2TDJPeFNkT25iOG5KWTM3SVo3NlVleHowZHNHb29fVG9rZW46TUVOcmJxaThUb3lqaEp4OVBZUmNJSlZWbmFiXzE3NTQ0NjA3MDU6MTc1NDQ2NDMwNV9WNA) #### 🌈 **工具增强推理智能体X-Master** 、**多智能体工作流系统X-Master**s [https://mp.weixin.qq.com/s/U6QKmdtgbSpdMwQNTTU97w](https://mp.weixin.qq.com/s/U6QKmdtgbSpdMwQNTTU97w) #### [Repo深度搜索的工具集成强化学习(9▲) ](https://huggingface.co/papers/2508.03012?utm_source=digest-papers&utm_medium=email&utm_campaign=2025-08-06)

Agentic-R1:7B小模型的逆袭,让LLM学会“见招拆招”

Agentic-R1探索如何提升7B参数小模型的智能体推理与动态应对能力。

 智能体 推理 强化学习 模型开发

文章介绍了Agentic-R1,重点关注7B小模型在智能体任务中的能力提升。其目标是让大语言模型能够根据环境反馈灵活调整策略,实现“见招拆招”式的动态推理。该方向体现了小参数模型在智能体决策与复杂交互场景中的潜力。

用途与启示
  • 为低成本部署具备动态决策能力的智能体提供思路
  • 关注小模型在交互式推理和策略调整任务中的应用潜力
  • 可用于研究强化学习与智能体推理能力的结合
📝 原始笔记(逐字保留)
4. 2025-07-18 14:10:01 Friday | Agentic-R1:7B小模型的逆袭,让LLM学会"见招拆招" https://mp.weixin.qq.com/s/wGOvevw9oUv6n4uZU-zaMQ
0%