2025-07-18 科研追新
当日精选(由提交工具自动创建)。
OpenAI 通用智能体 ChatGPT Agent 正式发布
OpenAI 正式推出 ChatGPT Agent,使 ChatGPT 能够调用工具并自主执行多步骤任务。
OpenAI 发布通用智能体 ChatGPT Agent,将信息检索、推理和工具操作整合到统一系统中。它可以围绕用户目标规划并执行多步骤任务,而不再局限于生成文本或提供建议。该产品体现了 ChatGPT 从对话助手向可实际操作数字环境的智能体演进。
- 用于自动完成信息搜集、分析整理及跨工具操作等复杂任务
- 展示通用智能体产品化与大规模落地的新进展
- 为智能体的任务规划、工具调用和安全权限设计提供参考
📝 原始笔记(逐字保留)
实测9款AI:Agent究竟如何改变PPT制作?
文章实测9款AI工具,考察所谓Agent在PPT生成与制作中的实际效果。
文章围绕AI Agent制作PPT的能力展开横向实测,共涉及9款AI产品。评测重点关注这些工具能否将用户需求转化为结构合理、内容可用且视觉效果合格的演示文稿。文章通过实际生成结果审视“Agent”概念在PPT场景中的落地表现,并揭示宣传定位与真实产出之间可能存在的差距。
- 为选择AI PPT工具提供横向评测参考
- 帮助判断Agent在内容组织、版式生成和任务执行方面的实际能力
- 提醒用户关注生成结果的可编辑性、准确性与人工修订成本
📝 原始笔记(逐字保留)
真相大白!RL不是魔法,随机奖励有效只是由于数据泄露
文章指出强化学习中随机奖励看似有效的现象可能源于数据泄露,而非算法真正获得了可泛化的学习能力。
文章质疑“随机奖励也能提升模型表现”这一反常结论,并认为其背后并非强化学习的神奇能力。相关实验结果可能受到训练数据与评测信息泄露的影响,使模型获得了隐性的正确答案信号。该观点提醒研究者重新审视奖励设计、数据隔离和实验对照,避免将评测污染误判为算法进步。
- 强调强化学习实验中训练集、验证集和测试集的严格隔离
- 提醒研究者排查奖励信号中的隐性信息与数据泄露
- 为评估随机奖励等反常实验结果提供更审慎的解释框架
📝 原始笔记(逐字保留)
两篇 ICLR 论文破解强化学习的两个关键难题
文章介绍两篇 ICLR 论文针对强化学习中的两个关键痛点提出的解决方案及其研究价值。
文章聚焦强化学习研究与训练中的两个关键难题,并解读两篇 ICLR 论文给出的解决思路。相关工作旨在改善强化学习方法的训练效果或稳定性,为突破现有技术瓶颈提供新路径。由于原始条目仅包含标题和链接,具体问题定义、算法设计与实验结论需参阅原文。
- 了解强化学习训练中的典型瓶颈及最新解决思路
- 跟踪 ICLR 相关研究进展,辅助筛选值得精读的论文
- 为强化学习算法设计与训练优化提供研究线索
📝 原始笔记(逐字保留)
Goedel-Prover-V2开源:72B模型定理证明超越DeepSeek-Prover-V2 671B
普林斯顿大学联合多所高校与企业推出开源数学定理证明模型Goedel-Prover-V2,其72B版本在相关基准上超越DeepSeek-Prover-V2 671B并取得SOTA表现。
普林斯顿大学牵头,联合清华大学、北京大学、上海交通大学、斯坦福大学,以及英伟达、亚马逊和Meta FAIR等机构推出Goedel-Prover-V2。该模型面向形式化数学与自动定理证明,并以开源方式发布。据原文介绍,其72B版本在定理证明任务上超过DeepSeek-Prover-V2的671B版本,实现SOTA表现。该成果显示,针对数学证明场景进行专门训练,有望以更小参数规模获得更强的形式化推理能力。
- 用于形式化数学、自动定理证明及证明辅助系统研究
- 为比较模型规模与专门化训练对推理能力的影响提供案例
- 可作为数学推理智能体、证明搜索与验证工具的基础模型
- 展示小规模专用模型超越超大通用模型的潜力
📝 原始笔记(逐字保留)
清华大学与智谱联合培养博士后招聘启事
清华大学与智谱发布联合培养博士后招聘启事,面向相关研究方向招募科研人才。
清华大学与智谱发布联合培养博士后招聘启事。该项目依托高校与人工智能企业的协同培养机制,为博士后研究人员提供产学研结合的科研环境。具体研究方向、申请条件及招聘流程以原文公告为准。
- 为有意从事人工智能研究的博士毕业生提供博士后岗位信息
- 展示高校与企业联合培养高层次科研人才的合作模式
- 可通过原文了解研究方向、申请要求及联系方式
📝 原始笔记(逐字保留)
Chain-of-Action:通过轨迹自回归实现动作推理的模仿学习新范式
Chain-of-Action 提出一种模仿学习新范式,通过自回归建模动作轨迹来增强智能体的动作推理与决策能力。
Chain-of-Action 将动作轨迹视为可自回归生成的序列,使智能体能够基于历史状态和动作逐步推导后续行为。该方法把轨迹建模与动作推理结合,为传统模仿学习提供了新的训练思路。其核心价值在于显式利用动作之间的时序依赖,从而支持更连贯的规划与决策。该范式可用于具身智能、机器人控制及其他需要长程动作生成的智能体任务。
- 为模仿学习引入类似序列生成的动作轨迹建模方式。
- 启发智能体通过显式动作链提升长程规划和决策连贯性。
- 可作为具身智能与机器人策略训练的新研究方向。
📝 原始笔记(逐字保留)
ACL 2025 Oral:Evaluation Agent,懂模型的智能评测搭子
ACL 2025 Oral 工作 Evaluation Agent 探索利用智能体辅助模型评测,让评估过程更贴合模型与用户需求。
该消息介绍了一项入选 ACL 2025 Oral 的 Evaluation Agent 工作。其核心方向是将智能体引入 AI 模型评测,使评测流程能够更好地理解模型表现与用户需求。原文发布于微信公众号,当前摘录未提供论文、代码或数据集地址。
- 为大模型建立更自动化、智能化的评测流程
- 探索评测智能体在模型分析和效果反馈中的应用
- 为面向真实用户需求的动态评估提供研究思路
📝 原始笔记(逐字保留)
Cradle:赋能基础智能体实现通用计算机控制
Cradle 通过截图输入和键鼠输出的统一接口,使基础智能体无需内置 API 即可操作游戏与日常软件并执行长时序复杂任务。
智能体 多模态 人工智能框架 任务规划 人工智能应用 模型评估
论文提出通用计算机控制(GCC)设定,以屏幕截图作为智能体输入,并以键盘和鼠标操作作为统一输出,从而消除不同软件封装及手工观察、动作空间带来的差异。Cradle 是一个模块化的大模型智能体框架,可理解截图、执行高层规划,并生成可运行的低级键鼠控制代码,无需依赖软件内置 API。实验覆盖四款商业游戏、五款软件应用和 OSWorld 基准,展示了较强的跨环境泛化能力。系统还在《荒野大镖客 2》中完成了约 40 分钟的真实任务,并可操作 Chrome、Outlook、飞书、美图秀秀和剪映等软件。
- 为跨软件、跨游戏的通用智能体提供统一且贴近真实用户的交互接口。
- 支持将任意软件转化为智能体能力评估与数据收集环境。
- 展示截图理解、长程规划和低级动作执行相结合的通用计算机控制路线。
- 为不依赖专用 API 的桌面自动化和复杂软件操作提供框架参考。
📝 原始笔记(逐字保留)
Agentic-R1:7B小模型的逆袭,让LLM学会“见招拆招”
Agentic-R1探索如何提升7B参数小模型的智能体推理与动态应对能力。
文章介绍了Agentic-R1,重点关注7B小模型在智能体任务中的能力提升。其目标是让大语言模型能够根据环境反馈灵活调整策略,实现“见招拆招”式的动态推理。该方向体现了小参数模型在智能体决策与复杂交互场景中的潜力。
- 为低成本部署具备动态决策能力的智能体提供思路
- 关注小模型在交互式推理和策略调整任务中的应用潜力
- 可用于研究强化学习与智能体推理能力的结合