2025-08-01 科研追新

当日精选(由提交工具自动创建)。

谷歌发布 IMO 金牌级模型 Gemini 2.5 Deep Think

Gemini 2.5 Deep Think 通过并行思维、扩展思考时间和强化学习提升复杂数学、科学研究及算法开发能力。

 推理 模型开发 强化学习 逻辑推理 人工智能辅助编程

Gemini 2.5 Deep Think 是谷歌推出的 IMO 金牌级推理模型,面向数学、科学、编程和复杂设计任务。其核心机制是扩展并行“思考时间”,同时探索多种假设和解题路径,再从中寻找更具创造性的解决方案。DeepMind 还采用新的强化学习技术,激励模型充分利用延长后的推理轨迹。该模型尤其适合分析数学猜想、复杂科学文献,以及需要权衡正确性与时间复杂度的算法问题。

用途与启示
  • 辅助研究人员提出、验证和探索数学猜想,加速科学发现。
  • 用于复杂算法设计、代码编写及时间复杂度权衡。
  • 为迭代式产品开发和复杂系统设计提供多路径推演能力。
  • 展示并行推理、测试时计算扩展与强化学习结合的模型优化方向。
📝 原始笔记(逐字保留)
5. 谷歌拿下IMO(国际数学奥林匹克竞赛)金牌的模型——Gemini 2.5 Deep Think([谷歌IMO金牌模型可以用了!推理性能秒了o3、Grok 4](https://mp.weixin.qq.com/s/oCaTpkXcW8FibYXS1aLQ_A)) 1. Gemini 2.5 Deep Think功能具备以下优势: 1. 迭代式开发与设计:逐步构建复杂事物。 2. 科学与数学领域的发现:由于能够通过极其复杂的难题进行推理,深度思考能够成为研究人员的强大工具。它能够协助制定和探索数学猜想,或者对复杂的科学文献进行推理分析,从而有可能加快发现的过程。 3. 算法开发与代码编写:Deep Think在处理那些需要精心编写代码、对问题表述、权衡利弊以及时间复杂度进行仔细考量的难题方面表现尤为出色。 2. 核心:扩展Gemini的并行“思考时间”。 1. Deep Think通过使用并行思维技术,拓展了思维能力的边界。 2. 此外,通过延长推理时间或“思考时间”,DeepMind为Gemini提供了更多时间去探索不同的假设,并为复杂问题找到创造性的解决方案。 3. DeepMind还开发了新颖的强化学习技术,旨在激励模型利用这些扩展的推理路径。

普林斯顿王梦迪团队综述:自我进化智能体的持续学习与适应

该综述从进化对象、进化时机和进化方法三个维度,系统梳理能够通过数据、交互与经验持续适应的自我进化智能体。

 自进化 智能体 智能体记忆 智能体工具 模型评估 人工智能

大语言模型的静态参数难以适应新任务、持续更新的知识和动态交互环境,因此研究正从扩展静态模型转向构建可持续学习的自我进化智能体。该综述围绕“哪方面需要进化、何时进化、如何进化”建立分类框架,覆盖模型、记忆、工具和整体架构等组件。文章进一步区分测试内与测试间适应,并讨论标量奖励、文本反馈以及单智能体和多智能体等实现机制。综述还总结了相关评估基准及其在编程、教育和医疗领域的应用,同时指出安全性、可扩展性与协同进化动力学等挑战。

用途与启示
  • 为自我进化智能体的架构设计与方法选型提供结构化框架
  • 帮助研究者从组件、适应阶段和反馈机制三个维度梳理现有工作
  • 为编程、教育、医疗等动态场景中的持续适应系统提供研究路线
  • 提醒实际部署重点关注安全、扩展成本及多智能体协同进化问题
📝 原始笔记(逐字保留)
2. 【自我进化agent!普林斯顿王梦迪团队新综述 - 大模型知识分享 | 小红书 - 你的生活兴趣社区】 😆 UmKNhR6TrJrnV0I 😆 https://www.xiaohongshu.com/discovery/item/688c6ad300000000220224db?source=webshare&xhsshare=pc_web&xsec_token=CB2UhBnXfvzR0e27jac2hdP7wE8J9Y_4kWRrXWM3i3D5k=&xsec_source=pc_share 1. 主要内容:本质上,大语言模型(LLM)是静态的,无法根据新任务、不断发展的知识领域或动态交互环境调整其内部参数。随着 LLM 越来越多地被部署在开放式、交互式环境中,这种静态特性已成为关键瓶颈,迫切需要能够**实时适应性推理、行动和进化**的智能体(agent)。 2. 这一范式转变——从扩展静态模型转向开发自我进化 agent——引发了对能够从数据、交互和经验中实现持续学习与适应的架构和方法的日益关注。 3. 在这篇综述中首次对自我进化 agent 进行了系统、全面的回顾,围绕**“哪方面需要进化”、“何时进化”以及“如何进化”**展开。 1. 他们探讨了 agent 组件(如**模型、记忆、工具、架构**)中的进化机制,按阶段(如 intra-test-time、inter-test-time)对适应方法进行分类,并分析了指导进化适应的算法和架构设计(如标量奖励、文本反馈、单 agent 和多 agent 系统)。 2. 此外,他们分析了针对自我进化 agent 的评估指标和基准,强调了在编程、教育和医疗等领域的应用,并识别了安全、可扩展性和协同进化动力学等关键挑战和研究方向。 3. 通过提供一个结构化的框架来理解和设计自我进化 agent,本综述为在研究和实际部署中推进适应性 agent 系统提供了路线图,最终为推动实现超级人工智能(ASI),其中 agent 能够自主进化,并在广泛的任务中达到或超越人类智能水平。 #### 3. [10.8k Star!一个能够随你不断成长、进化的超级AI助手!](https://mp.weixin.qq.com/s/Ug9g8P5RlFZ_t1fsAp55_w?scene=1&click_id=43)

MetaAgent:通过工具元学习实现自我进化智能体

MetaAgent 探索通过工具元学习机制,让智能体在使用与适应工具的过程中持续提升自身能力。

 自进化 智能体 智能体工具 元学习 模型训练

MetaAgent 面向可自我进化的智能体,核心思路是将工具学习提升到元学习层面。该方法旨在让智能体从工具使用经验中提炼可迁移的学习能力,从而更快适应新的工具与任务。论文同时公开了代码仓库,便于复现并研究工具驱动的智能体能力演化。

用途与启示
  • 为构建能够持续适应新工具的智能体提供方法参考
  • 将元学习用于工具调用,有望降低智能体扩展到新任务时的适配成本
  • 可作为研究开放式自我改进与工具生态协同演化的基础
📝 原始笔记(逐字保留)
1. MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning 1. https://arxiv.org/abs/2508.00271 2. https://github.com/qhjqhj00/MetaAgent
0%