2025-05-28 科研追新
当日精选(由提交工具自动创建)。
MM-UPT:基于 GRPO 的多模态大模型无监督持续自我改进框架
上海交通大学等机构提出 MM-UPT,通过 GRPO 在完全无监督条件下持续提升多模态大模型的图文数学推理能力。
MM-UPT(Multi-Modal Unsupervised Post-Training)是一种面向多模态大模型的无监督后训练框架。该方法利用 GRPO 强化学习,在不依赖人工标注数据的情况下推动模型持续自我改进。研究团队在多个图文数学推理基准上进行了实验,验证了该框架的有效性。该工作为降低多模态模型迭代中的数据标注成本提供了新路径。
用途与启示
- 探索无需人工标注的多模态模型持续优化方案
- 将 GRPO 强化学习扩展到图文联合推理场景
- 为低成本构建可自我进化的多模态推理系统提供参考
📝 原始笔记(逐字保留)
4. **上海交通大学等机构提出的多模态大模型的持续自我改进框架「MM-UPT」**:在完全无监督场景下,通过强化学习框架 GRPO 实现多模态大模型的持续自我改进。他们提出了一种简洁而高效的框架:MM-UPT(Multi-Modal Unsupervised Post-Training),并在多个图文数学推理 benchmarks 上验证了其有效性。
论文标题:Unsupervised Post-Training for Multi-Modal LLM Reasoning via GRPO
论文链接:https://arxiv.org/abs/2505.22453
项目代码:https://github.com/waltonfuture/MM-UPT
UI-Genie:面向移动端 GUI 智能体的自改进框架
香港中文大学联合 vivo 等机构提出 UI-Genie,通过奖励模型与迭代式自改进流水线协同提升移动端 GUI 智能体,并自动合成高质量训练轨迹。
UI-Genie 针对移动端 GUI 智能体难以验证轨迹结果、难以规模化获取高质量训练数据的问题,提出奖励模型 UI-Genie-RM 和自改进流水线。UI-Genie-RM 采用图文交错架构处理历史上下文,并统一动作级与任务级奖励。系统通过迭代式轨迹合成减少对人工标注的依赖,再利用自改进循环共同演进智能体和奖励模型。该流程能够在无需人工干预的情况下持续生成高质量数据,并迭代增强智能体能力。
用途与启示
- 为 GUI 智能体提供兼顾动作过程与任务结果的自动化评估机制
- 通过迭代合成轨迹降低高质量训练数据对人工标注的依赖
- 展示智能体、奖励模型与训练数据协同进化的闭环范式
- 可用于构建能够持续学习和优化的移动端自动操作智能体
📝 原始笔记(逐字保留)
5. **香港中文大学联合 vivo 等机构的自改进框架「UI-Genie」**:旨在解决 GUI 智能体中的两大核心挑战:一是轨迹结果的验证十分困难,二是高质量训练数据的规模化获取不易。针对这两个挑战,研究团队分别提出了一种奖励模型和一个自改进流水线。
论文标题:UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
论文链接:https://arxiv.org/abs/2505.21496
项目地址:https://github.com/Euphoria16/UI-Genie

**该奖励模型,即 UI-Genie-RM,采用了一种图文交错的架构,能够高效处理历史上下文信息,并统一了动作级别和任务级别的奖励:**
* 通过迭代式合成轨迹生成,消除人工标注
* 通过自改进循环,共同演进智能体和奖励模型
* 无需人工干预即可生成高质量数据集
