多模态 LLM-DailyDigest 2025-11-06 2025-11-06 约 100 字 预计阅读 0 分钟 相关消息(按子主题自动聚合) 三维生成 3 WorldClaw:智能体驱动的大规模 3D 开放世界生成 08-07 谢赛宁团队新作:无需提示词实现精准3D画面控制 12-31 昆仑万维发布 Matrix-3D:一张图生成 3D 游戏场景 12-31 三维重建 1 CVPR 2025 Award Candidate:Difix3D+ 用单步扩散模型修复 3D 重建伪影 06-23 世界模型 4 H3-World:以语言指令实现交互式世界控制 09-03 Code-as-World:智能体发现可执行世界表示以增强物理推理 09-01 谷歌 DeepMind 发布新一代通用世界模型 Genie 3 08-05 PEVA:基于全身动作条件的第一视角视频预测世界模型 07-02 中期训练 1 VLAct:以表征为中心的视觉-语言-动作模型持续预训练 09-01 交互式评测 2 OmniAssistBench:全模态助手交互评测基准 08-24 PlayWorld:智能体玩家驱动的长程世界模型评测基准 08-15 交互控制 1 OS-Kairos:以置信度机制避免 GUI 智能体“过度执行” 07-03 人工智能药物研发 1 Chai-2实现零样本抗体发现,AI设计药物有望进入临床 07-02 全模态生成 1 EchoWM:开放可进入的全模态世界模型 08-26 具身基础模型 5 Qwen-Drive-1.0:自动驾驶视觉语言基础模型 09-03 LightNav-0:激发 VLM 空间智能的通用具身导航模型 09-02 INDI:为视觉-语言-动作模型蒸馏行为意图 09-01 GigaBrain-0.7:三系统架构扩展具身基础模型 08-27 地平线与极佳提出几何一致视频世界模型,增强机器人策略学习 06-27 具身智能 1 Gemini Robotics On-Device:可直接部署于机器人的 VLA 模型 06-26 出行预测 1 多智能体主动采集与天气敏感出行需求预测 08-21 动作生成 1 北京大学提出检索增强文本动作生成框架 ReMoMask 12-31 动态操控 1 Reflex:面向反应关键型操作的快速预测式 VLA 模型 08-17 医学影像分析 1 GPT-5医学影像推理与理解准确率超过人类专家 12-31 医疗AI评测 2 MedXpertQA:专家级医学知识与高级推理评估基准 12-31 VQA-RAD医学视觉问答测试集 12-31 医疗人工智能应用 1 真·全民 AI 健康管家来了!实测蚂蚁 AQ 07-01 医疗健康数据 1 用表格扩散 Transformer 生成基准健康数据 08-17 同声传译 1 SeqPO-SiMT:序贯策略优化让同传性能直逼离线翻译 07-01 响应对齐 1 PatternEval:混合思考多模态模型的响应行为对齐 08-24 图像生成 3 GenFirst:先生成后重建的稳定端到端潜在生成建模 09-02 国产统一图像生成模型 OmniGen 2.0 发布,理解与生成质量双提升 12-31 字节发布多主体可控生成模型 XVerse 07-03 图像编辑 1 Black Forest Labs 开源图像编辑模型 FLUX.1 Kontext[dev] 07-01 图像评测 1 MMMG:面向文本到图像推理的大规模多学科多层级生成基准 06-13 图像重排序 1 EviRank:以结构化证据提升多模态图像重排序 08-25 图形用户界面探索 1 ScreenExplorer:基于好奇心机制自主探索 GUI 的视觉语言智能体 06-28 图形用户界面纠错 1 GUI-Critic-R1:为GUI智能体操作加上“紧急刹车” 06-18 基础模型 1 中国移动发布九天基础大模型3.0,性能提升35% 07-26 多样性评测 1 用多样性剖面评估 AI 生成内容 08-19 多模态学习 7 原生统一多模态模型的理解-生成协同机制 09-03 面向指代表达分割与视觉定位的低成本主动学习 09-01 智谱开源多模态模型 GLM-4.5V 12-31 GLM-4.5V:视觉多模态能力达到开源 SOTA 12-31 阶跃星辰发布多模态旗舰基座模型 Step 3 12-31 阿里发布多模态模型 Qwen-VLo 06-30 快手开源视频理解大模型 Keye-VL 06-27 多模态推理 6 OCR-MetaReasoning:文本密集图像元推理评测基准 09-01 CoRGI:以视觉证据验证思维链的多模态推理框架 08-05 智谱开源 GLM-4.1V-9B-Thinking:9B 参数模型斩获 23 项 SOTA 07-03 推理越多,幻觉越重?多模态推理模型的「幻觉悖论」 06-26 GRPO-CARE:面向多模态推理的一致性感知强化学习 06-24 香港中文大学 MMLab 发布多模态数学推理方案 MINT-CoT 06-17 多模态搜索 1 MMSearch-R1:激励大型多模态模型自主搜索 06-26 多模态训练 1 CPGD:仅用数学训练,跨学科推理超越 o1并缓解强化学习训练崩溃 06-24 多模态证明 1 MATP-BENCH:多模态大模型能否成为自动定理证明器? 07-17 多跳推理 1 Rex-Thinker:基于思维链的指代物体检测模型 07-01 多轮验证 1 Gemini 2.5 Pro结合多轮验证框架系统拆解IMO解题方法 12-31 奖励建模 1 通才奖励模型:从大型语言模型中发现内生奖励 06-29 奖励模型评测 1 Agent-RewardBench:面向现实世界多模态智能体的统一奖励建模基准 06-27 对话者建模 1 代理对代理心智理论:测试大语言模型的对话者意识 07-01 幻觉检测 1 SHROOM-Visions 2026:大视觉语言模型幻觉检测共享任务 08-27 开放式推理 1 PuzzleWorld:面向益智寻谜的多模态开放式推理基准 06-10 开源模型 1 千问、智谱开源低价新模型,Qwen4 架构提前亮相 08-27 引导生成 1 ICML 2025 Spotlight:流匹配模型的能量引导生成理论框架 06-30 强化学习 1 Magistral:Mistral 首个推理模型与可扩展强化学习管线 06-13 强化学习后训练 1 OraRL:将标注作为视频 MLLM 的神谕轨迹 08-27 形式化证明 2 MATT-BENCH:多模态大模型能否成为优秀的自动定理证明器? 12-31 MATP-BENCH:多模态大模型自动定理证明正确率仅约4% 06-18 心智理论 1 SoMi-ToM:评估具身社会互动中的多视角心智理论 06-29 拒答评测 1 TRAPSBench:视觉语言模型能识别不确定性,却不会克制回答 08-16 持续后训练 1 VDA:面向多模态无监督持续后训练的视觉依赖框架 08-27 持续推理 1 Continual Reasoning Gym:持续 RLVR 中的共享推理与提示回放 08-20 推理优化 1 NoWait:移除“等待”等思考标记可提升推理效率 06-12 推理评测 1 MMReason:面向 AGI 的开放式多模态多步骤推理基准 07-01 插件架构 1 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 操作学习 1 BridgeVLA:基于2D热图的高效3D机器人操作学习模型 06-27 数据合成 2 RailGen:智能体引导的铁路小型异物生成与检测 09-01 Code2Logic:游戏代码驱动的多模态推理数据合成 09-23 数据开放 1 EgoSuite-Open100K:10万小时人类行为数据开源 08-25 数据混合 1 难度感知数据策展缩小文档 VLM 成本与质量差距 09-02 数据课程 1 面向通用图像生成的能力中心化数据设计 08-19 文档解析 1 EasyDoc:一句 Prompt 生成 Python 文档解析调用代码 12-31 文档问答 1 港大开源 RAG-Anything:全模态 RAG 统一理解复杂文档 06-27 无监督训练 1 MM-UPT:基于 GRPO 的多模态大模型无监督持续自我改进框架 05-28 时序感知 1 StreamPI:让单帧 VLA 模型具备流式时序推理能力 08-28 智能体框架 1 首个开源多模态 Deep Research 智能体,超越多个闭源方案 12-31 智能体网络 1 Agentic Web:由 AI 智能体驱动的下一代互联网生态 12-31 智能体自进化 1 UI-Genie:面向移动端 GUI 智能体的自改进框架 05-28 智能体评测 7 DroneCATS:评估多模态 LLM 的通用无人机控制能力 09-03 MNIST-PRO:面向部分可观测智能体的感知状态评测 09-01 BrowseComp-VL:面向跨模态研究任务的视觉语言评测基准 12-31 AI Agent 评测的四大演进趋势 12-31 ScienceBoard:面向真实科学工作流的多模态智能体评测环境 06-27 基于LLM的人工智能代理评估的进化视角:全面综述 06-16 EconWebArena:现实 Web 环境中的经济任务自治智能体评测基准 06-12 智能眼镜 1 从观察到行动:智能眼镜迈向第一人称智能平台 08-27 本地智能体 1 Meta 开源本地多模态智能体模型 Muse Glimmer 30B 08-25 模型发布 9 UI-Venus-2:跨移动端、Web 与桌面的通用 GUI 智能体 09-03 DeepSeek-V4-Flash-Vision-Exp 多模态模型开源 09-01 智谱开源原生多模态模型 GLM-5.3 Flash 08-27 GLM-5.3-Flash 开源:低成本原生多模态前沿模型 08-26 DeepSeek Harness v0.1.0-rc.8 增强多模态与子代理能力 08-21 Qwen3.8-27B开源:消费级显卡可运行“Opus级”Agent 08-16 Kimi K3:开放前沿智能模型 08-07 OpenAI 发布 GPT-5 系列模型 08-07 小红书开源首个多模态大模型 dots.vlm1,性能直追 SOTA 07-02 模型微调 1 MokA:面向多模态大模型的低秩适配微调新范式 06-30 模型训练 1 dots.vlm1:自研 NaViT 编码器与 DeepSeek V3 组成的多模态模型 12-31 模型评测 1 dots.vlm1在多项多模态任务中表现突出 12-31 泛化机制 1 同策略蒸馏泛化的双重效应:行为迁移与能力跷跷板 08-18 测试时对齐 1 ReFrame:证据引导的多模态模型测试时安全对齐 08-24 深度研究智能体 1 WebWatcher:面向高难度多模态深度研究的智能体方案 12-31 游戏推理 2 ViGaL:仅通过游戏强化学习提升多模态推理能力 06-25 ViGaL:用街机游戏训练多模态模型的跨领域推理能力 06-18 游戏生成 1 ViGaL:以游戏化合成任务培养通用多模态推理能力 12-31 潜在表征 1 Scaffolding Minds:优化多模态推理的潜在视觉目标表征 08-21 物理仿真 1 Genesis:面向具身 AI 的生成式物理引擎 12-31 盲测 1 匿名模型 Ox Alpha 刷屏,代码能力逼近头部模型 08-23 研究方向 1 无需外部数据!AI自问自答实现推理能力进化 12-31 科研平台 1 深势科技发布玻尔·科学空间,AI接管科研全流程 08-22 科研智能体 2 OmniScientist:全模态跨学科 AI 科学家 08-16 Intern-S2-Preview:科学智能体基础模型 08-15 科研评测 3 ScienceArena:最新科学奥赛大模型评测基准 09-01 SciArena:面向科学文献任务的开放式基础模型评估平台 07-02 科学家的第一次考试:通过感知、理解与推理评测多模态大模型的科学认知能力 06-13 空间推理 1 密室逃脱成 AI 新考场:通关率不足 50%,暴露空间推理短板 07-17 空间认知 1 MindCube:从有限视图构建空间心智模型 06-27 空间记忆 1 Spatial Memory Agent:基于经验程序记忆的空间智能 08-15 端侧模型 2 谷歌开源端侧多模态模型 Gemma 3n,最低仅需 2GB 显存 06-28 Google DeepMind 发布端侧 VLA 模型 Gemini Robotics On-Device 06-26 端侧记忆 1 MobileMem:从一年移动端经历中学习长期记忆 08-17 算法比较 1 DPO 与 GRPO 在自回归图像生成中的系统性对比 06-20 统一多模态建模 1 OpenUni:1.1B 参数统一多模态模型媲美 BLIP3-o-8B 06-23 统一框架 1 多模态统一框架的设计与规模化训练挑战 12-31 统一表征 1 UniSpace:统一视觉表示支持多模态理解、生成与编辑 08-25 肌电数据采集 1 OriginFlow以神经肌电构建具身智能Human Tokens 08-23 脚手架优化 1 AutoDesign:面向长程智能体设计的元脚手架优化 08-15 自动化评测 1 文本、视觉和语音生成自动评估方法综述 06-13 自演化数据合成 1 VISA:面向多模态指令遵循的智能体自演化数据合成 08-27 行业动态 1 苹果公布全产品线 AI 融合计划 06-10 表征对齐 1 何恺明改进 REPA:大幅简化方法并保持强劲性能 06-13 规则规划 1 RuleMaze:多模态模型的规则约束视觉空间规划 08-21 视觉导航 1 VLN-R1:基于第一人称视觉的连续具身导航 06-26 视觉推理 7 TempCloze:Video-LLM 能否识别视频缺失的中间片段? 09-02 LOCI:定位器-批评器视觉证据迭代框架 09-01 VBVR-Pro:可扩展、可验证的原生视觉推理套件 08-27 ViLaSR-7B:通过“边画边想”学习人类式空间推理 06-23 CaughtCheating:多模态大模型能否成为优秀的作弊侦探? 06-23 SynthRL:以可验证数据合成扩展视觉推理 06-04 SynthRL:通过可验证的数据合成扩展视觉推理 06-03 视觉模型 3 大模型时代,通用视觉模型将何去何从? 12-31 清华鲁继文团队综述通用视觉模型研究进展 12-31 纯视觉范式下的通用视觉模型研究回顾与总结 07-03 视觉生成 2 清华、字节提出 PAROAttention:Token 重排实现 5 倍稀疏与 4 比特量化 07-01 GoT-R1:强化学习解锁多模态视觉生成推理新范式 06-26 视觉脚手架 1 渐进式视觉脚手如何提升 VLM 空间推理 08-24 视觉语言模型 1 小红书人文智能实验室开源视觉语言模型 dots.vlm1 08-06 视觉通才模型 1 视觉通用模型综述(Vision Generalist Model: A Survey) 12-31 视频到音频生成 1 Kling-Foley:为视频生成音画同步的高质量立体声 06-28 视频数据 2 多机构联合推出持续迭代的视频数据集项目 Sekai 12-31 浙大开源UltraVideo超高清视频数据集,推动原生4K视频生成 07-02 视频理解 1 微软推出长视频探索智能体 Deep Video Discovery 07-01 视频生成 11 DreamX-Creator:普惠化原生 2K 音视频联合生成 09-02 MuseSteamer登顶VBench图生视频榜单 12-31 HeyGen:AI 数字人视频生成工具 12-31 Topview:一键生成数字人带货视频 12-31 字节跳动开源轨迹可控视频生成框架 ATI 07-03 百度搜索十年来最大改版,MuseSteamer 与 AI 视频平台「绘想」上线 07-03 HeyGen:一键生成多语言数字人视频 07-03 DraftAttention:无需训练的视频扩散模型动态稀疏注意力加速方法 06-30 向量化时间步:极低成本微调大规模预训练视频扩散模型 06-20 MiniMax 发布海螺 2.0,原生支持 1080P 06-19 稀疏蒸馏实现 H200 单卡 5 秒生成视频,去噪提速 70 倍 05-19 视频评测 1 Video-IFBench:评估视频理解中的指令遵循能力 08-28 计算机控制 1 Cradle:赋能基础智能体实现通用计算机控制 07-18 训练系统 1 Rollplex:VLM 后训练的跨阶段 GPU 空间共享 08-17 证据仲裁 1 文本与数字冲突时:大模型的证据仲裁 08-21 评测基准 1 LLM 评测基准综述与多模态推理新基准 10-23 语义表征 1 AI 语言表征中虚假与不可能性方向不同 08-16 语音-文本冲突 1 文本误导下的音频扎根对话推理 08-28 语音模型 1 首个全面梳理语音大模型发展脉络的权威综述入选 ACL 2025 主会 06-18 谜题生成 1 GenEscape:分层多智能体生成密室逃脱谜题 06-27 资源图谱 1 LLM强化学习环境与开源训练框架资源图谱 12-31 跨模态一致性 1 语音与文本输入下多模态模型的跨模态不稳定性 08-28 跨模态对齐 1 LIFT:冻结LLM文本编码器,准确率超CLIP 11% 07-03 过程评测 1 从原子能力到智能体:可解释评测 LLM 数学智能体能力 08-29 长期记忆 1 EgoMonth:月级第一视角视频长期时空记忆基准 08-16 长程任务执行 1 OneDayAgent:面向自主智能体的长程执行框架 08-07 长视频理解 1 HoPE 混合位置编码提升视觉语言模型的长度泛化能力 06-30 音频理解 1 小米开源 MiDashengLM-7B,声音理解能力刷新 SOTA 12-31 音频生成 1 阿里通义开源首个 CoT 泛音频生成模型 ThinkSound 07-02 预算分配 1 轻量多模态模型估计 LLM 推理表现,实现文档推理预算优化 08-20 领域微调 1 ICML 2025 Spotlight|清华朱军组与 NVIDIA 提出 DDO,革新扩散与自回归模型训练 07-02 领域研究综述 1 基础模型时代的人本智能综述 08-24 风格评测 1 风格还是签名?艺术家隔离的绘画风格分类评测 08-17