模型开发 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 模型开发 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) AI辅助编程 1 昆仑万维发布软件工程智能体模型 Skywork-SWE-32B 06-20 三维生成 2 谢赛宁团队新作:无需提示词实现精准3D画面控制 12-31 昆仑万维发布 Matrix-3D:一张图生成 3D 游戏场景 12-31 三维重建 1 CVPR 2025 Award Candidate:Difix3D+ 用单步扩散模型修复 3D 重建伪影 06-23 世界模型 3 谷歌 DeepMind 发布新一代通用世界模型 Genie 3 08-05 PEVA:基于全身动作条件的第一视角视频预测世界模型 07-02 Meta 发布世界模型 IntPhys 2 06-12 中期训练 1 OctoThinker:中期训练促进强化学习规模化 06-25 人工智能工业应用 1 航空发动机大模型解决复杂时序问题,性能超越 GPT-4o 06-30 人工智能药物研发 1 Chai-2实现零样本抗体发现,AI设计药物有望进入临床 07-02 代码智能体 1 Reflection AI 发布代码理解智能体 Asimov 08-06 代码模型 6 蚂蚁集团提出代码图模型 CGM 12-31 CodeFuse-CGM-72B 代码大模型 12-31 Claude Opus 4.1 发布,SWE-bench 成绩提升至 74.5% 08-05 蚂蚁开源代码模型实现 44% 自动修 Bug 解决率 06-28 CodeFuse-CGM:面向代码智能的开源代码图模型 06-28 Kimi-Dev 开源代码模型在 SWE-bench Verified 取得开源 SOTA 06-17 元认知 1 SAGE-nano:通过逆向推理实现大模型元认知自我解释 06-30 具身基础模型 2 GigaBrain-0.7:三系统架构扩展具身基础模型 08-27 地平线与极佳提出几何一致视频世界模型,增强机器人策略学习 06-27 具身智能 1 Gemini Robotics On-Device:可直接部署于机器人的 VLA 模型 06-26 分层推理 1 HRM:无需预训练或 CoT 数据的分层推理模型 07-01 动作生成 1 北京大学提出检索增强文本动作生成框架 ReMoMask 12-31 医学影像分析 1 GPT-5医学影像推理与理解准确率超过人类专家 12-31 医疗人工智能 1 百川开源医疗推理模型 Baichuan-M2-32B,HealthBench 超越 GPT-OSS-120B 08-11 博弈评测 2 Grok 4夺得首届大模型国际象棋对抗赛冠军 08-07 谷歌首届大模型对抗赛:DeepSeek、Kimi 等模型同场博弈 08-04 同声传译 1 SeqPO-SiMT:序贯策略优化让同传性能直逼离线翻译 07-01 图像生成 2 国产统一图像生成模型 OmniGen 2.0 发布,理解与生成质量双提升 12-31 字节发布多主体可控生成模型 XVerse 07-03 图像编辑 1 Black Forest Labs 开源图像编辑模型 FLUX.1 Kontext[dev] 07-01 图像评测 1 MMMG:面向文本到图像推理的大规模多学科多层级生成基准 06-13 基础模型 2 中国移动发布九天基础大模型3.0,性能提升35% 07-26 华为发布盘古大模型 5.5 系列 06-23 增长动力 1 智能爆炸的动力学机制 08-17 多模态学习 6 原生统一多模态模型的理解-生成协同机制 09-03 智谱开源多模态模型 GLM-4.5V 12-31 GLM-4.5V:视觉多模态能力达到开源 SOTA 12-31 阶跃星辰发布多模态旗舰基座模型 Step 3 12-31 阿里发布多模态模型 Qwen-VLo 06-30 快手开源视频理解大模型 Keye-VL 06-27 多模态推理 1 智谱开源 GLM-4.1V-9B-Thinking:9B 参数模型斩获 23 项 SOTA 07-03 多跳推理 2 Rex-Thinker:基于思维链的指代物体检测模型 07-01 Auto-Patching:增强语言模型的多跳推理能力 06-04 奖励建模 3 Skywork-Reward-V2:通过人机协同扩展高质量偏好数据管理 07-02 RewardAnything:用自然语言定义通用奖励原则 06-27 大语言模型在线强化学习仅需响应级奖励:数学视角 06-04 奖励蒸馏 1 AdvDistill:通过奖励引导的数据集蒸馏增强小语言模型推理能力 07-02 嵌入模型 1 Qwen3-Embedding 系列发布,支持 119 种语言 06-06 工程模型 1 Frontis-MA1:专攻机器学习工程的全栈模型 08-12 并行推理 1 谷歌发布 IMO 金牌级模型 Gemini 2.5 Deep Think 08-01 开源模型 5 千问、智谱开源低价新模型,Qwen4 架构提前亮相 08-27 OpenAI 开源推理模型 gpt-oss-120b 与 gpt-oss-20b 08-05 百度文心大模型 4.5 系列正式开源并提供 API 服务 07-01 华为开源盘古 Embedded 7B 与盘古 Pro MoE 72B 模型 07-01 MiniMax开源MiniMax-M1模型并公开技术报告 06-17 引导生成 1 ICML 2025 Spotlight:流匹配模型的能量引导生成理论框架 06-30 强化学习 1 Magistral:Mistral 首个推理模型与可扩展强化学习管线 06-13 形式化推理 1 字节 Seed-Prover:以引理为核心的 Lean 4 数学证明模型 12-31 形式化证明 4 阶跃星辰发布并开源 StepFun-Prover 系列形式化定理证明模型 12-31 StepFun-Prover:基于环境反馈的形式化证明训练 12-31 Goedel-Prover-V2:通过分阶段数据合成与自我纠正扩展形式定理证明 08-05 Goedel-Prover-V2开源:72B模型定理证明超越DeepSeek-Prover-V2 671B 07-18 扩散模型 2 Mercury:首个扩散式 LLM,推理速度超过主流模型 7 倍 06-28 DiffuCoder:理解并改进用于代码生成的掩码扩散模型 06-25 持续适应 1 Macaron-V1:基于自我改进与 Mixture-of-LoRA 的开放持续学习 08-12 推理异常 1 GPT-oss 无提示生成问题并陷入数千次重复推理 12-31 推理模型 1 蚂蚁开源 Ling-flash-2.0 MoE 模型,小参数量实现越级推理性能 12-31 操作学习 1 BridgeVLA:基于2D热图的高效3D机器人操作学习模型 06-27 数学推理 4 MiroMind-M1:基于 Qwen-2.5 的开源数学推理模型 12-31 OpenAI与DeepMind在IMO 2025中均攻克5道题 12-31 有道开源14B「子曰3」数学模型,多项任务超越DeepSeek-R1 06-28 AceReason-Nemotron 1.1:通过 SFT 与 RL 协同提升数学和代码推理 06-18 数据归因 1 语言模型预训练中的任务无关数据影响度量 08-16 数据自演化 1 BigBang-V1:35B 模型用自演化合成数据挑战万亿参数模型 08-07 数据规模扩展 1 Skywork-SWE:揭示大模型软件工程能力的数据缩放定律 06-25 文本扩散模型 1 Cosmos:用于文本扩散建模的压缩平滑潜在空间 06-27 旗舰模型 2 GPT-5 来了:免费开放,主打简单易用 12-31 Grok 4 与 Grok 4 Code 发布:强化推理与编程能力 07-03 时间序列模型 1 清华发布首个万亿级时间点预训练生成式时序大模型「日晷」 06-23 智能体推理 1 Agentic-R1:7B小模型的逆袭,让LLM学会“见招拆招” 07-18 本地智能体 1 Meta 开源本地多模态智能体模型 Muse Glimmer 30B 08-25 机制发现 1 Mechanist:自主发现 AI 智能机制的科学智能体 08-14 架构搜索 1 ASI-ARCH 自主发现 106 种线性注意力架构 12-31 检索智能体 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-28 模型发布 19 DeepSeek-V4-Flash-Vision-Exp 多模态模型开源 09-01 腾讯发布 Hy4 preview:770B 参数、1M 上下文 08-30 智谱开源原生多模态模型 GLM-5.3 Flash 08-27 GLM-5.3-Flash 开源:低成本原生多模态前沿模型 08-26 Qwen3.8-27B开源:消费级显卡可运行“Opus级”Agent 08-16 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 GLM-5.3:后训练 Scaling 提升编程与网络安全能力 08-14 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 DeepSeek V4 Pro 正式版上线,主打 Agent 与 Coding 08-13 Kimi K3:开放前沿智能模型 08-07 AMix-1:1.7B 开源模型及配套资源发布 12-31 Qwen3-Max-Preview(Instruct)发布 09-15 OpenAI 发布 GPT-5 系列模型 08-07 OpenRouter 神秘模型 Cypher Alpha 上线 07-03 小红书开源首个多模态大模型 dots.vlm1,性能直追 SOTA 07-02 Gemini 2.5 Pro 稳定版全面可用 06-19 豆包大模型 1.6 发布 06-12 Mistral AI 发布推理模型系列 Magistral 06-12 Gemini 2.5 Pro 0605 版本发布 06-06 模型对抗 1 Grok 4晋级大模型对抗赛决赛,Gemini全军覆没 12-31 模型架构 1 GPT-5:基础模型、深度推理与实时路由一体化系统 12-31 模型架构创新 3 Qwen3.8-Next 架构设计:效率、能力与训练稳定性的联合优化 09-02 微型 Transformer 实现电路计算的完美长度泛化 09-01 Intern-S2-Mobius:知识与推理解耦的基础模型 08-17 模型架构演进 1 DeepSeek、Llama、GLM、Qwen 底层架构演进详解 08-22 模型训练 4 从生产流量到后训练:构建覆盖企业请求的自托管 LLM 09-02 Puro-2B:单卡 RTX 5090 低预算训练 2B 模型 09-01 dots.vlm1:自研 NaViT 编码器与 DeepSeek V3 组成的多模态模型 12-31 Jan-nano 技术报告:以多阶段 RLVR 训练高效 4B 搜索型语言模型 06-28 模型评测 9 GLM-5.3 实测:750B 基座靠后训练提升编码与安全能力 08-21 dots.vlm1在多项多模态任务中表现突出 12-31 实测蚂蚁万亿参数思考模型 Ring-1T:对比 DeepSeek V3.2 12-31 GPT-5 首波实测:SimpleBench 超越人类平均水平 12-31 最强 Gemini 2.5 Pro 逻辑推理评测仅得 60 分 10-23 GLM-4.5 逻辑能力评测:推理模式显著降低幻觉与计算误差 07-26 Kimi-2 上线 LiveBench AI,评测超越 GPT-4.1 07-17 SuperCLUE推理榜惊现黑马:中兴AI模型表现亮眼 07-02 OpenAI 发布 o3-pro,引入严格的“4/4 可靠性”评估 06-11 模型路由 1 英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard 08-13 模型量化评测 1 Seed-Evolving 量化策略研发与自迭代能力评测 08-14 模型验证 2 OpenAI以「通用验证器」推动GPT-5全领域能力提升 12-31 CompassVerifier:跨领域验证 LLM 输出的轻量级模型 12-31 泛化 1 GPT-5数字母任务仍翻车:CoT分布外泛化问题未解 12-31 测试时训练 1 SSI首个模型传闻:以测试时训练实现“边想边学” 08-26 深度研究智能体 1 MiroMind ODR:开放深度研究全流程项目 12-31 潜空间推理 1 BDH-CQ:基于循环潜在推理的上下文学习 08-12 物理提示学习 1 GEN-1.5让机器人看数秒演示学会新动作 08-22 生物医学人工智能 1 DeepMind 发布突破性生物模型 AlphaGenome 06-27 盲测 1 匿名模型 Ox Alpha 刷屏,代码能力逼近头部模型 08-23 神经符号人工智能 1 “神经-符号”融合规划器显著超越 o1 12-31 科研智能体 2 Intern-S2-Preview:科学智能体基础模型 08-15 AIBuildAI Science Agent:4小时自主完成顶刊级模型研发 08-13 程序修复 1 北大、字节跳动等发布 SWE-Swiss:面向代码修复的开源训练方案 12-31 端侧模型 3 Qwen发布两款4B端侧模型,支持256K上下文 12-31 谷歌开源端侧多模态模型 Gemma 3n,最低仅需 2GB 显存 06-28 Google DeepMind 发布端侧 VLA 模型 Gemini Robotics On-Device 06-26 答案验证 1 CompassVerifier:面向多领域答案评估与奖励的轻量级验证模型 12-31 结构生长 1 SoftModel:可自主生长拓扑的持续在线学习模型 08-18 统一多模态建模 1 OpenUni:1.1B 参数统一多模态模型媲美 BLIP3-o-8B 06-23 缩放定律 1 SMELT:计算匹配型 MoE 循环 Transformer 的扩展规律 09-03 能力提升 1 GPT-5 幻觉减少,空间推理与规划能力提升 12-31 自主智能体 1 月之暗面推出 Kimi-Researcher,自主 Agent 在“人类最后一场考试”取得 SOTA 06-23 自进化 1 普林斯顿 Alita 开启通用智能体自主进化新范式 06-04 自适应 1 自适应语言模型(SEAL) 06-12 蛋白质建模 2 清华AIR与上海AI实验室发布蛋白质基座模型 AMix-1 12-31 AMix-1:基于贝叶斯流网络的蛋白质基座模型新范式 12-31 表征对齐 1 何恺明改进 REPA:大幅简化方法并保持强劲性能 06-13 规则推理 1 StepFun-Prover-Preview:32B 规则推理模型 12-31 规模扩展瓶颈 1 Orion性能未达预期,三大瓶颈制约模型扩展 12-31 视觉导航 1 VLN-R1:基于第一人称视觉的连续具身导航 06-26 视觉推理 1 ViLaSR-7B:通过“边画边想”学习人类式空间推理 06-23 视觉模型 1 纯视觉范式下的通用视觉模型研究回顾与总结 07-03 视觉生成 1 GoT-R1:强化学习解锁多模态视觉生成推理新范式 06-26 视觉语言模型 1 小红书人文智能实验室开源视觉语言模型 dots.vlm1 08-06 视频到音频生成 1 Kling-Foley:为视频生成音画同步的高质量立体声 06-28 视频生成 7 MuseSteamer登顶VBench图生视频榜单 12-31 字节跳动开源轨迹可控视频生成框架 ATI 07-03 百度搜索十年来最大改版,MuseSteamer 与 AI 视频平台「绘想」上线 07-03 DraftAttention:无需训练的视频扩散模型动态稀疏注意力加速方法 06-30 向量化时间步:极低成本微调大规模预训练视频扩散模型 06-20 MiniMax 发布海螺 2.0,原生支持 1080P 06-19 稀疏蒸馏实现 H200 单卡 5 秒生成视频,去噪提速 70 倍 05-19 认知推理 1 抽象、对齐、预测:基于认知归纳推理的零样本立场检测 06-18 训练范式 1 ORBIT:时间序列基础模型的可控训练范式 08-16 训练配方 1 字节跳动 Seed 开源强化学习配方 POLARIS,4B 模型数学推理接近 235B 模型表现 07-17 评测争议 1 GPT-5 编程成绩被质疑:删去 23 道测试题,关键基准由自己提出 08-07 语音模型 1 首个全面梳理语音大模型发展脉络的权威综述入选 ACL 2025 主会 06-18 轻量化模型 3 DFM Mimir v1:仅用许可数据训练的 1B HRM 模型 08-17 谷歌开源 Gemma 3 270M 模型 12-31 Google 发布 Gemma 3 270M 超紧凑模型 08-14 轻量化模型架构 1 轻量化新模型仅采用4个注意力头 12-31 量化感知训练 1 SageAttention3:FP4 量化加速注意力并探索 8 比特训练 06-19 长期记忆 1 M+:以协同检索器扩展 MemoryLLM 的可扩展长期记忆 08-08 长视频理解 1 HoPE 混合位置编码提升视觉语言模型的长度泛化能力 06-30 音频理解 1 小米开源 MiDashengLM-7B,声音理解能力刷新 SOTA 12-31 音频生成 1 阿里通义开源首个 CoT 泛音频生成模型 ThinkSound 07-02 领域微调 1 ICML 2025 Spotlight|清华朱军组与 NVIDIA 提出 DDO,革新扩散与自回归模型训练 07-02 验证器模型 1 CompassVerifier:3B验证模型与多领域高难度基准 VerifierBench 12-31