混合专家模型 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 混合专家模型 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 低资源推理 1 低资源语言推理:SFT 构建语言习惯,RL 修复行为缺陷 08-19 工具使用训练 1 Palmyra x6:基于锚定监督微调的企业级工具调用模型 08-18 开源模型 1 千问、智谱开源低价新模型,Qwen4 架构提前亮相 08-27 数据混合 1 难度感知数据策展缩小文档 VLM 成本与质量差距 09-02 模型发布 2 腾讯发布 Hy4 preview:770B 参数、1M 上下文 08-30 Kimi K3:开放前沿智能模型 08-07 模型架构创新 1 Qwen3.8-Next 架构设计:效率、能力与训练稳定性的联合优化 09-02 模型架构演进 1 DeepSeek、Llama、GLM、Qwen 底层架构演进详解 08-22 模型路由 1 英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard 08-13 状态读出 1 J64/R64:从原生 MoE 路由读出可解释推理状态 08-19 端侧推理 1 FreeToken:单卡消费级 GPU 高效运行满血 MoE 大模型 08-23 统一表征 1 UniSpace:统一视觉表示支持多模态理解、生成与编辑 08-25 缩放定律 2 SMELT:计算匹配型 MoE 循环 Transformer 的扩展规律 09-03 智谱唐杰:大模型只看参数的时代结束了 08-20 超参数迁移 1 MoE 大模型的计算高效超参数迁移 08-24