推理加速 LLM-DailyDigest 2026-08-17 2026-08-17 约 100 字 预计阅读 1 分钟 推理加速 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 两阶段蒸馏 1 GEAR:表格基础模型的生成扩增与真实锚定两阶段蒸馏 08-20 前缀滑动窗口 1 Prefix Sliding:高效扩展测试时推理 08-27 动态操控 1 Reflex:面向反应关键型操作的快速预测式 VLA 模型 08-17 弱到强泛化 1 CritICL:利用小模型失败模式实现推理时弱到强泛化 08-28 推理效率 3 扩散语言模型让端侧 Agent 推理提速约 5 倍 09-02 无 LM Head 的软潜空间思考 09-01 Daedalus-150M:面向 CPU 推理的卷积-注意力混合模型 08-25 本地智能体 1 Meta 开源本地多模态智能体模型 Muse Glimmer 30B 08-25 模型发布 2 智谱开源原生多模态模型 GLM-5.3 Flash 08-27 GLM-5.3-Flash 开源:低成本原生多模态前沿模型 08-26 模型架构创新 1 Intern-S2-Mobius:知识与推理解耦的基础模型 08-17 模型架构演进 1 DeepSeek、Llama、GLM、Qwen 底层架构演进详解 08-22 稀疏加速 1 SparsePR:面向视频生成与世界模型的免训练稀疏注意力 08-25 端侧推理 1 FreeToken:单卡消费级 GPU 高效运行满血 MoE 大模型 08-23 置信度调度 1 ParaTempo:基于时间置信度的高效并行推理 08-18 记忆增强 1 记忆增强解锁高效思维链推理 08-24 递归调用 1 循环语言模型提升组合式工具调用能力 08-21 顶级学术会议成果 1 小米 8 篇大模型与智能体论文入选 EMNLP 2026 08-29 高效测试时训练 1 E²-TTT:兼顾表达力与效率的测试时训练 08-24