成本优化 LLM-DailyDigest 2026-08-13 2026-08-13 约 100 字 预计阅读 1 分钟 成本优化 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 不确定性量化 1 Forking Fast:高效估计文本生成的不确定性动态 08-22 令牌消耗 1 智能体 token 用量已达人类 5.2 倍 08-26 任务采样 1 Task-CoEvolve:自适应验证任务驱动的高效 Harness 优化 08-21 元编排 1 Omnigent 开源多 Agent 元编排层 08-28 反思早停 1 EvoResearcher:免训练的推理时自我反思与成本约束早停 08-20 多模态学习 1 面向指代表达分割与视觉定位的低成本主动学习 09-01 奖励建模 1 HSRM:用于测试时验证的隐藏状态奖励模型 09-01 定价机制 1 LLM 推理服务的默认设计与 Token 定价 08-16 容量配置 1 自我精炼流水线中的非对称模型容量分配 08-24 工具使用训练 1 单策略强化学习超越树搜索的化学工具调用 09-01 开源模型 1 千问、智谱开源低价新模型,Qwen4 架构提前亮相 08-27 思维链 1 MIST:基于模型内部显著性的思维链 Token 压缩 09-01 成本感知路由 1 Pandora 路由:估值有成本时的高效 AI 模型分配 08-21 技术生态 1 OpenClaw热潮退去,Agent竞争转向Harness 08-30 技能压缩 1 SkillZip Pro:面向自进化智能体的执行感知技能动态压缩 09-01 技能选择 1 LLM 智能体技能选择的双准则最优保证 08-21 拓扑优化 1 RGA-Designer:奖励引导的多智能体通信拓扑生成 08-21 拓扑解释 1 E2-Explainer:用因果推断解析多智能体通信拓扑 08-16 持续学习 1 JitRL:免梯度实现 LLM Agent 测试时持续学习 08-22 数据混合 1 难度感知数据策展缩小文档 VLM 成本与质量差距 09-02 智能体微调 1 Agentic ESOpt:低显存微调长时程 LLM 智能体 08-20 智能体评测 1 EarlyEval:通过早期结果预测降低智能体评测成本 09-03 框架评测 1 DeepSeek + Pi:轻量 Harness 提升智能体成功率与缓存效率 08-16 检索停止 1 多轮 RAG 何时停止:Search-R1 的结构化停止判断 08-16 模型发布 1 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 模型训练 3 SFT-RL 标注预算的跨模型规模近优分配 09-02 从生产流量到后训练:构建覆盖企业请求的自托管 LLM 09-02 Puro-2B:单卡 RTX 5090 低预算训练 2B 模型 09-01 模型评测 1 增量池化 LLM 评测:低成本选择检索模型 09-03 模型路由 2 LLMRouter:统一大模型路由开发、评估与部署框架 08-15 英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard 08-13 用量增长 1 智能体Token用量升至人类的5.2倍 08-25 科研智能体 1 RPM 用研究偏好提升科研智能体算力分配效率 09-02 端侧框架 1 端侧专用 Harness:Qwen 3.8 27B 实现近零成本推理 08-30 算力分配 1 Learning When to Think:自适应分配测试时推理算力 08-21 经验学习 1 经验链:通过测试时交互持续改进 LLM 08-19 置信度调度 1 ParaTempo:基于时间置信度的高效并行推理 08-18 能力迁移 1 AI4AI 测试时强弱模型能力迁移:用 Harness 提升小模型表现 08-14 脚手架演化 3 HarnessDev:LLM 自主创建与演化 Agent Harness 09-03 JIT-Agent:按任务即时生成并演化智能体 Harness 09-02 JIT-Agent:通过即时脚手演化扩展智能体能力 08-27 自我验证 1 LLM-as-a-Verifier:自验证让 DeepSeek V4 Flash 低成本反超闭源模型 08-21 自适应停止 1 知道何时停止:LLM 评测的贝叶斯最优停止 08-17 记忆能力评测 1 编码智能体工作记忆的语义化评估 09-01 论文生成 1 Spark-to-Paper:以可组合技能端到端生成研究论文 08-14 超参数迁移 1 MoE 大模型的计算高效超参数迁移 08-24 进度感知路由 1 ProgRouter:面向质量—成本权衡的多智能体在线进度路由 08-27 配置供应 1 面向关键基础设施运维的任务感知 Harness 配置 08-19 量规评分 1 评分靠量规,而非模型智能 08-19 长期记忆 1 面向长程智能体的实时轨迹模型与观察视图 09-02 预算分配 1 轻量多模态模型估计 LLM 推理表现,实现文档推理预算优化 08-20 额度异常检测 1 Codex 额度异常查明:自动标题等三处 Bug 导致超额消耗 08-24