测试时计算 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 测试时计算 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 世界模型 1 面向网页智能体的判别式世界模型 09-03 代码模型 1 后训练语言模型实现信息学竞赛金牌级表现 09-03 前缀滑动窗口 1 Prefix Sliding:高效扩展测试时推理 08-27 反思早停 1 EvoResearcher:免训练的推理时自我反思与成本约束早停 08-20 失败归因 1 超越 LLM 推理:轻量 GNN 实现智能体失败归因 08-20 强化学习 1 言语强化学习的兴起:自然语言反馈统一框架 09-02 循环推理 1 Recirculation:基础模型的推理时再循环 08-19 循环深度 1 循环模型为何越想越错:隐空间推理的深度困境 08-16 循环稳定性 1 循环模型为何越想越错:递归深度与训练稳定性 08-17 持续学习 1 JitRL:免梯度实现 LLM Agent 测试时持续学习 08-22 推理扩展 1 五年前的“开放式推理”设想预见 OpenAI o1、o3 路线 08-15 推理效率 1 无 LM Head 的软潜空间思考 09-01 数字孪生 1 Twin:测试时数字孪生破解未知游戏 08-17 测试扩展 1 真实开放任务中的测试时扩展:瓶颈在利用而非探索 08-20 测试时优化 1 TTPO:测试时策略优化 08-28 测试时对齐 1 ReFrame:证据引导的多模态模型测试时安全对齐 08-24 测试时训练 1 SSI首个模型传闻:以测试时训练实现“边想边学” 08-26 状态读出 1 J64/R64:从原生 MoE 路由读出可解释推理状态 08-19 算力分配 1 Learning When to Think:自适应分配测试时推理算力 08-21 经验学习 1 经验链:通过测试时交互持续改进 LLM 08-19 置信度调度 1 ParaTempo:基于时间置信度的高效并行推理 08-18 能力迁移 1 AI4AI 测试时强弱模型能力迁移:用 Harness 提升小模型表现 08-14 自我验证 1 LLM-as-a-Verifier:自验证让 DeepSeek V4 Flash 低成本反超闭源模型 08-21 自适应防御 1 自进化多智能体框架防御 LLM 越狱攻击 08-27 课程发布 1 斯坦福 CS329A:自改进 AI Agent 课程公开 08-26 课程学习研究综述 1 斯坦福新课 CS329A:Self-Improving AI Agents 08-21 连续推理 1 扩散课程训练实现无时间步迭代推理 09-02 采样控制 1 嵌套序贯蒙特卡洛控制离散扩散生成 08-21 采样校准 1 正确概率更高,答案反而更差:Power Sampling 的失效与修复 08-17 高效测试时训练 1 E²-TTT:兼顾表达力与效率的测试时训练 08-24