人工智能框架 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 人工智能框架 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 三维生成 1 WorldClaw:智能体驱动的大规模 3D 开放世界生成 08-07 上下文进化 1 ACE:无需微调的语言模型自我进化范式 12-31 世界模型 1 让小说角色“活”起来:复旦 BookWorld 打造沉浸式小说世界模拟系统 06-25 临床协作 1 MARC v1:面向临床推理与协作的开源多智能体框架 08-16 主动学习 1 ATGen:面向自然语言生成的主动文本生成框架 07-01 交互控制 1 OS-Kairos:以置信度机制避免 GUI 智能体“过度执行” 07-03 产品更新 1 OpenAI 上线会议记录功能与 MCP 连接器 06-05 人工智能教育应用 1 超越自动化:苏格拉底式 AI 与编排式多智能体学习架构 08-07 信息检索 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-27 关系推理评测 1 RelArena-α、TabPFN-Rel 与 RPI:开放可复现的关系学习工具栈 08-19 协作合成 1 GRA:多角色小模型协作生成媲美大模型的高质量训练数据 06-18 博弈智能体 1 DipLLM:以少量数据微调大模型的外交博弈智能体框架 07-02 博弈评测 1 Board Game Arena:通过策略游戏评估大型语言模型的框架与基准 08-05 原型推理 1 ProtoReasoning:以推理原型提升大模型跨领域泛化能力 06-23 参数高效微调 1 Progtuning:基于 Transformer 语言模型的渐进式微调框架 06-27 反馈规划 1 KRCL:借鉴人类运动学习反馈的双向闭环规划机制 12-31 可信推理 1 FLARE:基于逻辑辅助搜索的可信推理与探索方法 12-31 可扩展推理 1 SLR:可扩展逻辑推理的自动化综合框架 06-23 可解释性 1 MetaExplainer:生成多类型、以用户为中心的人工智能解释框架 07-03 复合推理 1 从原子证据到逻辑组合:复合答案选项的结构化推理 08-16 多元推理 1 思想定理:面向溯因、演绎与归纳推理的多智能体框架 06-11 多智能体协作框架 2 蚂蚁集团开源多智能体协作基础设施 Avernet 08-11 昆仑万维 Skywork 发布分层多智能体协作框架 AgentOrchestra 07-17 多智能体系统 4 蚂蚁 AWorld 以多智能体系统复现 DeepMind IMO 解题成果 07-24 Xolver:基于整体经验学习的多智能体推理框架 06-19 多智能体正在“燃烧”Token:Anthropic 公开研究系统构建经验 06-14 从辩论到均衡:基于贝叶斯纳什均衡的信念驱动多智能体 LLM 推理 06-12 多模态推理 2 CoRGI:以视觉证据验证思维链的多模态推理框架 08-05 香港中文大学 MMLab 发布多模态数学推理方案 MINT-CoT 06-17 多模态训练 1 CPGD:仅用数学训练,跨学科推理超越 o1并缓解强化学习训练崩溃 06-24 多源指令 1 Agent 的多源指令机制 12-31 多维推理 1 突破思维模式:面向大语言模型的多维推理框架 06-18 多路径推理 1 华为提出思维森林:多路径推理破解大模型数学瓶颈 12-31 多跳推理 1 自动修补:增强语言模型中的多跳推理 08-15 多轮验证 1 Gemini 2.5 Pro结合多轮验证框架系统拆解IMO解题方法 12-31 学术海报 1 PosterAgent:一键将论文生成顶会级学术海报 06-04 工作流进化 1 具备自进化能力的智能体工作流系统 12-31 工具使用训练 2 ToolTrain:借助代码库检索工具提升大模型问题定位能力 12-31 MCP·RL:用强化学习训练智能体自主发现并调用工具 12-31 并行推理 2 腾讯AI Lab俞栋团队开源首个并行思考强化学习框架 Parallel-R1 12-31 Parallel-R1:通过强化学习让大模型学会并行思维 09-17 开源框架 1 OpenAI开源Codex Harness智能体执行框架 08-21 思维框架 1 姚期智领衔提出大模型“思维”框架,逻辑推理正确率达98% 09-23 技术趋势 1 持续学习赛道升温:Karpathy称仍需十年 08-11 持续适应 1 Macaron-V1:基于自我改进与 Mixture-of-LoRA 的开放持续学习 08-12 指令优化 1 教学学习范式:融合白盒与黑盒 LLM 的指令优化框架 06-30 推测解码 1 S⁴C:利用语法与语义一致性加速大模型推理 06-19 推理效率 1 PREMISE:面向大模型高效数学推理的可扩展战略提示优化 06-13 推理系统 1 Frontier:模拟下一代大语言模型推理系统 08-05 提示优化 1 RiOT:基于残差优化树的高效提示词优化 06-24 插件架构 3 DeepSeek Harness:全插件化 AI 编程 Agent 框架 08-21 DeepSeek Cordis:面向自进化 Agent 的时空可组合框架 08-15 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 插件生态 1 DeepSeek Harness 插件生态爆发:长期记忆、多智能体与小游戏齐上阵 08-15 搜索能力评测 1 Mind2Web 2:基于 Agent-as-a-Judge 的智能体搜索评估 06-27 敏捷管理 1 根据团队文化选择 Scrum 或 Kanban 12-31 数学推理 1 AI Mathematician(AIM)框架探索前沿理论研究 12-31 数学评测 1 超越黄金标准:用于形式数学推理评估的LLM法官认识论集成 06-13 数据合成 1 仅用约100道种子题,Socratic-Zero合成数据质量超GPT-5 09-23 数据科学 1 AutoMind:用于自动化数据科学的自适应知识智能体 06-13 文档问答 1 港大开源 RAG-Anything:全模态 RAG 统一理解复杂文档 06-27 文献综述生成 1 SurveyForge:自动生成高质量学术综述的创新框架 06-13 无监督训练 1 MM-UPT:基于 GRPO 的多模态大模型无监督持续自我改进框架 05-28 智能体 1 EvoAgentX:具备自我进化能力的多智能体自动化系统 12-31 智能体强化学习 1 Agent Lightning v1.0:面向脚手架式智能体强化学习 08-19 智能体框架 6 OpenClaw 2.0 发布:最大规模更新与 Agent Harness 赛道反思 09-02 OpenClaw 2.0 发布:全面升级通用 Agent 运行时 09-01 Prime Agent 开源自我改进智能体框架 08-11 腾讯 AI Lab 开源层次化智能体框架 Cognitive Kernel-Pro 12-31 首个开源多模态 Deep Research 智能体,超越多个闭源方案 12-31 Agent Zero:开源 AI 智能体框架 12-31 智能体自进化 2 EvoAgentX:支持自主进化的多智能体框架 12-31 Darwin Gödel Machine:通过开放式进化实现智能体自我改进 12-31 智能体训练 2 L0:面向通用智能体的可扩展端到端强化学习训练系统 07-01 Agent-RLVR:通过指导与环境奖励训练软件工程智能体 06-16 机器人学习 1 MuJoCo Playground:面向机器人学习与仿真到现实迁移的开源框架 06-26 框架修复 1 能力层模型:组合式智能体 Harness 修复与真实仓库压力测试 08-16 框架演化 1 AIDE²:零权重更新实现一阶递归自我改进 08-12 框架评测 1 DeepSeek + Pi:轻量 Harness 提升智能体成功率与缓存效率 08-16 概念研究综述 1 什么是 Self-evolving、Self-improving 与 RSI? 08-12 模型发布 1 DeepSeek Harness v0.1.0-rc.8 增强多模态与子代理能力 08-21 模型路由 3 LLMRouter:统一大模型路由开发、评估与部署框架 08-15 英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard 08-13 Router-R1:通过强化学习实现多轮大模型路由与聚合 06-12 模型选型 1 LensLLM:以低成本预测微调表现的LLM选型框架 06-19 泛化推理 1 General-Reasoner:面向跨领域泛化的推理框架 06-04 测试时优化 1 MEMETRON:大型语言模型测试时响应优化的元启发式机制 06-12 深度研究智能体 1 MiroMind ODR:开放深度研究全流程项目 12-31 演化能力评测 1 SEAGym:自我演化 LLM 智能体评估环境 08-07 状态管理 1 LongHorizon-Harness:以状态管理提升长程智能体执行 08-07 神经符号人工智能 1 Moose:具备推理捷径感知的 EL++ 潜在概念学习 08-16 科学发现 1 DrSR:基于数据与经验双重推理的科学方程发现框架 06-23 科学检索增强生成 1 ScIRGen:为科学研究合成真实的大规模 RAG 数据集 06-16 程序进化 1 AlphaEvolve:利用大语言模型实现程序自动进化 12-31 端侧框架 1 端侧专用 Harness:Qwen 3.8 27B 实现近零成本推理 08-30 经验学习 1 MemoHarness:从执行经验中学习的自适应智能体框架 08-07 统一框架 1 多模态统一框架的设计与规模化训练挑战 12-31 自动化科研 1 自我加速 AI 系统蓝图:开放框架、架构与认知轨迹 12-31 自博弈 1 SQLM:非对称自我博弈框架 12-31 自我反思 1 MAPS:通过自动提示与多层自我反思增强大模型多步数学推理 07-01 自进化 2 浙大开源 HugAgentOS:三引擎驱动可控自进化 08-12 Alita:可自主创造 MCP 工具的极简通用智能体 12-31 自进化框架 2 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 PenguinHarness:构建持续自我进化 Agent 的开源框架 08-07 自适应推理 1 推理混合:教大型语言模型使用自适应策略进行推理 07-01 视觉模型 2 大模型时代,通用视觉模型将何去何从? 12-31 清华鲁继文团队综述通用视觉模型研究进展 12-31 计算机控制 1 Cradle:赋能基础智能体实现通用计算机控制 07-18 认知链 1 ECCoT:通过认知链验证增强大型语言模型的有效推理 06-25 记忆蒸馏 1 Agent Memory Distillation:用分层教师记忆增强小模型智能体 08-12 评测框架 1 BenchHub:面向整体与可定制 LLM 评估的统一基准套件 06-04 谜题生成 1 GenEscape:分层多智能体生成密室逃脱谜题 06-27 资源图谱 1 LLM强化学习环境与开源训练框架资源图谱 12-31 软件工程 1 SWE-Flow:以测试驱动方式合成软件工程数据 06-12 软件开发流程 1 软件开发方法论:瀑布模型与混合实践 12-31 运行时防御 1 HARD:面向 LLM 智能体的自演化运行时防御 08-16 逻辑增强 1 FLARE:忠实的逻辑辅助推理与探索 10-16 逻辑生成 1 LAG:从笛卡尔视角出发的逻辑增强生成 12-31 长程任务执行 2 阿里开源长程智能体框架 LongHorizon-Harness 08-13 OneDayAgent:面向自主智能体的长程执行框架 08-07