人工智能辅助编程 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 人工智能辅助编程 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) AI辅助编程 8 Super Library Agent:跨多代码库联合生成与维护应用 09-02 LLM 能否设计视频编码工具?Planar 模式案例研究 09-02 Claude Code 推出 Hooks 功能,让 AI 编程走向可控工程化 07-02 Gemini CLI 开源并免费提供 06-26 Amazon Q Developer 06-23 昆仑万维发布软件工程智能体模型 Skywork-SWE-32B 06-20 腾讯元宝推出 AI 编程模式,支持代码实时预览 06-19 ChatGPT 向普通会员开放 Codex 06-04 一致性评测 1 ConsistencyChecker:基于树结构评估大模型泛化一致性 06-18 世界模型 1 AutoWorldModel-Bench:自动化世界模型研究的状态中心基准 08-14 事故复盘 1 Claude安全降级失误,误删开发者700GB主目录 08-30 产业知识图谱 1 RSI产业图谱:围绕智能进化速度的新竞赛 08-28 产品设计 1 对话 Claude Code 之父:模型越聪明,工作流越应简化 08-26 代码世界模型 1 Code World Model:以编码代理充当世界大脑 08-28 代码仓库演化 1 Loreley:以质量多样性搜索实现仓库级程序演化 08-22 代码仓库级技能 1 SkillForge:自蒸馏智能体学习项目知识以解决仓库问题 08-20 代码仓库级生成 1 Repo0:设计驱动的零到全仓库代码生成 08-21 代码数据 1 CodeGraph 数据集 12-31 代码智能体 1 Reflection AI 发布代码理解智能体 Asimov 08-06 代码模型 7 后训练语言模型实现信息学竞赛金牌级表现 09-03 蚂蚁集团提出代码图模型 CGM 12-31 CodeFuse-CGM-72B 代码大模型 12-31 Claude Opus 4.1 发布,SWE-bench 成绩提升至 74.5% 08-05 蚂蚁开源代码模型实现 44% 自动修 Bug 解决率 06-28 CodeFuse-CGM:面向代码智能的开源代码图模型 06-28 Kimi-Dev 开源代码模型在 SWE-bench Verified 取得开源 SOTA 06-17 代码评审 1 LLM评审:面向IT自动化的无参考Bash代码验证与改进 06-16 代码评测 6 Φ-Bench:大模型基础设施工程能力评测基准 09-01 NatureBench:编程智能体能否复现论文中的 SOTA 08-12 OJBench:面向大语言模型的竞赛级代码评测基准 06-24 微软发布 SWE-bench-Live:Agent 全自动搭建代码环境并实时更新评测 06-20 LiveCodeBench Pro:奥赛级竞技编程基准揭示顶尖 LLM 的推理短板 06-19 人类最后的代码考试:高级大模型能否攻克最难编程竞赛? 06-18 元编排 1 Omnigent 开源多 Agent 元编排层 08-28 元进化 1 OpenMLE:单卡运行的 AI 自进化全栈系统 08-12 内生记忆 1 MemoraX以可学习记忆推动AI进入经验时代 08-22 创意应用 1 Anthropic 精选 6 个 Claude Code 创意项目 08-26 协同开发 1 使用 Claude 与 Replit 完成程序开发 12-31 协同测量 1 AI 编程智能体团队的协调测量 08-18 反馈起草 1 Claude Code 自动起草用户反馈报告 08-27 基准分析 1 剖析 SWE-Bench 排行榜:基于 LLM 和智能体的软件修复系统提交者与架构分析 06-23 基础设施评测 1 Φ-Bench:大模型基础设施工程能力评测 08-24 安全评测 2 用户调用方式如何影响编程智能体的仓库投毒风险 09-01 LLM 交叉赋能软件工程与软件安全:证据中心综述 08-24 工业控制代码 1 SemaPLC:项目级验证门控的 PLC 代码生成智能体框架 08-21 工程框架 1 Harness成为AI规模化落地新战场 08-23 工程模型 1 Frontis-MA1:专攻机器学习工程的全栈模型 08-12 并行推理 1 谷歌发布 IMO 金牌级模型 Gemini 2.5 Deep Think 08-01 开发评测 1 SWE-Dev:评估与训练自主特性驱动软件开发系统 05-16 开源框架 1 OpenAI开源Codex Harness智能体执行框架 08-21 开源模型 1 OpenAI 开源推理模型 gpt-oss-120b 与 gpt-oss-20b 08-05 形式化验证 2 Specula 自动形式化验证:67 个开源系统发现 382 个深层 Bug 08-27 Vero:智能体能否构建形式化验证的软件仓库 08-16 性能优化 1 ChatGPT长对话提速与Codex多智能体v2上线 08-16 执行评测 1 QuoteBench:同分掩盖的命令路径故障 08-16 扩散模型 1 DiffuCoder:理解并改进用于代码生成的掩码扩散模型 06-25 技术生态 2 OpenClaw热潮退去,Agent竞争转向Harness 08-30 AI4AI 从自进化、元进化迈向递归自我改进 08-12 技能演化 2 Socratic-SWE:基于轨迹技能的自进化编程智能体 08-14 CODESKILL:编码智能体的自进化技能学习 08-14 持久化智能体 1 OpenAI测试Codex持久化模式:跨会话续跑并自主创建任务 08-28 提示格式 1 PromptResponse:优化 LLM 编程任务提示词 08-24 插件开发 1 用 GLM 5.3 开发 DeepSeek Harness 插件 08-16 插件架构 2 DeepSeek Harness:全插件化 AI 编程 Agent 框架 08-21 DeepSeek Harness 开源:以插件化框架组装智能体 08-14 数据合成 2 SWE-Flow:以测试驱动方式合成软件工程数据 12-31 SWE-Flow:以测试驱动方式合成软件工程数据 06-09 数据混合 1 工业级 LLM 后训练:面向棕地维护的 Dataware 工程 09-01 数据科学 1 AutoMind:用于自动化数据科学的自适应知识智能体 06-13 数据规模扩展 1 Skywork-SWE:揭示大模型软件工程能力的数据缩放定律 06-25 数据集构建 1 Skywork-SWE:SWE-Dev 可验证软件开发数据集构建流程 08-06 文档交互 1 编码智能体如何发现、阅读与编写技术文档 08-21 旗舰模型 1 Grok 4 与 Grok 4 Code 发布:强化推理与编程能力 07-03 智能体 2 SWE-Dev:构建具备训练与推理扩展能力的软件工程智能体 06-07 SWE-Dev:通过训练与推理扩展构建软件工程智能体 06-07 智能体强化学习 1 Agent Lightning v1.0:面向脚手架式智能体强化学习 08-19 智能体框架 2 Harness-of-Harness:持续改进的多日自主软件开发框架 09-02 Prime Agent 开源自我改进智能体框架 08-11 智能体自进化 1 Darwin Gödel Machine:通过开放式进化实现智能体自我改进 12-31 智能体训练 1 Agent-RLVR:通过指导与环境奖励训练软件工程智能体 06-16 智能体评测 3 PTA-IRT:基于执行轨迹的高效 SWE 智能体评测 09-02 RExBench:评估 LLM 智能体实现研究扩展的能力 07-01 ALE-Bench:编程智能体跻身 NP 难题竞赛前 2% 06-18 智能运维 1 AI 运维工具 Chaterm 06-23 校园招聘面试 1 字节跳动 2027 校招重点 AI 岗位真题合集 08-26 核心演化 1 Ouroboros:可自我演化的前沿编程智能体 08-12 框架拆解 1 DeepSeek V4 Pro 与 Harness:后训练、缓存经济学及代理自进化 08-23 框架评测 1 DeepSeek + Pi:轻量 Harness 提升智能体成功率与缓存效率 08-16 桌面端应用 1 ChatGPT Linux 桌面版开放预览,集成 Work 与 Codex 08-15 模型发布 9 腾讯发布 Hy4 preview:770B 参数、1M 上下文 08-30 智谱开源原生多模态模型 GLM-5.3 Flash 08-27 GLM-5.3-Flash 开源:低成本原生多模态前沿模型 08-26 Qwen3.8-27B开源:消费级显卡可运行“Opus级”Agent 08-16 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 GLM-5.3:后训练 Scaling 提升编程与网络安全能力 08-14 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 DeepSeek V4 Pro 正式版上线,主打 Agent 与 Coding 08-13 Cursor 更新至 1.0 版本 06-05 模型评测 1 GLM-5.3 实测:750B 基座靠后训练提升编码与安全能力 08-21 模型路由 1 英伟达开源 Nemotron 3.5 Lightning 与 NeMo Switchyard 08-13 模型量化评测 1 Seed-Evolving 量化策略研发与自迭代能力评测 08-14 测试生成 1 CodeContests+:为竞技编程生成高质量测试用例 06-10 测试驱动开发 1 TDD-Agent:测试驱动的代码生成推理 08-18 游戏生成 2 VibeGame:可试玩、自反思、自进化的多智能体游戏开发框架 09-01 Spellcaster:6个Agent协作生成、试玩并修复游戏 08-18 盲测 1 匿名模型 Ox Alpha 刷屏,代码能力逼近头部模型 08-23 科学数据 1 AutoSDT:面向开放科学智能体的数据驱动发现任务合成管道 06-12 科学编程 1 SWE-bench Science:科学软件工程中的编码智能体评测 08-21 科研复现 1 自动化 LLM 速通基准:评估 NanoGPT 改进复现能力 06-30 科研实践 1 Claude Code 与 Codex 协作完成医学影像竞赛论文并获 Accept 08-24 科研智能体 1 AIBuildAI Science Agent:4小时自主完成顶刊级模型研发 08-13 科研自进化 1 Jeff Dean谈递归自我改进与Discovery Loop科研自动化 08-22 程序修复 5 WebWorld:以浏览器世界模型驱动 Web 代码自我改进 09-01 Anchored Self-Play:锚定自博弈提升代码修复真实性 08-14 北大、字节跳动等发布 SWE-Swiss:面向代码修复的开源训练方案 12-31 不靠 Agent,四步修复真实 Bug:蚂蚁 CGM 登顶 SWE-Bench 开源榜 06-28 ExpeRepair:双重记忆驱动的仓库级缺陷修复系统 06-12 程序进化 4 AlphaEvolve 将矩阵乘法指数上界降至 2.371177 09-01 AlphaEvolve:谷歌让 AI 通过代码实现自我进化 12-31 AlphaEvolve:利用大语言模型实现程序自动进化 12-31 达尔文哥德尔机:开放式进化的自我改进智能体 05-29 稳定性 1 比想象中更脆弱:工具集成型 LLM 智能体的稳定性研究 06-30 端侧模型 1 Qwen发布两款4B端侧模型,支持256K上下文 12-31 算法发现 1 AlphaEvolve:结合大语言模型与自动评估实现算法自我进化 12-31 算法设计 1 AI4AI-Bench:评测 LLM 智能体的递归自改进算法设计能力 08-21 编程工具 4 CodeFuse-CGM 开源代码仓库 12-31 Google Gemini CLI:终端中的开源 AI 智能体 12-31 Gemini Code Assist:面向 VS Code 的 AI 编程助手 12-31 字节跳动 AI 编程工具 TRAE 2.0 即将发布,新增语音交互 07-17 群体探索 1 SwarmResearch:编排 Coding Agents 实现开放式发现 08-14 脚手架 1 Opus 5借助极简Harness在ARC-AGI-3取得96.2%通关率 08-14 脚手架演化 1 AI4AI:强模型自动构建 Harness 向弱模型迁移能力 08-31 自动化维护 1 Claude自动维护应用:388个AI PR中180个获合并 08-15 自博弈 1 SSR:通过自博弈训练超智能软件智能体 08-14 自我投毒 1 EVOMAL:自进化编程智能体的自投毒攻击 08-27 自进化 1 上交大推出机器学习智能体 ML-Master,登顶 OpenAI MLE-bench 07-02 芯片设计 1 Redwood:AI 两周自动设计、验证并部署大模型加速芯片 09-01 规划差距 1 TraceML:人类与智能体的机器学习开发规划实证分析 08-27 规格迁移 1 LLM 开发代理间的规格可移植性与兼容性 08-24 视觉推理 1 Autoregressive Mosaics:探测纯文本模型的二维空间推理 09-01 训练-推理对齐 1 LEGO-RL:面向编程智能体原生 Harness 的强化学习框架 08-19 训练框架 1 面壁智能发布 AI 编写的大模型预训练框架 ForgeTrain 08-07 记忆能力评测 1 编码智能体工作记忆的语义化评估 09-01 论文格式转换 1 论文自动生成代码 06-10 证明修复 1 CAPRI:面向 Isabelle 的契约感知证明修复 08-16 评测争议 1 GPT-5 编程成绩被质疑:删去 23 道测试题,关键基准由自己提出 08-07 评测基准 2 NoCode-bench:评估自然语言驱动功能开发的新基准 12-31 剖析 SWE-Bench 排行榜:LLM 与智能体修复系统的提交者及架构画像 06-24 趋势分析 1 小宇宙《2026 AI趋势报告》:协作型AI、AI创作与办公升温 08-26 轨迹筛选 1 SWE-Prime:更少轨迹实现更强软件修复性能 08-28 软件可扩展性 1 AI让可扩展软件复活:人人都能定制自己的 App 08-28 软件工程 1 SWE-Flow:以测试驱动方式合成软件工程数据 06-12 迁移评测 1 SWE Refactor Bench:编码智能体的全仓长程栈迁移评测 08-25 过程奖励模型 1 从数学推理到代码:测试时扩展中过程奖励模型的泛化 06-04 进化算法 1 谷歌将大语言模型引入进化算法,实现代码自我迭代 12-31 递归自我改进 2 iCoder:AI 主导开发 27B 工业代码模型 09-02 Mendel Gödel Machine:比较进化驱动的编程智能体递归自改进 08-13 配置兼容性 1 Shopify CEO质疑Claude Code不兼容AGENTS.md 08-26 重构评测 1 SWE-Bench ProMax:大规模多语言代码重构智能体基准 08-12 长期记忆 1 MemoraX Code:让 Coding Agent 拥有长期记忆 08-18 问题定位 1 ToolTrain:面向代码问题定位的两阶段工具集成训练框架 12-31 额度异常检测 1 Codex 额度异常查明:自动标题等三处 Bug 导致超额消耗 08-24