2025-06-07 科研追新
当日精选(由提交工具自动创建)。
SWE-Dev:构建具备训练与推理扩展能力的软件工程智能体
SWE-Dev 探索通过训练与推理阶段的扩展机制,提升软件工程智能体处理复杂开发任务的能力。
SWE-Dev 面向软件工程任务构建可扩展的智能体。其核心方向是在训练阶段增强智能体的软件开发能力,并在推理阶段通过增加计算或搜索提升任务表现。该思路旨在提高智能体解决复杂、长程软件工程问题的能力与可靠性。原始文本未提供具体方法、实验结果或资源链接。
用途与启示
- 为软件工程智能体的训练扩展与推理扩展提供研究思路
- 启发通过增加推理计算、搜索或迭代验证来改善复杂开发任务表现
- 可用于关注代码生成、缺陷修复及长程开发任务的智能体研究
📝 原始笔记(逐字保留)
250607|SWE-Dev:构建具备训练与推理扩展能力的软件工程智能体
SWE-Dev:通过训练与推理扩展构建软件工程智能体
SWE-Dev通过合成测试用例与扩展智能体轨迹提升开源软件工程智能体能力,7B和32B模型在SWE-bench-Verified上的成功率分别达到23.4%和36.6%。
SWE 软件工程 人工智能辅助编程 智能体 数据合成 模型训练 推理 模型评估
SWE-Dev是一个基于开源大语言模型构建的软件工程智能体,面向真实代码仓库中的自动化开发与缺陷修复任务。研究团队设计了稳健的测试用例合成流程,以缓解高质量测试数据不足并提高补丁评估的可靠性。该方法还通过扩展智能体交互轨迹构建训练数据,将训练扩展与推理扩展结合起来。在SWE-bench-Verified上,SWE-Dev的7B和32B模型成功率分别达到23.4%和36.6%,代码、模型及数据均已开源。
用途与启示
- 为开源软件工程智能体提供可复用的训练、测试合成与推理扩展方案。
- 说明高质量测试用例不仅可用于最终评估,也能作为补丁筛选和训练数据构建的重要环节。
- 展示较小参数规模模型通过数据与智能体轨迹扩展,在仓库级缺陷修复任务上取得竞争力的可能性。
📝 原始笔记(逐字保留)
250607
**标题** :SWE-Dev: Building Software Engineering Agents with Training and Inference Scaling
**链接** :https://arxiv.org/abs/2506.07636
**作者** :[Haoran Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+H), [Zhenyu Hou](https://arxiv.org/search/cs?searchtype=author&query=Hou,+Z), [Yao Wei](https://arxiv.org/search/cs?searchtype=author&query=Wei,+Y), [Jie Tang](https://arxiv.org/search/cs?searchtype=author&query=Tang,+J), [Yuxiao Dong](https://arxiv.org/search/cs?searchtype=author&query=Dong,+Y)
**摘要** :
* 大型语言模型(LLMs)已从对话式问题解决快速发展到处理涉及工具使用的现实世界任务,如软件工程(SWE)。近期基于 LLM 的工具包(如 OpenAI Codex 和 Cursor)已实现软件开发流程的端到端自动化。
* 然而,由于缺乏高质量训练数据和有效测试用例,构建高效的 SWE 智能体仍具挑战性。为此,我们提出基于开源 LLMs 构建的 SWE 智能体 SWE-Dev。首先,我们开发了稳健的测试用例合成流程用于补丁评估;其次,通过扩展智能体轨迹构建训练数据集。
* 在 SWE-bench-Verified 基准测试中,SWE-Dev 模型在所有开源 SWE 智能体中表现最优,其中 7B 和 32B 参数模型的成功率分别达到 23.4%和 36.6%,超越当前最先进的开源模型。所有代码、模型及数据集已在[此 https 链接](https://github.com/THUDM/SWE-Dev)公开。

Gherkin 场景(Gherkin Scenario) 是行为驱动开发(BDD,Behavior-Driven Development)中用于描述软件功能行为的一种结构化文本格式,通常基于 Cucumber 等测试框架实现。
#### **ExpeRepair** ——具有“双重记忆”的仓库级缺陷修复系统