2025-05-16 科研追新
当日精选(由提交工具自动创建)。
使用强化学习训练大型语言模型解释人类决策
研究利用强化学习训练大型语言模型,使其能够生成对人类决策的合理解释。
该研究探索如何通过强化学习提升大型语言模型解释人类决策的能力。训练目标不只关注决策结果,还强调生成解释的合理性与可理解性。其核心思路是将解释质量转化为奖励信号,引导模型学习更符合人类认知的决策说明。这为构建透明、可审计的人机决策辅助系统提供了新路径。
用途与启示
- 提升大型语言模型对人类行为与决策的解释能力
- 探索将解释质量纳入强化学习奖励函数的方法
- 为可解释决策支持、行为研究和人机协作提供参考
📝 原始笔记(逐字保留)
6. Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
标题: 使用强化学习训练大型语言模型以解释人类决策
链接:https://arxiv.org/abs/2505.11614
软件开发方法论概览:敏捷开发
文章梳理软件开发方法论的基本定位,并介绍敏捷开发的核心思想、适用场景与实践方式。
软件开发方法论是指导开发过程的哲学与实践框架,需要结合项目需求和团队文化进行选择。文中以敏捷开发为例,强调快速迭代、客户反馈和团队协作,以灵活应对需求变化。完整梳理计划从核心特点、适用场景和典型工具等维度比较主流方法论。
用途与启示
- 帮助团队根据项目特征选择合适的软件开发方法论
- 为理解敏捷开发及其迭代、反馈与协作机制提供基础
- 可作为自主软件开发智能体设计任务流程和协作机制的参考
📝 原始笔记(逐字保留)
250516|SWE-Dev:评估与训练自主功能驱动的软件开发
# 概念
## 软件开发方法论
> by豆包
是指导软件开发过程的哲学和实践框架,它们各有侧重,适用于不同的项目需求和团队文化。
以下是对主流方法论的系统整理,包括核心特点、适用场景和典型工具:
### **一、敏捷开发(Agile Development)**
**核心思想** :快速迭代、客户反馈、团队协作,应对需求变化。
**典型方法** :
SWE-Dev:评估与训练自主特性驱动软件开发系统
SWE-Dev 提供带可运行环境和单元测试的大规模特性驱动开发数据集,用于评估并训练在现有代码库中自主实现新功能的编码系统。
SWE 软件工程 人工智能辅助编程 智能体 模型评估 数据工程 模型训练 强化学习
SWE-Dev 聚焦在现有大型代码库中实现新功能的特性驱动开发任务,包含 14,000 个训练样本和 500 个测试样本。每个实例均提供可运行环境及开发者编写的可执行单元测试,既可支持监督微调,也能为强化学习生成明确的奖励信号。研究评估了 17 个聊天式大模型、10 个推理模型和 10 个多智能体系统,Claude 3.7 Sonnet 在困难测试集上的 Pass@3 仅为 22.45%,显示该任务仍极具挑战。利用该数据集微调后,7B 模型在困难划分上的表现可与 GPT-4o 相当,体现了高质量软件工程训练数据的价值。
用途与启示
- 为自主编码系统提供更贴近真实需求的新功能开发评测基准。
- 通过可执行单元测试统一验证功能实现,并为强化学习提供精确奖励。
- 支持研究者比较聊天模型、推理模型及多智能体系统在复杂代码库中的开发能力。
- 表明高质量、可验证的训练数据能够显著提升小参数模型的软件工程表现。
📝 原始笔记(逐字保留)
250516
**标题** :SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
**链接** :https://arxiv.org/abs/2505.16975
**作者** :[Yaxin Du](https://arxiv.org/search/cs?searchtype=author&query=Du,+Y), [Yuzhu Cai](https://arxiv.org/search/cs?searchtype=author&query=Cai,+Y), [Yifan Zhou](https://arxiv.org/search/cs?searchtype=author&query=Zhou,+Y), [Cheng Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+C), [Yu Qian](https://arxiv.org/search/cs?searchtype=author&query=Qian,+Y), [Xianghe Pang](https://arxiv.org/search/cs?searchtype=author&query=Pang,+X), [Qian Liu](https://arxiv.org/search/cs?searchtype=author&query=Liu,+Q), [Yue Hu](https://arxiv.org/search/cs?searchtype=author&query=Hu,+Y), [Siheng Chen](https://arxiv.org/search/cs?searchtype=author&query=Chen,+S)
**摘要** :
* 大型语言模型(LLMs)在各类软件工程任务中展现出强大能力,例如代码补全、错误修复和文档生成。然而针对现有大型代码库开发新功能这一高度普遍的现实任务—— **特性驱动开发(FDD)** ,目前仍缺乏深入探索。
* 为此我们推出 SWE-Dev 数据集,这是首个专为评估和训练现实世界功能开发任务中自主编码系统而设计的大规模数据集(包含 14,000 个训练样本和 500 个测试样本)。为确保可验证且多样化的训练,SWE-Dev 创新性地为所有实例提供可运行环境及开发者编写的可执行单元测试。该数据集不仅为监督微调(SFT)提供高质量数据,还能通过单元测试的执行结果生成精确奖励信号,从而支持强化学习(RL)训练。
* 我们在 SWE-Dev 上开展的广泛评估覆盖 17 个聊天机器人 LLMs、10 个推理模型和 10 个多智能体系统(MAS),结果表明 FDD 对当前 AI 技术构成严峻挑战(例如 Claude-3.7-Sonnet 在困难测试集上仅达到 22.45%的 Pass@3 通过率)。 关键的是,我们证明了 SWE-Dev 可作为模型改进的有效平台:在训练集上进行微调后,7B 模型在\textit{困难}划分上表现与 GPT-4o 相当,凸显了其高质量训练数据的价值。代码可在此处获取 \href{[this https URL](https://github.com/justLittleWhite/SWE-Dev)}{[this https URL](https://github.com/justLittleWhite/SWE-Dev)}。