HarnessEvolve
目录
HarnessEvolve
研究方向:评测 harness 的演进——围绕 lm-evaluation-harness / SWE-bench 类工具的扩展与进化(本站已 fork 相关仓库)。
研究范畴
评测 / Agent harness 的演进,围绕 lm-evaluation-harness、SWE-bench 类工具及其扩展与进化展开。harness(含 Agent-Computer Interface、运行环境、工具与提示约定)显著影响甚至主导模型在 Agent 任务上的表现,因此其工程化与标准化日益重要。本方向涵盖:harness engineering、ACI 设计、真实运行环境构建,以及 harness 效应的度量和披露。社区关注的核心问题包括:harness 设计在多大程度上改变了模型间的相对排名、如何标准化披露 harness 配置以保证可比与可复现、环境真实度(realism)与隔离 / 安全的权衡,以及动态 / 长周期环境下的 harness 演进。
研究挑战
- 环境搭建与维护成本高、易腐化。
- 跨模型公平性与配置漂移。
- 安全隔离(沙箱、权限)与真实性的张力。
- harness 效应本身的度量难度。
自研项目
- EvolveLLM — 博士课题《Toward True ASI》承载仓库,含 harness / agent 评测相关的方法论与综述沉淀。
相关工作
代码 / 框架
- lm-evaluation-harness — LM 少样本评测框架(本站已 fork)
- SWELancer-Benchmark — 前沿模型软件工程评测
- SWE-bench_Pro-os — 长周期软件工程任务
- SWE-agent — Agent-Computer Interface (ACI) 自主软件工程系统(被引 2191+)
- SWE-bench (官方仓库) — 含 Verified/Multilingual/Lite/Full 等多个变体
- Multi-SWE-bench — 8 种语言的多语言 issue-resolving 评测(2132 实例)
- Terminal-Bench — 真实终端环境 Agent 评测(89 个复杂任务)
- awesome-agent-harness (RUCAIBox) — Agent harness engineering 官方 awesome list
- awesome-harness-engineering (ai-boost) — Agent harness 综合资源列表
- Awesome-Harness-Engineering (Jiaaqiliu) — 按环境类型分类的 harness compendium
- agent-eval-harness (linny006) — 框架无关的 Agent 评测 harness
- LLM-Agent-Benchmark-List (zhangxjohn) — LLM + Agent 基准测试资源归类
- CORE-Bench — 计算可复现性 Agent 基准(270 任务)
论文
- SWE-bench Goes Live!
- SWE-agent: Agent-Computer Interfaces Enable Automated SE (NeurIPS 2024) — ACI 设计将性能提升 3 倍
- SWE-Bench++: A Framework for Scalable Generation — 可扩展多语言 SWE-bench 改进(被引 22)
- Harness-Bench: Measuring Harness Effects across Models — 诊断 harness 效应的基准
- Stop Comparing LLM Agents Without Disclosing the Harness — 呼吁标准化 harness 披露
- Coding Benchmarks Are Misaligned with Agentic SE — 编码基准与真实 Agent SE 任务的错位
- VeRO: A Harness for Agents to Optimize Agents (ICML 2026) — Agent 迭代优化 Agent 的评测 harness
- Agent Harness Engineering: A Survey — 71 页系统综述
- A Survey on Agent System and Harness Design — 更广义的 Agent 系统与 harness 设计综述
- Multi-SWE-bench (ICLR 2026) — 多语言 issue-resolving 基准(被引 143)
- SWE-bench-Live — 可动态更新的 SWE-bench 变体(被引 91)
- SWE-Bench Pro — 长周期复杂真实任务扩展(被引 166)
- SWE-Bench+ — 数据集质量分析与增强(被引 109)
- Terminal-Bench 2.0 — 真实复杂终端任务评测(被引 219)
- CORE-Bench — 计算可复现性基准(被引 112)
- Establishing Best Practices for Rigorous Agentic Benchmarks — 10 个 Agent benchmark 方法论审计
博客