HarnessEvolve

HarnessEvolve

研究方向:评测 harness 的演进——围绕 lm-evaluation-harness / SWE-bench 类工具的扩展与进化(本站已 fork 相关仓库)。

研究范畴

评测 / Agent harness 的演进,围绕 lm-evaluation-harness、SWE-bench 类工具及其扩展与进化展开。harness(含 Agent-Computer Interface、运行环境、工具与提示约定)显著影响甚至主导模型在 Agent 任务上的表现,因此其工程化与标准化日益重要。本方向涵盖:harness engineering、ACI 设计、真实运行环境构建,以及 harness 效应的度量和披露。社区关注的核心问题包括:harness 设计在多大程度上改变了模型间的相对排名、如何标准化披露 harness 配置以保证可比与可复现、环境真实度(realism)与隔离 / 安全的权衡,以及动态 / 长周期环境下的 harness 演进。

研究挑战

  • 环境搭建与维护成本高、易腐化。
  • 跨模型公平性与配置漂移。
  • 安全隔离(沙箱、权限)与真实性的张力。
  • harness 效应本身的度量难度。

自研项目

  • EvolveLLM — 博士课题《Toward True ASI》承载仓库,含 harness / agent 评测相关的方法论与综述沉淀。

相关工作

代码 / 框架

论文

博客

相关工作(按子主题自动聚合)

三层框架 1

世界模型评测 1

严谨推理 1

临床进化 1

事故复盘 1

云端智能体 1

代码仓库演化 1

代码仓库级生成 1

任务采样 1

信任域划分 1

元智能体编排 1

元编排 1

分层防护 1

协同演化 1

原生交互 1

反思早停 1

变点检测 1

在线演化 1

在线自我改进 1

失控模式 1

工程架构 1

工程框架 1

工程进化 1

开源框架 1

循环安全 1

技术生态 1

技术趋势 1

技能优化 1

技能协同演化 1

技能压缩 1

技能安全 1

技能机制 1

技能演化 7

拓扑蒸馏 1

持续适应 1

接待智能体 1

插件开发 1

插件架构 3

插件生态 1

时间序列预测 1

智能体强化学习 1

智能体框架 3

智能体生态 1

智能体规模扩展 1

智能体评测 1

架构研究综述 1

核心演化 1

根因分析 1

框架修复 1

框架拆解 1

框架演化 3

框架评测 1

概念研究综述 1

模型发布 2

漏洞训练 1

演化能力评测 1

状态交接 1

状态管理 1

状态运行时 1

环境协同演化 1

环境合成 1

环境自博弈 1

生命周期安全 1

科学仿真 1

科研工作流编排 1

科研评测基准 1

端侧框架 1

策略迭代 1

纠错治理 1

红队演化 1

经验学习 1

经验进化 1

能力迁移 1

脚手架 1

脚手架优化 3

脚手架协同演化 1

脚手架学习 1

脚手架演化 12

自动化优化 1

自动化维护 1

自博弈 1

自我投毒 1

自进化 1

自进化框架 2

自进化系统 1

自进化闭环 2

自适应防御 1

训练-推理对齐 1

记忆产品 1

记忆演化 1

评测复现 1

评测编排 1

课程生成 1

轨迹推断 1

过程评测 1

运行时契约 1

运行时干预 1

运行时授权 1

运行时防御 1

递归自我改进 1

配置供应 1

配置兼容性 1

长程任务执行 2

长程智能体 1

闭环具身智能 1

黑箱训练 1

0%