EvalEvolve

EvalEvolve

研究方向:进化式评测——随能力增长持续演化、抗污染的评测基准与方法。

研究范畴

进化式评测(evolutionary / dynamic evaluation)针对静态基准易被污染、快速过时的问题,主张让基准与方法随模型能力增长持续演化、抗污染。本方向涵盖:持续更新的 live benchmarks、动态 / 等价变体评测、自动出题(auto-benchmaking)、抗污染机制,以及自进化基准框架。社区关注的核心问题包括:如何持续、低成本地产生高质量新题并标定难度、如何抵抗训练数据污染与基准泄漏、动态评测如何与真实世界能力对齐避免指标漂移,以及多模态 / Agent / 长周期任务的评测有效性。

研究挑战

  • 题目质量、ground truth 获取与难度一致性。
  • 防泄漏与可复现性的张力。
  • 评测本身的成本与算力。
  • 与快速迭代模型保持同步的运维负担。

自研项目

  • CLUB-benchmark (LogicEvolve) — 复杂逻辑推理的智能体评测平台,提供准确率 / cell 级准确率 / 一致性 / 推理路径追踪等多维指标,含可视化榜单(clubweb.site)与 4600+ 评测结果 JSONL。
  • EvolveLLM — 博士课题《Toward True ASI》承载仓库,含评测相关的方法论与综述沉淀。

相关工作

代码 / 框架

论文

相关工作(按子主题自动聚合)

世界模型 1

世界模型评测 1

交互式评测 1

交互成本 1

代码评测 1

信用审计 1

修辞敏感性 1

分层验证 1

判断校准 1

动态审查 1

医疗AI评测 1

协同演化 1

历史回测 1

发现能力评测 1

叙事一致性 1

可靠性认证 1

合规性评测 1

响应对齐 1

基准优化 1

增量评测 1

安全审计 1

实验审计 1

幻觉检测 1

形式化验证 1

思维链审计 1

截尾偏差 1

执行评测 1

技能演化 1

指标演化 1

探针效度 1

搜索能力评测 1

故障诊断 1

效度审计 1

智能体安全 1

智能体评测 6

根因评测 1

框架演化 2

概率对齐 1

模型可靠性 1

测试扩展 1

演化能力评测 4

灾害评测 1

物理适应 1

状态追踪 1

真实世界评测 1

科研评测 3

科研评测基准 1

答案选择 1

答案验证 1

算法设计 1

脚手架 1

自进化框架 1

自进化闭环 2

自适应停止 1

航空评测 1

评测基准构建 1

评测审计 3

评测意识 1

评测编排 1

谜题评测 1

跨模态一致性 1

迁移评测 1

过程评测 2

重构评测 1

错误共识 1

长程任务评测 1

风险评估 1

鲁棒性测试 1

0%