Skip to main content
本节说明 AgentCompass Benchmark 集成的职责边界、工作流程和完成标准。 Benchmark 集成定义的是一套可复现的评测契约,而不只是数据集加载器。它负责任务标识、准备、评分和聚合,也要提供用于比较 AgentCompass 运行结果与官方结果的证据。 开始修改前,应根据一手资料整理上游契约,包括官方代码仓库、数据集版本、论文、技术报告、评测器、任务镜像和排行榜产物。对于可能变化的上游依赖,必须固定版本。

集成边界

应把上游 Harness 标记为推荐的对齐配置,但不能只因其他 Harness 的 ID 不同就判定它不兼容。兼容性应由准备后的任务格式、Model 协议和 Environment 能力决定。

集成工作流

  1. 实现 Benchmark 契约,先确定由谁执行,再选择评测模式和聚合方式,然后进入对应子页。
  2. 更新公开文档,提供可运行命令和 Benchmark 负责的参数。
  3. 验证并完成对齐,从针对性检查扩展到完整官方数据划分比较。

完成标准

满足所有适用条件后再请求审查:
  • 明确记录官方任务、评测器、Model 和 Harness 的版本。
  • 错误、有效零分、超时和评测器失败保持可区分。
  • 每个声称支持的 Environment 都有真实冒烟测试结果。
  • 完整运行报告说明覆盖范围、失败情况、得分、官方参考结果和重要差异。
  • 公开文档与实现的默认值和兼容性矩阵一致。