Skip to main content
理解 AgentCompass Benchmark 集成的职责边界、工作流和完成标准。 Benchmark 集成是一套可复现的评测契约,不只是数据集加载器。它负责任务标识、准备、评分、聚合,以及比较 AgentCompass 运行与官方结果所需的证据。 开始修改前,应根据一手资料建立上游契约:官方代码仓库、数据集版本、论文、技术报告、评测器、任务镜像和排行榜产物。上游状态可能变化时必须固定版本。

集成边界

应将上游 Harness 标记为推荐的对齐配置,但不要仅因另一个 Harness ID 不同就拒绝它。兼容性应取决于已准备任务、model 协议和 Environment 能力。

集成工作流

  1. 实现 Benchmark 契约,包括任务标识、评测器语义、依赖、Recipe 和网络阶段。
  2. 更新公开文档,提供可运行命令和 Benchmark 负责的参数。
  3. 验证并完成对齐,从专用检查扩展到完整官方数据划分比较。

完成标准

满足所有适用条件后再请求审查:
  • 可以明确识别官方任务、评测器、model 和 Harness 版本。
  • 稳定任务 ID 支持精确 sample_ids 选择。
  • 错误、有效零分、超时和评测器失败保持可区分。
  • 显式 Environment 设置优先于推断出的 Recipe 默认值。
  • 每个声称支持的 Environment 都有真实冒烟测试结果。
  • 受限网络行为在适用时具有强制执行级别 证据。
  • 完整运行报告声明覆盖范围、失败、得分、官方参考和重要差异。
  • 公开文档与实现的默认值和兼容性矩阵一致。