> ## Documentation Index
> Fetch the complete documentation index at: https://agent-compass.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 概览

本节说明 AgentCompass Benchmark 集成的职责边界、工作流程和完成标准。

Benchmark 集成定义的是一套可复现的评测契约，而不只是数据集加载器。它负责任务标识、准备、评分和聚合，也要提供用于比较 AgentCompass 运行结果与官方结果的证据。

开始修改前，应根据一手资料整理上游契约，包括官方代码仓库、数据集版本、论文、技术报告、评测器、任务镜像和排行榜产物。对于可能变化的上游依赖，必须固定版本。

## 集成边界

| 属于 Benchmark                                | 属于其他组件                           |
| ------------------------------------------- | -------------------------------- |
| 数据集发现机制、版本管理、任务选择、稳定任务 ID                   | Model 调用和 agent 循环 → Harness     |
| `TaskSpec`、Benchmark 计划、`PreparedTask`、预期输出 | 命令、文件、sandbox 生命周期 → Environment |
| 评测模式、官方验证器、得分、聚合                            | provider 镜像/快照/工作区映射 → Recipe    |
| Benchmark 专属参数和元数据                          | 并发、重试、持久化 → runtime              |

应把上游 Harness 标记为推荐的对齐配置，但不能只因其他 Harness 的 ID 不同就判定它不兼容。兼容性应由准备后的任务格式、Model 协议和 Environment 能力决定。

## 集成工作流

1. [实现 Benchmark 契约](/zh/developer_guide/extensions/benchmark/code_implementation/overview)，先确定由谁执行，再选择评测模式和聚合方式，然后进入对应子页。
2. [更新公开文档](/zh/developer_guide/extensions/benchmark/documentation_update)，提供可运行命令和 Benchmark 负责的参数。
3. [验证并完成对齐](/zh/developer_guide/extensions/benchmark/validation_and_alignment)，从针对性检查扩展到完整官方数据划分比较。

## 完成标准

满足所有适用条件后再请求审查：

* 明确记录官方任务、评测器、Model 和 Harness 的版本。
* 错误、有效零分、超时和评测器失败保持可区分。
* 每个声称支持的 Environment 都有真实冒烟测试结果。
* 完整运行报告说明覆盖范围、失败情况、得分、官方参考结果和重要差异。
* 公开文档与实现的默认值和兼容性矩阵一致。
