> ## Documentation Index
> Fetch the complete documentation index at: https://agent-compass.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 概览

理解 AgentCompass Benchmark 集成的职责边界、工作流和完成标准。

Benchmark 集成是一套可复现的评测契约，不只是数据集加载器。它负责任务标识、准备、评分、聚合，以及比较 AgentCompass 运行与官方结果所需的证据。

开始修改前，应根据一手资料建立上游契约：官方代码仓库、数据集版本、论文、技术报告、评测器、任务镜像和排行榜产物。上游状态可能变化时必须固定版本。

## 集成边界

| 属于 Benchmark                                | 属于其他组件                           |
| ------------------------------------------- | -------------------------------- |
| 数据集发现机制、版本管理、任务选择、稳定任务 ID                   | model 调用和 agent 循环 → Harness     |
| `TaskSpec`、Benchmark 计划、`PreparedTask`、预期输出 | 命令、文件、sandbox 生命周期 → Environment |
| 评测模式、官方验证器、得分、聚合                            | provider 镜像/快照/工作区映射 → Recipe    |
| Benchmark 专属参数和元数据                          | 并发、重试、持久化 → runtime              |

应将上游 Harness 标记为推荐的对齐配置，但不要仅因另一个 Harness ID 不同就拒绝它。兼容性应取决于已准备任务、model 协议和 Environment 能力。

## 集成工作流

1. [实现 Benchmark 契约](/zh/developer_guide/benchmark_integration/code_implementation)，包括任务标识、评测器语义、依赖、Recipe 和网络阶段。
2. [更新公开文档](/zh/developer_guide/benchmark_integration/documentation_update)，提供可运行命令和 Benchmark 负责的参数。
3. [验证并完成对齐](/zh/developer_guide/benchmark_integration/validation_and_alignment)，从专用检查扩展到完整官方数据划分比较。

## 完成标准

满足所有适用条件后再请求审查：

* 可以明确识别官方任务、评测器、model 和 Harness 版本。
* 稳定任务 ID 支持精确 `sample_ids` 选择。
* 错误、有效零分、超时和评测器失败保持可区分。
* 显式 Environment 设置优先于推断出的 Recipe 默认值。
* 每个声称支持的 Environment 都有真实冒烟测试结果。
* 受限网络行为在适用时具有强制执行级别 证据。
* 完整运行报告声明覆盖范围、失败、得分、官方参考和重要差异。
* 公开文档与实现的默认值和兼容性矩阵一致。
