> ## Documentation Index
> Fetch the complete documentation index at: https://agent-compass.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 验证与对齐

验证 Harness 的协议、Environment、生命周期失败、并发和官方设置。

## 专用验证

启动完整任务前，验证导入、注册表发现机制、配置解析、协议验证、启动命令生成、输出解析、脱敏和清理行为。

为以下场景测试受控失败：

* 缺少可执行文件或可选依赖。
* 不支持的 model 协议或 Environment 能力。
* 无效凭证或 model 端点响应。
* 安装失败。
* 命令超时、步骤限制、格式错误输出和取消。
* 部分会话启动后的清理。

## 端到端矩阵

从一个真实 Benchmark 任务、任务并发数 `1` 且关闭重试开始，再覆盖：

| 维度          | 最低证据要求                                  |
| ----------- | --------------------------------------- |
| Benchmark   | 使用正常 `PreparedTask` 和评测器的一个目标 Benchmark |
| 协议          | 每个新增声明的 model API 协议                    |
| Environment | Harness 文档中声明的每个 provider               |
| 安装          | 每个声明的启动/安装策略                            |
| 结果          | 成功运行，以及受控失败和超时路径                        |
| 并发          | 单任务路径成功后的小型并发批次                         |

小型并发批次应暴露共享配置文件、固定进程名称、会话 ID 冲突、全局可变状态、日志混用、客户端复用和清理竞态。

Harness 支持基线/运行网络切换时，需要证明安装或启动在基线策略下完成，并在受限执行中发起真实被拒请求。确认策略切换或 agent 执行失败时仍会调用 `close_session()`。

## 官方对齐

如果 Harness 声称与官方 agent 或排行榜配置一致，应使用固定 Harness 版本运行完整官方 Benchmark 数据划分，并匹配提示词、model 协议、推理设置、步骤/成本限制、超时、资源、网络策略、重试策略和每个任务的尝试数。

报告需要包含：

* 支持的 Benchmark、协议、Environment 和安装矩阵。
* 准确且脱敏的冒烟测试和完整评测命令。
* 一条代表性标准化轨迹和终止记录。
* 任务覆盖范围、分类失败、得分及其与官方设置的比较。
* 重要提示词、provider、model 部署或资源差异。

发布得分对齐声明时，遵循[Benchmark 验证与对齐](/zh/developer_guide/benchmark_integration/validation_and_alignment)的报告结构。

## 代码仓库检查

```bash theme={"system"}
uvx pre-commit run --all-files --show-diff-on-failure
cd docs
mint broken-links
mint validate
```
