> ## Documentation Index
> Fetch the complete documentation index at: https://agent-compass.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Terminal-Bench 2 Verified

Terminal-Bench 2 Verified 是托管在 Hugging Face 的 Terminal-Bench 2 已验证子集。它与 [Terminal-Bench 2](/zh/user_guide/modules/benchmarks/terminal_bench_2) 使用相同的任务执行与验证器流程，通常搭配 [`terminus2`](/zh/user_guide/modules/harnesses/terminus2)。

## 工作原理

1. **加载任务。** AgentCompass 克隆 Hugging Face 数据集，并在加载任务目录前拉取其中的 Git LFS 对象。
2. **运行 agent。** Recipe 准备每个任务的容器镜像和工作区，随后终端 Harness 处理任务指令。
3. **验证结果。** Harbor 验证器运行 `tests/test.sh`；奖励为 `1` 时记录为 `correct`。

<Note type="warning">
  加载数据集的进程必须安装 `git-lfs`，否则无法取得已验证任务集的 LFS 资源。
</Note>

## 参数

可通过 `--benchmark-params '{...}'` 配置 Terminal-Bench 专属参数。

| 参数                            | 类型  | 默认值   | 说明                  |
| ----------------------------- | --- | ----- | ------------------- |
| `verifier_timeout_multiplier` | 浮点数 | `1.0` | 验证器超时倍率。            |
| `execute_timeout_multiplier`  | 浮点数 | `1.0` | 单个任务的 agent 执行超时倍率。 |

## 运行示例

运行配置分两段 JSON：`--benchmark-params` 传 Terminal-Bench 的 Benchmark 层配置（上文的超时倍率及按需指定的任务筛选），`--harness-params` 传所选 Harness 自身配置。下方默认示例使用 [`terminus2`](/zh/user_guide/modules/harnesses/terminus2)，常用项为 `max_turns` 和 `timeout`。两段都可改写进 `--config` 的 `benchmark.params` / `harness.params` 块；同名项以命令行为准。

### 推荐 Harness

推荐使用终端 agent [`terminus2`](/zh/user_guide/modules/harnesses/terminus2)。

<Tabs>
  <Tab title="冒烟测试（单条跑通）">
    验证端到端能否跑通——`sample_ids` 指定跑哪个场景，其余参数走默认。

    ```bash theme={"system"}
    agentcompass run \
      terminal_bench_2_verified \
      terminus2 \
      "$MODEL_NAME" \
      --env docker \
      --benchmark-params '{"sample_ids":["<task-id>"]}' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY"
    ```
  </Tab>

  <Tab title="自定义参数">
    为 model 响应较慢的运行环境提高超时倍率。

    ```bash theme={"system"}
    agentcompass run \
      terminal_bench_2_verified \
      terminus2 \
      "$MODEL_NAME" \
      --env docker \
      --benchmark-params '{
        "verifier_timeout_multiplier": 8,
        "execute_timeout_multiplier": 16
      }' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY"
    ```
  </Tab>

  <Tab title="AgentCompass 推荐配置">
    AgentCompass 推荐配置进行完整评测。model 服务状况、部署实例数、任务并发数或 model 能力等导致任务耗时增加时，可通过 `--benchmark-params` 设置 `verifier_timeout_multiplier` 和 `execute_timeout_multiplier`。

    ```bash theme={"system"}
    agentcompass run \
      terminal_bench_2_verified \
      terminus2 \
      "$MODEL_NAME" \
      --env docker \
      --task-concurrency 16 \
      --harness-params '{"max_turns":300,"timeout":14400}' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY"
    ```
  </Tab>
</Tabs>

### 其他可选 Harness

[`codex`](/zh/user_guide/modules/harnesses/codex) 和 [`claude_code`](/zh/user_guide/modules/harnesses/claude_code) 是其他两个可选 Harness。运行时传入 `--recipe terminalbench2_verified_docker_ac` 可使用 AgentCompass 的专用镜像。它额外提供了 Node.js、npm、curl、wget 等下载依赖，方便运行 Codex、Claude Code 等需要这些依赖的 Harness。

<Tabs>
  <Tab title="使用官方镜像运行">
    不传 `--recipe` 即使用官方任务镜像。它不包含节点环境引导依赖，因此需显式传入对应安装命令。

    ```bash theme={"system"}
    # Codex
    agentcompass run terminal_bench_2_verified codex "$MODEL_NAME" \
      --env docker \
      --task-concurrency 16 \
      --harness-params '{"install_command":"apt-get update && apt-get install -y curl ca-certificates && curl -fsSL https://deb.nodesource.com/setup_20.x | bash - && apt-get install -y nodejs && npm install -g @openai/codex"}' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol openai-responses

    # Claude Code
    agentcompass run terminal_bench_2_verified claude_code "$MODEL_NAME" \
      --env docker \
      --task-concurrency 16 \
      --harness-params '{"install_command":"apt-get update && apt-get install -y curl ca-certificates && curl -fsSL https://deb.nodesource.com/setup_20.x | bash - && apt-get install -y nodejs && npm install -g @anthropic-ai/claude-code"}' \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol anthropic
    ```
  </Tab>

  <Tab title="AgentCompass 推荐配置">
    传入 `--recipe terminalbench2_verified_docker_ac` 即可指定 AgentCompass 的专用镜像，无需显式传入对应安装命令。

    ```bash theme={"system"}
    # Codex
    agentcompass run terminal_bench_2_verified codex "$MODEL_NAME" \
      --env docker \
      --recipe terminalbench2_verified_docker_ac \
      --task-concurrency 16 \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol openai-responses

    # Claude Code
    agentcompass run terminal_bench_2_verified claude_code "$MODEL_NAME" \
      --env docker \
      --recipe terminalbench2_verified_docker_ac \
      --task-concurrency 16 \
      --model-base-url "$MODEL_BASE_URL" \
      --model-api-key "$MODEL_API_KEY" \
      --model-api-protocol anthropic
    ```
  </Tab>
</Tabs>

## 输出

一次运行在 `results/terminal_bench_2_verified/<model>/<run>/` 下产出两类结果：`summary.md` 中的聚合指标，以及 `details/` 下的单任务 JSON 记录。

### 聚合指标（summary.md）

`summary.md` 包含运行概况（`Model`、`Total`、`Evaluated`、`Error`）和主指标 **`accuracy`**。`accuracy` 是验证器返回满额奖励（`1`）的已评测任务占比，即 Terminal-Bench 的任务通过率。

### 单任务详情（details/）

每个任务 JSON 记录 `correct`、执行状态、尝试记录、agent 轨迹与 Harness 指标，以及用于判定结果的原始验证器输出。参见[结果](/zh/user_guide/other_features/results)。
