terminus2。
工作原理
- 加载任务。 AgentCompass 克隆 Hugging Face 数据集,并在加载任务目录前拉取其中的 Git LFS 对象。
- 运行 agent。 Recipe 准备每个任务的容器镜像和工作区,随后终端 Harness 处理任务指令。
- 验证结果。 Harbor 验证器运行
tests/test.sh;奖励为1时记录为correct。
加载数据集的进程必须安装
git-lfs,否则无法取得已验证任务集的 LFS 资源。参数
可通过--benchmark-params '{...}' 配置 Terminal-Bench 专属参数。
运行示例
运行配置分两段 JSON:--benchmark-params 传 Terminal-Bench 的 Benchmark 层配置(上文的超时倍率及按需指定的任务筛选),--harness-params 传所选 Harness 自身配置。下方默认示例使用 terminus2,常用项为 max_turns 和 timeout。两段都可改写进 --config 的 benchmark.params / harness.params 块;同名项以命令行为准。
推荐 Harness
推荐使用终端 agentterminus2。
- 冒烟测试(单条跑通)
- 自定义参数
- AgentCompass 推荐配置
验证端到端能否跑通——
sample_ids 指定跑哪个场景,其余参数走默认。其他可选 Harness
codex 和 claude_code 是其他两个可选 Harness。运行时传入 --recipe terminalbench2_verified_docker_ac 可使用 AgentCompass 的专用镜像。它额外提供了 Node.js、npm、curl、wget 等下载依赖,方便运行 Codex、Claude Code 等需要这些依赖的 Harness。
- 使用官方镜像运行
- AgentCompass 推荐配置
不传
--recipe 即使用官方任务镜像。它不包含节点环境引导依赖,因此需显式传入对应安装命令。输出
一次运行在results/terminal_bench_2_verified/<model>/<run>/ 下产出两类结果:summary.md 中的聚合指标,以及 details/ 下的单任务 JSON 记录。
聚合指标(summary.md)
summary.md 包含运行概况(Model、Total、Evaluated、Error)和主指标 accuracy。accuracy 是验证器返回满额奖励(1)的已评测任务占比,即 Terminal-Bench 的任务通过率。
单任务详情(details/)
每个任务 JSON 记录correct、执行状态、尝试记录、agent 轨迹与 Harness 指标,以及用于判定结果的原始验证器输出。参见结果。