选择四个组件
命令的位置参数顺序为 Benchmark、Harness、Model:
sample_ids 选择任务,并发 1 便于检查首次运行。成功后,可以使用命令构建器配置更大规模的评测。
选择使用入口
两种入口使用同一套 runtime 和运行配置。重复使用的设置可以保存为 YAML 文件,通过
--config 加载;详见配置文件与覆盖顺序。被测模型通过命令、编排请求或 SDK 传入。
Documentation Index
Fetch the complete documentation index at: /llms.txt
Use this file to discover all available pages before exploring further.
| 组件 | 需要决定什么 | CLI 输入 |
|---|---|---|
| Model | 评测哪个模型,以及端点、凭证和 API 协议。 | 第三个位置参数和 --model-* 选项。 |
| Benchmark | 运行哪些任务,如何给答案评分。 | 第一个位置参数和 --benchmark-params。 |
| Harness | 模型使用哪个 agent 循环和哪些工具。 | 第二个位置参数和 --harness-params。 |
| Environment | 命令在哪里执行,使用什么镜像、资源和网络权限。 | --env 和 --env-params。 |
agentcompass run <benchmark> <harness> <model> --env <environment>
agentcompass run swebench_verified mini_swe_agent "$MODEL_NAME" \
--env docker \
--model-base-url "$MODEL_BASE_URL" \
--model-api-key "$MODEL_API_KEY" \
--model-api-protocol openai-chat \
--benchmark-params '{"sample_ids":["astropy__astropy-12907"]}' \
--task-concurrency 1
sample_ids 选择任务,并发 1 便于检查首次运行。成功后,可以使用命令构建器配置更大规模的评测。
| 想运行什么 | CLI | Python SDK |
|---|---|---|
| 一组 Model、Benchmark、Harness、Environment 组合 | run | run_evaluation() |
| 多组显式命名的组合 | launch | launch() |
--config 加载;详见配置文件与覆盖顺序。被测模型通过命令、编排请求或 SDK 传入。
此页面对您有帮助吗?
