Skip to main content
agentcompass run 使用所选 Benchmark、Harness、Model 和 Environment 创建并执行一个评测请求。BENCHMARK HARNESS MODEL 是顺序固定的位置参数,Environment 通过 --env 选择。

运行最小评测

下面通过 --benchmark-params 中的 sample_ids,按稳定任务 ID 选择一个 Benchmark 任务,用于快速验证组件和端点配置:
一条 run 命令对应一个评测请求。需要协调多个显式评测请求时,请使用 agentcompass launch

参数参考

下表用于查询 agentcompass run 的完整参数签名、默认值和作用对象;并发、超时、重试、输出与调试参数的使用建议见运行控制。“内置默认值”指用户级、项目级或显式配置文件覆盖前使用的值。“按需”参数仅在所选组件或端点需要时必填。

组件选择与参数

配置与 Recipe

执行控制

输出与复用

进程级设置

分析

组件专属 JSON 参数

四个 JSON 参数并不共享同一个结构。可用字段和默认值取决于所选组件: sample_idskavgk 都属于 --benchmark-params,但职责不同:sample_ids 选择任务,k 设置每个任务的独立尝试次数,avgk 控制相应的平均指标聚合。provider 的 CPU、内存、镜像和网络设置属于 --env-params。评测各部分的概念分工见配置评测