agentcompass run 使用所选 Benchmark、Harness、Model 和 Environment 创建并执行一个评测请求。BENCHMARK HARNESS MODEL 是顺序固定的位置参数,Environment 通过 --env 选择。
运行最小评测
下面通过--benchmark-params 中的 sample_ids,按稳定任务 ID 选择一个 Benchmark 任务,用于快速验证组件和端点配置:
run 命令对应一个评测请求。需要协调多个显式评测请求时,请使用 agentcompass launch。
参数参考
下表用于查询agentcompass run 的完整参数签名、默认值和作用对象;并发、超时、重试、输出与调试参数的使用建议见运行控制。“内置默认值”指用户级、项目级或显式配置文件覆盖前使用的值。“按需”参数仅在所选组件或端点需要时必填。
组件选择与参数
配置与 Recipe
执行控制
输出与复用
进程级设置
分析
组件专属 JSON 参数
四个 JSON 参数并不共享同一个结构。可用字段和默认值取决于所选组件:sample_ids、k 和 avgk 都属于 --benchmark-params,但职责不同:sample_ids 选择任务,k 设置每个任务的独立尝试次数,avgk 控制相应的平均指标聚合。provider 的 CPU、内存、镜像和网络设置属于 --env-params。评测各部分的概念分工见配置评测。