单评测请求
run_evaluation() 执行一个由 Benchmark、Harness、Model 和 Environment 组成的评测请求:
metadata、metrics、summary 和 paths 的字典;逐任务详情保存在结果目录中。单请求超时或执行失败时,函数会抛出相应异常。
异步应用使用 await async_run_evaluation(...),参数和返回值与同步入口相同。
多评测请求
launch() 接收一个 OrchestrationSpec。其中,每个 RunRequestSpec 表示一个具名评测请求,OrchestrationDefaults 用于保存所有请求共享的组件和设置:
task_concurrency 是所有请求共享的 Benchmark 任务并发上限。launch() 返回 OrchestrationResult,其中 status 表示编排状态,requests 按请求名称保存各自的状态、结果、错误和输出路径。单个请求失败不会丢失其他请求的结果。
多请求参数分为编排级设置、所有请求共享的默认值和单个请求的覆盖值,分别写入 OrchestrationSpec、OrchestrationDefaults 和对应的 RunRequestSpec。
异步应用使用 await async_launch(spec, ...)。编排字段的继承和映射规则见 agentcompass launch。
与 CLI 的参数对应关系
CLI 使用命令行字符串;SDK 使用snake_case 关键字和原生 Python 对象。下面先列出 run、launch 及对应 SDK 入口共享的参数,再分别说明单评测请求和多评测编排的传参方式。
共享运行参数
单评测请求的直接参数
参数的含义和默认值见
agentcompass run 参数参考。
多评测请求的编排参数
OrchestrationSpec 的顶层字段为 version、name、task_concurrency、runtime、defaults 和 requests;当前 version 仅支持 1。
请求字段的编排写法
单评测也包含下表中的组件和请求设置,但通过agentcompass run 或 run_evaluation() 的直接参数传入。在多评测编排中,这些内容不是 launch() 的关键字参数:CLI 将其写入编排文件,SDK 则写入 OrchestrationDefaults 或 RunRequestSpec。
task_concurrency 只能作为编排级设置,不能写入 defaults.execution 或 requests[].execution。完整字段结构和继承规则见 agentcompass launch。
相关页面
- 并发、超时、重试和 provider 限制:运行控制
- 配置文件的加载和合并:
agentcompass config
