Skip to main content
通过命令生成器,将已通过单任务验证的配置用于完整 Benchmark 评测。 完成单任务验证后,可以在本页选择 Model API 协议、Benchmark、Harness、Environment、操作系统和并发数,并生成可直接运行的命令。修改选项时,命令预览会实时更新;非敏感选项会保存在页面 URL 中,便于以后继续使用或分享给他人。

扩大规模前

运行完整 Benchmark 前,请确认:
  • 已使用与完整评测相同的 Model、Benchmark、Harness 和 Environment 成功运行一个代表性任务;操作方式可参考快速开始
  • Model 端点和所选 Environment 的容量、资源和配额足以支持目标并发数。
  • 评测所需的数据集、任务镜像、Harness CLI 和可选依赖均已准备就绪。
  • 输出目录有足够空间保存所有任务的轨迹、日志和评测产物。

命令生成器

使用下方命令生成器选择 Model API 协议、Benchmark、Harness、Environment 和并发数等设置。每次修改选项后,请检查更新后的命令预览;确认无误后,在已安装 AgentCompass 的 Python 环境中执行生成的命令。
点击 参数 可以填写 Model 端点、Model 名称和必要凭证。如果所选配置需要其他服务,表单还会显示评委 Model、嵌入 Model、搜索工具或所选 Environment 的凭证字段。生成的命令直接以 agentcompass run 开头,并将所有值写入对应的 CLI 参数,包括 --benchmark-params--harness-params--env-params如需在后续访问中复用这些值,可以将其保存在当前浏览器中;凭证更新或不再使用时,请及时清除。
保存的值会写入当前浏览器的 localStorage,并在下次访问时复用。文档服务器不会接收或保存这些值;请勿在共享设备上保存凭证。

常见问题

如何设置合适的并发数?

任务并发数决定 AgentCompass 最多同时评测多少个样本。提高并发数可能缩短整体运行时间,但也会增加 Model 请求流量、Environment 资源用量和 host 内存压力,并更容易触发限流或超出配额。 实际可用的并发数取决于 Model 端点容量、所选 Environment 的资源与配额,以及 host 的 CPU 和内存。先以低并发完成一小批任务,再逐步提高并观察任务启动耗时、Model 延迟、错误率和配额用量。如果出现限流、错误率升高或资源不足,请退回上一个稳定值。

如何调整生成器未提供的参数?

命令生成器提供了运行完整评测所需的常用设置。其他 CLI 参数和默认值见 agentcompass run,配置优先级见 agentcompass config;组件专属字段分别见 ModelBenchmarkHarnessEnvironment。建议从生成的命令开始,只添加本次评测确实需要调整的参数。