扩大规模前
运行完整 Benchmark 前,请确认:- 已使用与完整评测相同的 Model、Benchmark、Harness 和 Environment 成功运行一个代表性任务;操作方式可参考快速开始。
- Model 端点和所选 Environment 的容量、资源和配额足以支持目标并发数。
- 评测所需的数据集、任务镜像、Harness CLI 和可选依赖均已准备就绪。
- 输出目录有足够空间保存所有任务的轨迹、日志和评测产物。
命令生成器
使用下方命令生成器选择 Model API 协议、Benchmark、Harness、Environment 和并发数等设置。每次修改选项后,请检查更新后的命令预览;确认无误后,在已安装 AgentCompass 的 Python 环境中执行生成的命令。保存的值会写入当前浏览器的
localStorage,并在下次访问时复用。文档服务器不会接收或保存这些值;请勿在共享设备上保存凭证。常见问题
如何设置合适的并发数?
任务并发数决定 AgentCompass 最多同时评测多少个样本。提高并发数可能缩短整体运行时间,但也会增加 Model 请求流量、Environment 资源用量和 host 内存压力,并更容易触发限流或超出配额。 实际可用的并发数取决于 Model 端点容量、所选 Environment 的资源与配额,以及 host 的 CPU 和内存。先以低并发完成一小批任务,再逐步提高并观察任务启动耗时、Model 延迟、错误率和配额用量。如果出现限流、错误率升高或资源不足,请退回上一个稳定值。如何调整生成器未提供的参数?
命令生成器提供了运行完整评测所需的常用设置。其他 CLI 参数和默认值见agentcompass run,配置优先级见 agentcompass config;组件专属字段分别见 Model、Benchmark、Harness 和 Environment。建议从生成的命令开始,只添加本次评测确实需要调整的参数。