Skip to main content
通过快速开始验证一个任务后,再调整并发、重试、结果命名和恢复。这些控制适用于 CLI 和 SDK;launch 的多个请求共享一个调度器。

安全扩展并发

先用并发 1 跑几个有代表性的任务,再逐步增加到 2 或 4。观察模型延迟、错误率、Environment 启动时间和内存使用;错误增加时,回到上一个稳定值。 任务并发和 provider 上限中的较小值决定实际并发上限,模型配额和主机资源还可能进一步限制它。创建速率控制启动节奏,不控制活跃任务数。单个 sandbox 的 CPU 和内存见 Environment 资源设置。

CLI 写法

在已有的 run 命令中添加 --task-concurrency 4。通过 Docker 和 Modal 运行多个请求时,可以分别设置 provider 上限:

配置文件写法

将重复使用的设置保存到配置文件,并通过 --config 加载:
在 launch 编排文件中,公共 task_concurrency 放在顶层,provider 映射仍放在 runtime 下。详见编排字段。 为每个任务配置多次 attempt 时,它们共享同一个并发池。只有 Benchmark 和 Harness 都支持隔离执行时,同一任务的多个 attempt 才会重叠。详见重复尝试。

只重试瞬时失败

默认不重试。在命令中添加 --max-retries 2,允许每个逻辑 attempt 在首次执行后最多重试两次。如果还想重试指定的 agent 错误,需要配置匹配模式,例如:
未填写、null 或空的模式列表只重试 FATAL。模式匹配单个问题的 message 或 code,不匹配 traceback。端点错误、缺少凭证或配置无效时,需要先修正配置;重复相同请求无法解决这些问题。 重试替换当前逻辑 attempt 内的工作,不增加评分样本数。已完成的其他 attempt 仍会保留。none 或 fresh 模式下,具备完整评分输入时可以只重试评测;reuse 模式会重跑整个 attempt。历史记录见重试详情,未解决失败的影响见评分有效性。

输出与复用

命名新运行

在 run 命令中添加 --run-name ablation --run-id baseline,指定实验分组和运行 ID。使用默认结果根目录时,输出路径为:
Model、Benchmark 和 Harness ID 会规范化后拼成一个目录名。launch 使用每个请求的 name 替代这个组合目录,详见请求命名。 通过结果查看器打开已完成的运行:
每个目录保存哪些文件,见评测结果。

继续中断的运行

在相同的评测命令中添加 --reuse,从最近一次兼容运行继续;也可以用 --reuse 20260806_120000 选择源运行 ID。保持相同的结果根目录、run-name 分组以及 Model、Benchmark 和 Harness 选择,以便 AgentCompass 找到源运行。 复用会写入新运行并保留源目录。AgentCompass 检查 Benchmark、task ID、attempt 计划和保存的数据后,再复用已完成结果或恢复待处理工作。launch 在每个请求的命名输出目录内查找。 当前重试预算适用于未解决的失败,历史重试次数仍作为记录保留。恢复待完成评测时,可以调整评测超时或资源;复用不会恢复正在运行的 agent 进程或 sandbox。兼容性要求见复用校验和评测恢复记录。 如果希望重跑待处理工作,而不是恢复其评测输入,可以添加 --no-checkpoint-resume:
该选项默认为 true,不会强制重跑已经完成的结果。使用 launch 时,将其放在 defaults.runtime 或 requests[].runtime 下;SDK 中传入 checkpoint_resume=False。

保留 Environment 以便调试

失败后需要检查任务或评分器 sandbox 时,在命令中添加 --keep-environment。AgentCompass 会关闭 Harness session,但跳过 Environment 清理。 重试和多个任务可能留下多个活跃资源,请在检查后使用 provider 工具释放。如果只需要本地文件副本,可以保存产物。

日志与进度

在 CI 或重定向输出时添加 --progress plain;需要更详细的控制台信息时添加 --log-level DEBUG。控制台与文件日志级别独立设置: auto 在交互式终端显示实时进度,否则输出文本进度。none 关闭终端进度,但 AgentCompass 仍会保存进度、日志和任务结果。检查方法见排查运行失败。