launch --dry-run,则不会生成结果目录。
目录布局
一次完整运行通常会生成以下目录和文件:run-name 时,路径中不会包含这一层。retry_details/ 仅在实际触发 runtime 重试后生成;只有存在可汇总的分析结果时,才会生成分析摘要。如果评测在预检、任务执行或汇总阶段提前结束,目录中可能只有已经写入的部分文件。
从哪里开始
details/*.json 保存已经写入磁盘的逐任务结果,summary.md 展示运行级聚合指标。评测结束时的首次汇总使用本次运行收集到的结果;之后单独执行 agentcompass summary 时,则会重新读取详情文件。启用分析后,每次评测尝试的分析输出会写入详情文件的 analysis_result,并进一步汇总为运行级分析摘要。进度文件、日志和 retry_details/ 主要用于观察运行状态与排查问题,不直接参与 Benchmark 指标计算。
数据、缓存与输出目录
Benchmark 数据与评测结果保存在不同目录中。配置路径时,可以根据下表判断应使用哪项设置:
在配置文件中,使用
runtime.data_dir 和 runtime.results_dir 设置根目录;运行单个评测请求时,也可以通过对应的 CLI 选项传入。run-name 和 run-id 属于每个请求的输出设置,因此在多评测编排文件中需要写入相应请求的 output。详情见 agentcompass run 和 agentcompass launch。
