Skip to main content
评测请求开始写入输出后,会将任务结果、运行记录、汇总指标和日志保存在同一个运行目录中。本页介绍目录结构,并帮助你根据查看目的找到对应文件。各类文件的字段和使用方式会在后续页面中分别说明。 如果评测在创建运行目录前就未通过预检,或者执行的是 launch --dry-run,则不会生成结果目录。

目录布局

一次完整运行通常会生成以下目录和文件:
未设置 run-name 时,路径中不会包含这一层。retry_details/ 仅在实际触发 runtime 重试后生成;只有存在可汇总的分析结果时,才会生成分析摘要。如果评测在预检、任务执行或汇总阶段提前结束,目录中可能只有已经写入的部分文件。

从哪里开始

details/*.json 保存已经写入磁盘的逐任务结果,summary.md 展示运行级聚合指标。评测结束时的首次汇总使用本次运行收集到的结果;之后单独执行 agentcompass summary 时,则会重新读取详情文件。启用分析后,每次评测尝试的分析输出会写入详情文件的 analysis_result,并进一步汇总为运行级分析摘要。进度文件、日志和 retry_details/ 主要用于观察运行状态与排查问题,不直接参与 Benchmark 指标计算。

数据、缓存与输出目录

Benchmark 数据与评测结果保存在不同目录中。配置路径时,可以根据下表判断应使用哪项设置: 在配置文件中,使用 runtime.data_dirruntime.results_dir 设置根目录;运行单个评测请求时,也可以通过对应的 CLI 选项传入。run-namerun-id 属于每个请求的输出设置,因此在多评测编排文件中需要写入相应请求的 output。详情见 agentcompass runagentcompass launch

相关页面