agentcompass analysis 对已有 AgentCompass 结果目录重新运行分析器,而不重新执行 agent:
analysis_result.<analyzer-family>;字段结构见任务结果。
当 Benchmark 得分只能说明“什么失败了”而不能解释“为什么失败”时,请使用分析器。
分析器的作用
Badcase 检测
标记异常、截断、JSON 错误、重复、空输出、延迟异常和终端误用。
统计
计算步骤数、工具调用数、耗时、词元长度、值分布和数值摘要。
定性诊断
使用由 LLM 驱动分析器标注轨迹阶段、总结行为并生成报告。
聚合
将分析器输出聚合为
analysis_summary.json 和 analysis_summary.md。随评测运行
重新分析已有结果
analysis 会把输入运行复制到带有新时间戳的同级目录。使用 --output 指定复制目标;只有明确需要原地修改时才使用 --override。
参数
默认复制可以避免意外修改已测量运行。只有确实希望替换已有分析数据,且没有不可变归档依赖该目录时,才使用
--override。
选择规则
支持的分析器系列
使用agentcompass list analyzer 查看当前版本注册的分析器。常见系列包括:
输出结构
每个任务详情将分析器输出保存在:- 分析的任务总数;
- 错误案例数量和比例;
- 分析器提供得分时的平均值;
- 值数量分布;
- 数值的数量、最小值、平均值、p50、p90、p95 和最大值。
