Skip to main content
执行后置错误案例检测、统计、延迟检查和定性轨迹诊断。 agentcompass analysis 对已有 AgentCompass 结果目录重新运行分析器,而不重新执行 agent:
分析器会检查轨迹、指标、错误、延迟、model 输出和工具调用,并把结果写入 analysis_result.<analyzer-family>;字段结构见任务结果 当 Benchmark 得分只能说明“什么失败了”而不能解释“为什么失败”时,请使用分析器。

分析器的作用

Badcase 检测

标记异常、截断、JSON 错误、重复、空输出、延迟异常和终端误用。

统计

计算步骤数、工具调用数、耗时、词元长度、值分布和数值摘要。

定性诊断

使用由 LLM 驱动分析器标注轨迹阶段、总结行为并生成报告。

聚合

将分析器输出聚合为 analysis_summary.jsonanalysis_summary.md
分析器不会重新运行 agent,也不会重新判定 Benchmark 正确性;它们只读取已经完成的任务结果。

随评测运行

如果已确定评测期间应运行哪些分析器,请使用此方式。

重新分析已有结果

默认情况下,analysis 会把输入运行复制到带有新时间戳的同级目录。使用 --output 指定复制目标;只有明确需要原地修改时才使用 --override

参数

默认复制可以避免意外修改已测量运行。只有确实希望替换已有分析数据,且没有不可变归档依赖该目录时,才使用 --override

选择规则

支持的分析器系列

使用 agentcompass list analyzer 查看当前版本注册的分析器。常见系列包括:

输出结构

每个任务详情将分析器输出保存在:
键可以是分析器自身的 ID,也可以是多个实现共用的分析器系列 ID。聚合摘要按类别和分析器系列输出:
  • 分析的任务总数;
  • 错误案例数量和比例;
  • 分析器提供得分时的平均值;
  • 值数量分布;
  • 数值的数量、最小值、平均值、p50、p90、p95 和最大值。
逐任务字段见任务结果,两个分析摘要文件的完整结构见汇总与分析结果

相关页面