Skip to main content
缩小失败范围、定位生命周期阶段、检查证据并采取正确的修复措施。 排查 AgentCompass 失败时,应先将问题缩小到一个任务,并识别最先失败的生命周期阶段。不要一次修改多个限制或组件,否则可能掩盖根因,也会让恢复后的结果无法与预期评测直接比较。

从最小复现开始

保持与失败运行相同的 Model、Benchmark、Harness、Environment 和组件参数,但只选择一个失败任务、关闭重试并保留详细日志:
只有需要检查 sandbox 内文件或进程时才添加 --keep-environment。确认实际问题是缺少可选依赖前,不要启用自动依赖安装。

定位最先失败的阶段

在持久化运行日志中搜索任务 ID 和最后一个已启动阶段。正常顺序如下: 最先出现的失败通常比后续清理警告更有价值。例如,model 身份验证错误之后出现的 Environment 关闭警告并不是根因。

检查运行证据

运行目录包含不同层次的证据: 请直接检查对应文件。请求他人复现问题时,应保留 run_info.jsonparams.json、相关详情文件和日志。

常见失败

检查最终配置

当某个值看似未生效时,对比合并后的配置和组件结构:
随后检查每个任务的执行计划摘要。Recipe 在普通配置层之后运行,可以适配镜像、工作区、资源和网络策略;当前结果文件中的摘要记录 Environment、网络策略和已应用的 Recipe,但不包含全部 provider 参数。排查镜像、资源或工作区时,还应结合组件配置和运行日志。

provider 检查

在调试 AgentCompass 内部实现前,先运行 provider 最小独立检查: provider 凭证验证成功,并不代表特定镜像或资源请求一定成功。独立检查后仍需保留单任务 AgentCompass 冒烟测试,因为它还会验证 Recipe、工作区、Harness 准备和验证。

选择重试、复用或重启

重试和复用语义见运行控制,分阶段网络排查见网络策略

提交可复现问题单

提交问题单时请包含:
  • AgentCompass 版本和 Python 版本;
  • 操作系统和 Environment provider;
  • Model 协议、Benchmark、Harness 和任务 ID;
  • 已移除密钥的完整命令;
  • 相关组件参数,以及是否应用了 Recipe;
  • 最先失败的阶段和文件日志中的完整堆栈跟踪;
  • 脱敏后的 run_info.jsonparams.json 和任务详情;
  • 并发为 1 且关闭重试后是否仍可复现。
不要上传 API 密钥、provider 令牌、私有基础 URL、代理凭证或专有任务数据。