专用验证
启动完整任务前,验证导入、注册表发现机制、配置解析、协议验证、启动命令生成、输出解析、脱敏和清理行为。 为以下场景测试受控失败:- 缺少可执行文件或可选依赖。
- 不支持的 model 协议或 Environment 能力。
- 无效凭证或 model 端点响应。
- 安装失败。
- 命令超时、步骤限制、格式错误输出和取消。
- 部分会话启动后的清理。
端到端矩阵
从一个真实 Benchmark 任务、任务并发数1 且关闭重试开始,再覆盖:
小型并发批次应暴露共享配置文件、固定进程名称、会话 ID 冲突、全局可变状态、日志混用、客户端复用和清理竞态。
Harness 支持准备/运行网络切换时,需要证明安装或启动在准备阶段策略下完成,并在受限执行中发起真实被拒请求。确认策略切换或 agent 执行失败时仍会调用
close_session()。
官方对齐
如果 Harness 声称与官方 agent 或排行榜配置一致,应使用固定 Harness 版本运行完整官方 Benchmark 数据划分,并匹配提示词、model 协议、推理设置、步骤/成本限制、超时、资源、网络策略、重试策略和每个任务的尝试数。 报告需要包含:- 支持的 Benchmark、协议、Environment 和安装矩阵。
- 准确且脱敏的冒烟测试和完整评测命令。
- 一条代表性标准化轨迹和终止记录。
- 任务覆盖范围、分类失败、得分及其与官方设置的比较。
- 重要提示词、provider、model 部署或资源差异。
