Skip to main content
这篇框架论文介绍了 AgentCompass,旨在为不同任务、Harness 与 Environment 中的 agent 评测提供统一基础设施。

研究概述

论文通过分离 Benchmark、Harness 和 Environment 的职责,让研究者可以组合评测流程,减少重复实现执行逻辑的工作。论文还介绍了具备容错能力的异步 runtime,以及用于诊断 agent 失败原因和奖励投机行为的轨迹分析工具。

与 AgentCompass 的关系

这是介绍 AgentCompass 项目及其评测设计的框架论文。当前实现与各组件职责请参阅架构总览

相关资源

返回 AgentCompass 研究论文