一句话介绍
HoneyHive是一款面向生产级AI代理的可观测与评测平台,帮助工程团队追踪模型、工具、链路和多代理运行,使用自动与人工评测发现问题,并把真实故障沉淀为持续回归测试。
工具简介
HoneyHive把可观测、评测、数据集、提示词和持续集成放在同一开发生命周期中。它不是模型提供商,也不会替用户构建业务代理,而是记录代理实际做了什么、衡量结果质量并帮助团队定位退化原因。
平台使用OpenTelemetry作为主要追踪基础,提供Python、TypeScript、开放接口、命令行和多种自动插桩方式。开发者可以使用云端免费版,企业则可选择多租户、单租户、混合或自托管部署。
核心数据模型
| 对象 | 含义 | 典型内容 | 主要用途 |
|---|---|---|---|
| Event | 一次跨度或指标标签组合 | 模型、工具、链路步骤或指标 | 计费、筛选和评测的基础单位 |
| Span | 单个执行步骤 | 输入、输出、错误、耗时和属性 | 定位具体失败环节 |
| Session | 完整请求或多轮运行 | 多个模型、工具和链路事件 | 还原端到端代理轨迹 |
| Trace | 分布式执行路径 | 父子关系、重试、循环与交接 | 观察长时和多代理任务 |
| Datapoint | 一条测试样本 | 输入、标准答案、历史和元数据 | 实验与回归测试 |
| Dataset | 结构化测试样本集合 | 生产故障、边缘案例和基准集 | 比较提示、模型或RAG配置 |
| Evaluator | 对输出或轨迹评分的函数 | 布尔、数值、分类或解释 | 质量监控和发布门槛 |
| Prompt Config | 提示、模型和参数的版本组合 | 模板、模型、工具和超参数 | 实验、版本管理与部署 |
主要功能
分布式链路追踪
HoneyHive可以记录模型推理、外部工具、检索、链式步骤和完整用户会话,并保留父子关系。工程师能够按时间顺序重放一次运行,直接跳到错误、超时或行为异常的跨度。
长时间代理调试
平台针对持续数小时或数天的代理轨迹展示重试、循环、子代理交接和工具调用。它适合定位代理从哪一步偏离目标,而不只是查看最终回答是否正确。
多代理可观测
多个代理或子代理可以使用统一事件模型记录决策、工具、状态和交接。团队需要传递稳定的追踪标识和上下文,否则跨进程运行仍可能被拆成无法关联的片段。
自动插桩
Python和TypeScript工具包基于OpenTelemetry,可自动捕获常见模型框架、代理框架和外部调用。平台宣称覆盖50多个常用库,包括LangChain、LangGraph、AWS Strands、Google ADK和OpenAI Agents SDK等。
自定义跨度
对于未被自动识别的函数,开发者可以用装饰器或手动跨度记录输入、输出、错误、持续时间、元数据、反馈和指标。追踪粒度越细,调试能力越强,但事件消耗、延迟和敏感数据风险也会增加。
生产质量监控
团队可以在实时流量上运行评测并把分数与用户反馈、业务结果和特定版本关联。生产监控应设置采样和成本边界,避免每次复杂代理运行都触发昂贵的模型裁判。
自定义仪表板
追踪、元数据和评测指标可以按模型、版本、用户群、环境或功能分组并形成图表。布尔指标可查看通过率,数值指标可计算平均值、分位数与极值,字符串适合分类与筛选。
告警与漂移检测
平台可以围绕错误、延迟、成本、质量和分布变化建立监控,帮助团队及时发现代理退化。告警阈值需要结合流量和业务风险校准,过于敏感会产生噪声,过于宽松则会漏掉真实故障。
客户端评测
应用可以在自己的运行环境中计算格式、安全、个人信息或业务规则指标,再把结果写入追踪或跨度。客户端评测适合在数据离开系统前完成敏感检查,并且同名指标不会被服务端评测覆盖。
服务端代码评测
开发者可以在HoneyHive中配置代码评测,对已上传的日志、跨度或完整会话计算确定性指标。代码评测适合格式、字段、工具顺序和可验证业务规则,结果比模型裁判更稳定。
LLM裁判评测
LLM Evaluator根据自定义标准为非结构化回答、检索结果或代理轨迹打分,并可以给出解释。现行文档说明服务端模型裁判使用GPT-4o,敏感数据和成本需要结合采样、合同与部署方式评估。
人工评测与标注队列
领域专家可以在界面中按自定义量表评分、评论并建立标注队列,适合医疗、法律、金融或品牌语气等难以完全自动判断的任务。人工标准需要先对齐,否则不同标注员会产生不可比较的结果。
评测器验证
平台允许先用近期事件或手工样本测试评测器,再决定是否在生产部署。模型裁判并非天然可靠,应与专家判断对齐,检查偏差、提示注入、位置偏好和评分稳定性。
在线评测采样
服务端评测可以只对生产或预发布事件的一定比例运行,控制成本和吞吐。离线实验通常不使用同样的采样逻辑,以保证不同配置在同一完整数据集上可比较。
数据集管理
数据集由输入、标准答案、对话历史和元数据组成,可以从生产追踪中筛选,也可以通过界面或SDK上传。团队能够把真实故障和边缘案例持续加入基准集,形成更贴近业务的测试资产。
数据集导入与导出
界面支持JSON、JSONL和CSV文件,SDK也能批量创建和读取数据点。数据集可以导出用于外部评测、归档或微调,但导出前应清理用户身份与机密内容。
离线实验
实验将待测试函数、统一数据集和一组评测器组合起来,适合比较提示词、模型、检索策略、分块方式或完整代理架构。每个运行会保留指标和追踪,便于逐样本比较退化与提升。
并行实验
评测框架可以并行执行数据点并控制工作线程数量,从而缩短大型测试集运行时间。并行度仍受模型供应商限流、预算、共享状态和目标系统容量限制。
Git上下文
从代码仓库运行实验时,SDK可以记录提交、分支、作者、远程地址和工作区是否存在未提交修改。该信息有助于把结果关联到代码版本,但也可能暴露内部仓库元数据,应按环境与权限决定是否保留。
持续集成门槛
团队可以在代码变更时运行评测,设置质量阈值并在指标退化时阻止发布。测试集应包含关键业务失败而非只使用容易样本,否则绿色检查仍不能证明生产可靠。
在线实验与A/B测试
应用可以把实验标识、配置版本和用户反馈加入追踪,再在仪表板比较控制组与实验组。HoneyHive负责记录和分析,流量分配通常仍由现有功能开关或实验系统完成。
提示词Playground
Playground用于快速试验提示、模型、函数和外部工具,并可以从追踪中打开失败事件继续迭代。它适合探索和重现问题,不应绕过正式数据集、评测与代码审查直接修改生产提示。
提示词版本管理
每个提示配置包含模板、模型、超参数和工具,可以保存历史并部署到应用。版本化能减少手工复制错误,但模型提供商升级、外部知识和运行时工具变化仍可能影响结果。
生产故障转数据集
工程师可以从日志仓中筛选错误、低分或高价值运行,并将其整理成数据集。随后用同一案例比较修复前后的提示、模型与代码,形成从观察到改进的闭环。
评测方法对比
| 评测方式 | 执行位置 | 适合指标 | 优势 | 主要限制 |
|---|---|---|---|---|
| 客户端代码 | 用户应用内 | 格式、安全、个人信息和业务规则 | 数据可在本地检查,结果确定 | 需要开发和维护代码 |
| 服务端代码 | HoneyHive或私有部署 | 结构、字段、工具顺序和计算指标 | 集中管理并可重复运行 | 必须确保运行环境和依赖安全 |
| LLM裁判 | 服务端模型调用 | 相关性、忠实度、语气和轨迹一致性 | 适合非结构化复杂标准 | 成本、偏差和不稳定性 |
| 人工标注 | 平台标注界面 | 专业质量、风险与主观体验 | 领域判断最贴近业务 | 速度慢且需要标准对齐 |
| 用户反馈 | 生产交互 | 喜欢、成功、投诉和真实结果 | 直接连接用户体验 | 信号稀疏且可能有选择偏差 |
从追踪到改进的工作流
- 为生产、预发布和开发环境建立独立项目与API密钥。
- 用OpenTelemetry或官方SDK接入模型、工具、检索和代理步骤。
- 先在测试环境检查跨度结构、父子关系、字段和敏感数据。
- 为延迟、错误、成本、工具正确性和输出质量建立基础指标。
- 从真实流量中筛选失败、低分、投诉和高价值边缘案例。
- 将案例整理为带输入、标准答案和元数据的版本化数据集。
- 用代码、模型裁判与领域专家建立互补评测器并完成校准。
- 运行提示、模型或架构实验,逐样本比较提升与新退化。
- 把关键评测加入持续集成,并在生产设置采样和告警。
- 持续将新故障加入数据集,让可靠性标准随真实业务演进。
接入步骤
- 创建HoneyHive工作区和项目,为项目生成独立API密钥。
- 根据技术栈安装Python或TypeScript工具包,或使用OpenTelemetry发送追踪。
- 初始化追踪器并设置项目、环境、会话名称和可选私有服务地址。
- 运行一条最小请求,确认模型、工具、链路和会话层级正确。
- 为自定义函数添加跨度,记录必要的错误、耗时、反馈与业务元数据。
- 屏蔽密码、令牌、个人信息、文档正文和其他不应上传的数据。
- 在日志仓重放运行,验证搜索、过滤、图表和团队权限。
- 建立小型数据集和确定性评测器,再逐步加入模型裁判。
- 设置事件预算、请求速率、保留策略、采样和生产告警。
- 在正式扩大流量前完成安全、DPA、BAA或私有部署评估。
价格与套餐
价格信息于2026年8月23日核验,实际金额、税费、汇率和优惠可能变化,最终以结算页面显示为准。
HoneyHive目前提供Developer免费版与Enterprise定制方案。免费版不要求信用卡,适合开发和小规模生产验证;企业版增加使用量、身份、支持、保留、合规和部署弹性。
| 套餐 | 价格 | 事件与速率 | 用户和工作区 | 保留与部署 | 适合用户 |
|---|---|---|---|---|---|
| Developer | 免费 | 每月10000个事件;每分钟最多1000次请求 | 最多5名用户;1个工作区;项目数不限 | 保留30天;美国西部多租户云;逻辑隔离 | 个人开发者、小团队和概念验证 |
| Enterprise | 定制报价 | 事件、请求速率与用量自定义 | 用户和工作区不限;项目数不限 | 自定义保留;多租户、单租户、混合或自托管;地区可定制 | 生产关键代理与受监管企业 |
| Startup计划 | 联系团队获取折扣 | 以所选套餐为准 | 面向累计融资低于500万美元的公司 | 具体权益未公开 | 符合条件的早期创业团队 |
事件如何计数
一个事件指单个追踪跨度或一组指标标签,月度总量等于跨度数与指标数之和。一次复杂代理运行可能包含大量模型、工具、重试和指标,因此10000个事件不等于10000次用户请求。
免费版包含什么
Developer包含自动与人工评测、完整可观测功能、提示词版本与部署、持续集成、30天数据保留和社区支持。社会化单点登录与基础角色控制可用,但没有企业SAML、自定义角色和专属支持。
Enterprise增加什么
Enterprise提供自定义使用量、无限用户和工作区、SAML或定制单点登录、定制保留、SLA与服务额度、DPA、BAA、专属技术客户经理和季度业务评审。具体价格与合同期限需要联系销售。
部署方式对比
| 部署方式 | 控制平面 | 数据平面 | 主要优势 | 适合场景 |
|---|---|---|---|---|
| 多租户SaaS | HoneyHive管理 | HoneyHive云环境 | 上线最快、维护最少 | Developer与一般企业 |
| 单租户SaaS | HoneyHive管理 | 客户独立环境 | 隔离程度更高 | 需要独立基础设施的企业 |
| Hybrid | HoneyHive管理 | 客户自托管 | 保留数据平面控制 | 数据边界要求较高的组织 |
| Self-hosted | 客户基础设施 | 客户基础设施 | 控制平面与数据平面均私有 | 强监管或内部网络环境 |
自托管仅属于Enterprise,并不意味着用户可以免费获得完整平台代码。企业需要确认部署包、升级、遥测、离线依赖、备份、灾难恢复和支持责任。
SDK、CLI与开放接口
| 组件 | 当前状态 | 用途 | 许可证或注意事项 |
|---|---|---|---|
| Python SDK | 公开且持续更新 | 追踪、评测、数据集与开放接口操作 | 仓库未识别到明确开源许可证,使用前核对许可 |
| TypeScript API Client | 公开且持续更新 | 操作HoneyHive数据接口 | MIT许可证 |
| 旧TypeScript SDK | 公开但已归档 | 历史TypeScript客户端与MCP服务 | MIT许可证,不宜作为长期新项目首选 |
| OpenAPI规范 | 公开且持续更新 | 生成其他语言客户端 | MIT许可证 |
| HoneyHive CLI | 公开且持续更新 | 命令行管理开放接口 | MIT许可证 |
| Cookbook | 公开且持续更新 | 集成示例与实践 | 未识别到明确许可证 |
| HoneyHive Daemon | 公开且持续更新 | 编码代理遥测与导出 | 仓库未识别到明确许可证 |
| Skills | 公开且持续更新 | 代理使用HoneyHive能力的技能文件 | MIT许可证 |
| Realign | 已归档 | AI应用测试与模拟框架 | MIT许可证,仅适合维护旧项目或参考 |
Python SDK
Python工具包支持OpenTelemetry、同步与异步装饰器、手动跨度、上下文传播、实验和多个模型插桩器。代码仓库公开不等于自动获得开源权利,缺少明确许可证时应按保留版权处理。
TypeScript与MCP
当前活跃的TypeScript API Client用于数据接口操作;旧TypeScript SDK仓库包含MCP服务能力,但已被归档。新项目应按照当前文档选择活跃包并固定版本,避免依赖已停止维护的生成客户端。
开放接口与其他语言
除Python和TypeScript外,其他语言可以直接发送OpenTelemetry数据,调用开放接口,或依据OpenAPI规范生成类型化客户端。自行生成的客户端仍需处理鉴权、限流、重试、分页和版本兼容。
HoneyHive Daemon
Daemon用于收集Claude Code等编码代理的遥测并导出到HoneyHive,适合观察工具调用和代理执行。编码轨迹可能包含仓库路径、代码、提示和命令,启用前应配置排除与脱敏。
开源状态
HoneyHive平台本身不是完整开源项目,云端控制台、企业服务和自托管部署仍受商业套餐与合同约束。部分SDK、CLI、OpenAPI和技能组件以MIT许可证公开,只代表这些具体仓库可以按许可证使用。
Realign曾作为独立AI测试与模拟框架公开,但已经归档为只读。将公开工具与闭源平台区分开,可以避免误以为免费克隆仓库就能获得完整HoneyHive服务。
适合哪些用户
- 正在开发多步骤AI代理、RAG或工具调用应用的工程团队。
- 需要调试重试、循环、子代理交接和长时运行的平台团队。
- 希望把真实生产故障持续转化为回归数据集的AI产品团队。
- 需要代码、模型裁判、人工标注和用户反馈组合评测的组织。
- 希望在持续集成中设置AI质量发布门槛的开发团队。
- 需要SAML、DPA、BAA、SLA、定制保留和私有部署的企业。
- 已经使用OpenTelemetry并希望统一AI遥测标准的基础设施团队。
- 需要监控编码代理和企业内部AI平台的技术负责人。
不太适合哪些用户
- 只想使用通用聊天机器人而不开发AI应用的普通用户。
- 只需要传统服务器CPU、内存和网络监控的运维团队。
- 要求完整平台代码都采用开源许可证的组织。
- 无法对追踪数据进行脱敏和权限治理的敏感业务团队。
- 月度代理运行会远超10000事件却不愿购买企业方案的团队。
- 希望模型裁判自动代替所有领域专家和真实用户反馈的团队。
- 不能接受云端数据位于美国西部且又不采购私有部署的组织。
典型使用场景
- 重放客服代理的一次失败运行,定位漏掉政策查询的具体工具步骤。
- 比较两个提示版本在同一投诉数据集上的忠实度和工具正确性。
- 监控RAG应用的检索相关性、回答忠实度、延迟和成本趋势。
- 让领域专家在标注队列审核医疗或金融回答。
- 从生产低分追踪中创建回归样本并加入持续集成。
- 对不同模型、分块策略和重排序器进行并行离线实验。
- 按代理版本和用户群开展在线A/B测试并连接实际结果。
- 在企业私有环境部署数据平面,同时使用托管控制平面。
- 收集编码代理工具调用和错误,观察开发自动化可靠性。
产品优势
- 将生产追踪、离线实验、在线评测和人工标注连接成闭环。
- 事件模型覆盖模型、工具、链路、完整会话和多代理轨迹。
- 基于OpenTelemetry,可与现有可观测基础设施共同使用。
- 同时支持代码评测、模型裁判、人工量表和用户反馈。
- 数据集可以直接从真实生产故障持续整理和版本化。
- 提示词版本、部署和实验与追踪结果处于同一项目。
- 免费版无需信用卡,并提供10000事件和最多5名用户。
- 企业可选择多租户、单租户、混合和完整自托管。
- 公开OpenAPI、CLI和多种SDK,便于集成与自动化。
使用限制与注意事项
- 免费版按事件而非用户请求计数,复杂代理会快速消耗额度。
- Developer仅保留30天数据,不适合长期合规审计。
- 免费云端数据位于AWS美国西部区域,跨境要求需提前评估。
- 详细追踪可能记录提示、文档、个人信息、密钥和内部代码。
- 自动插桩会增加事件量,并可能对性能与日志成本产生影响。
- LLM裁判本身会出错、受提示注入影响并产生额外模型费用。
- 文档中的服务端模型裁判使用GPT-4o,敏感任务需确认数据路径。
- 自托管和单租户只在Enterprise提供,价格没有公开。
- 平台并非完整开源,公开SDK不能替代商业控制台和后端。
- 部分仓库已归档或没有明确许可证,新项目应核对维护状态。
- 仪表板和评测绿色不能代替安全测试、红队和真实业务结果。
- 生产质量标准需要持续更新,固定测试集可能逐渐失去代表性。
安全、隐私与合规
追踪可能包含用户提示、模型回答、检索文档、工具参数、业务标识、反馈和代码上下文。团队应在发送前完成字段级脱敏,使用独立项目密钥,并按生产、测试和开发环境隔离数据。
| 风险领域 | 可能问题 | 建议控制 |
|---|---|---|
| 自动插桩 | 无意记录令牌、请求正文和个人信息 | 白名单字段、过滤器和脱敏测试 |
| 模型裁判 | 数据被发送到外部模型 | 使用低敏样本、私有部署或替代评测 |
| 项目权限 | 工作区成员误访问生产数据 | 独立项目、最小角色和定期审查 |
| API密钥 | 泄露后可写入或读取遥测 | 密钥库保存、轮换和环境隔离 |
| 数据保留 | 免费版30天与审计要求不匹配 | 企业定制保留或外部归档 |
| 跨境数据 | 默认美国西部区域 | 评估地区、DPA和企业驻留选项 |
| 编码代理 | 记录仓库代码、文件和命令 | 排除敏感路径并限制遥测范围 |
| 人工标注 | 专家看到敏感客户对话 | 脱敏、权限、保密与审计日志 |
| 数据集导出 | 训练或评测文件扩散 | 审批导出、加密和到期删除 |
安全与合规声明
HoneyHive宣称数据静态和传输过程均加密,并具备SOC 2 Type II、GDPR与HIPAA相关合规能力,同时接受第三方渗透测试。受监管客户仍应索取当前报告、范围、例外、DPA、BAA和子处理商资料。
企业身份与访问
Developer提供社会化单点登录和基础角色控制;Enterprise增加SAML、定制单点登录、自定义角色和权限组。项目访问与工作区访问分开管理,成员仍需被明确加入项目。
提示词供应商密钥
Playground需要连接模型供应商,现行文档说明供应商密钥经加密后保存在浏览器缓存中。企业应确认浏览器管理、共享设备、缓存清理和密钥轮换是否符合内部政策。
基本信息
| 项目 | 内容 |
|---|---|
| 工具名称 | HoneyHive |
| 工具类型 | AI代理可观测、评测与提示词管理平台 |
| 主要用户 | AI工程、平台、产品和领域评测团队 |
| 核心标准 | OpenTelemetry |
| 免费版 | 每月10000事件、最多5人、30天保留 |
| 企业版 | 定制报价 |
| 云端地区 | Developer为AWS美国西部区域 |
| 部署 | 多租户、单租户、混合与自托管 |
| SDK | Python、TypeScript及开放接口客户端 |
| API | 提供 |
| MCP与CLI | 提供相关公开组件 |
| 平台开源 | 否 |
| 部分组件开源 | 是,许可证因仓库而异 |
| 主要数据 | 追踪、跨度、评测、数据集、提示和指标 |
常见问题
HoneyHive是什么?
它是一款AI代理可观测与评测平台,用于记录模型和工具轨迹、监控生产质量、运行实验、管理数据集、组织人工标注和控制提示版本。
HoneyHive免费吗?
Developer版免费且无需信用卡,每月包含10000个事件、最多5名用户、1个工作区、无限项目和30天数据保留。
10000个事件等于多少次请求?
没有固定换算。每个跨度和指标都会计为事件,一次包含多个工具、重试和指标的代理请求可能消耗数十甚至更多事件。
支持哪些评测?
支持客户端与服务端代码评测、LLM裁判、人工标注和用户反馈,可用于相关性、忠实度、轨迹、工具正确性、安全和业务指标。
可以自托管吗?
可以,但仅属于Enterprise。企业可选择完整自托管、托管控制平面加私有数据平面的混合模式,或单租户SaaS。
支持Python和TypeScript吗?
支持。Python用于追踪与评测,活跃TypeScript API Client用于平台接口;其他语言可以发送OpenTelemetry数据或依据OpenAPI生成客户端。
HoneyHive开源吗?
平台本身不是完整开源产品。OpenAPI、CLI、部分TypeScript客户端和技能采用MIT许可证,其他仓库需单独核对。
Realign还在维护吗?
不再主动维护。Realign仓库已在2025年12月归档为只读,新项目应优先使用当前HoneyHive评测框架。
能监控多代理系统吗?
可以。平台能够还原子代理、工具、循环、重试和交接,但需要应用正确传播追踪上下文与标识。
LLM裁判可靠吗?
不能直接假定可靠。应使用代表性样本与专家评分校准,并监控模型升级、提示注入、偏差、稳定性和成本。
适合处理医疗数据吗?
企业方案提供BAA并宣称具备HIPAA相关合规能力,但客户仍需确认部署方式、模型裁判、子处理商和追踪字段是否全部在覆盖范围内。
可以从Langfuse迁移吗?
文档提供迁移追踪、评测和历史数据的步骤,并为企业提供专有云与自托管选项。迁移前应比较字段映射、附件、指标和保留策略。
总结
HoneyHive适合已经把AI代理投入真实开发或生产,需要知道代理为何失败、怎样衡量质量以及如何防止回归的团队。其核心价值是让生产行为、领域专家和工程实验进入同一个持续学习循环。
小团队可以用免费版验证事件模型和评测流程,生产企业则应重点评估事件成本、30天保留、数据脱敏、模型裁判路径、身份管理和部署边界。只有把评测与真实业务结果、红队和人工责任结合,才不会把可观测仪表板误当成代理可靠性的充分证明。
桂公网安备45132202000164号