一句话介绍
Coval是一款面向AI语音与聊天智能体的持续质量平台,可在上线前模拟大量对话,在上线后监控真实通话,并把失败样本送入人工复核和回归测试。
工具简介
Coval由美国特拉华州公司Datawave Inc.运营,核心定位不是创建客服机器人,而是测试已有智能体是否能完成任务、遵守政策并在复杂语音环境中稳定工作。
平台把模拟、自动评测、生产监控、人工质检、可观测性和告警放在同一套流程中。产品、QA、运营和合规团队可以围绕统一指标判断版本是否达到上线标准。
主要功能
大规模对话模拟
Coval可以让合成用户与待测语音或聊天智能体进行对话,覆盖正常流程和边缘情况。模拟分钟按合成通话的实际持续时间计算,不按整分钟向上取整。
人物与环境配置
测试人物可以设置提示词、声音、语言、说话速度、音量、等待时间和由谁先开口。语音场景还可加入办公室、机场、人群、交通、雨声或婴儿哭声等背景噪声。
场景与测试集
团队可以把业务目标、用户行为、异常路径和禁止事项组织成可重复运行的测试集。每次提示词、模型、工具或供应商变更后,都能重新执行相同场景比较结果。
自动评测指标
平台支持内置与自定义指标,用于判断任务完成、事实依据、身份验证、升级处理、情绪、延迟、打断、工具调用和合规行为。指标数量受套餐限制。
知识库对照
每个智能体可以附加FAQ、政策或产品文档作为评测依据,让模型检查回答是否与权威资料一致。知识库能提高判定依据的相关性,但仍需要人工验证关键指标。
工作流可视化
智能体可配置可视化对话流程,标记预期步骤与决策点。团队可用它发现测试覆盖空白,并将业务流程与实际对话轨迹进行对照。
生产监控
Coval可对真实生产通话运行评测,识别质量漂移、重复失败和版本回归。监控调用量与模拟分钟分开计费,不能用一个额度替代另一个。
人工复核队列
失败指标、指定场景或抽样规则可以把通话送入人工复核队列。评审由客户自己的团队完成,Coval提供队列、界面和指标记录,不代替企业配备质检人员。
可观测性与实时告警
平台集中展示对话轨迹、音频、转录、指标和失败原因,并可针对高风险事件触发告警。告警规则必须经过噪声控制,否则容易产生大量低价值通知。
供应商对比
同一组场景可以运行在不同语音智能体或模型供应商上,用一致标准比较成功率、延迟和异常处理。对比结果只对所选数据、配置和时间窗口有效。
测试对象与连接方式
| 连接类型 | 适用对象 | 连接信息 | 核验重点 |
|---|---|---|---|
| 入站语音 | 接听客服电话的智能体 | 电话号码与认证 | 来电路由和录音合规 |
| 出站语音 | 销售、预约和通知智能体 | 电话连接与呼叫配置 | 呼叫同意和地区法规 |
| OpenAI兼容接口 | 文本聊天智能体 | 接口地址与密钥 | 请求格式、限流和数据范围 |
| 聊天WebSocket | 持续连接的文本对话 | 连接地址与认证 | 会话状态和断线处理 |
| 实时语音接口 | 端到端语音模型 | 实时连接配置 | 延迟、打断和音频质量 |
| 自定义Webhook | 未预置的平台或内部系统 | 回调与认证参数 | 签名、超时和重试 |
重点评测维度
- 任务是否完成,用户目标是否真正得到满足。
- 回答是否基于知识库,是否出现幻觉或无依据承诺。
- 身份验证、敏感操作和升级人工是否遵守政策。
- 延迟、沉默、打断、重叠说话和音频异常是否可接受。
- 工具调用参数、结果读取和失败恢复是否正确。
- 不同口音、语言、速度、情绪和背景噪声下是否稳定。
- 提示词、模型或供应商变更后是否出现质量回归。
- 高风险案例是否正确进入人工复核与告警流程。
持续质量工作流
- 连接待测智能体,并使用测试连接功能确认接口、电话或WebSocket可用。
- 定义业务工作流、成功条件、禁止行为和必须升级人工的情况。
- 建立人物、噪声、口音、异常输入和边缘场景组成的测试集。
- 配置自动指标与知识库依据,先用少量对话校准评分。
- 批量运行模拟,按失败类型、版本和场景分析结果。
- 修复提示词、模型、工具或业务流程后执行回归测试。
- 上线后接入生产监控,把关键失败送入人工复核队列。
- 将已确认的生产故障加入测试集,形成持续改进闭环。
快速使用教程
- 注册Coval并创建项目,根据智能体类型选择语音或聊天连接。
- 填写接口地址、电话号码和必要认证,保存后执行连接测试。
- 创建测试人物,设置角色目标、语言、声音和环境噪声。
- 编写测试场景,明确用户行为、预期结果与禁止结果。
- 添加任务完成、事实性、延迟和合规等评测指标。
- 运行小批量模拟并人工抽查,确认指标没有系统性误判。
- 扩大测试规模,比较版本并将结果接入发布门禁。
回归测试教程
- 从历史故障、投诉、人工质检和产品需求中整理稳定测试集。
- 锁定人物、场景、评测标准和关键环境参数,记录基准版本。
- 对提示词、模型、语音供应商或工具链的每次变更运行相同测试。
- 分别观察总体通过率与高风险场景,不用平均分掩盖严重失败。
- 对自动评分失败和临界案例进行人工复核。
- 仅在关键指标达到门槛且无阻断问题时允许发布。
生产监控与人工质检
- 监控真实对话时先确认录音、转录和个人信息处理的合法基础。
- 用失败驱动规则把合规、身份、支付或高损失案例优先送审。
- 结合随机抽样检查自动指标未识别的新型问题。
- 把人工结论反馈到指标和测试集,而不是只关闭工单。
- 按套餐保留期及时导出必要证据,避免历史轨迹到期消失。
- 为告警配置负责人、响应时限和升级路径。
套餐与价格
| 套餐 | 月付价格 | 年付价格 | 模拟分钟/月 | 监控通话/月 | 轨迹保留 |
|---|---|---|---|---|---|
| Starter | 100美元/月 | 960美元/年 | 100分钟 | 1,000次 | 30天 |
| Growth | 500美元/月 | 4,800美元/年 | 1,000分钟 | 10,000次 | 90天 |
| Enterprise | 4,500美元/月起 | 定制年度合同 | 定制 | 定制 | 定制 |
Starter和Growth年付相当于公开月付总价的八折。Enterprise起始价只是官网参考,私有网络、数据驻留、自带存储、支持和服务等级会影响最终报价。
套餐差异
| 项目 | Starter | Growth | Enterprise |
|---|---|---|---|
| 项目数 | 1个 | 5个 | 不限 |
| 席位 | 不限 | 不限 | 不限 |
| 并发模拟 | 5个 | 25个 | 定制 |
| 自定义指标 | 50个 | 250个 | 不限并可定制 |
| 人物库 | 10个 | 50个 | 定制 |
| 语音模型 | 基础 | 高级 | 定制或自带 |
| 接口限流 | 每分钟60次请求 | 每分钟300次请求 | 定制 |
| Webhook | 每项目5个 | 不限 | 不限 |
| 单点登录 | 无 | Google SSO | SAML SSO |
| 审计日志 | 无 | 30天 | 自定义保留 |
| 服务等级 | 未公开承诺 | 99% | 最高99.99% |
| 支持 | 社区与邮件 | 优先邮件和共享Slack | 专属渠道与工程师 |
超额费用与试用规则
| 项目 | Starter | Growth | Enterprise |
|---|---|---|---|
| 超额模拟 | 每分钟0.40美元 | 每分钟0.25美元 | 协商 |
| 超额监控 | 每分钟0.10美元 | 每分钟0.05美元 | 协商 |
| 免费试用 | 7天,需信用卡 | 7天,需信用卡 | 演示与合同 |
| 试用结束 | 自动转为所选套餐 | 自动转为所选套餐 | 按合同 |
| 付款方式 | 银行卡 | 银行卡与ACH | 采购单或发票等 |
官网说明试用期不收费,并会在结束前两天提醒;若未取消,会转为注册时选择的套餐。升级立即生效并按比例计费,降级从下一计费周期开始。
续订、取消与退款
- 月付方案可在应用内取消,服务通常持续到当前计费期结束。
- 年付方案在合同期限结束时取消,未用月份不能按月随意终止。
- Enterprise取消规则以双方签署的合同为准。
- 服务条款说明已支付费用不可退款,也不能抵销其他款项。
- 年付未用容量可在同一订阅期限内滚存,月付容量可能受当月限制。
- 超额用量实时累计,并在计费周期结束时按对应单价收取。
API、CLI、MCP与自动化
所有公开套餐都列出REST API、CLI、MCP服务器和skills框架。团队可以创建人物、测试集和运行任务,读取指标并把评测接入持续集成或智能编码工作流。
| 开发者入口 | 主要用途 | 开源情况 | 注意事项 |
|---|---|---|---|
| REST API | 管理智能体、人物、测试和评测运行 | 平台接口非开源 | 使用API密钥并遵守套餐限流 |
| CLI | 在终端和开发环境启动评测 | 官方仓库采用MIT许可证 | 仍需Coval账户与服务 |
| MCP Server | 让AI助手管理测试和读取指标 | 有官方公开仓库 | 严格限制工具权限和密钥 |
| GitHub Actions | 把评测加入持续集成 | 官方组件公开 | 设置失败门槛和超时 |
| External Skills | 复用智能体评测流程 | 官方仓库采用MIT许可证 | 审查每个技能的实际操作 |
| Benchmarks | 复现语音识别与合成测试 | 官方方法和代码公开 | 排行榜不等于业务场景表现 |
集成与兼容性
- Vapi、Retell、ElevenLabs和Twilio等语音智能体平台。
- OpenAI兼容聊天接口、OpenAI Realtime和Gemini Live。
- Pipecat Cloud、LiveKit与WebSocket智能体。
- 电话号码、标准接口和自定义Webhook连接。
- GitHub Actions、API、CLI、MCP和Agent Skills。
- 未列出的系统可评估通用电话或Webhook连接。
数据与隐私
Coval会处理测试场景、模拟结果、交互转录和录音、性能指标、自定义评测标准、生产监控数据及账户资料。客户保留Customer Data的权利,并授权Coval在订阅期内为提供服务而处理。
条款写明测试集、场景和评测标准对账户保持私密,不会与其他客户共享或用于训练Coval模型。隐私政策也声明不会使用个体客户数据训练惠及其他客户的AI模型,但允许使用聚合匿名数据改进服务。
安全与合规
| 项目 | Starter | Growth | Enterprise |
|---|---|---|---|
| SOC 2 Type II | 包含 | 包含 | 包含 |
| HIPAA基础设施 | 可用 | 可用 | 可用并可签BAA |
| GDPR | 标准支持 | 标准支持 | 可签定制DPA |
| 角色权限 | 基础 | 标准 | 定制 |
| IP白名单 | 无 | 无 | 可用 |
| 数据驻留 | 美国默认 | 美国默认 | 可选区域 |
| 私有或VPC部署 | 无 | 无 | 可用 |
| SCIM | 无 | 无 | 可用 |
官网把HIPAA-ready列入所有套餐,但签署BAA需要Enterprise。处理真实受保护健康信息前,不能只凭页面徽章判断合规,必须落实合同、权限、数据流和组织流程。
GitHub与开源状态
Coval拥有官方GitHub组织,公开CLI、MCP服务器、评测示例、外部skills、GitHub Actions、安装配方及语音基准等仓库。部分仓库采用MIT或Apache-2.0许可证。
商业平台、托管服务和完整评测基础设施并未整体开源。目录应标记为核心产品不开源、部分开发工具和基准项目开源,不能把CLI许可证扩展到Coval全部服务。
产品优势
- 覆盖上线前模拟、上线后监控、人工复核与回归测试。
- 特别考虑语音中的延迟、打断、噪声、口音和工具调用。
- 可用知识库和自定义指标表达具体业务与合规要求。
- 同一场景可用于版本回归和多供应商对比。
- 提供API、CLI、MCP、skills和持续集成组件。
- 套餐公开列出用量、超额单价、保留期和安全能力。
- Enterprise支持BAA、数据驻留、VPC和自带存储等需求。
使用限制与注意事项
- 自动指标本身可能误判,正式门禁前必须用人工标注集校准。
- 模拟人物和噪声不能完全代表真实用户与电话网络。
- 模拟分钟和生产监控分别计费,规模扩大后成本可能快速增长。
- 七天试用需要信用卡,未取消会自动转为付费套餐。
- 录音、转录和生产数据可能包含敏感信息,需满足告知与授权要求。
- Starter和Growth默认美国数据位置,其他驻留区域需Enterprise。
- HIPAA-ready不等于已经签署BAA,受监管使用必须完成合同流程。
- 产品核心并非开源,自托管仅在Enterprise定制方案中提供。
适合哪些用户
- 开发AI电话客服、销售、预约和通知智能体的团队。
- 需要建立语音智能体发布门禁的产品与QA部门。
- 运营大量真实通话并希望持续发现质量漂移的企业。
- 需要审核身份、披露、升级和政策遵循的合规团队。
- 比较Vapi、Retell、Twilio或不同模型方案的采购团队。
- 希望用API或持续集成自动运行智能体评测的工程团队。
不太适合哪些情况
- 只需要创建一个简单聊天机器人,而不需要系统评测。
- 没有明确成功标准、测试数据或人工复核人员的早期项目。
- 预算无法承担月费、模拟超额和生产监控超额费用。
- 必须完全本地部署,却不准备采购Enterprise方案的组织。
- 希望通过少量合成通话直接证明全部真实业务合规的团队。
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | Coval |
| 运营公司 | Datawave Inc. |
| 工具类型 | AI语音与聊天智能体测试、评估和监控平台 |
| 核心环节 | 模拟、评测、监控、人工复核和告警 |
| 公开起售价 | Starter每月100美元 |
| 免费体验 | 7天试用,需要信用卡 |
| 默认数据区域 | 美国 |
| 公共API | 有 |
| 官方CLI | 有 |
| MCP Server | 有 |
| 官方GitHub | 有 |
| 是否开源 | 核心平台不开源,部分工具和基准项目开源 |
| 私有部署 | Enterprise可选 |
推荐指数
推荐指数为4.4分,满分5分。Coval在语音智能体的模拟、生产监控、人工复核和工程化接入方面覆盖完整,价格与用量也公开得较细。
它更适合已经拥有智能体并准备建立质量体系的团队,而不是入门级机器人生成器。成本、自动评分可靠性和生产数据合规是采购前必须验证的三项重点。
常见问题
Coval是做什么的?
它用于测试和监控已有的AI语音或聊天智能体,通过合成对话、评测指标和人工复核发现失败。它不是直接替用户创建业务机器人。
Coval有免费套餐吗?
当前定价页提供七天免费试用,没有列出长期免费套餐。试用需要信用卡,结束后会自动转为所选付费方案。
Starter多少钱?
Starter月付100美元,年付960美元,每月包含100个模拟分钟和1,000次监控通话。超额模拟每分钟0.40美元。
模拟分钟怎么计算?
一段由Coval人物与语音智能体合成的通话持续几分钟,就消耗几分钟。官网说明不会按整分钟向上取整。
支持哪些语音平台?
官网列出Vapi、Retell、ElevenLabs和Twilio等一等集成,也支持电话与自定义Webhook。未列出平台是否兼容需实际连接测试。
可以监控真实通话吗?
可以,平台能对生产对话运行指标并识别漂移和失败。生产监控有独立额度和超额单价。
Coval会用客户数据训练模型吗?
官方条款声明测试集不用于训练自有模型,隐私政策也表示不会用个体客户数据训练惠及其他客户的模型。平台可使用聚合匿名数据改进服务。
支持API和MCP吗?
支持,所有公开套餐都列出REST API、CLI、MCP服务器和skills。调用限流和部分能力因套餐不同。
Coval开源吗?
核心商业平台不开源。官方GitHub公开CLI、MCP、基准、示例和持续集成组件,具体许可证应逐仓库确认。
可以私有部署吗?
Enterprise提供私有或VPC部署、数据驻留和自带存储等选项。架构、费用和运维责任需要与销售团队书面确认。
总结
Coval将AI语音与聊天智能体的测试从少量人工试拨扩展为可重复的模拟、自动评测、生产监控和人工复核闭环,适合建立正式发布标准。
购买前应按真实通话时长估算两类用量,校准自动指标,并确认录音、转录、数据驻留、BAA或DPA等要求。高风险场景不能仅凭自动通过率上线。
桂公网安备45132202000164号