一句話介紹
Coval是一個專為AI語音與聊天智能體打造的持續品質管理平台,可在上線前模擬大量對話,上線後則監控實際通話情況,並將失敗的樣本送入人工複核及回歸測試。
工具簡介
Coval由美國特拉華州的Datawave Inc.所運營,其核心目標並非打造客服機器人,而是測試現有的智慧體是否能夠完成任務、遵守相關規則,並在複雜的語音環境中穩定運作。
平台將模擬、自動評測、生產監控、人工品質檢查、可觀測性以及告警功能整合在同一個流程中。產品、QA、運營和合規團隊可以透過統一的指標來判斷版本是否達到上線標準。
主要功能
大規模對話模擬
Coval能讓合成用戶與待測語音或聊天智能體進行對話,涵蓋正常流程與邊緣情況。模擬時間是根據合成通話的實際持續時間來計算的,不會以整分鐘為單位向上取整。
人物與環境配置
測試人物可以設定提示詞、聲音、語言、說話速度、音量、等待時間,以及由誰先開口。語音場景還可加入辦公室、機場、人群、交通、雨聲或嬰兒哭聲等背景噪音。
場景與測試集
團隊可以將業務目標、使用者行為、異常路徑以及禁止事項整理成可重複運行的測試集。每次提示詞、模型、工具或供應商發生變更後,都能重新執行相同的場景並比較結果。
自動評測指標
平台支援內建與自訂指標,用於判斷任務完成、事實依據、身分驗證、升級處理、情緒、延遲、中斷、工具調用以及合規行為。指標數量受套餐限制。
知識庫對照
每個智能體可以附加FAQ、政策或產品文件作為評測依據,讓模型檢查回答是否與權威資料一致。知識庫能提高判定依據的相關性,但仍需要人工驗證關鍵指標。
工作流可視化
智慧體可配置可視化對話流程,標記預期步驟與決策點。團隊可用它發現測試覆蓋空白,並將業務流程與實際對話軌跡進行對照。
生產監控
Coval可對真實生產通話進行評測,識別品質漂移、重複失敗和版本回歸。監控調用量與模擬分鐘分開計費,不能以一個額度替代另一個。
人工複核隊列
失敗指標、指定場景或抽樣規則可以將通話送入人工複核隊列。評審由客戶自己的團隊完成,Coval負責提供隊列、介面及指標記錄,並不會取代企業配備的品質檢查人員。
可觀測性與即時告警
平台集中展示對話軌跡、音頻、轉錄、指標和失敗原因,並可針對高風險事件觸發告警。告警規則必須經過雜訊控制,否則容易產生大量低價值通知。
供應商對比
同一組場景可以運行在不同的語音智能體或模型供應商上,用一致標準比較成功率、延遲和異常處理。對比結果只對所選數據、配置和時間窗口有效。
測試對象與連接方式
| 連接類型 | 適用對象 | 連接資訊 | 核驗重點 |
|---|---|---|---|
| 入站語音 | 接聽客服電話的智能體 | 電話號碼與認證 | 來電路由和錄音合規 |
| 出站語音 | 銷售、預約和通知智能體 | 電話連接與呼叫配置 | 呼叫同意和地區法規 |
| OpenAI相容介面 | 文本聊天智能體 | 接口地址與密鑰 | 請求格式、限流和數據範圍 |
| 聊天WebSocket | 持續連接的文本對話 | 連接地址與認證 | 會話狀態和斷線處理 |
| 實時語音接口 | 端到端語音模型 | 實時連接配置 | 延遲、中斷和音訊品質 |
| 自訂Webhook | 未預置的平台或內部系統 | 回調與認證參數 | 簽名、超時和重試 |
重點評測維度
- 任務是否完成,使用者目標是否真正得到滿足。
- 回答是否基於知識庫,是否出現幻覺或無依據承諾。
- 身份驗證、敏感操作和升級人工是否遵守政策。
- 延遲、沉默、打斷、重複說話和音頻異常是否可接受。
- 工具呼叫參數、結果讀取和失敗恢復是否正確。
- 在不同口音、語言、速度、情緒和背景雜音下是否穩定。
- 提示詞、模型或供應商變更後是否出現品質回歸。
- 高風險案例是否正確進入人工複核與告警流程。
持續品質工作流
- 連接待測智慧體,並使用測試連接功能確認介面、電話或WebSocket可用。
- 定義業務工作流程、成功條件、禁止行為以及必須升級人工處理的情況。
- 建立由人物、噪聲、口音、異常輸入和邊緣場景組成的測試集。
- 配置自動指標與知識庫依據,先用少量對話校準評分。
- 批量運行模擬,按失敗類型、版本和場景分析結果。
- 修復提示詞、模型、工具或業務流程後執行回歸測試。
- 上線後接入生產監控,把關鍵失敗送入人工複核隊列。
- 將已確認的生產故障加入測試集,形成持續改進閉環。
快速使用教學
- 註冊Coval並創建專案,根據智能體類型選擇語音或聊天連接。
- 填寫介面地址、電話號碼及必要認證,儲存後執行連線測試。
- 創建測試人物,設定角色目標、語言、聲音和環境噪聲。
- 編寫測試場景,明確使用者行為、預期結果與禁止結果。
- 添加任務完成、事實性、延遲和合規等評測指標。
- 運行小批量模擬並人工抽查,確認指標沒有系統性誤判。
- 擴大測試規模,比較版本並將結果接入發布門禁。
回歸測試教學
- 從歷史故障、投訴、人工檢質和產品需求中整理穩定測試集。
- 鎖定人物、場景、評測標準和關鍵環境參數,記錄基準版本。
- 對提示詞、模型、語音供應商或工具鏈的每次變更運行相同測試。
- 分別觀察整體通過率與高風險場景,不用平均分掩蓋嚴重失敗。
- 對自動評分失敗和臨界案例進行人工複核。
- 僅在關鍵指標達到門檻且無阻斷問題時允許發布。
生產監控與人工品質檢查
- 監控真實對話時先確認錄音、轉錄和個人資訊處理的合法基礎。
- 用失敗驅動規則把合規、身分、支付或高損失案例優先送審。
- 結合隨機抽樣檢查自動指標未識別的新型問題。
- 把人工結論反饋到指標和測試集,而不是只關閉工單。
- 按套餐保留期及時導出必要證據,避免歷史軌跡到期消失。
- 為告警配置負責人、響應時限和升級路徑。
套餐與價格
| 套餐 | 月付價格 | 年付價格 | 模擬分鐘/月 | 監控通話/月 | 軌跡保留 |
|---|---|---|---|---|---|
| Starter | 100美元/月 | 960美元/年 | 100分鐘 | 1,000次 | 30天 |
| Growth | 500美元/月 | 4,800美元/年 | 1,000分鐘 | 10,000次 | 90天 |
| Enterprise | 4,500美元/月起 | 訂製年度合約 | 訂製 | 訂製 | 訂製 |
Starter和Growth年付的價格,相當於公開月付總價的八折。Enterprise的起始價格僅為官網上的參考數值,而私有網路、資料儲存方式、自帶儲存空間以及所享有的支援與服務等級,都會影響最終的報價。
套餐差異
| 項目 | Starter | Growth | Enterprise |
|---|---|---|---|
| 項目數 | 1個 | 5個 | 不限 |
| 席位 | 不限 | 不限 | 不限 |
| 併發模擬 | 5個 | 25個 | 訂製 |
| 自訂指標 | 50個 | 250個 | 不限并可訂製 |
| 人物庫 | 10個 | 50個 | 訂製 |
| 語音模型 | 基礎 | 高級 | 訂製或自帶 |
| 介面限流 | 每分鐘60次請求 | 每分鐘300次請求 | 訂製 |
| Webhook | 每項目5個 | 不限 | 不限 |
| 單點登入 | 無 | Google SSO | SAML SSO |
| 審計日誌 | 無 | 30天 | 自訂保留 |
| 服務等級 | 未公開承諾 | 99% | 最高99.99% |
| 支持 | 社區與郵件 | 優先郵件和共享Slack | 專屬渠道與工程師 |
超額費用與試用規則
| 項目 | Starter | Growth | Enterprise |
|---|---|---|---|
| 超額模擬 | 每分鐘0.40美元 | 每分鐘0.25美元 | 協商 |
| 超額監控 | 每分鐘0.10美元 | 每分鐘0.05美元 | 協商 |
| 免費試用 | 7天,需信用卡 | 7天,需信用卡 | 演示與合同 |
| 試用結束 | 自動轉為所選套餐 | 自動轉為所選套餐 | 按合約 |
| 付款方式 | 銀行卡 | 銀行卡與ACH | 採購單或發票等 |
官網說明,試用期間是免費的,且會在結束前兩天發出提醒;如果沒有取消,則會轉為註冊時所選擇的套餐。升級會立即生效,並按比例計費;而降級則從下一個計費週期開始生效。
續訂、取消與退款
- 月付方案可在應用內取消,服務通常持續到目前計費期結束。
- 年付方案在合約期限結束時取消,未用月份不能按月隨意終止。
- Enterprise取消規則以雙方簽署的合約為準。
- 服務條款說明已支付費用不可退款,也不能抵銷其他款項。
- 年付未用容量可在同一訂閱期限內滾存,月付容量可能受當月限制。
- 超額用量實時累計,並在計費週期結束時按對應單價收取。
API、CLI、MCP與自動化
所有公開的套件都列出了REST API、CLI、MCP伺服器以及skills框架。團隊可以建立角色、測試集並執行任務,同時也能讀取相關指標,並將評估結果整合到持續集成或智慧編碼的工作流程中。
| 開發者入口 | 主要用途 | 開源情況 | 注意事項 |
|---|---|---|---|
| REST API | 管理智能體、人物、測試和評測運行 | 平台介面非開源 | 使用API密鑰並遵守套餐限流 |
| CLI | 在終端和開發環境啟動評測 | 官方倉庫採用MIT許可證 | 仍需Coval賬戶與服務 |
| MCP Server | 讓AI助手管理測試和讀取指標 | 有官方公開倉庫 | 嚴格限制工具權限和金鑰 |
| GitHub Actions | 把評測加入持續集成 | 官方組件公開 | 設定失敗門檻和超時 |
| External Skills | 復用智能體評測流程 | 官方倉庫採用MIT許可證 | 審查每個技能的實際操作 |
| Benchmarks | 復現語音識別與合成測試 | 官方方法與代碼公開 | 排行榜不等於業務場景表現 |
集成與相容性
- Vapi、Retell、ElevenLabs和Twilio等語音智慧體平台。
- OpenAI相容聊天介面、OpenAI Realtime和Gemini Live。
- Pipecat Cloud、LiveKit與WebSocket智能體。
- 電話號碼、標準介面及自訂Webhook連接。
- GitHub Actions、API、CLI、MCP和Agent Skills。
- 未列出的系統可評估通用電話或Webhook連接。
數據與隱私
Coval會負責處理測試場景、模擬結果、互動轉錄與錄音內容、性能指標、自訂的評分標準,以及生產監控數據和帳戶資料。客戶保留對客戶資料的控制權,並授權Coval在訂閱期間為了提供服務而處理這些資料。
條款中明確規定,測試集、場景及評估標準都會被妥善保密,不會與其他客戶共享,也不會用於訓練Coval模型。隱私政策亦聲明,不會使用個別客戶的資料來訓練能為其他客戶帶來好處的AI模型,但允許使用經過彙總且已匿名化的資料來改進服務品質。
安全與合規
| 項目 | Starter | Growth | Enterprise |
|---|---|---|---|
| SOC 2 Type II | 包含 | 包含 | 包含 |
| HIPAA基礎設施 | 可用 | 可用 | 可用且可簽BAA |
| GDPR | 標準支援 | 標準支援 | 可簽訂定製DPA |
| 角色權限 | 基礎 | 標準 | 訂製 |
| IP白名單 | 無 | 無 | 可用 |
| 數據駐留 | 美國默認 | 美國默認 | 可選區域 |
| 私有或VPC部署 | 無 | 無 | 可用 |
| SCIM | 無 | 無 | 可用 |
官網將HIPAA-ready列為所有套餐的選項,但簽署BAA則需要Enterprise級別的服務。在處理真正的受保護健康資訊之前,不能僅憑頁面上的標章來判斷是否符合規定,必須落實合約、權限、資料流動方式以及組織流程等相關措施。
GitHub與開源狀態
Coval擁有官方的GitHub組織,其中包含了CLI、MCP伺服器、測試範例、外部技能相關資料、GitHub Actions相關內容、安裝說明以及語音檢測相關的檔案等。部分檔案是採用MIT或Apache-2.0授權條款來發布的。
商業平台、託管服務以及完整的評測基礎設施並未整體開源。目錄中應標明核心產品為非開源,而部分開發工具及基準專案則為開源,不得將CLI許可證擴展至Coval的所有服務。
產品優勢
- 覆蓋上線前模擬、上線後監控、人工複核與回歸測試。
- 特別考慮語音中的延遲、中斷、雜訊、口音和工具調用。
- 可用知識庫和自訂指標表達具體業務與合規要求。
- 同一場景可用於版本回歸和多供應商對比。
- 提供API、CLI、MCP、skills及持續整合組件。
- 套餐公開列出用量、超額單價、保留期和安全能力。
- Enterprise支援BAA、資料駐留、VPC及自帶儲存等需求。
使用限制與注意事項
- 自動指標本身可能誤判,正式門禁前必須用人工標註集校準。
- 模擬人物和噪聲不能完全代表真實用戶與電話網路。
- 模擬分鐘和生產監控分別計費,規模擴大後成本可能快速增長。
- 七天試用需要信用卡,未取消會自動轉為付費套餐。
- 錄音、轉錄和生產數據可能包含敏感資訊,需滿足告知與授權要求。
- Starter和Growth預設為美國資料位置,其他駐留區域需Enterprise。
- HIPAA-ready並不等於已簽署BAA,受監管使用必須完成合約流程。
- 產品核心並非開源,自託管僅在Enterprise訂製方案中提供。
適合哪些用戶
- 開發AI電話客服、銷售、預約和通知智能體的團隊。
- 需要建立語音智能體發布門禁的產品與QA部門。
- 運營大量真實通話並希望持續發現品質漂移的企業。
- 需要審核身份、披露、升級和政策遵循的合規團隊。
- 比較Vapi、Retell、Twilio或不同模型方案的採購團隊。
- 希望用API或持續集成自動運行智能體評測的工程團隊。
不太適合哪些情況
- 只需要創建一個簡單的聊天機器人,而不需要系統評測。
- 沒有明確成功標準、測試數據或人工複核人員的早期項目。
- 預算無法承擔月費、模擬超額和生產監控超額費用。
- 必須完全本地部署,卻不準備採購Enterprise方案的組織。
- 希望透過少量合成通話直接證明全部真實業務合規的團隊。
基本資訊
| 字段 | 內容 |
|---|---|
| 工具名稱 | Coval |
| 運營公司 | Datawave Inc. |
| 工具類型 | AI語音與聊天智能體測試、評估和監控平台 |
| 核心環節 | 模擬、評測、監控、人工複核和告警 |
| 公開起售價 | Starter每月100美元 |
| 免費體驗 | 7天試用,需要信用卡 |
| 預設資料區域 | 美國 |
| 公共API | 有 |
| 官方CLI | 有 |
| MCP Server | 有 |
| 官方GitHub | 有 |
| 是否開源 | 核心平台不開源,部分工具和基準項目開源 |
| 私有部署 | Enterprise可選 |
推薦指數
推薦指數為4.4分,滿分5分。Coval在語音智能體的模擬、生產監控、人工複核以及工程化接入等方面功能完整,其價格與用量也都有相當詳細的公開資料。
它更適合那些已經擁有智能體且準備建立品質管理體系的團隊,而非初學者使用的機器人生成工具。在採購之前,必須先確認成本、自動評分系統的可靠性,以及生產數據的合規性這三個重點。
常見問題
Coval是做什麼的?
它用於測試和監控已有的AI語音或聊天智能體,透過合成對話、評測指標和人工複核來發現故障。它並非直接替用戶創建業務機器人。
Coval有免費套餐嗎?
目前,定價頁面提供七天的免費試用期,並未列出長期的免費方案。試用時需要使用信用卡,試用期結束後會自動轉為所選的付費方案。
Starter多少錢?
Starter方案的月費為100美元,年費則為960美元。每個月可使用100分鐘的模擬通話時間,以及1,000次監控通話次數。若超過此限制,則每分鐘需支付0.40美元的費用。
模擬分鐘怎麼計算?
一段由Coval人物與語音智能體合成的通話持續幾分鐘,就消耗幾分鐘。官網說明不會按整分鐘向上取整。
支持哪些語音平台?
官網列出了Vapi、Retell、ElevenLabs和Twilio等一流的整合服務,同時也支援電話與自訂Webhook。至於各平台是否相容,則需要實際連線測試才能確定。
可以監控真實通話嗎?
可以,平台能對生產對話運行指標並識別漂移和失敗。生產監控有獨立額度及超額單價。
Coval會用客戶數據訓練模型嗎?
官方條款聲明測試集不用於訓練自有模型,隱私政策亦表示不會用個體客戶數據訓練惠及其他客戶的模型。平台可使用聚合匿名數據改進服務。
支援API和MCP嗎?
支持,所有公開套餐都列出REST API、CLI、MCP伺服器和skills。呼叫限流及部分功能因套餐不同而有所差異。
Coval是開源的嗎?
核心商業平台不開源。官方GitHub公開了CLI、MCP、基準、範例以及持續整合組件,具體許可證則需依各個倉庫來確認。
可以私有部署嗎?
Enterprise提供私有或VPC部署、資料儲存以及自帶儲存等選項。其架構、費用及維運責任需與銷售團隊以書面方式確認。
總結
Coval將AI語音與聊天智能體的測試,從少量的手動試撥,擴展為可重複的模擬、自動評測、生產監控以及人員復核的閉環流程,適合用於建立正式發布的標準。
購買前應按真實通話時長估算兩類用量,校準自動指標,並確認錄音、轉錄、數據駐留、BAA或DPA等要求。高風險場景不能僅憑自動通過率上線。
桂公網安備45132202000164號