一句話介紹
Hamming AI是一個用於為語音及聊天智能體提供上線前測試、生產監控、安全紅隊測試以及回歸測試等功能的企業級品質保證平台。
工具簡介
Hamming的核心工作並非為企業打造客服機器人,而是驗證現有的智慧體是否準確、自然、穩定且安全,並能夠達成業務目標。該團隊可以連接現有的語音平台或自行開發的系統,自動生成測試場景,再透過真實的通話路徑進行運行與評分。
平台將測試、監控和問題修復整合成一個循環。在實際通話中發現的故障,可以轉換為可重複使用的回歸測試案例;在提示詞、模型或基礎設施更新之後,再執行這些測試案例,以避免類似的問題再次出現。
產品定位
| 能力層 | 解決的問題 | 典型使用階段 | 主要輸出 |
|---|---|---|---|
| 模擬測試 | 智能體在真實對話中會不會失敗 | 開發與預發布 | 場景、錄音、轉寫、評分和失敗證據 |
| 回歸測試 | 版本更新是否破壞原有能力 | 每次提示詞、模型或代碼變更 | 版本對比與發布門禁 |
| 壓力測試 | 併發增加後系統是否穩定 | 容量規劃與重大上線前 | 延遲、錯誤、吞吐和尾部指標 |
| 安全紅隊 | 是否會被越獄、注入或誘導洩漏數據 | 安全驗收和持續驗證 | 風險發現與可重複用例 |
| 生產監控 | 真實客戶通話是否發生品質或合規問題 | 正式運行階段 | 告警、趨勢、審查隊列和證據 |
| 生產回放 | 修復是否解決真實失敗 | 事故復盤與修復驗證 | 保留語音、時序和預期意圖的測試 |
主要功能
自動生成測試場景
團隊可以貼上智能體系統的提示詞,或連接現有平台,讓Hamming產生大量正常路徑、邊界情況、對抗性輸入、口音及雜訊場景。生成的結果仍需業務人員檢查其覆蓋範圍與預期答案。
音頻原生評測
Hamming不僅分析轉寫後的文字,還會直接檢查音頻層面的輪次、中斷、靜音情況、單人長時間講話的狀況,以及語音的清晰度與情緒表達。如此一來,就能發現那些看似正確,但實際聽起來很差的問題。
多輪對話與跨通話流程
測試可以涵蓋多輪上下文,也能構建同一角色分多次通話完成預約、改期和取消的序列。該能力適合驗證狀態保持和跨互動業務流程。
生產通話轉回歸用例
團隊可將真實的失敗通話一鍵轉換為可重放的測試,並保留呼叫者的音頻、語音辨識文本、時序及預期意圖。修復後在相同條件下再次運行,比重新編寫類似腳本更容易驗證。
安全與合規紅隊
預設的紅隊場景涵蓋了提示注入、越獄、社會工程學攻擊、敏感資訊洩露、越權工具使用,以及違反政策的行為等風險。企業還可以定義行業相關的腳本、必須公開的內容,以及禁止回覆的問題。
IVR與DTMF測試
Hamming可以模擬傳統電話的選單功能、發送DTMF按鍵音,並驗證智慧體是否能正確地透過IVR進行操作。它同時支援進站、出站以及直接的WebRTC通訊路徑。
生產健康檢查
平台可每隔數分鐘重放一組黃金通話,發現模型變化、基礎設施故障或提示詞回歸。指標超出閾值時可以透過郵件、Slack或其他告警渠道通知團隊。
測試條件與角色模擬
- 不同地區的語言、口音和方言。
- 辦公室、街道、人群和其他背景噪音。
- 快速或緩慢說話、長靜音和意外輸入。
- 用戶中途打斷、搶話和代理說話過長。
- 老年呼叫者、情緒激動和辱罵場景。
- API超時、語音識別置信度低和上下文遺失。
- 預約、付款、身分驗證、轉接人工以及取消等業務流程。
- 提示注入、越獄、敏感數據提取和政策繞過。
評測指標
Hamming目前宣傳提供50多項內建指標,並允許用自然語言定義業務專屬的評分器。評測分為對話品質、預期結果和合規護欄三類,不應只看單一的平均分數。
| 指標類別 | 代表指標 | 可以發現的問題 |
|---|---|---|
| 準確與相關 | 事實準確、意圖識別、相關性與幻覺 | 回答錯誤、誤解需求或編造資訊 |
| 任務完成 | 目標完成、欄位採集和工具調用成功 | 口頭承諾完成但後台動作失敗 |
| 延遲 | 首詞時間、輪次延遲、p50、p90和p99 | 平均值正常但少量通話非常慢 |
| 對話流 | 輪次數、打斷、沉默、重複和獨白 | 機械感、搶話或用戶無法插入 |
| 語音與音頻 | 清晰度、雜訊、口音和轉寫品質 | 特定人群或環境表現下降 |
| 情緒 | 語音級情緒和趨勢 | 客戶挫敗或負面升級 |
| 合規 | 腳本遵循、披露、PII、PHI和支付資訊 | 政策或監管風險 |
| 自訂評分 | 企業規則和行業閾值 | 通用指標無法覆蓋的業務要求 |
端到端延遲分解
延遲分析涵蓋語音活動檢測、自動語音識別、LLM處理以及文字轉語音等完整流程。團隊可以比較各組件的貢獻,而非僅觀察使用者所聽到的整體等待時間。
AI評分與人工校準
Hamming運用 AI 來評估意圖與整體結果,並聲稱音頻原生評測與人工判斷的一致度約在 95% 至 96% 之間。這是廠商所測得的指標,企業仍應在自己的語言、領域和風險等級上進行盲測與人工校準。
測試與生產監控的區別
| 項目 | 上線前測試 | 生產監控 |
|---|---|---|
| 數據 | 合成角色與受控場景 | 真實客戶通話或生產證據 |
| 目標 | 在發布前發現可重現問題 | 發現漂移、事故和未知失敗 |
| 風險 | 可在沙盒中隔離副作用 | 會接觸真實個人和業務數據 |
| 運行方式 | 按計劃、版本或CI觸發 | 持續或定期健康檢查 |
| 結果 | 通過、失敗、指標和回歸差異 | 趨勢、告警、審查和事故證據 |
| 後續動作 | 修復後重跑並決定是否發布 | 轉成回歸用例並調整告警 |
兩者需要共用指標和用例,但不能互相替代。模擬測試無法覆蓋全部真實行為,生產監控也不應成為在真實客戶身上試錯的藉口。
支援的語言與口音
Hamming目前宣稱支援65種以上語言,包括英語、西班牙語、葡萄牙語、法語、德語、阿拉伯語、印地語、泰米爾語、日語、韓語和中文等。
| 語言或地區 | 公開列出的口音或變體 | 測試建議 |
|---|---|---|
| 英語 | 美國、英國、澳大利亞、印度和紐西蘭 | 加入本地俚語、姓名和號碼格式 |
| 西班牙語 | 拉丁美洲、歐洲和美國西語 | 按目標市場分別設定預期 |
| 阿拉伯語 | 現代標準、海灣、黎凡特、埃及和馬格里布 | 測試方言切換與混合語言 |
| 中文 | 簡體普通話、繁體和粵語 | 分別評估識別、語音和數字表達 |
| 泰米爾語 | 印度與斯里蘭卡變體 | 加入地區口音和英語混說 |
| 葡萄牙語 | 巴西與歐洲葡語 | 不要混用評分基線 |
| 日語與韓語 | 標準及部分地區變體 | 測試敬語、停頓和專有名詞 |
語言數量並不等於每種語言都擁有相同的音色、口音覆蓋範圍以及評測準確率。在上線之前,應為每個目標市場建立獨立的說話者群組、領域詞彙以及人工基準。
集成能力
| 平台或協議 | 接入方式 | 當前公開能力 |
|---|---|---|
| SIP | 撥打測試號碼或由平台呼叫 | 入站、出站、IVR和DTMF測試 |
| LiveKit | API密鑰或直接WebRTC | 同步智能體、運行測試和監控 |
| Pipecat | 直接WebRTC或平台連接 | 測試自訂語音流水線 |
| Daily | WebRTC連接 | 網頁語音智能體測試 |
| ElevenLabs | 連接帳號或API密鑰 | 導入智能體與運行評測 |
| Retell | API密鑰與區域設定 | 每5分鐘自動同步智能體、錄音和工具調用 |
| Vapi | 平台連接 | 導入智能體並執行一致指標評測 |
| Bland | 平台連接 | 自動測試現有語音智能體 |
| 自研系統 | SIP、WebRTC或REST API | 適配任意LLM、ASR和TTS組合 |
| OpenTelemetry | 導入traces、spans和logs | 關聯通話、組件和基礎設施證據 |
Retell集成示例
Retell連接可導入智能體、區域、工具調用、轉寫和錄音,並預設每5分鐘同步一次。測試時應使用獨立專案或測試帳號,避免將負載和副作用寫入正式業務。
使用教學
完成第一次語音智能體測試
- 建立Hamming工作區或預約演示,並確認當前方案的測試量與數據規則。
- 選擇LiveKit、Pipecat、ElevenLabs、Retell、Vapi、Bland、SIP或自研接入。
- 使用測試專用金鑰連接智能體,並限制可訪問的項目和環境。
- 導入系統提示詞、工具定義和必要文件,讓平台生成初始場景。
- 由產品、QA和業務人員審查場景、期望結果與風險等級。
- 先運行小批量測試,檢查通話能接通、錄音完整和評分方向正確。
- 展開到口音、噪聲、打斷、錯誤邊界和對抗場景。
- 查看失敗錄音、轉寫、工具證據和組件延遲,修復後再次運行。
建立CI/CD回歸門禁
- 把穩定的正常路徑、關鍵邊界和歷史事故整理為版本化測試集。
- 使用REST API在每次提示詞、工具、模型或代碼部署前觸發測試。
- 設定任務完成、準確率、合規性、延遲以及關鍵用例的最低閾值。
- 將測試運行與具體智能體版本、提示詞哈希和部署提交關聯。
- 當關鍵指標下降或安全用例失敗時阻止發布。
- 在報告中保留錄音、轉寫、工具調用和評分理由供人工複核。
- 對偶發失敗進行重複運行和校準,不要直接降低閾值掩蓋問題。
- 上線後將新生產失敗轉為永久回歸覆蓋。
配置生產監控
- 確定需要導入全部通話、抽樣通話還是僅導入異常事件。
- 定義音頻、原始轉寫、脫敏轉寫、工具調用和元數據的權限。
- 為準確、合規、延遲、情緒和任務完成設定分級閾值。
- 將工程問題發送到工程通道,合規問題發送到受限審查通道。
- 使用黃金通話做定期健康檢查並記錄基線。
- 建立人工審查、標註、覆蓋和校準流程。
- 把嚴重失敗轉換成回歸測試並指定修復負責人。
- 定期複核告警噪聲、資料保存和用戶訪問權限。
生產回放與事故閉環
傳統方法常根據轉寫重新編寫一個相似場景,容易失去原始語音、停頓、雜訊和時序。Hamming的生產回放則保留這些條件,用同一失敗證據測試新版本。
- 標記產生客戶影響或高風險的生產通話。
- 確認錄音、轉寫、工具調用和期望意圖完整。
- 去除不需要的個人資料或在受控環境使用。
- 將通話轉換為帶有版本和負責人資訊的回歸用例。
- 在修復前後運行相同場景並比較結果。
- 將修復證據加入發布審查和事故報告。
- 定期檢查歷史事故是否仍被持續執行。
壓力與併發測試
企業級負載測試環境可同時執行超過50,000個並發測試通話,涵蓋入站、出站以及直接WebRTC通話。一般工作環境的預設並發數約為50路,且可配置至100路以上,具體上限則取決於所使用的方案以及被測平台的處理能力。
| 測試維度 | 應觀察的指標 | 常見失敗 |
|---|---|---|
| 呼叫建立 | 接通率、建連時間和失敗碼 | 號碼、SIP或區域限流 |
| 語音識別 | WER、延遲和低置信度比例 | 併發下隊列或丟棄畫面 |
| LLM | 首Token、完成時間和錯誤率 | 供應商限流或上下文過載 |
| 語音合成 | 首音頻、卡頓和失敗率 | 音頻隊列或配額不足 |
| 工具調用 | 成功、超時、重試和幀等 | 重複預約或重複寫入 |
| 整體對話 | p50、p90、p99以及任務完成情況 | 平均正常但尾部崩潰 |
| 成本 | 每通、每分鐘和供應商成本 | 測試規模導致意外費用 |
負載測試會同時消耗Hamming、電話、語音、模型和業務API的配額。團隊必須設定最大併發數、預算、沙盒以及緊急停止機制,不得直接影響正式客戶的系統。
價格與套餐
截至2026年8月23日,Hamming尚未公佈固定的套餐價格。其定價主要是根據測試量及生產使用量來決定,而非以會員人數為依據;具體的費用與價格則會在示範及入門流程中說明。
| 方案或階段 | 公開價格 | 計費依據 | 團隊席位 | 主要權益 |
|---|---|---|---|---|
| 個性化演示 | 免費 | 約25分鐘演示,不是產品免費試用 | 不受適用 | 結合實際智能體和場景展示 |
| Startup方案 | 聯絡銷售 | 數百級測試量或實際需求 | 主要不按席位收費 | 測試、監控和團隊協作範圍按報價 |
| 成長或常規團隊 | 聯絡銷售 | 測試量、代理數量和生產調用 | 可邀請整個團隊 | 更高測試量、集成和支持 |
| Enterprise | 訂製報價 | 大規模測試、生產通話和合約要求 | 不以席位為主要計價 | 批量折扣、訂製集成、專屬成功支援及SLA |
是否有免費試用
目前的 FAQ 明確指出,不提供傳統的免費自試服務,而是透過個人化示範與入門指南,讓團隊能夠親自體驗其智慧體功能。網站上仍有一些地方有「開始免費試用」這類舊式的按鈕,但無法以此作為現行免費使用額度的承諾依據。
報價前應確認
- 每月包含的測試次數、分鐘數、併發及生產監控通話量。
- 電話、語音、模型和第三方平台費用由誰承擔。
- 自動生成場景、評分器及重複運行是否分別計費。
- 資料保存、導出、單租戶和地區部署是否另收費用。
- API、MCP、Webhooks、OpenTelemetry和CI/CD是否包含。
- 超量單價、最短合約、續費、取消和退款規則。
- 企業支援嚴重度、10分鐘至4小時回應如何映射。
- 50,000路併發負載活動的單獨報價及前置容量要求。
支援與服務
| 支持方式 | 適用範圍 | 公開說明 |
|---|---|---|
| 郵件支援 | 所有客戶 | 日常問題與工單 |
| 線上聊天 | 所有客戶 | 產品內快速協助 |
| 專屬Slack | 入門客戶 | 直接聯絡工程團隊 |
| 集成支援 | 所有客戶,企業更深入 | 協助SIP、WebRTC、平台和API連接 |
| 企業SLA | Enterprise | 按嚴重度約10分鐘至4小時回應 |
| 訂製集成 | Enterprise | 按需求開發和維護 |
| 客戶成功管理 | Enterprise | 定期檢查、培訓和優化 |
API、MCP與開發工具
Hamming提供REST API,可用於安排測試、取得測試結果、設定智能體、管理測試用例以及讀取監控數據。它還能與GitHub Actions、Jenkins以及其他CI/CD流程整合,並透過Webhooks來驅動自動化操作。
目前的完整文件需要密碼才能存取,且主要提供給已入門的客戶使用。公開的行銷資料中雖提到了SDK、MCP伺服器以及OpenTelemetry的導入方式,但關於介面的穩定性、權限及版本等細節,仍應以工作區內的文件為準。
| 開發能力 | 當前狀態 | 主要用途 | 注意事項 |
|---|---|---|---|
| REST API | 正式提供,文件受限 | 運行測試、管理用例和讀取監控 | 需客戶帳號與憑證 |
| Webhooks | 正式提供 | 將測試結果與告警連接到外部流程 | 事件簽名和重試需看客戶文件 |
| CI/CD | 支持 | 在每次發布前執行品質門禁 | 需要穩定測試集和版本關聯 |
| OpenTelemetry | 支持 | 導入traces、spans和logs | 應控制敏感屬性和採樣 |
| MCP伺服器 | 官方資源稱提供 | 運行測試、查詢通話和搜尋轉寫 | 公開安裝文件有限 |
| Python SDK | 公開包最後更新於2024年 | 調用早期Hamming平台 | 版本0.0.17,需確認與當前API相容 |
| JavaScript SDK | 公開包最後更新較早 | 早期Evals框架 | 不能視為當前主接口的活躍保證 |
GitHub與開源情況
Hamming平台本質上是一種商業性的封閉式服務,其官方網站並未將完整的產品代碼或評估模型以開源形式公開。在公開的套件管理器中,雖有使用MIT或ISC授權的早期SDK,但這些SDK僅包含用戶端代碼而已。
| 項目 | 公開狀態 | 許可證或維護 | 結論 |
|---|---|---|---|
| Hamming商業平台 | 未公開完整源碼 | 商業服務 | 不開源 |
| 評測模型與運行系統 | 未公開 | 未披露 | 不是開放權重項目 |
| hamming-sdk Python套件 | 公開 | MIT,0.0.17,2024年9月更新 | 早期SDK,不代表平台開源 |
| hamming-sdk JavaScript套件 | 公開 | ISC,1.0.27,約兩年前更新 | 早期SDK,維護狀態需確認 |
| 第三方C# SDK | 公開但由tryAGI維護 | MIT | 不是Hamming官方產品代碼 |
新集成應優先使用客戶工作區中的現有REST API文件,而非僅依賴舊版SDK套件來開發。採購時應要求明確API版本的支援情況、廢止通知、SDK的發展方向以及退出時的資料導出方式。
隱私政策
Hamming的合法經營實體為Forward Inc,現行的公開隱私政策最後更新時間為2024年12月14日。此政策適用於網站、帳號、銷售、行銷以及相關服務。
| 數據或規則 | 當前政策 |
|---|---|
| 帳號與聯絡資訊 | 姓名、電話、信箱、地址、職位、用戶名和密碼等 |
| 付款 | 支付工具資訊由Stripe保存 |
| 自動收集 | IP、瀏覽器、裝置、使用時間、Cookies及分析數據 |
| 敏感資訊 | 只有與客戶簽署BAA後才處理 |
| 客戶數據訓練 | 不用於訓練,也不用於惠及其他客戶 |
| 用戶生成數據銷售 | 不出售 |
| 網站分析 | 使用Google Analytics |
| 一般保存 | 在帳號有效及業務目的需要期間保存,法律要求可更久 |
| 無法立即刪除的備份 | 安全隔離,直到可以刪除 |
| 未成年人 | 不主動收集或營銷給18歲以下用戶 |
隱私政策並未為所有的錄音、轉寫及測試證據規定統一的固定保存天數。FAQ中說明,測試錄音會以加密方式儲存,且可根據客戶的要求來設定保存期限;在投入生產使用之前,應在訂單或DPA中確定具體的數值。
數據權利
- 符合條件的用戶可請求訪問、導出、更正或刪除個人資訊。
- 部分地區用戶可限制敏感資訊使用或反對特定處理。
- 用戶可以退出行銷郵件並撤回適用的同意。
- 終止帳號後,平台會刪除或停用活躍資料庫中的資訊。
- 為防欺詐、調查、執行條款或法律要求,部分記錄可能繼續保留。
- 隱私請求和申訴透過官方聯絡信箱處理。
安全與合規
Hamming在2025年12月完成了SOC 2審計,目前其官網上標示的為SOC 2 Type II。醫療業界的客戶可以簽署BAA協議,以符合HIPAA的規定。此外,該平台還提供美國、歐盟及英國地區的資料儲存服務,以及單一租戶模式。
| 控制或能力 | 當前公開狀態 | 採購核驗 |
|---|---|---|
| SOC 2 Type II | 已完成並在官網展示 | 索取當前報告、期間、範圍和例外 |
| HIPAA | 可簽署BAA | 在任何PHI進入平台前完成簽署 |
| 加密 | 錄音與數據在傳輸和靜態狀態加密 | 確認算法、密鑰和備份範圍 |
| RBAC | 支持 | 按工程、產品、QA和管理角色測試 |
| SSO | 支持Okta等企業身份服務 | 確認SAML或OIDC、強制範圍和離職撤權 |
| 審計日誌 | 支援且可導出至SIEM | 確認事件覆蓋和保存期 |
| 數據駐留 | 美國、歐盟和英國選項 | 確認所有分包商、備份和支持數據 |
| 單租戶 | 企業選項 | 驗證網路、金鑰、升級和管理面隔離 |
| PII檢測 | 測試和監控洩漏風險 | 不能替代完整脫敏和訪問控制 |
SOC 2和BAA並不代表客戶的系統能自動符合所有法規要求。錄音授權、支付卡相關事項、醫療資訊、資料轉移、行銷電話以及責任界定等事宜,仍需由客戶自行設定、測試並持續監控。
生產數據安全建議
- 先用完全合成的數據完成基礎POC,不上傳真實客戶錄音。
- 審查SOC 2範圍、DPA、BAA、分包商、資料流及事件回應。
- 為音頻、原始轉寫、脫敏轉寫、元數據和工具證據分別設定保存期。
- 配置SSO、MFA、RBAC和最小權限,並定期複核訪問。
- 在導入前移除不需要的PII、PHI、支付卡和憑證。
- 限制人工支援人員訪問真實生產證據的條件和審計。
- 驗證導出、刪除、備份過期及合約終止流程。
- 每次新增模型、平台、地區或分包商後重新執行風險審查。
適合哪些用戶
- 語音AI工程團隊:驗證提示詞、模型、ASR、TTS、工具和延遲。
- QA團隊:建立自動化場景、回歸集和發布門禁。
- 產品經理:定義業務成功並比較不同智能體版本。
- 客服與運營:發現生產通話中的失敗和客戶痛點。
- 安全團隊:執行提示注入、越獄、PII洩露及工具越權測試。
- 合規團隊:檢查腳本、身分驗證、揭露及審計證據。
- 醫療與金融機構:在簽署適用合約後監控高風險語音流程。
- 平台廠商和系統集成商:對多家語音供應商採用統一指標。
典型使用場景
- 在預約機器人上線前驗證創建、改期、取消和工具寫入。
- 更換LLM、ASR或TTS後比較品質、延遲和成本。
- 對新提示詞運行歷史回歸,防止舊問題重新出現。
- 測試口音、雜音、中斷以及長達70輪以上的複雜通話。
- 用50,000路以上併發活動評估企業峰值容量。
- 在生產環境持續檢測幻覺、偏離腳本和隱私洩露。
- 將真實客戶的失敗案例回放到修復版本並生成發布證據。
- 將測試結果與CI、Slack、SIEM和OpenTelemetry連接。
產品優勢
- 覆蓋測試、監控、紅隊、回放和回歸的完整生命週期。
- 直接分析音頻,能發現轉寫文本看不出的互動問題。
- 自動根據提示詞生成大量場景,降低手動編寫成本。
- 支援65種以上語言、地區口音、雜音及不同的說話行為。
- 原生連接多種主流語音平台,也支援SIP、WebRTC和自研系統。
- 50多項內建指標加不限數量的自訂評分器。
- 支援CI/CD、REST API、Webhooks和OpenTelemetry。
- 企業併發負載可擴展到50,000路以上。
- SOC 2 Type II、BAA、資料存放要求、SSO以及單一租戶模式,均能滿足企業的採購需求。
- 計費主要按測試量而非席位,跨團隊協作不額外增加主要席位費。
主要限制
- 沒有公開固定套餐金額,預算需要經過演示和報價。
- 不提供傳統自助免費試用,個人開發者體驗門檻較高。
- 公開文件需要訪問碼,API端點和權限無法在購買前完整瀏覽。
- 舊版Python和JavaScript SDK已約兩年未更新,相容性需確認。
- AI評分即使與人工較一致,也可能在新語言或領域產生偏差。
- 高併發測試會同時消耗電話、語音、模型和業務API費用。
- 生產監控會處理真實錄音、轉寫和工具證據,需要嚴格數據治理。
- 廠商發布的95%預測準確率、95%至96%的人工一致性以及90%的競品勝率,皆需在自身場景中重新驗證。
- 平台面向企業品質保障,不是用來直接構建語音智能體的完整運行時。
支援平台
| 平台或方式 | 支持情況 | 主要用途 |
|---|---|---|
| Web控制台 | 支持 | 配置測試、查看錄音、報告、趨勢和監控 |
| SIP電話 | 支持 | 入站、出站、IVR、DTMF與傳統電話鏈路 |
| WebRTC | 支持 | LiveKit、Pipecat、Daily和網頁智能體 |
| REST API | 支持,客戶文件受限 | 自動化測試、結果和監控 |
| Webhooks | 支持 | 連接流水線、告警和外部系統 |
| CI/CD | 支持 | GitHub Actions、Jenkins及其他系統 |
| OpenTelemetry | 支持 | 導入追蹤、跨度和日誌 |
| MCP | 官方資源稱支援 | 查詢通話、分析品質和運行測試 |
| 移動原生應用 | 未發現 | 主要透過網頁使用 |
| 瀏覽器擴充功能 | 未發現 | 無公開擴展 |
基本資訊
| 項目 | 內容 |
|---|---|
| 工具名稱 | Hamming AI |
| 法律實體 | Forward Inc |
| 成立時間 | 2024年 |
| 創始人兼CEO | Sumanyu Sharma |
| 加速器 | Y Combinator S24 |
| 產品類型 | 語音與聊天智能體測試、監控和安全評測 |
| 主要客戶 | 語音AI團隊、企業客服、醫療、金融和高成長公司 |
| 語言 | 65種以上 |
| 內建指標 | 50多項 |
| 企業負載 | 50,000路以上併發測試通話 |
| 定價 | 訂製報價,主要按測試量和使用量 |
| 傳統免費試用 | 不提供,改為個性化演示與入門 |
| API | 有,完整文件客戶可見 |
| SDK | 有早期Python和JavaScript套件,目前維護需確認 |
| 是否開源 | 產品不開源,部分舊客戶端SDK開源 |
| SOC 2 | Type II |
| HIPAA | 支持簽署BAA |
| 數據駐留 | 美國、歐盟和英國選項 |
| 核驗日期 | 2026年8月23日 |
推薦指數
推薦指數:4.7 / 5。Hamming將音頻原生評測、真實場景模擬、生產監控、重播以及CI門禁功能整合得相當完善,特別適合那些已經在運作語音智慧體系的團隊。
價格及完整文件並未公開,且生產監控涉及高度敏感的資料,因此它更適合那些擁有正式採購、安全及品質控制流程的組織,而非只想要免費試用幾個電話機器人的個人使用者。
常見問題
Hamming AI是什麼?
Hamming AI是語音與聊天智能體的測試和監控平台,用於自動模擬對話、評估品質、執行紅隊測試、監控實際通話,並將失敗案例轉換為回歸用例。
Hamming會幫我創建語音機器人嗎?
它的主要定位並非智能體建構工具,而是用於連接及評估現有的智能體。使用者必須先擁有 Vapi、Retell、ElevenLabs、LiveKit、Pipecat,或是自行開發的語音系統。
Hamming AI多少錢?
官網並未公開固定金額。報價主要是根據測試量與生產使用量來決定,而非依照團隊成員人數來收費。
Hamming有免費試用嗎?
目前FAQ顯示並沒有傳統的免費試用服務。團隊可以預約個性化的演示,並在入門階段使用自己的智能體與場景進行體驗。
Hamming支援中文嗎?
支援中文測試,並列出普通話簡體、繁體和粵語等變體。實際識別、音頻評分和業務術語表現仍需用本地說話者校準。
Hamming如何測試中斷和延遲?
平台模擬搶話、長時間靜音、快慢語速及其他真實行為,並將延遲分解到VAD、ASR、LLM和TTS,同時顯示p50、p90和p99。
Hamming支援生產監控嗎?
支持。它能持續評估真實通話、依閾值發出警報、重放黃金通話,並將生產失敗轉為永久回歸測試。
Hamming可以測試自研語音智能體嗎?
可以。自研系統可透過SIP、WebRTC或REST API接入,不依賴固定的LLM、語音識別或語音合成供應商。
Hamming符合HIPAA嗎?
Hamming可與醫療客戶簽署BAA並提供相關的安全控制措施。必須先完成BAA的簽署及資料審查,不得在未簽署的情況下上傳PHI。
Hamming會用客戶數據訓練模型嗎?
公開的隱私政策明確表示,不會使用客戶數據進行訓練,也不會用於惠及其他客戶,同時也不會出售由用戶產生的數據。
Hamming是開源的嗎?
完整平台不開源。早期Python和JavaScript SDK採用開放許可證,但客戶端包開源並不代表評測平台、模型或運行系統開源。
Hamming支援MCP嗎?
官方2026年資源說明提供Hamming MCP伺服器,可運行測試、查詢通話和搜尋轉寫。公開安裝資料有限,具體權限需透過客戶文件確認。
總結
Hamming適合將語音智慧體從「偶爾由人員撥打幾次」升級為可持續的工程品質體系。它能自動生成場景、直接聆聽音頻、模擬真實干擾、比較版本,並將生產事故轉化為回歸測試。
採購前應確認報價、測試量、第三方通話成本、API版本、資料儲存方式、保存方式以及企業合約。上線後的最佳做法是讓自動評分與人工校準並存,並將每個高風險的失敗案例轉換為長期發布的限制條件。
桂公網安備45132202000164號