Resemble AI是什麼?
Resemble AI是一套同時涵蓋AI語音生成與生成式媒體安全的平台。創作與開發能力包括文字轉語音、聲音克隆、文字設計聲音、語音轉語音、語音轉寫、音頻編輯增強以及即時語音Agent;
安全能力則包括音頻、圖片和影片的Deepfake檢測、檢測結果解釋、會議即時分析、身分登記與匹配、C2PA簽名以及不可感知水印。
產品定位已從單純的AI配音工具,擴展為「生成、驗證、檢測」一體化平台。內容團隊可以製作品牌聲音及多語言旁白,開發者可透過API接入即時語音,而安全團隊則能將可疑媒體送入檢測流程,並保留審計結果。
Resemble Ultra文字轉語音
Resemble Ultra是當前託管平台用於新建及升級語音功能的預設文字轉語音模型,支援同步生成、HTTP流式以及WebSocket流式輸出。API會根據voice_uuid自動選擇對應的模型,開發者不應將resemble-ultra作為普通模型參數強行傳入。
舊版的 Chatterbox、Chatterbox Turbo、Chatterbox Multilingual,以及更早的 TTS 版本,皆已被官方文件列為已停止服務。若仍要使用這些舊模型所產生的聲音,則必須升級到 Ultra 版本才能繼續使用。在遷移之前,應重新檢查音質、發音、延遲時間以及與各項功能的相容性。
聲音克隆
聲音克隆可以從約10秒的清晰錄音中建立可重複使用的聲音。API既可一次上傳完整音頻並進行訓練,也可先創建聲音後再分批上傳錄音,再透過回呼接收訓練完成的通知。
克隆API目前要求Business或更高方案。
短樣本能快速建立聲音,但環境噪音、音樂、混響、多人重疊和過度壓縮會降低相似度。任何真人聲音都必須取得本人明確同意,並約定可使用場景、期限、團隊成員、模型刪除和衍生內容範圍。
Voice Design聲音設計
Voice Design不需要真人錄音。用戶以文字描述年齡、口音、語氣、風格和角色用途,系統會產生3個候選聲音,試聽後將選中的候選轉換為可用於TTS的voice_uuid。
聲音設計適用於虛構角色、原型,以及無法錄製真人聲音的專案,但無法保證所選用的聲線與現實中的人物完全沒有關聯。品牌和遊戲專案仍應進行相似性檢查,並保存最終的候選聲線及相關參數。
語音轉語音語音轉語音
語音轉語音會將輸入的錄音中的節奏、語調及表現方式轉換成目標聲音,適用於即時角色扮演、遊戲、配音修改以及語音代理等場景。本文件列出了Core STS v2和v1兩個版本,其中v2的音高追蹤功能更佳,且支援48kHz的錄音格式;其訓練數據通常需要10分鐘以上。
STS比純文字生成更能保留表演的特質,但無法自動解決輸入中的雜音、口誤以及版權問題。無論是輸入的說話者還是目標聲音,都必須取得授權;而在直播場景中,還需要具備濫用檢測以及人工中止的功能。
同步、HTTP與WebSocket流式API
同步介面一次返回完整音頻,適合短句和離線任務;HTTP流式介面邊生成邊返回WAV數據,並在檔案頭中包含字素和音素時間戳;
WebSocket保持長連接,以更低延遲持續返回音頻框架。
WebSocket目前主要用於商業級及以上的應用方案,預設情況下,一個集群可支援20個同時進行的會話,而每個API Key則可支援20個並行連線。所謂的「同時進行」並非指每秒的請求次數,開發者仍需處理容量限制、重試機制、連線中斷以及audio_end訊息等問題。
實時語音Agent
Real-Time Agents可把Resemble聲音與提示詞、知識庫、工具、Webhook和電話號碼組合,用於客服、預約、銷售、遊戲NPC和互動式培訓。系統支持Agent API、工具調用、知識庫和電話接入。
即時代理的語音自然度無法取代事實的可靠性。在涉及帳戶、付款、醫療、法律或身分核驗時,應限制工具的權限、建立真人轉接、確認敏感操作並保存可審計的日誌。
音頻編輯、增強與轉寫
Audio Edit可用於對非市場上已有的音頻檔案進行異步編輯,Audio Enhancement則用於降噪並提升語音的清晰度,而Speech to Text則可以用來建立及查詢轉錄任務。這些功能很適合用於清理錄音、製作字幕,或是重新處理某些部分的旁白內容。
增強可能改變音色細節,轉寫也會誤識別人名、數字和專業術語。關鍵記錄應保留原始文件並人工校對,不能把處理結果當作無誤證據。
Deepfake多模態檢測
Resemble Detect適用於音頻、圖片和影片,能分析TTS、聲音克隆、臉部替換以及生成式圖像等特徵,並可在上傳檔案、API或即時處理流程中提供可信度評估結果及相關說明資訊。目前,DETECT-3B Omni被視為可應用於這三種媒體格式的企業級檢測模型。
檢測結論屬於概率判斷,壓縮、剪輯、重錄、新模型以及對抗處理都可能導致誤判。在高風險場景中,不能僅憑一個分數就自動拒絕用戶,應結合來源、身分驗證、人工複核以及申訴流程來做決定。
Resemble Intelligence與Meetings
Intelligence用於對檢測結果提供更豐富的分析,Meetings則可在會議中即時監控可疑媒體。Team具備會議分析功能,而Business則增加了組織級日曆整合以及會議安全通知功能。
會議監控會涉及參會者的音訊、影片及元數據。組織應事先告知、限制保存期限,並核對所在地區的錄音、隱私及員工監控規則。
Identity身份搜尋
Identity API可登記個人或品牌的身份、關聯參考媒體,並搜尋上傳的內容是否與已登記的對象相符,用於發現冒充、未經授權的聲音或品牌素材。它可以成為KYC、內容審核和人才權益保護的一層信號。
身份相似不能單獨證明欺詐,誤匹配也可能影響真實用戶。生產系統需要閾值校準、二次認證和人工複核,不能把身份搜尋當作唯一的生物識別結論。
PerTH水印與C2PA
Resemble Watermarker可為媒體編碼及解碼不可感知的標記,PerTH專案則著重於音頻神經水印,其目標是在壓縮及常見編輯後仍能檢測出來源。該平台也支援檢查SynthID及簽署C2PA記錄。
水印適合用來證明已標記內容的來源,但沒有檢測到水印並不代表該檔案一定是真實的,因為第三方工具可能根本就沒有嵌入相容的標記。最佳做法是將水印、內容憑證、Deepfake檢測以及發布記錄結合起來使用。
Flex免費按量方案
Flex的訂閱費用為0美元,無需信用卡,包含1個團隊席位、平台與API、音頻、圖片、影片的檢測功能、檢測結果的解釋、身份登記、會議的即時檢測、SynthID檢查以及C2PA簽名功能。使用者可先預充Credits,再根據實際處理量來支付費用,沒有最低消費額的要求,且Flex Credits不會過期。
0美元意味著沒有月度訂閱費用,但並不代表所有服務都是免費的。產生語音、進行檢測、搜尋身份資訊以及添加水印等服務,都會按照相應的費率來扣除餘額。在購買之前,應先在控制台確認那些未列在公開頁面上的服務費率。
價格與版本對比
| 套餐或版本 | 價格、額度與核心權益 |
|---|---|
| Team價格 | Team的月費為350美元;若選擇年付,則每月費用為280美元,全年總費用為3360美元。如此一來,與按月支付相比,可節省840美元。它包含5個使用帳號、Flex的所有功能,以及一些服務的較低用量定價。此外,還包含會議智能功能、大檔案處理以及批量上傳功能。Team適合那些希望將檢測功能投入實際生產環境的中型團隊,但不包含SSO、組織級會議日曆以及企業SLA等功能。若選擇年付,則需一次性支付全年的費用。 |
| Business價格 | Business方案為每月1000美元;若選擇年付,則每月約需800美元,全年共需9600美元。如此一來,相比按月支付的方式,可節省2400美元。此方案包含20個席位、可根據需求調整的配置、組織級日曆整合功能、會議安全通知以及SSO服務。此外,Business方案也支援聲音克隆API和WebSocket流式語音功能。如果每月的支出超過1000美元,或者需要更高的同時處理能力或本地部署功能,建議聯絡銷售人員以評估適合企業的批量購買價格。 |
| 檢測與安全處理價格 | 在Flex中,音訊和圖片的檢測費用為每秒0.035美元,而影片的檢測費用則為每秒0.07美元。至於Intelligence功能,其費用則為每秒0.025美元。在Team和Business方案中,音訊和圖片的檢測費用仍為每秒0.015美元,影片的檢測費用為每秒0.03美元,而Intelligence功能的費用則仍為每秒0.015美元。至於Identity搜尋功能,其費用為每次呼叫0.0005美元;Watermarker編碼的費用也是每次0.0005美元,而解碼的費用則為每次0.0002美元。這三項服務在Flex、Team和Business方案中的費用都是相同的。圖片相關的費用是以「每秒」來計算的,這是官方定價表上的計費方式,但實際的費用計算方式則需以控制台上的顯示為準。 |
| 託管語音生成價格如何看? | 目前,公開的價格頁面主要顯示的是有關生成式媒體安全的解決方案及相關處理費用,並未在同一個表格中列出 Resemble Ultra TTS、克隆、STS 和 Agent 的完整用量單價。因此,不應再沿用舊版部落格或過去套餐中的每秒生成價格。需要語音生成服務的使用者應註冊 Flex 以查看即時的費率,或者讓銷售人員根據語言、時長、並發數量及部署方式來報價。在預算時,應將生成服務、流式主機、克隆服務、Agent 服務以及安全檢測服務分開計算。 |
Team價格
團隊每月需支付350美元;若選擇年度付款,則每月需支付280美元,全年共需3360美元。如此一來,與每月支付的方式相比,可以節省840美元。
它包含5個席位、Flex全部能力、部分服務更低用量單價、會議Intelligence、大檔案和批量上傳。
Team適合將檢測功能投入生產的中型團隊,但不包含SSO、組織級會議日曆以及企業SLA。年付折扣需要一次性承擔年度承諾。
Business價格
商業版每月需支付1000美元;若選擇年付,則每月約需支付800美元,整年共需9600美元。如此一來,與按月支付相比,可以節省2400美元。
它包含20個席位、可隨部署調整的配置、組織級日曆集成、會議安全通知和SSO。
Business也是聲音克隆API和WebSocket流式語音的當前准入等級。若月支出超過1000美元、需要更高並發或本地部署,官方建議聯繫銷售評估企業批量價格。
Enterprise企業方案
Enterprise定製報價,可提供容量折扣、企業SLA、定製模型訓練、本地部署、專屬支援、SOC 2文件及自訂席位。高併發、資料隔離、私有雲或氣隙環境通常需要企業合約。
本地部署並非公開訂閱自動包含,採購時應書面確認模型、檢測模態、硬體、更新頻率、日誌留存、支援回應及許可證範圍。
檢測與安全處理價格
Flex中,音頻和圖片的檢測費用為每秒0.035美元,影片的檢測費用則為每秒0.07美元,而 Intelligence功能的檢測費用則為每秒0.025美元。在Team和Business方案中,音頻、圖片的檢測費用皆為每秒0.015美元,影片的檢測費用為每秒0.03美元,Intelligence功能的檢測費用則仍為每秒0.015美元。
Identity搜尋的費用為每次0.0005美元,Watermarker編碼的費用也是每次0.0005美元,而解碼的費用則為每次0.0002美元。這三項服務在Flex、Team和Business版本中的價格都是一樣的。至於以「每秒」來顯示圖片的情況,那只是官方定價表中的計費方式而已,實際的費用計算應以控制台上的顯示為準。
託管語音生成價格如何看?
目前公開的價格頁面主要顯示生成式媒體的安全方案及處理費用,並未在同一個表格中列出 Resemble Ultra TTS、克隆、STS 和 Agent 的完整用量單價。因此,目錄不應沿用舊博客或歷史套餐中的每秒生成價格。
需要語音生成的用戶應註冊Flex以查看即時費率,或讓銷售人員根據語言、時長、並發數以及部署方式來報價。在預算時,必須將生成服務、流式主機、克隆功能、Agent電話以及安全檢測等項目分開計算。
Chatterbox開源模型
Resemble AI在GitHub上公開了Chatterbox語音模型系列。目前的儲存庫中包含具有350百萬個參數的Chatterbox Turbo,該模型適用於低延遲的英語語音處理以及表演相關的應用場景。
110M參數、可在CPU和受限設備運行的Nano;以及500M參數、支援中文在內23種語言的Multilingual V3和多種單語言微調包。
Chatterbox的代碼與模型採用MIT許可證,可用於個人、研究及商業專案,也可用於封閉式產品中進行自托管,但必須保留許可證說明,並遵守相關法律及聲音使用規定。Resemble Ultra這個托管平台與開源版的Chatterbox是兩種不同的產品線,而官方文件中也明確指出,舊版本的Chatterbox已停止服務。
PerTH與Resemble Enhance開源項目
官方GitHub還公開了採用MIT許可的PerTH音頻水印工具,以及用於降噪和增強音質的Resemble Enhance。開發者可以在本地測試水印提取與音頻處理的功能,但這並不代表Detect、Identity、Meetings以及相關的托管平台都是開源的。
開源範例及部分舊版SDK可能已停止維護,例如官方的Go SDK已被標記為已廢棄。新專案應以目前的API文件及Client Libraries頁面為準,且在升級之前應先鎖定版本並執行回歸測試。
Resemble AI使用教學
完成一次基礎任務
- 註冊Resemble AI並創建僅用於測試環境的API Key;
- 根據輸入類型、上下文、品質、速度和價格選擇模型;
- 先調用Resemble Ultra文字轉語音完成最小請求並檢查返回結構;
- 再用聲音克隆測試流式輸出、參數和異常響應;
- 記錄Tokens、呼叫次數、延遲、錯誤率及單次成本;
- 把密鑰移入服務端密鑰管理器後再接入正式應用;
建立可重複使用的專業工作流
- 為開發、測試與生產環境使用不同密鑰與額度;
- 按Resemble Ultra文字轉語音、聲音克隆和Voice Design聲音設計建立代表性評測集;
- 設定超時、併發、重試、限流和預算上限;
- 對輸出執行事實、安全、格式和敏感資訊檢查;
- 監控模型版本、價格、延遲和失敗率變化;
- 準備降級模型、熔斷和人工接管方案;
適合哪些用戶?
- 需要品牌聲音、遊戲角色和多語言旁白的全案團隊;
- 構建低延遲語音Agent、客服和互動應用的開發者;
- 審核音頻、圖片和影片真偽的安全與風控團隊;
- 保護演員、品牌和高管身份不被冒充的組織;
- 希望自託管MIT語音模型的研究與工程團隊。
產品優勢
- 將語音生成、身份、水印和Deepfake檢測整合在同一平台;
- Resemble Ultra覆蓋同步及兩種流式TTS;
- 支援快速聲音克隆、Voice Design與語音轉語音;
- 檢測覆蓋音頻、圖片和影片,並提供解釋資訊;
- Flex沒有月訂閱費,Credits目前不會過期;
- Chatterbox、PerTH和Enhance提供可自托管開源選擇。
限制與注意事項
- 目前公開價格的重點已轉向安全產品,託管語音生成的完整單價需在控制台核對;
- VoiceCloningAPI、WebSocket以及部分生產能力要求為Business等級以上,入門用戶不能假設可以以0美元的費用使用所有的語音接口;
- Deepfake檢測會誤報和漏報,水印缺失也不能證明內容真實;
- 克隆與STS必須取得聲音授權;
- 開源Chatterbox的MIT許可證不免除隱私、肖像、聲音人格權及反冒充義務;
常見問題
Resemble AI免費嗎?
有0美元/月的Flex方案,不收訂閱費並採用預充Credits按量付費。Credits目前不會過期,但實際生成、檢測和水印調用仍會收費。
Resemble AI多少錢?
Team方案為350美元/月,或以年付的方式,每月約280美元;Business方案則為1000美元/月,或以年付的方式,每月約800美元。
Enterprise定製。Flex沒有月費。
可以克隆自己的聲音嗎?
可以,約10秒的清晰錄音即可建立快速克隆,但API目前要求Business或更高方案,並必須取得說話者同意。
能檢測影片和圖片Deepfake嗎?
可以。Detect目前覆蓋音頻、圖片和影片,並可結合Intelligence、Identity、會議監測和水印;
結果仍需按風險進行人工複核。
Resemble AI是開源的嗎?
託管平台與Ultra模型並非整體開源;官方的Chatterbox語音模型、PerTH水印以及Resemble Enhance則以開源項目的形式提供,其中Chatterbox與PerTH採用MIT許可證。
桂公網安備45132202000164號