Tavus
免費增值
AI工具大全 AI影片工具

Tavus

提供可編程數字人與個性化影片能力的AI平台

標籤:

Tavus是什麼?

Tavus是一個專為開發者、產品團隊及企業所設計的即時型AI數位人平台。它最初因能夠生成個性化的數位分身影片而受到關注,而現在它的核心產品則是Conversational Video Interface,簡稱CVI。這個技術可用來打造能夠看、聽、說、記憶以及使用各種工具的即時型視頻AI Agent。

CVI將數字人渲染、語音識別、LLM、文字轉語音以及WebRTC連接等功能整合為一個API與托管組件。開發者無需分別購買多個語音和影片服務,就能將1080p品質的數字人對話功能嵌入到網頁、應用程式、Zoom或Google Meet中。

Face與PAL的區別

Face定義螢幕上的外觀與聲音,也就是數位人的臉龐、聲音、表情以及呈現方式。PAL則定義行為、知識、提示詞、目標、限制條件、工具以及管線配置。

一個PAL可以綁定預設的Face,也可以在建立會話時選擇其他Face。

分開設計身份和行為有利於重複使用:同一客服邏輯可以使用不同人物,同一數字分身也可承擔銷售、培訓或諮詢等不同角色。

Phoenix數字人渲染模型

Phoenix負責即時生成人臉、微表情、頭部動作以及情緒變化。目前的Phoenix-4版本能夠根據情境、語氣和對話中的線索來動態調整表情,並在說話與聆聽狀態之間自然過渡。

它專注於Face的呈現,不負責完整的業務知識。外觀逼真並不代表回答可靠,事實的品質仍由PAL配置、LLM、知識庫和工具決定。

Raven感知模型

Raven能分析使用者的影片、聲音、身體語言、螢幕共享內容以及環境中的各種線索,從而辨別出使用者的情緒、意圖、語氣,以及與特定物體或動作相關的資訊。當發現特定的行為或聲音事件時,它還能觸發相關的工具。

視覺與情緒推斷可能出現誤判,不能單獨用於醫療診斷、招聘篩選、信貸決策或執法。涉及敏感推斷時需要明確告知、使用者同意及人工複核。

Sparrow輪次管理模型

Sparrow能夠處理對話中的停頓、節奏、輪流說話的順序以及中斷的情況。Sparrow-1是官方推薦的版本,相較於舊版以及僅依賴時間規則的版本,它的表現更快且更自然。

開發者可以將 Turn-taking Patience 設定為低、中、高,也可以控制 PAL 被打斷的敏感度。客服查詢可偏快,訪談和諮詢場景應更耐心。

從影片創建自訂Face

高品質的方式是上傳約1分鐘的訓練影片,其中約30秒用於說話、30秒用於聆聽。此方法能捕捉外貌、聲音、表情以及說話習慣,其品質與控制度通常優於單張圖片。

訓練影片需要清晰、穩定、以正面畫面為主,且符合技術要求。使用者必須擁有肖像、聲音和影片的必要權利。

從圖片創建Face

使用者也可以上傳單張的人物或角色圖片,由系統自動生成訓練數據,並選擇現有的語音。這種方式的部署速度更快,但身份、動作和表達的精確度則低於以影片進行訓練的方式。

圖片Face適合原型和虛擬角色,不應用於未經授權的真人克隆。

100多種Stock Faces

Tavus提供了100多個由真實演員錄製的Stock Faces,這些資源適用於快速打造原型、進行演示,或是那些沒有自訂素材的團隊。在使用這些Stock資源時,仍需遵守平台所規定的使用場景及廣告披露規則。

PAL Maker無代碼構建

PAL Maker提供引導式介面,讓非開發人員能夠設定臉部特徵、聲音、行為模式、知識庫、目標以及工具,並直接啟動對話功能。而API則適用於嵌入正式產品及實現自動化部署。

知識庫與RAG

經優化的知識庫能夠載入公司文件,為回覆內容提供搜尋上下文。文件應區分版本、移除過期資料,並設定存取權限。

RAG能減少幻覺,但無法保證每次都檢索到正確段落。

動態記憶

動態記憶體可讓 PAL 在後續會話中記住使用者的偏好與背景資訊,進而提升連續性。此類記憶體屬於個人資料,必須提供相關的告知、刪除、修改以及保存期限的說明,且不應儲存密碼、支付資訊或不必要的敏感資料。

目標、護欄與工具調用

Objectives用於定義會話中需要完成的任務,Guardrails則用來限制不允許的行為,而Function Calling與Tools則用於查詢訂單、安排日程或更新CRM資料。工具的參數必須由伺服器端進行驗證,且對於高風險的操作,還需要使用者確認。

情緒控制

Phoenix-4支援明確與隱含的情緒控制。明確設定可指定表達方向,隱含模式則根據對話上下文進行調整。

行銷和娛樂可使用更明顯的情緒,醫療、金融和投訴處理應避免操縱性表達。

語音、發音與降噪

CVI包含TTS、24kHz音頻、發音詞典、先進降噪以及說話人隔離功能。自訂發音詞典可用於修正品牌名、人名及專業術語的發音。

嘈雜環境仍應提供文字確認和字幕。

影片與純音頻管線

開發者可以選擇完整影片或僅有音訊的模式。純音訊的成本和頻寬通常較低,適合用於電話或後台代理;

影片模式提供表情和視覺感知,但對網路、設備和隱私的要求更高。

套餐與價格方式對比

套餐價格方式Face與用量適合場景
Free免費開發體驗,具體分鐘與併發以控制台為準可使用Stock資源和基礎CVI;不能創建自定義Face原型、API測試和功能評估
Starter訂閱或用量價格由動態控制台顯示開放自訂Face與更高會話額度創始產品與小規模正式部署
Growth按更高用量與能力計費自訂Face、更大併發、分鐘與生產能力增長中的應用和多場景部署
Enterprise訂製報價訂製Face、容量、合規、支援和合約條件高併發、受監管和大型企業項目

目前官方網站的價格資訊並未在公開文本中穩定顯示具體金額,但可確認從Free到Enterprise等各個級別皆提供API以及端到端對話架構,且付費級別越高,可自訂的Face數量、分鐘數以及同時處理的請求數也越多。購買前應登入開發者控制台,以確認實時單價,以及包含的分鐘數、超額費用、同時處理的請求數和錄製儲存空間等資訊。

費用包含什麼?

官網說明,CVI的價格已包含LLM、TTS和WebRTC等完整功能,同時還包括1080p畫質的影片、24kHz頻率的音訊,以及感知、RAG、記憶、保護機制、各種工具、轉錄和錄製等功能。企業的總成本還可能包含整合、資料準備、合規性要求、上線支援,以及超出使用量部分的費用。

舊影片生成與當前CVI

Tavus仍擁有Videos API以及數位分身影片的功能,單條影片的生成時間上限曾被標示為5分鐘。目前,該產品的發展重點已轉向即時CVI和PAL技術,因此不應僅將其描述為用於批量製作個性化錄播影片的工具。

Zoom與Google Meet

PAL可以進入Zoom和Google Meet的會議,適用於面試、培訓、銷售及支援等場合。在自動加入會議之前,必須先告知參與者這是AI,並說明是否會進行錄音、錄影、轉錄或儲存資料。

LiveKit與Pipecat集成

Tavus提供LiveKit與Pipecat的整合方案,適用於將臉部渲染功能整合到現有的即時Agent及媒體基礎架構中。團隊需處理會話的生命週期、網路重新連線、麥克風權限以及伺服器金鑰等相關問題。

快速嵌入流程

  1. 在服務端保存TAVUS_API_KEY。
  2. 選擇Stock或自訂PAL與Face。
  3. 服務端呼叫建立Conversation介面。
  4. 將返回的Conversation URL嵌入iframe或應用。
  5. 用戶離開時主動結束會話,避免持續計費。

自動測試可使用test_mode,建立不會讓PAL真正加入且立即結束的會話,避免測試任務產生正常會話費用。

Conversation API

開發者可以建立、結束及查詢會話,並取得轉錄與錄製的內容。一旦會話被建立,就會開始計費且佔用併發資源,因此不能僅依靠關閉瀏覽器來釋放資源。

OpenAPI與服務端安全

官方提供完整的OpenAPI合約。API Key不得放入瀏覽器代碼、行動應用或公開倉庫;

前端只能調用自己的後端,由後端創建受控會話。

Face訓練使用的檔案URL應採用短期簽名地址,日誌中不得記錄金鑰和永久公開的敏感素材。

GitHub與範例專案

Tavus Engineering在官方GitHub上公開了CVI範例、面試相關內容,以及Santa等示範專案,協助開發者了解即時介面。在搜尋結果中也有第三方的Python、Ruby和C# SDK,使用前必須區分哪些是官方提供的,哪些是由社群維護的。

開源狀態

Tavus的Phoenix、Raven、Sparrow模型、Face訓練、託管CVI和商業API並非開源產品。官方示範專案的開放代碼,並不等同於核心模型或伺服器可以被私有化部署。

數據、錄製與合規

CVI可保存對話轉錄和錄製內容,並能處理影片、音頻、面部特徵、情緒以及知識庫等資料。企業必須明確規定相關的同意程序、合法依據、存取權限、資料保留方式、刪除方式、資料儲存地點,以及受監管的資料處理方式。

用戶可以請求刪除資料,但企業應用仍需在其自身的資料系統中實現同步刪除。

Tavus使用教學

建立可重複使用的專業工作流

  1. 建立腳本、鏡頭表、品牌素材和禁用元素清單;
  2. 為Face與PAL的差異、Phoenix數字人渲染模型和Raven感知模型保存統一參數;
  3. 先用代表性鏡頭測試模型與額度;
  4. 把失敗鏡頭轉入人工剪輯或重新生成;
  5. 統一字幕、響度、色彩和片尾版權資訊;
  6. 記錄版本和審核人後再批量發布;

適合哪些用戶?

  • 構建實時數字人客服和銷售Agent的開發者;
  • 需要視覺、語音與情緒感知的對話產品;
  • 創建數位分身培訓與互動課程的團隊;
  • 將AI Agent加入Zoom或Google Meet的企業;
  • 需要RAG、記憶、護欄和工具調用的應用;
  • 使用LiveKit或Pipecat來建立即時媒體管線的團隊。

主要優勢

  • 端到端包含LLM、TTS、WebRTC和數字人渲染;
  • Phoenix、Raven、Sparrow分別處理外觀、感知和輪次;
  • 支援影片或單張圖片創建自訂Face;
  • PAL整合知識、記憶、目標、護欄和工具;
  • 提供1080p影片、低延遲和豐富的即時控制;
  • 開放API、PAL Maker、會議與即時框架整合。

限制與注意事項

  • 實時影片比文字或語音Agent成本、頻寬和隱私風險更高;
  • 視覺情緒推斷可能誤判,自訂Face必須授權;
  • 會話若未正確結束可能繼續計費;
  • 核心平台不開源,具體價格需登錄控制台確認;
  • LLM回答、RAG檢索和工具執行仍可能出錯,高風險操作必須人工確認;

常見問題

Tavus免費嗎?

有免費的開發體驗,可使用基礎的CVI和Stock資源;自訂Face功能則僅在Starter、Growth和Enterprise版本中提供。

創建自己的數位分身需要多久素材?

以高品質方式使用約1分鐘的影片,其中約30秒說話、30秒聆聽;也可使用單張圖片快速創建但品質較低。

Face和PAL有什麼區別?

Face負責外觀和聲音,PAL負責行為、知識、目標、記憶、護欄與工具。

Tavus提供API嗎?

提供完整的API和OpenAPI契約,可管理Faces、PALs、Conversations、Videos、Tools和Documents。

Tavus能加入Zoom嗎?

支持Zoom與Google Meet整合,使用時需告知參與者AI身份及錄製政策。

Tavus是開源的嗎?

核心模型和託管CVI不開源;官方GitHub公開範例與演示專案。

©️版權聲明:若無特殊說明,本站所有文章版權均歸AI工具分享本網站的內容為原創作品,任何人或機構在未獲許可的情況下,都不得轉載、抄襲或以其他方式複製並發表本網站的內容,亦不得在非本網站所屬的伺服器上建立其鏡像版本。否則,本網站將依法追究相關責任人的法律責任。

類似於Tavus的工具