LangWatch是什麼
LangWatch是一個針對大型語言模型應用及AI代理而設的開源LLMOps平台,由Reasoning Engine B.V.所運營。它將可觀測性、評估功能、代理模擬、提示詞管理、AI Gateway以及治理能力整合在一起,協助團隊從開發測試到最終的生產運作進行全程管理。
平台使用 OpenTelemetry 來接收並整理追蹤資料,支援託管雲端、完全自托管、企業專用雲端以及混合部署模式。開發人員可以從模型調用、工具使用情況以及使用者會話中找出問題,再將實際案例轉化為評測與情境測試的素材。
主要能力概覽
| 能力模組 | 解決的問題 | 典型產出 |
|---|---|---|
| Observability | 看清模型、工具和代理如何運行 | 追蹤、Span、指標、成本和告警 |
| Evaluations | 衡量品質、安全與可靠性 | 實驗分數、在線評測、Guardrails和回歸結果 |
| Agent Simulations | 在上線前測試完整對話和行為 | 場景執行、模擬用戶、失敗原因和測試報告 |
| Prompt Management | 集中管理提示及版本 | 提示模板、變數、版本、Playground和優化結果 |
| AI Gateway | 統一模型調用、預算和路由 | 虛擬金鑰、路由、緩存、限額和護欄 |
| AI Governance | 控制團隊訪問和生產風險 | 權限、審計、支出與組織治理 |
LLM與代理可觀測性
LangWatch會自動記錄大語言模型的呼叫次數、工具的使用情況、搜尋結果、錯誤狀況以及用戶互動記錄,並在追蹤過程中呈現完整的執行流程。團隊可以查看輸入與輸出內容、Token數量、成本、延遲時間、模型相關資訊、用戶資料以及自訂的元資料。
- 按項目、用戶、模型、提示或版本篩選追蹤。
- 查看嵌套Span和代理多步驟執行順序。
- 定位工具失敗、慢調用和成本異常。
- 對生產品質和業務指標設置儀表盤。
- 透過使用者事件連接回饋與具體追蹤。
- 將分析數據導出到外部系統。
- 使用告警和自動化響應品質下降。
OpenTelemetry與集成
追蹤層是建立在 OpenTelemetry 之上的,因此既可以使用 LangWatch SDK,也能接收其他相容函式庫所產生的資料。它可直接整合常見的代理框架、模型供應商以及自動化平台。
| 集成類別 | 代表項目 | 用途 |
|---|---|---|
| 代理與應用框架 | LangChain、LangGraph、Mastra、CrewAI和Google ADK | 自動捕獲模型、工具和代理Span |
| 模型供應商 | OpenAI、Anthropic、Azure、Google Cloud、AWS和Groq | 記錄模型請求、回應、Token和成本 |
| 本地模型 | Ollama | 觀察私有或本地推理流程 |
| 低代碼平台 | LangFlow、Flowise和n8n | 為可視化流程增加追蹤與評測 |
| 標準協議 | OTLP | 接入其他OpenTelemetry相容服務 |
離線實驗
實驗用於在上線前對固定資料集運行模型、提示或代理版本,並記錄每個樣本的輸出與評分。團隊可以透過介面、Python或TypeScript來執行實驗,進而比較多種配置的品質、成本和延遲。
- 創建代表真實任務的資料集。
- 選擇當前生產版本作為基線。
- 定義需要比較的提示、模型或代理配置。
- 為輸出配置內建或自訂評測器。
- 並行運行全部樣本並記錄追蹤。
- 比較分數、錯誤、延遲和成本。
- 把失敗樣本加入回歸數據集。
- 將最低品質要求接入持續集成門禁。
在線評測
線上評估在生產追蹤資料到達後會自動運行指定的評測工具,用於持續監控資料的真實性、相關性、安全性,以及 PII 或自訂的業務指標。它適用於發現隨著使用者、模型和資料變化而出現的品質偏移。
| 評測方式 | 運行時機 | 適合用途 |
|---|---|---|
| 離線實驗 | 發布前針對固定數據集 | 比較提示、模型和代理版本 |
| Online Evaluation | 生產追蹤到達後 | 監控品質趨勢和異常樣本 |
| Guardrail | 模型調用前後同步執行 | 實時阻斷越獄、PII或違規內容 |
| 人工Annotation | 對選定追蹤或數據點審核 | 專家標籤、偏好和爭議案例 |
Guardrails實時護欄
評測器可在應用程式碼中作為Guardrail同步執行,並根據是否通過決定放行或阻斷。它適合用於輸入端的越獄檢測、輸出端的安全檢查以及關鍵業務規則的驗證,但會增加呼叫延遲和事件用量。
- 檢測越獄和提示注入。
- 識別PII及敏感資訊。
- 檢查毒性、有害或違規內容。
- 驗證RAG回答的忠實度與相關性。
- 執行LLM-as-a-judge或自訂代碼評分。
- 在失敗時返回安全提示或轉人工處理。
評測器與工作流
LangWatch提供RAGAS、幻覺、毒性、PII以及模型裁判等內建評測工具,同時也允許團隊建立可重複使用的組織級評測工具。對於較為複雜的評測,則可以透過工作流程來組合多個步驟與判斷標準,並將自訂的分數附加到追蹤記錄或Span中。
資料集與標註
資料集可以透過SDK和API來管理,也可以從生產追蹤中提取,或是由AI輔助生成。Annotation Inbox用於將樣本分配給人工審核者,適合業務專家補充標籤、目標答案以及主觀品質判斷。
- 從真實追蹤建立失敗案例集。
- 保存文本和圖像等評測輸入。
- 透過程式碼批量建立與查詢資料集。
- 讓AI快速生成初始測試樣本。
- 將人工標籤與自動評測分開記錄。
- 把審核結果用於後續回歸測試。
Agent Simulations
Agent Simulations透過模擬使用者與待測代理之間的多輪互動,來驗證該代理是否能夠在真實對話中達成目標、遵守規則,並正確使用工具。相較於單輪的輸入輸出評估,它更適合用來測試狀態管理、記憶能力、工具調用以及長時間對話中的表現。
場景結構
| 組成 | 內容 | 作用 |
|---|---|---|
| Scenario | 初始條件、使用者目標與約束 | 定義需要驗證的真實業務任務 |
| Agent Adapter | 連接本地、遠端或託管代理 | 把測試消息送到待測系統 |
| User Simulator | 按角色和目標生成多輪用戶行為 | 覆蓋不同表達、追問和阻力 |
| Criteria | 成功、失敗和安全判斷 | 決定場景是否通過 |
| Run Parameters | 併發、重試、模型和測試數量 | 控制成本與覆蓋範圍 |
支援的代理形態
- 文本聊天代理。
- 需要登入或令牌的遠端代理。
- 本地開發中的代理函數。
- OpenAI Realtime等即時代理。
- ElevenLabs、Twilio和Pipecat等語音代理。
- Gemini Live等即時多模態代理。
紅隊與安全場景
場景測試可用於產生對抗性用戶、越權請求和提示注入流程,觀察代理在多輪互動中的防禦表現。紅隊的測試結果應作為改進的依據,不能認為透過一次測試就能永遠保持安全。
Scenario開源庫
獨立Scenario倉庫提供了用於Python和TypeScript語言的代理測試工具,且採用Apache第二版授權協議。它可以在本地或持續整合環境中運作,並不要求所有的測試都必須在LangWatch雲端上完成。
提示管理
Prompt Management可集中儲存提示模板、變數、版本及發布狀態,避免提示散落在程式碼、表格和介面中。開發者可透過SDK或CLI同步提示,並在Playground中替換模型和參數以進行比對。
| 功能 | 作用 | 典型用戶 |
|---|---|---|
| Prompt Registry | 集中保存命名提示和版本 | 開發與產品團隊 |
| Variables | 在運行時填充業務數據 | 應用開發者 |
| Playground | 測試提示、模型和參數 | 提示工程與業務專家 |
| CLI Sync | 將提示配置納入代碼倉庫 | 平台工程與持續集成 |
| Optimization Studio | 基於樣本和目標改進提示 | 需要系統化優化的團隊 |
| DSPy Optimization | 用程式化方法搜尋更優提示 | 研究和高級評測團隊 |
AI Gateway
AI Gateway可以統一接入多個模型供應商,並在組織邊界內管理虛擬金鑰、路由、預算、緩存以及Guardrails。在自托管模式下,可選擇讓模型流量在自己的網路邊界處終止。
- 用虛擬金鑰隔離應用和團隊。
- 在多個模型或供應商之間路由。
- 為組織、專案或用戶設定層級預算。
- 使用提示緩存減少重複推理。
- 在統一入口執行實時護欄。
- 集中記錄成本、失敗和模型用量。
MCP、CLI與Skills
LangWatch提供MCP、命令列工具以及用於輔助編程的技能,讓AI助手能夠協助進行追蹤、建立評估、執行模擬以及管理提示。不過,自動化的修改仍需經過人為審核,尤其是對於生產用金鑰、安全機制以及部署設定而言。
雲端價格
價格資訊於2026年8月23日核驗,實際金額、稅費、匯率及優惠可能變動,最終以結算頁面顯示為準。
LangWatch Cloud是根據核心席位數量及事件使用量來計費的,而Growth版則會對保存超過30天的資料收取儲存費用。Lite版的使用者雖可查看及協作,但具體的可編輯範圍仍需以當前的權限說明為準。
| 套餐或版本 | 價格 | 計費週期 | 核心權益或額度 | 適合用戶 |
|---|---|---|---|---|
| Developer | 免費 | 永久免費,額度每月刷新 | 5萬事件、14天數據訪問、2名用戶,3個場景、3次模擬和3個自定義評測 | 個人開發者與早期原型 |
| Growth | 每核心席位29歐元 | 每月 | 含20萬事件和30天保留,無限Lite用戶、模擬、評測與提示 | 把AI應用投入生產的團隊 |
| Enterprise | 訂製報價 | 合同約定 | 混合、自託管或本地部署,自訂保留、SSO、RBAC、審計、SLA及專屬工程支援 | 受監管與大型組織 |
事件與儲存計費
每次模型調用、工具調用、檢索、評估或模擬步驟都會被視為一個事件,因此一次用戶對話通常會包含多個計費事件。Growth服務在每月的前20萬個事件內是免費的,之後則每10萬個事件需支付5歐元。
| 計費項 | Growth包含量 | 超額價格 | 注意事項 |
|---|---|---|---|
| 核心席位 | 每席位獨立計費 | 29歐元每席位每月 | 可增減席位,20人以上可詢問量價優惠 |
| 事件 | 每月20萬 | 每10萬事件5歐元 | 模型、工具、檢索、評測和模擬步驟均可能計費 |
| 資料存取 | 30天 | 延長部分每GB 3歐元 | 僅在保留超過包含週期時計費 |
| Lite用戶 | 無限 | 包含 | 權限範圍與核心席位不同 |
| 模型推理 | 不包含 | 由模型供應商收取 | 模擬和LLM評測可能產生較多模型調用 |
賬單估算方法
- 統計每月最終用戶互動數量。
- 測量一次典型互動包含多少模型、工具和檢索事件。
- 加入線上評測和Guardrail產生的事件。
- 估算離線實驗與代理模擬的額外運行量。
- 確定需要完整使用權限的核心席位數量。
- 計算超過30天仍需訪問的資料GB。
- 另行加入模型、雲端儲存和自託管基礎設施費用。
- 為增長、回填和異常流量預留預算。
開源與許可證
LangWatch採用開放核心模式,主要平台代碼使用Apache第二版許可證,Python、TypeScript SDK及MCP服務則使用MIT許可證。SCIM、審計日誌、許可證與計費管理等企業相關模組位於獨立的目錄中,若要進行實際應用,則需要取得商業許可證。
| 組件 | 許可證 | 可做什麼 | 限制 |
|---|---|---|---|
| LangWatch核心平台 | Apache第二版 | 查看、修改和自託管主要功能 | 企業目錄中的模組不在同一許可下 |
| Python SDK | MIT | 追蹤、評測和數據訪問 | 仍需連接雲端或自託管服務 |
| TypeScript SDK | MIT | 在Node與Web項目中集成平台 | 不包含託管基礎設施 |
| MCP Server | MIT | 讓AI客戶端操作LangWatch能力 | 需要合理配置權限和憑證 |
| Scenario | Apache第二版 | 本地運行代理場景測試 | 模型和目標代理費用自理 |
| Enterprise模組 | 商業許可證 | SSO、SCIM、審計和企業管理 | 生產使用需購買授權 |
自託管版本
若不配置企業許可證,自託管版LangWatch仍允許擁有無限數量的成員、團隊、專案以及自建內容,且能運行與雲端版相同的主軟體。而企業許可證則可在同一部署環境中啟用SSO、RBAC、SCIM、審計日誌及支援服務,無需更換為獨立的產品版本。
部署模式對比
| 部署模式 | 應用由誰管理 | 資料儲存位置 | 適合場景 |
|---|---|---|---|
| LangWatch Cloud | LangWatch | 託管雲 | 快速開始和免運維 |
| Self-Managed | 客戶 | 客戶基礎設施 | 完整數據主權和自主管理 |
| Cloud Enterprise | LangWatch | 客戶指定區域的專屬實例 | 需要隔離且不想自行運維 |
| Hybrid | LangWatch管理控制平面 | ClickHouse與對象儲存位於客戶網路 | 追蹤數據不能離開企業網路 |
自託管基礎設施
目前的 v3 生產方案以 Kubernetes Helm 為主,使用 ClickHouse 作為核心分析儲存層,並透過對象儲存來分層保存冷數據。Docker Compose 的快速方案仍主要適用於 v2,準備部署 v3 時不應沿用舊有的教學內容。
- 使用ClickHouse保存和查詢追蹤及評測事件。
- 透過事件溯源保證追蹤與評測處理順序。
- 將舊數據分層到相容對象儲存。
- 使用原生ClickHouse備份與恢復機制。
- 透過Helm Overlay調整不同規模部署。
- 可選啟用AI Gateway子Chart。
- 需要自行維護密鑰、網路、備份、升級和監控。
安全與合規
LangWatch公開聲明其符合GDPR規定,並已取得ISO 27001認證,企業客戶可申請相關報告及資料處理協議。由於該平台可能會接觸到提示詞、輸出內容、工具參數以及使用者資料,因此該團隊仍需自行完成資料的分類與存取規劃。
- 在埋點前移除不需要的個人數據和密鑰。
- 限制誰能查看原始追蹤與資料集。
- 為導出、MCP和API設定最小權限。
- 審查雲端地區、子處理方和保留週期。
- 自託管環境啟用傳輸與靜態加密。
- 為審計、刪除、備份和事件應對制定流程。
- 受監管業務應透過企業合約確認合規責任。
適合哪些用戶
- 開發大語言模型應用和AI代理的工程團隊。
- 負責模型品質、回歸與安全測試的團隊。
- 需要模擬用戶測試多輪代理行為的產品團隊。
- 希望讓業務專家參與提示和人工標註的組織。
- 需要統一模型網關、預算和治理的平台團隊。
- 希望開源自託管並控制追蹤數據的企業。
- 使用n8n等低代碼工具來建構AI流程的開發者。
產品優勢
- 可觀測、評測、模擬與提示管理形成完整閉環。
- Agent Simulations適合驗證多輪和工具型代理。
- 支援離線實驗、在線監控和同步Guardrails。
- OpenTelemetry降低與單一SDK的綁定。
- 雲端價格同時提供免費入口和低價事件擴展。
- 自託管主要能力沒有成員和項目上限。
- 開放核心的許可證邊界說明較清晰。
限制與注意事項
- 一次用戶互動可能產生多個計費事件。
- 模擬、在線評測和Guardrail會增加模型與事件成本。
- LLM評分器和模擬用戶可能產生誤判。
- 完整品質體系需要維護數據集、標準和人工審核。
- v3自託管以Kubernetes為主,運維複雜度高於單容器工具。
- 企業模組雖在同一倉庫,但不適用Apache開源許可。
- 追蹤內容可能包含敏感業務數據和模型提示。
- 開發者版的場景、模擬和自訂評測數量有限。
實施流程
- 選擇LangWatch Cloud或規劃自託管環境。
- 建立專案並接入OpenTelemetry或官方SDK。
- 用測試請求驗證Span、成本和用戶元數據。
- 建立核心品質指標與失敗分類。
- 從真實追蹤創建首批測試數據集。
- 為提示與模型變更設置離線實驗。
- 用場景模擬測試多輪代理和工具行為。
- 為高風險輸入輸出增加Guardrails。
- 配置生產在線評測、告警和預算。
- 按事件、席位、儲存和模型費複盤實際成本。
常見問題
LangWatch免費嗎?
開發者雲套餐永久免費,每月包含5萬個事件處理量、14天的資料存取權限、2名使用者,以及有限數量的場景、模擬與自訂評估功能。自托管開源版則不限制成員、團隊和專案的數量,但基礎建設成本由使用者自行承擔。
什麼是一個計費事件?
模型調用、工具調用、檢索、評估以及模擬等步驟,都可能產生事件。一個完整的用戶會話通常包含多個事件,因此應根據實際的追蹤數據來判斷,而非直接以會話數量來估算。
LangWatch是開源的嗎?
主要平台使用Apache第二版許可證,SDK和MCP使用MIT許可證。企業模組採用單獨的商業許可證,因此更準確的表述是開放核心平台。
可以自託管嗎?
可以,v3建議使用Kubernetes和官方Helm Chart。無許可證也能使用主要平台功能,SSO、SCIM、RBAC、審計及企業支援則需要商業授權。
Agent Simulation與普通評測有什麼區別?
普通評測通常檢查固定的輸入輸出,Agent Simulation則會讓模擬用戶與代理進行多輪互動。後者更適合測試狀態、工具、語音、拒答以及完成業務目標的完整過程。
能實時阻斷有害內容嗎?
可以將評測器作為Guardrail,在模型調用前後同步執行,並根據結果阻斷或回退。上線前應測試延遲、誤報、降級邏輯和異常處理。
總結
LangWatch不僅能記錄LLM的追蹤資料,還將離線實驗、在線評估、即時監控、代理人場景模擬以及提示管理整合成一套AI工程流程。它特別適用於那些需要對多輪代理行為進行系統性驗證的團隊,而非僅僅觀察單次模型輸出的團隊。
雲端Growth的費用為每個核心席位29歐元起,並會根據額外處理的事件數量及儲存時間長短來計費;開源自托管版則能提供更強大的資料控制功能,但進行v3版本的生产部署時,需要具備Kubernetes的運維能力。在正式採用之前,應先根據實際流量來估算事件處理量、模型費用以及資料保留需求。
桂公網安備45132202000164號