LangWatch
免費增值
AI工具大全 AI模型評測

LangWatch

LangWatch,專注於AI模型評測的智能工具

標籤:

LangWatch是什麼

LangWatch是一個針對大型語言模型應用及AI代理而設的開源LLMOps平台,由Reasoning Engine B.V.所運營。它將可觀測性、評估功能、代理模擬、提示詞管理、AI Gateway以及治理能力整合在一起,協助團隊從開發測試到最終的生產運作進行全程管理。

平台使用 OpenTelemetry 來接收並整理追蹤資料,支援託管雲端、完全自托管、企業專用雲端以及混合部署模式。開發人員可以從模型調用、工具使用情況以及使用者會話中找出問題,再將實際案例轉化為評測與情境測試的素材。

主要能力概覽

能力模組解決的問題典型產出
Observability看清模型、工具和代理如何運行追蹤、Span、指標、成本和告警
Evaluations衡量品質、安全與可靠性實驗分數、在線評測、Guardrails和回歸結果
Agent Simulations在上線前測試完整對話和行為場景執行、模擬用戶、失敗原因和測試報告
Prompt Management集中管理提示及版本提示模板、變數、版本、Playground和優化結果
AI Gateway統一模型調用、預算和路由虛擬金鑰、路由、緩存、限額和護欄
AI Governance控制團隊訪問和生產風險權限、審計、支出與組織治理

LLM與代理可觀測性

LangWatch會自動記錄大語言模型的呼叫次數、工具的使用情況、搜尋結果、錯誤狀況以及用戶互動記錄,並在追蹤過程中呈現完整的執行流程。團隊可以查看輸入與輸出內容、Token數量、成本、延遲時間、模型相關資訊、用戶資料以及自訂的元資料。

  • 按項目、用戶、模型、提示或版本篩選追蹤。
  • 查看嵌套Span和代理多步驟執行順序。
  • 定位工具失敗、慢調用和成本異常。
  • 對生產品質和業務指標設置儀表盤。
  • 透過使用者事件連接回饋與具體追蹤。
  • 將分析數據導出到外部系統。
  • 使用告警和自動化響應品質下降。

OpenTelemetry與集成

追蹤層是建立在 OpenTelemetry 之上的,因此既可以使用 LangWatch SDK,也能接收其他相容函式庫所產生的資料。它可直接整合常見的代理框架、模型供應商以及自動化平台。

集成類別代表項目用途
代理與應用框架LangChain、LangGraph、Mastra、CrewAI和Google ADK自動捕獲模型、工具和代理Span
模型供應商OpenAI、Anthropic、Azure、Google Cloud、AWS和Groq記錄模型請求、回應、Token和成本
本地模型Ollama觀察私有或本地推理流程
低代碼平台LangFlow、Flowise和n8n為可視化流程增加追蹤與評測
標準協議OTLP接入其他OpenTelemetry相容服務

離線實驗

實驗用於在上線前對固定資料集運行模型、提示或代理版本,並記錄每個樣本的輸出與評分。團隊可以透過介面、Python或TypeScript來執行實驗,進而比較多種配置的品質、成本和延遲。

  1. 創建代表真實任務的資料集。
  2. 選擇當前生產版本作為基線。
  3. 定義需要比較的提示、模型或代理配置。
  4. 為輸出配置內建或自訂評測器。
  5. 並行運行全部樣本並記錄追蹤。
  6. 比較分數、錯誤、延遲和成本。
  7. 把失敗樣本加入回歸數據集。
  8. 將最低品質要求接入持續集成門禁。

在線評測

線上評估在生產追蹤資料到達後會自動運行指定的評測工具,用於持續監控資料的真實性、相關性、安全性,以及 PII 或自訂的業務指標。它適用於發現隨著使用者、模型和資料變化而出現的品質偏移。

評測方式運行時機適合用途
離線實驗發布前針對固定數據集比較提示、模型和代理版本
Online Evaluation生產追蹤到達後監控品質趨勢和異常樣本
Guardrail模型調用前後同步執行實時阻斷越獄、PII或違規內容
人工Annotation對選定追蹤或數據點審核專家標籤、偏好和爭議案例

Guardrails實時護欄

評測器可在應用程式碼中作為Guardrail同步執行,並根據是否通過決定放行或阻斷。它適合用於輸入端的越獄檢測、輸出端的安全檢查以及關鍵業務規則的驗證,但會增加呼叫延遲和事件用量。

  • 檢測越獄和提示注入。
  • 識別PII及敏感資訊。
  • 檢查毒性、有害或違規內容。
  • 驗證RAG回答的忠實度與相關性。
  • 執行LLM-as-a-judge或自訂代碼評分。
  • 在失敗時返回安全提示或轉人工處理。

評測器與工作流

LangWatch提供RAGAS、幻覺、毒性、PII以及模型裁判等內建評測工具,同時也允許團隊建立可重複使用的組織級評測工具。對於較為複雜的評測,則可以透過工作流程來組合多個步驟與判斷標準,並將自訂的分數附加到追蹤記錄或Span中。

資料集與標註

資料集可以透過SDK和API來管理,也可以從生產追蹤中提取,或是由AI輔助生成。Annotation Inbox用於將樣本分配給人工審核者,適合業務專家補充標籤、目標答案以及主觀品質判斷。

  • 從真實追蹤建立失敗案例集。
  • 保存文本和圖像等評測輸入。
  • 透過程式碼批量建立與查詢資料集。
  • 讓AI快速生成初始測試樣本。
  • 將人工標籤與自動評測分開記錄。
  • 把審核結果用於後續回歸測試。

Agent Simulations

Agent Simulations透過模擬使用者與待測代理之間的多輪互動,來驗證該代理是否能夠在真實對話中達成目標、遵守規則,並正確使用工具。相較於單輪的輸入輸出評估,它更適合用來測試狀態管理、記憶能力、工具調用以及長時間對話中的表現。

場景結構

組成內容作用
Scenario初始條件、使用者目標與約束定義需要驗證的真實業務任務
Agent Adapter連接本地、遠端或託管代理把測試消息送到待測系統
User Simulator按角色和目標生成多輪用戶行為覆蓋不同表達、追問和阻力
Criteria成功、失敗和安全判斷決定場景是否通過
Run Parameters併發、重試、模型和測試數量控制成本與覆蓋範圍

支援的代理形態

  • 文本聊天代理。
  • 需要登入或令牌的遠端代理。
  • 本地開發中的代理函數。
  • OpenAI Realtime等即時代理。
  • ElevenLabs、Twilio和Pipecat等語音代理。
  • Gemini Live等即時多模態代理。

紅隊與安全場景

場景測試可用於產生對抗性用戶、越權請求和提示注入流程,觀察代理在多輪互動中的防禦表現。紅隊的測試結果應作為改進的依據,不能認為透過一次測試就能永遠保持安全。

Scenario開源庫

獨立Scenario倉庫提供了用於Python和TypeScript語言的代理測試工具,且採用Apache第二版授權協議。它可以在本地或持續整合環境中運作,並不要求所有的測試都必須在LangWatch雲端上完成。

提示管理

Prompt Management可集中儲存提示模板、變數、版本及發布狀態,避免提示散落在程式碼、表格和介面中。開發者可透過SDK或CLI同步提示,並在Playground中替換模型和參數以進行比對。

功能作用典型用戶
Prompt Registry集中保存命名提示和版本開發與產品團隊
Variables在運行時填充業務數據應用開發者
Playground測試提示、模型和參數提示工程與業務專家
CLI Sync將提示配置納入代碼倉庫平台工程與持續集成
Optimization Studio基於樣本和目標改進提示需要系統化優化的團隊
DSPy Optimization用程式化方法搜尋更優提示研究和高級評測團隊

AI Gateway

AI Gateway可以統一接入多個模型供應商,並在組織邊界內管理虛擬金鑰、路由、預算、緩存以及Guardrails。在自托管模式下,可選擇讓模型流量在自己的網路邊界處終止。

  • 用虛擬金鑰隔離應用和團隊。
  • 在多個模型或供應商之間路由。
  • 為組織、專案或用戶設定層級預算。
  • 使用提示緩存減少重複推理。
  • 在統一入口執行實時護欄。
  • 集中記錄成本、失敗和模型用量。

MCP、CLI與Skills

LangWatch提供MCP、命令列工具以及用於輔助編程的技能,讓AI助手能夠協助進行追蹤、建立評估、執行模擬以及管理提示。不過,自動化的修改仍需經過人為審核,尤其是對於生產用金鑰、安全機制以及部署設定而言。

雲端價格

價格資訊於2026年8月23日核驗,實際金額、稅費、匯率及優惠可能變動,最終以結算頁面顯示為準。

LangWatch Cloud是根據核心席位數量及事件使用量來計費的,而Growth版則會對保存超過30天的資料收取儲存費用。Lite版的使用者雖可查看及協作,但具體的可編輯範圍仍需以當前的權限說明為準。

套餐或版本價格計費週期核心權益或額度適合用戶
Developer免費永久免費,額度每月刷新5萬事件、14天數據訪問、2名用戶,3個場景、3次模擬和3個自定義評測個人開發者與早期原型
Growth每核心席位29歐元每月含20萬事件和30天保留,無限Lite用戶、模擬、評測與提示把AI應用投入生產的團隊
Enterprise訂製報價合同約定混合、自託管或本地部署,自訂保留、SSO、RBAC、審計、SLA及專屬工程支援受監管與大型組織

事件與儲存計費

每次模型調用、工具調用、檢索、評估或模擬步驟都會被視為一個事件,因此一次用戶對話通常會包含多個計費事件。Growth服務在每月的前20萬個事件內是免費的,之後則每10萬個事件需支付5歐元。

計費項Growth包含量超額價格注意事項
核心席位每席位獨立計費29歐元每席位每月可增減席位,20人以上可詢問量價優惠
事件每月20萬每10萬事件5歐元模型、工具、檢索、評測和模擬步驟均可能計費
資料存取30天延長部分每GB 3歐元僅在保留超過包含週期時計費
Lite用戶無限包含權限範圍與核心席位不同
模型推理不包含由模型供應商收取模擬和LLM評測可能產生較多模型調用

賬單估算方法

  1. 統計每月最終用戶互動數量。
  2. 測量一次典型互動包含多少模型、工具和檢索事件。
  3. 加入線上評測和Guardrail產生的事件。
  4. 估算離線實驗與代理模擬的額外運行量。
  5. 確定需要完整使用權限的核心席位數量。
  6. 計算超過30天仍需訪問的資料GB。
  7. 另行加入模型、雲端儲存和自託管基礎設施費用。
  8. 為增長、回填和異常流量預留預算。

開源與許可證

LangWatch採用開放核心模式,主要平台代碼使用Apache第二版許可證,Python、TypeScript SDK及MCP服務則使用MIT許可證。SCIM、審計日誌、許可證與計費管理等企業相關模組位於獨立的目錄中,若要進行實際應用,則需要取得商業許可證。

組件許可證可做什麼限制
LangWatch核心平台Apache第二版查看、修改和自託管主要功能企業目錄中的模組不在同一許可下
Python SDKMIT追蹤、評測和數據訪問仍需連接雲端或自託管服務
TypeScript SDKMIT在Node與Web項目中集成平台不包含託管基礎設施
MCP ServerMIT讓AI客戶端操作LangWatch能力需要合理配置權限和憑證
ScenarioApache第二版本地運行代理場景測試模型和目標代理費用自理
Enterprise模組商業許可證SSO、SCIM、審計和企業管理生產使用需購買授權

自託管版本

若不配置企業許可證,自託管版LangWatch仍允許擁有無限數量的成員、團隊、專案以及自建內容,且能運行與雲端版相同的主軟體。而企業許可證則可在同一部署環境中啟用SSO、RBAC、SCIM、審計日誌及支援服務,無需更換為獨立的產品版本。

部署模式對比

部署模式應用由誰管理資料儲存位置適合場景
LangWatch CloudLangWatch託管雲快速開始和免運維
Self-Managed客戶客戶基礎設施完整數據主權和自主管理
Cloud EnterpriseLangWatch客戶指定區域的專屬實例需要隔離且不想自行運維
HybridLangWatch管理控制平面ClickHouse與對象儲存位於客戶網路追蹤數據不能離開企業網路

自託管基礎設施

目前的 v3 生產方案以 Kubernetes Helm 為主,使用 ClickHouse 作為核心分析儲存層,並透過對象儲存來分層保存冷數據。Docker Compose 的快速方案仍主要適用於 v2,準備部署 v3 時不應沿用舊有的教學內容。

  • 使用ClickHouse保存和查詢追蹤及評測事件。
  • 透過事件溯源保證追蹤與評測處理順序。
  • 將舊數據分層到相容對象儲存。
  • 使用原生ClickHouse備份與恢復機制。
  • 透過Helm Overlay調整不同規模部署。
  • 可選啟用AI Gateway子Chart。
  • 需要自行維護密鑰、網路、備份、升級和監控。

安全與合規

LangWatch公開聲明其符合GDPR規定,並已取得ISO 27001認證,企業客戶可申請相關報告及資料處理協議。由於該平台可能會接觸到提示詞、輸出內容、工具參數以及使用者資料,因此該團隊仍需自行完成資料的分類與存取規劃。

  • 在埋點前移除不需要的個人數據和密鑰。
  • 限制誰能查看原始追蹤與資料集。
  • 為導出、MCP和API設定最小權限。
  • 審查雲端地區、子處理方和保留週期。
  • 自託管環境啟用傳輸與靜態加密。
  • 為審計、刪除、備份和事件應對制定流程。
  • 受監管業務應透過企業合約確認合規責任。

適合哪些用戶

  • 開發大語言模型應用和AI代理的工程團隊。
  • 負責模型品質、回歸與安全測試的團隊。
  • 需要模擬用戶測試多輪代理行為的產品團隊。
  • 希望讓業務專家參與提示和人工標註的組織。
  • 需要統一模型網關、預算和治理的平台團隊。
  • 希望開源自託管並控制追蹤數據的企業。
  • 使用n8n等低代碼工具來建構AI流程的開發者。

產品優勢

  • 可觀測、評測、模擬與提示管理形成完整閉環。
  • Agent Simulations適合驗證多輪和工具型代理。
  • 支援離線實驗、在線監控和同步Guardrails。
  • OpenTelemetry降低與單一SDK的綁定。
  • 雲端價格同時提供免費入口和低價事件擴展。
  • 自託管主要能力沒有成員和項目上限。
  • 開放核心的許可證邊界說明較清晰。

限制與注意事項

  • 一次用戶互動可能產生多個計費事件。
  • 模擬、在線評測和Guardrail會增加模型與事件成本。
  • LLM評分器和模擬用戶可能產生誤判。
  • 完整品質體系需要維護數據集、標準和人工審核。
  • v3自託管以Kubernetes為主,運維複雜度高於單容器工具。
  • 企業模組雖在同一倉庫,但不適用Apache開源許可。
  • 追蹤內容可能包含敏感業務數據和模型提示。
  • 開發者版的場景、模擬和自訂評測數量有限。

實施流程

  1. 選擇LangWatch Cloud或規劃自託管環境。
  2. 建立專案並接入OpenTelemetry或官方SDK。
  3. 用測試請求驗證Span、成本和用戶元數據。
  4. 建立核心品質指標與失敗分類。
  5. 從真實追蹤創建首批測試數據集。
  6. 為提示與模型變更設置離線實驗。
  7. 用場景模擬測試多輪代理和工具行為。
  8. 為高風險輸入輸出增加Guardrails。
  9. 配置生產在線評測、告警和預算。
  10. 按事件、席位、儲存和模型費複盤實際成本。

常見問題

LangWatch免費嗎?

開發者雲套餐永久免費,每月包含5萬個事件處理量、14天的資料存取權限、2名使用者,以及有限數量的場景、模擬與自訂評估功能。自托管開源版則不限制成員、團隊和專案的數量,但基礎建設成本由使用者自行承擔。

什麼是一個計費事件?

模型調用、工具調用、檢索、評估以及模擬等步驟,都可能產生事件。一個完整的用戶會話通常包含多個事件,因此應根據實際的追蹤數據來判斷,而非直接以會話數量來估算。

LangWatch是開源的嗎?

主要平台使用Apache第二版許可證,SDK和MCP使用MIT許可證。企業模組採用單獨的商業許可證,因此更準確的表述是開放核心平台。

可以自託管嗎?

可以,v3建議使用Kubernetes和官方Helm Chart。無許可證也能使用主要平台功能,SSO、SCIM、RBAC、審計及企業支援則需要商業授權。

Agent Simulation與普通評測有什麼區別?

普通評測通常檢查固定的輸入輸出,Agent Simulation則會讓模擬用戶與代理進行多輪互動。後者更適合測試狀態、工具、語音、拒答以及完成業務目標的完整過程。

能實時阻斷有害內容嗎?

可以將評測器作為Guardrail,在模型調用前後同步執行,並根據結果阻斷或回退。上線前應測試延遲、誤報、降級邏輯和異常處理。

總結

LangWatch不僅能記錄LLM的追蹤資料,還將離線實驗、在線評估、即時監控、代理人場景模擬以及提示管理整合成一套AI工程流程。它特別適用於那些需要對多輪代理行為進行系統性驗證的團隊,而非僅僅觀察單次模型輸出的團隊。

雲端Growth的費用為每個核心席位29歐元起,並會根據額外處理的事件數量及儲存時間長短來計費;開源自托管版則能提供更強大的資料控制功能,但進行v3版本的生产部署時,需要具備Kubernetes的運維能力。在正式採用之前,應先根據實際流量來估算事件處理量、模型費用以及資料保留需求。

©️版權聲明:若無特殊說明,本站所有文章版權均歸AI工具分享本網站的內容為原創作品,任何人或機構在未獲許可的情況下,都不得轉載、抄襲或以其他方式複製並發表本網站的內容,亦不得在非本網站所屬的伺服器上建立其鏡像版本。否則,本網站將依法追究相關責任人的法律責任。

類似於LangWatch的工具