Laminar是什麼
Laminar是一個專為AI代理和大語言模型應用而設計的開源可觀測、調試與評估平台,由lmnr.ai團隊開發,並入選了Y Combinator S24計劃。它能記錄模型的呼叫次數、工具的使用情況、控制流程以及子代理的活動,並將這些資料轉換成可搜尋、可查詢且可評估的數據。
使用者既可以使用託管的 Laminar Cloud,也可以部署完整的開源技術堆疊。該產品以 OpenTelemetry 為基礎進行追蹤,並為長時間、多步驟及並行處理的場景提供更易閱讀的對話式追蹤視圖。
主要解決什麼問題
- 查看代理每一步實際調用了什麼模型與工具。
- 定位錯誤、重複呼叫、循環和異常成本。
- 從大量生產追蹤中自動發現行為模式。
- 在提示詞、模型或代碼變更前運行回歸評測。
- 將真實失敗案例轉為評測資料集。
- 透過SQL、全文搜尋和儀表板分析運行數據。
- 在雲端或自有基礎設施保存敏感追蹤。
AI代理追蹤
Tracing會記錄代理運行中的模型輸入輸出、工具參數與結果、函數調用、錯誤、延遲、Token以及成本。Laminar則將複雜的代理軌跡以對話式轉錄的方式呈現,並將子代理折疊成可展開的卡片,從而減少僅查看Span樹時的理解負擔。
自動與手動埋點
| 埋點方式 | 工作方式 | 適合場景 |
|---|---|---|
| 自動儀表化 | 初始化SDK後捕獲受支援框架和模型客戶端 | 快速接入現有代理應用 |
| 函數包裝 | 用observe包裝函數並記錄輸入輸出 | 追蹤業務步驟和工具函數 |
| 手動Span | 顯式創建層級與附加屬性 | 複雜控制流和自訂框架 |
| OpenTelemetry導入 | 接收標準OTLP追蹤數據 | 已有可觀測體系和跨服務代理 |
常見集成
- OpenAI、Anthropic和Gemini模型客戶端。
- Vercel AI SDK與OpenAI Agents SDK。
- Claude Agent SDK和OpenHands SDK。
- LangChain、Mastra和Pydantic AI。
- Browser Use、Stagehand和Playwright瀏覽器代理。
- LiteLLM及其他OpenTelemetry相容服務。
即時追蹤與全文搜尋
平台可在代理尚未結束時即時顯示Span,適合用於觀察長時間運行的任務、並行執行的子代理以及瀏覽器操作。所有的追蹤功能都支援全文搜尋、欄位過濾和表格視圖,開發者可以從錯誤訊息、工具參數或使用者內容中快速定位異常狀況。
瀏覽器會話重播
對於 Browser Use、Stagehand 和 Playwright 等瀏覽器代理工具,Laminar 可以將頁面操作與代理追蹤相關聯。開發者不但能了解模型為何選擇某個動作,還能回顧執行時的瀏覽器狀態。
信號生產監控
Signals允許團隊以自然語言來描述需要監控的結果或失敗情況,例如代理程式是否重複呼叫工具、在介面出錯時是否偽造數據,或是使用者是否放棄了任務。系統會讀取完整的追蹤資料,而非僅僅最終的回應,並在找到匹配的資料時產生結構化的事件。
Signal組成
| 組成部分 | 作用 | 配置範例 |
|---|---|---|
| Prompt | 描述要檢測或提取的行為 | 尋找工具失敗後仍給出無依據結論的運行 |
| 結構化Schema | 定義事件中必須提取的欄位 | 失敗工具、錯誤聲明和用戶影響 |
| Trigger | 決定何時分析追蹤 | 根Span結束或指定Span結束 |
| Filters | 限制需要分析的追蹤範圍 | 最小Token、錯誤狀態或Span名稱 |
| Severity | 標記事件嚴重程度 | Critical、Warning或Info |
Signals工作流程
- 新追蹤滿足觸發器與過濾條件。
- 系統壓縮長追蹤並保留模型、工具及錯誤主線。
- Signals代理依據自然語言規則調查壓縮內容。
- 必要時讀取完整Span以確認具體輸入輸出。
- 將發現轉換為符合Schema的結構化事件。
- 事件關联回原追蹤並進入搜尋索引。
- 相似事件自動聚類以識別重複模式。
- 符合規則的事件會透過Slack或郵件發出警報。
Signals與普通LLM評分的差異
普通評分器通常只檢查最後一段模型的輸出,因此很難發現數十步之前的工具錯誤、無效的子代理以及重複調用等問題。Signals則會閱讀整個運行過程,並能將最終結論與中間各個工具的輸出結果相關聯。
| 對比項 | 普通輸出評分 | Laminar Signals |
|---|---|---|
| 分析範圍 | 通常是最終回答 | 完整模型、工具、子代理、重試和錯誤追蹤 |
| 規則表達 | 代碼或固定評分提示 | 自然語言檢測規則加結構化Schema |
| 結果 | 一個或多個分數 | 可查詢、聚類和告警的結構化事件 |
| 運行方式 | 多用於離線樣本 | 可實時分析新追蹤,也可回填歷史數據 |
| 適合問題 | 答案品質和格式 | 邏輯失敗、用戶摩擦、業務結果與成本浪費 |
AI Agent Debugger
除錯器會將一次問題的調查過程整理成一個會話,其中包含原始的執行過程、重放功能、評估結果、指令以及開發筆記。當開發人員或編程代理修改了代碼之後,他們可以從指定位置重新播放已記錄的追蹤資料,而之前相同的模型呼叫則會由快取來回傳。
緩存回放價值
長期代理可能在運行很久之後才暴露問題,完整重跑會重複消耗時間和模型費用。前綴緩存讓調試只需重新執行變更點之後的部分,從而加快提示、工具和控制流程的迭代。
- 以調試模式運行代理並記錄完整追蹤。
- 閱讀轉錄內容,找到錯誤Span或無效行為。
- 修改提示、工具、代碼或控制流程。
- 從需要驗證的邊界重放已記錄運行。
- 比較新舊追蹤、輸出、延遲和成本。
- 用固定資料集運行評測證明修復並非偶然。
- 在相同的調試會話中保存結果和說明。
- 透過回歸門禁後再發布變更。
離線評測
Laminar評測由數據點、執行器、評測器及分組名稱所組成。系統會同時處理每個輸入,記錄其執行與評分Span,並將相同分組下的多次運行結果繪製成趨勢圖,以便發現問題或模型升級後的迴歸現象。
| 評測部分 | 內容 | 作用 |
|---|---|---|
| Datapoints | 輸入、可選目標和元數據 | 定義固定測試樣本 |
| Executor | 運行模型、代理或工具的函數 | 生成需要評分的實際輸出 |
| Evaluators | 返回數值或多維分數的函數 | 衡量準確性、格式、成本或業務條件 |
| Group | 關聯多次相關運行的名稱 | 比較版本並觀察指標變化 |
| Custom Rendering | 針對數據類型自定義評測行視圖 | 提高人工審核和差異比較效率 |
資料集與標註
團隊可以從生產追蹤、SQL查詢、介面或本地資料建立評測資料集,再透過標註隊列補充人工標籤。將真正的失敗案例與邊緣案例納入資料集,能讓回歸測試更貼近線上問題。
- 批量把查詢結果轉換為資料集。
- 從單條異常追蹤創建評測樣本。
- 為數據點保存目標答案和元資料。
- 用標註隊列分配人工審核任務。
- 在本地腳本或持續整合流程運行評測。
- 比較同一分組下多個版本的分数趨勢。
Playground
Playground可重放已追蹤Span,並替換提示詞、模型或輸入後並排比較結果。它適合快速驗證一個局部調整,但正式發布仍應使用覆蓋更多樣本的評測。
SQL、MCP與儀表盤
Laminar允許透過內建SQL編輯器直接查詢追蹤資料、指標以及Signal事件,同時也可以利用查詢結果來建立資料集或儀表板。而CLI和MCP訪問功能則讓程式設計代理能夠讀取可觀測資料、執行分析,並參與除錯流程。
| 分析入口 | 能力 | 適合用戶 |
|---|---|---|
| SQL Editor | 查詢追蹤、Span、指標和事件 | 資料工程師和高級開發者 |
| Dashboards | 用指標及自訂SQL構建圖表 | 產品、平台與運維團隊 |
| Full-text Search | 搜尋Span輸入輸出和錯誤 | 故障排查與客服支援 |
| CLI | 執行評測、管理數據與調試會話 | 開發者與持續整合流程 |
| MCP | 讓AI客戶端查詢和分析Laminar數據 | 編程代理與自動化研究 |
Python與TypeScript SDK
官方提供Python和TypeScript用戶端,皆可用於初始化專案金鑰、自動處理受支援的模型與框架,並能透過裝飾器或函數來包裝以記錄自訂邏輯。Python套件有特定的Python版本要求,其依賴項目及儀表板功能範圍,都必須在升級前依照發布說明進行確認。
- 建立工作區、專案以及專案 API 金鑰。
- 安裝Python或TypeScript SDK及所需集成。
- 在應用啟動階段初始化Laminar。
- 為關鍵業務函數加入observe包裝。
- 運行本地請求並確認追蹤層級與內容。
- 添加用戶、會話、標籤和版本元資料。
- 在生產前配置採樣與敏感數據處理。
- 建立儀表板、Signals和評測門禁。
雲端價格
價格資訊於2026年8月23日核驗,實際金額、稅費、匯率及優惠可能變動,最終以結算頁面顯示為準。
Laminar Cloud的計費方式是根據基本套餐、每月的追蹤數據量、Signals分析Token以及資料保留期來決定。Free版沒有數據用量超過限制的機制,而Starter版和Pro版則可以在用完額度後,再按GB數量來計費。
| 套餐或版本 | 價格 | 計費週期 | 核心權益或額度 | 適合用戶 |
|---|---|---|---|---|
| Free | 0美元 | 每月 | 1GB數據、5美元Signals額度、7天保留、1個項目和1個席位,無超額 | 個人開發者與小型原型 |
| Starter | 30美元 | 每月 | 3GB數據、15美元Signals額度、30天保留、無限項目和席位,超額2美元每GB | 小團隊和早期生產應用 |
| Pro | 150美元 | 每月 | 10GB數據、50美元Signals額度、6個月保留、無限項目和席位,超額1.5美元每GB | 多項目生產團隊 |
| Enterprise | 訂製報價 | 合同約定 | 自訂額度與保留、本地部署、專屬支援及企業安全能力 | 高規模、合規和私有部署組織 |
Signals計費
Signals並非依照代理原始Token的一對一比例來收費,而是根據內部分析後,代理在實際進行追蹤時所消耗的Token數量來計費。系統會先對追蹤資料進行壓縮,官方估計平均可將其壓縮到原來Token量的約十分之一,但實際比例會受到工具的輸出方式以及追蹤資料的結構影響。
| 套餐 | 包含Signals額度 | 超額輸入價格 | 超額輸出價格 |
|---|---|---|---|
| Free | 5美元 | 不支援超額 | 不支援超額 |
| Starter | 15美元 | 每百萬Token 0.5美元 | 每百萬Token 3美元 |
| Pro | 50美元 | 每百萬Token 0.4美元 | 每百萬Token 2.5美元 |
| Enterprise | 訂製 | 訂製 | 訂製 |
成本估算注意事項
- 追蹤數據GB與代理Token量不是固定換算關係。
- 保存完整工具輸出會顯著增加數據量。
- 信號過濾範圍決定需要分析多少追蹤。
- 回填歷史追蹤會集中消耗Signals額度。
- 長保留期可能需要更高套餐或自託管儲存。
- 模型推理費不包含在Laminar訂閱中。
- 自託管仍需計算資料庫、對象儲存和運維成本。
開源與許可證
Laminar核心倉庫、Python SDK以及TypeScript SDK均採用Apache第二版許可證,使用者可以查看、修改這些軟體,並自行部署它們。至於商業雲服務、企業鏡像、許可證相關功能以及專屬支援,則仍需遵守各自的商業條款。
| 項目 | 狀態 | 許可證或條件 | 主要用途 |
|---|---|---|---|
| lmnr核心倉庫 | 公開且持續維護 | Apache第二版 | 前端、應用服務、查詢引擎和本地部署 |
| Python SDK | 公開 | Apache第二版 | Python應用追蹤與評測 |
| TypeScript SDK | 公開 | Apache第二版 | Node與TypeScript應用追蹤 |
| Helm部署倉庫 | 公開 | 按倉庫文件執行 | 在Kubernetes部署企業規模組件 |
| 企業功能 | 部分需要許可證金鑰 | 商業許可 | 專屬集成、支援及高級安全能力 |
| Laminar Cloud | 託管商業服務 | 按套餐使用 | 免運維的雲端平台 |
Docker自託管
輕量級的自管理方式可以透過 Docker Compose 來啟動前端、應用程式服務以及所需的資料元件,這種方式適合用於開發或小規模的應用場景。而在正式的生產環境中,則應使用完整的編排檔案,並設定好持久化儲存、備份、網路加密、身分驗證、資源限制以及升級策略等功能。
Kubernetes自託管
官方的Helm方案適用於AWS和Google Cloud的集群,支援的資料庫包括PostgreSQL、ClickHouse、Redis、RabbitMQ,此外還支援全文搜尋及物件儲存功能。雖然可以下載公開提供的企業鏡像,但某些整合功能則需要使用企業許可證金鑰。
| 組件 | 主要職責 | 生產注意事項 |
|---|---|---|
| PostgreSQL | 帳戶、專案和元資料 | 高可用、備份和升級 |
| ClickHouse | 大規模追蹤與分析數據 | 磁盤、對象儲存和保留策略 |
| Redis | 緩存與臨時狀態 | 記憶體限制與故障恢復 |
| RabbitMQ | 異步處理隊列 | 持久化、積壓和監控 |
| Quickwit | 全文搜尋索引 | 對象儲存、索引規模和重建 |
| Frontend與App Server | 界面、接口和資料處理 | 版本鎖定、擴容和網路入口 |
隱私與PII刪除
雲端專案可在寫入前啟用伺服器端PII刪除功能,對每個Span的輸入和輸出內容進行檢測,找出姓名、電子郵件、電話號碼、帳號及其他個人資訊,並以佔位符替換之。原始文本不會被儲存於追蹤系統或搜尋索引中,但此功能僅適用於啟用後的新Span。
- PII開關依項目配置,而非整個工作區統一配置。
- 現有歷史追蹤不會被自動重新處理。
- JSON字段名、Span名稱、狀態和成本等結構資訊會保留。
- 透過追蹤元資料寫入的使用者ID不會被此開關刪除。
- 誤識別或漏識別仍可能發生,敏感字段應優先在上游移除。
- 自託管團隊需要自行配置訪問、加密、備份和刪除。
企業安全能力
公開的套餐對比表中列出了 OAuth 登入、SOC 2 Type II、HIPAA 以及伺服器端 PII 刪除等安全功能,但具體可用的套餐仍需透過控制台及合約來確認。負責監管的團隊還應審查子處理方、資料儲存地點、資料保留期限以及事件應變相關條款。
適合哪些用戶
- 開發多步驟AI代理的工程團隊。
- 需要監控模型、工具和子代理行為的平台團隊。
- 為提示與模型變更建立回歸評測的品質團隊。
- 希望用自然語言發現生產異常的產品與運營人員。
- 需要SQL、儀表板及全文搜尋分析追蹤的數據團隊。
- 希望自託管開源可觀測平台的公司。
- 讓編程代理參與除錯循環的開發者。
產品優勢
- 針對長時間和多代理任務提供對話式追蹤視圖。
- OpenTelemetry原生,便於接入現有可觀測體系。
- Signals可以跨完整追蹤發現邏輯和業務問題。
- 調試器透過緩存重放減少重複呼叫成本。
- 評測、資料集、標註和生產追蹤形成閉環。
- 支援SQL、MCP、CLI和自訂儀表板。
- 核心平台與SDK採用寬鬆開源許可證。
限制與注意事項
- 全面追蹤可能記錄提示、工具結果和敏感業務數據。
- 信號依賴模型判斷,可能產生誤報或漏報。
- Trace Token與儲存GB之間無法簡單換算。
- Free僅保留7天並且不允許數據超額。
- 完整自託管堆疊包含多種資料庫和中介軟體,運維門檻較高。
- 部分企業能力與整合需要商業許可證。
- 緩存重放不能替代真實的端到端和負載測試。
- 自動儀表化範圍會隨框架版本變化。
選型與部署建議
- 統計代理運行量、平均追蹤大小和保留要求。
- 列出必須追蹤與必須排除的敏感字段。
- 先在測試專案接入SDK並檢查Span結構。
- 確定使用雲端還是自託管數據邊界。
- 為錯誤、成本和業務結果建立初始信號。
- 從生產失敗構建小型回歸數據集。
- 將評測加入持續集成但設定合理併發。
- 觀察一個完整計費週期的GB與Signals用量。
- 為告警、保留、刪除和權限制定運行手冊。
- 定期驗證備份、升級和故障恢復。
常見問題
Laminar是做什麼的?
它用於追蹤、調試、監控和評估AI代理及大語言模型應用。平台會記錄模型、工具和子代理的運行狀況,並提供Signals、資料集、SQL和儀表板。
Laminar免費嗎?
雲端Free方案每月免費提供1GB數據、5美元的Signals額度、7天的資料保留期、1個專案以及1個席位。核心開源代碼也可自行部署,但基礎設施與運維成本則由使用者承擔。
Laminar是開源的嗎?
是的,核心倉庫及主要SDK採用Apache第二版許可證。部分企業鏡像、整合、許可證功能及託管服務仍屬於商業服務範疇。
Signals會讀取所有追蹤嗎?
只有滿足對應觸發器及過濾條件的追蹤才會被分析。系統先壓縮追蹤,再由內部代理調查完整運行,並按需讀取具體的Span。
可以自託管嗎?
可以,輕量級環境可使用Docker Compose,企業規模則可利用Helm部署到AWS或Google Cloud。而實際生產環境中,則需要自行維護資料庫、搜尋功能、物件儲存、備份以及安全設施。
是否支援Python和TypeScript?
支持,兩種語言皆有官方SDK,可進行自動儀表化、手動Span、函數觀察與評測。採用前應確認框架版本與當前SDK整合相容。
總結
Laminar將AI代理追蹤、自然語言生成監控、快取重放調試、離線評估以及數據分析等功能整合在一個OpenTelemetry原生平台上。它特別適用於那些需要了解長時間運作過程中的各種行為,而不想只看到最終結果的工程團隊。
託管版從免費到每月150美元,並根據資料與Signals的用量進行調整;開源版則能提供更強大的資料控制能力,但需要自行負責所有的運維工作。實際選型時,應考慮追蹤的資料量、資料保留期間、敏感資訊的處理方式、Signals的成本,以及自託管的複雜度等因素。
桂公網安備45132202000164號