一句話介紹
Fleak是一種針對企業級AI、機器數據及流式分析所設計的即時資料基礎建設,能夠在資料來源與AI應用之間完成解析、標準化、過濾、去重、治理以及依價值進行路由的處理。
工具簡介
Fleak是由Fleak Tech Inc.所開發的,其定位為AI原生的資料處理層,而非一般的聊天機器人。使用者可以透過視覺化的DAG或自然語言來建立資料流程,再將其部署在託管式運算集群中,以進行分散式的異步處理。
該平台主要用於解決數據格式不一致、上游Schema變更、重複事件、無價值的數據佔用儲存空間及Token的問題,同時也解決不同下游系統之間的權限不一致問題。而ZephFlow則是可獨立使用的開源無狀態處理引擎。
產品組成
| 組成 | 主要作用 | 運行方式 | 開放狀態 |
|---|---|---|---|
| Fleak託管平台 | 連接、編排、部署、監控與治理數據管道 | 託管計算集群 | 商業服務,預約演示 |
| Workflow Builder | 用DAG配置渠道、處理節點和輸出 | 網頁界面 | 文件公開,帳戶能力按方案 |
| AI Copilot | 從自然語言生成管道配置並輔助Schema變化 | 平台內使用 | 商業功能 |
| ZephFlow Core | 無狀態流式資料處理 | 嵌入應用、獨立進程或網路服務 | Apache 2.0開源 |
| ZephFlow Python SDK | 用Python組合過濾、轉換和錯誤處理 | Python調用Java 17引擎 | Apache 2.0開源 |
工作原理
- 從Kafka、Splunk、機器日誌、資料庫、工業系統或其他渠道接入原始事件。
- 透過AI或規則識別事件類型、欄位含義、Schema及下游應用需求。
- 使用解析、過濾、斷言、表達式或SQL節點來清洗、驗證、標準化及分支。
- 按照實時價值、合規價值和目標Schema把記錄路由到不同目的地。
- 部署到託管計算集群後持續處理,並在監控面板觀察吞吐、錯誤和管道健康。
- 檢測上游Schema漂移時生成新配置,由團隊審核後重新部署。
主要功能
AI價值感知路由
Fleak會評估每條輸入資料對下游AI或業務應用的價值,再決定是即時傳遞、長期儲存還是丟棄。如此一來,就能在資料進入資料湖、SIEM或模型之前,減少無用、重複且低價值的資料。
自然語言編排
使用者可用自然語言描述目標,由Copilot生成資料處理配置。生成結果仍需用真實事件樣本驗證欄位、邊界條件和錯誤處理,不能直接把描述當作生產規則。
自愈Schema漂移
平台可以檢測上游Schema的變化、發出提醒並生成新的配置。官網上有頁面說明會自動重新部署,也有說明要求用戶批准後再進行部署,生產環境應採用「自動檢測與生成、人工審核後發布」的配置方式。
可視化DAG工作流
Workflow Builder將渠道、處理和輸出節點連接成有向無環圖,每個上游節點的輸出會成為下游節點的輸入。在發布之前,平台會先檢查DAG結構,之後再由託管集群負責處理並行化、同時處理多個任務以及負載分配等問題。
多格式解析
解析器節點可處理JSON、鍵值對、CSV、Grok、Syslog、CEF以及Windows多行等結構化或半結構化文本。解析後的欄位可進一步用於過濾、斷言、SQL及架構對應。
過濾、斷言與表達式
Filter用於排除不必要的記錄,Assertion用於驗證必要的欄位及資料品質,Fleak Eval則負責建立或修改欄位。失敗的記錄可被放入錯誤追蹤系統或死信隊列中。
SQL數據轉換
FleakSQL讓熟悉SQL的團隊能夠轉換記錄,從而降低學習專用運算式的成本。其支援範圍並非所有的資料庫語法,因此在遷移複雜查詢之前,需要參考語法文件並進行相容性測試。
去重與標準化
平台在數據進入儲存或模型之前進行過濾、去重以及統一 Schema,可降低儲存、查詢以及模型上下文中的重複內容。官網所說的成本降低屬於宣傳指標,實際效果則取決於數據品質與規則。
細粒度治理與審計
Fleak在資料層面執行存取控制,並記錄轉換與交付的過程,其官網上會顯示完整的審計紀錄,以及SOC 2 Type II的認證資格。企業在採購時,應要求獲得最新的報告、範圍說明、例外情況以及資料處理協議。
分散式異步執行
託管工作流部署後會在Fleak計算集群中運行,平台會自動處理並行化、併發以及資源調整等問題。團隊無需自行編寫多執行緒與負載均衡的相關邏輯,但仍需設定容量、延遲及故障處理的目標。
可觀察性
監控面板用於查看管道的健康狀態、吞吐量以及錯誤情況,便於發現通道中斷、解析失敗或目的地問題。在投入使用之前,應確認指標的保存期限、告警方式、日誌欄位以及服務等級。
零儲存式即時傳遞
官網強調,資料可以即時轉換並直接傳送至目標系統,無需在Fleek中長期儲存。零儲存是管道設計的能力,並不代表日誌、審計、錯誤或運營元數據完全不會被保留。
公開節點與資料格式
| 類別 | 已明確公開的節點或格式 | 主要用途 | 核驗提醒 |
|---|---|---|---|
| 渠道 | Kafka來源、Splunk來源 | 流式主題和Splunk查詢輸入 | 官網所稱任意渠道不等於每個連接器都有公開文件 |
| 處理 | Fleak Eval、Filter、Assertion、Parser、SQL | 轉換、過濾、驗證、解析和查詢式處理 | 表達式與SQL有專用語法範圍 |
| 解析格式 | JSON、鍵值、CSV、Grok、Syslog、CEF、Windows多行 | 把原始文本變成結構化記錄 | 樣本應覆蓋異常和多行邊界 |
| 輸出 | Kafka、Delta Lake、Databricks、Elasticsearch | 消息、湖倉和搜尋索引 | 不同文件更新速度可能不同 |
| 錯誤處理 | S3死信隊列 | 保存攝取、解析、斷言和轉換失敗事件 | Python SDK文件明確支援 |
| 行業Schema | OCSF、UDM、CSF等安全Schema | 安全日誌標準化 | 映射準確性需與目標工具驗證 |
創建託管資料管道
- 預約演示並準備輸入類型、樣本事件、峰值吞吐、延遲、目標Schema和目的地。
- 在Workflow Builder中建立DAG,設定輸入連接器以及最低必要的讀取權限。
- 添加Parser、Filter、Assertion、Eval或SQL節點,逐步預覽每一階段的輸出。
- 設定 Kafka、Delta Lake、Databricks、Elasticsearch 或合約支援的目標地點。
- 使用測試數據驗證正常、缺字段、類型變化、重複、超大記錄和目標中斷等情況。
- 部署到託管集群,配置監控與告警,再透過受控流量逐步擴大。
處理Schema漂移
- 為關鍵渠道建立預期Schema、必填字段、類型、枚舉和樣本基線。
- 開啟漂移檢測和告警,區分新增字段、刪除字段、類型變化及嵌套結構變化。
- 查看AI生成的新配置和字段映射,檢查是否會遺失、錯誤轉換或擴大數據訪問。
- 在隔離數據上回放新舊事件,比較成功率、輸出Schema和下游相容性。
- 透過變更審批後重新部署,並保留舊配置、回滾方式及審計記錄。
ZephFlow Python入門
- 請準備Python 3.8或更高版本,以及Java 17或更高版本,因為Python SDK需要依賴Java處理引擎。
- 安裝zephflow套件,在本地建立最小流並以記憶體事件驗證環境。
- 使用JSONPath過濾記錄,再用Eval表達式建立欄位或修改結構。
- 增加Assertion並開啟逐步驟錯誤結果,確保壞數據不會靜默進入下游。
- 需要持續通道時配置檔案或Kafka Source,並為生產錯誤配置S3死信隊列。
- 將測試通過的DAG儲存為YAML,於持續整合中運行樣本及回歸測試。
生產驗證流程
- 收集代表正常、異常、重複、亂序、延遲和未來Schema的事件樣本。
- 為每個處理節點定義輸入、輸出、錯誤及性能驗收條件。
- 並行運行舊管道與Fleak,對比記錄數量、字段、延遲和目的地結果。
- 模擬渠道斷開、憑證過期、目標限流、網路抖動和大批錯誤事件。
- 驗證審計、訪問控制、告警、死信重放和回滾,再決定是否切換生產流量。
適合哪些用戶
- 資料工程團隊:快速接入新渠道並減少維護Schema與轉換規則的重複工作。
- AI平台團隊:在RAG、智能體和模型調用前清洗、去重和規範化輸入。
- 安全運營團隊:將異構日誌映射到統一的安全Schema,並過濾進入SIEM的雜訊。
- 工業與物聯網團隊:統一感測器與OT遙測,減少重複讀數與標籤差異。
- 金融科技團隊:標準化交易事件,為欺詐、風險及合規系統提供一致數據。
- Java與Python開發者:使用Apache 2.0的ZephFlow在自有應用中運行無狀態處理。
典型使用場景
- 安全日誌規範化:將不同廠商的事件轉換為OCSF、UDM或CSF後送入檢測系統。
- AI輸入治理:刪除重複和低價值事件,統一字段後再交給模型或智能體。
- 湖倉擷取:從Kafka或Splunk處理數據並寫入Delta Lake或Databricks。
- 即時搜尋索引:批量轉換事件並寫入Elasticsearch以供調查和檢索。
- 工業遙測清潔:統一設備標籤、單位及Schema,過濾雜訊讀數。
- 欺詐數據準備:標準化多渠道交易,補充規則並保留完整處理審計。
- 嵌入式資料處理:將ZephFlow作為Java函式庫嵌入現有服務,不使用託管平台。
產品優勢
- 將連接、解析、轉換、治理和交付置於一條即時管道中,減少中間系統。
- 自然語言生成配置降低搭建門檻,同時保留DAG節點供工程人員檢查。
- Schema漂移檢測和配置生成可縮短上游變更後的修復時間。
- 託管集群處理平行、併發和擴展,適合不想自行管理流處理基礎設施的團隊。
- 價值感知路由在數據進入儲存和模型前過濾,可控制儲存與Token消耗。
- ZephFlow Java核心與Python SDK採用Apache 2.0,便於本地驗證和二次開發。
- 斷言、錯誤追蹤和S3死信隊列為壞數據提供明確的隔離路徑。
使用限制與注意事項
- 官網沒有公開固定套餐、免費額度或具體單價,採購需預約演示和企業報價。
- 連接任意渠道屬於廣泛產品表述,公開工作流文件只明確列出部分渠道和輸出節點。
- 自愈並非可以完全無人監管,Schema映射錯誤會把問題快速傳播到所有下游。
- 官網的效能與成本節省數字屬於廠商指標,必須以自身的事件、吞吐量及下游費用來驗證。
- 零儲存並不等於零資料處理或零日誌,審計、錯誤、監控及支援資料的保存規則需透過合約確認。
- 託管平台與開源ZephFlow不是同一交付物,開源引擎不包含商業控制台、AI編排和託管服務。
- Python SDK需要Java 17引擎,部署、容器和本地環境都必須同時滿足兩種運行時要求。
- S3死信隊列僅在資料通道驅動的流程中運作,記憶體process透過回傳結果來處理每個步驟的錯誤。
- 細粒度資料權限和審計需要正確配置,錯誤授權仍可能把敏感記錄送往不適合的目標。
- 官網的隱私權政策、條款及EULA頁面雖可訪問,但公開取得的資訊有限,企業應在簽約前取得完整文本。
價格與採購方式
截至2026年8月22日,Fleak的官網上並未公佈可驗證的公開價格表、免費方案、試用期限或按量計算的單價,主要的參與方式是預約30分鐘的演示。任何過去的第三方報價都不得作為當前的採購依據。
| 產品或成本項 | 公開價格 | 可能計量方式 | 採購前確認 |
|---|---|---|---|
| Fleak託管平台 | 訂製報價 | 管道、吞吐、計算或企業合約 | 最低承諾、環境數、支援和服務級別 |
| 渠道與連接器 | 未公開 | 連接器或數據量 | 標準連接器與訂製接入費用 |
| 流式計算 | 未公開 | CPU、事件量或運行時間 | 峰值、擴容和超額計費 |
| 儲存與死信數據 | 未公開 | 保存量與期限 | 對象儲存、日誌與回放成本 |
| 企業治理 | 未公開 | 用戶、角色、審計和環境 | 單點登入、審計導出和數據駐留 |
| ZephFlow開源引擎 | 源碼免費 | 自有基礎設施成本 | 運維、支援、雲資源與下游服務 |
官方公開的社交資訊曾提到,是按照管道畫布或流式CPU的用量來每日計費,但官網上並未列出目前的數字或完整的規則。簽約時應以正式的報價、訂單及結算方式為準。
支援平台與部署
| 平台或方式 | 支援狀態 | 用途 | 要求 |
|---|---|---|---|
| 網頁DAG Builder | 支持 | 設計、部署和監控託管工作流 | 企業帳戶 |
| 託管計算集群 | 支持 | 分散式異步流處理 | 按合約分配資源 |
| Java SDK | 支持 | 嵌入應用或獨立運行ZephFlow | Java 17 |
| Python SDK | 支持 | 用Python構建和運行ZephFlow | Python 3.8以上與Java 17以上 |
| 獨立進程 | 支持 | 在自有環境運行無狀態管道 | 自行監控和運維 |
| 網路服務 | 支持 | 透過服務介面運行處理流程 | 自行保護端點和容量 |
| 容器或雲環境 | 可部署 | 運行開源引擎和依賴 | 用戶維護鏡像、金鑰和升級 |
API、SDK與開源情況
ZephFlow Core是一個基於Java 17的無狀態資料處理框架,可作為函式庫、獨立進程或網路服務來運行。目前其README中標示的版本為0.4.1。它支援組合節點、斷言、錯誤處理,以及靈活的部署方式。
ZephFlow Python SDK可從Python套件倉庫安裝,支援流式API、JSONPath過濾、Eval轉換、Flow合併、斷言以及S3死信隊列。Java核心與Python SDK皆採用Apache 2.0許可證。
| 項目 | 語言或介面 | 許可證 | 與商業平台關係 |
|---|---|---|---|
| ZephFlow Core | Java 17 | Apache 2.0 | Fleak底層無狀態處理能力,可獨立運行 |
| ZephFlow SDK模組 | Java依賴 | Apache 2.0 | 可透過Gradle或Maven接入 |
| ZephFlow Python SDK | Python 3.8以上與Java引擎 | Apache 2.0 | Python封裝與本地管道API |
| ZephFlow Examples | Java範例 | Apache 2.0 | 演示開源引擎用法 |
| Fleak託管平台 | 網頁DAG、AI與託管集群 | 閉源商業服務 | 不因核心引擎開源而整體開源 |
隱私、安全與治理
Fleak處理的資料可能包括安全日誌、交易記錄、工業遙測數據以及AI輸入的資料,這些資料中可能包含帳號、設備、網路、員工或客戶的相關資訊。企業需要明確資料是否會被儲存於硬碟上、元資料的保存期限、誰有權存取這些資料、是否有分包處理商、資料儲存的地區,以及資料刪除的流程。
官網標示為SOC 2 Type II,具備細粒度訪問控制、完整的轉換日誌及審計追蹤功能,但目錄頁面無法取代審計報告。採購方應核實報告的週期、產品範圍、控制例外情況,以及開源與託管部署之間的責任邊界。
- 以最小權限帳戶連接通道與目標,分別管理讀取、寫入和管理權限。
- 在測試環境使用脫敏樣本,不要把生產安全日誌直接交給未審核的AI配置。
- 對每個分支建立數據分類和允許目的地,阻止敏感字段進入不相關系統。
- 記錄配置生成、人工審批、部署、回滾和權限變更,形成可審計鏈路。
- 確認監控日誌、死信隊列和支持包中是否包含完整原始事件。
- 為死信數據設定加密、訪問控制、保存期限和重放後的刪除流程。
- 定期輪換Kafka、Splunk、雲端儲存和資料庫的憑證,並監控異常讀取。
- 將零儲存、資料駐留及刪除承諾寫入合約與資料處理協議。
基本資訊
| 項目 | 內容 |
|---|---|
| 工具名稱 | Fleak |
| 開發公司 | Fleak Tech Inc. |
| 工具類型 | AI原生資料層、即時資料管道與流處理 |
| 核心介面 | DAG Workflow Builder |
| 開源引擎 | ZephFlow |
| 主要用戶 | 數據工程、AI平台、安全、工業物聯網和金融團隊 |
| 價格模式 | 企業訂製報價;ZephFlow源碼免費 |
| 是否需要註冊 | 託管平台需要企業帳戶 |
| 中文支援 | 未發現明確中文界面 |
| 託管部署 | 支持 |
| Java SDK | 提供,Java 17 |
| Python SDK | 提供,Python 3.8以上並依賴Java 17 |
| 產品是否開源 | 託管平台不開源;ZephFlow組件開源 |
| 開源許可證 | Apache 2.0 |
| 價格核驗日期 | 2026年8月22日 |
推薦指數
推薦指數:4.0 / 5。Fleek將即時解析、去重、標準化、治理、Schema漂移處理以及多目的地傳輸等功能整合在一起,對於安全日誌、工業遙測以及AI輸入流程而言具有很大的價值。
主要不足是商業價格不透明、公開連接器目錄與官網的說明存在差異,隱私及合約細節也需由銷售方提供。ZephFlow的開源特性降低了技術驗證的門檻,但企業平台仍需要完整的POC。
常見問題
Fleak是做什麼的?
它位於資料來源與AI、湖倉、SIEM或搜尋系統之間,能夠即時解析、清洗、去重、標準化、治理並路由事件。
Fleak免費嗎?
託管平台並未公開免費套餐或試用額度,需要預約演示並獲取定製報價。ZephFlow核心及Python SDK可依Apache 2.0授權免費使用。
Fleak多少錢?
官網並未公佈固定數字。公開資訊顯示,計費方式可能與管道畫布或流式CPU的每日使用量有關,但具體單價、最低承諾量以及超額規則仍需以報價為準。
Fleak真的會自動修復管道嗎?
平台可以自動檢測Schema的變化並產生新的配置,但官網也說明使用者需要批准並重新部署。關鍵的管道不應該跳過測試、審批和回滾步驟。
支持哪些渠道?
公開的工作流程文件中明確列出了Kafka與Splunk,官網還展示了安全、工業、介面以及資料庫等各種應用領域。那些未在文件中列出的連接器,則需要透過示範和測試來確認其功能。
支持哪些輸出?
文件明確包含 Kafka、Delta Lake、Databricks 和 Elasticsearch 等輸出方式。至於具體的版本、認證、批次處理、重試機制以及事務相關規則,則需根據目標連接器來確定。
可以處理安全日誌嗎?
可以,平台主打將不同安全日誌標準化為OCSF、UDM或CSF,並在進入SIEM或AI檢測工具前過濾和去重。
Fleak是否保存原始數據?
官網支援即時、零儲存式的資料傳輸,但這並不代表所有的監控、審計、錯誤及支援相關的資料都不予保存。企業需透過合約來明確各類資料的保存與刪除方式。
ZephFlow是什麼?
ZephFlow是Fleak所公開的無狀態資料處理引擎,可嵌入Java應用、獨立運行或作為服務部署,支援過濾、轉換、斷言及錯誤處理。
有Python SDK嗎?
有,Python SDK支援流式組合、JSONPath過濾、Eval轉換、合併、斷言以及S3死信隊列。運行時還需要Java 17。
Fleak是開源的嗎?
不能籠統標為開源。ZephFlow的Java核心、Python SDK以及部分範例採用Apache 2.0授權,但託管平台、AI編排與控制台則屬於商業性質的封閉式服務。
SOC 2 Type II涵蓋什麼?
官網標示SOC 2 Type II,但公開首頁並未說明報告的範圍與期間。企業應索取最新報告,並確認其是否涵蓋了託管平台、相關基礎設施以及所需的資料流。
適合替代現有流處理平台嗎?
有可能,但不能只看功能列表。應並行回放真實數據,比較語義、吞吐、延遲、錯誤恢復、連接器及總成本後再決定遷移範圍。
如何避免AI錯誤映射字段?
為關鍵字段設定斷言與目標 Schema,用歷史與異常樣本回放 AI 設定,並保留人工審批、差異檢查及一鍵回滾功能。
總結
Fleak著重解決AI系統前端中的資料品質與治理問題,透過即時DAG、AI配置、Schema漂移處理以及價值路由,讓進入模型、湖倉或安全工具的資料更加一致。
在正式採用之前,應先透過真實的環境來驗證連接器、延遲時間、錯誤狀況以及成本等問題,同時也應將零儲存、資料保留期限、審計功能、服務品質以及資料刪除的相關規定寫入合約中。而那些只需要進行本地無狀態處理的團隊,則可以先從 Apache 2.0 的 ZephFlow 開始使用。
桂公網安備45132202000164號