一句话介绍
Fleak是一款面向企业AI、机器数据和流式分析的实时数据基础设施,可在数据源与AI应用之间完成解析、标准化、过滤、去重、治理和按价值路由。
工具简介
Fleak由Fleak Tech Inc.开发,当前定位是AI原生数据层,而不是通用聊天机器人。用户通过可视化DAG或自然语言建立数据流程,再部署到托管计算集群进行分布式异步处理。
平台主要解决数据格式不一致、上游Schema变化、重复事件、无价值数据占用存储与Token,以及不同下游系统权限不一致的问题。ZephFlow则是其可独立使用的开源无状态处理引擎。
产品组成
| 组成 | 主要作用 | 运行方式 | 开放状态 |
|---|---|---|---|
| Fleak托管平台 | 连接、编排、部署、监控与治理数据管道 | 托管计算集群 | 商业服务,预约演示 |
| Workflow Builder | 用DAG配置渠道、处理节点和输出 | 网页界面 | 文档公开,账户能力按方案 |
| AI Copilot | 从自然语言生成管道配置并辅助Schema变化 | 平台内使用 | 商业功能 |
| ZephFlow Core | 无状态流式数据处理 | 嵌入应用、独立进程或网络服务 | Apache 2.0开源 |
| ZephFlow Python SDK | 用Python组合过滤、转换和错误处理 | Python调用Java 17引擎 | Apache 2.0开源 |
工作原理
- 从Kafka、Splunk、机器日志、数据库、工业系统或其他渠道接入原始事件。
- 通过AI或规则识别事件类型、字段含义、Schema和下游应用需求。
- 使用解析、过滤、断言、表达式或SQL节点清洗、验证、标准化和分支。
- 按照实时价值、合规价值和目标Schema把记录路由到不同目的地。
- 部署到托管计算集群后持续处理,并在监控面板观察吞吐、错误和管道健康。
- 检测上游Schema漂移时生成新配置,由团队审核后重新部署。
主要功能
AI价值感知路由
Fleak评估每条输入数据对下游AI或业务应用的价值,再决定实时传递、长期保存或丢弃。这样可以在进入数据湖、SIEM或模型前减少无用、重复和低价值事件。
自然语言编排
用户可用自然语言描述目标,由Copilot生成数据处理配置。生成结果仍需用真实事件样本验证字段、边界条件和错误处理,不能直接把描述当作生产规则。
自愈Schema漂移
平台可以检测上游Schema变化、发出提醒并生成新的配置。官网有页面称自动重新部署,也有说明要求用户批准后部署,生产环境应按“自动检测与生成、人工审核后发布”配置。
可视化DAG工作流
Workflow Builder把渠道、处理和输出节点连接成有向无环图,每个上游节点的输出成为下游输入。发布前平台校验DAG,之后由托管集群处理并行化、并发和负载。
多格式解析
Parser节点可处理JSON、键值对、CSV、Grok、Syslog、CEF和Windows多行等结构化或半结构化文本。解析后的字段可以继续用于过滤、断言、SQL和Schema映射。
过滤、断言与表达式
Filter用于排除不需要的记录,Assertion用于验证必需字段和数据质量,Fleak Eval负责创建或修改字段。失败记录可以进入错误跟踪或死信队列。
SQL数据转换
FleakSQL允许熟悉SQL的团队转换记录,减少学习专用表达式的成本。支持范围并非完整数据库方言,迁移复杂查询前需要查看语法文档并做兼容测试。
去重与标准化
平台在数据进入存储或模型前进行过滤、去重和统一Schema,可降低存储、查询和模型上下文中的重复内容。官网给出的成本降低属于宣传指标,实际效果取决于数据质量和规则。
细粒度治理与审计
Fleak在数据层执行访问控制,并记录转换与交付过程,官网标示完整审计轨迹和SOC 2 Type II。企业应在采购时索取最新报告、范围、例外和数据处理协议。
分布式异步执行
托管工作流部署后在Fleak计算集群运行,平台自动处理并行化、并发和资源伸缩。团队无需自行编写多线程与负载均衡逻辑,但仍要设定容量、延迟和故障目标。
可观察性
监控面板用于查看管道健康、吞吐和错误,便于发现渠道中断、解析失败或目的地问题。生产采用前应确认指标保存期、告警渠道、日志字段和服务级别。
零存储式实时传递
官网强调数据可以实时转换并直接发送到目标系统,不必在Fleak中长期落盘。零存储是管道设计能力,不代表日志、审计、错误或运营元数据完全不被保留。
公开节点与数据格式
| 类别 | 已明确公开的节点或格式 | 主要用途 | 核验提醒 |
|---|---|---|---|
| 渠道 | Kafka Source、Splunk Source | 流式主题和Splunk查询输入 | 官网所称任意渠道不等于每个连接器都有公开文档 |
| 处理 | Fleak Eval、Filter、Assertion、Parser、SQL | 转换、过滤、验证、解析和查询式处理 | 表达式与SQL有专用语法范围 |
| 解析格式 | JSON、键值、CSV、Grok、Syslog、CEF、Windows多行 | 把原始文本变成结构化记录 | 样本应覆盖异常和多行边界 |
| 输出 | Kafka、Delta Lake、Databricks、Elasticsearch | 消息、湖仓和搜索索引 | 不同文档更新速度可能不同 |
| 错误处理 | S3死信队列 | 保存摄取、解析、断言和转换失败事件 | Python SDK文档明确支持 |
| 行业Schema | OCSF、UDM、CSF等安全Schema | 安全日志标准化 | 映射准确性需与目标工具验证 |
创建托管数据管道
- 预约演示并准备输入类型、样例事件、峰值吞吐、延迟、目标Schema和目的地。
- 在Workflow Builder创建DAG,配置输入连接器及最小必要读取权限。
- 添加Parser、Filter、Assertion、Eval或SQL节点,逐步预览每一阶段的输出。
- 设置Kafka、Delta Lake、Databricks、Elasticsearch或合同支持的目的地。
- 使用测试数据验证正常、缺字段、类型变化、重复、超大记录和目标中断等情况。
- 部署到托管集群,配置监控与告警,再通过受控流量逐步扩大。
处理Schema漂移
- 为关键渠道建立预期Schema、必填字段、类型、枚举和样本基线。
- 开启漂移检测和告警,区分新增字段、删除字段、类型变化和嵌套结构变化。
- 查看AI生成的新配置和字段映射,检查是否会丢失、错误转换或扩大数据访问。
- 在隔离数据上回放新旧事件,比较成功率、输出Schema和下游兼容性。
- 通过变更审批后重新部署,并保留旧配置、回滚方式和审计记录。
ZephFlow Python入门
- 准备Python 3.8或更高版本以及Java 17或更高版本,因为Python SDK依赖Java处理引擎。
- 安装zephflow包,在本地创建最小流并用内存事件验证环境。
- 使用JSONPath过滤记录,再用Eval表达式创建字段或修改结构。
- 增加Assertion并开启逐步骤错误结果,确保坏数据不会静默进入下游。
- 需要持续渠道时配置文件或Kafka Source,并为生产错误配置S3死信队列。
- 把测试通过的DAG保存为YAML,在持续集成中运行样本和回归测试。
生产验证流程
- 收集代表正常、异常、重复、乱序、延迟和未来Schema的事件样本。
- 为每个处理节点定义输入、输出、错误和性能验收条件。
- 并行运行旧管道与Fleak,对比记录数量、字段、延迟和目的地结果。
- 模拟渠道断开、凭据过期、目标限流、网络抖动和大批错误事件。
- 验证审计、访问控制、告警、死信重放和回滚,再决定是否切换生产流量。
适合哪些用户
- 数据工程团队:快速接入新渠道并减少维护Schema与转换规则的重复工作。
- AI平台团队:在RAG、智能体和模型调用前清洗、去重和规范化输入。
- 安全运营团队:把异构日志映射到统一安全Schema,并过滤进入SIEM的噪声。
- 工业与物联网团队:统一传感器和OT遥测,减少重复读数与标签差异。
- 金融科技团队:标准化交易事件,为欺诈、风险和合规系统提供一致数据。
- Java与Python开发者:用Apache 2.0的ZephFlow在自有应用中运行无状态处理。
典型使用场景
- 安全日志规范化:把不同厂商事件转换为OCSF、UDM或CSF后送入检测系统。
- AI输入治理:删除重复和低价值事件,统一字段后再交给模型或智能体。
- 湖仓摄取:从Kafka或Splunk处理数据并写入Delta Lake或Databricks。
- 实时搜索索引:批量转换事件并写入Elasticsearch供调查和检索。
- 工业遥测清洗:统一设备标签、单位和Schema,过滤噪声读数。
- 欺诈数据准备:标准化多渠道交易,补充规则并保留完整处理审计。
- 嵌入式数据处理:把ZephFlow作为Java库嵌入现有服务,不使用托管平台。
产品优势
- 把连接、解析、转换、治理和交付放在一条实时管道中,减少中间系统。
- 自然语言生成配置降低搭建门槛,同时保留DAG节点供工程人员检查。
- Schema漂移检测和配置生成可缩短上游变更后的修复时间。
- 托管集群处理并行、并发和伸缩,适合不想自管流处理基础设施的团队。
- 价值感知路由在数据进入存储和模型前过滤,可控制存储与Token消耗。
- ZephFlow Java核心与Python SDK采用Apache 2.0,便于本地验证和二次开发。
- 断言、错误跟踪和S3死信队列为坏数据提供明确隔离路径。
使用限制与注意事项
- 官网没有公开固定套餐、免费额度或具体单价,采购需预约演示和企业报价。
- 连接任意渠道属于广泛产品表述,公开工作流文档只明确列出部分渠道和输出节点。
- 自愈并非可以完全无人监管,Schema映射错误会把问题快速传播到所有下游。
- 官网性能和成本节省数字属于厂商指标,必须用自己的事件、吞吐和下游费用验证。
- 零存储不等于零数据处理或零日志,审计、错误、监控和支持数据的保存规则需通过合同确认。
- 托管平台与开源ZephFlow不是同一交付物,开源引擎不包含商业控制台、AI编排和托管服务。
- Python SDK需要Java 17引擎,部署、容器和本地环境都要同时满足两种运行时要求。
- S3死信队列只在数据渠道驱动的流程中工作,内存process调用通过返回结果处理逐步骤错误。
- 细粒度数据权限和审计需要正确配置,错误授权仍可能把敏感记录送往不合适的目标。
- 官网隐私、条款和EULA页面可访问但公开提取信息有限,企业应在签约前索取完整文本。
价格与采购方式
截至2026年8月22日,Fleak官网没有展示可验证的公开价格表、免费计划、试用期限或按量单价,主要入口是预约30分钟演示。任何历史第三方价格都不应作为当前采购依据。
| 产品或成本项 | 公开价格 | 可能计量方式 | 采购前确认 |
|---|---|---|---|
| Fleak托管平台 | 定制报价 | 管道、吞吐、计算或企业合同 | 最低承诺、环境数、支持和服务级别 |
| 渠道与连接器 | 未公开 | 连接器或数据量 | 标准连接器与定制接入费用 |
| 流式计算 | 未公开 | CPU、事件量或运行时间 | 峰值、扩容和超额计费 |
| 存储与死信数据 | 未公开 | 保存量和期限 | 对象存储、日志与回放成本 |
| 企业治理 | 未公开 | 用户、角色、审计和环境 | 单点登录、审计导出和数据驻留 |
| ZephFlow开源引擎 | 源码免费 | 自有基础设施成本 | 运维、支持、云资源和下游服务 |
官方公开社交信息曾提到按管道画布或流式CPU每日计费,但官网没有列出当前数字或完整规则。签约时应以正式报价、订单和结算口径为准。
支持平台与部署
| 平台或方式 | 支持状态 | 用途 | 要求 |
|---|---|---|---|
| 网页DAG Builder | 支持 | 设计、部署和监控托管工作流 | 企业账户 |
| 托管计算集群 | 支持 | 分布式异步流处理 | 按合同分配资源 |
| Java SDK | 支持 | 嵌入应用或独立运行ZephFlow | Java 17 |
| Python SDK | 支持 | 用Python构建和运行ZephFlow | Python 3.8以上与Java 17以上 |
| 独立进程 | 支持 | 在自有环境运行无状态管道 | 自行监控和运维 |
| 网络服务 | 支持 | 通过服务接口运行处理流程 | 自行保护端点和容量 |
| 容器或云环境 | 可部署 | 运行开源引擎和依赖 | 用户维护镜像、密钥和升级 |
API、SDK与开源情况
ZephFlow Core是Java 17无状态数据处理框架,可作为库、独立进程或网络服务运行,当前README标示版本0.4.1。它支持组合节点、断言、错误处理和灵活部署。
ZephFlow Python SDK可从Python包仓库安装,支持流式API、JSONPath过滤、Eval转换、Flow合并、断言和S3死信队列。Java核心与Python SDK均采用Apache 2.0许可证。
| 项目 | 语言或接口 | 许可证 | 与商业平台关系 |
|---|---|---|---|
| ZephFlow Core | Java 17 | Apache 2.0 | Fleak底层无状态处理能力,可独立运行 |
| ZephFlow SDK模块 | Java依赖 | Apache 2.0 | 可通过Gradle或Maven接入 |
| ZephFlow Python SDK | Python 3.8以上与Java引擎 | Apache 2.0 | Python封装与本地管道API |
| ZephFlow Examples | Java示例 | Apache 2.0 | 演示开源引擎用法 |
| Fleak托管平台 | 网页DAG、AI与托管集群 | 闭源商业服务 | 不因核心引擎开源而整体开源 |
隐私、安全与治理
Fleak处理的可能是安全日志、交易、工业遥测和AI输入,其中包含账号、设备、网络、员工或客户信息。企业需要明确数据是否落盘、元数据保存期、支持访问、子处理商、地区和删除流程。
官网标示SOC 2 Type II、细粒度访问控制、完整转换日志和审计轨迹,但目录页无法替代审计报告。采购方应核验报告周期、产品范围、控制例外以及开源与托管部署的责任边界。
- 用最小权限账户连接渠道和目标,分别管理读取、写入和管理权限。
- 在测试环境使用脱敏样本,不要把生产安全日志直接交给未审核的AI配置。
- 对每个分支建立数据分类和允许目的地,阻止敏感字段进入不相干系统。
- 记录配置生成、人工审批、部署、回滚和权限变更,形成可审计链路。
- 确认监控日志、死信队列和支持包中是否包含完整原始事件。
- 为死信数据设置加密、访问控制、保存期限和重放后的删除流程。
- 定期轮换Kafka、Splunk、云存储和数据库凭据,并监控异常读取。
- 将零存储、数据驻留和删除承诺写入合同与数据处理协议。
基本信息
| 项目 | 内容 |
|---|---|
| 工具名称 | Fleak |
| 开发公司 | Fleak Tech Inc. |
| 工具类型 | AI原生数据层、实时数据管道与流处理 |
| 核心界面 | DAG Workflow Builder |
| 开源引擎 | ZephFlow |
| 主要用户 | 数据工程、AI平台、安全、工业物联网和金融团队 |
| 价格模式 | 企业定制报价;ZephFlow源码免费 |
| 是否需要注册 | 托管平台需要企业账户 |
| 中文支持 | 未发现明确中文界面 |
| 托管部署 | 支持 |
| Java SDK | 提供,Java 17 |
| Python SDK | 提供,Python 3.8以上并依赖Java 17 |
| 产品是否开源 | 托管平台不开源;ZephFlow组件开源 |
| 开源许可证 | Apache 2.0 |
| 价格核验日期 | 2026年8月22日 |
推荐指数
推荐指数:4.0 / 5。Fleak把实时解析、去重、标准化、治理、Schema漂移处理和多目的地交付组合在一起,对安全日志、工业遥测和AI输入管道具有明确价值。
主要不足是商业价格不透明、公开连接器目录与官网广泛表述存在差距,隐私和合同细节也需销售提供。ZephFlow开源降低了技术验证门槛,但企业平台仍需完整POC。
常见问题
Fleak是做什么的?
它位于数据源和AI、湖仓、SIEM或搜索系统之间,实时解析、清洗、去重、标准化、治理并路由事件。
Fleak免费吗?
托管平台没有公开免费套餐或试用额度,需要预约演示并获取定制报价。ZephFlow核心和Python SDK可以按Apache 2.0免费使用。
Fleak多少钱?
官网没有公布固定数字。公开信息显示计费可能与管道画布或流式CPU每日用量有关,但具体单价、最低承诺和超额规则必须以报价为准。
Fleak真的会自动修复管道吗?
平台可以自动检测Schema变化并生成新配置,但官网也说明用户需要批准和重新部署。关键管道不应跳过测试、审批和回滚。
支持哪些渠道?
公开工作流文档明确列出Kafka与Splunk,官网还展示安全、工业、接口和数据库等广泛渠道。未在文档列出的连接器应通过演示和测试确认。
支持哪些输出?
文档明确包括Kafka、Delta Lake、Databricks和Elasticsearch等输出。具体版本、认证、批量、重试和事务语义需要按目标连接器验证。
可以处理安全日志吗?
可以,平台主打把不同安全日志标准化为OCSF、UDM或CSF,并在进入SIEM或AI检测工具前过滤和去重。
Fleak是否保存原始数据?
官网支持实时、零存储式传递,但这不证明所有监控、审计、错误和支持数据都不保存。企业需要通过合同确认每类数据的保存与删除。
ZephFlow是什么?
ZephFlow是Fleak公开的无状态数据处理引擎,可嵌入Java应用、独立运行或作为服务部署,支持过滤、转换、断言和错误处理。
有Python SDK吗?
有,Python SDK支持流式组合、JSONPath过滤、Eval转换、合并、断言和S3死信队列。运行时还需要Java 17。
Fleak开源吗?
不能笼统标为开源。ZephFlow Java核心、Python SDK和部分示例采用Apache 2.0,但托管平台、AI编排和控制台是商业闭源服务。
SOC 2 Type II覆盖什么?
官网标示SOC 2 Type II,但公开首页没有给出报告范围和期间。企业应索取最新报告并确认是否覆盖托管平台、相关基础设施和所需数据流。
适合替代现有流处理平台吗?
有可能,但不能只看功能列表。应并行回放真实数据,比较语义、吞吐、延迟、错误恢复、连接器和总成本后再决定迁移范围。
如何避免AI错误映射字段?
为关键字段设置断言和目标Schema,用历史与异常样本回放AI配置,并保留人工审批、差异检查和一键回滚。
总结
Fleak面向的是AI系统前方的数据质量和治理问题,通过实时DAG、AI配置、Schema漂移处理和价值路由,让进入模型、湖仓或安全工具的数据更一致。
正式采用前应以真实渠道验证连接器、延迟、错误和成本,并把零存储、数据驻留、审计、服务级别和删除写进合同。只需要本地无状态处理的团队则可以先从Apache 2.0的ZephFlow开始。
桂公网安备45132202000164号