LangWatch是什么
LangWatch是一款面向大语言模型应用和AI代理的开源LLMOps平台,由Reasoning Engine B.V.运营。它把可观测、评测、代理模拟、提示管理、AI Gateway和治理能力连接起来,帮助团队从开发测试一直管理到生产运行。
平台使用OpenTelemetry接收和组织追踪数据,支持托管云、完整自托管、企业专属云及混合部署。开发者可以从模型调用、工具使用和用户会话中寻找问题,再把真实案例转为评测与场景测试。
主要能力概览
| 能力模块 | 解决的问题 | 典型产出 |
|---|---|---|
| Observability | 看清模型、工具和代理如何运行 | 追踪、Span、指标、成本和告警 |
| Evaluations | 衡量质量、安全与可靠性 | 实验分数、在线评测、Guardrails和回归结果 |
| Agent Simulations | 在上线前测试完整对话和行为 | 场景执行、模拟用户、失败原因和测试报告 |
| Prompt Management | 集中管理提示及版本 | 提示模板、变量、版本、Playground和优化结果 |
| AI Gateway | 统一模型调用、预算和路由 | 虚拟密钥、路由、缓存、限额和护栏 |
| AI Governance | 控制团队访问和生产风险 | 权限、审计、支出与组织治理 |
LLM与代理可观测性
LangWatch自动记录大语言模型调用、工具使用、检索、错误和用户交互,并在追踪中呈现完整执行链路。团队可以查看输入输出、Token、成本、延迟、模型、用户和自定义元数据。
- 按项目、用户、模型、提示或版本筛选追踪。
- 查看嵌套Span和代理多步骤执行顺序。
- 定位工具失败、慢调用和成本异常。
- 对生产质量和业务指标设置仪表盘。
- 通过用户事件连接反馈与具体追踪。
- 将分析数据导出到外部系统。
- 使用告警和自动化响应质量下降。
OpenTelemetry与集成
追踪层建立在OpenTelemetry之上,因此既能使用LangWatch SDK,也能接收其他兼容库产生的数据。直接集成覆盖常见代理框架、模型供应商和自动化平台。
| 集成类别 | 代表项目 | 用途 |
|---|---|---|
| 代理与应用框架 | LangChain、LangGraph、Mastra、CrewAI和Google ADK | 自动捕获模型、工具和代理Span |
| 模型提供商 | OpenAI、Anthropic、Azure、Google Cloud、AWS和Groq | 记录模型请求、响应、Token和成本 |
| 本地模型 | Ollama | 观察私有或本地推理流程 |
| 低代码平台 | LangFlow、Flowise和n8n | 为可视化流程增加追踪与评测 |
| 标准协议 | OTLP | 接入其他OpenTelemetry兼容服务 |
离线实验
Experiments用于在上线前对固定数据集运行模型、提示或代理版本,并记录每个样本的输出和评分。团队可以通过界面、Python或TypeScript执行实验,再比较多个配置的质量、成本和延迟。
- 创建代表真实任务的数据集。
- 选择当前生产版本作为基线。
- 定义需要比较的提示、模型或代理配置。
- 为输出配置内置或自定义评测器。
- 并行运行全部样本并记录追踪。
- 比较分数、错误、延迟和成本。
- 把失败样本加入回归数据集。
- 将最低质量要求接入持续集成门禁。
在线评测
Online Evaluation在生产追踪到达后自动运行指定评测器,用于持续观察真实性、相关性、安全、PII或自定义业务指标。它适合发现随着用户、模型和数据变化而出现的质量漂移。
| 评测方式 | 运行时机 | 适合用途 |
|---|---|---|
| 离线Experiment | 发布前针对固定数据集 | 比较提示、模型和代理版本 |
| Online Evaluation | 生产追踪到达后 | 监控质量趋势和异常样本 |
| Guardrail | 模型调用前后同步执行 | 实时阻断越狱、PII或违规内容 |
| 人工Annotation | 对选定追踪或数据点审核 | 专家标签、偏好和争议案例 |
Guardrails实时护栏
评测器可以在应用代码中作为Guardrail同步执行,并根据是否通过决定放行或阻断。它适合输入端越狱检测、输出端安全检查和关键业务规则验证,但会增加调用延迟和事件用量。
- 检测越狱和提示注入。
- 识别PII及敏感信息。
- 检查毒性、有害或违规内容。
- 验证RAG回答的忠实度和相关性。
- 执行LLM-as-a-judge或自定义代码评分。
- 在失败时返回安全提示或转人工处理。
评测器与工作流
LangWatch提供RAGAS、幻觉、毒性、PII和模型裁判等内置评测器,也允许团队创建可复用的组织级评测器。复杂评测可以通过工作流组合多个步骤和判断,并把自定义分数附加到追踪或Span。
数据集与标注
数据集可以通过SDK和API管理,也能从生产追踪抽取或由AI辅助生成。Annotation Inbox用于把样本分配给人工审核者,适合业务专家补充标签、目标答案和主观质量判断。
- 从真实追踪建立失败案例集。
- 保存文本和图像等评测输入。
- 通过代码批量创建与查询数据集。
- 让AI快速生成初始测试样本。
- 将人工标签与自动评测分开记录。
- 把审核结果用于后续回归测试。
Agent Simulations
Agent Simulations通过模拟用户与待测代理进行多轮互动,验证代理是否能在真实对话中完成目标、遵守规则并正确使用工具。它比单轮输入输出评测更适合测试状态、记忆、工具调用和长对话行为。
场景结构
| 组成 | 内容 | 作用 |
|---|---|---|
| Scenario | 初始条件、用户目标和约束 | 定义需要验证的真实业务任务 |
| Agent Adapter | 连接本地、远程或托管代理 | 把测试消息送到待测系统 |
| User Simulator | 按角色和目标生成多轮用户行为 | 覆盖不同表达、追问和阻力 |
| Criteria | 成功、失败和安全判断 | 决定场景是否通过 |
| Run Parameters | 并发、重试、模型和测试数量 | 控制成本与覆盖范围 |
支持的代理形态
- 文本聊天代理。
- 需要登录或令牌的远程代理。
- 本地开发中的代理函数。
- OpenAI Realtime等实时代理。
- ElevenLabs、Twilio和Pipecat等语音代理。
- Gemini Live等实时多模态代理。
红队与安全场景
场景测试可以用于生成对抗性用户、越权请求和提示注入流程,观察代理在多轮互动中的防御表现。红队结果应作为改进输入,不能理解为通过一次测试就永久安全。
Scenario开源库
独立Scenario仓库提供Python和TypeScript方向的代理测试工具,并使用Apache第二版许可证。它可以在本地和持续集成环境运行,不要求所有测试都通过LangWatch云端完成。
提示管理
Prompt Management集中保存提示模板、变量、版本和发布状态,避免提示散落在代码、表格和界面中。开发者可以通过SDK或CLI同步提示,并在Playground中替换模型和参数进行对比。
| 功能 | 作用 | 典型用户 |
|---|---|---|
| Prompt Registry | 集中保存命名提示和版本 | 开发与产品团队 |
| Variables | 在运行时填充业务数据 | 应用开发者 |
| Playground | 测试提示、模型和参数 | 提示工程与业务专家 |
| CLI Sync | 将提示配置纳入代码仓库 | 平台工程与持续集成 |
| Optimization Studio | 基于样本和目标改进提示 | 需要系统化优化的团队 |
| DSPy Optimization | 用程序化方法搜索更优提示 | 研究和高级评测团队 |
AI Gateway
AI Gateway可以统一接入多个模型提供商,并在组织边界内管理虚拟密钥、路由、预算、缓存和Guardrails。自托管时可选择让模型流量在自己的网络边界终止。
- 用虚拟密钥隔离应用和团队。
- 在多个模型或供应商之间路由。
- 为组织、项目或用户设置层级预算。
- 使用提示缓存减少重复推理。
- 在统一入口执行实时护栏。
- 集中记录成本、失败和模型用量。
MCP、CLI与Skills
LangWatch提供MCP、命令行工具和面向编程助手的Skills,使AI助手可以协助接入追踪、创建评测、运行模拟和管理提示。自动化修改仍应经过人工审查,尤其是生产密钥、护栏和部署设置。
云端价格
价格信息于2026年8月23日核验,实际金额、税费、汇率和优惠可能变化,最终以结算页面显示为准。
LangWatch Cloud按核心席位和事件用量计费,Growth另对超过30天保留的数据收取存储费。Lite用户可以查看和协作,但具体可编辑范围应以当前权限说明为准。
| 套餐或版本 | 价格 | 计费周期 | 核心权益或额度 | 适合用户 |
|---|---|---|---|---|
| Developer | 免费 | 永久免费,额度每月刷新 | 5万事件、14天数据访问、2名用户,3个场景、3次模拟和3个自定义评测 | 个人开发者和早期原型 |
| Growth | 每核心席位29欧元 | 每月 | 含20万事件和30天保留,无限Lite用户、模拟、评测与提示 | 把AI应用投入生产的团队 |
| Enterprise | 定制报价 | 合同约定 | 混合、自托管或本地部署,自定义保留、SSO、RBAC、审计、SLA和专属工程支持 | 受监管与大型组织 |
事件与存储计费
每次模型调用、工具调用、检索、评测或模拟步骤都会计为一个事件,因此一次用户对话通常包含多个计费事件。Growth每月前20万事件包含在席位费中,之后每10万事件收取5欧元。
| 计费项 | Growth包含量 | 超额价格 | 注意事项 |
|---|---|---|---|
| 核心席位 | 每席位独立计费 | 29欧元每席位每月 | 可增减席位,20人以上可询问量价优惠 |
| 事件 | 每月20万 | 每10万事件5欧元 | 模型、工具、检索、评测和模拟步骤均可能计费 |
| 数据访问 | 30天 | 延长部分每GB 3欧元 | 仅在保留超过包含周期时计费 |
| Lite用户 | 无限 | 包含 | 权限范围与核心席位不同 |
| 模型推理 | 不包含 | 由模型提供商收取 | 模拟和LLM评测可能产生较多模型调用 |
账单估算方法
- 统计每月最终用户交互数量。
- 测量一次典型交互包含多少模型、工具和检索事件。
- 加入在线评测和Guardrail产生的事件。
- 估算离线实验与代理模拟的额外运行量。
- 确定需要完整使用权限的核心席位数量。
- 计算超过30天仍需访问的数据GB。
- 另行加入模型、云存储和自托管基础设施费用。
- 为增长、回填和异常流量预留预算。
开源与许可证
LangWatch采用开放核心模式,主要平台代码使用Apache第二版许可证,Python、TypeScript SDK和MCP服务使用MIT许可证。SCIM、审计日志、许可证与计费管理等企业模块位于单独目录,生产使用需要商业许可证。
| 组件 | 许可证 | 可做什么 | 限制 |
|---|---|---|---|
| LangWatch核心平台 | Apache第二版 | 查看、修改和自托管主要功能 | 企业目录中的模块不在同一许可下 |
| Python SDK | MIT | 追踪、评测和数据访问 | 仍需连接云端或自托管服务 |
| TypeScript SDK | MIT | 在Node与Web项目中集成平台 | 不包含托管基础设施 |
| MCP Server | MIT | 让AI客户端操作LangWatch能力 | 需要合理配置权限和凭据 |
| Scenario | Apache第二版 | 本地运行代理场景测试 | 模型和目标代理费用自理 |
| Enterprise模块 | 商业许可证 | SSO、SCIM、审计和企业管理 | 生产使用需购买授权 |
自托管版本
不配置企业许可证时,自托管LangWatch仍允许无限成员、团队、项目和自建内容,并运行与云端相同的主软件。企业许可证在同一部署中解锁SSO、RBAC、SCIM、审计日志和支持,不需要更换独立产品版本。
部署模式对比
| 部署模式 | 应用由谁管理 | 数据存储位置 | 适合场景 |
|---|---|---|---|
| LangWatch Cloud | LangWatch | 托管云 | 快速开始和免运维 |
| Self-Managed | 客户 | 客户基础设施 | 完整数据主权和自主管理 |
| Cloud Enterprise | LangWatch | 客户指定区域的专属实例 | 需要隔离且不想自行运维 |
| Hybrid | LangWatch管理控制平面 | ClickHouse与对象存储位于客户网络 | 追踪数据不能离开企业网络 |
自托管基础设施
当前v3生产方案以Kubernetes Helm为主,使用ClickHouse作为核心分析存储,并通过对象存储分层保存冷数据。Docker Compose快速方案仍主要面向v2,准备部署v3时不应沿用旧教程。
- 使用ClickHouse保存和查询追踪及评测事件。
- 通过事件溯源保证追踪与评测处理顺序。
- 将旧数据分层到兼容对象存储。
- 使用原生ClickHouse备份与恢复机制。
- 通过Helm Overlay调整不同规模部署。
- 可选启用AI Gateway子Chart。
- 需要自行维护密钥、网络、备份、升级和监控。
安全与合规
LangWatch公开说明其符合GDPR,并已获得ISO 27001认证,企业客户可申请相关报告和数据处理协议。由于平台可能接触提示词、输出、工具参数和用户数据,团队仍需完成自己的数据分类与访问设计。
- 在埋点前移除不需要的个人数据和密钥。
- 限制谁能查看原始追踪与数据集。
- 为导出、MCP和API设置最小权限。
- 审查云端地区、子处理方和保留周期。
- 自托管环境启用传输与静态加密。
- 为审计、删除、备份和事件响应制定流程。
- 受监管业务应通过企业合同确认合规责任。
适合哪些用户
- 开发大语言模型应用和AI代理的工程团队。
- 负责模型质量、回归和安全测试的团队。
- 需要模拟用户测试多轮代理行为的产品团队。
- 希望让业务专家参与提示和人工标注的组织。
- 需要统一模型网关、预算和治理的平台团队。
- 希望开源自托管并控制追踪数据的企业。
- 使用n8n等低代码工具构建AI流程的开发者。
产品优势
- 可观测、评测、模拟与提示管理形成完整闭环。
- Agent Simulations适合验证多轮和工具型代理。
- 支持离线实验、在线监控和同步Guardrails。
- OpenTelemetry降低与单一SDK绑定。
- 云端价格同时提供免费入口和低价事件扩展。
- 自托管主要能力没有成员和项目上限。
- 开放核心的许可证边界说明较清晰。
限制与注意事项
- 一次用户交互可能产生多个计费事件。
- 模拟、在线评测和Guardrail会增加模型与事件成本。
- LLM评分器和模拟用户可能产生误判。
- 完整质量体系需要维护数据集、标准和人工审核。
- v3自托管以Kubernetes为主,运维复杂度高于单容器工具。
- 企业模块虽在同一仓库,但不适用Apache开源许可。
- 追踪内容可能包含敏感业务数据和模型提示。
- Developer版的场景、模拟和自定义评测数量有限。
实施流程
- 选择LangWatch Cloud或规划自托管环境。
- 创建项目并接入OpenTelemetry或官方SDK。
- 用测试请求验证Span、成本和用户元数据。
- 建立核心质量指标与失败分类。
- 从真实追踪创建首批评测数据集。
- 为提示与模型变更设置离线实验。
- 用场景模拟测试多轮代理和工具行为。
- 为高风险输入输出增加Guardrails。
- 配置生产在线评测、告警和预算。
- 按事件、席位、存储和模型费复盘实际成本。
常见问题
LangWatch免费吗?
Developer云套餐永久免费,每月包含5万事件、14天数据访问、2名用户以及有限数量的场景、模拟和自定义评测。自托管开源版也不限制成员、团队和项目,但基础设施成本由用户承担。
什么是一个计费事件?
模型调用、工具调用、检索、评测和模拟步骤都可能形成事件。一个完整用户会话通常包含多个事件,因此应根据实际追踪测量而不是直接按会话数估算。
LangWatch是开源的吗?
主要平台使用Apache第二版许可证,SDK和MCP使用MIT许可证。企业模块采用单独商业许可证,因此更准确的表述是开放核心平台。
可以自托管吗?
可以,v3建议使用Kubernetes和官方Helm Chart。无许可证也能使用主要平台能力,SSO、SCIM、RBAC、审计和企业支持需要商业授权。
Agent Simulation与普通评测有什么区别?
普通评测通常检查固定输入输出,Agent Simulation会让模拟用户与代理进行多轮互动。后者更适合测试状态、工具、语音、拒答和完成业务目标的完整过程。
能实时阻断有害内容吗?
可以把评测器作为Guardrail在模型调用前后同步执行,并根据结果阻断或回退。上线前应测试延迟、误报、降级逻辑和异常处理。
总结
LangWatch不仅记录LLM追踪,还把离线实验、在线评测、实时护栏、代理场景模拟和提示管理组合成一套AI工程流程。它特别适合需要系统验证多轮代理,而不是只观察单次模型回答的团队。
云端Growth按每核心席位29欧元起,并按超额事件和延长存储计费;开源自托管版提供更强数据控制,但v3生产部署需要Kubernetes运维能力。正式采用前应以真实流量测算事件倍率、模型费用和保留需求。
桂公网安备45132202000164号