LangWatch
免费增值
AI工具大全 AI模型评测

LangWatch

LangWatch,专注于AI 模型评测的智能工具

标签:

LangWatch是什么

LangWatch是一款面向大语言模型应用和AI代理的开源LLMOps平台,由Reasoning Engine B.V.运营。它把可观测、评测、代理模拟、提示管理、AI Gateway和治理能力连接起来,帮助团队从开发测试一直管理到生产运行。

平台使用OpenTelemetry接收和组织追踪数据,支持托管云、完整自托管、企业专属云及混合部署。开发者可以从模型调用、工具使用和用户会话中寻找问题,再把真实案例转为评测与场景测试。

主要能力概览

能力模块解决的问题典型产出
Observability看清模型、工具和代理如何运行追踪、Span、指标、成本和告警
Evaluations衡量质量、安全与可靠性实验分数、在线评测、Guardrails和回归结果
Agent Simulations在上线前测试完整对话和行为场景执行、模拟用户、失败原因和测试报告
Prompt Management集中管理提示及版本提示模板、变量、版本、Playground和优化结果
AI Gateway统一模型调用、预算和路由虚拟密钥、路由、缓存、限额和护栏
AI Governance控制团队访问和生产风险权限、审计、支出与组织治理

LLM与代理可观测性

LangWatch自动记录大语言模型调用、工具使用、检索、错误和用户交互,并在追踪中呈现完整执行链路。团队可以查看输入输出、Token、成本、延迟、模型、用户和自定义元数据。

  • 按项目、用户、模型、提示或版本筛选追踪。
  • 查看嵌套Span和代理多步骤执行顺序。
  • 定位工具失败、慢调用和成本异常。
  • 对生产质量和业务指标设置仪表盘。
  • 通过用户事件连接反馈与具体追踪。
  • 将分析数据导出到外部系统。
  • 使用告警和自动化响应质量下降。

OpenTelemetry与集成

追踪层建立在OpenTelemetry之上,因此既能使用LangWatch SDK,也能接收其他兼容库产生的数据。直接集成覆盖常见代理框架、模型供应商和自动化平台。

集成类别代表项目用途
代理与应用框架LangChain、LangGraph、Mastra、CrewAI和Google ADK自动捕获模型、工具和代理Span
模型提供商OpenAI、Anthropic、Azure、Google Cloud、AWS和Groq记录模型请求、响应、Token和成本
本地模型Ollama观察私有或本地推理流程
低代码平台LangFlow、Flowise和n8n为可视化流程增加追踪与评测
标准协议OTLP接入其他OpenTelemetry兼容服务

离线实验

Experiments用于在上线前对固定数据集运行模型、提示或代理版本,并记录每个样本的输出和评分。团队可以通过界面、Python或TypeScript执行实验,再比较多个配置的质量、成本和延迟。

  1. 创建代表真实任务的数据集。
  2. 选择当前生产版本作为基线。
  3. 定义需要比较的提示、模型或代理配置。
  4. 为输出配置内置或自定义评测器。
  5. 并行运行全部样本并记录追踪。
  6. 比较分数、错误、延迟和成本。
  7. 把失败样本加入回归数据集。
  8. 将最低质量要求接入持续集成门禁。

在线评测

Online Evaluation在生产追踪到达后自动运行指定评测器,用于持续观察真实性、相关性、安全、PII或自定义业务指标。它适合发现随着用户、模型和数据变化而出现的质量漂移。

评测方式运行时机适合用途
离线Experiment发布前针对固定数据集比较提示、模型和代理版本
Online Evaluation生产追踪到达后监控质量趋势和异常样本
Guardrail模型调用前后同步执行实时阻断越狱、PII或违规内容
人工Annotation对选定追踪或数据点审核专家标签、偏好和争议案例

Guardrails实时护栏

评测器可以在应用代码中作为Guardrail同步执行,并根据是否通过决定放行或阻断。它适合输入端越狱检测、输出端安全检查和关键业务规则验证,但会增加调用延迟和事件用量。

  • 检测越狱和提示注入。
  • 识别PII及敏感信息。
  • 检查毒性、有害或违规内容。
  • 验证RAG回答的忠实度和相关性。
  • 执行LLM-as-a-judge或自定义代码评分。
  • 在失败时返回安全提示或转人工处理。

评测器与工作流

LangWatch提供RAGAS、幻觉、毒性、PII和模型裁判等内置评测器,也允许团队创建可复用的组织级评测器。复杂评测可以通过工作流组合多个步骤和判断,并把自定义分数附加到追踪或Span。

数据集与标注

数据集可以通过SDK和API管理,也能从生产追踪抽取或由AI辅助生成。Annotation Inbox用于把样本分配给人工审核者,适合业务专家补充标签、目标答案和主观质量判断。

  • 从真实追踪建立失败案例集。
  • 保存文本和图像等评测输入。
  • 通过代码批量创建与查询数据集。
  • 让AI快速生成初始测试样本。
  • 将人工标签与自动评测分开记录。
  • 把审核结果用于后续回归测试。

Agent Simulations

Agent Simulations通过模拟用户与待测代理进行多轮互动,验证代理是否能在真实对话中完成目标、遵守规则并正确使用工具。它比单轮输入输出评测更适合测试状态、记忆、工具调用和长对话行为。

场景结构

组成内容作用
Scenario初始条件、用户目标和约束定义需要验证的真实业务任务
Agent Adapter连接本地、远程或托管代理把测试消息送到待测系统
User Simulator按角色和目标生成多轮用户行为覆盖不同表达、追问和阻力
Criteria成功、失败和安全判断决定场景是否通过
Run Parameters并发、重试、模型和测试数量控制成本与覆盖范围

支持的代理形态

  • 文本聊天代理。
  • 需要登录或令牌的远程代理。
  • 本地开发中的代理函数。
  • OpenAI Realtime等实时代理。
  • ElevenLabs、Twilio和Pipecat等语音代理。
  • Gemini Live等实时多模态代理。

红队与安全场景

场景测试可以用于生成对抗性用户、越权请求和提示注入流程,观察代理在多轮互动中的防御表现。红队结果应作为改进输入,不能理解为通过一次测试就永久安全。

Scenario开源库

独立Scenario仓库提供Python和TypeScript方向的代理测试工具,并使用Apache第二版许可证。它可以在本地和持续集成环境运行,不要求所有测试都通过LangWatch云端完成。

提示管理

Prompt Management集中保存提示模板、变量、版本和发布状态,避免提示散落在代码、表格和界面中。开发者可以通过SDK或CLI同步提示,并在Playground中替换模型和参数进行对比。

功能作用典型用户
Prompt Registry集中保存命名提示和版本开发与产品团队
Variables在运行时填充业务数据应用开发者
Playground测试提示、模型和参数提示工程与业务专家
CLI Sync将提示配置纳入代码仓库平台工程与持续集成
Optimization Studio基于样本和目标改进提示需要系统化优化的团队
DSPy Optimization用程序化方法搜索更优提示研究和高级评测团队

AI Gateway

AI Gateway可以统一接入多个模型提供商,并在组织边界内管理虚拟密钥、路由、预算、缓存和Guardrails。自托管时可选择让模型流量在自己的网络边界终止。

  • 用虚拟密钥隔离应用和团队。
  • 在多个模型或供应商之间路由。
  • 为组织、项目或用户设置层级预算。
  • 使用提示缓存减少重复推理。
  • 在统一入口执行实时护栏。
  • 集中记录成本、失败和模型用量。

MCP、CLI与Skills

LangWatch提供MCP、命令行工具和面向编程助手的Skills,使AI助手可以协助接入追踪、创建评测、运行模拟和管理提示。自动化修改仍应经过人工审查,尤其是生产密钥、护栏和部署设置。

云端价格

价格信息于2026年8月23日核验,实际金额、税费、汇率和优惠可能变化,最终以结算页面显示为准。

LangWatch Cloud按核心席位和事件用量计费,Growth另对超过30天保留的数据收取存储费。Lite用户可以查看和协作,但具体可编辑范围应以当前权限说明为准。

套餐或版本价格计费周期核心权益或额度适合用户
Developer免费永久免费,额度每月刷新5万事件、14天数据访问、2名用户,3个场景、3次模拟和3个自定义评测个人开发者和早期原型
Growth每核心席位29欧元每月含20万事件和30天保留,无限Lite用户、模拟、评测与提示把AI应用投入生产的团队
Enterprise定制报价合同约定混合、自托管或本地部署,自定义保留、SSO、RBAC、审计、SLA和专属工程支持受监管与大型组织

事件与存储计费

每次模型调用、工具调用、检索、评测或模拟步骤都会计为一个事件,因此一次用户对话通常包含多个计费事件。Growth每月前20万事件包含在席位费中,之后每10万事件收取5欧元。

计费项Growth包含量超额价格注意事项
核心席位每席位独立计费29欧元每席位每月可增减席位,20人以上可询问量价优惠
事件每月20万每10万事件5欧元模型、工具、检索、评测和模拟步骤均可能计费
数据访问30天延长部分每GB 3欧元仅在保留超过包含周期时计费
Lite用户无限包含权限范围与核心席位不同
模型推理不包含由模型提供商收取模拟和LLM评测可能产生较多模型调用

账单估算方法

  1. 统计每月最终用户交互数量。
  2. 测量一次典型交互包含多少模型、工具和检索事件。
  3. 加入在线评测和Guardrail产生的事件。
  4. 估算离线实验与代理模拟的额外运行量。
  5. 确定需要完整使用权限的核心席位数量。
  6. 计算超过30天仍需访问的数据GB。
  7. 另行加入模型、云存储和自托管基础设施费用。
  8. 为增长、回填和异常流量预留预算。

开源与许可证

LangWatch采用开放核心模式,主要平台代码使用Apache第二版许可证,Python、TypeScript SDK和MCP服务使用MIT许可证。SCIM、审计日志、许可证与计费管理等企业模块位于单独目录,生产使用需要商业许可证。

组件许可证可做什么限制
LangWatch核心平台Apache第二版查看、修改和自托管主要功能企业目录中的模块不在同一许可下
Python SDKMIT追踪、评测和数据访问仍需连接云端或自托管服务
TypeScript SDKMIT在Node与Web项目中集成平台不包含托管基础设施
MCP ServerMIT让AI客户端操作LangWatch能力需要合理配置权限和凭据
ScenarioApache第二版本地运行代理场景测试模型和目标代理费用自理
Enterprise模块商业许可证SSO、SCIM、审计和企业管理生产使用需购买授权

自托管版本

不配置企业许可证时,自托管LangWatch仍允许无限成员、团队、项目和自建内容,并运行与云端相同的主软件。企业许可证在同一部署中解锁SSO、RBAC、SCIM、审计日志和支持,不需要更换独立产品版本。

部署模式对比

部署模式应用由谁管理数据存储位置适合场景
LangWatch CloudLangWatch托管云快速开始和免运维
Self-Managed客户客户基础设施完整数据主权和自主管理
Cloud EnterpriseLangWatch客户指定区域的专属实例需要隔离且不想自行运维
HybridLangWatch管理控制平面ClickHouse与对象存储位于客户网络追踪数据不能离开企业网络

自托管基础设施

当前v3生产方案以Kubernetes Helm为主,使用ClickHouse作为核心分析存储,并通过对象存储分层保存冷数据。Docker Compose快速方案仍主要面向v2,准备部署v3时不应沿用旧教程。

  • 使用ClickHouse保存和查询追踪及评测事件。
  • 通过事件溯源保证追踪与评测处理顺序。
  • 将旧数据分层到兼容对象存储。
  • 使用原生ClickHouse备份与恢复机制。
  • 通过Helm Overlay调整不同规模部署。
  • 可选启用AI Gateway子Chart。
  • 需要自行维护密钥、网络、备份、升级和监控。

安全与合规

LangWatch公开说明其符合GDPR,并已获得ISO 27001认证,企业客户可申请相关报告和数据处理协议。由于平台可能接触提示词、输出、工具参数和用户数据,团队仍需完成自己的数据分类与访问设计。

  • 在埋点前移除不需要的个人数据和密钥。
  • 限制谁能查看原始追踪与数据集。
  • 为导出、MCP和API设置最小权限。
  • 审查云端地区、子处理方和保留周期。
  • 自托管环境启用传输与静态加密。
  • 为审计、删除、备份和事件响应制定流程。
  • 受监管业务应通过企业合同确认合规责任。

适合哪些用户

  • 开发大语言模型应用和AI代理的工程团队。
  • 负责模型质量、回归和安全测试的团队。
  • 需要模拟用户测试多轮代理行为的产品团队。
  • 希望让业务专家参与提示和人工标注的组织。
  • 需要统一模型网关、预算和治理的平台团队。
  • 希望开源自托管并控制追踪数据的企业。
  • 使用n8n等低代码工具构建AI流程的开发者。

产品优势

  • 可观测、评测、模拟与提示管理形成完整闭环。
  • Agent Simulations适合验证多轮和工具型代理。
  • 支持离线实验、在线监控和同步Guardrails。
  • OpenTelemetry降低与单一SDK绑定。
  • 云端价格同时提供免费入口和低价事件扩展。
  • 自托管主要能力没有成员和项目上限。
  • 开放核心的许可证边界说明较清晰。

限制与注意事项

  • 一次用户交互可能产生多个计费事件。
  • 模拟、在线评测和Guardrail会增加模型与事件成本。
  • LLM评分器和模拟用户可能产生误判。
  • 完整质量体系需要维护数据集、标准和人工审核。
  • v3自托管以Kubernetes为主,运维复杂度高于单容器工具。
  • 企业模块虽在同一仓库,但不适用Apache开源许可。
  • 追踪内容可能包含敏感业务数据和模型提示。
  • Developer版的场景、模拟和自定义评测数量有限。

实施流程

  1. 选择LangWatch Cloud或规划自托管环境。
  2. 创建项目并接入OpenTelemetry或官方SDK。
  3. 用测试请求验证Span、成本和用户元数据。
  4. 建立核心质量指标与失败分类。
  5. 从真实追踪创建首批评测数据集。
  6. 为提示与模型变更设置离线实验。
  7. 用场景模拟测试多轮代理和工具行为。
  8. 为高风险输入输出增加Guardrails。
  9. 配置生产在线评测、告警和预算。
  10. 按事件、席位、存储和模型费复盘实际成本。

常见问题

LangWatch免费吗?

Developer云套餐永久免费,每月包含5万事件、14天数据访问、2名用户以及有限数量的场景、模拟和自定义评测。自托管开源版也不限制成员、团队和项目,但基础设施成本由用户承担。

什么是一个计费事件?

模型调用、工具调用、检索、评测和模拟步骤都可能形成事件。一个完整用户会话通常包含多个事件,因此应根据实际追踪测量而不是直接按会话数估算。

LangWatch是开源的吗?

主要平台使用Apache第二版许可证,SDK和MCP使用MIT许可证。企业模块采用单独商业许可证,因此更准确的表述是开放核心平台。

可以自托管吗?

可以,v3建议使用Kubernetes和官方Helm Chart。无许可证也能使用主要平台能力,SSO、SCIM、RBAC、审计和企业支持需要商业授权。

Agent Simulation与普通评测有什么区别?

普通评测通常检查固定输入输出,Agent Simulation会让模拟用户与代理进行多轮互动。后者更适合测试状态、工具、语音、拒答和完成业务目标的完整过程。

能实时阻断有害内容吗?

可以把评测器作为Guardrail在模型调用前后同步执行,并根据结果阻断或回退。上线前应测试延迟、误报、降级逻辑和异常处理。

总结

LangWatch不仅记录LLM追踪,还把离线实验、在线评测、实时护栏、代理场景模拟和提示管理组合成一套AI工程流程。它特别适合需要系统验证多轮代理,而不是只观察单次模型回答的团队。

云端Growth按每核心席位29欧元起,并按超额事件和延长存储计费;开源自托管版提供更强数据控制,但v3生产部署需要Kubernetes运维能力。正式采用前应以真实流量测算事件倍率、模型费用和保留需求。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于LangWatch的工具