AI21 Maestro是什么
AI21 Maestro是AI21 Labs面向生产级AI Agent推出的动态规划、编排和优化系统。它会根据任务、要求和预算,在运行时选择模型、工具与执行路径,并对中间结果和最终输出进行验证与修正。
一句话介绍
Maestro可以把企业文件、网页、模型和工具组合成可追踪的知识Agent,并在质量、成本与响应时间之间自动寻找执行方案。
产品定位
- 面向高价值、数据密集型企业任务。
- 用于创建和优化RAG知识Agent。
- 强调运行时动态规划而非固定链路。
- 以要求验证和执行追踪提高可控性。
- 支持AI21与第三方模型统一编排。
- 既有API和SDK,也可通过平台配置。
核心功能
- 把复杂任务拆解为多步骤执行计划。
- 选择合适模型、搜索和外部工具。
- 并行探索多个候选路径。
- 按质量、成本和延迟预算分配计算。
- 逐步检查要求满足情况。
- 发现问题后自动重试或修正。
- 提供执行图、置信度和验证报告。
- 保存Agent配置供后续API调用。
动态规划与编排
每次运行时,Maestro会根据任务构建由模型调用和工具操作组成的执行树,而不是始终使用固定提示链。计划会随要求、数据和预算变化。
- 分析任务目标与显式要求。
- 选择需要执行的检索和推理步骤。
- 比较不同路径的预期质量和成本。
- 在运行过程中调整下一步。
- 在额外计算价值不足时停止。
- 输出完整执行轨迹供审查。
多路径竞争
- 为复杂问题生成多个候选策略。
- 允许平行路径使用不同模型或工具。
- 比较候选结果对要求的满足程度。
- 淘汰低质量或高成本路径。
- 保留表现最佳的结果。
- 并行计算会增加实际成本与延迟。
内置验证与自动修正
Maestro会依据用户定义的内容、风格、格式和护栏等要求对输出评分。如果结果低于目标,可以进一步搜索、推理或修正,直至满足要求或预算耗尽。
- 为每项要求返回单独得分。
- 提供整体满足度评分。
- 在中间步骤发现错误。
- 避免错误持续传递到后续流程。
- 自动尝试修复不合格结果。
- 验证结果仍需结合人工抽查。
预算控制
| 预算等级 | 执行特征 | 适合任务 | 主要取舍 |
|---|---|---|---|
| Low | 单步、最低计算 | 简单或时效性强的任务 | 速度快、成本低,验证较少 |
| Medium | 多步骤、中等投入 | 常规企业知识任务 | 质量、速度与费用平衡 |
| High | 多策略、多轮验证 | 复杂或高风险任务 | 可靠性更高,成本和延迟增加 |
质量、成本与延迟优化
- 为任务设置可接受的质量门槛。
- 限制单次运行可使用的计算预算。
- 根据场景设定延迟目标。
- 观察不同配置的质量成本曲线。
- 将简单任务路由到较轻执行路径。
- 仅在预期质量收益值得时增加计算。
- 按团队、代码库和Agent归因支出。
RAG知识检索
Maestro建立在AI21的RAG Engine之上,可通过规划层组合文件搜索、网页搜索和后续问题。回答能够以企业文档为上下文,但RAG仍不能完全消除幻觉。
- 上传文件后自动解析和索引。
- 从指定文档中检索相关内容。
- 通过网页搜索补充公开信息。
- 支持连续追问和澄清。
- 将检索结果用于多步推理。
- 适合内部知识和客户应用。
支持的文件类型
- PDF文档。
- Microsoft Word文档。
- 纯文本文件。
- Markdown文件。
- HTML文件。
- 云端数据源连接需按账户能力确认。
- 扫描件、复杂表格和图片应单独测试解析质量。
结构化RAG与数据抽取
- 从复杂文件提取结构化信息。
- 识别表格、字段和文档关系。
- 将抽取结果用于后续Agent步骤。
- 适合合同、报告和技术文档。
- 可用于数据迁移和标准化。
- 高风险字段必须与原文核对。
模型无关编排
Maestro可以使用AI21自有模型,也能调用由AI21管理或由用户自行提供密钥的第三方模型。团队可指定模型,也可以让系统根据任务自动选择。
- 支持AI21 Jamba系列模型。
- 可使用OpenAI部分模型。
- 可使用Anthropic部分模型。
- 可使用Google部分模型。
- 通过统一接口降低上层集成差异。
- 第三方可用模型会随服务更新。
- 模型使用仍受各供应商条款约束。
BYOK自带密钥
- 在平台中配置第三方模型凭据。
- 当前文档列出OpenAI、Anthropic和Google。
- 在Agent运行时引用已配置模型ID。
- 第三方费用由相应供应商计算。
- 应使用专用项目和受限密钥。
- 定期轮换并监控异常调用。
- 不要把密钥直接写入客户端代码。
远程MCP工具
Maestro可以作为MCP客户端连接互联网可访问的远程MCP服务器,用于调用外部工具、服务与数据。当前文档说明支持远程服务器,不支持仅运行在单台设备上的本地MCP服务器。
- 连接可通过互联网访问的远程MCP服务。
- 使用常见认证方式保护调用。
- 把外部工具加入Agent执行计划。
- 支持需要多步骤操作的工作流。
- 工具返回值可进入后续验证。
- 外部写操作应加入人工批准。
保存和复用Agent
- 保存Agent名称和描述。
- 保存系统指令和业务边界。
- 保存工具与模型配置。
- 在后续API调用中直接引用。
- 减少重复传递大型配置。
- 有利于统一团队工作流。
- 修改配置时应进行版本和回归测试。
执行追踪与可观测性
- 查看可视化执行图。
- 了解模型、工具和检索调用顺序。
- 查看各项要求验证得分。
- 定位失败或低质量步骤。
- 分析成本和延迟来源。
- 比较不同预算配置。
- 为审计保留必要运行记录。
支持的响应语言
API当前支持阿拉伯语、荷兰语、英语、法语、德语、希伯来语、意大利语、葡萄牙语和西班牙语输出,默认使用英语。中文不在当前公开枚举中。
适合哪些用户
- 构建企业知识Agent的AI工程团队。
- 需要高准确度RAG的金融和法律机构。
- 处理大量合同、报告和技术文档的企业。
- 希望统一多家模型供应商的开发者。
- 需要控制Agent成本与延迟的平台团队。
- 希望保留执行与验证记录的受监管组织。
- 把AI研究和分析流程投入生产的公司。
典型使用场景
- 生成金融研究报告。
- 自动准备RFP响应。
- 开展并购尽职调查。
- 审查合同组合和关键条款。
- 分析投资说明书和财务文件。
- 总结临床试验结果。
- 排查高价值设备技术问题。
- 从专利中提取权利要求要素。
- 将旧系统数据转换为标准结构。
不太适合哪些情况
- 只需要一次简单聊天问答的个人。
- 追求最低延迟且不需要验证的场景。
- 必须完全离线和本地运行的组织。
- 要求原生中文输出枚举的应用。
- 没有工程能力管理工具权限的团队。
- 希望获得完整Maestro源码的开发者。
- 不能接受用量计费和成本波动的项目。
API使用方式
- 创建一次Maestro run执行任务。
- 传入用户输入和显式requirements。
- 配置文件搜索或网页搜索资源。
- 指定模型或使用自动选择。
- 设置low、medium或high预算。
- 选择需要返回的追踪信息。
- 读取输出、要求得分和总体评分。
价格与试用额度
AI21文档说明平台主要按token或具体端点用量计费,新账户提供10美元试用额度,有效期三个月,可用于API、SDK和Playground。额度用完或过期后需要添加有效付款方式。
| 费用类型 | 公开规则 | 注意事项 |
|---|---|---|
| 新账户试用 | 10美元,有效3个月 | 不是长期免费套餐 |
| AI21平台用量 | 按token或端点计费 | 输入与输出价格可能不同 |
| Maestro运行 | 受预算、步骤、模型和工具影响 | 高预算通常增加成本 |
| 第三方托管模型 | 按AI21或对应配置计费 | 需查看当前模型价目 |
| BYOK模型 | 第三方供应商另行收费 | AI21运行费用仍需确认 |
| 云平台部署 | 由AWS或Azure等平台定价 | 可能按token、实例或时间计费 |
| 大规模企业 | 定制方案 | 联系AI21获取商务报价 |
影响成本的因素
- 输入和输出token数量。
- 选择的模型与供应商。
- Low、Medium或High预算等级。
- 执行路径和验证循环数量。
- 网页搜索、文件检索和外部工具调用。
- 失败重试与自动修正次数。
- 第三方云和数据服务费用。
如何控制成本
- 简单任务默认从Low预算开始。
- 缩小文件搜索范围和网页域名。
- 将明确任务路由到较轻模型。
- 只为关键要求启用高强度验证。
- 监控API响应中的用量字段。
- 按团队、应用和Agent设置预算。
- 使用样本集比较质量和单位成本。
创建RAG Agent教程
- 创建AI21账户并安全保存API密钥。
- 上传少量经过授权的测试文档。
- 等待文件自动解析和索引。
- 编写Agent身份、任务和禁止范围。
- 添加文件搜索并限定文件或标签。
- 从Low预算执行代表性问题。
- 核查引用、回答和验证报告。
- 保存Agent并用API接入测试应用。
requirements配置教程
- 将任务目标与评价要求分开编写。
- 为每项要求使用清晰名称。
- 描述内容、格式、语气和护栏。
- 避免互相冲突或不可验证的要求。
- 设置合适预算并执行测试。
- 查看每项要求得分和失败原因。
- 修改要求或工具后再次回归测试。
MCP工具接入教程
- 确认MCP服务器可通过互联网安全访问。
- 审查工具能力、参数和写入风险。
- 配置专用身份与最小权限认证。
- 在Maestro工具参数中添加远程服务。
- 使用只读和测试数据验证调用。
- 为敏感动作增加人工批准。
- 监控调用日志、错误和异常费用。
评测与上线流程
- 建立真实任务和标准答案数据集。
- 定义准确度、要求满足率和延迟指标。
- 分别测试不同模型和预算等级。
- 检查失败、拒答和错误工具调用。
- 测算每个合格结果的总成本。
- 小流量上线并保留人工复核。
- 持续监控数据、模型和任务漂移。
安全与数据治理
- 只上传已获授权的企业资料。
- 为文件、Agent和项目划分权限。
- BYOK使用独立且可撤销的密钥。
- 对远程工具采用最小权限。
- 敏感写操作设置人工确认。
- 明确运行日志和文档保留周期。
- 采购前核验信任中心和合同覆盖范围。
- 删除测试数据并定期轮换凭据。
Agent可靠性风险
- 验证模型本身也可能判断错误。
- 高分不一定代表事实完全正确。
- 检索遗漏会限制最终答案。
- 复杂文档解析可能破坏表格和上下文。
- 第三方模型与工具会引入额外故障。
- 动态执行使成本和延迟存在波动。
- 高风险任务仍需领域专家审核。
产品优势
- 在运行时动态选择执行路径。
- 把质量、成本与延迟放在同一控制面。
- 对每项明确要求进行评分和修正。
- 支持文件、网页和远程MCP工具。
- 可以统一编排AI21与第三方模型。
- 支持BYOK降低模型锁定。
- 提供执行图和结构化验证报告。
- 官方Python和TypeScript SDK便于集成。
产品限制
- 完整Maestro平台不是开源软件。
- 高预算和多路径会增加费用与延迟。
- 验证不能消除所有事实和推理错误。
- 当前响应语言列表不包含中文。
- 本地MCP服务器不在当前支持范围。
- 复杂权限与工具调用需要工程治理。
- 价格受多个模型和服务共同影响。
- 公开页面没有简单固定月费套餐。
- 企业敏感数据需完成额外合规评估。
GitHub与开源状态
AI21 Labs拥有官方GitHub组织,公开Python和TypeScript SDK,相关客户端采用Apache 2.0许可证并包含Maestro调用示例。SDK开源不代表Maestro动态规划、验证引擎和托管平台源码开放。
基本信息
| 项目 | 内容 |
|---|---|
| 工具名称 | AI21 Maestro |
| 开发公司 | AI21 Labs |
| 工具类型 | 企业AI Agent规划、RAG与优化系统 |
| 预算等级 | Low、Medium、High |
| 模型 | AI21、托管第三方与BYOK |
| 试用 | 10美元,有效3个月 |
| API与SDK | REST、Python和TypeScript |
| MCP | 支持远程服务器 |
| 开源状态 | 平台不开源,SDK为Apache 2.0 |
推荐指数
推荐指数:4.6 / 5。AI21 Maestro适合需要把高准确度RAG和复杂知识任务投入生产,同时控制成本与延迟的企业AI团队。
正式选型应通过自有数据集验证准确度、解析质量、验证可信度、中文需求和每个合格结果的真实成本。
常见问题
AI21 Maestro是什么?
它是用于创建、编排和优化生产级RAG与知识Agent的动态规划系统。
Maestro免费吗?
新账户有10美元试用额度,有效三个月,之后需要按用量付费。
支持第三方模型吗?
支持AI21管理的第三方模型,也支持OpenAI、Anthropic和Google的BYOK配置。
支持中文吗?
当前API公开的response_language枚举不包含中文,应使用真实任务测试其他输出方式。
支持MCP吗?
支持互联网可访问的远程MCP服务器,目前文档不支持仅本地运行的MCP服务器。
可以上传哪些文件?
支持PDF、DOCX、TXT、Markdown和HTML。
High预算一定更准确吗?
通常会增加路径和验证机会,但不能保证所有任务都更准确。
Maestro开源吗?
平台不开源,官方Python和TypeScript SDK采用Apache 2.0许可证。
适合个人聊天吗?
它更适合开发者和企业知识工作流,普通聊天使用可能过于复杂。
桂公网安备45132202000164号