Future AGI是什么
Future AGI是一款用于构建、测试、监控和改进LLM应用及AI智能体的端到端平台。它把仿真、评测、护栏、追踪、网关、数据集和提示词优化连接成同一反馈循环。
平台既提供托管Cloud,也公开了可自托管的核心代码。工程师、产品经理和领域专家可以在同一项目中查看质量、成本、延迟、错误和人工标注。
一句话介绍
Future AGI帮助团队在上线前模拟AI智能体,上线后追踪和评测,并用实时护栏与生产反馈持续修正提示词和代理流程。
六大产品模块
| 模块 | 核心能力 | 主要输入 | 主要结果 |
|---|---|---|---|
| Build | Agent Playground、Prompt和Dataset | 提示词、工具、数据 | 代理定义与版本 |
| Command Center | 路由、缓存、护栏和成本控制 | 模型请求 | 统一模型响应与治理 |
| Simulate | 合成用户与测试场景 | 人物、脚本、数据集和图 | 文本或语音会话 |
| Evaluate | 启发式、代码、模型裁判和Agentic评测 | 数据集、追踪或实时输入 | 分数、解释和失败标签 |
| Observe | 追踪、会话、错误流和仪表盘 | 生产跨度和事件 | 调用图、成本、延迟和异常 |
| Optimize | 提示词和智能体优化 | 生产追踪和评测结果 | 改进版本与实验 |
AI智能体仿真
Simulate可以用预设或自定义人物,在上线前运行多轮文本与语音会话。场景可由脚本、数据集或图结构定义,并保留转录、会话对比和跟踪结果。
仿真适合测试什么
- 正常用户从提问到任务完成的完整流程。
- 模糊、矛盾、越权和提示注入输入。
- 工具失败、超时、重复调用和部分数据缺失。
- 不同语言、语气、背景和知识水平的人物。
- 语音中断、沉默、口音和识别错误。
- 长会话中的记忆、状态和目标漂移。
多类型AI评测
Evaluate支持启发式指标、代码评测、LLM-as-judge和智能体评测代理。公开仓库列出50多个指标,包括事实依据、幻觉、工具使用正确性、个人信息和语气。
评测方式对比
| 评测方式 | 特点 | 成本 | 适合任务 |
|---|---|---|---|
| 启发式 | BLEU、ROUGE、正则等确定规则 | 平台永久免费 | 格式、词面和明确规则 |
| 代码评测 | 运行自定义程序判断结果 | 按AI Credits计次 | 结构化业务逻辑 |
| LLM-as-judge | 模型按标准评价开放结果 | 托管模型用信用点;BYOK平台费为0 | 质量、语气和复杂标准 |
| Agentic Eval | 专用代理定位RAG、工具、提示和错误 | 使用AI Credits | 多步骤智能体 |
| 人工标注 | 领域人员给出标签和复核 | 平台不按席位收费 | 高风险与金标准 |
生产追踪与可观测性
Observe基于OpenTelemetry接收LLM和智能体追踪,展示跨度图、会话、终端用户、延迟、令牌和成本。系统支持11种跨度类型、70多个筛选条件和全文搜索。
traceAI集成
traceAI为50多个AI框架提供自动插桩,涵盖LangChain、LangGraph、LlamaIndex、CrewAI、AutoGen、DSPy等。Python、TypeScript、Java和C#均有相应接入路径。
实时护栏Protect
Protect可检测个人信息、密钥、越狱、提示注入、毒性和其他不安全内容。15种规则护栏永久免费,机器学习Protect按AI Credits计费。
护栏运行模式
| 模式 | 行为 | 适合阶段 |
|---|---|---|
| Enforce | 达到阈值时拦截或修正 | 生产高风险入口 |
| Monitor | 检测并记录但不立即阻断 | 上线初期与阈值调优 |
| Log | 仅保存检测结果 | 离线分析和审计 |
| Protect Flash | 较低延迟,约1至3信用点 | 高频实时检查 |
| Protect Full | 更完整检查,约3至8信用点 | 复杂或高风险内容 |
| External BYOK | 连接Lakera、Presidio、Llama Guard等 | 已有安全供应商 |
Agent Command Center
Command Center是兼容OpenAI接口的LLM网关,可在100多个模型提供商之间路由。它提供自动故障转移、重试、虚拟密钥、预算、限流、成本跟踪和精确或语义缓存。
网关适合解决的问题
- 统一管理不同模型供应商的密钥和请求。
- 按延迟、成本、权重或可用性进行路由。
- 供应商故障时自动切换并重试。
- 通过缓存减少重复调用和模型费用。
- 为组织、团队、用户和虚拟密钥设置预算。
- 在请求或响应路径中执行实时护栏。
数据集、实验与人工标注
平台支持手工、CSV、PDF、Hugging Face和SDK等方式创建数据集,并提供14种列类型。数据集和实验数量不受限制,数据集与标注在所有Cloud方案中永久保存。
免费和按量方案提供3个标注队列,Boost提供10个,Scale及更高方案不限制。标签支持数值、文本、分类、星级和赞踩。
提示词与Agent Playground
Prompt模块支持模板、版本、标签和文件夹,Prompt Playground可用自带模型密钥免费运行。Agent Playground提供可视化图构建、工具调用和输出格式验证。
Falcon AI
Falcon AI可分析追踪和评测、聚类错误、生成洞察、自动标签和性能报告。它与其他托管AI能力共享每月2,000个免费AI Credits。
提示词与智能体优化
Optimize可把生产追踪和评测结果反馈到提示词改进,并提供GEPA、PromptWizard、ProTeGi、Bayesian、Meta-Prompt和Random等算法。改进版本仍需在独立测试集上验证。
建立首个追踪教程
- 注册Cloud或部署自托管实例并创建项目。
- 选择Python、TypeScript、Java或C#插桩包。
- 配置项目名、端点和安全保存的认证信息。
- 为所用模型或框架启用对应Instrumentor。
- 运行一条测试请求并检查跨度图、令牌和延迟。
- 添加用户、会话、版本和环境等业务属性。
- 配置错误筛选、仪表盘和告警。
创建评测教程
- 把代表性输入、标准答案和业务条件整理成数据集。
- 先用正则或启发式指标检查确定性要求。
- 为开放质量编写清晰量表和失败示例。
- 选择BYOK模型裁判或托管Turing评测。
- 加入工具、RAG和提示错误定位代理。
- 用人工标注样本校准自动分数和阈值。
- 把关键评测加入持续集成和生产抽样。
设置网关与护栏教程
- 添加模型供应商并创建最小权限的虚拟密钥。
- 配置主模型、备用模型、重试和超时。
- 选择缓存后端并确定不能缓存的敏感请求。
- 开启个人信息、密钥和提示注入规则护栏。
- 先用Monitor观察误报和漏报,再设置Enforce阈值。
- 按组织、团队、用户和密钥配置预算与限流。
- 监控成本、失败、缓存命中和护栏延迟。
Docker自托管教程
- 准备Docker Engine或Docker Desktop及Compose。
- 克隆官方future-agi仓库并阅读安装与安全说明。
- 使用安装脚本生成配置并拉取已发布镜像。
- 为生产环境生成独立密钥并固定镜像版本。
- 启动PostgreSQL、ClickHouse、Redis、RabbitMQ和Temporal等组件。
- 限制网络入口、启用备份并配置监控。
- 先在非生产环境验证升级、恢复和遥测设置。
适合哪些用户
- AI应用工程师:追踪模型、工具和智能体调用。
- 评测团队:建立离线、持续和生产质量测试。
- RAG团队:检测事实依据、幻觉和检索问题。
- 语音智能体团队:模拟人物、场景和通话。
- 安全团队:配置个人信息、注入和内容护栏。
- 平台工程团队:统一路由、密钥、缓存和成本。
- 产品与领域专家:使用数据集和标注队列参与审核。
- 受监管企业:通过自托管控制数据位置和基础设施。
典型使用场景
- 上线前模拟客服智能体的正常与攻击会话。
- 持续评测RAG回答是否有依据和幻觉。
- 追踪多智能体中每个工具的延迟、成本和失败。
- 通过网关在多个模型供应商间故障转移。
- 在生产响应前拦截个人信息和提示注入。
- 从错误追踪生成标注队列和回归数据集。
- 比较不同模型、提示词和代理版本。
- 在企业网络内部部署完整评测与可观测平台。
产品优势
- 覆盖仿真、评测、追踪、护栏、网关和优化完整链路。
- Cloud免费额度较高且团队成员与项目数量不限。
- 启发式评测、BYOK模型裁判和规则护栏平台费为0。
- OpenTelemetry和兼容OpenAI接口降低接入锁定。
- 支持100多个模型提供商和50多个AI框架。
- 核心平台采用Apache 2.0并可Docker自托管。
- 数据集和标注在Cloud所有方案中永久保存。
- 按存储、信用点、网关、缓存和仿真分别计费。
使用限制与注意事项
- 开源仓库当前标记为Nightly早期测试版,稳定版尚未发布。
- 自托管包含多个数据库、队列和运行组件,运维成本不低。
- 官方Kubernetes与Helm支持仍在路线图中。
- AWS Marketplace仍标记为即将推出。
- 自动评测和模型裁判可能有偏差,必须用人工样本校准。
- 护栏会产生误报和漏报,高风险决策不能只依赖自动拦截。
- BYOK平台费为0不代表模型供应商调用免费。
- Cloud免费和按量方案的追踪数据只保留30天。
- 数据集永久保存可能增加存储费,也需要主动删除敏感数据。
- 自托管默认含部署遥测,完全无外联需在网络边界阻断。
Cloud免费额度
| 计费维度 | 每月免费额度 | 超额基础价 | 说明 |
|---|---|---|---|
| 追踪与存储 | 50 GB | 50至500 GB为2美元/GB | 包含跨度、评测和会话 |
| AI Credits | 2,000 | 10美元/1,000点 | 评测、Protect和Falcon共享 |
| Gateway Requests | 100,000次 | 5美元/100,000次起 | 按用量自动阶梯降价 |
| Cache Hits | 100,000次 | 1美元/100,000次起 | 与网关请求分开计费 |
| Text Simulation | 100万Token | 2美元/100万Token起 | 超过1,000万后更低 |
| Voice Simulation | 60分钟 | 0.08美元/分钟 | 与文本仿真分开 |
追踪与网关阶梯价格
| 产品 | 用量区间 | 价格 |
|---|---|---|
| Storage | 前50 GB | 免费 |
| Storage | 50至500 GB | 2美元/GB |
| Storage | 500 GB至2 TB | 1.50美元/GB |
| Storage | 2 TB以上 | 1美元/GB |
| Gateway | 前100,000次 | 免费 |
| Gateway | 100,000至1,000,000次 | 5美元/100,000次 |
| Gateway | 1,000,000至10,000,000次 | 4美元/100,000次 |
| Gateway | 10,000,000次以上 | 2.50美元/100,000次 |
平台附加套餐
| 方案 | 价格 | 数据保留 | 合规与身份 | 队列和监控 | 支持 |
|---|---|---|---|---|---|
| Free或PAYG | 0美元起加按量 | 30天 | 基础账户 | 3队列、3监控 | 社区或邮件 |
| Boost | 250美元/月 | 90天 | SOC 2 Type II、OAuth SSO、审计日志 | 10队列、15监控、5知识库 | 48小时邮件 |
| Scale | 750美元/月 | 1年 | HIPAA BAA、SAML SSO、SCIM | 不限队列和监控 | 24小时邮件与Slack |
| Enterprise | 2,000美元/月 | 定制 | ABAC、数据遮罩及Scale全部功能 | 自定义限制 | 专属工程师和CSM |
价格核验日期为2026年8月22日。按量方案可设置账单告警和硬上限,免费方案达到额度后暂停而不会自动产生超额账单。
自托管成本
开源自托管没有Cloud订阅费,但需要计算服务器、数据库、对象存储、备份、升级、监控、安全和人员成本。使用外部模型和护栏供应商仍会产生独立费用。
| 自托管组件 | 主要用途 | 运维注意 |
|---|---|---|
| Python与Django | 平台后端 | 版本、进程和漏洞更新 |
| Go Gateway | 模型路由和请求治理 | 高可用、限流和密钥 |
| React前端 | Web控制台 | 构建与访问控制 |
| PostgreSQL | 元数据 | 备份和迁移 |
| ClickHouse | 跨度和时序数据 | 容量和保留策略 |
| Redis | 状态与缓存 | 持久化和内存 |
| RabbitMQ与Temporal | 任务与工作流 | 积压、重试和恢复 |
支持语言、SDK与集成
| 类别 | 支持内容 | 用途 |
|---|---|---|
| 客户端语言 | Python、TypeScript、Java、C# | 追踪和平台接入 |
| 评测SDK | Python与TypeScript | 50多个指标与护栏 |
| 平台SDK | Python | 数据集、提示词、知识库和实验 |
| Gateway SDK | Python与TypeScript | 模型路由和缓存 |
| 模型提供商 | OpenAI、Anthropic、Gemini、Bedrock、Azure等100多个 | 统一调用 |
| Agent框架 | LangChain、LlamaIndex、CrewAI、AutoGen、DSPy等 | 自动插桩 |
| 语音平台 | VAPI、Retell、LiveKit、Pipecat | 语音仿真 |
| 向量数据库 | Pinecone、Weaviate、Chroma、Milvus、Qdrant、pgvector | RAG与知识库 |
| MCP | 提供服务端 | 在Cursor或Claude Code中访问平台和文档 |
开源、自托管与许可证
Future AGI完整核心平台仓库采用Apache License 2.0,可检查评测器、提示词、追踪和网关代码,并通过Docker Compose自托管。仓库同时包含LICENSE-EE,使用企业功能前仍应检查目录边界。
futureagi-sdk、Agent Command Center SDK等官方仓库也采用Apache 2.0,部分生态包可能使用Apache或MIT。每个独立软件包仍需核对自己的许可证文件。
| 项目 | 开放状态 | 许可证或阶段 |
|---|---|---|
| Future AGI核心平台 | 源码公开、自托管 | Apache 2.0核心;当前Nightly测试 |
| futureagi SDK | 公开 | Apache 2.0 |
| traceAI | 公开 | 按仓库许可证使用 |
| ai-evaluation | 公开 | Python与TypeScript |
| Command Center SDK | 公开 | Apache 2.0 |
| Cloud托管服务 | 商业服务 | 按免费、按量和附加套餐计费 |
| 企业功能 | 部分商业能力 | 检查LICENSE-EE和合同 |
部署选项
| 部署方式 | 当前状态 | 说明 |
|---|---|---|
| Future AGI Cloud | 正式提供 | 免运维并按用量计费 |
| Docker Compose | 提供 | 从仓库拉取镜像自托管 |
| Production Compose Overlay | 提供 | 生成密钥并固定镜像 |
| AWS、GCP、Azure VM | 可用 | 在虚拟机运行Compose |
| Air-gapped与本地部署 | 提供企业路径 | 无回传需求需联系销售 |
| Kubernetes与Helm | 即将推出 | 不能写成当前正式支持 |
| AWS Marketplace | 即将推出 | 尚未正式可用 |
遥测与隐私
自托管默认发送一次注册和周期性心跳遥测,可能包含实例ID、版本、部署类型、管理员邮箱及域名和匿名汇总使用量,不发送追踪、提示词或API密钥。
可以通过环境配置关闭周期心跳,但禁用后仍发送一次不含邮箱的最小统计。需要完全无外联的环境应在网络边界阻断。
Cloud隐私与删除
隐私政策列出姓名、邮箱、组织、电话以及IP、浏览器、访问页面和诊断数据。信息用于服务、支持、分析、安全和通知,不出售个人身份信息。
用户可请求访问、更正、删除、限制、反对和可携带,删除申请在30天内处理。法律、争议和匿名统计可能构成保留例外。
基本信息
| 项目 | 内容 |
|---|---|
| 工具名称 | Future AGI |
| 运营公司 | Future AGI Inc. |
| 工具类型 | AI智能体评测、可观测性、护栏、仿真与网关 |
| 价格模式 | 免费、按量、附加套餐和企业服务 |
| 免费要求 | 无需信用卡 |
| 团队与项目 | 所有Cloud方案不限成员和项目 |
| 主要平台 | Web Cloud、API、SDK和Docker自托管 |
| 公开API | 提供 |
| 官方SDK | Python、TypeScript、Java和C#等 |
| 产品是否开源 | 核心平台开源 |
| 核心许可证 | Apache 2.0 |
| 自托管 | 支持Docker Compose |
| 当前开源阶段 | Nightly早期测试,稳定版待发布 |
| 价格核验日期 | 2026年8月22日 |
推荐指数
推荐指数:4.7 / 5。Future AGI把评测、可观测性、护栏、网关、仿真和优化放进一套开源平台,免费额度和不限席位对开发团队很有吸引力。
主要风险是完整开源仓库仍处于Nightly阶段,自托管架构复杂,自动评测与护栏也需要持续校准。生产采用应固定版本并完成恢复、安全和容量测试。
常见问题
Future AGI免费吗?
有无需信用卡的免费Cloud方案,每月包含50 GB、2,000 AI Credits、100,000网关请求、100万文本仿真Token和60分钟语音仿真。
免费额度用完会扣费吗?
免费方案会暂停使用,不会自动产生账单。添加信用卡并启用Pay-as-you-go后才会按公开超额价继续。
Future AGI开源吗?
核心平台已经开源并采用Apache 2.0,但仓库当前标注为Nightly早期测试,企业目录还可能受LICENSE-EE约束。
可以自托管吗?
可以通过Docker Compose部署完整栈,也可在云虚拟机运行。Kubernetes与Helm官方支持仍在路线图中。
提供哪些SDK?
提供Python、TypeScript、Java和C#追踪能力,以及评测、平台、仿真和网关相关Python或TypeScript包。
支持哪些评测?
支持启发式、代码、LLM-as-judge、机器学习、智能体评测代理和人工标注,公开生态提供50多个指标。
BYOK是什么意思?
用户提供自己的模型密钥,Future AGI不收模型裁判的平台调用费,但模型供应商仍会按实际用量收费。
规则护栏收费吗?
15种内置规则护栏永久免费。机器学习Protect和托管评测使用共享AI Credits。
支持语音智能体吗?
支持文本和语音仿真,免费方案每月含60分钟语音,超出部分为0.08美元/分钟。
数据保存多久?
Free和PAYG追踪保留30天,Boost为90天,Scale为1年,Enterprise可定制;数据集与标注永久保存。
提供HIPAA和SSO吗?
Scale提供HIPAA BAA、SAML SSO和SCIM,Boost提供SOC 2 Type II和OAuth SSO,Enterprise增加ABAC等能力。
有MCP服务器吗?
有,可把Future AGI平台与文档接入Cursor或Claude Code等兼容客户端。
自托管完全不发送遥测吗?
不是默认完全无遥测。可关闭周期心跳,但仍会有一次最小统计;完全静默需要在网络层阻断。
适合中国团队吗?
技术接口和自托管适合全球开发团队,但文档主要为英语。涉及中国数据合规时应选择合适部署地区并完成法律评估。
总结
Future AGI适合希望用统一数据闭环提高AI智能体质量的团队,从上线前仿真、离线评测到生产追踪、护栏和提示词优化均有对应模块。
小团队可先使用免费Cloud和BYOK评测,受监管或数据敏感组织可评估自托管。生产环境应注意Nightly阶段、企业许可证边界、遥测、数据保留和复杂组件运维。
桂公网安备45132202000164号