未來的AGI是什麼
Future AGI是一個用於建構、測試、監控及改進LLM應用程式及AI智能體的端到端平台。它將模擬、評估、防護機制、追蹤功能、網關、資料集以及提示詞優化等要素整合為一個完整的反饋循環。
平台既提供託管雲服務,也公開了可自託管的核心代碼。工程師、產品經理和領域專家可以在同一個專案中查看品質、成本、延遲、錯誤以及人工標註的資訊。
一句話介紹
Future AGI協助團隊在上線前模擬AI智能體,上線後追蹤與評測,並以即時護欄與生產反饋持續修正提示詞和代理流程。
六大產品模組
| 模組 | 核心能力 | 主要輸入 | 主要結果 |
|---|---|---|---|
| Build | Agent Playground、Prompt和Dataset | 提示詞、工具、數據 | 代理定義與版本 |
| Command Center | 路由、緩存、護欄和成本控制 | 模型請求 | 統一模型響應與治理 |
| Simulate | 合成用戶與測試場景 | 人物、腳本、資料集和圖 | 文本或語音會話 |
| Evaluate | 啟發式、代碼、模型裁判和Agentic評測 | 資料集、追蹤或即時輸入 | 分數、解釋和失敗標籤 |
| Observe | 追蹤、會話、錯誤流和儀表板 | 生產跨度與事件 | 調用圖、成本、延遲和異常 |
| Optimize | 提示詞和智能體優化 | 生產追蹤和評測結果 | 改進版本與實驗 |
AI智能體仿真
Simulate可用預設或自訂人物,在上線前運行多輪文本與語音會話。場景可由腳本、資料集或圖結構定義,並保留轉錄、會話對比和追蹤結果。
仿真適合測試什麼
- 正常用戶從提問到任務完成的完整流程。
- 模糊、矛盾、越權和提示注入輸入。
- 工具失敗、超時、重複呼叫和部分數據缺失。
- 不同語言、語氣、背景和知識水平的人物。
- 語音中斷、沉默、口音和識別錯誤。
- 長會話中的記憶、狀態和目標漂移。
多類型AI評測
Evaluate支援啟發式指標、代碼評測、LLM-as-judge以及智能體評測代理。公開倉庫列出了50多個指標,包括事實依據、幻覺、工具使用正確性、個人資訊以及語氣。
評測方式對比
| 評測方式 | 特點 | 成本 | 適合任務 |
|---|---|---|---|
| 啟發式 | BLEU、ROUGE、正則等確定規則 | 平台永久免費 | 格式、詞面和明確規則 |
| 代碼評測 | 運行自訂程式判斷結果 | 按AI Credits計次 | 結構化業務邏輯 |
| LLM-as-judge | 模型按標準評價開放結果 | 託管模型用信用點;BYOK平台費為0 | 品質、語氣和複雜標準 |
| Agentic Eval | 專用代理定位RAG、工具、提示和錯誤 | 使用AI Credits | 多步驟智能體 |
| 人工標註 | 領域人員給出標籤和複核 | 平台不按席位收費 | 高風險與金標準 |
生產追蹤與可觀測性
Observe基於OpenTelemetry來接收LLM及智能體的追蹤資料,並顯示跨度圖、會話、終端用戶、延遲時間、令牌以及成本等資訊。該系統支援11種跨度類型、70多種篩選條件,還具備全文搜尋功能。
traceAI集成
traceAI為50多個AI框架提供自動插樁功能,涵蓋LangChain、LangGraph、LlamaIndex、CrewAI、AutoGen、DSPy等。Python、TypeScript、Java和C#皆有相應的接入方式。
實時護欄Protect
Protect能夠偵測個人資訊、金鑰、越獄行為、提示注入、惡意程式以及其他不安全的內容。15種規則式的防護功能可永久免費使用,而基於機器學習的Protect功能則需根據AI Credits來計費。
護欄運行模式
| 模式 | 行為 | 適合階段 |
|---|---|---|
| Enforce | 達到閾值時攔截或修正 | 生產高風險入口 |
| Monitor | 檢測並記錄但不立即阻斷 | 上線初期與閾值調優 |
| Log | 僅保存檢測結果 | 離線分析與審計 |
| Protect Flash | 較低延遲,約1至3信用點 | 高頻實時檢查 |
| Protect Full | 更完整檢查,約3至8信用點 | 複雜或高風險內容 |
| External BYOK | 連接Lakera、Presidio、Llama Guard等 | 已有安全供應商 |
Agent Command Center
Command Center是一個兼容OpenAI介面的LLM網關,能夠在100多個模型供應商之間進行資料路由。它具有自動故障轉移、重試功能,同時還提供虛擬金鑰、預算控制、流量限制、成本追蹤,以及精確或基於語義的快取功能。
網關適合解決的問題
- 統一管理不同模型供應商的金鑰和請求。
- 按延遲、成本、權重或可用性進行路由。
- 供應商故障時自動切換並重試。
- 透過快取減少重複呼叫和模型費用。
- 為組織、團隊、用戶和虛擬金鑰設定預算。
- 在請求或回應路徑中執行即時護欄。
資料集、實驗與人工標註
平台支援以手動方式、CSV、PDF、Hugging Face及SDK等格式來建立資料集,並提供14種不同的欄位類型。資料集與實驗的數量沒有限制,且所有Cloud方案都會永久保存這些資料集及標註內容。
免費和按量方案提供3個標註隊列,Boost提供10個,Scale及更高方案不限制。標籤支援數值、文本、分類、星級和讚踩。
提示詞與Agent Playground
Prompt模組支援模板、版本、標籤和資料夾,Prompt Playground可使用內建模型金鑰免費運行。Agent Playground則提供可視化圖表建立、工具調用以及輸出格式驗證的功能。
Falcon AI
Falcon AI可分析追蹤與評估、聚類錯誤、產生洞察、自動標籤以及效能報告。它與其他託管AI功能共享每月2,000個免費的AI Credits。
提示詞與智能體優化
Optimize可將生產追蹤與評測結果反饋至提示詞的改進,並提供GEPA、PromptWizard、ProTeGi、Bayesian、Meta-Prompt和Random等算法。改進版本仍需在獨立測試集上驗證。
建立首個追蹤教學課程
- 註冊Cloud或部署自託管實例並創建專案。
- 選擇Python、TypeScript、Java或C#插樁包。
- 配置項目名、端點及安全保存的認證資訊。
- 為所用模型或框架啟用對應Instrumentor。
- 運行一條測試請求並檢查跨度圖、令牌和延遲。
- 添加用戶、會話、版本和環境等業務屬性。
- 配置錯誤篩選、儀表盤和告警。
創建評測教學
- 把代表性輸入、標準答案和業務條件整理成資料集。
- 先用正則或啟發式指標檢查確定性要求。
- 為開放品質編寫清晰量表和失敗示例。
- 選擇BYOK模型裁判或託管Turing評測。
- 加入工具、RAG和提示錯誤定位代理。
- 用人工標註樣本校準自動分數和閾值。
- 把關鍵評測加入持續集成和生產抽樣。
設定網關與護欄教學
- 添加模型供應商並創建最小權限的虛擬金鑰。
- 配置主模型、備用模型、重試和超時。
- 選擇緩存後端並確定不能緩存的敏感請求。
- 開啟個人資訊、金鑰和提示注入規則護欄。
- 先用Monitor觀察誤報和漏報,再設定Enforce閾值。
- 按組織、團隊、用戶和金鑰配置預算與限流。
- 監控成本、失敗、緩存命中和護欄延遲。
Docker自託管教學
- 準備Docker Engine或Docker Desktop及Compose。
- 克隆官方future-agi倉庫並閱讀安裝與安全說明。
- 使用安裝腳本生成配置並拉取已發布鏡像。
- 為生產環境生成獨立金鑰並固定鏡像版本。
- 啟動PostgreSQL、ClickHouse、Redis、RabbitMQ和Temporal等組件。
- 限制網路入口、啟用備份並配置監控。
- 先在非生產環境驗證升級、恢復和遙測設定。
適合哪些用戶
- AI應用工程師:追蹤模型、工具和智能體調用。
- 評測團隊:建立離線、持續和生產品質測試。
- RAG團隊:檢測事實依據、幻覺和檢索問題。
- 語音智能體團隊:模擬人物、場景和通話。
- 安全團隊:配置個人資訊、注入與內容護欄。
- 平台工程團隊:統一路由、金鑰、緩存和成本。
- 產品與領域專家:使用資料集和標註隊列參與審核。
- 受監管企業:透過自託管控制數據位置和基礎設施。
典型使用場景
- 上線前模擬客服智慧體的正常與攻擊會話。
- 持續評測RAG回答是否有依據和幻覺。
- 追蹤多智能體中每個工具的延遲、成本和失敗。
- 透過網關在多個模型供應商間故障轉移。
- 在生產響應前攔截個人信息及提示注入。
- 從錯誤追蹤生成標註隊列和回歸數據集。
- 比較不同模型、提示詞和代理版本。
- 在企業網路內部部署完整評測與可觀測平台。
產品優勢
- 覆蓋仿真、評測、追蹤、護欄、網關和優化完整鏈路。
- Cloud免費額度較高且團隊成員與專案數量不限。
- 啟發式評測、BYOK模型裁判和規則護欄平台的費用為0。
- OpenTelemetry及相容的OpenAI介面可降低接入限制。
- 支援100多個模型供應商和50多個AI框架。
- 核心平台採用Apache 2.0且可Docker自托管。
- 資料集和標註在Cloud所有方案中永久保存。
- 按儲存、信用點、網關、緩存和仿真分別計費。
使用限制與注意事項
- 開源倉庫目前標記為Nightly早期測試版,穩定版尚未發布。
- 自託管包含多個資料庫、隊列和運行組件,運維成本不低。
- 官方Kubernetes與Helm支援仍在路線圖中。
- AWS Marketplace仍標記為即將推出。
- 自動評測和模型裁判可能有偏差,必須用人工樣本校準。
- 護欄會產生誤報和漏報,高風險決策不能只依賴自動攔截。
- BYOK平台費為0不代表模型供應商調用免費。
- Cloud免費和按量方案的追蹤數據只保留30天。
- 資料集永久保存可能增加儲存費,也需要主動刪除敏感資料。
- 自託管預設包含部署遙測,完全無外聯需在網路邊界阻斷。
Cloud免費額度
| 計費維度 | 每月免費額度 | 超額基礎價 | 說明 |
|---|---|---|---|
| 追蹤與儲存 | 50 GB | 50至500 GB為2美元/GB | 包含跨度、評測和會話 |
| AI Credits | 2,000 | 10美元/1,000點 | 評測、Protect和Falcon共享 |
| Gateway Requests | 100,000次 | 5美元/100,000次起 | 按用量自動階梯降價 |
| Cache Hits | 100,000次 | 1美元/100,000次起 | 與網關請求分開計費 |
| Text Simulation | 100萬Token | 2美元/100萬Token起 | 超過1,000萬後更低 |
| Voice Simulation | 60分鐘 | 0.08美元/分鐘 | 與文本仿真分開 |
追蹤與網關階梯價格
| 產品 | 用量區間 | 價格 |
|---|---|---|
| Storage | 前50 GB | 免費 |
| Storage | 50至500 GB | 2美元/GB |
| Storage | 500 GB至2 TB | 1.50美元/GB |
| Storage | 2 TB以上 | 1美元/GB |
| Gateway | 前100,000次 | 免費 |
| Gateway | 100,000至1,000,000次 | 5美元/100,000次 |
| Gateway | 1,000,000至10,000,000次 | 4美元/100,000次 |
| Gateway | 10,000,000次以上 | 2.50美元/100,000次 |
平台附加套餐
| 方案 | 價格 | 數據保留 | 合規與身分 | 隊列和監控 | 支持 |
|---|---|---|---|---|---|
| Free或PAYG | 0美元起加按量 | 30天 | 基礎帳戶 | 3隊列、3監控 | 社區或郵件 |
| Boost | 250美元/月 | 90天 | SOC 2 Type II、OAuth SSO、審計日誌 | 10隊列、15監控、5知識庫 | 48小時郵件 |
| Scale | 750美元/月 | 1年 | HIPAA BAA、SAML SSO、SCIM | 不限隊列和監控 | 24小時郵件與Slack |
| Enterprise | 2,000美元/月 | 訂製 | ABAC、資料遮罩及Scale全部功能 | 自訂限制 | 專屬工程師和CSM |
價格核驗日期為2026年8月22日。按量方案可設定帳單告警和硬上限,免費方案達到額度後將暫停服務,且不會自動產生超額帳單。
自託管成本
開源自託管沒有雲端訂閱費用,但需要支付伺服器、資料庫、對象儲存、備份、升級、監控、安全以及人員的相關成本。若使用外部模型和防護服務供應商,則仍需額外支付費用。
| 自託管組件 | 主要用途 | 運維注意 |
|---|---|---|
| Python與Django | 平台後端 | 版本、進程和漏洞更新 |
| Go Gateway | 模型路由和請求治理 | 高可用、限流和金鑰 |
| React前端 | Web控制台 | 構建與訪問控制 |
| PostgreSQL | 元數據 | 備份和遷移 |
| ClickHouse | 跨度和時序數據 | 容量和保留策略 |
| Redis | 狀態與緩存 | 持久化與記憶體 |
| RabbitMQ與Temporal | 任務與工作流 | 積壓、重試和恢復 |
支援語言、SDK與整合
| 類別 | 支持內容 | 用途 |
|---|---|---|
| 客戶端語言 | Python、TypeScript、Java、C# | 追蹤和平台接入 |
| 評測SDK | Python與TypeScript | 50多個指標與護欄 |
| 平台SDK | Python | 資料集、提示詞、知識庫和實驗 |
| Gateway SDK | Python與TypeScript | 模型路由和緩存 |
| 模型供應商 | OpenAI、Anthropic、Gemini、Bedrock、Azure等100多個 | 統一調用 |
| Agent框架 | LangChain、LlamaIndex、CrewAI、AutoGen、DSPy等 | 自動插樁 |
| 語音平台 | VAPI、Retell、LiveKit、Pipecat | 語音仿真 |
| 向量資料庫 | Pinecone、Weaviate、Chroma、Milvus、Qdrant、pgvector | RAG與知識庫 |
| MCP | 提供服務端 | 在Cursor或Claude Code中訪問平台和文件 |
開源、自託管與許可證
Future AGI的完整核心平台倉庫採用Apache License 2.0,可檢查評測器、提示詞、追蹤及網關代碼,並能透過Docker Compose自主托管。該倉庫同時包含LICENSE-EE,使用企業功能前仍應檢查目錄邊界。
futureagi-sdk、Agent Command Center SDK等官方倉庫也採用Apache 2.0,部分生態套件可能使用Apache或MIT。每個獨立軟體套件仍需核對自己的許可證文件。
| 項目 | 開放狀態 | 許可證或階段 |
|---|---|---|
| Future AGI核心平台 | 源碼公開、自託管 | Apache 2.0核心;目前為Nightly測試版本 |
| futureagi SDK | 公開 | Apache 2.0 |
| traceAI | 公開 | 按倉庫許可證使用 |
| ai-evaluation | 公開 | Python與TypeScript |
| Command Center SDK | 公開 | Apache 2.0 |
| 雲端託管服務 | 商業服務 | 按免費、按量及附加套餐計費 |
| 企業功能 | 部分商業能力 | 檢查LICENSE-EE和合約 |
部署選項
| 部署方式 | 當前狀態 | 說明 |
|---|---|---|
| Future AGI Cloud | 正式提供 | 免運維並按用量計費 |
| Docker Compose | 提供 | 從倉庫拉取鏡像自託管 |
| Production Compose Overlay | 提供 | 生成密鑰並固定鏡像 |
| AWS、GCP、Azure VM | 可用 | 在虛擬機運行Compose |
| Air-gapped與本地部署 | 提供企業路徑 | 無回傳需求需聯繫銷售 |
| Kubernetes與Helm | 即將推出 | 不能寫成當前正式支援 |
| AWS Marketplace | 即將推出 | 尚未正式可用 |
遙測與隱私
自託管預設會發送一次註冊資訊以及定期的心跳遙測資料,其中可能包含實例ID、版本、部署類型、管理員電子郵件及域名,以及匿名統計的使用量;不會發送追蹤資料、提示詞或API密鑰。
可以透過環境設定來關閉週期性的心跳訊息,但即使關閉後,仍會發送一次不包含電子郵件地址的最簡單統計資料。若需要完全沒有外部連線的環境,則應在網路邊界處進行阻斷。
Cloud隱私與刪除
隱私政策列出了姓名、電子郵件地址、所屬組織、電話號碼,以及 IP 位址、瀏覽器類型、訪問過的頁面和診斷數據。這些資訊用於服務提供、客戶支援、分析、安全保障及通知之用,個人身份資訊不會被出售。
用戶可請求訪問、更正、刪除、限制、反對及攜帶,刪除申請在30天內處理。法律、爭議及匿名統計可能構成保留例外。
基本資訊
| 項目 | 內容 |
|---|---|
| 工具名稱 | Future AGI |
| 運營公司 | Future AGI Inc. |
| 工具類型 | AI智能體評測、可觀測性、護欄、仿真與網關 |
| 價格模式 | 免費、按量、附加套餐和企業服務 |
| 免費要求 | 無需信用卡 |
| 團隊與專案 | 所有Cloud方案不限成員和項目 |
| 主要平台 | Web Cloud、API、SDK和Docker自託管 |
| 公開API | 提供 |
| 官方SDK | Python、TypeScript、Java和C#等 |
| 產品是否開源 | 核心平台開源 |
| 核心許可證 | Apache 2.0 |
| 自託管 | 支援Docker Compose |
| 當前開源階段 | Nightly早期測試,穩定版待發布 |
| 價格核驗日期 | 2026年8月22日 |
推薦指數
推薦指數:4.7 / 5。Future AGI將評測、可觀測性、護欄、網關、模擬與優化整合在一個開源平台上,免費額度且無使用人數限制,對開發團隊而言非常有吸引力。
主要風險在於,完整的開源倉庫仍處於Nightly階段,自託管架構相當複雜,且自動評測與防護機制也需持續校準。在正式投入使用時,必須使用固定版本,並完成恢復、安全及容量方面的測試。
常見問題
Future AGI免費嗎?
有無需信用卡的免費Cloud方案,每月包含50 GB、2,000 AI Credits、100,000網關請求、100萬文本仿真Token和60分鐘語音仿真。
免費額度用完會扣費嗎?
免費方案會暫停使用,不會自動產生帳單。添加信用卡並啟用Pay-as-you-go後才會按公開的超額價繼續計費。
未來的AGI會開源嗎?
核心平台已經開源並採用Apache 2.0,但倉庫目前標註為Nightly早期測試,企業目錄還可能受LICENSE-EE約束。
可以自託管嗎?
可以透過 Docker Compose 來部署完整的應用程式堆疊,也可以在雲端虛擬機上運行。至於 Kubernetes 與 Helm 的官方支援,則仍在規劃中。
提供哪些SDK?
提供Python、TypeScript、Java和C#追蹤功能,以及評測、平台、仿真和網關相關的Python或TypeScript套件。
支持哪些評測?
支援啟發式、代碼、LLM-as-judge、機器學習、智能體評測代理和人工標註,公開生態提供50多個指標。
BYOK是什麼意思?
用戶提供自己的模型密鑰,Future AGI不收模型裁判的平台調用費,但模型供應商仍會按實際用量收費。
規則護欄收費嗎?
15種內建規則護欄永久免費。機器學習Protect及託管評測需使用共享AI Credits。
支援語音智能體嗎?
支援文字與語音仿真,免費方案每月含60分鐘語音,超出部分為0.08美元/分鐘。
數據保存多久?
Free和PAYG的追蹤記錄會保存30天,Boost為90天,Scale則為1年,Enterprise版可自行設定;而資料集與標註則會永久保存。
提供HIPAA和SSO嗎?
Scale提供HIPAA BAA、SAML SSO和SCIM,Boost提供SOC 2 Type II和OAuth SSO,Enterprise則增加了ABAC等功能。
有MCP伺服器嗎?
有,可將Future AGI平台與文件接入Cursor或Claude Code等相容客戶端。
自託管完全不發送遙測嗎?
並非預設就完全沒有遙測功能。可以關閉週期性的心跳傳送,但仍然會有最低限度的統計資料;若要完全無訊號傳輸,則需要在網路層面進行阻斷。
適合中國團隊嗎?
技術介面與自託管適合全球開發團隊,但文件主要以英語為主。若涉及中國的資料合規問題,應選擇合適的部署地區並完成法律評估。
總結
Future AGI適合希望透過統一數據閉環來提升AI智能體品質的團隊,從上線前的模擬、離線評測到生產追蹤、護欄及提示詞優化,皆有相應的模組。
小型團隊可先使用免費的 Cloud 和 BYOK 進行測試,而那些受到監管或處理敏感資料的組織,則可考慮自行托管的方式。在實際運作環境中,則需注意每晚的更新過程、企業許可證的範圍、遠端監控、資料保留以及複雜組件的維運問題。
桂公網安備45132202000164號