Foundry
免費增值
AI工具大全 AI設計工具

Foundry

Foundry,專注於AI設計的智能工具

標籤:

Foundry是什麼

Foundry是一個專為AI瀏覽器智能體研發團隊所設計的模擬、評估及訓練數據平台。透過可重設的企業級網頁環境,開發者可以在不必依賴不斷變化的真實網站的情況下,對自動化智能體進行測試與訓練。

這裡介紹的是運作在 thefoundryai.com 上的瀏覽器智慧體平台,該平台過去使用的是 foundryrl.com 這個網域名稱,它並非 Microsoft Foundry、Foundry VTT 或其他同名的產品。

一句話介紹

Foundry為瀏覽器智能體提供可重複的網頁仿真、逐動作評估、專家長軌跡數據以及強化學習環境,並能透過Python SDK接入現有的代理。

產品定位

項目Foundry的定位主要用戶
仿真復刻企業網頁和業務狀態智能體平台與研究團隊
評測記錄、分類並評分每一步動作評測、品質和模型團隊
數據生成面向真實企業流程的專家長軌跡監督微調團隊
強化學習在可重設環境中採樣大量軌跡後訓練與Agent RL團隊
排行榜比較標準任務上的成功率與耗時模型選擇和研發決策者

為什麼瀏覽器智能體需要仿真

真實網站會持續改版、更新數據並出現不同帳號狀態,導致同一智慧體在不一時刻面對不同環境。驗證碼、反自動化、速率限制和網路波動還會讓訓練難以重複。

Foundry試圖將網頁、帳戶及業務數據固定在可控制的狀態,如此一來,每次評測都能從相同的起點開始。如此一來,團隊就能將失敗的原因歸咎於智能體本身,而非那些無法解釋的頁面變化。

可復現瀏覽器環境

Simulation模組強調像素級、可重複的瀏覽器環境,並避免頁面偏移、隨機雜訊及外部速率限制。環境可重設至任務初始狀態,適合批量回歸與策略比較。

可重現性帶來的價值

  • 讓不同模型面對相同頁面、數據和任務條件。
  • 失敗後可回放並定位具體界面或策略問題。
  • 升級提示、模型或工具後執行一致的回歸測試。
  • 在不污染真實業務系統的情況下測試寫入操作。
  • 批量採樣軌跡時不受真實站點反自動化機制干擾。

智能體評測

評估模組會追蹤、分類並標記智能體的每個動作。點擊失敗、佈局改變、錯誤操作以及未能達成目標的狀態,都不會僅被簡化為一個最終分數。

核心評測指標

指標含義解讀方式
任務成功率完成目標的執行佔比應結合任務難度和樣本量
平均完成時間成功任務的平均耗時更快不一定更穩健
動作數量完成一次任務使用的步驟過多可能代表繞路或恢復
失敗類型點擊、佈局、誤操作等分類用於定位工程問題
狀態變更網頁與業務數據被如何修改驗證結果而非只看文本
跨環境一致性仿真與真實環境結果相關性判斷仿真保真度

軌跡、事件和狀態記錄

Python SDK範例顯示,開發者可以取得任務提示、起始頁面、登入憑證、支付細節及附加說明,並記錄事件、最終狀態及狀態變更。評測器再將最終結果與標準答案進行比較。

適合保存的運行證據

  • 任務ID、環境版本和智能體版本。
  • 每一步觀察、動作、工具返回和時間。
  • 點擊、輸入、導航和異常事件。
  • 初始狀態、最終狀態及中間狀態變更。
  • 人工標準、自動評分和失敗類別。
  • 模型、提示、採樣參數和成本。

企業級訓練數據

Data模組由專家標註人員生成自訂長軌跡數據,用於真實企業平台及跨應用工作流程。此類數據可用於監督微調,讓模型學習正確的操作順序、欄位判斷以及失敗恢復方式。

長軌跡數據的特點

  • 任務需要跨越多個頁面和應用。
  • 前一步操作會改變後續頁面狀態。
  • 錯誤可能在很多步驟後才暴露。
  • 不僅包含成功路徑,也需要恢復和糾錯示例。
  • 任務結果由業務狀態驗證,而非只有最後一句回答。

強化學習環境

RL模組允許在安全仿真中重複採樣和評估大量軌跡,避免真實網站的驗證碼、封禁以及產生數據風險。開發團隊可據此優化長流程中的信譽分配與錯誤恢復。

適合強化學習的研究問題

  • 如何把最終成功獎勵分配給中間動作。
  • 智能體何時應重試、回退或切換策略。
  • 跨應用工作流中的記憶和狀態追蹤。
  • 複雜表單中的欄位對齊與驗證。
  • 在動作成本、耗時和成功率之間權衡。

SDRBench基準

Foundry公開的SDRBench是一套用於模擬銷售開發代表工作流程的工具,它是一種可重設的瀏覽器基準測試環境,同時也適用於強化學習的訓練。它包含50個確定性任務,且能保留跨應用程式的狀態。

任務涵蓋類似Gmail、Sheets、LinkedIn式的客戶開發,以及Apollo和Salesforce的業務流程,用於研究潛在客戶、進行個性化的外聯活動、管理客戶,並判斷潛在客戶的資格。

基準覆蓋能力

工作階段代表任務需要的智能體能力
線索研究查找公司與聯絡人資訊搜尋、閱讀和證據整合
外聯準備根據線索撰寫個性化內容上下文理解與文案生成
表格管理讀取和更新線索列表結構化數據操作
CRM維護創建、修改和推進記錄權限、字段和狀態判斷
資格判斷根據規則評估潛客多條件推理
跨應用交接在郵件、表格和CRM間傳遞狀態長期記憶和一致性

公開排行榜

排行榜的設計旨在顯示模型、平均成功率以及完成任務的平均時間,同時還能提供流程階段的分析。此外,它還讓團隊能夠提交新的智能體、優化現有的智能體,或是將自身的企業流程納入基準範圍內。

核驗時頁面標註的SDR Automation Benchmark為2025年9月版本,但表格顯示沒有可用的公開成績。目錄正文不應虛構模型排名或成功率。

仿真與真實環境一致性

Foundry建議在仿真環境與真實環境中同時執行任務,並透過成功率相關性、皮爾遜相關係數以及排序一致性來驗證其精確度。此外,該系統還需要檢測真實界面中的偏差,並持續對仿真結果進行校準。

評估仿真是否可信

  1. 選擇一組獲得授權且風險可控的真實業務任務。
  2. 在仿真與真實環境中使用相同智能體和任務定義。
  3. 比較成功率、步驟、耗時和失敗類型。
  4. 計算絕對差異、相關性及模型排序一致性。
  5. 調查差異是來自頁面、數據、網路還是業務規則。
  6. 修訂仿真並重新運行,直到達到預設誤差範圍。

Python SDK接入方式

官網範例透過AWE環境對象來建立任務並執行它,進而取得任務與CDP的連線地址,再將瀏覽器會話交給已有的智慧體。執行後可讀取最終狀態、狀態變更以及相關事件。

接入流程

  1. 申請私有測試並取得平台帳戶、任務和密鑰。
  2. 在隔離開發環境安裝平台提供的Python SDK。
  3. 使用任務ID創建AWE環境並開啟事件記錄。
  4. 讀取任務說明並把瀏覽器連接地址交給智能體。
  5. 運行智能體並等待其提交或達到終止條件。
  6. 獲取最終狀態、狀態變更、事件和軌跡。
  7. 使用標準答案或業務啟發式計算分數。

建立回歸評測教學

  1. 按業務價值、難度和風險選擇代表性任務集。
  2. 凍結任務輸入、初始狀態、驗收條件和環境版本。
  3. 為成功、部分成功、錯誤修改和超時定義評分。
  4. 記錄模型、提示、工具版本、參數和隨機種子。
  5. 多次運行以計算均值、波動和置信區間。
  6. 按失敗類型定位提示、視覺、規劃或執行問題。
  7. 把閾值接入發布流程,阻止明顯退化版本上線。

構建訓練數據教學

  1. 確定目標平台、使用者角色、權限和高價值流程。
  2. 將工作流程拆分成可驗證的初始狀態、步驟和結果。
  3. 由獲得授權的專家執行並記錄完整軌跡。
  4. 標註觀察、動作、欄位、理由、錯誤和恢復。
  5. 移除真實個人資訊、金鑰與客戶機密。
  6. 透過雙人核對和自動規則檢查軌跡品質。
  7. 劃分訓練、驗證和測試集,防止任務洩漏。

提交智能體評測教學

  1. 確認私有測試資格並閱讀當前提交要求。
  2. 固定智能體版本、模型、工具和運行參數。
  3. 使用測試金鑰驗證連接、終止和錯誤處理。
  4. 提交智能體並讓平台運行標準任務。
  5. 查看成功率、耗時、動作和失敗標籤。
  6. 按失敗階段修復並在同一環境中複測。
  7. 對外公佈成績時同時說明版本、日期和方法。

適合哪些用戶

  • 瀏覽器智能體公司:需要穩定評測產品升級。
  • 大模型團隊:訓練網頁理解與操作能力。
  • Agent RL團隊:需要可重設、可規模化的環境。
  • 企業自動化團隊:驗證智慧體能否安全操作內部系統。
  • 數據團隊:採購或製作高品質長軌跡數據。
  • 研究機構:分析跨應用規劃、恢復和信譽分配。
  • 模型評測團隊:建立帶狀態證據的瀏覽器基準。

典型使用場景

  • 比較不同模型在同一企業流程中的成功率。
  • 回歸測試提示、工具或瀏覽器執行器升級。
  • 定位智能體在哪一步點擊、輸入或判斷失敗。
  • 訓練跨郵件、表格、客戶開發和CRM的代理。
  • 在不觸碰生產數據時測試寫入型任務。
  • 生成監督微調與強化學習軌跡。
  • 把客戶的專有工作轉化為內部基準。
  • 評估網頁是否便於自動化智能體使用。

產品優勢

  • 環境可重設,便於公平比較不同智能體。
  • 從最終狀態和狀態變更驗證任務,而非只看回答。
  • 逐動作事件分類有助於定位真實失敗原因。
  • 仿真避免真實網站驗證碼、封禁和速率限制。
  • 同時覆蓋評測、數據和強化學習訓練鏈路。
  • 支援長流程、跨應用及企業SaaS工作流。
  • Python SDK可接入已有瀏覽器智能體框架。
  • SDRBench提供公開的任務設計與研究入口。

使用限制與注意事項

  • 平台仍處於私有測試,需要申請訪問。
  • 官網沒有公開固定套餐、免費額度或按量價格。
  • 樣本資料集頁面標為即將推出,不能視為已開放下載。
  • 公開排行榜核驗時沒有顯示可用模型成績。
  • 仿真永遠可能與真實網站存在視覺、延遲和規則差異。
  • 企業專有環境和人工軌跡可能涉及較高製作成本。
  • 真實帳戶、登入憑證和支付細節屬於高敏感資訊。
  • 基準成績只代表指定任務和版本,不能證明通用自主能力。
  • Python SDK可使用不代表平台、環境或資料開源。
  • 沒有發現官方公開的GitHub倉庫或明確的開源許可證。
  • 隱私政策並未為各類數據規定固定的保留期限。

價格與接入方式

項目當前狀態費用說明
官網瀏覽公開免費查看產品介紹、研究和排行榜
排行榜瀏覽公開無需付費,但目前未顯示成績數據
私有測試申請訪問未公開固定價格
完整平台申請訪問按團隊、環境、任務和規模洽談
自訂企業仿真企業服務需根據網站與工作流報價
專家訓練數據企業服務按領域、軌跡長度和品質要求報價
智能體提交評測聯絡團隊公開頁未列收費規則
樣本資料集即將推出尚無公開價格或可用下載

價格核驗日期為2026年8月22日。Foundry尚未公佈標準訂閱、按運行計費或企業合約的價格,因此無法根據其他同名的Foundry產品來填寫價格。

報價時需要確認什麼

報價變數需要確認的內容可能影響成本的原因是
環境數量需要仿真的企業應用和版本每個應用都需建模與維護
任務規模任務數、難度、平均步驟和狀態長任務運行與標註更多
併發與次數每日或每月軌跡、併發和峰值影響計算和瀏覽器資源
數據服務是否需要專家演示、複核和糾錯人工質量成本差異大
保真度視覺、行為、數據和延遲要求高保真需要更多校準
部署與安全共享、專用或私有環境隔離和合規要求影響架構
支持SLA、回應、訂製和研究協助企業支持通常單獨定價

支援平台與技術介面

平台或介面支援狀態用途
Web官網支持產品介紹、申請和研究內容
仿真瀏覽器環境支持運行和重設網頁任務
Python SDK私有測試提供接入現有智能體工作流
CDP瀏覽器連接示例顯示支援讓智能體控制任務瀏覽器
事件與狀態介面示例顯示支援讀取事件、最終狀態和變更
公開排行榜支持展示標準基準與方法
獨立桌面或行動應用未發現產品主要面向研發與企業接口
公開自助控制台未發現完整能力需私有測試資格

API密鑰與憑證安全

SDK範例需要Foundry金鑰,任務還可能包含登入憑證和支付細節。團隊應使用測試帳戶、虛構的支付工具以及隔離式的金鑰管理系統,切勿讓實際的生產用憑證進入訓練集或日誌中。

  • 為每個環境和團隊使用獨立、可輪換的密鑰。
  • 只給測試帳戶授予完成基準所需的權限。
  • 日誌和軌跡中屏蔽密碼、令牌、支付及個人字段。
  • 禁止智能體訪問任務範圍外的域名和網路。
  • 設定運行超時、動作上限和緊急終止。
  • 對數據導出和排行榜發布增加審批。
  • 定期銷毀過期的憑證以及已完成專案的測試數據。

隱私與資料收集

隱私政策所列出的使用者提交的資訊包括電子郵件地址、姓名、所屬組織、由智慧體提交的資料、基準結果以及溝通內容。而自動收集的資訊則包括使用分析資料、裝置資訊、IP位址、Cookie、效能指標以及錯誤日誌。

這些數據用於運營服務、處理智能體提交的資料、產生基準結果、改進產品,以及支援溝通與安全。託管、分析與客服服務商在履行職責時,也可能處理相關數據。

排行榜公開與保密

政策說明:智慧體的表現及基準結果可能會顯示在公開排名榜上,但在未獲得明確同意的情況下,個人身份資訊是不會被公開的。企業仍應在提交之前確認,智慧體的名稱、模型設定以及失敗過程是否會被公開。

數據保留、跨境與權利

個人資訊會被保留到提供服務及達成相關政策目標所需的期間,或根據法律要求而延長保存時間;並未規定固定的天數。這些資料可能會被傳輸到其他國家進行處理,此時必須採取適當的資料保護措施。

根據所在地,用戶可請求訪問、更新、刪除、限制或反對處理,亦可要求數據的攜帶及撤回同意。本服務不適用於13歲以下的兒童。

GitHub、SDK與開源狀態

官網明確展示了Python SDK的接入範例,但沒有找到經官方確認的公開GitHub倉庫、軟體包頁面或開源許可證。SDK可能僅向私有測試客戶發放。

項目公開狀態結論
Foundry平台閉源企業服務產品本身不開源
Python SDK官網展示,需獲取訪問公開頁未說明許可證
SDRBench論文公開可讀論文公開不等於環境代碼開源
樣本資料集標記即將推出不能按已發布處理
官方GitHub未發現可確認倉庫不要混淆微軟或其他同名項目
仿真環境代碼未公開無法僅憑官網自行部署

與Microsoft Foundry的差異

對比項本頁FoundryMicrosoft Foundry
運營主體獨立的瀏覽器智慧體平台團隊Microsoft
核心用途網頁仿真、評測、數據和強化學習構建、部署與治理企業AI應用和智能體
主要介面私有Python SDK和仿真瀏覽器Azure雲平台、SDK和服務
價格私有測試、未公開按具體Azure服務與資源計費
SDRBench官方研究基準不是其產品組成
官網域名thefoundryai.com微軟雲服務體系

基本資訊

項目內容
工具名稱Foundry
曾用品牌域名foundryrl.com
工具類型瀏覽器智能體仿真、評測、數據與強化學習平台
核心引擎Agent Web Engine
公開基準SDRBench
任務規模SDRBench包含50個確定性任務
接入狀態私有測試
價格模式未公開,申請訪問與企業洽談
主要平台Web、仿真瀏覽器和Python SDK
開發語言官網示範為Python
公開API未提供完整公開自助文件
官方SDK提供Python SDK訪問路徑
產品是否開源不開源
官方GitHub未確認
隱私政策更新日期2025年10月28日
價格核驗日期2026年8月22日

推薦指數

推薦指數:4.1 / 5。Foundry針對瀏覽器智能體最難解決的環境漂移、長軌跡評測及訓練資料問題提供完整的解決方向,適合專業Agent研發團隊。

主要不足是仍為私有測試、價格和完整文件未公開、排行榜暫無可用成績。普通用戶和只想運行網頁自動化的企業不會直接受益。

常見問題

Foundry是做什麼的?

它為瀏覽器智能體團隊提供可重設的網頁仿真環境、運行評測功能、專家長軌跡數據,以及強化學習訓練環境。

這是Microsoft Foundry嗎?

不是。本頁產品由獨立團隊運營,專注於瀏覽器智能體的仿真與評測,與微軟同名的雲平台不同。

Foundry免費嗎?

官網可免費瀏覽,但完整平台處於私有測試,未公佈免費額度、標準套餐或固定企業價格。

怎樣獲得使用權限?

需要在官網申請私有測試或聯繫團隊,說明智能體、任務、環境、軌跡量及數據需求。

提供Python SDK嗎?

提供接入路徑,官網展示了使用AWE環境、任務ID、瀏覽器連接以及事件讀取的Python範例。

SDRBench是什麼?

它是一個用於銷售開發工作流程的、可重設的瀏覽器基準以及強化學習訓練場,其中包含50個具有確定性的跨應用程式任務。

排行榜有模型成績嗎?

排行榜具備模型、成功率與耗時欄位,但核驗時頁面顯示沒有可用基準成績,因此無法給出排名。

可以評測自有智能體嗎?

可以申請提交智能體,也可聯絡團隊把自己的資料集或企業工作流用於基準。具體資格和費用未公開。

可以在真實網站上訓練嗎?

Foundry的重點在於受控仿真,以避免真實網站的變動以及自動化相關的限制。仿真結果仍需在獲得授權的真實環境中進行驗證。

能生成訓練數據嗎?

可以提供專家標註的自訂長軌跡數據,用於真實企業平台的監督微調。具體規模、品質標準及價格需另行協商。

Foundry是開源的嗎?

不開源。論文和SDK範例可公開查看,但沒有找到官方開源平台的代碼、仿真環境或明確的許可證。

樣本資料集可以下載嗎?

核驗時樣本資料集仍標為即將推出,不能視為已經開放。

會公開提交結果嗎?

隱私政策說明:智慧體的表現與基準結果可能會出現在公開排行榜上。提交前應確認哪些資料屬於公開範圍,哪些則需保密。

數據保存多久?

隱私政策僅規定為了完成服務目的或符合法律要求所需的時間,並未設定固定的資料保存天數。企業合約應針對不同情況分別作出約定。

適合普通網頁自動化用戶嗎?

通常不適合。它面向構建、訓練和評測瀏覽器智能體的專業團隊,而不是讓普通用戶直接錄製網頁流程。

總結

Foundry將網頁環境、狀態、事件、評分以及訓練軌跡整合在相同的基礎設施中,這有助於瀏覽器智能體團隊建立穩定、可比較且可重複的研發循環。SDRBench則展示了跨應用程式的長期流程發展方向。

有意採用的團隊應先申請私有測試,用自己的代表任務驗證仿真與真實環境的一致性,並在合同中確認價格、資料保密、結果公開、憑據隔離、保留期限和SDK許可證。

©️版權聲明:若無特殊說明,本站所有文章版權均歸AI工具分享本網站的內容為原創作品,任何人或機構在未獲許可的情況下,都不得轉載、抄襲或以其他方式複製並發表本網站的內容,亦不得在非本網站所屬的伺服器上建立其鏡像版本。否則,本網站將依法追究相關責任人的法律責任。

類似於Foundry的工具