Ask On Data是什麼
Ask On Data是一種以聊天互動作為介面的生成式AI數據工程工具,使用者可以透過自然語言來描述數據遷移、清洗、連接、轉換和調度等需求。它適用於數據工程師、分析師、數據科學家,以及那些希望減少編碼工作的業務用戶。
該產品的定位更接近於由AI驅動的ETL及資料管道平台,而非僅能將自然語言轉換成查詢語句的資料庫問答工具。該平台同時保留了SQL、Python和YAML等專業的控管方式,方便技術人員處理複雜的邏輯與邊緣情況。
主要功能
- 自然語言建管道:透過英文對話描述資料處理需求,由系統生成相應的資料管道步驟。
- 資料整合:支援合併、連接、遷移以及不同來源之間的資料流轉。
- 資料清洗與整理:處理缺失值、格式、欄位及其他資料品質問題。
- 資料轉換:完成自訂計算、欄位衍生及業務規則轉換。
- 即時資料預覽:每次提交轉換指令後查看結果樣本,在運行正式任務前交叉檢查。
- 操作歷史與撤銷:查看工作流中的歷史動作,並在發現錯誤時撤銷修改。
- 任務編排與調度:設定完整載入、增量載入或清空後重載,並按指定頻率運行。
- 代碼控制:需要精細調整時,可編寫SQL、Python或編輯YAML設定。
- 自訂Spark邏輯:在任務調度階段加入Apache Spark程式碼以處理特殊需求。
支援的資料來源
官網說明,該平台能處理來自資料庫、資料倉庫、資料湖、介面、平面檔案以及日誌等各種來源的資料,並且允許使用者提出自訂的資料來源需求。不過,不同套餐所支援的資料來源範圍並不相同。
| 數據來源 | 適合處理的內容 | 使用前需要確認 |
|---|---|---|
| Excel與CSV | 本地表格、導出數據和小型數據集 | 雲端免費版僅支援這兩類檔案且有容量限制 |
| 關係型資料庫 | 業務庫、訂單庫和分析庫 | 驅動、網路、權限及讀寫範圍 |
| 資料倉庫與資料湖 | 大規模歷史數據和分析數據 | 連接器、計算資源和目標表策略 |
| API | 第三方系統和在線服務數據 | 認證、頻率限制和字段變化 |
| 日誌及其他檔案 | 應用日誌和批次檔案 | 格式解析、編碼和異常數據處理 |
資料管道如何工作
- 選擇或連接資料來源,並設定存取憑證與最低必要權限。
- 讓平台載入數據預覽,先確認欄位、類型和樣本是否正確。
- 用自然語言描述連接、清洗、計算或轉換步驟。
- 逐步檢查每條指令後的數據預覽和操作歷史。
- 需要時查看並修改生成的YAML、SQL或Python邏輯。
- 確定目標資料來源、寫入方式及失敗處理規則。
- 設定手動觸發或定時任務,並選擇全量或增量策略。
- 運行小規模測試,核對結果後再處理正式數據。
適合哪些使用場景
- 資料遷移:將檔案、資料庫或其他系統中的資料搬移到目標平台。
- 資料清洗:統一欄位格式、修正異常值並準備可分析的資料集。
- 資料整合:透過連接或合併多個業務系統的資料。
- 報表預處理:在進入BI工具前完成轉換、聚合和口徑整理。
- 機器學習準備:為模型訓練生成清洗和特徵處理後的數據。
- 定時同步:以小時、每天或其他頻率來執行重複的資料更新任務。
- 管道原型:透過聊天快速驗證轉換思路,再由工程師完善生產配置。
適合哪些用戶
- 資料工程師:快速生成管道雛形,並透過程式碼和設定進行精細控制。
- 資料分析師:減少簡單的資料準備工作,將更多時間用於分析與驗證。
- 資料科學家:自行整理訓練資料,不必為每次預處理等待獨立工程支持。
- BI團隊:建構報表前的資料清洗、整合與定時更新流程。
- 業務人員:在權限和審核機制下,以自然語言提出基礎數據處理需求。
- 中小企業:可透過自托管或免費雲端版本,來評估即時通訊式的資料工程流程。
產品優勢
- 對話式入口降低了常見資料處理任務的表達門檻。
- 每一步都可預覽數據,有助於在正式運行前發現錯誤。
- 保留YAML、SQL、Python和Spark控制,不局限於純無代碼操作。
- 支援操作歷史與撤銷,便於追蹤工作流如何形成。
- 能夠將轉換步驟進一步編排和調度為重複運行的任務。
- 自託管方案在官網定價中標為免費,適合技術團隊測試。
使用限制
- 目前聊天介面以英文指令為主,中文的理解與生成品質需自行測試。
- 生成式AI可能誤解字段含義或業務規則,預覽不等於完整數據驗證。
- 資料庫的寫入、刪除和覆蓋操作可能造成實際損失,必須限制權限並建立備份。
- 雲端免費版僅支援Excel和CSV,單個檔案容量上限為5MB。
- 雲端免費版不提供任務調度,無法直接承擔持續生產流程。
- 企業版沒有公開固定價格,費用按數據量及實際服務範圍溝通。
- 官網宣稱開源,但官方GitHub倉庫截至核驗時為空,無法下載完整源碼自部署。
- 公開文件尚不足以確認所有資料庫連接器、系統要求及生產級運維細節。
版本與價格對比
Ask On Data官網列出了開源自託管、免費雲端以及企業雲端這三種方案。企業版是根據數據量來計算費用,但並未公佈具體的金額。
| 版本 | 價格 | 資料來源 | 調度 | 託管與支援 |
|---|---|---|---|---|
| Open Source | 免費 | 官網稱支援所有資料庫作為來源和目標 | 支持 | 自行託管、社區支援,手動部署補丁和升級 |
| Free | 免費 | 僅Excel與CSV,檔案上限5MB | 不支援 | 官方託管、社區支援,自動升級、備份和監控 |
| Enterprise | 聯絡詢價 | 官網稱支援所有資料庫作為來源和目標 | 支持 | 官方託管、企業支援,自動升級、備份和監控 |
官網的FAQ還說明,自託管服務可免費使用,而企業版則需根據資料量來決定費用。由於官方的代碼倉庫目前是空的,因此在實際下載及部署自託管方案之前,仍需向團隊確認相關事宜。
開源與GitHub狀態
官網多處將Ask On Data稱為開源產品,並將開源自託管版列為免費方案。官方GitHub組織下也建立了同名公開倉庫。
截至本次核驗,該倉庫顯示為空,沒有源代碼、安裝說明、版本發布或許可證文件。因此,不能僅憑官網表述認定目前已經提供可審計、可部署的開源版本。
| 核驗項目 | 當前狀態 | 結論 |
|---|---|---|
| 官方產品表述 | 稱產品開源 | 屬於廠商公開定位 |
| GitHub倉庫 | 公開但為空 | 目前沒有可獲取代碼 |
| 許可證 | 倉庫未提供 | 無法確認具體開源許可 |
| 安裝文件 | 倉庫未提供 | 無法按公開步驟完成自部署 |
| 版本與發布 | 沒有公開Release | 無法核對穩定版本和更新記錄 |
技術架構
官方FAQ指出,後端以Python為基礎,前端則使用React,而資料處理流程則透過Apache Spark來執行並進行編排。該產品也提到了LangChain、Ollama和Airbyte等技術。
- Python:承載後端服務和資料處理相關邏輯。
- React:建構網頁端的互動介面。
- Apache Spark:用於執行所產生的資料處理任務。
- LangChain:連接大模型與應用流程。
- Ollama:為本地或自管模型的運行提供相關功能。
- Airbyte:用於數據連接與整合生態。
安全使用建議
- 優先使用只讀帳戶驗證來源數據,寫入目標庫時採用獨立低權限帳號。
- 不要向聊天框提交密碼、金鑰、個人敏感資訊或未經授權的生產數據。
- 對生成的連接、過濾、聚合和計算邏輯進行人工審查。
- 先在測試庫和小樣本上運行,確認結果後再擴大數據範圍。
- 為目標表建立快照、備份和可恢復的版本策略。
- 記錄提示詞、配置、模型、管道版本和每次運行結果。
- 正式採購前確認數據保存位置、加密、審計、刪除和事故響應條款。
新手試用教學
- 先準備不含敏感資訊的小型Excel或CSV測試檔案。
- 註冊免費雲端版本並上傳不超過5MB的檔案。
- 檢查系統識別的欄位名稱、資料類型和樣本記錄。
- 用簡單英文指令完成一次篩選或欄位清洗。
- 查看轉換後的實時預覽,並與原始數據人工對照。
- 增加一次連接、計算或格式轉換操作。
- 檢查操作歷史,並測試撤銷功能是否符合預期。
- 導出或保存結果,記錄準確性、耗時和需要人工修改的步驟。
企業評估教學
- 選擇一條規則明確、風險較低且已有人工結果的資料管道。
- 整理數據規模、來源、目標、更新頻率及合規要求。
- 向產品團隊確認連接器、部署位置、模型來源以及資料是否外發。
- 要求演示錯誤恢復、任務監控、權限控制及審計日誌。
- 使用脫敏數據驗證複雜連接、增量同步和異常處理。
- 對比現有流程的開發時間、運行成本、準確率及維護工作量。
- 確認合同中的資料處理、支援等級、故障恢復及退出機制。
- 通過驗收門檻後再遷移生產數據和關鍵定時任務。
與自然語言資料庫問答工具的差異
| 比較維度 | Ask On Data | 資料庫問答工具 |
|---|---|---|
| 核心目標 | 創建、轉換和調度資料管道 | 用自然語言查詢並解釋數據 |
| 主要輸出 | 可執行的資料處理工作流 | SQL、答案、圖表或分析結果 |
| 是否改變數據 | 可遷移、轉換並寫入目標 | 通常以讀取和分析為主 |
| 執行技術 | Spark任務與管道編排 | 資料庫查詢引擎 |
| 主要風險 | 錯誤轉換、覆寫或遷移資料 | 錯誤查詢或解釋結果 |
基本資訊
| 項目 | 內容 |
|---|---|
| 產品名稱 | Ask On Data |
| 產品類型 | 生成式AI數據工程與ETL平台 |
| 互動方式 | 英文自然語言聊天、SQL、Python和YAML |
| 主要能力 | 數據集成、清洗、轉換、預覽、編排和調度 |
| 執行框架 | Apache Spark |
| 託管方式 | 免費雲端、企業雲端及官網宣稱的自託管方案 |
| 價格模式 | 免費與企業詢價 |
| 是否開源 | 官網稱開源,但官方倉庫目前為空且沒有許可證 |
| 適合用戶 | 數據工程師、分析師、數據科學家、BI團隊和企業數據團隊 |
推薦指數
綜合推薦指數為3.2分,滿分為5分。Ask On Data將自然語言、資料預覽、程式碼控制以及Spark管道整合在一起,產品設計思路清晰,但空倉庫、文件不足,以及企業級服務的價格不透明等問題,限制了其實際應用價值。
常見問題
Ask On Data主要用來做什麼?
它用於透過聊天功能來建立資料遷移、清理、連接、轉換及排程的流程。
它是資料庫聊天問答工具嗎?
不完全是,它的核心輸出是可運行的數據工程工作流,而不只是查詢答案。
Ask On Data免費嗎?
官網列出的自託管版和基礎雲端版均為免費,企業雲端版需要询价。
免費雲端版有哪些限制?
它只支援Excel與CSV,單個檔案的上限為5MB,且沒有任務調度功能。
可以連接資料庫嗎?
官網稱開源版與企業版支援以資料庫作為來源和目標,具體連接器需在使用前確認。
可以查看AI生成的處理邏輯嗎?
可以查看和編輯YAML,也可使用SQL、Python以及調度階段的Spark代碼來增強控制。
Ask On Data真的開源嗎?
官網宣稱開源,但官方公開倉庫目前沒有代碼或許可證,暫時無法完成獨立審計和部署。
數據會立即被修改嗎?
搭建管道時先載入預覽,任務被手動觸發或按計劃運行後才會處理實際數據。
適合直接處理生產資料庫嗎?
不建議未經測試直接使用,應先採用低權限帳戶、測試數據、人工審核和可靠備份。
桂公網安備45132202000164號