飛漿PaddlePaddle是什麼?
飛漿PaddlePaddle是百度發起並持續維護的開源深度學習平台,英文名稱來自Parallel Distributed Deep Learning。它涵蓋張量計算、神經網路、自動微分、優化器、混合精度、分散式訓練、模型保存和推理部署,並配套大量產業模型套件與開發工具。
飛漿既可用於教學以及傳統的視覺、語音、推薦任務,也適用於大模型的預訓練、微調與推理。其核心框架可在本地或伺服器上安裝,而 AI Studio 星河社區則提供課程、Notebook、資料集、模型以及雲端運算能力,這兩者不應被視為同一種收費產品。
當前版本PaddlePaddle 3.3
截至本次核驗,官網文件和官方GitHub均將3.3列為最新穩定版本。3.x版本重點強化PIR統一中介表示、編譯器、自動平行處理、大模型分佈式訓練、Checkpoint相容性以及多種國產硬體的適配。
穩定版適合用於生產與學習,develop和Nightly則用於體驗最新功能,此時可能會出現API變更及相容性問題。部署時應固定完整的版本號,並讓訓練、導出和推理環境使用相容的版本。
動態圖與靜態圖
動態圖的寫法接近一般Python,運算會立即執行,便於除錯與研究;靜態圖則先構建完整的計算圖,再進行編譯與執行,便於全局優化與部署。
飛漿提供動轉靜能力,可把動態圖模型轉換為適合推理的靜態形式。
動轉靜對Python控制流、自訂運算子及動態Shape有約束。轉換失敗時應縮小問題範圍、檢查不受支援的語法,並以真實輸入驗證精確度,而非僅確認模型檔案成功導出。
PIR與編譯優化
PIR是飛漿3.x中的重要統一中間表達形式,用於連接前端API、自動並行處理機制、編譯器以及後端執行環境。CINN編譯器則能夠進行運算子融合、圖形優化以及代碼生成,從而減少中間記憶體的使用量及調度上的開銷。
編譯優化收益取決於模型結構、Shape、硬體及運算子覆蓋率。開啟後應比較結果精確度、首次編譯時間、吞吐量及顯存使用量;
遇到不支援算子時可能回退或需要關閉部分Pass。
自動微分與神經網路API
paddle.Tensor、paddle.nn.Layer、Loss、Optimizer和DataLoader構成了常用的訓練介面。使用者在定義好網路的前向邏輯之後,框架會自動建立反向計算過程並更新參數,同時也支援使用SGD、Adam、AdamW等優化器,以及學習率調度功能。
在模型評估時,除了呼叫 eval 之外,還應使用 no_grad 來關閉梯度記錄,否則可能會增加顯存使用量。在儲存模型時,必須區分參數、優化器狀態以及用於推理的模型,因為訓練時所產生的檔案與部署時所使用的檔案目的不同。
自動混合精度
AMP可使用FP16或BF16來降低顯存消耗並提升Tensor Core的處理效率,同時搭配GradScaler來減少低精確度所造成的數值溢出問題。在訓練大型模型時,還可以結合重計算、梯度累積以及分片優化器等技術。
低精度可能造成NaN、收斂變化或個別運算子不穩定。應保留FP32基線,監控Loss和梯度,使用白名單或黑名單控制敏感運算子,並針對最終業務指標驗證。
分散式訓練與Fleet
paddle.distributed與Fleet支援單機多卡、多機多卡、資料並行、模型並行、流水線並行、張量並行以及參數伺服器等模式。啟動器可指定GPU或節點,Fleet則透過DistributedStrategy來配置混合精度、重計算、通訊融合與並行策略。
飛漿3.3持續強化自動並行與FSDP策略,並改進FlexCheckpoint的線上合併與重切分功能。分散式運算的效果會受到網路、拓撲結構、批次大小以及資料讀取方式的影響;
卡數增加不一定線性加速,需要分析通訊佔比和負載不均。
大模型訓練
飛漿為大型語言模型提供自動並行策略發現、分散式Checkpoint、顯存優化以及高效能運算子。PaddleNLP與PaddleFleetX則提供預訓練、微調、對齊及推理的範例,可用於國產及開源的大型模型。
大模型訓練需要明確模型許可證、數據授權和集群容錯。建議先以小規模配置驗證數據管道和Loss,再擴展到多機;
Checkpoint應同步到可靠儲存並定期進行恢復演練。
推理部署
Paddle Inference用於伺服器端的高效能推論,可結合PIR、CINN、TensorRT、MKL以及硬體後端進行優化。Paddle Lite則適用於行動裝置和邊緣裝置,Paddle Serving用於線上服務,而Paddle.js則能應用於部分瀏覽器及前端場景。
不同部署組件支援的模型和運算子並不完全相同。導出後應在目標設備上進行正確性、冷啟動、P95延遲、吞吐量、峰值記憶體以及長時間穩定性測試。
硬體支援
飛漿提供CPU與NVIDIA GPU的安裝套件,同時也為昆侖XPU、昇騰NPU、海光DCU等國產硬體提供了相應的適配功能。官方的3.3版說明文件中,針對不同的芯片分別提供了獨立的安裝、鏡像、驅動程式以及健康狀態檢查的說明。
硬體安裝必須與作業系統、Python、CUDA或廠商的運行時環境、驅動程式以及框架套件相容。不得在普通環境中混裝不同的後端Wheel;
容器鏡像通常更利於固定依賴,但仍需要宿主機驅動相容。
PaddleOCR
PaddleOCR是飛漿生態中知名度較高的OCR與文件理解工具,涵蓋文本檢測、識別、版面分析、表格、公式以及文件解析等功能。適用於票據、掃描檔、圖片中的文字,以及PDF文件的結構化處理。
OCR的準確率會受到清晰度、角度、語言、版面以及字體類型的影響。生產系統應在真實樣本上進行測試,並保留低可信度結果的復核記錄、版面座標以及原始圖片作為參考。
PaddleNLP
PaddleNLP提供文本分類、資訊抽取、Embedding、預訓練語言模型以及大模型訓練推理工具,包含Tokenizer、資料集、Trainer和產業範例。可與飛漿分散式功能結合,用於處理大規模訓練。
不同模型可能使用單獨的許可證和權重來源。PaddleNLP的代碼雖然開源,但並不代表其中的每個模型都能無條件用於商業用途,下載前仍需核對模型相關資料。
視覺與產業套件
PaddleDetection涵蓋目標檢測、追蹤、關鍵點以及實例分割;PaddleSeg用於圖像分割;
PaddleClas用於分類與識別;PaddleRec面向推薦;
PaddleSpeech涵蓋語音識別與合成;PaddleHelix服務生物計算。
PaddleX提供低代碼開發與統一產線,便於將OCR、檢測、分類、分割等功能組合成應用。套件版本與核心框架有相容性矩陣,安裝時應依據各自的文件選擇合適的組合。
模型保存與遷移
訓練過程中可保存參數和優化器狀態以恢復訓練,部署前則透過JIT或相關導出介面生成推理模型。3.3 分散式功能支援更靈活的分片Checkpoint處理,並可載入部分Hugging Face開放格式的Checkpoint。
格式相容並不保證模型結構與數值結果完全一致。跨框架遷移時應比較Tokenizer、權重映射、位置編碼、精確度類型及生成參數,並以固定樣本進行逐層或最終輸出的對比。
安裝方式
CPU版通常透過pip安裝paddlepaddle,GPU版則使用paddlepaddle-gpu,並選擇與CUDA相對應的官方源碼或Wheel。安裝完成後,可查看版本,並運行paddle.utils.run_check來進行基礎的健康檢查。
Windows、Linux、macOS以及不同架構的支援範圍會有所差異。在開始之前,應先使用官方網站的安裝選擇器來確認Python、作業系統和硬體的組合,切勿直接複製舊教學資料中的CUDA後綴。
AI Studio星河社區
AI Studio是飛漿所配套的學習與實訓社群,提供線上Notebook、課程、專案、資料集、比賽、模型社群、應用空間以及雲端GPU。新手可在瀏覽器中運行範例,無需先搭建本地環境。
平台提供免費的運算資源,也透過訂閱會員及A幣兌換高效能GPU等資源。會員權益、A幣消耗量以及活動額度都可能會調整,歷史資料中的每日固定V100使用時數不能視為現在的永久承諾。
價格與費用
PaddlePaddle的核心框架、官方源碼以及大多數生態系統中的軟體包都可以免費取得,不需要支付任何框架使用費用。不過,用戶在自行運行這些軟體時,需要承擔伺服器、GPU、電力、儲存空間以及維運等方面的成本。
AI Studio雲算力是獨立服務,目前權益說明採用會員和A幣模式,項目或應用的高性能資源按頁面規則消耗。具體會員價格和GPU兌換量應登錄實時購買頁核對;
企業私有化、培訓及技術服務請另行諮詢。
GitHub與開源許可證
核心倉庫為PaddlePaddle/Paddle,採用Apache License 2.0授權,只要遵守相關許可證及聲明中的要求,即可進行使用、修改和散布。至於文件、PaddleOCR、PaddleNLP、PaddleDetection等,則由各自的官方倉庫負責維護。
框架許可證不會自動覆蓋第三方資料集、模型權重和生成內容。商業專案應分別建立代碼、模型、資料與內容的許可清單。
飛漿PaddlePaddle使用教學
完成一次基礎任務
- 註冊飛漿PaddlePaddle並創建僅用於測試環境的API Key;
- 根據輸入類型、上下文、品質、速度和價格選擇模型;
- 先調用當前版本PaddlePaddle 3.3完成最小請求並檢查返回結構;
- 再以動態圖與靜態圖測試流式輸出、參數和異常響應;
- 記錄Tokens、呼叫次數、延遲、錯誤率及單次成本;
- 把密鑰移入服務端密鑰管理器後再接入正式應用;
建立可重複使用的專業工作流
- 為開發、測試與生產環境使用不同密鑰與額度;
- 按目前版本PaddlePaddle 3.3、動態圖與靜態圖以及PIR與編譯優化建立代表性評測集;
- 設定超時、併發、重試、限流和預算上限;
- 對輸出執行事實、安全、格式和敏感資訊檢查;
- 監控模型版本、價格、延遲和失敗率變化;
- 準備降級模型、熔斷和人工接管方案;
適合哪些用戶?
- 學習深度學習和Python模型訓練的學生與教師;
- 開發OCR、視覺、NLP、語音和推薦系統的工程團隊;
- 需要多機多卡和大模型分散式訓練的研究人員;
- 需要適配崑崙、昇騰和海光等國產硬件的企業;
- 希望使用AI Studio課程、Notebook和比賽資源的開發者。
產品優勢
- 從核心框架到模型套件和部署工具鏈較完整;
- 同時支援動態圖、靜態圖、動轉靜與編譯優化;
- 自動並行、Fleet和Checkpoint覆蓋大規模訓練;
- PaddleOCR、PaddleNLP等產業套件成熟;
- 支援NVIDIA GPU與多種國產AI芯片;
- Apache 2.0是開源軟體,且有中文文件與學習社群。
限制與注意事項
- 飛漿生態組件多,核心框架、CUDA、驅動、套件和硬件後端版本不匹配是常見問題;
- 舊FluidAPI已逐步廢棄,遷移老項目時應按3.3文件替換介面;
- 框架本身免費不代表訓練和雲算力免費;
- 模型權重也可能採用其他許可證;
- 生產升級前應鎖定依賴、運行回歸、驗證數值精確度及導出模型,並準備回滾版本;
常見問題
PaddlePaddle免費嗎?
核心框架免費開源,沒有訂閱費。自行訓練要承擔硬件成本,AI Studio高性能雲算力可能消耗會員權益或A幣。
飛漿目前最新的穩定版是什麼?
截至本次核驗為PaddlePaddle 3.3。Nightly和develop更新更快,但生產環境建議使用穩定版並固定小版本。
飛槳支援哪些硬體?
支援CPU、NVIDIA GPU,並提供崑崙XPU、昇騰NPU、海光DCU等後端;具體型號與環境需參考對應的3.3安裝文件。
PaddlePaddle適合大模型嗎?
適合。框架提供自動並行、Fleet、FSDP、混合精度、重計算和分佈式Checkpoint,PaddleNLP提供大模型訓練與推理工具。
飛槳可以商用嗎?
核心框架採用Apache 2.0,可按許可證商用。具體模型、資料集和第三方組件仍需分別核對許可。
桂公網安備45132202000164號