全部產品
Search
文件中心

Data Lake Formation:引擎對接

更新時間:Jun 25, 2026

DLF 作為阿里雲統一的資料湖底座,旨在無縫整合主流巨量資料計算引擎,為即時湖倉、離線湖倉及 OLAP 分析等多樣化業務情境提供強大支援。目前,DLF 已與Realtime Compute Flink 版、EMR Serverless Spark、EMR Serverless StarRocks 和 EMR on ECS 等核心引擎深度對接,並持續擴充其生態相容性。

支援的引擎範圍

下表列出了各對接方式支援的引擎和工具:

對接方式

支援的引擎/工具

Paimon REST

Iceberg REST

檔案訪問

Lance

說明

DLF 暫不支援自建 Spark 等非阿里雲引擎直接對接。如需使用 Spark 引擎訪問 DLF,請選擇 EMR Serverless Spark 或 EMR on ECS。

對接方式

為了滿足不同引擎和使用者在訪問資料時的靈活性需求,DLF 提供了以下四種標準化的對接方式:

  1. Paimon REST:面向基於 Apache Paimon 構建的計算引擎,提供符合 Paimon 社區規範的 RESTful 中繼資料服務介面,支援表結構管理、快照查詢等核心操作。

  2. Iceberg REST:面向基於 Apache Iceberg 構建的計算引擎,提供符合 Iceberg 社區規範的 RESTful 中繼資料服務介面,支援表結構管理、快照查詢等核心操作。

  3. 檔案訪問:通過 Paimon 虛擬檔案系統(PVFS),將表資料抽象為標準檔案路徑,直接讀取底層資料檔案與中繼資料,無需依賴完整計算引擎,適用於指令碼化探索、調試及輕量級資料處理。

  4. Lance:面向 Lance 格式資料,通過 Python SDK(lance-dlf)串連 DLF Catalog,支援 Lance 表的讀寫操作,可配合 Daft DataFrame 引擎進行查詢過濾和批次運算。

通過這四種方式,您可以根據自身引擎的技術棧和架構偏好,選擇最適合的接入路徑,實現與 DLF 資料湖的高效協同。