Data Lake Formation (DLF) s'intègre aux principaux moteurs de calcul Big Data pour les charges de travail Lakehouse en temps réel et par lots, ainsi que pour le traitement analytique en ligne (OLAP). Il prend nativement en charge Flink (VVP), EMR Serverless Spark, EMR Serverless StarRocks et EMR on ECS.
Moteurs pris en charge et méthodes de connexion
Le tableau suivant répertorie les moteurs et outils pris en charge pour chaque méthode d'intégration :
Méthode d'intégration | Moteurs/outils pris en charge |
Paimon REST | |
Iceberg REST | |
Accès aux fichiers | |
Lance |
Les clusters Spark autogérés ne sont pas pris en charge. Pour utiliser Spark avec DLF, choisissez EMR Serverless Spark ou EMR on ECS d'Alibaba Cloud.
Méthodes d'intégration
DLF propose quatre méthodes d'intégration, chacune conçue pour un type de moteur et un modèle d'accès spécifiques :
Paimon REST : interface de service de métadonnées RESTful conforme aux normes de la communauté Apache Paimon. Utilisez cette méthode si votre moteur de calcul repose sur Apache Paimon. Elle gère les schémas de table et les requêtes de snapshot.
Iceberg REST : interface de service de métadonnées RESTful conforme aux normes de la communauté Apache Iceberg. Privilégiez cette méthode si votre moteur de calcul est basé sur Apache Iceberg. Elle gère les schémas de table et les requêtes de snapshot.
Accès aux fichiers : expose les données de table sous forme de chemins de fichier standard via le système de fichiers virtuel Paimon (PVFS). Vous accédez directement aux fichiers de données et aux métadonnées sous-jacents sans avoir besoin d'un moteur de calcul complet. Cette solution convient à l'exploration par script, au débogage et au traitement léger des données.
Lance : se connecte au catalogue DLF via le SDK Python (lance-dlf) pour lire et écrire des tables Lance. Il prend en charge le filtrage des requêtes et le traitement par lots avec le moteur DataFrame Daft.