Tous les produits
Search
Centre de documentation

Data Lake Formation:Gestion des données

Dernière mise à jour :Aug 11, 2026

Data Lake Formation (DLF) propose des API de gestion de tables compatibles avec le catalogue REST Apache Paimon. La structure de stockage des fichiers est entièrement compatible avec Paimon, permettant à tout moteur ou application compatible de créer, mettre à jour, interroger et supprimer les tables gérées par DLF.

La hiérarchie principale des données au sein d’un catalogue est la suivante :

image
  1. Catalogue : Conteneur de métadonnées de niveau supérieur. Un catalogue organise les ressources selon une hiérarchie qui impose des limites d’isolation et d’autorisation entre les services et les utilisateurs. Il régit également le stockage du data lake et les opérations sur les tables.

  2. Base de données : Regroupement logique au sein d’un catalogue, offrant une organisation et un contrôle d’accès plus fins.

  3. Table : DLF prend en charge plusieurs types de tables pour une gestion unifiée et une compatibilité transparente avec différents moteurs de calcul et formats. Pour activer le chiffrement au repos, ouvrez un ticket.

  4. Vue : Les vues sont persistantes dans DLF et prennent en charge plusieurs dialectes SQL, ce qui permet leur configuration sur différents moteurs de calcul.

  5. Fonction : Les fonctions sont persistantes dans DLF et prennent actuellement en charge les JAR Flink (Java et Python) ainsi que les fonctions Lambda Java exécutées sur le moteur Spark.

Service de métadonnées unifié

DLF fournit un service de gestion des métadonnées unifié. Un seul catalogue gère de manière centralisée les métadonnées des tables, des vues et des fonctions, brisant ainsi les silos entre les moteurs de calcul afin que les moteurs Big Data et IA d’Alibaba Cloud puissent accéder aux données omni-modales sans configuration spécifique à chaque moteur.

Prise en charge des données multimodales

DLF gère les données structurées et non structurées via un seul catalogue, avec une prise en charge native des principaux formats de table ouverts et des types de données IA :

  • Formats de data lake : Prise en charge complète d’Apache Paimon, d’Apache Iceberg et de leurs composants écosystémiques.

  • Données IA et vectorielles : Prise en charge du format Lance pour la récupération et l’entraînement IA haute performance.

  • Données non structurées : Gérez des jeux de données non tabulaires tels que des images et des vidéos à l’aide des Object Tables, assurant l’interopérabilité entre le stockage et le calcul.

  • Formats de fichier standard : Prise en charge des tables au format compatible Hive, notamment Parquet, CSV et ORC.

Contrôle d’accès unifié

DLF centralise la gestion de la sécurité de sorte qu’une autorisation accordée une seule fois s’applique automatiquement à tous les moteurs de calcul connectés, sans configuration spécifique à chaque moteur.

  • Autorisation granulaire : Contrôlez l’accès à quatre niveaux : catalogue, base de données, table et colonne.

  • Synchronisation multi-moteurs : Autorisez une opération une seule fois et la politique prend effet sur tous les moteurs de calcul connectés.

Cela garantit un accès cohérent aux données, renforce la sécurité et simplifie considérablement les processus d’exploitation et de maintenance (O&M) inter-moteurs.