Tous les produits
Search
Centre de documentation

AnalyticDB:Stockage Hudi

Dernière mise à jour :Aug 10, 2026

AnalyticDB for MySQL s'intègre à Apache Hudi pour proposer une solution de data lakehouse sur Object Storage Service (OSS). Une fois le cluster créé, ingérez directement des données dans les tables Hudi sur OSS, sans configuration complexe de Spark.

Hudi storage

Fonctionnement

Le flux de données se déroule en trois étapes :

Ingestion : Utilisez AnalyticDB Pipeline Service (APS) pour diffuser les journaux depuis Kafka ou Log Service vers les tables Hudi en quasi temps réel. Vous pouvez également utiliser le moteur Serverless Spark pour charger par lots des données structurées depuis ApsaraDB RDS ou des fichiers Parquet.

Stockage : Les données atterrissent dans des tables Hudi sur OSS. Le système fusionne automatiquement les petits fichiers, gère le cycle de vie des partitions et exécute les services de table tels que le clustering. Ces opérations sont asynchrones et isolées du chemin d'écriture.

Interrogation : Le moteur Serverless Spark et le moteur XIHE lisent les données directement après leur écriture. La synchronisation automatique des métadonnées supprime toute nécessité d'enregistrement manuel des tables.

Fonctionnalités d'Apache Hudi

Apache Hudi fournit la base de stockage :

  • Prise en charge de plusieurs versions des protocoles de gestion de fichiers

  • Écritures incrémentielles en temps réel avec garanties transactionnelles ACID (atomicité, cohérence, isolation et durabilité)

  • Fusion et optimisation automatiques des petits fichiers

  • Évolution du schéma et vérification des métadonnées

  • Formats columnaires haute efficacité avec optimisation des index

  • Prise en charge des tables partitionnées de très grande taille

Améliorations apportées par AnalyticDB for MySQL

AnalyticDB for MySQL ajoute les fonctionnalités suivantes à la base open source Hudi :

Écritures haute performance

Le chemin d'écriture OSS est optimisé pour offrir un débit d'écriture plus de deux fois supérieur à celui de Hudi open source dans la plupart des charges de travail de journalisation. Les données actives sont réparties uniformément entre les partitions, ce qui élimine les déséquilibres de données et améliore la stabilité des écritures.

Gestion du cycle de vie des partitions

Contrôlez la rétention des données de partition par nombre de partitions, volume de données ou date d'expiration. Plusieurs politiques de cycle de vie peuvent s'exécuter simultanément pour réduire davantage les coûts de stockage.

Services de table asynchrones

Les services de table, tels que le clustering, s'exécutent de manière totalement indépendante du chemin d'écriture. Dans la plupart des charges de travail, le clustering améliore les performances des requêtes de plus de 40 %.

Synchronisation automatique des métadonnées

Les métadonnées sont gérées de manière centralisée. Une fois les données écrites dans une table Hudi, le moteur Serverless Spark et le moteur XIHE peuvent y accéder sans synchronisation manuelle des métadonnées de la table. Une seule copie des données ingérées est lisible par plusieurs moteurs de calcul.

Facilité d'utilisation

Configurez l'ingestion des données via la console graphique APS. Aucun fichier de configuration Spark n'est nécessaire.

Cas d'utilisation

  • Ingestion de journaux en quasi temps réel : Diffusez les journaux d'application depuis Kafka ou Log Service vers les tables Hudi sur OSS avec une faible latence, tout en maîtrisant les coûts de stockage grâce à la gestion du cycle de vie.

  • Migration de données par lots : Chargez des données structurées depuis ApsaraDB RDS ou des fichiers Parquet dans le data lakehouse à l'aide de Serverless Spark, puis interrogez ces données avec Serverless Spark ou XIHE sans les dupliquer.

  • Analytique multi-moteurs : Ingérez les données une seule fois et rendez-les disponibles pour plusieurs moteurs de calcul grâce à la gestion centralisée des métadonnées, ce qui élimine les copies redondantes et réduit la surcharge de stockage.