AnalyticDB for MySQL s'intègre à Apache Hudi pour proposer une solution de data lakehouse sur Object Storage Service (OSS). Une fois le cluster créé, ingérez directement des données dans les tables Hudi sur OSS, sans configuration complexe de Spark.

Fonctionnement
Le flux de données se déroule en trois étapes :
Ingestion : Utilisez AnalyticDB Pipeline Service (APS) pour diffuser les journaux depuis Kafka ou Log Service vers les tables Hudi en quasi temps réel. Vous pouvez également utiliser le moteur Serverless Spark pour charger par lots des données structurées depuis ApsaraDB RDS ou des fichiers Parquet.
Stockage : Les données atterrissent dans des tables Hudi sur OSS. Le système fusionne automatiquement les petits fichiers, gère le cycle de vie des partitions et exécute les services de table tels que le clustering. Ces opérations sont asynchrones et isolées du chemin d'écriture.
Interrogation : Le moteur Serverless Spark et le moteur XIHE lisent les données directement après leur écriture. La synchronisation automatique des métadonnées supprime toute nécessité d'enregistrement manuel des tables.
Fonctionnalités d'Apache Hudi
Apache Hudi fournit la base de stockage :
Prise en charge de plusieurs versions des protocoles de gestion de fichiers
Écritures incrémentielles en temps réel avec garanties transactionnelles ACID (atomicité, cohérence, isolation et durabilité)
Fusion et optimisation automatiques des petits fichiers
Évolution du schéma et vérification des métadonnées
Formats columnaires haute efficacité avec optimisation des index
Prise en charge des tables partitionnées de très grande taille
Améliorations apportées par AnalyticDB for MySQL
AnalyticDB for MySQL ajoute les fonctionnalités suivantes à la base open source Hudi :
Écritures haute performance
Le chemin d'écriture OSS est optimisé pour offrir un débit d'écriture plus de deux fois supérieur à celui de Hudi open source dans la plupart des charges de travail de journalisation. Les données actives sont réparties uniformément entre les partitions, ce qui élimine les déséquilibres de données et améliore la stabilité des écritures.
Gestion du cycle de vie des partitions
Contrôlez la rétention des données de partition par nombre de partitions, volume de données ou date d'expiration. Plusieurs politiques de cycle de vie peuvent s'exécuter simultanément pour réduire davantage les coûts de stockage.
Services de table asynchrones
Les services de table, tels que le clustering, s'exécutent de manière totalement indépendante du chemin d'écriture. Dans la plupart des charges de travail, le clustering améliore les performances des requêtes de plus de 40 %.
Synchronisation automatique des métadonnées
Les métadonnées sont gérées de manière centralisée. Une fois les données écrites dans une table Hudi, le moteur Serverless Spark et le moteur XIHE peuvent y accéder sans synchronisation manuelle des métadonnées de la table. Une seule copie des données ingérées est lisible par plusieurs moteurs de calcul.
Facilité d'utilisation
Configurez l'ingestion des données via la console graphique APS. Aucun fichier de configuration Spark n'est nécessaire.
Cas d'utilisation
Ingestion de journaux en quasi temps réel : Diffusez les journaux d'application depuis Kafka ou Log Service vers les tables Hudi sur OSS avec une faible latence, tout en maîtrisant les coûts de stockage grâce à la gestion du cycle de vie.
Migration de données par lots : Chargez des données structurées depuis ApsaraDB RDS ou des fichiers Parquet dans le data lakehouse à l'aide de Serverless Spark, puis interrogez ces données avec Serverless Spark ou XIHE sans les dupliquer.
Analytique multi-moteurs : Ingérez les données une seule fois et rendez-les disponibles pour plusieurs moteurs de calcul grâce à la gestion centralisée des métadonnées, ce qui élimine les copies redondantes et réduit la surcharge de stockage.