Qu'est-ce qu'AnalyticDB ?
AnalyticDB est un entrepôt de données en temps réel natif du cloud proposé par Alibaba Cloud. Il ingère des données en temps réel depuis des sources telles que les bases de données transactionnelles en ligne (OLTP) et les fichiers journaux, et analyse des pétaoctets de données en quelques secondes. AnalyticDB repose sur une architecture native du cloud qui découple le stockage du calcul. Cette architecture prend en charge le stockage selon le modèle de paiement à l'utilisation, la mise à l'échelle élastique des ressources de calcul et l'isolation des ressources pour le traitement par lots hors ligne et l'analyse en ligne. Cette conception aide les entreprises à améliorer l'efficacité du traitement des données, à maîtriser les coûts et à garantir la stabilité du système. AnalyticDB est compatible avec les écosystèmes MySQL, PostgreSQL et Spark.
AnalyticDB propose deux moteurs : AnalyticDB for MySQL et AnalyticDB for PostgreSQL.
|
Critère de comparaison |
AnalyticDB for MySQL |
AnalyticDB for PostgreSQL |
|
|
Écosystème |
Haute compatibilité avec MySQL Haute compatibilité avec Spark |
Compatibilité à 100 % avec PostgreSQL Haute compatibilité avec Oracle |
|
|
Édition |
|
|
|
|
Architecture |
Architecture découplant le stockage et le calcul |
||
|
Extensibilité |
Fonctionnalités communes |
Mise à l'échelle verticale Mise à l'échelle horizontale |
|
|
Différences |
Prend en charge le modèle Multi-Cluster pour la mise à l'échelle automatique des ressources Prend en charge le modèle MIN-MAX pour la mise à l'échelle élastique automatique basée sur le temps |
Prend en charge les tâches planifiées pour la mise à l'échelle automatique programmée Prend en charge un modèle serverless pour la mise à l'échelle automatique à la demande |
|
|
Fonctionnalités clés |
Fonctionnalités communes |
AISearch Index en texte intégral Traitement par lots hors ligne Vue matérialisée en temps réel |
|
|
Différences |
Data lake Traitement hors ligne Spark Diagnostic intelligent et réglage des performances des requêtes |
Applications RAG (Retrieval-Augmented Generation) Analyse spatio-temporelle |
|
|
Scénarios |
Fonctionnalités communes |
Entrepôt de données en temps réel Analyse des journaux en temps réel Rapports de business intelligence (BI) |
|
|
Différences |
Marketing de précision Analytique fédérée sur plusieurs sources Stockage et analyse de big data Accélération des données hors ligne Migration depuis d'autres services de data lake ou d'entrepôt de données (tels que Databricks, Athena, Spark autogéré ou Presto) |
Solution tout-en-un pour la création d'applications LLM (Large Language Model) Bases de connaissances exclusives pour les entreprises Analytique des big data spatio-temporels SIG (Système d'information géographique) Analytique intégrée des données hors ligne et en ligne Migration depuis d'autres services d'entrepôt de données cloud (tels que Greenplum, Redshift, Synapse, Snowflake ou BigQuery) |
|
|
Secteurs clients |
Jeux vidéo, commerce de détail, automobile |
Commerce de détail, e-commerce, éducation |
|
|
Économies de coûts |
Fonctionnalités communes |
Les frais de stockage des données sont basés sur le volume réel de données. Le stockage hiérarchisé pour les données chaudes et froides réduit les coûts de stockage. Met automatiquement à l'échelle les ressources à la hausse ou à la baisse en fonction des pics et des creux prévisibles de l'activité. Cela garantit des ressources suffisantes lors des pics de trafic et évite le gaspillage de ressources après les pics. |
|
|
Différences |
Met automatiquement à l'échelle les ressources à la hausse ou à la baisse en fonction de la charge de travail réelle de l'entreprise. |
Démarre ou met en pause manuellement les instances selon les besoins. |
|
Présentation d'AnalyticDB for MySQL
Sources de données
Le pipeline de données APS offre une méthode simple et peu coûteuse pour ingérer des données provenant de bases de données, de journaux et de systèmes de big data.
Couche de stockage + Couche de calcul
Elle prend en charge son propre moteur de calcul Xihe et son moteur de stockage Xuanwu. Elle intègre également le moteur de calcul open source Spark et le moteur de stockage Hudi. Ces moteurs open source couvrent un éventail plus large de scénarios d'analyse de données. L'accès mutuel entre les moteurs propriétaires et les moteurs open source est activé, offrant une expérience plus intégrée.
-
Couche de stockage : Une seule copie complète des données peut répondre aux besoins des scénarios hors ligne et en ligne.
Les scénarios d'analyse en ligne nécessitent des supports de stockage haute performance pour améliorer les performances, tandis que les scénarios hors ligne requièrent des supports de stockage à faible coût pour réduire les dépenses de stockage. Pour satisfaire ces besoins différents, une copie complète des données est d'abord stockée sur des supports de stockage à faible coût et haut débit. Cela permet aux scénarios de traitement hors ligne à faible coût de lire et d'écrire directement dans ces données, ce qui réduit les coûts de stockage et d'E/S de données tout en garantissant un débit élevé. Ensuite, les données en temps réel sont stockées sur des nœuds d'E/S de stockage distincts (EIU) afin d'assurer des performances en temps réel au niveau des lignes. Des index sont construits sur l'intégralité des données et la mise en cache est utilisée pour accélérer l'accès aux données. Cette conception répond aux exigences des scénarios d'analyse en ligne haute performance, avec des temps de réponse de l'ordre de quelques centaines de millisecondes.
-
Couche de calcul : Le moteur de calcul Xihe sélectionne intelligemment le mode de calcul, tandis que le moteur de calcul open source Spark répond aux besoins de divers scénarios.
Le moteur de calcul Xihe propose à la fois les modes MPP (Massively Parallel Processing) et BSP (Bulk Synchronous Parallel). Le mode MPP est un modèle de traitement de flux et ne convient pas aux scénarios de traitement hors ligne à faible coût et haut débit. Le mode BSP utilise un graphe acyclique dirigé (DAG) pour diviser les tâches et les planifier par lots. Cette approche prend en charge le calcul de données à grande échelle avec des ressources limitées et permet l'écriture des données de calcul sur disque. Le moteur de calcul Xihe inclut une fonctionnalité de basculement automatique. Si une requête en mode MPP ne se termine pas dans un délai spécifié, le système bascule automatiquement vers le mode BSP pour l'exécution.
Le moteur de calcul open source Spark peut répondre aux besoins de scénarios de traitement hors ligne et d'apprentissage automatique plus complexes. La couche de calcul Spark et la couche de stockage sont interconnectées, permettant aux ressources de la couche de calcul de traiter les données de la couche de stockage. Cela simplifie la création et la configuration des groupes de ressources Spark.
Couche d'accès
La couche d'accès améliore l'efficacité du développement en fournissant une unité de facturation unifiée, des métadonnées et des autorisations unifiées, un langage de développement unifié et un lien de transmission unifié.
Pour plus d'informations sur les éditions du produit AnalyticDB for MySQL ( Data Lakehouse Edition et Data Warehouse Edition), consultez Éditions du produit.
Présentation d'AnalyticDB for PostgreSQL
AnalyticDB for PostgreSQL existe sous deux formes : le mode élastique de stockage et le mode Serverless. Le mode élastique de stockage utilise une architecture Shared-Nothing basée sur ECS et des disques cloud ESSD avec MPP. Le mode Serverless utilise une architecture Shared-Storage découplant le stockage et le calcul, basée sur ECS, un cache local et un stockage distant OSS.
Une instance AnalyticDB for PostgreSQL se compose d'un nœud coordinateur (également appelé nœud maître) et de plusieurs nœuds de travail (également appelés nœuds de segment). Le nœud coordinateur gère les métadonnées et l'équilibrage de charge. Les nœuds de travail traitent les données et incluent l'optimiseur Orca, le moteur d'exécution propriétaire Laser et le moteur de stockage Beam pour des performances de requête élevées. Associé au composant IMV (vue matérialisée en temps réel), AnalyticDB for PostgreSQL constitue un entrepôt de données en temps réel. Les disques cloud ESSD attachés aux nœuds de travail stockent les données chaudes, tandis que les données froides sont stockées dans OSS. Cette hiérarchisation des données chaudes et froides équilibre les performances des requêtes et le coût de stockage. AnalyticDB for PostgreSQL utilise une architecture découplant le calcul et le stockage. Les ressources de calcul sur les nœuds de travail prennent en charge une mise à l'échelle flexible pour optimiser les performances et l'utilisation des ressources. Cependant, les ressources de stockage ne prennent en charge que la mise à l'échelle ascendante et ne prennent pas en charge la mise à l'échelle descendante. Cette conception garantit la durabilité des données et la stabilité du système tout en permettant une croissance flexible de la capacité de stockage à mesure que le volume de données augmente.