Tous les produits
Search
Centre de documentation

E-MapReduce:Présentation d'EMR Serverless StarRocks

Dernière mise à jour :Aug 09, 2026

E-MapReduce (EMR) Serverless StarRocks est un service StarRocks entièrement géré sur Alibaba Cloud. Créez des instances StarRocks et gérez vos instances et vos données depuis la console EMR, sans configurer, exploiter ni mettre à l'échelle les clusters vous-même.

Qu'est-ce que StarRocks ?

StarRocks est une base de données analytique conçue pour offrir des analyses multidimensionnelles rapides, en temps réel et efficaces. Elle s'appuie sur une architecture de traitement massivement parallèle (MPP) dotée d'un moteur d'exécution vectorisé, d'un optimiseur basé sur les coûts (CBO), de vues matérialisées intelligentes et d'un moteur de stockage columnaire actualisable en temps réel. StarRocks étant compatible avec le protocole MySQL, tout client MySQL ou outil BI standard peut s'y connecter directement. L'architecture permet une mise à l'échelle horizontale et garantit une haute disponibilité ainsi qu'une grande fiabilité.

StarRocks répond aux cas d'utilisation analytiques suivants :

  • Entrepôts de données en temps réel — synchronisez les modifications issues des bases de données transactionnelles en quelques secondes et interrogez des données toujours à jour.

  • Traitement analytique en ligne (OLAP) — exécutez des rapports multidimensionnels, des tableaux de bord en libre-service et des requêtes ad hoc.

  • Analyse de data lake — interrogez les données stockées dans Apache Hive, Apache Iceberg, Apache Hudi et Delta Lake sans les migrer.

Fonctionnalités principales

Framework MPP

StarRocks découpe chaque requête en unités de calcul physiques qui s'exécutent en parallèle sur plusieurs machines, chacune disposant de ressources CPU et mémoire dédiées. Lorsque vous augmentez la taille du cluster, les performances des requêtes individuelles évoluent proportionnellement.

Moteur d'exécution vectorisé

Le moteur d'exécution vectorisé optimise tous les opérateurs, fonctions, modules d'analyse et de filtrage, ainsi que les modules d'importation et d'exportation au niveau du processeur. Il exploite les instructions SIMD (Single Instruction, Multiple Data) pour traiter davantage de données par cycle d'horloge. Les tests de référence effectués sur des jeux de données standards montrent une amélioration des performances globales des opérateurs comprise entre 3 et 10 fois.

Ce moteur intègre également la fonctionnalité Operation on Encoded Data, qui permet d'exécuter des opérateurs de jointure, d'agrégation et d'expression directement sur des chaînes encodées, sans étape de décodage. Cette approche réduit la complexité d'exécution des requêtes SQL et multiplie par plus de deux la vitesse d'interrogation.

Séparation du calcul et du stockage

Introduite avec StarRocks 3.0, l'architecture de séparation du calcul et du stockage dissocie les ressources de calcul des ressources de stockage, permettant à chacune d'évoluer indépendamment. Les nœuds de calcul peuvent être mis à l'échelle en quelques secondes, ce qui élimine le surdimensionnement souvent nécessaire lorsque le calcul et le stockage doivent croître conjointement.

La couche de stockage s'appuie sur divers services de stockage d'objets offrant une capacité quasi illimitée et reste compatible avec le système de fichiers distribués Hadoop (HDFS). Cette architecture de séparation conserve une parité fonctionnelle totale avec l'architecture intégrée : les mises à jour de données, l'analyse de data lake et l'accélération via les vues matérialisées fonctionnent de manière identique. Les performances en écriture de données et en interrogation des données fréquemment utilisées (« hot data ») sont quasiment équivalentes dans les deux architectures.

Optimiseur basé sur les coûts

Dans le cadre de requêtes complexes impliquant des jointures entre plusieurs tables, le nombre de plans d'exécution valides augmente de façon exponentielle avec le nombre de tables, rendant la sélection du plan optimal NP-difficile. Le CBO de StarRocks utilise une architecture de type Cascades, personnalisée pour le moteur d'exécution vectorisé. Il prend en charge :

  • La réutilisation des sous-expressions courantes et la réécriture des sous-requêtes.

  • Les jointures latérales (Lateral Join) et la réorganisation des jointures (Join Reorder).

  • La sélection des politiques d'exécution distribuée des jointures.

  • L'optimisation de l'encodage par dictionnaire pour les données à faible cardinalité.

Le CBO prend en charge l'intégralité des 99 instructions SQL TPC-DS.

Moteur de stockage columnaire en temps réel

StarRocks stocke les données dans un format columnaire, ce qui améliore les taux de compression, réduit les entrées/sorties disque et accélère les requêtes qui ne lisent qu'un sous-ensemble de colonnes, schéma courant dans les charges de travail OLAP. StarRocks permet de charger les données en quelques secondes et offre des capacités de traitement des données en quasi temps réel.

Le moteur de stockage garantit les propriétés ACID (atomicité, cohérence, isolation et durabilité) lors des imports de données. Les imports par lots réussissent ou échouent de manière atomique, tandis que les transactions concurrentes bénéficient de l'isolation par instantané. Le moteur prend également en charge les mises à jour partielles et les opérations upsert. Il utilise des index de clé primaire avec un mode Delete-and-Insert pour éviter la surcharge liée au tri et à la fusion lors des lectures. Des index secondaires permettent de gérer les scénarios de mise à jour de données à haut débit.

Vues matérialisées intelligentes

Les vues matérialisées de StarRocks fonctionnent automatiquement :

  • Synchronisation automatique — lorsque les données d'une table source changent, la vue matérialisée correspondante détecte et applique la mise à jour en temps réel, garantissant la cohérence des données.

  • Réécriture transparente des requêtes — lors de la planification des requêtes, StarRocks identifie si une vue matérialisée peut accélérer l'exécution et réécrit la requête automatiquement, sans modification requise au niveau de l'application.

  • Gestion du cycle de vie en arrière-plan — créez et supprimez des vues matérialisées sans intervention manuelle ; le système gère ces opérations en arrière-plan.

  • Remplacement de l'ETL — utilisez les vues matérialisées pour transformer et traiter les données directement, remplaçant ainsi les pipelines ETL (extraction, transformation et chargement) traditionnels et le prétraitement en amont.

Analyse de data lake

Utilisez des catalogues externes pour interroger directement les data lakes, sans migration de données. StarRocks prend en charge :

  • Formats de table : Apache Hive, Apache Iceberg, Apache Hudi, Delta Lake.

  • Formats de fichier : Parquet, ORC, CSV.

  • Services de stockage : HDFS, Amazon Simple Storage Service (S3), Object Storage Service (OSS).

Dans ce modèle, les data lakes servent de source unique de vérité (SSOT) pour les charges de travail liées à la BI, à l'IA, aux requêtes ad hoc et au reporting, tandis que StarRocks assure le calcul et l'analyse grâce à son moteur vectorisé et à son CBO.

Apports de Serverless StarRocks

L'exploitation autonome de StarRocks implique le provisionnement de clusters, la planification des mises à niveau de version, la configuration de la sécurité et la surveillance du système. EMR Serverless StarRocks supprime cette charge opérationnelle :

  • Aucune gestion de cluster — le service est entièrement géré et exempt de tâches d'exploitation et de maintenance (O&M) ; oubliez le dimensionnement, la configuration initiale et l'ajustement continu des clusters.

  • Gestion visualisée des instances — gérez vos instances et exécutez les tâches d'O&M directement depuis la console EMR.

  • Surveillance visualisée — tableaux de bord de surveillance et d'O&M intégrés.

  • Mises à niveau automatiques des versions — les versions majeures et mineures de StarRocks sont mises à jour automatiquement.

  • Gestion de niveau entreprise avec EMR StarRocks Manager :

    • Sécurité : gérez les utilisateurs et les permissions.

    • Analyse diagnostique : identifiez les requêtes SQL lentes et analysez l'exécution SQL à l'aide d'outils visuels.

    • Gestion des données : parcourez les bases de données, tables, partitions, shards et tâches pour simplifier les opérations d'O&M.

  • AI+OLAP (Bêta) — appelez des modèles de langage de grande taille (LLM) via SQL dans votre flux de travail d'analyse OLAP ; une seule instruction SQL gère de bout en bout le traitement des données, l'analyse et l'inférence IA.