MaxCompute propose une solution de data lakehouse qui vous permet de créer une plateforme de gestion des données alliant la flexibilité des data lakes à la robustesse opérationnelle des entrepôts de données. Utilisez-la pour exécuter des analyses SQL sur des données au format ouvert stockées dans Object Storage Service (OSS) ou des clusters Hadoop.
La solution de data lakehouse est en aperçu public.
Fonctionnalités
La solution de data lakehouse MaxCompute vous permet de :
Interroger les données à leur emplacement d'origine — exécutez directement des requêtes SQL sur les données présentes dans OSS sans les déplacer vers MaxCompute
Exploiter des formats ouverts — traitez nativement les fichiers Delta Lake, Apache Hudi, AVRO, CSV, JSON, Parquet et ORC
Unifier la gestion des métadonnées – mappez les schémas de data lake externes vers des projets externes MaxCompute pour assurer une gouvernance cohérente
Tirer parti de l'infrastructure existante – connectez-vous aux clusters Hadoop hébergés dans vos centres de données, sur des machines virtuelles (VM) cloud ou via E-MapReduce (EMR), sans migrer les données
Méthodes de déploiement
Dans cette architecture de data lakehouse, MaxCompute fait office d'entrepôt de données. Choisissez la méthode de déploiement adaptée en fonction de l'emplacement de vos données et de vos métadonnées.
Déployer un data lakehouse avec MaxCompute, DLF et OSS
Cas d'utilisation : Vos données résident dans OSS et vous souhaitez bénéficier d'une couche de métadonnées entièrement managée et native du cloud.
Tous les schémas du data lake sont stockés dans Data Lake Formation (DLF). MaxCompute s'appuie sur les capacités de gestion des métadonnées de DLF pour interroger directement les données semi-structurées dans OSS, en prenant en charge les formats Delta Lake, Apache Hudi, AVRO, CSV, JSON, Parquet et ORC.
Pour obtenir les instructions de configuration, consultez la rubrique Déployer un data lakehouse avec MaxCompute, DLF et OSS.
Déployer un data lakehouse avec MaxCompute et Hadoop
Cas d'utilisation : Vous disposez déjà d'un cluster Hadoop (sur site, sur des VM cloud ou dans Alibaba Cloud E-MapReduce (EMR)) et souhaitez interroger ses données depuis MaxCompute sans migration.
Connectez MaxCompute au réseau privé virtuel (VPC) où s'exécute le cluster Hadoop. MaxCompute accède alors directement aux metastores Hive et mappe les métadonnées vers des projets externes MaxCompute.
Pour obtenir les instructions de configuration, consultez la rubrique Déployer un data lakehouse avec MaxCompute et Hadoop.
Limites
Régions prises en charge : Chine (Hangzhou), Chine (Shanghai), Chine (Pékin), Chine (Zhangjiakou), Chine (Shenzhen), Chine (Hong Kong), Singapour et Allemagne (Francfort).
Exigence de colocalisation : MaxCompute doit être déployé dans la même région que DLF et OSS.
Étapes suivantes
Accorder à d'autres utilisateurs des permissions sur un projet externe — le propriétaire du projet externe correspond au compte utilisé lors de sa création ; accordez séparément l'accès aux autres utilisateurs.
Gérer un projet externe à l'aide d'instructions SQL — gérez les projets externes via SQL une fois la configuration terminée.