Un composant clé du framework cloud-native de data lake
Un data lake est un référentiel centralisé utilisé pour le Big Data et le calcul d'IA. Il vous permet de stocker des données structurées et non structurées à n'importe quelle échelle. Data Lake Formation (DLF) est un composant clé du framework cloud-native de data lake. DLF offre un moyen simple de construire un data lake cloud-native. Il s'intègre de manière transparente à divers moteurs de calcul et vous permet de gérer les métadonnées des data lakes de manière centralisée et de contrôler les permissions de classe entreprise.
• Collecte de données simplifiée : collecte systématiquement les données structurées, semi-structurées et non structurées, et prend en charge le stockage massif de données.
• Architecture flexible : utilise une architecture qui sépare le calcul du stockage. Vous pouvez planifier les ressources à la demande et à moindre coût, ce qui améliore l'efficacité du traitement des données pour répondre aux besoins métier en constante évolution.
• Gestion des données simplifiée : utilise un stockage unifié, sépare les données froides et chaudes, et gère le cycle de vie des données. Cela résout divers problèmes d'exploitation et maintenance, tels que l'impossibilité de copier les données entre les clusters.
• Extraction de valeur facilitée : se connecte à différents types de plateformes de calcul et d'analyse de données. Cela élimine les silos de données et offre une visibilité sur la valeur métier.
Fonctionnalités
-
Ingestion de données
Multiples types de données et canaux d'ingestion
Permet de nettoyer les données de manière centralisée. -
Service de métadonnées
Découverte intelligente des métadonnées
Collecte les métadonnées de différentes sources de données pour faciliter la gestion centralisée. -
Gestion des permissions
Gestion des permissions de données de classe entreprise
Permet de définir des permissions sur les bases de données, les tables et les champs. -
Accès multi-moteurs
Accès à plusieurs moteurs de calcul en amont
Vous aide à déployer une solution data lake de bout en bout. -
Écosystème ouvert
Compatible avec Hive metastore
Fournit des API dans plusieurs langages de programmation pour une intégration facile. -
Accélération des données
Accélération des données basée sur JindoFS
Accélère l'analytique data lake avec des performances élevées.
Scénarios
Scénarios
Scénarios types
Une plateforme de traitement et d'analytique de données doit être construite à partir des services de l'écosystème big data d'Alibaba Cloud, tels qu'E-MapReduce, Realtime Compute for Apache Flink et Data Lake Analytics (DLA).
La montée en charge des ressources de stockage et de calcul ne suit pas le rythme de l'augmentation du volume de données. Une optimisation des coûts est donc nécessaire.
Les métadonnées provenant de différents systèmes de stockage sont difficiles à gérer.
Avantages
-
Gestion des métadonnées
DLF découvre et collecte automatiquement les métadonnées de plusieurs moteurs et les gère de manière centralisée pour résoudre les problèmes de silos de données.
Services professionnels
L'équipe big data d'Alibaba Cloud vous fournit des services de niveau expert.
Scénarios
Scénarios types
Dans la plupart des cas, une architecture data lake ou une architecture entrepôt de données est utilisée dans les scénarios big data.
Avantages :
Avec une architecture data lake, le système de stockage de fichiers sous-jacent est ouvert pour une ingestion de données flexible.
Avec une architecture entrepôt de données, les exigences de classe entreprise en matière d'efficacité de traitement, de gestion de données à grande échelle, de sécurité et de conformité sont satisfaites.
Les data lakes doivent être intégrés aux entrepôts de données pour suivre le rythme du développement métier. DLF et les entrepôts de données Alibaba Cloud, tels que MaxCompute, Hologres et AnalyticDB for MySQL, vous aident à créer un data lakehouse. Ce data lakehouse transfère dynamiquement les données et les ressources de calcul entre data lakes et entrepôts de données, créant ainsi un écosystème big data complet.
Avantages
-
Zéro exploitation et maintenance
DLF fournit un service entièrement géré. Il vous permet de créer un data lake dans le cloud en quelques clics.
Sécurité renforcée
DLF utilise un système unifié de gestion des permissions pour contrôler les accès aux bases de données, tables et colonnes.
Scénarios
Scénarios types
Un grand volume de données OSS de différents types doit être interrogé et analysé selon plusieurs dimensions, par exemple l'analyse en temps réel, les requêtes OLAP et la restitution des résultats vers un système métier.
Lorsque vous interrogez des données, les data lakes peuvent accéder à plusieurs moteurs de calcul dans le cloud. Il n'est pas nécessaire de transférer l'ensemble des données vers un système de requêtes.
Avantages
-
Ingestion de données en temps réel
DLF ingère les données dans un data lake en temps réel pour garantir la réactivité métier.
Découverte automatique des métadonnées
DLF capture, orchestre et prépare automatiquement les données pour l'analytique. Aucune opération manuelle complexe n'est requise.
Scénarios
Scénarios types
Les data lakes sont indispensables pour les utilisateurs en machine learning et deep learning.
Dans les scénarios de machine learning, vous pouvez rencontrer des problèmes tels que des volumes de données importants, un entraînement de modèles lent et des performances algorithmiques insuffisantes. Les data lakes doivent pouvoir se connecter à des plateformes de machine learning matures et ajuster dynamiquement les ressources GPU pour réduire les coûts.
Avantages
-
Facilité d'utilisation
DLF s'intègre de manière transparente à Machine Learning Platform for AI (PAI) et fournit de nombreuses API pour l'intégration.
Nettoyage unifié des données
DLF vous permet de nettoyer et de normaliser les données avant leur ingestion dans un data lake. Cela facilite les opérations d'analytique ultérieures avec PAI.
Scénarios sectoriels
Éducation en ligne
Une plateforme d'éducation en ligne comptant plus de 100 millions d'utilisateurs
Besoins clients
Les données telles que les supports de cours, les journaux d'application et les échantillons d'étude doivent être stockées et gérées de manière centralisée.
La lecture de cours, l'analyse hors ligne et le machine learning doivent être mis en œuvre pour différents types de données dans divers scénarios d'éducation en ligne.
Valeur client
DLF peut se connecter à OSS et à un grand nombre de moteurs de calcul pour répondre à différents besoins d'analyse.
Jeux en ligne
Un leader du divertissement interactif en Asie
Besoins clients
Les données doivent être analysées pour ajuster la difficulté des jeux, réduire les taux de drop d'objets et augmenter les taux de production de ressources. Cela permet d'améliorer l'expérience de jeu et d'augmenter le taux de rétention des joueurs.
Les ressources cloud doivent être mises à l'échelle et mises à niveau de manière dynamique. Une architecture séparant le calcul du stockage est nécessaire pour garantir l'élasticité des ressources.
Valeur client
DLF vous aide à créer un data lake dans le cloud qui sépare le stockage du calcul. DLF peut également être interconnecté avec des moteurs de calcul et d'analyse en temps réel. Cela vous permet d'ajuster votre activité en temps réel.
Divertissement interactif et nouveaux médias
Une plateforme de nouveaux médias Internet comptant plus de 100 millions d'utilisateurs actifs par mois
Besoins clients
Les métadonnées provenant de plusieurs systèmes de stockage doivent être gérées de manière centralisée. Le partage et l'analyse des données sont nécessaires au développement de l'activité.
Valeur client
DLF vous permet de gérer les métadonnées de différents systèmes de stockage de manière centralisée. Le service de découverte de métadonnées de DLF peut collecter et cataloguer les données de vos bases de données et de vos buckets Object Storage Service (OSS).
