Qu'est-ce qu'un lac de données | Architecture de base d'un lac de données

Le concept de lac de données est très en vogue actuellement. Beaucoup s'interrogent sur la manière de construire un lac de données, sur l'existence d'une solution mature chez Alibaba Cloud, sur la réalité de sa mise en œuvre, et sur la relation entre lac de données et données. Quelle est la différence entre un lac de données et une plateforme big data ? Cette série d'articles propose une analyse approfondie du lac de données.

Cet article aborde les points suivants :
1. Qu'est-ce qu'un lac de données
2. Architecture de base d'un lac de données
3. Framework de lac de données basé sur le cloud

L'article suivant présentera la différence entre un lac de données et un entrepôt de données.

Première partie. Qu'est-ce qu'un lac de données

Avant de planifier la construction d'un lac de données, il est essentiel de comprendre ce qu'est un lac de données, de clarifier les composants de base d'un projet de lac de données, puis de concevoir son architecture fondamentale.

Un lac de données est un pool de stockage unifié connecté à de multiples méthodes d'entrée de données. Il permet de stocker des données structurées, semi-structurées et non structurées de toute échelle. Le lac de données se connecte de manière transparente à diverses plateformes de calcul et d'analyse, traite et analyse directement les données, brise les silos et révèle la valeur métier. Il offre également la possibilité de convertir entre les couches chaudes et froides, couvrant ainsi l'ensemble du cycle de vie des données.

Il existe de nombreuses définitions du lac de données, mais elles s'articulent essentiellement autour des caractéristiques suivantes :
(1) Le lac de données doit fournir une capacité de stockage suffisante pour conserver toutes les données d'une entreprise ou d'une organisation.
(2) Le lac de données peut stocker des volumes massifs de données de tout type, y compris des données structurées, semi-structurées et non structurées.
(3) Les données du lac de données sont les données brutes, copies complètes des données métier. Elles conservent leur format d'origine tel qu'il existe dans le système métier.
(4) Le lac de données doit disposer de capacités complètes de gestion des données (métadonnées exhaustives), permettant de gérer les différents éléments liés aux données : sources, formats, informations de connexion, schémas de données et gestion des permissions.
(5) Le lac de données doit offrir des capacités d'analyse diversifiées, incluant sans s'y limiter : le traitement par lots, le calcul en streaming, l'analyse interactive et le machine learning. Il doit également fournir des capacités d'ordonnancement et de gestion des tâches.
(6) Le lac de données doit disposer de capacités complètes de gestion du cycle de vie des données. Il ne suffit pas de stocker les données brutes : il faut aussi pouvoir enregistrer les résultats intermédiaires des différentes analyses et traitements, et consigner l'intégralité du processus d'analyse et de traitement, afin de permettre aux utilisateurs de retracer la génération de toute donnée de manière complète et détaillée.
(7) Le lac de données doit disposer de capacités complètes d'acquisition et de diffusion des données. Il doit pouvoir prendre en charge diverses sources de données et obtenir des données complètes ou incrémentielles à partir de ces sources, puis normaliser le stockage. Le lac de données peut pousser les résultats d'analyse et de traitement vers un moteur de stockage adapté pour répondre aux différentes exigences d'accès applicatif.
(8) Prise en charge du big data, incluant un stockage à très grande échelle et des capacités de traitement de données massives évolutives.

Ainsi, un lac de données doit être une infrastructure évolutive pour le stockage, le traitement et l'analyse du big data. Orienté données, il permet l'acquisition et le stockage complets de données de toute source, toute vitesse, toute échelle et tout type, un traitement multimode et une gestion complète du cycle de vie. Grâce à l'interaction et à l'intégration avec diverses sources de données externes hétérogènes, il prend en charge différentes applications de niveau entreprise.

Deuxième partie. Architecture de base du lac de données

Un lac de données possède une architecture plate, car les données peuvent être non structurées, semi-structurées ou structurées et provenir de diverses sources au sein d'une organisation, tandis qu'un entrepôt de données stocke les données dans des fichiers ou des dossiers. Les lacs de données peuvent être hébergés sur site ou dans le cloud.

Grâce à ses caractéristiques architecturales, le lac de données peut être étendu massivement jusqu'à des exaoctets. C'est important, car lors de la création d'un lac de données, on ne sait souvent pas à l'avance quel volume de données il faudra stocker. Les systèmes de stockage traditionnels ne permettent pas une telle mise à l'échelle.

Cette architecture facilite grandement le travail des data scientists, qui peuvent explorer et exploiter les données de l'entreprise, partager et croiser des données (y compris des données hétérogènes de différents domaines) pour poser des questions et découvrir de nouvelles analyses. Ils peuvent également analyser les données du lac à l'aide de l'analyse big data et du machine learning.

Bien que les données n'aient pas de schéma fixe avant leur stockage dans le lac de données, une bonne gouvernance des données permet d'éviter efficacement les marécages de données. Les données doivent être associées à des métadonnées lors de leur stockage dans le lac de données afin de garantir leur accessibilité ultérieure.

Troisième partie. Framework de lac de données basé sur le cloud

Les piliers d'un lac de données comprennent un stockage de données évolutif et durable, des mécanismes de collecte et d'organisation des données, ainsi que des outils de traitement, d'analyse et de partage des résultats. Nous nous concentrons donc sur les technologies clés que tout lac de données moderne doit intégrer pour prendre en charge tous les types de données du big data.

Le cloud offre des ressources illimitées. Les services cloud sont particulièrement adaptés aux lacs de données, car l'infrastructure cloud peut fournir des ressources quasi illimitées à la demande, en quelques minutes ou secondes, sans aucune préoccupation. Les organisations ne paient que pour ce qu'elles utilisent, ce qui permet une prise en charge dynamique des utilisateurs et des charges de travail de toute taille, sans compromis sur les performances.

Réduire les coûts grâce à la technologie cloud. Les services cloud offrent à toute organisation une solution cloud qui évite les investissements initiaux dans du matériel, des logiciels et d'autres infrastructures coûteux, ainsi que les coûts de maintenance, de mise à jour et de sécurisation des systèmes sur site.

La technologie cloud offre des points d'intégration naturels. On estime que jusqu'à 80 % des données à analyser proviennent des applications métier, des magasins de données opérationnelles, des données de clickstream, des plateformes de médias sociaux, des objets IoT et des données en streaming temps réel. Intégrer ces données dans le cloud est beaucoup plus simple et moins coûteux que de construire un centre de données sur site.

Intégration native de NoSQL. NoSQL désigne une technologie capable de stocker et d'analyser des données sous des formes actualisées, telles que celles générées par les ordinateurs et les médias sociaux, afin d'enrichir et d'élargir l'analyse de données d'une organisation. Il est bien connu que les entrepôts de données traditionnels ne peuvent pas gérer efficacement ces types de données. C'est pourquoi de nouveaux systèmes ont émergé ces dernières années pour traiter ces données semi-structurées et non structurées, telles que JSON, Avro et XML.

Prise en charge des compétences existantes. Le lac de données prend en charge les fonctionnalités nécessaires pour stocker et traiter efficacement tout type de données : gestion des données, transformation, intégration, visualisation, business intelligence et outils d'analyse compatibles avec les entrepôts de données SQL. La place prépondérante du SQL standard signifie également qu'un grand nombre de personnes possèdent des compétences SQL. D'autres langages de programmation permettent en outre d'extraire et d'analyser des données.

Les avantages inhérents du cloud en matière de coût, d'échelle, de performances, de facilité d'utilisation et de sécurité doivent être clairement reconnus, car ils ont un impact direct sur les plans et les résultats globaux du lac de données.

Pour en savoir plus sur la coexistence du cloud et du lac de données, participez au « Sommet mondial en ligne Data Lake 2022 d'Alibaba Cloud » et découvrez les dernières tendances.

Articles associés

Découvrir d'autres offres spéciales

  1. Short Message Service (SMS) et service de messagerie

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone Contacter
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.