DataHub

Alibaba Cloud propose DataHub, un service de traitement de données en streaming. DataHub vous permet de publier et de vous abonner à des flux de données en streaming. Vous pouvez ainsi analyser vos données en streaming et créer des applications.

Avantages

  • Haute stabilité

    DataHub est issu du système de transmission en temps réel d'Alibaba Group. Au fil des années, DataHub a fait ses preuves en termes de stabilité et de fiabilité lors du Double 11.

  • #
    Haut débit

    Jusqu'à plusieurs téraoctets de données peuvent être écrits dans un topic par jour. Jusqu'à plusieurs centaines de Go de données peuvent être écrits dans un shard par jour.

  • #
    Économique

    DataHub est une solution clé en main qui vous permet de transmettre des données à moindre coût grâce au mode de facturation par paiement à l'utilisation.

  • #
    Écosystème intégré

    DataHub repose sur le système d'exploitation distribué Apsara et s'intègre en profondeur aux systèmes big data d'Alibaba Cloud. DataHub se connecte de manière transparente à MaxCompute, Realtime Compute for Apache Flink et Hologres.

Fonctionnalités de synchronisation des données

Des fonctionnalités complètes d'import et de synchronisation des données, ainsi qu'une mise en cache et une interaction flexibles.

Import de données

DataHub prend en charge divers SDK et API et fournit plusieurs plug-ins tiers tels que Flume et Logstash. Vous pouvez importer des données dans DataHub de manière efficace.

Livraison de données

Le module DataConnector synchronise les données importées vers les systèmes de stockage et d'analyse en aval en temps réel, tels que MaxCompute, OSS et Tablestore. Votre charge de travail s'en trouve considérablement réduite.

Cache de données

DataHub prend en charge des planifications de cache flexibles, la consommation répétée dans les systèmes en aval et la sauvegarde automatique pour garantir une haute fiabilité des données.

Interfaces multiples

Vous pouvez accéder à DataHub via la console web ou en utilisant les API et SDK.

Scénarios

Sources de données hétérogènes et systèmes big data en aval multiples

Vous pouvez importer en temps réel dans DataHub des données hétérogènes générées par des applications, des sites web, des appareils IoT ou des bases de données. DataHub vous permet de gérer ces données de manière unifiée et de les transmettre à des systèmes en aval tels que des systèmes d'analyse et d'archivage. Vous pouvez ainsi construire un pipeline de données en streaming et en extraire davantage de valeur.

Avantages

  • Découplage système

    DataHub permet de découpler les systèmes big data des systèmes métier. DataHub permet également de découpler les composants d'un système big data.

  • Canal en temps réel

    DataHub permet de transmettre les données métier aux systèmes big data, ce qui raccourcit le cycle d'analyse des données.

Analyse en temps réel de la publicité en ligne

Pour les entreprises du secteur Internet, la publicité reste une source de revenus majeure. La publicité est essentiellement un processus de vente qui nécessite une prise de décision en temps réel et une conversion en ligne. Avec les solutions de calcul hors ligne traditionnelles, les données publicitaires générées dans la journée ne sont traitées que le lendemain. Cependant, ces solutions ne répondent plus aux exigences métier. L'ensemble du secteur a besoin de solutions de calcul en temps réel.

Avantages

  • Convergence des sources de données en temps réel

    DataHub vous permet de collecter les informations utilisateur à partir de différentes sources de données. Realtime Compute for Apache Flink vous permet ensuite de surveiller les publicités en temps réel, de signaler les liens invalides et de détecter le trafic frauduleux.

  • Analyse et prise de décision en temps réel

    Les données provenant de différentes plateformes sont traitées de manière unifiée afin d'éviter les silos de données. Vous pouvez ainsi réagir rapidement aux évolutions métier en temps réel, éliminer les pertes de trafic et accroître la visibilité publicitaire.

L'entrepôt de données en temps réel en remplacement des bases de données traditionnelles

Les exigences croissantes en matière d'analyse et de traitement des données métier en temps réel représentent un défi majeur pour les entrepôts de données hors ligne traditionnels. Pour relever ce défi, vous pouvez utiliser DataHub et Realtime Compute for Apache Flink afin de construire un entrepôt de données en temps réel basé sur l'architecture Kappa. Cet entrepôt se divise en trois couches : Data Warehouse Detail (DWD), Data Warehouse Summary (DWS) et Application Data Service (ADS).

Avantages

  • Architecture Kappa unifiée

    Par rapport à l'architecture Lambda, l'architecture Kappa utilise un seul lien au lieu des deux liens traditionnels, ce qui réduit les coûts de maintenance.

  • Big data en temps réel

    DataHub vous permet de réutiliser vos données en temps réel selon vos besoins métier. Cette fonctionnalité réduit les calculs et le stockage redondants, et unifie les indicateurs métier.

产品动态

      查看全部日志 >
      phone Contacter
      Hi, I'm Alibaba Cloud AI Assistant!
      I can help with questions and solutions.