DataWorks aide les entreprises de nombreux secteurs à surmonter leurs défis liés aux données et à exploiter pleinement la valeur de leur patrimoine informationnel. Découvrez ces succès pour comprendre comment nos clients construisent des solutions innovantes avec DataWorks.
Nouveau commerce de détail : Plateforme de données cloud pour RT-Mart

-
Contexte
Pour accélérer sa transformation numérique et s'adapter au paysage du nouveau commerce de détail, RT-Mart a prévu de migrer l'intégralité de son système informatique vers Alibaba Cloud en deux ans, abandonnant ainsi ses centres de données autogérés. Parallèlement, l'entreprise a lancé un projet de plateforme de données centrale (data mid-end) en partenariat avec Alibaba Cloud. Cette initiative visait à réduire le coût total de possession (TCO) et à utiliser l'écosystème cloud pour transformer les données en valeur commerciale.
-
Le défi
Son système existant basé sur Hadoop entraînait des coûts de maintenance élevés et des problèmes de stabilité persistants, affectant gravement les opérations commerciales et les analyses.
En raison de la croissance rapide de son activité en ligne, l'entreprise faisait face à un important arriéré de demandes. Elle avait besoin d'une solution complète capable de s'adapter avec flexibilité et rapidité pour soutenir l'évolution de ses exigences techniques.
-
La solution et les avantages
Grâce à MaxCompute Migration Assist (MMA), RT-Mart a migré sans accroc plus de 400 To de données historiques en seulement 15 jours, garantissant une grande précision et une adoption fluide du cloud. En s'appuyant sur la plateforme big data Apsara avec DataWorks et MaxCompute, l'entreprise a considérablement amélioré l'efficacité du développement des données et mis en place une plateforme de données centrale robuste.
Fintech : Data lakehouse pour une entreprise de finance internet

-
Contexte
La première génération de data lake de l'entreprise était construite sur Hadoop et OSS. Cependant, sa plateforme de données centrale utilisait MaxCompute comme moteur d'exécution et de stockage. L'utilisation de deux systèmes hétérogènes entraînait un stockage redondant, des incohérences dans les métadonnées et les autorisations, et entravait le partage des données et des ressources de calcul entre le data lake et l'entrepôt de données.
-
Le défi
Comme le montre le schéma d'architecture, les moteurs MaxCompute et E-MapReduce étaient utilisés pour différents scénarios métier. L'entreprise devait utiliser Data Lake Formation (DLF) d'Alibaba Cloud pour unifier la gestion des métadonnées et des autorisations. Elle visait également à mettre en œuvre une gouvernance des données de bout en bout avec DataWorks afin d'améliorer la qualité et l'utilisabilité des données.
-
La solution et les avantages
La solution a centralisé les métadonnées d'E-MapReduce dans DLF et a utilisé OSS pour unifier le stockage. En construisant une architecture data lakehouse, elle a connecté le data lake basé sur E-MapReduce à l'entrepôt de données basé sur MaxCompute, permettant aux données et aux ressources de calcul de circuler librement entre eux.
Cette approche a mis en place un stockage hiérarchisé au sein du lakehouse. La plateforme de données centrale stockait les tables intermédiaires de modélisation dimensionnelle pour les données du lac dans MaxCompute, tandis qu'E-MapReduce ou d'autres moteurs consommaient la couche ADS.
Nouvelle énergie : Gouvernance des données de bout en bout pour une entreprise énergétique avec DataWorks

-
Contexte
Plusieurs filiales avaient accumulé un grand nombre de systèmes au fil des années, résultant en des stacks technologiques complexes et diversifiés.
Les données étaient dispersées dans les systèmes avec des normes incohérentes, créant des écarts entre les jeux de données et rendant toute analyse efficace impossible.
Les responsabilités de gestion des données n'étaient pas claires, la gouvernance des données faisait défaut et aucun mécanisme de partage des données efficace n'était en place.
-
Le défi
Construire une plateforme de données centrale avec DataWorks et MaxCompute pour briser les silos de données.
Améliorer les capacités temps réel de la plateforme centrale grâce à Realtime Compute et à l'analytique interactive MaxCompute (Hologres).
Mettre en œuvre une gouvernance des données de bout en bout avec DataWorks pour améliorer la qualité et l'utilisabilité des données.
-
La solution et les avantages
Construction d'un système de marketing intelligent B2B pour permettre la mise en œuvre d'un modèle associant fabrication intelligente et internet.
Mise en place d'une plateforme de données centrale unifiée pour le traitement par lots et en temps réel, dotée d'un pipeline complet d'applications big data au service de plusieurs unités commerciales principales.
La gouvernance des données de bout en bout a amélioré l'utilisabilité des données, permettant leur circulation libre au sein de la plateforme centrale tout en garantissant exactitude, actualité et cohérence, ce qui a généré des économies de 100 millions de CNY.
L'efficacité des itérations métier a été améliorée en réduisant l'intervalle de rafraîchissement des données d'une journée à 10 minutes et le délai de lancement des nouvelles exigences d'une semaine à un jour.
Internet : Entrepôt de données cloud pour GoGoX 
-
Contexte
GoGoX s'est engagée dans des solutions numériques telles que la connectivité réseau, le partage de capacité de transport, les processus pilotés par les données et la mise en correspondance intelligente. L'entreprise consolide la capacité de transport fragmentée sur sa plateforme et utilise le big data pour faire correspondre avec précision l'offre à la demande du marché, réalisant ainsi des économies d'énergie, réduisant les taux de trajets à vide, améliorant efficacement l'efficacité du secteur et promouvant activement la logistique verte.
-
Le défi
L'efficacité du traitement des volumes massifs de données diminuait et les durées de calcul des données hors ligne étaient instables.
Le calcul en temps réel présentait des coûts de développement et de maintenance élevés, et une gouvernance complète de l'entrepôt de données s'imposait.
-
La solution et les avantages
En tirant parti de la plateforme big data Apsara, GoGoX a réduit ses coûts d'infrastructure de plus de 30 % et doublé l'efficacité du développement des données. La migration de Java Storm vers Flink SQL a considérablement raccourci les cycles de développement du calcul en temps réel, simplifié la maintenance et amélioré la cohérence des données, renforçant ainsi la précision et l'actualité des tableaux de bord de surveillance métier. Les utilisateurs peuvent se concentrer davantage sur la logique métier, accélérant la transformation en temps réel des activités. De plus, le support opérationnel 24h/24 et 7j/7 d'Alibaba Cloud a garanti la stabilité du cluster avec zéro temps d'arrêt.
Internet : Entrepôt de données cloud pour Babytree 
-
Contexte
Fondée en 2007, Babytree est la plus grande et la plus active plateforme communautaire dédiée à la parentalité en Chine. En tant que l'une des premières plateformes communautaires internet B2C, Babytree a construit très tôt ses propres clusters IDC, dont l'échelle n'a cessé de croître.
-
Le défi
L'utilisation du cluster était élevée, les performances médiocres et une gouvernance complète du big data était urgemment nécessaire.
L'investissement annuel dans l'infrastructure big data basée sur les centres de données (IDC) était élevé et l'entreprise souhaitait réduire les coûts et améliorer l'efficacité.
-
La solution et les avantages
Dans le cadre d'une stratégie globale de migration vers le cloud axée sur la réduction des coûts et l'amélioration de l'efficacité, le passage à MaxCompute, Realtime Compute et DataWorks a permis d'obtenir des gains de performance supérieurs à 10 fois pour certaines tâches. Le stockage est passé de 3 Po sur Hadoop autogéré à 900 To. En exploitant les capacités de traitement des données en temps réel de Flink, Babytree a activé des scénarios tels que le suivi en temps réel du comportement des utilisateurs par ID utilisateur et type de contenu, la récupération en temps réel des ID de groupes de discussion et la recherche en temps réel des informations de publication d'articles. Les recommandations en temps réel basées sur Flink ont également augmenté les taux de conversion. Les coûts globaux de la plateforme big data ont été réduits de plus de 30 %.
Jeux vidéo : Opérations de pipeline complet pour DeNA China 
-
Contexte
DeNA est une entreprise leader dans les services internet. Alors que les cycles de vie des projets de jeux deviennent plus courts, chaque phase nécessite un contrôle précis et en temps réel, créant ainsi le besoin d'un système d'exploitation des données rentable et efficace.
-
Le défi
L'entreprise exploitait deux clusters Hadoop (1,0 et 2,0) avec une architecture complexe, et atteignait des goulots d'étranglement en matière de stabilité de la plateforme, de sécurité et d'évolutivité élastique.
Les sources de journaux étaient diverses et nécessitaient de fortes capacités en temps réel. Le service de collecte de fichiers basé sur fluentd faisait face à d'importants goulets d'étranglement de performance et de stabilité à mesure que le volume des journaux augmentait.
Le développement des données basé sur des scripts manuels entraînait une faible efficacité du support métier, et les performances de calcul de Hive ne répondaient pas aux exigences.
-
La solution et les avantages
DeNA China a été la première entreprise de jeux vidéo à utiliser les outils Lightning Cube et MMA. Sans connexion réseau dédiée, l'entreprise a achevé la migration de plus de 300 To de données incrémentielles RDS accumulées sur 10 ans et de 50 To de données historiques en un peu plus d'un mois, un projet d'une complexité technique considérable. Par rapport au précédent système de gestion des tâches Airflow open source basé sur Python, DataWorks offre les avantages suivants :
La gestion des tâches est claire d'un coup d'œil, avec une identification rapide des erreurs et une navigation instantanée vers le code de la tâche concernée pour les corrections.
Avec des centaines de sources de données pour les opérations de jeu, une configuration unique permet la réutilisation pour plusieurs besoins de service de données, éliminant ainsi les travaux redondants.
L'abstraction technologique globale signifie que l'ordonnancement des ressources et d'autres tâches d'infrastructure ne nécessitent aucun effort supplémentaire ni codage additionnel, permettant à l'équipe de se concentrer sur le développement et la gestion.
Après la migration, la plateforme big data Apsara couvrait l'intégralité du pipeline d'exploitation des données de jeu, de la collecte des données > au stockage et calcul > jusqu'à l'analyse en temps réel/par lots.