O DataWorks capacita empresas de diversos setores a superar desafios relacionados a dados e extrair todo o valor de suas informações. Explore estas histórias de sucesso para entender como os clientes criam soluções inovadoras com o DataWorks.
Novo varejo: Mid-end de dados na nuvem para a RT-Mart

-
Contexto
Para acelerar a transformação digital e adaptar-se ao novo cenário do varejo, a RT-Mart planejou migrar todo o sistema de TI para a Alibaba Cloud em dois anos, substituindo data centers autogerenciados. Simultaneamente, firmou parceria com a Alibaba Cloud para iniciar um projeto de mid-end de dados. Essa iniciativa visava reduzir o custo total de propriedade (TCO) e aproveitar o ecossistema em nuvem para converter dados em valor de negócio.
-
O desafio
O sistema existente, baseado em Hadoop, apresentava altos custos de manutenção e problemas persistentes de estabilidade, impactando severamente as operações e análises de negócios.
Devido ao rápido crescimento dos negócios online, a empresa enfrentava um acúmulo significativo de solicitações. Era necessária uma solução abrangente capaz de escalar de forma flexível e ágil para atender aos requisitos técnicos em evolução.
-
A solução e os benefícios
Com o MaxCompute Migration Assist (MMA), a RT-Mart migrou mais de 400 TB de dados históricos em apenas 15 dias, garantindo alta precisão e uma transição suave para a nuvem. Ao adotar a plataforma de big data Apsara com DataWorks e MaxCompute, a empresa aumentou significativamente a eficiência do desenvolvimento de dados e estabeleceu um mid-end de dados robusto.
Fintech: Data lakehouse para uma empresa de finanças digitais

-
Contexto
O data lake de primeira geração da empresa foi construído sobre Hadoop e OSS. No entanto, o mid-end de dados utilizava o MaxCompute como motor de execução e armazenamento. O uso desses dois sistemas heterogêneos gerava redundância no armazenamento, inconsistência em metadados e permissões, além de dificultar o compartilhamento de dados e computação entre o data lake e o data warehouse.
-
O desafio
Conforme ilustrado no diagrama de arquitetura, os motores MaxCompute e E-MapReduce eram utilizados para cenários de negócios distintos. A empresa precisava usar o Data Lake Formation (DLF) da Alibaba Cloud para unificar a gestão de metadados e permissões. Além disso, buscava implementar governança de dados de ponta a ponta com o DataWorks para elevar a qualidade e a usabilidade das informações.
-
A solução e os benefícios
A solução centralizou os metadados do E-MapReduce no DLF e adotou o OSS para armazenamento unificado. Com a construção de uma arquitetura de data lakehouse, conectou-se o data lake baseado em E-MapReduce ao data warehouse baseado em MaxCompute, permitindo o fluxo livre de dados e recursos de computação entre eles.
Implementou-se também o armazenamento em camadas em todo o lakehouse. O mid-end de dados armazenava tabelas intermediárias de modelagem dimensional para dados do data lake no MaxCompute, enquanto o E-MapReduce ou outros motores consumiam a camada ADS.
Nova energia: Governança de dados de ponta a ponta para uma empresa de energia com DataWorks

-
Contexto
Várias subsidiárias acumularam muitos sistemas ao longo dos anos, resultando em stacks tecnológicos complexos e diversificados.
Os dados estavam dispersos por diferentes sistemas, com padrões inconsistentes, o que criava lacunas entre conjuntos de dados e inviabilizava análises eficazes.
As responsabilidades de gestão de dados não eram claras, faltava governança e não existia um mecanismo eficaz de compartilhamento de informações.
-
O desafio
Construir um mid-end de dados com DataWorks e MaxCompute para eliminar silos de informação.
Aprimorar as capacidades em tempo real do mid-end de dados usando Realtime Compute e análises interativas do MaxCompute (Hologres).
Implementar governança de dados de ponta a ponta com o DataWorks para melhorar a qualidade e a usabilidade dos dados.
-
A solução e os benefícios
Criação de um sistema inteligente de marketing B2B para viabilizar o modelo de manufatura inteligente integrada à internet.
Desenvolvimento de um mid-end de dados unificado para processamento em lote e em tempo real, com um pipeline completo de aplicações de big data para atender a várias unidades de negócios essenciais.
A governança de dados de ponta a ponta aumentou a usabilidade das informações, permitindo que os dados fluíssem livremente dentro do mid-end com precisão, atualidade e consistência, gerando uma economia de CNY 100 milhões.
Aumento da eficiência nas iterações de negócios, reduzindo o intervalo de atualização de dados de um dia para 10 minutos e o prazo para lançar novos requisitos de uma semana para um dia.
Internet: Data warehouse na nuvem para a GoGoX 
-
Contexto
A GoGoX dedica-se a soluções digitais como conectividade de rede, capacidade de transporte compartilhada, processos orientados por dados e correspondência inteligente. A empresa consolida a capacidade de transporte fragmentada em sua plataforma e utiliza big data para alinhar com precisão essa capacidade à demanda do mercado, alcançando economia de energia, reduzindo taxas de viagens vazias, melhorando a eficiência do setor e promovendo ativamente a logística verde.
-
O desafio
A eficiência no processamento de grandes volumes de dados estava diminuindo, e a duração da computação offline era instável.
A computação em tempo real tinha altos custos de desenvolvimento e manutenção, exigindo uma governança abrangente do data warehouse.
-
A solução e os benefícios
Ao aproveitar a plataforma de big data Apsara, a GoGoX reduziu os custos de infraestrutura em mais de 30% e dobrou a eficiência do desenvolvimento de dados. A migração do Java Storm para o Flink SQL encurtou significativamente os ciclos de desenvolvimento de computação em tempo real, simplificou a manutenção e melhorou a consistência dos dados, aumentando a precisão e a atualidade dos painéis de monitoramento de negócios. Os usuários podem focar mais na lógica de negócios, acelerando a transformação digital em tempo real. Além disso, o suporte operacional 24/7 da Alibaba Cloud garantiu a estabilidade do cluster sem tempo de inatividade.
Internet: Data warehouse na nuvem para a Babytree 
-
Contexto
Fundada em 2007, a Babytree é a maior e mais ativa plataforma de comunidade parental da China. Como uma das primeiras plataformas de comunidade B2C da internet, a Babytree construiu seus próprios clusters IDC desde cedo, e a escala continuou a crescer.
-
O desafio
A utilização do cluster era alta, o desempenho era baixo e havia uma necessidade urgente de governança abrangente de big data.
O investimento anual em infraestrutura de big data baseada em IDC era elevado, e a empresa desejava reduzir custos e aumentar a eficiência.
-
A solução e os benefícios
Iniciando com uma estratégia geral de migração para a nuvem focada em redução de custos e melhoria de eficiência, a transição para MaxCompute, Realtime Compute e DataWorks proporcionou ganhos de desempenho superiores a 10 vezes para determinadas tarefas. O armazenamento foi reduzido de 3 PB em Hadoop autogerenciado para 900 TB. Utilizando as capacidades de processamento de dados em tempo real do Flink, a Babytree ativou cenários como rastreamento de comportamento do usuário em tempo real por ID e tipo de conteúdo, recuperação de ID de chat em grupo em tempo real e obtenção de informações de publicação de artigos instantaneamente. As recomendações em tempo real baseadas em Flink também aumentaram as taxas de conversão. Os custos gerais da plataforma de big data foram reduzidos em mais de 30%.
Jogos: Operações de pipeline completo para a DeNA China 
-
Contexto
A DeNA é uma empresa líder em serviços de internet. À medida que os ciclos de vida dos projetos de jogos se tornam mais curtos, cada fase exige controle preciso e em tempo real, criando a necessidade de um sistema de operações de dados eficiente e econômico.
-
O desafio
A empresa operava dois clusters Hadoop (1,0 e 2,0) com uma arquitetura complexa, enfrentando gargalos na estabilidade da plataforma, segurança e escalabilidade elástica.
As fontes de log eram diversas e exigiam alta capacidade de tempo real. O serviço de coleta de arquivos baseado em fluentd enfrentava gargalos significativos de desempenho e estabilidade conforme o volume de logs crescia.
O desenvolvimento de dados baseado em scripts manuais resultava em baixa eficiência no suporte aos negócios, e o desempenho de computação do Hive não atendia aos requisitos.
-
A solução e os benefícios
A DeNA China foi a primeira empresa de jogos a utilizar as ferramentas Lightning Cube e MMA. Sem uma conexão de rede dedicada, a empresa concluiu a migração de mais de 300 TB de dados incrementais do RDS acumulados ao longo de 10 anos e 50 TB de dados históricos em pouco mais de um mês, um projeto de considerável complexidade técnica. Em comparação com o sistema anterior de gerenciamento de tarefas Airflow open-source baseado em Python, o DataWorks oferece as seguintes vantagens:
O gerenciamento de tarefas é claro visualmente, permitindo identificação rápida de erros e navegação instantânea para o código da tarefa relevante para correções.
Com centenas de fontes de dados para operações de jogos, uma configuração única permite reutilização em vários requisitos de serviço de dados, eliminando trabalho redundante.
A abstração tecnológica geral significa que o agendamento de recursos e outras tarefas de infraestrutura não exigem esforço extra ou codificação adicional, permitindo que a equipe foque no desenvolvimento e na gestão.
Após a migração, a plataforma de big data Apsara cobriu todo o pipeline de operações de dados de jogos, desde a coleta > armazenamento e computação > análise em tempo real/lote.