Um componente-chave do Data Lake Framework nativo da nuvem
Um data lake é um repositório centralizado usado para big data e computação AI. Ele permite que você armazene dados estruturados e não estruturados em qualquer escala. O Data Lake Formation (DLF) é um componente-chave da estrutura de data lake nativa da nuvem. DLF fornece uma maneira fácil de construir um data lake nativo da nuvem. Ele se integra perfeitamente a uma variedade de mecanismos de computação e permite gerenciar os metadados em data lakes de maneira centralizada e controlar as permissões de classe empresarial.
•Fácil recolha dos dados: coleta sistematicamente dados estruturados, semiestruturados e não estruturados e suporta armazenamento massivo de dados.
•Arquitetura flexível: usa uma arquitetura que separa a computação do armazenamento. Você pode planejar recursos sob demanda a baixo custo. Isso melhora a eficiência do processamento de dados para atender aos requisitos comerciais em rápida mudança.
•Fácil gestão dos dados: usa armazenamento unificado de dados, armazena separadamente dados frios e quentes e gerencia o ciclo de vida dos dados. Isso resolve uma variedade de problemas de O&M, como a falha na cópia de dados entre clusters.
•Extração fácil do valor: conecta-se a diferentes tipos de plataformas de computação e análise. Isso resolve os problemas do silo de dados e fornece insights sobre o valor comercial.
Funcionalidades
-
Ingestão de dados
Vários tipos de dados e canais
Permite que você limpe os dados de maneira centralizada. -
Serviço de metadados
Descoberta inteligente de metadados
Coleta metadados de diferentes fontes de dados para facilitar o gerenciamento centralizado. -
Gerenciamento de permissão
Gerenciamento de permissão de dados classe empresarial
Permite que você defina permissões em bancos de dados, tabelas e campos. -
Acesso multi-motor
Acesso a vários mecanismos computacionais upstream
Ajuda você a implantar uma solução de data lake de ponta a ponta. -
Ecossistema aberto
Compatível com metastore Hive
Fornece APIs em várias linguagens para fácil integração. -
Aceleração de dados
Aceleração de dados baseada em JindoFS
Acelera a análise do data lake com alto desempenho.
Cenários
Cenários
Cenários típicos
Uma plataforma de processamento e análise de dados precisa ser construída sobre serviços no ecossistema de big data do Alibaba Cloud, como E-MapReduce, Realtime Compute for Apache Flink, análise de Data Lake (DLA).
A expansão dos recursos de armazenamento e computação não acompanha o aumento do volume de dados. Portanto, a otimização do custo é necessária.
Metadados de diferentes sistemas de armazenamento são difíceis de gerenciar.
Benefícios
-
Gestão metadados
O DLF pode descobrir e coletar metadados automaticamente de vários mecanismos e gerenciar os metadados de maneira centralizada para resolver os problemas do silo de dados.
Serviços profissionais
A equipe de big data do Alibaba Cloud fornece serviços de nível especializado.
Cenários
Cenários típicos
Na maioria dos casos, uma arquitetura de data lake ou armazém de dados é usada em cenários de big data.
Vantagens:
Se uma arquitetura de data lake for usada, o sistema de armazenamento de arquivos subjacente será aberto para tornar a ingestão flexível.
Se uma arquitetura de armazém de dados for usada, os requisitos de classe empresarial para eficiência de processamento de dados, gerenciamento de dados em larga escala, segurança e conformidade podem ser atendidos.
Os data lakes precisam ser integrados aos armazéns de dados para acompanhar o desenvolvimento dos negócios. Os armazéns de dados DLF e Alibaba Cloud, como MaxCompute, Hologres e AnalyticDB for MySQL, ajudam você a criar um lago de dados. O lakehouse transfere dinamicamente dados e recursos computacionais entre data lakes e armazéns. Dessa forma, um ecossistema completo de big data é construído.
Benefícios
-
Zero O&M
O DLF fornece um serviço totalmente gerenciado. Ele permite que você construa um data lake na nuvem com apenas alguns cliques.
Alta segurança
O DLF usa um sistema unificado de gerenciamento de permissões para controlar permissões em bancos de dados, tabelas e colunas.
Cenários
Cenários típicos
Uma grande quantidade de diferentes tipos de dados OSS precisa ser consultada e analisada em várias dimensões, por exemplo, análise em tempo real, consulta OLAP e saída de resultados para um sistema de negócios.
Quando você consulta dados, os data lakes podem acessar vários mecanismos de computação na nuvem. Você não precisa transferir todos os dados para um sistema de consulta.
Benefícios
-
Ingestão de dados em tempo real
A DLF ingere dados em um data lake em tempo real para garantir a pontualidade dos negócios.
Descoberta automática metadados
O DLF pode capturar, orquestrar e preparar automaticamente dados para análise. Operações manuais complexas não são necessárias.
Cenários
Cenários típicos
Data lakes são necessários para usuários em cenários de machine learning e deep learning.
Em cenários de machine learning, você pode encontrar problemas, como grandes quantidades de dados, treinamento lento de modelos e desempenho ruim do algoritmo. Os data lakes devem poder se conectar a plataformas maduras de machine learning e ajustar dinamicamente os recursos da GPU para reduzir custos.
Benefícios
-
Fácil de usar
O DLF integra-se perfeitamente ao Machine Learning Platform for AI (PAI) e fornece uma variedade de APIs para integração.
Limpeza unificada dos dados
O DLF permite limpar e normalizar os dados antes que os dados sejam ingeridos em um data lake. Isso ajuda você a realizar operações de análise subsequentes usando o PAI.
Cenários industriais
Educação online
Uma plataforma educacional online com mais de 100 milhões de usuários
Requisitos do cliente
Os dados, como materiais didáticos, registros de aplicativos e amostras de estudo, precisam ser armazenados e gerenciados de maneira centralizada.
A reprodução de cursos, a análise offline e o aprendizado de máquina precisam ser implementados para vários tipos de dados em diferentes cenários educacionais online.
Valor do cliente
O DLF pode se conectar ao OSS e a um grande número de mecanismos de computação para atender a diferentes requisitos analíticos.
Jogos online
Empresa líder em entretenimento interativo na Ásia
Requisitos do cliente
Os dados precisam ser analisados para ajustar as dificuldades do jogo, reduzir as taxas de queda e aumentar as taxas de produção de recursos. Isso ajuda a melhorar a experiência de jogo e aumentar a taxa de retenção dos jogadores.
Os recursos em nuvem precisam ser dimensionados e atualizados dinamicamente. Uma arquitetura que separa a computação do armazenamento é necessária para garantir a elasticidade do recurso.
Valor do cliente
O DLF ajuda você a criar um data lake na nuvem que separa o armazenamento da computação. Além disso, o DLF pode ser interconectado com mecanismos de computação e análise em tempo real. Isso ajuda você a ajustar os negócios em tempo real.
Novas mídias de entretenimento interativo
Uma nova plataforma de mídia na internet com mais de 100 milhões de usuários ativos por mês
Requisitos do cliente
Os metadados de vários sistemas de armazenamento precisam ser gerenciados de maneira centralizada. O compartilhamento de dados é necessário para o desenvolvimento do negócio.
Valor do cliente
O DLF permite gerenciar os metadados de diferentes sistemas de armazenamento de maneira centralizada. O serviço de detecção de metadados do DLF pode coletar e catalogar dados de seus bancos de dados e buckets Object Storage Service (OSS).
