Data Lake Formation

Uma solução end-to-end para construir eficientemente um data lake seguro

Um componente-chave do Data Lake Framework nativo da nuvem

Um data lake é um repositório centralizado usado para big data e computação AI. Ele permite que você armazene dados estruturados e não estruturados em qualquer escala. O Data Lake Formation (DLF) é um componente-chave da estrutura de data lake nativa da nuvem. DLF fornece uma maneira fácil de construir um data lake nativo da nuvem. Ele se integra perfeitamente a uma variedade de mecanismos de computação e permite gerenciar os metadados em data lakes de maneira centralizada e controlar as permissões de classe empresarial.

Fácil recolha dos dados: coleta sistematicamente dados estruturados, semiestruturados e não estruturados e suporta armazenamento massivo de dados.
Arquitetura flexível: usa uma arquitetura que separa a computação do armazenamento. Você pode planejar recursos sob demanda a baixo custo. Isso melhora a eficiência do processamento de dados para atender aos requisitos comerciais em rápida mudança.
Fácil gestão dos dados: usa armazenamento unificado de dados, armazena separadamente dados frios e quentes e gerencia o ciclo de vida dos dados. Isso resolve uma variedade de problemas de O&M, como a falha na cópia de dados entre clusters.
Extração fácil do valor: conecta-se a diferentes tipos de plataformas de computação e análise. Isso resolve os problemas do silo de dados e fornece insights sobre o valor comercial.

Funcionalidades

  • Ingestão de dados

    Vários tipos de dados e canais
    Permite que você limpe os dados de maneira centralizada.

  • Serviço de metadados

    Descoberta inteligente de metadados
    Coleta metadados de diferentes fontes de dados para facilitar o gerenciamento centralizado.

  • Gerenciamento de permissão

    Gerenciamento de permissão de dados classe empresarial
    Permite que você defina permissões em bancos de dados, tabelas e campos.

  • Acesso multi-motor

    Acesso a vários mecanismos computacionais upstream
    Ajuda você a implantar uma solução de data lake de ponta a ponta.

  • Ecossistema aberto

    Compatível com metastore Hive
    Fornece APIs em várias linguagens para fácil integração.

  • Aceleração de dados

    Aceleração de dados baseada em JindoFS
    Acelera a análise do data lake com alto desempenho.

Cenários

Cenários

Cenários típicos

Uma plataforma de processamento e análise de dados precisa ser construída sobre serviços no ecossistema de big data do Alibaba Cloud, como E-MapReduce, Realtime Compute for Apache Flink, análise de Data Lake (DLA).
A expansão dos recursos de armazenamento e computação não acompanha o aumento do volume de dados. Portanto, a otimização do custo é necessária.
Metadados de diferentes sistemas de armazenamento são difíceis de gerenciar.

Benefícios

  • Gestão metadados
    O DLF pode descobrir e coletar metadados automaticamente de vários mecanismos e gerenciar os metadados de maneira centralizada para resolver os problemas do silo de dados.

    Serviços profissionais
    A equipe de big data do Alibaba Cloud fornece serviços de nível especializado.

Cenários

Cenários típicos

Na maioria dos casos, uma arquitetura de data lake ou armazém de dados é usada em cenários de big data.

Vantagens:
Se uma arquitetura de data lake for usada, o sistema de armazenamento de arquivos subjacente será aberto para tornar a ingestão flexível.
Se uma arquitetura de armazém de dados for usada, os requisitos de classe empresarial para eficiência de processamento de dados, gerenciamento de dados em larga escala, segurança e conformidade podem ser atendidos.

Os data lakes precisam ser integrados aos armazéns de dados para acompanhar o desenvolvimento dos negócios. Os armazéns de dados DLF e Alibaba Cloud, como MaxCompute, Hologres e AnalyticDB for MySQL, ajudam você a criar um lago de dados. O lakehouse transfere dinamicamente dados e recursos computacionais entre data lakes e armazéns. Dessa forma, um ecossistema completo de big data é construído.

Benefícios

  • Zero O&M
    O DLF fornece um serviço totalmente gerenciado. Ele permite que você construa um data lake na nuvem com apenas alguns cliques.

    Alta segurança
    O DLF usa um sistema unificado de gerenciamento de permissões para controlar permissões em bancos de dados, tabelas e colunas.

Cenários

Cenários típicos


Uma grande quantidade de diferentes tipos de dados OSS precisa ser consultada e analisada em várias dimensões, por exemplo, análise em tempo real, consulta OLAP e saída de resultados para um sistema de negócios.
Quando você consulta dados, os data lakes podem acessar vários mecanismos de computação na nuvem. Você não precisa transferir todos os dados para um sistema de consulta.

Benefícios

  • Ingestão de dados em tempo real
    A DLF ingere dados em um data lake em tempo real para garantir a pontualidade dos negócios.

    Descoberta automática metadados
    O DLF pode capturar, orquestrar e preparar automaticamente dados para análise. Operações manuais complexas não são necessárias.

Cenários

Cenários típicos

Data lakes são necessários para usuários em cenários de machine learning e deep learning.
Em cenários de machine learning, você pode encontrar problemas, como grandes quantidades de dados, treinamento lento de modelos e desempenho ruim do algoritmo. Os data lakes devem poder se conectar a plataformas maduras de machine learning e ajustar dinamicamente os recursos da GPU para reduzir custos.

Benefícios

  • Fácil de usar
    O DLF integra-se perfeitamente ao Machine Learning Platform for AI (PAI) e fornece uma variedade de APIs para integração.

    Limpeza unificada dos dados
    O DLF permite limpar e normalizar os dados antes que os dados sejam ingeridos em um data lake. Isso ajuda você a realizar operações de análise subsequentes usando o PAI.

Cenários industriais

Educação online

Uma plataforma educacional online com mais de 100 milhões de usuários

Requisitos do cliente
Os dados, como materiais didáticos, registros de aplicativos e amostras de estudo, precisam ser armazenados e gerenciados de maneira centralizada.
A reprodução de cursos, a análise offline e o aprendizado de máquina precisam ser implementados para vários tipos de dados em diferentes cenários educacionais online.

Valor do cliente
O DLF pode se conectar ao OSS e a um grande número de mecanismos de computação para atender a diferentes requisitos analíticos.

Jogos online

Empresa líder em entretenimento interativo na Ásia

Requisitos do cliente
Os dados precisam ser analisados para ajustar as dificuldades do jogo, reduzir as taxas de queda e aumentar as taxas de produção de recursos. Isso ajuda a melhorar a experiência de jogo e aumentar a taxa de retenção dos jogadores.
Os recursos em nuvem precisam ser dimensionados e atualizados dinamicamente. Uma arquitetura que separa a computação do armazenamento é necessária para garantir a elasticidade do recurso.

Valor do cliente
O DLF ajuda você a criar um data lake na nuvem que separa o armazenamento da computação. Além disso, o DLF pode ser interconectado com mecanismos de computação e análise em tempo real. Isso ajuda você a ajustar os negócios em tempo real.

Novas mídias de entretenimento interativo

Uma nova plataforma de mídia na internet com mais de 100 milhões de usuários ativos por mês

Requisitos do cliente
Os metadados de vários sistemas de armazenamento precisam ser gerenciados de maneira centralizada. O compartilhamento de dados é necessário para o desenvolvimento do negócio.

Valor do cliente
O DLF permite gerenciar os metadados de diferentes sistemas de armazenamento de maneira centralizada. O serviço de detecção de metadados do DLF pode coletar e catalogar dados de seus bancos de dados e buckets Object Storage Service (OSS).

phone Fale Conosco
Oi, eu sou o assistente de IA da Alibaba Cloud!
Posso ajudar com perguntas e soluções.