Todos os produtos
Search
Central de documentação

OpenLake:O que é o OpenLake

Última atualização: Jun 29, 2026

Visão geral

O Alibaba Cloud OpenLake é uma plataforma aberta de lakehouse para big data, busca e inteligência artificial (IA). Baseado no Data Lake Formation (DLF), unifica dados estruturados, semiestruturados, não estruturados e vetoriais em um único catálogo de metadados. Essa arquitetura de Dados Agênticos permite que uma única cópia dos dados atenda a múltiplos mecanismos, com busca global e governança de ponta a ponta.

O OpenLake oferece suporte a formatos abertos de tabela, como Paimon, Iceberg e Lance. A plataforma abrange todo o fluxo de trabalho: ingestão de dados, engenharia de recursos e vetorização até geração aumentada por recuperação (RAG), treinamento de modelos e inferência. O resultado é uma infraestrutura de dados multimodais de alto desempenho, baixo custo, alta disponibilidade e fácil gerenciamento.

Essa solução atende setores como internet, finanças, varejo, manufatura, educação e direção autônoma, que precisam processar dados multimodais e criar aplicações nativas de IA.

image.png

Benefícios

Padrões abertos que eliminam silos de dados

  • Compatível com formatos abertos de tabela (Paimon, Iceberg, Lance) e padrões de arquivo (Parquet, ORC, Avro, CSV).

  • Integra-se a Spark, Flink, Trino, StarRocks, Hologres e MaxCompute, eliminando custos de migração de dados e conversão de formato.

  • O DLF Omni Catalog unifica cinco tipos de dados — estruturados, semiestruturados, não estruturados, vetoriais e streaming — para ingestão única e uso em qualquer lugar.

Colaboração multimotor de alto desempenho

  • Spark, Flink, StarRocks, Hologres e MaxCompute acessam os mesmos dados do lake sem cópias redundantes.

  • O serviço de metadados do DLF garante permissões consistentes, sincronização de esquema e isolamento de transações entre os mecanismos.

  • Cargas de trabalho em lote, streaming, interativas e de IA compartilham uma única camada de armazenamento, o que melhora a utilização e a eficiência dos recursos.

  • Oferece suporte a cargas mistas de alta concorrência e baixa latência, combinando processamento em lote T+1 com análises em tempo real no nível de segundos.

Desenvolvimento e governança unificados

  • O OpenLake Studio integra-se ao DataWorks para oferecer Notebook, SQL IDE e agendamento visual em uma única interface.

  • Metadados centralizados, permissões, linhagem, orquestração e monitoramento de qualidade viabilizam a governança desde o primeiro dia.

  • O agendamento de tarefas em larga escala e alta concorrência assegura SLAs e estabilidade de nível empresarial.

  • Todo o pipeline de dados é rastreável, auditável e permite rollbacks para conformidade.

Integração de dados, busca e IA

  • Combina tabelas estruturadas, arquivos não estruturados (imagens, áudio, vídeo, documentos) e dados vetoriais em um único lakehouse multimodal.

  • Oferece suporte nativo a SQL, busca full-text (OpenSearch, Elasticsearch) e busca vetorial (Milvus, PgVector).

  • Disponibiliza um pipeline de dados pesquisável e governável para RAG de grandes modelos de linguagem (LLM) e agentes inteligentes.

  • Simplifica o fluxo de trabalho da ingestão de dados, engenharia de recursos e vetorização até o aumento por recuperação e inferência de modelos, acelerando a entrega de aplicações de IA.

Recursos principais

Recurso

Descrição

Documentação

Gerenciamento unificado de metadados e tabelas

Usa o DLF para fornecer um catálogo unificado para Paimon, Iceberg, Lance, Parquet e outros formatos.

O que é o Data Lake Formation

Otimização de custos de armazenamento

Reduz custos de armazenamento com camadas inteligentes do OSS, compactação e políticas de ciclo de vida.

Otimização de armazenamento

Integração em tempo real de data lakes e streams

Flink, Streaming Storage Fluss e DLF permitem ingestão de dados em segundos e visibilidade em minutos.

, O que é o Realtime Compute for Apache Flink

Mecanismos de alto desempenho de nível empresarial

Integra Serverless Spark, Flink, Hologres, MaxCompute e outros mecanismos nativos da nuvem.

O que é o EMR Serverless Spark, O que é o Realtime Compute for Apache Flink, O que é o Hologres, O que é o MaxCompute

Desenvolvimento colaborativo para big data e IA

OpenLake Studio com Notebook, SQL e agendamento visual.

Desenvolvimento básico com Notebooks

Integração de Agent e Copilot

O OpenLake Agent e o protocolo MCP permitem que agentes inteligentes multimodais acessem o lakehouse diretamente.

DataWorks Copilot

Soluções de arquitetura

Solução 1: Arquitetura clássica de lakehouse (Serverless Spark + StarRocks + DLF)

  • Cenários: Processamento em lote T+1 para análises econômicas e totalmente gerenciadas: relatórios, business intelligence e personas de usuários.

  • Componentes: EMR Serverless Spark (processamento em lote) + StarRocks (consultas abaixo de um segundo) + DLF (metadados unificados).

  • Soluções alternativas: AWS Redshift + Glue, Databricks (processamento em lote), Hive + Presto.

  • Benefícios: Redução de custos superior a 30%, desempenho de consulta de 3 a 5 vezes maior e gerenciamento total.

image.png

Solução 2: Arquitetura de lakehouse em streaming (Flink + Hologres + DLF)

  • Cenários: Análises quase em tempo real com latência de segundos a minutos: controle de risco, monitoramento de anúncios e monitoramento de IoT.

  • Componentes: Flink (ETL em streaming) + Hologres (serviço em tempo real) + DLF (colaboração entre mecanismos).

  • Soluções alternativas: Kafka + ClickHouse + Hive, AWS Kinesis + Redshift.

  • Benefícios: Visibilidade de dados de ponta a ponta em até 10 minutos e latência de consulta inferior a um segundo.

image.png

Solução 3: Arquitetura de lakehouse nativa da nuvem (MaxCompute + Hologres + DLF)

  • Cenários: Indicada para finanças, governo e outros setores com requisitos rigorosos de segurança, conformidade e escala.

  • Componentes: MaxCompute (processamento em lote na escala de petabytes) + Hologres (gravações em milissegundos) + DLF (governança).

  • Soluções alternativas: Snowflake, Azure Synapse, edições comerciais do Databricks.

  • Benefícios: Segurança de nível empresarial, dimensionamento elástico, RPO=0 e RTO < 30 minutos.

image.png

Solução 4: Lake vetorial omnimodal (Spark + Milvus + DLF)

  • Cenários: Treinamento de IA, busca semântica multimodal, RAG, atendimento ao cliente inteligente e gerenciamento de dados de percepção para direção autônoma.

  • Componentes: Spark (pré-processamento multimodal), Milvus (busca vetorial) e DLF (catálogo unificado).

  • Capacidades: Busca híbrida em texto, imagens, áudio e vídeo com consultas combinadas de SQL e vetores.

  • Benefícios: Eficiência 5 vezes maior na seleção de amostras e ajuste fino de LLM de alta qualidade.

  • Casos de uso: Treinamento de IA, busca multimodal, RAG, atendimento ao cliente e direção autônoma.

image.png