Visão geral
O Alibaba Cloud OpenLake é uma plataforma aberta de lakehouse para big data, busca e inteligência artificial (IA). Baseado no Data Lake Formation (DLF), unifica dados estruturados, semiestruturados, não estruturados e vetoriais em um único catálogo de metadados. Essa arquitetura de Dados Agênticos permite que uma única cópia dos dados atenda a múltiplos mecanismos, com busca global e governança de ponta a ponta.
O OpenLake oferece suporte a formatos abertos de tabela, como Paimon, Iceberg e Lance. A plataforma abrange todo o fluxo de trabalho: ingestão de dados, engenharia de recursos e vetorização até geração aumentada por recuperação (RAG), treinamento de modelos e inferência. O resultado é uma infraestrutura de dados multimodais de alto desempenho, baixo custo, alta disponibilidade e fácil gerenciamento.
Essa solução atende setores como internet, finanças, varejo, manufatura, educação e direção autônoma, que precisam processar dados multimodais e criar aplicações nativas de IA.

Benefícios
Padrões abertos que eliminam silos de dados
Compatível com formatos abertos de tabela (Paimon, Iceberg, Lance) e padrões de arquivo (Parquet, ORC, Avro, CSV).
Integra-se a Spark, Flink, Trino, StarRocks, Hologres e MaxCompute, eliminando custos de migração de dados e conversão de formato.
O DLF Omni Catalog unifica cinco tipos de dados — estruturados, semiestruturados, não estruturados, vetoriais e streaming — para ingestão única e uso em qualquer lugar.
Colaboração multimotor de alto desempenho
Spark, Flink, StarRocks, Hologres e MaxCompute acessam os mesmos dados do lake sem cópias redundantes.
O serviço de metadados do DLF garante permissões consistentes, sincronização de esquema e isolamento de transações entre os mecanismos.
Cargas de trabalho em lote, streaming, interativas e de IA compartilham uma única camada de armazenamento, o que melhora a utilização e a eficiência dos recursos.
Oferece suporte a cargas mistas de alta concorrência e baixa latência, combinando processamento em lote T+1 com análises em tempo real no nível de segundos.
Desenvolvimento e governança unificados
O OpenLake Studio integra-se ao DataWorks para oferecer Notebook, SQL IDE e agendamento visual em uma única interface.
Metadados centralizados, permissões, linhagem, orquestração e monitoramento de qualidade viabilizam a governança desde o primeiro dia.
O agendamento de tarefas em larga escala e alta concorrência assegura SLAs e estabilidade de nível empresarial.
Todo o pipeline de dados é rastreável, auditável e permite rollbacks para conformidade.
Integração de dados, busca e IA
Combina tabelas estruturadas, arquivos não estruturados (imagens, áudio, vídeo, documentos) e dados vetoriais em um único lakehouse multimodal.
Oferece suporte nativo a SQL, busca full-text (OpenSearch, Elasticsearch) e busca vetorial (Milvus, PgVector).
Disponibiliza um pipeline de dados pesquisável e governável para RAG de grandes modelos de linguagem (LLM) e agentes inteligentes.
Simplifica o fluxo de trabalho da ingestão de dados, engenharia de recursos e vetorização até o aumento por recuperação e inferência de modelos, acelerando a entrega de aplicações de IA.
Recursos principais
|
Recurso |
Descrição |
Documentação |
|
Gerenciamento unificado de metadados e tabelas |
Usa o DLF para fornecer um catálogo unificado para Paimon, Iceberg, Lance, Parquet e outros formatos. |
|
|
Otimização de custos de armazenamento |
Reduz custos de armazenamento com camadas inteligentes do OSS, compactação e políticas de ciclo de vida. |
|
|
Integração em tempo real de data lakes e streams |
Flink, Streaming Storage Fluss e DLF permitem ingestão de dados em segundos e visibilidade em minutos. |
|
|
Mecanismos de alto desempenho de nível empresarial |
Integra Serverless Spark, Flink, Hologres, MaxCompute e outros mecanismos nativos da nuvem. |
O que é o EMR Serverless Spark, O que é o Realtime Compute for Apache Flink, O que é o Hologres, O que é o MaxCompute |
|
Desenvolvimento colaborativo para big data e IA |
OpenLake Studio com Notebook, SQL e agendamento visual. |
|
|
Integração de Agent e Copilot |
O OpenLake Agent e o protocolo MCP permitem que agentes inteligentes multimodais acessem o lakehouse diretamente. |
Soluções de arquitetura
Solução 1: Arquitetura clássica de lakehouse (Serverless Spark + StarRocks + DLF)
Cenários: Processamento em lote T+1 para análises econômicas e totalmente gerenciadas: relatórios, business intelligence e personas de usuários.
Componentes: EMR Serverless Spark (processamento em lote) + StarRocks (consultas abaixo de um segundo) + DLF (metadados unificados).
Soluções alternativas: AWS Redshift + Glue, Databricks (processamento em lote), Hive + Presto.
Benefícios: Redução de custos superior a 30%, desempenho de consulta de 3 a 5 vezes maior e gerenciamento total.

Solução 2: Arquitetura de lakehouse em streaming (Flink + Hologres + DLF)
Cenários: Análises quase em tempo real com latência de segundos a minutos: controle de risco, monitoramento de anúncios e monitoramento de IoT.
Componentes: Flink (ETL em streaming) + Hologres (serviço em tempo real) + DLF (colaboração entre mecanismos).
Soluções alternativas: Kafka + ClickHouse + Hive, AWS Kinesis + Redshift.
Benefícios: Visibilidade de dados de ponta a ponta em até 10 minutos e latência de consulta inferior a um segundo.

Solução 3: Arquitetura de lakehouse nativa da nuvem (MaxCompute + Hologres + DLF)
Cenários: Indicada para finanças, governo e outros setores com requisitos rigorosos de segurança, conformidade e escala.
Componentes: MaxCompute (processamento em lote na escala de petabytes) + Hologres (gravações em milissegundos) + DLF (governança).
Soluções alternativas: Snowflake, Azure Synapse, edições comerciais do Databricks.
Benefícios: Segurança de nível empresarial, dimensionamento elástico, RPO=0 e RTO < 30 minutos.

Solução 4: Lake vetorial omnimodal (Spark + Milvus + DLF)
Cenários: Treinamento de IA, busca semântica multimodal, RAG, atendimento ao cliente inteligente e gerenciamento de dados de percepção para direção autônoma.
Componentes: Spark (pré-processamento multimodal), Milvus (busca vetorial) e DLF (catálogo unificado).
Capacidades: Busca híbrida em texto, imagens, áudio e vídeo com consultas combinadas de SQL e vetores.
Benefícios: Eficiência 5 vezes maior na seleção de amostras e ajuste fino de LLM de alta qualidade.
Casos de uso: Treinamento de IA, busca multimodal, RAG, atendimento ao cliente e direção autônoma.
