Todos os produtos
Search
Central de documentação

Hologres:Aceleração de data lake

Última atualização: Aug 22, 2026

O Hologres acelera a leitura e a gravação de dados armazenados no OSS por meio de tabelas externas, o que melhora a eficiência das consultas e simplifica o processamento de dados.

Informações básicas

Com a maturidade do armazenamento de objetos, as soluções de data lake estão migrando para arquiteturas cloud-native. Na arquitetura de lakehouse da Alibaba Cloud, o OSS atua como armazenamento unificado de data lake, oferecendo uma base segura, econômica, altamente confiável e escalável.

A solução de data lake em tempo real foca no processamento de dados em streaming e em tempo real dentro da arquitetura de lakehouse. O Hologres suporta gravações, atualizações e análises em tempo real. Ao se integrar ao DLF, HMS, OSS e a diversos recursos do ecossistema, o Hologres utiliza tabelas externas para acelerar a leitura e a gravação de dados no OSS sem necessidade de migração. Como as tabelas externas mapeiam campos em vez de armazenar dados, elas reduzem os custos de desenvolvimento e O&M, além de eliminar silos de dados.

A tabela a seguir lista os services da Alibaba Cloud utilizados na solução de data lake em tempo real.

Service

Descrição

Referência

DLF

Service totalmente gerenciado para a construção de data lakes e lakehouses na cloud. O DLF oferece gerenciamento centralizado de metadados, permissões e segurança, além de recursos práticos para ingestão e exploração de dados.

What is Data Lake Formation (DLF) 1.0?

HMS

Componente central do Apache Hive que gerencia metadados de tabelas Hive e Spark, incluindo locais de armazenamento, schemas, nomes de tabelas e colunas, tipos de dados e informações de partições. O HMS permite consultas de dados no Hive e Spark.

Hive Metastore Server

OSS

O OSS é o armazenamento unificado para data lakes na cloud no DLF. Trata-se de um service seguro, econômico e altamente confiável, capaz de armazenar grandes volumes de dados e todos os tipos de arquivos. O OSS oferece 99,9999999999% de durabilidade de dados e é o padrão de fato para armazenamento de data lake.

What is OSS?

O OSS-HDFS (JindoFS) é um service de armazenamento de data lake cloud-native que se integra aos mecanismos de computação do ecossistema Hadoop. Ele é totalmente compatível com APIs HDFS e POSIX, superando o desempenho do OSS nativo em cargas de trabalho ETL baseadas em Hive/Spark.

What is OSS-HDFS?

Arquitetura

A figura a seguir ilustra a arquitetura recomendada de data lake do Hologres. Ela abrange todo o ciclo de vida dos dados, desde a coleta e o armazenamento até o gerenciamento e a aplicação, fornecendo uma solução de lakehouse ponta a ponta com auto scaling flexível.

image

Gerenciamento unificado de metadados

  • Compatibilidade com services de metadados DLF e HMS.

  • Mapeamento para catálogos externos via bancos de dados externos com apenas um clique em.

  • Descoberta automática e atualização de alterações de metadados no data lake.

  • Crie bancos de dados e tabelas no data lake por meio de instruções DDL, com suporte ao Paimon.

Recursos de computação e modelo unificados

  • Utilização de Dynamic Table para camadas e processamento de dados no lakehouse.

  • Suporte a análise OLAP de alto desempenho e write-back de dados do data lake.

  • Uso de instâncias de virtual warehouse para elasticidade e isolamento de recursos.

  • Execução de tarefas serverless com custo zero de propriedade e faturamento conforme o uso.

  • Integração com as principais ferramentas de BI do mercado.

Suporte a formatos abertos de lakehouse

  • Consultas aceleradas em tabelas de lake nos formatos Paimon, Iceberg, Hudi, Delta, ORC e Parquet.

  • Write-back suportado nos formatos Paimon, Iceberg, ORC e Parquet.

Observações de uso

O Hologres oferece os seguintes métodos para mapear source de dados externos.

Método de mapeamento

Sintaxe

Descrição

Source de dados suportado

Versão necessária

Cenário

CREATE EXTERNAL DATABASE

Crie um banco de dados externo em uma instância do Hologres para carregar metadados de uma source de dados externa. Isso permite o gerenciamento centralizado de dados internos e externos na arquitetura de lakehouse.

  • DLF 1.0

  • DLF 2.0

  • MaxCompute

V3.0

Mapear um banco de dados inteiro e todas as suas tabelas de um catálogo em uma source de dados externa para o Hologres.

FOREIGN TABLE

IMPORT FOREIGN SCHEMA

Crie múltiplas tabelas externas em um schema do Hologres de uma só vez para mapear automaticamente tabelas de uma source de dados externa.

  • DLF 1.0

  • DLF 2.0

  • HMS

  • MaxCompute

  • Hologres

V0.8

Mapear todas as tabelas de um banco de dados ou schema de uma source de dados externa para um schema do Hologres.

CREATE FOREIGN TABLE

Crie manualmente uma tabela externa no Hologres para mapear uma tabela ou campos específicos de uma source de dados externa.

  • DLF 1.0

  • DLF 2.0

  • HMS

  • MaxCompute

  • Hologres

V0.8

Mapear tabelas ou campos específicos para o Hologres.

Formatos de tabela e formatos de arquivo

Formatos de tabela

Formato de tabela

Versão suportada

Método de compressão suportado

Hudi

Leitura de dados suportada no Hologres V1.3 e posterior

  • UNCOMPRESSED

  • GZIP

  • SNAPPY

  • BROTLI

  • LZ4

  • ZSTD

  • LZ4_RAW

  • None

  • ZLIB

Delta Lake

Leitura de dados suportada no Hologres V1.3 e posterior

  • UNCOMPRESSED

  • GZIP

  • SNAPPY

  • BROTLI

  • LZ4

  • ZSTD

  • LZ4_RAW

Apache Paimon

  • Leitura de dados suportada no Hologres V2.1 e posterior

  • Leitura de dados de tabelas de lake e gravação em tabelas append-only do Apache Paimon com base no DLF 2.0 suportadas no Hologres V3.0 e posterior

  • PARQUET

    • UNCOMPRESSED

    • SNAPPY

    • GZIP

    • LZO

    • BROTLI

    • LZ4

    • ZSTD

  • ORC

    • NONE

    • ZLIB

    • SNAPPY

    • LZO

    • LZ4

Iceberg

Leitura de dados de tabelas Iceberg V1 e V2 com base no DLF 1.0 e HMS suportada no Hologres V3.0

  • PARQUET

    • UNCOMPRESSED

    • SNAPPY

    • GZIP

    • LZO

    • BROTLI

    • LZ4

    • ZSTD

  • ORC

    • NONE

    • ZLIB

    • SNAPPY

    • LZO

    • LZ4

Formatos de arquivo

Formato de arquivo

Versão suportada

Método de compressão suportado

CSV

Leitura e gravação de dados suportadas no Hologres V1.3 e posterior

COMPRESSION_CODEC

  • BZip2Codec

  • DefaultCodec

  • GzipCodec

  • SnappyCodec

Parquet

Leitura e gravação de dados suportadas no Hologres V1.3 e posterior

  • UNCOMPRESSED

  • GZIP

  • SNAPPY

  • BROTLI

  • LZ4

  • ZSTD

  • LZ4_RAW

ORC

Leitura e gravação de dados suportadas no Hologres V1.3 e posterior

  • None

  • ZLIB

  • SNAPPY

SequenceFile

Leitura e gravação de dados suportadas no Hologres V1.3 e posterior

  • COMPRESSION_CODEC

    • BZip2Codec

    • DefaultCodec

    • GzipCodec

    • SnappyCodec

  • COMPRESSION_TYPE

    • NONE

    • RECORD

    • BLOCK

Mapeamentos de tipos de dados

Para consultar os mapeamentos de tipos de dados do DLF para o Hologres, consulte Data types overview.

Visão geral dos recursos

  • No Hologres V1.1 e posterior, é possível ler dados ORC, Parquet, CSV e SequenceFile do OSS. A partir do Hologres V1.3, você pode gravar dados nesses formatos no OSS e ler tabelas Apache Hudi ou Delta Lake armazenadas no OSS.

    Nota

    Visualize a versão da sua instância do Hologres na página de detalhes da instância no console do Hologres. Caso a versão seja anterior à V1.1, faça o upgrade pelo console ou entre em contato com o grupo do DingTalk do Hologres. Para realizar o upgrade manualmente, consulte Instance upgrades. Para entrar no grupo do DingTalk, consulte Get online support for Hologres.

  • A partir do Hologres V1.3.25, o recurso de multicatálogo do DLF isola metadados entre instâncias de teste, desenvolvimento e跨departamentais, ajudando a garantir a segurança do seu negócio. Catalog.

  • No Hologres V1.3.26 e posterior, há suporte para leitura e gravação de dados no OSS-HDFS. O Hologres integra-se a mecanismos de computação do ecossistema Hadoop para acelerar a análise em tempo real de dados no OSS-HDFS, permitindo consultas federadas em data lakes para cargas de trabalho de big data e IA.

  • As versões V2.1.0 e posteriores do Hologres permitem a leitura de tabelas externas do Apache Paimon. O Apache Paimon é uma plataforma unificada de armazenamento de lake para processamento em streaming e batch, que suporta gravações de alto throughput e consultas de baixa latência, viabilizando o fluxo de dados em tempo real em data lakes. Com ele, os usuários podem integrar o processamento de dados em tempo real e offline no data lake. Apache Paimon.

  • No Hologres V2.2 e posterior, a nova arquitetura de tabelas externas permite que o HQE leia arquivos ORC e Parquet diretamente com aceleração de cache baseada em SSD, aumentando o desempenho em mais de 5 vezes. É possível usar o HMS para acessar dados no OSS e no OSS-HDFS. Access OSS data with Hive Metastore (beta).

    Nota

    Se a sua instância do Hologres for V2.1 ou anterior, entre em contato com o suporte técnico do Hologres para fazer o upgrade.

  • O Hologres V3.0 e versões posteriores incluem os seguintes recursos:

    • Bancos de dados externos agora suportam mapeamento de metadados no nível de catálogo para source de dados DLF e MaxCompute, aprimorando as capacidades de gerenciamento de metadados e dados em data lakes. CREATE EXTERNAL DATABASE.

    • Schemas externos e tabelas externas permitem criar bancos de dados e tabelas em um catálogo DLF para write-back agregado de dados. CREATE EXTERNAL SCHEMA e CREATE EXTERNAL TABLE.

    • Gravações de alto desempenho em tabelas append-only do Apache Paimon para encaminhamento de dados entre lakes e warehouses.

    • A otimização de vetores de exclusão do Paimon melhora o desempenho de consultas quando ocorrem grandes exclusões antes da compactação.

    • Leitores reconstruídos para o Delta Lake aumentam significativamente o desempenho de leitura.

    • Leituras de data lake baseadas em Iceberg expandem o ecossistema de data lake.

    • O mapeamento de metadados do HMS acelera consultas de dados em clusters EMR. Consulte Usar o HMS para acessar dados em data lakes do OSS (beta).

    • Segurança aprimorada: o acesso ao DLF 2.0 usa a função vinculada ao service por padrão, com opção de acesso via função RAM.