O Hologres acelera a leitura e a gravação de dados armazenados no OSS por meio de tabelas externas, o que melhora a eficiência das consultas e simplifica o processamento de dados.
Informações básicas
Com a maturidade do armazenamento de objetos, as soluções de data lake estão migrando para arquiteturas cloud-native. Na arquitetura de lakehouse da Alibaba Cloud, o OSS atua como armazenamento unificado de data lake, oferecendo uma base segura, econômica, altamente confiável e escalável.
A solução de data lake em tempo real foca no processamento de dados em streaming e em tempo real dentro da arquitetura de lakehouse. O Hologres suporta gravações, atualizações e análises em tempo real. Ao se integrar ao DLF, HMS, OSS e a diversos recursos do ecossistema, o Hologres utiliza tabelas externas para acelerar a leitura e a gravação de dados no OSS sem necessidade de migração. Como as tabelas externas mapeiam campos em vez de armazenar dados, elas reduzem os custos de desenvolvimento e O&M, além de eliminar silos de dados.
A tabela a seguir lista os services da Alibaba Cloud utilizados na solução de data lake em tempo real.
|
Service |
Descrição |
Referência |
|
DLF |
Service totalmente gerenciado para a construção de data lakes e lakehouses na cloud. O DLF oferece gerenciamento centralizado de metadados, permissões e segurança, além de recursos práticos para ingestão e exploração de dados. |
|
|
HMS |
Componente central do Apache Hive que gerencia metadados de tabelas Hive e Spark, incluindo locais de armazenamento, schemas, nomes de tabelas e colunas, tipos de dados e informações de partições. O HMS permite consultas de dados no Hive e Spark. |
|
|
OSS |
O OSS é o armazenamento unificado para data lakes na cloud no DLF. Trata-se de um service seguro, econômico e altamente confiável, capaz de armazenar grandes volumes de dados e todos os tipos de arquivos. O OSS oferece 99,9999999999% de durabilidade de dados e é o padrão de fato para armazenamento de data lake. |
|
|
O OSS-HDFS (JindoFS) é um service de armazenamento de data lake cloud-native que se integra aos mecanismos de computação do ecossistema Hadoop. Ele é totalmente compatível com APIs HDFS e POSIX, superando o desempenho do OSS nativo em cargas de trabalho ETL baseadas em Hive/Spark. |
Arquitetura
A figura a seguir ilustra a arquitetura recomendada de data lake do Hologres. Ela abrange todo o ciclo de vida dos dados, desde a coleta e o armazenamento até o gerenciamento e a aplicação, fornecendo uma solução de lakehouse ponta a ponta com auto scaling flexível.
Gerenciamento unificado de metadados
Compatibilidade com services de metadados DLF e HMS.
Mapeamento para catálogos externos via bancos de dados externos com apenas um clique em.
Descoberta automática e atualização de alterações de metadados no data lake.
Crie bancos de dados e tabelas no data lake por meio de instruções DDL, com suporte ao Paimon.
Recursos de computação e modelo unificados
Utilização de Dynamic Table para camadas e processamento de dados no lakehouse.
Suporte a análise OLAP de alto desempenho e write-back de dados do data lake.
Uso de instâncias de virtual warehouse para elasticidade e isolamento de recursos.
Execução de tarefas serverless com custo zero de propriedade e faturamento conforme o uso.
Integração com as principais ferramentas de BI do mercado.
Suporte a formatos abertos de lakehouse
Consultas aceleradas em tabelas de lake nos formatos Paimon, Iceberg, Hudi, Delta, ORC e Parquet.
Write-back suportado nos formatos Paimon, Iceberg, ORC e Parquet.
Observações de uso
O Hologres oferece os seguintes métodos para mapear source de dados externos.
|
Método de mapeamento |
Sintaxe |
Descrição |
Source de dados suportado |
Versão necessária |
Cenário |
|
CREATE EXTERNAL DATABASE |
Crie um banco de dados externo em uma instância do Hologres para carregar metadados de uma source de dados externa. Isso permite o gerenciamento centralizado de dados internos e externos na arquitetura de lakehouse. |
|
V3.0 |
Mapear um banco de dados inteiro e todas as suas tabelas de um catálogo em uma source de dados externa para o Hologres. |
|
|
FOREIGN TABLE |
Crie múltiplas tabelas externas em um schema do Hologres de uma só vez para mapear automaticamente tabelas de uma source de dados externa. |
|
V0.8 |
Mapear todas as tabelas de um banco de dados ou schema de uma source de dados externa para um schema do Hologres. |
|
|
Crie manualmente uma tabela externa no Hologres para mapear uma tabela ou campos específicos de uma source de dados externa. |
|
V0.8 |
Mapear tabelas ou campos específicos para o Hologres. |
Formatos de tabela e formatos de arquivo
Formatos de tabela
|
Formato de tabela |
Versão suportada |
Método de compressão suportado |
|
Hudi |
Leitura de dados suportada no Hologres V1.3 e posterior |
|
|
Delta Lake |
Leitura de dados suportada no Hologres V1.3 e posterior |
|
|
Apache Paimon |
|
|
|
Iceberg |
Leitura de dados de tabelas Iceberg V1 e V2 com base no DLF 1.0 e HMS suportada no Hologres V3.0 |
|
Formatos de arquivo
|
Formato de arquivo |
Versão suportada |
Método de compressão suportado |
|
CSV |
Leitura e gravação de dados suportadas no Hologres V1.3 e posterior |
COMPRESSION_CODEC
|
|
Parquet |
Leitura e gravação de dados suportadas no Hologres V1.3 e posterior |
|
|
ORC |
Leitura e gravação de dados suportadas no Hologres V1.3 e posterior |
|
|
SequenceFile |
Leitura e gravação de dados suportadas no Hologres V1.3 e posterior |
|
Mapeamentos de tipos de dados
Para consultar os mapeamentos de tipos de dados do DLF para o Hologres, consulte Data types overview.
Visão geral dos recursos
-
No Hologres V1.1 e posterior, é possível ler dados ORC, Parquet, CSV e SequenceFile do OSS. A partir do Hologres V1.3, você pode gravar dados nesses formatos no OSS e ler tabelas Apache Hudi ou Delta Lake armazenadas no OSS.
NotaVisualize a versão da sua instância do Hologres na página de detalhes da instância no console do Hologres. Caso a versão seja anterior à V1.1, faça o upgrade pelo console ou entre em contato com o grupo do DingTalk do Hologres. Para realizar o upgrade manualmente, consulte Instance upgrades. Para entrar no grupo do DingTalk, consulte Get online support for Hologres.
A partir do Hologres V1.3.25, o recurso de multicatálogo do DLF isola metadados entre instâncias de teste, desenvolvimento e跨departamentais, ajudando a garantir a segurança do seu negócio. Catalog.
No Hologres V1.3.26 e posterior, há suporte para leitura e gravação de dados no OSS-HDFS. O Hologres integra-se a mecanismos de computação do ecossistema Hadoop para acelerar a análise em tempo real de dados no OSS-HDFS, permitindo consultas federadas em data lakes para cargas de trabalho de big data e IA.
As versões V2.1.0 e posteriores do Hologres permitem a leitura de tabelas externas do Apache Paimon. O Apache Paimon é uma plataforma unificada de armazenamento de lake para processamento em streaming e batch, que suporta gravações de alto throughput e consultas de baixa latência, viabilizando o fluxo de dados em tempo real em data lakes. Com ele, os usuários podem integrar o processamento de dados em tempo real e offline no data lake. Apache Paimon.
-
No Hologres V2.2 e posterior, a nova arquitetura de tabelas externas permite que o HQE leia arquivos ORC e Parquet diretamente com aceleração de cache baseada em SSD, aumentando o desempenho em mais de 5 vezes. É possível usar o HMS para acessar dados no OSS e no OSS-HDFS. Access OSS data with Hive Metastore (beta).
NotaSe a sua instância do Hologres for V2.1 ou anterior, entre em contato com o suporte técnico do Hologres para fazer o upgrade.
-
O Hologres V3.0 e versões posteriores incluem os seguintes recursos:
Bancos de dados externos agora suportam mapeamento de metadados no nível de catálogo para source de dados DLF e MaxCompute, aprimorando as capacidades de gerenciamento de metadados e dados em data lakes. CREATE EXTERNAL DATABASE.
Schemas externos e tabelas externas permitem criar bancos de dados e tabelas em um catálogo DLF para write-back agregado de dados. CREATE EXTERNAL SCHEMA e CREATE EXTERNAL TABLE.
Gravações de alto desempenho em tabelas append-only do Apache Paimon para encaminhamento de dados entre lakes e warehouses.
A otimização de vetores de exclusão do Paimon melhora o desempenho de consultas quando ocorrem grandes exclusões antes da compactação.
Leitores reconstruídos para o Delta Lake aumentam significativamente o desempenho de leitura.
Leituras de data lake baseadas em Iceberg expandem o ecossistema de data lake.
O mapeamento de metadados do HMS acelera consultas de dados em clusters EMR. Consulte Usar o HMS para acessar dados em data lakes do OSS (beta).
Segurança aprimorada: o acesso ao DLF 2.0 usa a função vinculada ao service por padrão, com opção de acesso via função RAM.