O OSS-HDFS (JindoFS) é um recurso de armazenamento de data lake nativo da nuvem com gerenciamento unificado de metadados e total compatibilidade com a API do Hadoop Distributed File System (HDFS) para cargas de trabalho de big data e IA.
Observações de uso
Após ativar o OSS-HDFS, gravar no diretório .dlsdata/ por meio de outros recursos do OSS pode causar perda, corrupção ou inacessibilidade dos dados, conforme descrito em Pré-requisitos.
Benefícios
O OSS-HDFS funciona com aplicações Hadoop e Spark existentes sem necessidade de modificações. Após a configuração básica, gerencie os dados como no HDFS nativo, com as vantagens adicionais do OSS: capacidade praticamente ilimitada, escalabilidade elástica, além de maior segurança, confiabilidade e disponibilidade.
O OSS-HDFS processa exabytes de dados e bilhões de arquivos com throughput na casa dos terabytes. Além do namespace plano do armazenamento de objetos padrão, ele oferece um namespace hierárquico que organiza objetos em diretórios, com conversão automática via gerenciamento unificado de metadados. Em vez da redundância ativa-passiva do NameNode tradicional do HDFS, o OSS-HDFS utiliza redundância multi-nó ativa-ativa para garantir resiliência superior. Usuários do Hadoop acessam os dados com a mesma eficiência de um HDFS local, sem replicação ou conversão, o que melhora o desempenho dos jobs e reduz custos de manutenção.
Recursos
|
Recurso |
Descrição |
Referências |
|
RootPolicy |
Configure um prefixo personalizado para o OSS-HDFS para executar jobs sem alterar o prefixo de acesso original |
|
|
ProxyUser |
Autorize um usuário a executar operações no sistema de arquivos em nome de outros usuários, como acessar dados confidenciais. |
|
|
UserGroupsMapping |
Defina mapeamentos entre usuários e grupos de usuários. |
UserGroupsMapping (Gerenciar mapeamentos de usuários e grupos) |
Casos de uso
O OSS-HDFS suporta cenários de big data e IA:
Hive e Spark
Ideal para data warehouses offline construídos com Hive e Spark. O serviço suporta nativamente semântica de arquivos e diretórios, permissões, operações atômicas de diretório, renomeações em nível de milissegundos, setTimes, atributos estendidos (XAttrs), ACLs e aceleração via cache de leitura local. Em cargas de trabalho ETL, o OSS-HDFS apresenta desempenho significativamente superior aos buckets padrão do OSS.
OLAP
Compatível com append, truncate, flush, sync e pwrite, com suporte total ao POSIX via JindoFuse. Essa funcionalidade permite substituir discos locais em cenários OLAP (como ClickHouse) para desacoplar armazenamento e computação. O cache integrado acelera o desempenho.
Desacoplamento do HBase
O suporte nativo à semântica de arquivos e diretórios e às operações flush permite que o OSS-HDFS substitua o HDFS em arquiteturas de armazenamento e computação desacoplados para o HBase. Diferentemente do OSS padrão, essa abordagem armazena o Write-Ahead Log (WAL) diretamente no OSS-HDFS, simplificando a arquitetura. Usar o OSS-HDFS como armazenamento subjacente para o HBase.
Computação em tempo real
Com suporte a flush e truncate, o serviço substitui perfeitamente o HDFS para sinks e checkpoints na computação em tempo real do Flink.
Migração de dados
Facilita a migração suave de dados do HDFS on-premises para a nuvem, reduzindo custos de armazenamento por meio de dimensionamento elástico e pagamento conforme o uso. A ferramenta JindoDistCp migra dados do HDFS (incluindo atributos de arquivo e metadados) para o OSS-HDFS e fornece comparação rápida de dados usando checksums do HDFS.
Mecanismos suportados
|
Ecossistema |
Mecanismo/Plataforma |
Referências |
|
Ecossistema open source |
Flink |
Usar Flink open source com JindoSDK para processar dados no OSS-HDFS |
|
Flume |
||
|
Hadoop |
||
|
HBase |
||
|
Hive |
||
|
Impala |
||
|
Presto |
||
|
Spark |
||
|
Ecossistema Alibaba Cloud |
EMR |
|
|
Flink |
||
|
Flume |
Usar Flume para sincronizar dados de um cluster EMR Kafka para o OSS-HDFS |
|
|
HBase |
Usar o OSS-HDFS como armazenamento subjacente para o HBase em um cluster EMR |
|
|
Hive |
Usar Hive em um cluster EMR para processar dados no OSS-HDFS |
|
|
Impala |
Usar Impala em um cluster EMR para consultar dados no OSS-HDFS |
|
|
Presto |
Usar Trino em um cluster EMR para consultar dados no OSS-HDFS |
|
|
Spark |
Usar Spark em um cluster EMR para processar dados no OSS-HDFS |
|
|
Sqoop |
Usar Sqoop em um cluster EMR para ler e gravar dados no OSS-HDFS |