Todos os produtos
Search
Central de documentação

Object Storage Service:O que é o OSS-HDFS?

Última atualização: Jul 03, 2026

O OSS-HDFS (JindoFS) é um recurso de armazenamento de data lake nativo da nuvem com gerenciamento unificado de metadados e total compatibilidade com a API do Hadoop Distributed File System (HDFS) para cargas de trabalho de big data e IA.

Observações de uso

Aviso

Após ativar o OSS-HDFS, gravar no diretório .dlsdata/ por meio de outros recursos do OSS pode causar perda, corrupção ou inacessibilidade dos dados, conforme descrito em Pré-requisitos.

Benefícios

O OSS-HDFS funciona com aplicações Hadoop e Spark existentes sem necessidade de modificações. Após a configuração básica, gerencie os dados como no HDFS nativo, com as vantagens adicionais do OSS: capacidade praticamente ilimitada, escalabilidade elástica, além de maior segurança, confiabilidade e disponibilidade.

O OSS-HDFS processa exabytes de dados e bilhões de arquivos com throughput na casa dos terabytes. Além do namespace plano do armazenamento de objetos padrão, ele oferece um namespace hierárquico que organiza objetos em diretórios, com conversão automática via gerenciamento unificado de metadados. Em vez da redundância ativa-passiva do NameNode tradicional do HDFS, o OSS-HDFS utiliza redundância multi-nó ativa-ativa para garantir resiliência superior. Usuários do Hadoop acessam os dados com a mesma eficiência de um HDFS local, sem replicação ou conversão, o que melhora o desempenho dos jobs e reduz custos de manutenção.

Recursos

Recurso

Descrição

Referências

RootPolicy

Configure um prefixo personalizado para o OSS-HDFS para executar jobs sem alterar o prefixo de acesso original hdfs://.

Acessar o OSS-HDFS usando RootPolicy

ProxyUser

Autorize um usuário a executar operações no sistema de arquivos em nome de outros usuários, como acessar dados confidenciais.

ProxyUser (Configurar um usuário proxy)

UserGroupsMapping

Defina mapeamentos entre usuários e grupos de usuários.

UserGroupsMapping (Gerenciar mapeamentos de usuários e grupos)

Casos de uso

O OSS-HDFS suporta cenários de big data e IA:

Hive e Spark

Ideal para data warehouses offline construídos com Hive e Spark. O serviço suporta nativamente semântica de arquivos e diretórios, permissões, operações atômicas de diretório, renomeações em nível de milissegundos, setTimes, atributos estendidos (XAttrs), ACLs e aceleração via cache de leitura local. Em cargas de trabalho ETL, o OSS-HDFS apresenta desempenho significativamente superior aos buckets padrão do OSS.

OLAP

Compatível com append, truncate, flush, sync e pwrite, com suporte total ao POSIX via JindoFuse. Essa funcionalidade permite substituir discos locais em cenários OLAP (como ClickHouse) para desacoplar armazenamento e computação. O cache integrado acelera o desempenho.

Desacoplamento do HBase

O suporte nativo à semântica de arquivos e diretórios e às operações flush permite que o OSS-HDFS substitua o HDFS em arquiteturas de armazenamento e computação desacoplados para o HBase. Diferentemente do OSS padrão, essa abordagem armazena o Write-Ahead Log (WAL) diretamente no OSS-HDFS, simplificando a arquitetura. Usar o OSS-HDFS como armazenamento subjacente para o HBase.

Computação em tempo real

Com suporte a flush e truncate, o serviço substitui perfeitamente o HDFS para sinks e checkpoints na computação em tempo real do Flink.

Migração de dados

Facilita a migração suave de dados do HDFS on-premises para a nuvem, reduzindo custos de armazenamento por meio de dimensionamento elástico e pagamento conforme o uso. A ferramenta JindoDistCp migra dados do HDFS (incluindo atributos de arquivo e metadados) para o OSS-HDFS e fornece comparação rápida de dados usando checksums do HDFS.

Mecanismos suportados

Ecossistema

Mecanismo/Plataforma

Referências

Ecossistema open source

Flink

Usar Flink open source com JindoSDK para processar dados no OSS-HDFS

Flume

Usar Flume com JindoSDK para gravar dados no OSS-HDFS

Hadoop

Usar Hadoop com JindoSDK para acessar o OSS-HDFS

HBase

Usar o OSS-HDFS como armazenamento subjacente para o HBase

Hive

Usar Hive com JindoSDK para processar dados no OSS-HDFS

Impala

Usar Impala com JindoSDK para consultar dados no OSS-HDFS

Presto

Usar Trino com JindoSDK para consultar dados no OSS-HDFS

Spark

Usar Spark com JindoSDK para consultar dados no OSS-HDFS

Ecossistema Alibaba Cloud

EMR

Acessar o OSS-HDFS a partir do Hive ou Spark no EMR

Flink

Flume

Usar Flume para sincronizar dados de um cluster EMR Kafka para o OSS-HDFS

HBase

Usar o OSS-HDFS como armazenamento subjacente para o HBase em um cluster EMR

Hive

Usar Hive em um cluster EMR para processar dados no OSS-HDFS

Impala

Usar Impala em um cluster EMR para consultar dados no OSS-HDFS

Presto

Usar Trino em um cluster EMR para consultar dados no OSS-HDFS

Spark

Usar Spark em um cluster EMR para processar dados no OSS-HDFS

Sqoop

Usar Sqoop em um cluster EMR para ler e gravar dados no OSS-HDFS