Todos os produtos
Search
Central de documentação

E-MapReduce:Use JindoFS in block storage mode

Última atualização: Jul 04, 2026

Quando seu cluster EMR precisa processar grandes conjuntos de dados armazenados no OSS, o acesso direto ao OSS pode resultar em consultas de metadados lentas e desempenho imprevisível sob alta carga. O modo de armazenamento em bloco do JindoFS resolve esse problema ao armazenar dados como blocos no OSS e manter os dados acessados com frequência em cache nos discos locais do cluster. O Namespace Service gerencia todos os metadados, oferecendo desempenho semelhante ao do Hadoop Distributed File System (HDFS) na escala do OSS.

Como funciona

O modo de armazenamento em bloco utiliza três camadas:

  • OSS: backend de armazenamento persistente. A capacidade escala independentemente do cluster EMR.

  • Discos locais: camada de cache. O JindoFS armazena blocos de dados localmente para acelerar leituras, especialmente em cargas de trabalho do tipo Write Once Read Many (WORM).

  • Namespace Service: camada de metadados. Gerencia os metadados do namespace e garante consultas rápidas e estáveis, mesmo sob alto volume de acesso.

Durante a execução de jobs no cluster EMR, o JindoFS maximiza a localidade dos dados para reduzir a transmissão pela rede e melhorar o desempenho de leitura.

Pré-requisitos

Antes de começar, verifique se você tem:

  • Um cluster EMR com o serviço SmartData instalado

  • Um bucket do OSS para usar como backend de armazenamento

  • (Recomendado) O bucket do OSS na mesma região e sob a mesma conta do cluster EMR. Isso permite acesso sem senha e evita a configuração de credenciais AccessKey.

Configure o modo de armazenamento em bloco

  1. Faça login no console do Alibaba Cloud EMR.

  2. Na barra de navegação superior, selecione a região onde o cluster está localizado. Selecione o grupo de recursos conforme necessário.

  3. Clique em Cluster Management. Localize o cluster desejado e clique em Details na coluna Actions.

  4. No painel de navegação à esquerda, clique em Cluster Service e depois em SmartData.

  5. Clique em Configure. Na seção Service Configuration, clique em namespace.

    namespace

  6. Defina jfs.namespaces como test. Para configurar múltiplos namespaces, separe-os por vírgulas (,).

  7. No canto superior direito da seção Service Configuration, clique em Custom Configuration. Na caixa de diálogo Add Configuration Item, adicione os seguintes parâmetros:

    Parâmetro

    Descrição

    Exemplo

    jfs.namespaces.test.oss.uri

    Backend de armazenamento do namespace test. Defina como um diretório no bucket do OSS. O JindoFS armazenará os blocos de dados neste local.

    oss://<oss_bucket>/<oss_dir>/

    jfs.namespaces.test.mode

    Modo de armazenamento do namespace test.

    block

    jfs.namespaces.test.oss.access.key

    AccessKey ID do bucket do OSS. Não é necessário se o bucket do OSS estiver na mesma região e sob a mesma conta do cluster EMR.

    xxxx

    jfs.namespaces.test.oss.access.secret

    AccessKey secret do bucket do OSS. Não é necessário se o bucket do OSS estiver na mesma região e sob a mesma conta do cluster EMR.

  8. Clique em OK.

  9. No canto superior direito da seção Service Configuration, clique em Save.

  10. No canto superior direito, escolha Actions > Restart Jindo Namespace Service.

Após a reinicialização do Namespace Service, acesse arquivos no JindoFS pelo caminho jfs://test/<path_of_file>.

Controle o uso de espaço em disco

O JindoFS armazena grandes volumes de dados no OSS, mas a capacidade do disco local é finita. O sistema remove automaticamente dados frios dos discos locais por meio de um mecanismo de duas marcas d'água: quando o uso do disco excede a marca d'água alta, a remoção começa e continua até que o uso caia para a marca d'água baixa. Ambos os parâmetros aceitam valores decimais entre 0 e 1.

A marca d'água alta deve ser maior que a marca d'água baixa.
  1. Na seção Service Configuration do SmartData, clique em storage.

    storage

    Configure os seguintes parâmetros:

    Parâmetro

    Descrição

    Padrão

    storage.watermark.high.ratio

    Limiar superior de uso do disco. Quando os dados do JindoFS excederem essa proporção, a remoção automática será iniciada.

    0.4

    storage.watermark.low.ratio

    Meta inferior de uso do disco. A remoção para quando os dados do JindoFS atingirem essa proporção.

    0.2

  2. No canto superior direito da seção Service Configuration, clique em Save. Na caixa de diálogo Confirm Changes, especifique uma descrição e ative a opção Auto-update Configuration. Clique em OK.

  3. No canto superior direito, escolha Actions > Restart Jindo Storage Service. Na caixa de diálogo Cluster Activities, especifique os parâmetros necessários e clique em OK. Na mensagem de confirmação, clique em OK.