Todos os produtos
Search
Central de documentação

Object Storage Service:Uso do JindoSDK com Impala para consulta de dados armazenados no OSS-HDFS

Última atualização: Jul 03, 2026

O JindoSDK é um cliente OSS desenvolvido para os ecossistemas Hadoop e Spark. Ele implementa um sistema de arquivos Hadoop altamente otimizado e baseado no OSS. Em comparação ao cliente OSS da comunidade Hadoop, o JindoSDK oferece melhor desempenho nas consultas do Impala a dados armazenados no OSS-HDFS (JindoFS).

Pré-requisitos

Procedimento

  1. Conecte-se à instância ECS. Para instruções detalhadas, consulte Conectar-se a uma instância ECS.

  2. Configure o JindoSDK.

    1. Baixe a versão mais recente do pacote JAR do JindoSDK. Para baixar o JindoSDK, acesse o GitHub..

    2. Descompacte o pacote JAR do JindoSDK.

      O exemplo a seguir demonstra como descompactar um pacote chamado jindosdk-x.x.x-linux.tar.gz. Substitua o nome do pacote pela versão real baixada.

      tar zxvf jindosdk-x.x.x-linux.tar.gz
      Nota

      x.x.x representa o número da versão do pacote JAR do JindoSDK.

    3. Copie o pacote JAR do JindoSDK baixado para o caminho definido pelo classpath.

      cp jindosdk-x.x.x-linux/lib/*.jar  $HIVE_HOME/lib/
  3. Configure a classe de implementação do OSS-HDFS e especifique o par de AccessKey usado para acessar o bucket.

    1. Configure a classe de implementação do OSS-HDFS no arquivo core-site.xml do Impala.

      <configuration>
          <property>
              <name>fs.AbstractFileSystem.oss.impl</name>
              <value>com.aliyun.jindodata.oss.JindoOSS</value>
          </property>
      
          <property>
              <name>fs.oss.impl</name>
              <value>com.aliyun.jindodata.oss.JindoOssFileSystem</value>
          </property>
      </configuration>
    2. No arquivo core-site.xml do Impala, especifique o AccessKey ID e o AccessKey Secret da conta usada para acessar o bucket com OSS-HDFS ativado.

      <configuration>
          <property>
              <name>fs.oss.accessKeyId</name>
              <value>LTAI********</value>
          </property>
      
          <property>
              <name>fs.oss.accessKeySecret</name>
              <value>KZo1********</value>
          </property>
      </configuration>
  4. Configure o endpoint do OSS-HDFS.

    Especifique o endpoint do OSS-HDFS para acessar buckets no Object Storage Service (OSS) por meio desse serviço. Recomendamos configurar o caminho de acesso ao OSS-HDFS no formato oss://{yourBucketName}.{yourBucketEndpoint}/{path} (exemplo: oss://examplebucket.cn-shanghai.oss-dls.aliyuncs.com/exampleobject.txt). Após essa configuração, o JindoSDK invocará a operação correspondente do OSS-HDFS com base no endpoint especificado no caminho de acesso.

    Também é possível definir o endpoint do OSS-HDFS por outros métodos. Endpoints configurados de formas distintas possuem prioridades diferentes. Para mais informações, consulte Início rápido: Conectar um cluster não EMR ao serviço OSS-HDFS.

  5. Use o Impala para consultar dados armazenados no OSS-HDFS.

    1. Crie uma tabela.

      CREATE EXTERNAL TABLE customer_demographics (
       `cd_demo_sk` INT,
       `cd_gender` STRING,
       `cd_marital_status` STRING,
       `cd_education_status` STRING,
       `cd_purchase_estimate` INT,
       `cd_credit_rating` STRING,
       `cd_dep_count` INT,
       `cd_dep_employed_count` INT,
       `cd_dep_college_count` INT)
      STORED AS PARQUET
      LOCATION 'oss://bucket.endpoint/dir';
    2. Consulte os dados da tabela.

      select * from customer_demographics;