Cette rubrique explique comment utiliser Impala sur un cluster E-MapReduce (EMR) pour interroger des données stockées dans OSS-HDFS.
Prérequis
Vous avez créé un cluster EMR V3.42.0 ou version ultérieure, ou EMR V5.8.0 ou version ultérieure, en sélectionnant le service Impala. Pour plus d'informations, consultez la section Créer un cluster.
OSS-HDFS est activé sur un bucket et les autorisations d'accès à OSS-HDFS sont accordées. Pour savoir comment activer OSS-HDFS, consultez la section Activer OSS-HDFS et accorder des autorisations d'accès.
Procédure
-
Exécutez la commande suivante dans le terminal pour vous connecter à Impala.
Pour plus d'informations, consultez la section Se connecter à Impala.
impala-shell -i core-1-1 -
Interrogez les données stockées dans OSS-HDFS avec Impala.
-
Créez une base de données.
CREATE DATABASE store LOCATION 'oss://<bucket-name>.<endpoint>/impala'; -
Sélectionnez la base de données.
USE store; -
Créez une table.
CREATE EXTERNAL TABLE customer_demographics ( `cd_demo_sk` INT, `cd_gender` STRING, `cd_marital_status` STRING, `cd_education_status` STRING, `cd_purchase_estimate` INT, `cd_credit_rating` STRING, `cd_dep_count` INT, `cd_dep_employed_count` INT, `cd_dep_college_count` INT) STORED AS PARQUET; -
Insérez des données dans la table.
INSERT INTO customer_demographics VALUES (1, 'Male', 'Single', 'Graduate', 1000, 'AAA', 2, 1, 1), (2, 'Female', 'Married', 'Undergraduate', 2000, 'BBB', 3, 2, 2); -
Interrogez les données de la table.
select * from customer_demographics;
-