Cette rubrique explique comment utiliser Spark sur un cluster E-MapReduce (EMR) pour traiter les données stockées dans OSS-HDFS.
Prérequis
Vous avez créé un cluster EMR V3.42.0 ou version ultérieure, ou EMR V5.8.0 ou version ultérieure. Pour plus d'informations, consultez la section Créer un cluster.
OSS-HDFS est activé pour un bucket et les autorisations d'accès à OSS-HDFS sont configurées. Pour savoir comment activer OSS-HDFS, consultez la section Activer OSS-HDFS et accorder des permissions d'accès.
Procédure
-
Exécutez la commande suivante dans le terminal pour démarrer Spark Shell :
spark-shell -
Utilisez Spark pour accéder à OSS-HDFS.
-
Créez une table.
spark.sql("CREATE TABLE test_oss (`c1` string) OPTIONS (PATH 'oss://examplebucket.cn-hangzhou.oss-dls.aliyuncs.com/dir')") -
Insérez des données dans la table.
spark.sql("INSERT INTO TABLE test_oss SELECT 'testdata' AS c1") -
Interrogez les données de la table.
spark.sql("SELECT c1 FROM test_oss")
-