Este tópico descreve como usar o Spark em um cluster E-MapReduce (EMR) para processar dados armazenados no OSS-HDFS.
Pré-requisitos
Crie um cluster EMR V3.42.0 ou posterior, ou EMR V5.8.0 ou posterior. Para mais informações, consulte Criar um cluster.
Ative o OSS-HDFS para um bucket e conceda as permissões de acesso ao OSS-HDFS. Para mais detalhes sobre como ativar o OSS-HDFS, consulte Ativar o OSS-HDFS e conceder permissões de acesso.
Procedimento
-
Execute o seguinte comando no terminal para iniciar o Spark Shell:
spark-shell -
Use o Spark para acessar o OSS-HDFS.
-
Crie uma tabela.
spark.sql("CREATE TABLE test_oss (`c1` string) OPTIONS (PATH 'oss://examplebucket.cn-hangzhou.oss-dls.aliyuncs.com/dir')") -
Insira dados na tabela.
spark.sql("INSERT INTO TABLE test_oss SELECT 'testdata' AS c1") -
Consulte os dados da tabela.
spark.sql("SELECT c1 FROM test_oss")
-