Tous les produits
Search
Centre de documentation

Object Storage Service:Utiliser Spark sur un cluster EMR pour traiter des données stockées dans OSS-HDFS

Dernière mise à jour :Aug 18, 2026

Cette rubrique explique comment utiliser Spark sur un cluster E-MapReduce (EMR) pour traiter les données stockées dans OSS-HDFS.

Prérequis

  • Vous avez créé un cluster EMR V3.42.0 ou version ultérieure, ou EMR V5.8.0 ou version ultérieure. Pour plus d'informations, consultez la section Créer un cluster.

  • OSS-HDFS est activé pour un bucket et les autorisations d'accès à OSS-HDFS sont configurées. Pour savoir comment activer OSS-HDFS, consultez la section Activer OSS-HDFS et accorder des permissions d'accès.

Procédure

  1. Exécutez la commande suivante dans le terminal pour démarrer Spark Shell :

    spark-shell
  2. Utilisez Spark pour accéder à OSS-HDFS.

    1. Créez une table.

      spark.sql("CREATE TABLE test_oss (`c1` string) OPTIONS (PATH 'oss://examplebucket.cn-hangzhou.oss-dls.aliyuncs.com/dir')")
    2. Insérez des données dans la table.

      spark.sql("INSERT INTO TABLE test_oss SELECT 'testdata' AS c1")
    3. Interrogez les données de la table.

      spark.sql("SELECT c1 FROM test_oss")