All Products
Search
Document Center

DataWorks:Node EMR Spark Streaming

Last Updated:Apr 23, 2026

Node EMR Spark Streaming memproses data streaming real-time ber-throughput tinggi dan menyediakan mekanisme toleransi kesalahan untuk memulihkan aliran data yang gagal. Topik ini menjelaskan cara membuat node EMR Spark Streaming untuk pengembangan data.

Prasyarat

  • Anda telah membuat kluster Alibaba Cloud EMR dan mendaftarkannya ke DataWorks. Untuk informasi selengkapnya, lihat Data Studio: Bind an EMR computing resource.

  • (Opsional, untuk pengguna RAM) Pengguna RAM untuk pengembangan task telah ditambahkan ke ruang kerja yang sesuai dan diberikan peran Development atau Workspace Administrator (peran ini memiliki izin yang luas; berikan dengan hati-hati). Untuk informasi lebih lanjut tentang cara menambahkan anggota, lihat Add members to a workspace.

    Jika Anda menggunakan Akun Alibaba Cloud, Anda dapat melewati langkah ini.

Batasan

  • Jenis task ini hanya dapat dijalankan pada serverless resource group (disarankan) atau exclusive resource group for scheduling.

  • Anda tidak dapat menggunakan node EMR Spark Streaming untuk pengembangan task pada kluster Spark yang berjalan di EMR on ACK.

  • Node ini tidak dapat digunakan dalam workflow. Anda hanya dapat mengembangkan dan menjalankannya sebagai node mandiri.

Prosedur

  1. Pada halaman editor node EMR Spark Streaming, lakukan langkah-langkah berikut.

    Buat dan referensikan resource EMR JAR

    Jika Anda menggunakan kluster DataLake, ikuti langkah-langkah berikut untuk mereferensikan resource EMR JAR.

    Catatan

    Jika resource yang diperlukan terlalu besar untuk diunggah dari halaman DataWorks, Anda harus menyimpan resource tersebut di HDFS dan mereferensikannya dalam kode Anda. Kode berikut merupakan contoh.

    spark-submit --master yarn
    --deploy-mode cluster
    --name SparkPi
    --driver-memory 4G
    --driver-cores 1
    --num-executors 5
    --executor-memory 4G
    --executor-cores 1
    --class org.apache.spark.examples.JavaSparkPi
    hdfs:///tmp/jars/spark-examples_2.11-2.4.8.jar 100
    1. Buat resource EMR JAR.

      1. Untuk informasi selengkapnya, lihat Resource Management. Simpan paket JAR yang dihasilkan di direktori emr/jars. Klik Click Upload untuk mengunggah resource JAR.

      2. Pilih Storage Path, Data Sources, dan Resource Group.

      3. Klik Save.

    2. Referensikan resource EMR JAR.

      1. Buka node EMR Spark Streaming yang telah dibuat dan tetap berada di halaman editor kode.

      2. Di panel navigasi sebelah kiri, temukan resource yang ingin Anda referensikan di bawah Resource Management. Klik kanan resource tersebut dan pilih Insert Resource Path.

      3. Setelah referensi ditambahkan, pesan sukses akan muncul di halaman editor kode untuk node EMR Spark Streaming. Anda kemudian dapat menjalankan perintah berikut. Nama paket resource, nama bucket, dan informasi path dalam perintah berikut hanyalah contoh. Gantilah dengan nilai Anda sendiri.

        ##@resource_reference{"examples-1.2.0-shaded.jar"}
        --master yarn-cluster --executor-cores 2 --executor-memory 2g --driver-memory 1g --num-executors 2 --class com.aliyun.emr.example.spark.streaming.JavaLoghubWordCount examples-1.2.0-shaded.jar <logService-project> <logService-store> <group> <endpoint> <access-key-id> <access-key-secret>

    Kembangkan kode

    Di editor kode untuk node EMR Spark Streaming, masukkan kode pekerjaan yang ingin Anda jalankan. Contoh:

    spark-submit --master yarn-cluster --executor-cores 2 --executor-memory 2g --driver-memory 1g --num-executors 2 --class com.aliyun.emr.example.spark.streaming.JavaLoghubWordCount examples-1.2.0-shaded.jar <logService-project> <logService-store> <group> <endpoint> <access-key-id> <access-key-secret>
    Catatan
    • Dalam contoh ini, resource yang diunggah ke DataWorks adalah examples-1.2.0-shaded.jar.

    • Ganti access-key-id dan access-key-secret dengan ID AccessKey dan AccessKey Secret akun Alibaba Cloud Anda. Untuk mendapatkan ID AccessKey dan AccessKey Secret, login ke DataWorks console, arahkan kursor ke gambar profil Anda di pojok kanan atas bilah navigasi atas, lalu pilih AccessKey Management.

    • Komentar tidak didukung di editor kode untuk node EMR Spark Streaming.

    (Opsional) Konfigurasi parameter lanjutan

    Di panel Scheduling Settings di sisi kanan halaman node, Anda dapat mengonfigurasi parameter spesifik dalam tabel berikut di bawah EMR Node Parameters > DataWorks parameters.

    Catatan
    • Parameter lanjutan yang tersedia bervariasi tergantung jenis kluster EMR, seperti yang ditunjukkan dalam tabel berikut.

    • Anda dapat mengonfigurasi lebih banyak properti Spark open-source di panel Scheduling Settings di bawah EMR Node Parameters > Spark parameter.

    DataLake: EMR on ECS

    Parameter

    Deskripsi

    FLOW_SKIP_SQL_ANALYZE

    Mode eksekusi untuk pernyataan SQL. Nilai yang valid:

    • true: Mengeksekusi beberapa pernyataan SQL sekaligus.

    • false (default): Mengeksekusi satu pernyataan SQL dalam satu waktu.

    Catatan

    Parameter ini hanya didukung untuk uji coba di lingkungan pengembangan data.

    queue

    Antrian pengiriman pekerjaan. Antrian default adalah default. Untuk informasi selengkapnya tentang EMR YARN, lihat Basic queue configuration.

    priority

    Prioritas pekerjaan. Nilai default adalah 1.

    Other

    Anda dapat menambahkan parameter SparkConf kustom dalam konfigurasi lanjutan. Saat Anda mengirimkan kode, DataWorks secara otomatis menambahkan parameter baru tersebut ke perintah. Contoh: "spark.driver.memory" : "2g".

    Catatan

    Untuk mengaktifkan kontrol akses Ranger, tambahkan konfigurasi spark.hadoop.fs.oss.authorization.method=ranger di Set global Spark parameters.

    Untuk informasi selengkapnya tentang konfigurasi parameter, lihat Set global Spark parameters.

    Jalankan task

    1. Di Run Configuration, di bawah Compute Resource, pilih Compute Resource dan DataWorks Resource Group.

      Catatan
      • Anda juga dapat mengonfigurasi CUs for Scheduling berdasarkan kebutuhan sumber daya task. Nilai default adalah 0.25.

      • Untuk mengakses sumber data melalui internet publik atau di dalam VPC, Anda harus menggunakan resource group penjadwalan yang dapat terhubung ke sumber data tersebut. Untuk informasi selengkapnya, lihat Network connectivity solutions.

    2. Di kotak dialog parameter pada toolbar, pilih sumber data yang telah Anda buat dan klik Run untuk menjalankan task.

  2. Untuk menjalankan node sebagai tugas terjadwal, konfigurasikan properti penjadwalannya sesuai kebutuhan. Untuk informasi selengkapnya, lihat Configure node scheduling.

  3. Setelah mengonfigurasi task node, Anda harus memublikasikannya. Untuk informasi selengkapnya, lihat Publish a node or workflow.

  4. Setelah task dipublikasikan, Anda dapat melihat status tugas terjadwal di Operation Center. Untuk informasi selengkapnya, lihat Get started with Operation Center.