All Products
Search
Document Center

DataWorks:Konfigurasikan parameter Spark global

Last Updated:Jun 22, 2026

Di DataWorks, Anda dapat menentukan parameter Spark untuk setiap modul di tingkat ruang kerja. Secara default, tugas menggunakan parameter tersebut. Anda dapat merujuk ke dokumentasi resmi Spark untuk menyesuaikan parameter Spark global dan mengonfigurasi apakah parameter tersebut memiliki prioritas lebih tinggi dibandingkan parameter khusus modul, seperti Data Development, Data Analysis, dan Operation Center.

Latar Belakang

Apache Spark adalah mesin untuk analitik data skala besar. Di DataWorks, Anda dapat mengonfigurasi parameter Spark waktu proses untuk node terjadwal dengan cara berikut:

  • Metode 1: Konfigurasikan parameter Spark global

    Tetapkan parameter Spark di tingkat ruang kerja untuk modul DataWorks yang menjalankan tugas EMR. Anda juga dapat mengatur agar parameter ini memiliki prioritas lebih tinggi daripada parameter Spark yang dikonfigurasi dalam modul tertentu. Untuk informasi selengkapnya, lihat Konfigurasikan parameter Spark global.

  • Metode 2: Konfigurasikan parameter Spark khusus modul

    • Data Development (Data Studio): Untuk node Hive dan Spark, Anda dapat menetapkan properti Spark untuk tugas node individual di panel Scheduling Settings di sisi kanan halaman pengeditan node.

    • Modul lain: Pengaturan properti Spark dalam modul lain tidak didukung.

Batasan

  • Hanya role berikut yang dapat mengonfigurasi parameter Spark global:

    • Akun Alibaba Cloud.

    • A RAM user atau RAM role dengan izin AliyunDataWorksFullAccess.

    • A RAM user dengan roleWorkspace Administrator.

  • Parameter Spark hanya berlaku untuk node EMR Spark, node EMR Spark SQL, dan node EMR Spark Streaming.

    Catatan

    Untuk menggunakan Ranger dalam kontrol akses Spark, tambahkan konfigurasi spark.hadoop.fs.oss.authorization.method=ranger di parameter Spark global untuk menerapkan kontrol akses Ranger.

  • Anda dapat memperbarui konfigurasi terkait Spark baik diManagement Center DataWorks maupun di E-MapReduce console. Jika konfigurasi suatu parameter berbeda di kedua lokasi tersebut, tugas yang dikirim melalui DataWorks akan menggunakan konfigurasi dariManagement Center DataWorks.

  • Saat ini, Anda hanya dapat mengonfigurasi parameter Spark global untuk modul Data Development (Data Studio), Data Quality, Data Analysis, dan Operation Center.

Prasyarat

Anda harus mengaitkan kluster E-MapReduce dengan ruang kerja DataWorks Anda. Untuk informasi selengkapnya, lihat Bind an E-MapReduce compute engine.

Konfigurasikan parameter Spark global

  1. Buka halaman konfigurasi parameter Spark global.

    1. Masuk ke DataWorks console. Di wilayah target, klik More > Management Center di panel navigasi sebelah kiri. Pilih ruang kerja dari daftar drop-down dan klik Go to Management Center.

    2. Di panel navigasi sebelah kiri, klik Computing Resources.

    3. Temukan kluster EMR target dan klik SPARK Parameters untuk membuka halaman konfigurasi parameter Spark global.

      Halaman konfigurasi parameter Spark global berisi bagian Production and Development Environments, yang mencantumkan modul DataStudio (Data Development) dan Data Analysis. Di sebelah kanan setiap modul terdapat kotak centang Global Configuration Has Priority dan tautan Expand. Di pojok kanan atas halaman terdapat tombol Edit SPARK Parameters.

  2. Konfigurasikan parameter Spark global.

    Di pojok kanan atas halaman SPARK Parameters, klik Edit SPARK Parameters untuk mengonfigurasi parameter Spark global dan prioritasnya untuk setiap modul.

    Catatan

    Pengaturan ini berlaku secara global untuk seluruh ruang kerja. Pastikan Anda telah memilih ruang kerja yang benar sebelum melanjutkan.

    Parameter

    Deskripsi

    Spark property

    Konfigurasikan properti Spark (Spark Property Name dan Spark Property Value) yang digunakan modul untuk menjalankan tugas EMR. Untuk konfigurasi yang valid, lihat Spark Configurations dan Spark Configurations on Kubernetes.

    Global Settings Take Precedence

    Jika Anda memilih opsi ini, konfigurasi global akan menggantikan konfigurasi khusus modul. Dalam hal ini, tugas akan menggunakan properti Spark global.

    • Konfigurasi global: Parameter Spark yang dikonfigurasi di halaman SPARK Parameters untuk kluster EMR diManagement Center > Computing Resources.

      Catatan

      Saat ini, Anda hanya dapat mengonfigurasi parameter Spark global untuk modul Data Development (Data Studio), Data Quality, Data Analysis, dan Operation Center.

    • Konfigurasi khusus modul:

      • Data Development (Data Studio): Untuk node Hive dan Spark, Anda dapat menetapkan properti Spark untuk tugas node individual di panel Scheduling Settings di sisi kanan halaman pengeditan node.

      • Modul lain: Pengaturan properti Spark dalam modul lain tidak didukung.