All Products
Search
Document Center

DataWorks:Lindorm Spark node

Last Updated:Aug 21, 2026

Di DataWorks, Anda dapat menggunakan node Lindorm Spark untuk mengembangkan dan menjadwalkan tugas Lindorm Spark secara berkala. Topik ini menjelaskan alur kerja pengembangan tugas pada node Lindorm Spark.

Informasi latar belakang

Lindorm adalah layanan komputasi terdistribusi berbasis arsitektur cloud native yang mendukung model komputasi Community Edition, kompatibel dengan API Spark, serta terintegrasi secara mendalam dengan mesin penyimpanan Lindorm. Lindorm memanfaatkan fitur dan kemampuan pengindeksan dari penyimpanan data dasar untuk menyelesaikan pekerjaan terdistribusi secara efisien, sehingga cocok untuk skenario seperti pemrosesan data masif, analisis interaktif, pembelajaran mesin, dan komputasi graf.

Prasyarat

  • (Opsional, untuk Pengguna RAM) Pengguna RAM untuk pengembangan tugas telah ditambahkan ke ruang kerja yang sesuai dan diberikan peran Development atau Workspace Administrator. Peran Workspace Administrator memberikan izin yang luas, jadi tetapkan dengan hati-hati. Untuk informasi selengkapnya, lihat Tambahkan anggota ke ruang kerja.

    Catatan

    Jika Anda menggunakan Akun Alibaba Cloud, Anda dapat melewati langkah ini.

  • Instans Lindorm telah dibuat dan di-bind ke ruang kerja DataWorks Anda. Untuk informasi selengkapnya, lihat Bind resource komputasi Lindorm.

Buat node Lindorm Spark

Untuk petunjuk cara membuat node, lihat Buat node Lindorm Spark.

Kembangkan node Lindorm Spark

Bergantung pada bahasa (Java/Scala atau Python), Anda dapat mengonfigurasi node untuk mereferensikan paket JAR atau file .py yang sesuai.

Konten node (Java/Scala)

Bagian ini menggunakan program contoh SparkPi sebagai contoh untuk menunjukkan cara mengonfigurasi dan menggunakan node Lindorm Spark di DataWorks.

Unggah paket JAR

Unggah paket JAR contoh ke LindormDFS dan salin jalur penyimpanannya. Jalur ini diperlukan nanti untuk mengonfigurasi node.

  1. Siapkan paket JAR contoh.

    Unduh paket contoh spark-examples_2.12-3.3.0.jar ke komputer Anda.

  2. Unggah paket JAR ke LindormDFS.

    1. Masuk ke Konsol Lindorm. Di daftar Instances untuk wilayah yang sesuai, temukan instans Lindorm yang telah Anda buat.

    2. Klik instans Name untuk membuka halaman Instance Details.

    3. Di bilah navigasi kiri, klik Compute Engines untuk membuka halaman Compute Engines.

    4. Di tab Job Management, klik tombol Upload resources untuk membuka halaman Upload resources.

    5. Klik kotak bergaris putus-putus, temukan paket JAR yang telah Anda unduh, lalu klik Open.

    6. Klik Upload untuk mengunggah paket JAR.

  3. Salin jalur penyimpanan paket JAR contoh.

    Di tab Job Management, temukan paket JAR yang telah Anda unggah. Paket tersebut muncul di bawah tombol Upload Resource. Klik ikon image di sebelah kiri nama file untuk menyalin jalur penyimpanan paket JAR di LindormDFS.

Konfigurasikan konten node

Konfigurasikan node Lindorm Spark dengan parameter berikut.

Language

Parameter

Description

Java/Scala

Main JAR Resource

Masukkan jalur penyimpanan paket JAR contoh yang telah Anda salin pada langkah Upload a JAR package.

Main Class

Kelas utama tugas dalam paket JAR yang dikompilasi. Untuk kode contoh, kelas utamanya adalah org.apache.spark.examples.SparkPi.

Parameter

Masukkan parameter yang akan diteruskan ke kode. Anda dapat mengonfigurasi parameter dinamis dengan menggunakan format ${var}.

Configuration Item

Konfigurasikan parameter waktu proses Spark di bagian ini. Untuk informasi selengkapnya tentang properti Spark, lihat Job configuration instructions.

Catatan

Anda dapat mengatur parameter Spark global saat meng-bind resource komputasi Lindorm.

Konten node (Python)

Bagian ini menggunakan program Spark contoh yang menghitung pi sebagai contoh untuk menunjukkan cara mengonfigurasi dan menggunakan node Lindorm Spark di DataWorks.

Unggah resource Python

Unggah file Python contoh ke LindormDFS dan salin jalur penyimpanannya. Jalur ini diperlukan nanti untuk mengonfigurasi node.

  1. Buat file Python.

    Simpan skrip Python berikut sebagai file lokal bernama pi.py.

    import sys
    from random import random
    from operator import add
    
    from pyspark.sql import SparkSession
    
    if __name__ == "__main__":
        """
            Usage: pi [partitions]
        """
        spark = SparkSession\
            .builder\
            .appName("PythonPi")\
            .getOrCreate()
    
        partitions = int(sys.argv[1]) if len(sys.argv) > 1 else 2
        n = 100000 * partitions
    
        def f(_: int) -> float:
            x = random() * 2 - 1
            y = random() * 2 - 1
            return 1 if x ** 2 + y ** 2 <= 1 else 0
    
        count = spark.sparkContext.parallelize(range(1, n + 1), partitions).map(f).reduce(add)
        print("Pi is roughly %f" % (4.0 * count / n))
    
        spark.stop()
    
  2. Unggah file Python ke LindormDFS.

    1. Masuk ke Konsol Lindorm. Di daftar Instances untuk wilayah yang sesuai, temukan instans Lindorm yang telah Anda buat.

    2. Klik Name instans untuk membuka halaman Instance Details.

    3. Di bilah navigasi kiri, klik Compute Engines untuk membuka halaman Compute Engines.

    4. Di tab Job Management, klik tombol Upload resources untuk membuka halaman Upload resources.

    5. Klik kotak bergaris putus-putus, temukan file Python yang telah Anda buat, lalu klik Open.

    6. Klik Upload untuk mengunggah file Python.

  3. Salin jalur penyimpanan file Python contoh.

    Di tab Job Management, temukan file Python yang telah Anda unggah. File tersebut muncul di bawah tombol Upload Resource. Klik ikon image di sebelah kiri nama file untuk menyalin jalur penyimpanan file Python di LindormDFS.

Konfigurasikan konten node

Konfigurasikan node Lindorm Spark dengan parameter berikut.

Language

Parameter

Description

Python

Main Package

Masukkan jalur penyimpanan file Python contoh yang telah Anda salin pada langkah Upload a Python resource.

Parameter

Masukkan parameter yang akan diteruskan ke kode. Anda dapat mengonfigurasi parameter dinamis dengan menggunakan format ${var}.

Configuration Item

Anda dapat mengonfigurasi parameter waktu proses Spark di bagian ini. Untuk informasi selengkapnya tentang properti Spark, lihat Job configuration instructions.

Debug node Lindorm Spark

  1. Konfigurasikan properti debugging.

    Di panel Run Configuration di sebelah kanan, konfigurasikan Compute Resource, Lindorm Resource Group, dan Resource Group. Tabel berikut menjelaskan parameter-parameter ini.

    Parameter

    Description

    Compute Resource

    Pilih resource komputasi Lindorm yang di-bind ke ruang kerja Anda.

    Lindorm Resource Group

    Pilih kelompok sumber daya Lindorm yang Anda tentukan saat meng-bind resource komputasi Lindorm.

    Resource Group

    Pilih kelompok sumber daya yang telah lulus uji konektivitas saat Anda meng-bind resource komputasi Lindorm Spark.

    Script Parameters

    Jika Anda menentukan parameter dinamis dalam format ${ParameterName}, tentukan Script Parameters dan Parameter name yang sesuai di bagian Parameter Value. Saat tugas dijalankan, variabel akan diganti secara dinamis dengan nilai aktualnya. Untuk informasi selengkapnya, lihat Sumber dan ekspresi parameter penjadwalan.

  2. Debug dan jalankan node.

    Untuk menjalankan node, klik Save lalu Run.

Langkah berikutnya

  • Konfigurasikan penjadwalan untuk node: Untuk menjalankan node secara berkala, buka panel Scheduling Settings untuk mengatur Scheduling Policy dan mengonfigurasi properti terkait.

  • Deploy node: Untuk menjalankan tugas di lingkungan produksi, klik ikon image untuk melakukan deploy. Node hanya akan dijadwalkan secara berkala setelah dideploy ke lingkungan produksi.

  • Data Map (data tabel Lindorm): Gunakan Data Map untuk mengumpulkan metadata Lindorm.