MaxCompute Spark adalah layanan komputasi Spark yang kompatibel dengan open source dan disediakan oleh MaxCompute. Dibangun di atas sistem sumber daya komputasi terpadu dan sistem izin set data, layanan ini menyediakan framework komputasi Spark yang memungkinkan pengguna mengirim serta menjalankan pekerjaan Spark menggunakan pendekatan pengembangan yang sudah dikenal, guna mendukung berbagai skenario pemrosesan dan analitik data yang lebih luas.
Fitur utama
-
Dukungan untuk pekerjaan Spark multi-versi native
Spark komunitas native berjalan di MaxCompute, sepenuhnya kompatibel dengan API Spark, dan mendukung beberapa versi Spark.
-
Sumber daya komputasi terpadu
MaxCompute Spark berjalan pada sumber daya komputasi terpadu yang diaktifkan untuk Proyek MaxCompute, sama seperti jenis task lainnya seperti MaxCompute SQL dan MapReduce.
-
Pengelolaan data dan izin terpadu
Mengikuti sistem izin Proyek MaxCompute untuk mengakses data secara aman dalam cakupan izin pengguna.
-
Pengalaman pengguna yang sama dengan sistem open source
Menyediakan antarmuka Spark UI real-time open source native dan fitur log riwayat kueri.
Fitur yang didukung
MaxCompute Spark saat ini mendukung fitur-fitur berikut:
-
Komputasi offline: GraphX, MLlib, RDD, Spark-SQL, PySpark, dan lainnya.
-
Membaca dan menulis data tabel MaxCompute.
-
Merujuk resource file di MaxCompute.
-
Mengakses layanan di lingkungan VPC Alibaba Cloud.
-
Mengakses penyimpanan tidak terstruktur OSS Alibaba Cloud.
-
Membaca tabel eksternal OSS MaxCompute.
-
DataWorks Notebook
Batasan
MaxCompute Spark saat ini tidak mendukung skenario-skenario berikut:
-
Skema interaktif seperti Spark-Shell, Spark-SQL-Shell, dan PySpark-Shell tidak didukung.
-
Akses ke fungsi bawaan MaxCompute dan user-defined function (UDF MaxCompute) tidak didukung.
-
Akses ke tabel eksternal MaxCompute selain tabel eksternal OSS tidak didukung.