Data Studio adalah platform pengembangan data lakehouse cerdas dari Alibaba Cloud yang dibangun berdasarkan lebih dari satu dekade keahlian dalam big data. Platform ini mendukung berbagai layanan komputasi Alibaba Cloud dan menyediakan kemampuan untuk ETL cerdas, manajemen katalog data, serta orkestrasi alur kerja lintas mesin. Data Studio menyediakan instans lingkungan pengembangan pribadi dengan dukungan Python, analisis Notebook, dan integrasi Git. Dilengkapi ekosistem plugin yang kaya, platform ini menyatukan pemrosesan real-time dan offline, arsitektur data lakehouse, serta big data dengan AI untuk mendukung seluruh siklus hidup manajemen data Data+AI.
Data Studio
Data Studio adalah platform pengembangan data lakehouse cerdas yang mengintegrasikan praktik terbaik big data Alibaba. Platform ini terintegrasi secara mendalam dengan puluhan layanan komputasi big data dan AI Alibaba Cloud, termasuk MaxCompute, E-MapReduce, Hologres, Flink, dan PAI. Data Studio menyediakan layanan pengembangan ETL cerdas untuk gudang data, data lake, dan arsitektur data lakehouse OpenLake. Fitur utamanya meliputi:
-
Dukungan data lakehouse dan multi-mesin
Akses data secara mulus di berbagai data lake (seperti OSS) dan gudang data (seperti MaxCompute) melalui data catalog terpadu. Manfaatkan beragam node mesin untuk memungkinkan pengembangan hibrida multi-mesin. -
Alur kerja dan penjadwalan fleksibel
Gunakan berbagai node kontrol alur untuk mengorkestrasi secara visual tugas lintas mesin dalam suatu alur kerja. Platform ini mendukung penjadwalan berulang berbasis waktu dan penjadwalan berbasis pemicu berbasis event. -
Lingkungan pengembangan Data+AI terbuka
Bangun stasiun kerja riset dan pengembangan AI yang fleksibel dengan lingkungan pengembangan pribadi yang memungkinkan dependensi kustom, Notebook yang mendukung pengkodean campuran SQL dan Python, serta fitur seperti manajemen dataset dan Git integration. -
Bantuan cerdas dan rekayasa AI
Copilot bawaan yang andal membantu Anda sepanjang proses pengembangan kode. Node algoritma PAI profesional dan node large model menyediakan dukungan native untuk rekayasa AI end-to-end.
Konsep utama
|
Konsep |
Definisi |
Nilai inti |
Kata kunci |
|
Workflow |
Unit untuk mengorganisasi dan mengorkestrasi tugas. |
Mengelola dependensi dan mengotomatiskan penjadwalan untuk tugas kompleks. Berfungsi sebagai wadah untuk pengembangan dan penjadwalan. |
Visualisasi, DAG, berulang/berbasis pemicu, orkestrasi |
|
Node |
Unit eksekusi terkecil dalam suatu workflow. |
Tempat Anda menulis kode dan menerapkan logika bisnis spesifik. Merupakan operasi atomik untuk pemrosesan data. |
SQL, Python, Shell, integrasi data |
|
Custom image |
Snapshot standar dari suatu lingkungan. |
Memastikan bahwa lingkungan bersifat ekstensibel, konsisten, dan dapat direproduksi. |
Persistensi lingkungan, standardisasi, reproduktibilitas, konsistensi |
|
Scheduling |
Aturan untuk memicu tugas secara otomatis. |
Mengotomatiskan produksi data dengan mengubah tugas manual menjadi beban kerja produksi otomatis. |
Penjadwalan berulang, penjadwalan berbasis pemicu, dependensi, otomatisasi |
|
Data catalog |
Workbench metadata terpadu. |
Mengorganisasi dan mengelola aset data (seperti tabel) serta sumber daya komputasi (seperti fungsi dan resource) secara terstruktur. |
Metadata, manajemen tabel, eksplorasi data |
|
Dataset |
Pemetaan logis ke penyimpanan eksternal. |
Menjembatani kesenjangan ke data tidak terstruktur eksternal (gambar dan dokumen), berfungsi sebagai jembatan data utama untuk pengembangan AI. |
Akses OSS/NAS, pemasangan data, tidak terstruktur |
|
Notebook |
Kanvas pengembangan Data+AI interaktif. |
Mengintegrasikan kode SQL dan Python untuk mempercepat eksplorasi data dan validasi algoritma. |
Interaktif, multi-bahasa, visualisasi, analisis eksploratif |
Proses pengembangan
Data Studio menyediakan proses untuk pengembangan gudang data dan AI. Bagian berikut menjelaskan dua jalur umum. Anda juga dapat mengeksplorasi jalur lain sesuai kebutuhan spesifik Anda.
Jalur umum: Pengembangan gudang data
Proses ini cocok untuk membangun gudang data perusahaan yang memungkinkan pemrosesan data batch stabil dan otomatis.
-
Audien target: Insinyur data dan pengembang ETL.
-
Tujuan utama: Membangun gudang data perusahaan yang stabil, terstandarisasi, dan dijadwalkan secara otomatis untuk pemrosesan data batch dan pembuatan laporan.
-
Teknologi utama: data catalog, workflow berulang, node SQL, dan konfigurasi penjadwalan.
|
Langkah |
Fase |
Deskripsi |
Lokasi dan referensi |
|
1 |
Asosiasikan mesin komputasi |
Asosiasikan satu atau beberapa mesin komputasi inti, seperti MaxCompute, dengan ruang kerja Anda untuk mengeksekusi semua tugas SQL.
|
Console > Workspace Configuration Untuk dokumentasi terkait, lihat Asosiasikan sumber daya komputasi. |
|
2 |
Kelola katalog data |
Di katalog data, buat atau jelajahi skema tabel yang diperlukan untuk setiap lapisan gudang data Anda (seperti ODS, DWD, dan ADS). Ini menentukan input dan output untuk pemrosesan data. Kami merekomendasikan Anda menggunakan modul Data Modeling untuk membangun sistem gudang data Anda. |
Data Studio > data catalog Untuk dokumentasi terkait, lihat Katalog Data. |
|
3 |
Buat workflow berulang |
Buat workflow berulang di direktori proyek untuk berfungsi sebagai wadah pengorganisasian dan pengelolaan tugas ETL terkait. |
Data Studio > Project Directory > recurring workflow Untuk dokumentasi terkait, lihat Orkestrasi workflow berulang. |
|
4 |
Kembangkan dan debug node |
Buat node, seperti node ODPS SQL, dan tulis logika ETL inti (pembersihan data, transformasi, dan agregasi) di editor. Kemudian, debug node tersebut. |
Untuk dokumentasi terkait, lihat Pengembangan node. |
|
5 |
Kembangkan dengan bantuan Copilot |
Gunakan DataWorks Copilot untuk menghasilkan, memperbaiki, menulis ulang, dan mengonversi kode SQL dan Python. |
|
|
6 |
Orkestrasi dan jadwalkan node |
Di kanvas DAG workflow, tentukan dependensi hulu dan hilir antar node dengan menyeret dan menghubungkannya. Berbagai node kontrol alur tersedia untuk orkestrasi kompleks. Konfigurasikan properti penjadwalan produksi untuk workflow atau node individual, seperti siklus, waktu, dan dependensi. Platform ini mendukung penjadwalan skala besar hingga puluhan juta instans per hari. |
Untuk dokumentasi terkait, lihat Node kontrol alur umum dan Konfigurasi penjadwalan node. |
|
7 |
Terapkan dan kelola workflow/node |
|
|
Untuk contoh pengantar terkait, lihat Tingkat Lanjut: Analisis kategori produk terlaris.
Jalur lanjutan: Pengembangan big data dan AI
Proses ini cocok untuk pengembangan model AI, eksplorasi ilmu data, dan membangun aplikasi AI real-time. Proses ini menekankan fleksibilitas dan interaktivitas lingkungan. Sesuaikan langkah-langkah berdasarkan kasus penggunaan Anda.
-
Audien target: Insinyur AI, ilmuwan data, dan insinyur algoritma.
-
Tujuan utama: Melakukan eksplorasi data, pelatihan model, validasi algoritma, atau membangun aplikasi AI real-time (misalnya, Retrieval-Augmented Generation (RAG) dan layanan inferensi real-time).
-
Teknologi utama: lingkungan pengembangan pribadi, Notebook, workflow berbasis pemicu, dataset, dan custom image.
|
Langkah |
Fase |
Deskripsi |
Lokasi dan referensi |
|
1 |
Buat lingkungan pengembangan pribadi |
Buat instans kontainer cloud terisolasi dan dapat dikustomisasi untuk berfungsi sebagai lingkungan instalasi dependensi Python kompleks dan pengembangan AI profesional. |
Data Studio > Personal Development Environment Untuk dokumentasi terkait, lihat Lingkungan pengembangan pribadi. |
|
2 |
Buat workflow berbasis pemicu |
Buat workflow di direktori proyek yang digerakkan oleh event eksternal. Ini menyediakan wadah orkestrasi untuk aplikasi AI real-time. |
Data Studio > Project Directory > event-triggered workflow Untuk dokumentasi terkait, lihat Workflow berbasis pemicu. |
|
3 |
Buat dan atur pemicu |
Di Operation Center, konfigurasikan pemicu yang menentukan event eksternal mana, seperti event OSS atau pesan Kafka, yang memulai workflow. |
Untuk dokumentasi terkait, lihat Kelola pemicu dan Workflow berbasis pemicu. |
|
4 |
Buat node Notebook |
Buat unit pengembangan inti untuk menulis kode AI dan Python. Biasanya, Anda mulai dengan eksplorasi di Notebook dalam folder pribadi Anda. |
Project Directory > event-triggered workflow > Notebook Node Untuk dokumentasi terkait, lihat Buat node. |
|
5 |
Buat dan gunakan dataset |
Daftarkan data tidak terstruktur, seperti gambar dan dokumen, yang disimpan di OSS atau NAS sebagai dataset, lalu pasang ke lingkungan pengembangan atau tugas agar dapat diakses oleh kode. |
Untuk dokumentasi terkait, lihat Kelola dataset dan Gunakan dataset. |
|
6 |
Kembangkan & debug Notebook/node |
Tulis logika algoritma, jelajahi data, validasi model, dan iterasi dengan cepat di lingkungan interaktif yang disediakan oleh lingkungan pengembangan pribadi. |
Data Studio > Notebook Editor Untuk dokumentasi terkait, lihat Pengembangan Notebook dasar. |
|
7 |
Instal paket dependensi kustom |
Di terminal lingkungan pengembangan pribadi Anda atau di sel Notebook, gunakan alat seperti |
Data Studio > Personal Development Environment > Terminal Untuk dokumentasi terkait, lihat Lampiran: Lengkapi lingkungan pengembangan pribadi Anda. |
|
8 |
Buat custom image |
Buat snapshot lingkungan pengembangan pribadi yang telah dikonfigurasi Anda menjadi gambar standar. Ini memastikan bahwa lingkungan produksi identik dengan lingkungan pengembangan. Jika Anda belum menginstal paket dependensi kustom apa pun, Anda dapat melewati langkah ini. |
Untuk dokumentasi terkait, lihat Buat gambar DataWorks dari lingkungan pengembangan pribadi. |
|
9 |
Konfigurasikan penjadwalan node |
Dalam konfigurasi penjadwalan untuk node produksi, Anda harus menentukan custom image yang dibuat pada langkah sebelumnya sebagai lingkungan runtime dan memasang dataset yang diperlukan. |
Data Studio > Notebook Node > Scheduling Configuration Untuk dokumentasi terkait, lihat Konfigurasi penjadwalan node. |
|
10 |
Terapkan dan kelola node/workflow |
|
|
Modul inti
|
Modul |
Kemampuan utama |
|
Orkestrasi workflow |
Menyediakan kanvas Directed Acyclic Graph (DAG) visual yang memungkinkan Anda dengan mudah membangun dan mengelola proyek kompleks melalui antarmuka seret-dan-lepas. Mendukung orkestrasi workflow berulang, workflow berbasis pemicu, dan proses bisnis manual untuk memenuhi berbagai kebutuhan otomatisasi. |
|
Lingkungan dan mode eksekusi |
Menyediakan lingkungan pengembangan fleksibel dan terbuka untuk meningkatkan efisiensi dan kolaborasi pengembangan.
|
|
Pengembangan node |
Mendukung berbagai jenis node dan mesin komputasi untuk pemrosesan dan analisis data yang fleksibel.
Untuk informasi lebih lanjut, lihat Manajemen sumber daya komputasi dan Pengembangan node. |
|
Penjadwalan node |
Menyediakan kemampuan penjadwalan otomatis yang andal dan fleksibel untuk memastikan tugas dieksekusi tepat waktu dan teratur.
|
|
Manajemen sumber daya pengembangan |
Menyediakan manajemen terpadu berbagai aset yang terlibat dalam proses pengembangan data.
|
|
Kontrol kualitas |
Memiliki berbagai mekanisme kontrol bawaan untuk memastikan proses produksi data terstandarisasi dan output data akurat.
|
|
Keterbukaan dan ekstensibilitas |
Menyediakan berbagai antarmuka terbuka dan titik ekstensi untuk integrasi mudah dengan sistem eksternal dan pengembangan kustom.
|
Penagihan
Biaya di sisi DataWorks (termasuk dalam tagihan DataWorks)
Biaya kelompok sumber daya: Penggunaan pengembangan node dan lingkungan pengembangan pribadi bergantung pada kelompok sumber daya. Bergantung pada jenis kelompok sumber daya, Anda dikenai biaya kelompok sumber daya serverless atau biaya kelompok sumber daya eksklusif untuk penjadwalan.
Jika Anda menggunakan layanan large model, biaya kelompok sumber daya serverless juga dikenakan.
Biaya penjadwalan tugas: Jika tugas diterapkan ke lingkungan produksi untuk eksekusi terjadwal, biaya penjadwalan tugas (saat menggunakan kelompok sumber daya serverless) atau biaya kelompok sumber daya eksklusif untuk penjadwalan (saat menggunakan kelompok sumber daya eksklusif) dikenakan.
Biaya Data Quality: Jika Anda mengonfigurasi pemantauan kualitas untuk tugas terjadwal dan instans berhasil dipicu, biaya instans Data Quality dikenakan.
Biaya garis dasar cerdas: Jika Anda mengonfigurasi garis dasar cerdas untuk tugas terjadwal, garis dasar cerdas yang diaktifkan akan dikenai biaya instans garis dasar cerdas.
Biaya SMS dan panggilan telepon notifikasi: Jika Anda mengonfigurasi notifikasi pemantauan untuk tugas terjadwal dan notifikasi SMS atau telepon berhasil dipicu, biaya SMS dan panggilan telepon notifikasi dikenakan.
CatatanModul yang terlibat: Data Studio, Data Quality, dan Operation Center.
Biaya di luar sisi DataWorks (tidak termasuk dalam tagihan DataWorks)
Saat Anda menjalankan tugas node pengembangan data, biaya komputasi dan penyimpanan mesin komputasi (seperti biaya penyimpanan OSS) yang mungkin timbul tidak dikenakan oleh DataWorks.
Mulai cepat
Buat atau aktifkan Data Studio
-
Saat membuat ruang kerja, pilih Use Data Studio (New Version). Untuk informasi lebih lanjut, lihat Buat ruang kerja.
-
Di DataStudio lama, Anda dapat mengklik Upgrade to New Version di bagian atas halaman DataStudio dan ikuti petunjuk di layar untuk memigrasikan data Anda ke Data Studio. Untuk informasi lebih lanjut, lihat Panduan peningkatan Data Studio.
Buka Data Studio
Buka halaman Workspaces di konsol DataWorks. Di bilah navigasi atas, pilih wilayah yang diinginkan. Temukan ruang kerja yang diinginkan dan pilih di kolom Actions.
FAQ
-
T: Bagaimana cara membedakan Data Studio versi baru dan DataStudio lama?
J: Antarmuka penggunanya sangat berbeda. Data Studio versi baru memiliki bilah atas gelap dan direktori berbentuk pohon di sebelah kiri, sedangkan versi lama memiliki latar belakang terang dan tata letak panel tradisional.
-
T: Apakah saya dapat kembali ke versi lama setelah meningkatkan ke Data Studio versi baru?
J: Peningkatan ini tidak dapat dikembalikan. Setelah peningkatan berhasil, Anda tidak dapat kembali ke versi lama. Sebelum beralih, kami sarankan Anda membuat ruang kerja dengan Data Studio versi baru diaktifkan untuk pengujian guna memastikan sesuai dengan kebutuhan bisnis Anda. Selain itu, data di versi baru dan lama disimpan terpisah.
-
T: Mengapa saya tidak melihat opsi Use Data Studio (New Version) saat membuat ruang kerja?
A: Jika Anda tidak melihat opsi ini, Data Studio versi baru telah diaktifkan secara default di ruang kerja Anda.
PentingJika Anda mengalami masalah saat menggunakan Data Studio versi baru, Anda dapat bergabung dengan grup DingTalk DataWorks untuk dukungan peningkatan Data Studio guna mendapatkan bantuan.
