All Products
Search
Document Center

DataWorks:Ikhtisar Data Studio

Last Updated:May 13, 2026

Data Studio adalah platform pengembangan data lakehouse cerdas dari Alibaba Cloud yang dibangun berdasarkan lebih dari satu dekade keahlian dalam big data. Platform ini mendukung berbagai layanan komputasi Alibaba Cloud dan menyediakan kemampuan untuk ETL cerdas, manajemen katalog data, serta orkestrasi alur kerja lintas mesin. Data Studio menyediakan instans lingkungan pengembangan pribadi dengan dukungan Python, analisis Notebook, dan integrasi Git. Dilengkapi ekosistem plugin yang kaya, platform ini menyatukan pemrosesan real-time dan offline, arsitektur data lakehouse, serta big data dengan AI untuk mendukung seluruh siklus hidup manajemen data Data+AI.

Data Studio

Data Studio adalah platform pengembangan data lakehouse cerdas yang mengintegrasikan praktik terbaik big data Alibaba. Platform ini terintegrasi secara mendalam dengan puluhan layanan komputasi big data dan AI Alibaba Cloud, termasuk MaxCompute, E-MapReduce, Hologres, Flink, dan PAI. Data Studio menyediakan layanan pengembangan ETL cerdas untuk gudang data, data lake, dan arsitektur data lakehouse OpenLake. Fitur utamanya meliputi:

  • Dukungan data lakehouse dan multi-mesin
    Akses data secara mulus di berbagai data lake (seperti OSS) dan gudang data (seperti MaxCompute) melalui data catalog terpadu. Manfaatkan beragam node mesin untuk memungkinkan pengembangan hibrida multi-mesin.

  • Alur kerja dan penjadwalan fleksibel
    Gunakan berbagai node kontrol alur untuk mengorkestrasi secara visual tugas lintas mesin dalam suatu alur kerja. Platform ini mendukung penjadwalan berulang berbasis waktu dan penjadwalan berbasis pemicu berbasis event.

  • Lingkungan pengembangan Data+AI terbuka
    Bangun stasiun kerja riset dan pengembangan AI yang fleksibel dengan lingkungan pengembangan pribadi yang memungkinkan dependensi kustom, Notebook yang mendukung pengkodean campuran SQL dan Python, serta fitur seperti manajemen dataset dan Git integration.

  • Bantuan cerdas dan rekayasa AI
    Copilot bawaan yang andal membantu Anda sepanjang proses pengembangan kode. Node algoritma PAI profesional dan node large model menyediakan dukungan native untuk rekayasa AI end-to-end.

Konsep utama

Konsep

Definisi

Nilai inti

Kata kunci

Workflow

Unit untuk mengorganisasi dan mengorkestrasi tugas.

Mengelola dependensi dan mengotomatiskan penjadwalan untuk tugas kompleks. Berfungsi sebagai wadah untuk pengembangan dan penjadwalan.

Visualisasi, DAG, berulang/berbasis pemicu, orkestrasi

Node

Unit eksekusi terkecil dalam suatu workflow.

Tempat Anda menulis kode dan menerapkan logika bisnis spesifik. Merupakan operasi atomik untuk pemrosesan data.

SQL, Python, Shell, integrasi data

Custom image

Snapshot standar dari suatu lingkungan.

Memastikan bahwa lingkungan bersifat ekstensibel, konsisten, dan dapat direproduksi.

Persistensi lingkungan, standardisasi, reproduktibilitas, konsistensi

Scheduling

Aturan untuk memicu tugas secara otomatis.

Mengotomatiskan produksi data dengan mengubah tugas manual menjadi beban kerja produksi otomatis.

Penjadwalan berulang, penjadwalan berbasis pemicu, dependensi, otomatisasi

Data catalog

Workbench metadata terpadu.

Mengorganisasi dan mengelola aset data (seperti tabel) serta sumber daya komputasi (seperti fungsi dan resource) secara terstruktur.

Metadata, manajemen tabel, eksplorasi data

Dataset

Pemetaan logis ke penyimpanan eksternal.

Menjembatani kesenjangan ke data tidak terstruktur eksternal (gambar dan dokumen), berfungsi sebagai jembatan data utama untuk pengembangan AI.

Akses OSS/NAS, pemasangan data, tidak terstruktur

Notebook

Kanvas pengembangan Data+AI interaktif.

Mengintegrasikan kode SQL dan Python untuk mempercepat eksplorasi data dan validasi algoritma.

Interaktif, multi-bahasa, visualisasi, analisis eksploratif

Proses pengembangan

Data Studio menyediakan proses untuk pengembangan gudang data dan AI. Bagian berikut menjelaskan dua jalur umum. Anda juga dapat mengeksplorasi jalur lain sesuai kebutuhan spesifik Anda.

Jalur umum: Pengembangan gudang data

Proses ini cocok untuk membangun gudang data perusahaan yang memungkinkan pemrosesan data batch stabil dan otomatis.

  • Audien target: Insinyur data dan pengembang ETL.

  • Tujuan utama: Membangun gudang data perusahaan yang stabil, terstandarisasi, dan dijadwalkan secara otomatis untuk pemrosesan data batch dan pembuatan laporan.

  • Teknologi utama: data catalog, workflow berulang, node SQL, dan konfigurasi penjadwalan.

Langkah

Fase

Deskripsi

Lokasi dan referensi

1

Asosiasikan mesin komputasi

Asosiasikan satu atau beberapa mesin komputasi inti, seperti MaxCompute, dengan ruang kerja Anda untuk mengeksekusi semua tugas SQL.

image

Console > Workspace Configuration

Untuk dokumentasi terkait, lihat Asosiasikan sumber daya komputasi.

2

Kelola katalog data

Di katalog data, buat atau jelajahi skema tabel yang diperlukan untuk setiap lapisan gudang data Anda (seperti ODS, DWD, dan ADS). Ini menentukan input dan output untuk pemrosesan data.

Kami merekomendasikan Anda menggunakan modul Data Modeling untuk membangun sistem gudang data Anda.

Data Studio > data catalog

Untuk dokumentasi terkait, lihat Katalog Data.

3

Buat workflow berulang

Buat workflow berulang di direktori proyek untuk berfungsi sebagai wadah pengorganisasian dan pengelolaan tugas ETL terkait.

Data Studio > Project Directory > recurring workflow

Untuk dokumentasi terkait, lihat Orkestrasi workflow berulang.

4

Kembangkan dan debug node

Buat node, seperti node ODPS SQL, dan tulis logika ETL inti (pembersihan data, transformasi, dan agregasi) di editor. Kemudian, debug node tersebut.

  • Data Studio > Node Development > Node Editor

  • Data Studio > Node Development > Run Configuration

Untuk dokumentasi terkait, lihat Pengembangan node.

5

Kembangkan dengan bantuan Copilot

Gunakan DataWorks Copilot untuk menghasilkan, memperbaiki, menulis ulang, dan mengonversi kode SQL dan Python.

  • Data Studio > Node Development > Copilot

  • Data Studio > Copilot > Agent

    Untuk dokumentasi terkait, lihat Ikhtisar Data Agent.

6

Orkestrasi dan jadwalkan node

Di kanvas DAG workflow, tentukan dependensi hulu dan hilir antar node dengan menyeret dan menghubungkannya. Berbagai node kontrol alur tersedia untuk orkestrasi kompleks.

Konfigurasikan properti penjadwalan produksi untuk workflow atau node individual, seperti siklus, waktu, dan dependensi. Platform ini mendukung penjadwalan skala besar hingga puluhan juta instans per hari.

  • Data Studio > Workflow > Workflow Canvas

  • Data Studio > Node Development > Scheduling Configuration

Untuk dokumentasi terkait, lihat Node kontrol alur umum dan Konfigurasi penjadwalan node.

7

Terapkan dan kelola workflow/node

  • Deploy: Terapkan node atau workflow yang telah di-debug ke lingkungan produksi.

  • O&M: Di Operation Center, pantau tugas produksi, konfigurasikan notifikasi, isi ulang data, dan lakukan validasi berulang. Anda dapat menggunakan garis dasar cerdas untuk memastikan tugas selesai tepat waktu dan notifikasi pemantauan untuk menerima pemberitahuan cepat tentang pengecualian.

Catatan

Untuk contoh pengantar terkait, lihat Tingkat Lanjut: Analisis kategori produk terlaris.

Jalur lanjutan: Pengembangan big data dan AI

Proses ini cocok untuk pengembangan model AI, eksplorasi ilmu data, dan membangun aplikasi AI real-time. Proses ini menekankan fleksibilitas dan interaktivitas lingkungan. Sesuaikan langkah-langkah berdasarkan kasus penggunaan Anda.

  • Audien target: Insinyur AI, ilmuwan data, dan insinyur algoritma.

  • Tujuan utama: Melakukan eksplorasi data, pelatihan model, validasi algoritma, atau membangun aplikasi AI real-time (misalnya, Retrieval-Augmented Generation (RAG) dan layanan inferensi real-time).

  • Teknologi utama: lingkungan pengembangan pribadi, Notebook, workflow berbasis pemicu, dataset, dan custom image.

Langkah

Fase

Deskripsi

Lokasi dan referensi

1

Buat lingkungan pengembangan pribadi

Buat instans kontainer cloud terisolasi dan dapat dikustomisasi untuk berfungsi sebagai lingkungan instalasi dependensi Python kompleks dan pengembangan AI profesional.

Data Studio > Personal Development Environment

Untuk dokumentasi terkait, lihat Lingkungan pengembangan pribadi.

2

Buat workflow berbasis pemicu

Buat workflow di direktori proyek yang digerakkan oleh event eksternal. Ini menyediakan wadah orkestrasi untuk aplikasi AI real-time.

Data Studio > Project Directory > event-triggered workflow

Untuk dokumentasi terkait, lihat Workflow berbasis pemicu.

3

Buat dan atur pemicu

Di Operation Center, konfigurasikan pemicu yang menentukan event eksternal mana, seperti event OSS atau pesan Kafka, yang memulai workflow.

  • Create: Operation Center > Trigger Management

  • Use: Data Studio > Event-triggered Workflow > Scheduling Configuration

Untuk dokumentasi terkait, lihat Kelola pemicu dan Workflow berbasis pemicu.

4

Buat node Notebook

Buat unit pengembangan inti untuk menulis kode AI dan Python. Biasanya, Anda mulai dengan eksplorasi di Notebook dalam folder pribadi Anda.

Project Directory > event-triggered workflow > Notebook Node

Untuk dokumentasi terkait, lihat Buat node.

5

Buat dan gunakan dataset

Daftarkan data tidak terstruktur, seperti gambar dan dokumen, yang disimpan di OSS atau NAS sebagai dataset, lalu pasang ke lingkungan pengembangan atau tugas agar dapat diakses oleh kode.

  • Create: Data Studio > data catalog > dataset

  • Use: Data Studio > Personal Development Environment > Dataset Configuration

Untuk dokumentasi terkait, lihat Kelola dataset dan Gunakan dataset.

6

Kembangkan & debug Notebook/node

Tulis logika algoritma, jelajahi data, validasi model, dan iterasi dengan cepat di lingkungan interaktif yang disediakan oleh lingkungan pengembangan pribadi.

Data Studio > Notebook Editor

Untuk dokumentasi terkait, lihat Pengembangan Notebook dasar.

7

Instal paket dependensi kustom

Di terminal lingkungan pengembangan pribadi Anda atau di sel Notebook, gunakan alat seperti pip untuk menginstal library Python pihak ketiga yang dibutuhkan model Anda.

Data Studio > Personal Development Environment > Terminal

Untuk dokumentasi terkait, lihat Lampiran: Lengkapi lingkungan pengembangan pribadi Anda.

8

Buat custom image

Buat snapshot lingkungan pengembangan pribadi yang telah dikonfigurasi Anda menjadi gambar standar. Ini memastikan bahwa lingkungan produksi identik dengan lingkungan pengembangan.

Jika Anda belum menginstal paket dependensi kustom apa pun, Anda dapat melewati langkah ini.
  • Data Studio > Personal Development Environment > Manage Environment

  • Console > Custom Image

Untuk dokumentasi terkait, lihat Buat gambar DataWorks dari lingkungan pengembangan pribadi.

9

Konfigurasikan penjadwalan node

Dalam konfigurasi penjadwalan untuk node produksi, Anda harus menentukan custom image yang dibuat pada langkah sebelumnya sebagai lingkungan runtime dan memasang dataset yang diperlukan.

Data Studio > Notebook Node > Scheduling Configuration

Untuk dokumentasi terkait, lihat Konfigurasi penjadwalan node.

10

Terapkan dan kelola node/workflow

  • Deploy: Terapkan workflow berbasis pemicu yang telah dikonfigurasi sepenuhnya ke lingkungan produksi.

  • O&M: Verifikasi bahwa proses end-to-end berfungsi dengan benar dengan memicu event nyata, seperti unggahan file, dan lakukan validasi pemicu.

Modul inti

Modul

Kemampuan utama

Orkestrasi workflow

Menyediakan kanvas Directed Acyclic Graph (DAG) visual yang memungkinkan Anda dengan mudah membangun dan mengelola proyek kompleks melalui antarmuka seret-dan-lepas. Mendukung orkestrasi workflow berulang, workflow berbasis pemicu, dan proses bisnis manual untuk memenuhi berbagai kebutuhan otomatisasi.

Lingkungan dan mode eksekusi

Menyediakan lingkungan pengembangan fleksibel dan terbuka untuk meningkatkan efisiensi dan kolaborasi pengembangan.

  • Lingkungan eksekusi: Mendukung lingkungan pengembangan default, lingkungan pengembangan pribadi, dan custom image untuk memenuhi kebutuhan pengembangan personal. Juga mendukung integrasi Git untuk kontrol versi kode, sehingga pengembang dapat menggunakan alat yang sudah dikenal.

  • Mode pengembangan: Menyediakan direktori proyek (kolaborasi tim), direktori pribadi (pengembangan dan pengujian individu), dan direktori manual (tugas sementara) untuk memungkinkan isolasi dan manajemen aset pengembangan secara efektif.

Pengembangan node

Mendukung berbagai jenis node dan mesin komputasi untuk pemrosesan dan analisis data yang fleksibel.

  • Mesin komputasi: Terintegrasi mulus dengan mesin komputasi big data seperti MaxCompute, E-MapReduce, Hologres, dan Flink, serta layanan AI seperti PAI.

  • Jenis node: Menyediakan integrasi data, SQL, Python, Shell, Notebook, node large model, dan berbagai node interaktif AI untuk memenuhi beragam kebutuhan, termasuk sinkronisasi data, pembersihan, pemrosesan, dan pelatihan AI.

Untuk informasi lebih lanjut, lihat Manajemen sumber daya komputasi dan Pengembangan node.

Penjadwalan node

Menyediakan kemampuan penjadwalan otomatis yang andal dan fleksibel untuk memastikan tugas dieksekusi tepat waktu dan teratur.

  • Mekanisme penjadwalan: Mendukung penjadwalan berulang berbasis waktu (per tahun, bulan, hari, jam, menit, dan detik), serta penjadwalan berbasis event atau pemicu OpenAPI.

  • Dependensi penjadwalan: Mendukung hubungan dependensi kompleks dalam siklus yang sama, lintas siklus, lintas workflow, dan lintas ruang kerja, serta dependensi antara siklus penjadwalan dan jenis tugas yang berbeda.

  • Kebijakan penjadwalan: Mendukung kebijakan lanjutan seperti menetapkan waktu efektif tugas, menjalankan ulang saat gagal, dry run, dan pembekuan.

  • Parameter penjadwalan: Mendukung parameter workflow, parameter ruang kerja, parameter konteks, dan parameter node.

    Untuk informasi lebih lanjut, lihat Konfigurasi penjadwalan node.

Manajemen sumber daya pengembangan

Menyediakan manajemen terpadu berbagai aset yang terlibat dalam proses pengembangan data.

  • Data catalog: Menyediakan kemampuan manajemen metadata data lakehouse, mendukung pembuatan, peninjauan, dan pengelolaan tabel data.

  • Fungsi dan resource: Mendukung manajemen dan referensi fungsi yang ditentukan pengguna (UDF) serta berbagai file resource, seperti file JAR dan Python.

  • Dataset: Mendukung pemasangan dan pengelolaan dataset dari sistem penyimpanan eksternal seperti OSS dan NAS.

    Untuk informasi lebih lanjut, lihat Katalog Data, Manajemen Resource, dan Gunakan dataset.

Kontrol kualitas

Memiliki berbagai mekanisme kontrol bawaan untuk memastikan proses produksi data terstandarisasi dan output data akurat.

  • Tinjauan kode: Mendukung tinjauan kode manual sebelum penerapan tugas untuk memastikan kualitas kode.

  • Kontrol proses: Memungkinkan validasi otomatis selama pengiriman dan penerapan tugas dengan menggunakan metode seperti pengujian asap, pemeriksaan item tata kelola, dan ekstensi.

  • Data Quality: Anda dapat mengasosiasikan tugas dengan aturan pemantauan Data Quality untuk secara otomatis memicu validasi data setelah eksekusi, sehingga segera menemukan data bermasalah.

    Untuk informasi lebih lanjut, lihat Tinjauan kode, Konfigurasikan item pemeriksaan, Pengujian asap, dan Konfigurasikan aturan Data Quality.

Keterbukaan dan ekstensibilitas

Menyediakan berbagai antarmuka terbuka dan titik ekstensi untuk integrasi mudah dengan sistem eksternal dan pengembangan kustom.

  • OpenAPI: Menyediakan antarmuka API komprehensif yang mendukung manajemen dan operasi tugas pengembangan secara terprogram.

  • Pesan event: Mendukung berlangganan pesan event terkait pengembangan data untuk memungkinkan interaksi dengan sistem eksternal.

    Untuk informasi lebih lanjut, lihat OpenAPI, OpenEvent, dan Ekstensi.

Penagihan

  • Biaya di sisi DataWorks (termasuk dalam tagihan DataWorks)

  • Biaya di luar sisi DataWorks (tidak termasuk dalam tagihan DataWorks)

    Saat Anda menjalankan tugas node pengembangan data, biaya komputasi dan penyimpanan mesin komputasi (seperti biaya penyimpanan OSS) yang mungkin timbul tidak dikenakan oleh DataWorks.

Mulai cepat

Buat atau aktifkan Data Studio

  • Saat membuat ruang kerja, pilih Use Data Studio (New Version). Untuk informasi lebih lanjut, lihat Buat ruang kerja.

  • Di DataStudio lama, Anda dapat mengklik Upgrade to New Version di bagian atas halaman DataStudio dan ikuti petunjuk di layar untuk memigrasikan data Anda ke Data Studio. Untuk informasi lebih lanjut, lihat Panduan peningkatan Data Studio.

Buka Data Studio

Buka halaman Workspaces di konsol DataWorks. Di bilah navigasi atas, pilih wilayah yang diinginkan. Temukan ruang kerja yang diinginkan dan pilih Shortcuts > Data Studio di kolom Actions.

FAQ

  • T: Bagaimana cara membedakan Data Studio versi baru dan DataStudio lama?

    J: Antarmuka penggunanya sangat berbeda. Data Studio versi baru memiliki bilah atas gelap dan direktori berbentuk pohon di sebelah kiri, sedangkan versi lama memiliki latar belakang terang dan tata letak panel tradisional.

  • T: Apakah saya dapat kembali ke versi lama setelah meningkatkan ke Data Studio versi baru?

    J: Peningkatan ini tidak dapat dikembalikan. Setelah peningkatan berhasil, Anda tidak dapat kembali ke versi lama. Sebelum beralih, kami sarankan Anda membuat ruang kerja dengan Data Studio versi baru diaktifkan untuk pengujian guna memastikan sesuai dengan kebutuhan bisnis Anda. Selain itu, data di versi baru dan lama disimpan terpisah.

  • T: Mengapa saya tidak melihat opsi Use Data Studio (New Version) saat membuat ruang kerja?

    A: Jika Anda tidak melihat opsi ini, Data Studio versi baru telah diaktifkan secara default di ruang kerja Anda.

    Penting

    Jika Anda mengalami masalah saat menggunakan Data Studio versi baru, Anda dapat bergabung dengan grup DingTalk DataWorks untuk dukungan peningkatan Data Studio guna mendapatkan bantuan.