All Products
Search
Document Center

DataWorks:Manajemen sumber data

Last Updated:Jun 19, 2026

Sumber data mendaftarkan detail koneksi sistem data eksternal (database, penyimpanan, atau antrian pesan) di DataWorks untuk operasi baca/tulis data lintas modul. Ruang kerja mode standar mendukung isolasi lingkungan—sumber data terpisah untuk pengembangan dan produksi mencegah operasi pengujian memengaruhi data produksi.

Fitur

Penggunaan sumber data

Sumber data di DataWorks dikelola secara terpusat di bagian Management Center > Data Sources ruang kerja. Setelah Anda membuat dan menguji koneksi, sumber data tersebut dapat digunakan di seluruh modul DataWorks.

Modul

Kasus penggunaan

Jenis yang didukung

Data Integration

Jalankan tugas sinkronisasi data untuk memigrasikan data antar sumber data, seperti dari MySQL ke MaxCompute. Mendukung berbagai jenis sinkronisasi, termasuk tabel tunggal, database penuh, batch, dan real-time.

Sumber data yang didukung dan solusi sinkronisasi

Data Studio

Kembangkan, debug, dan jadwalkan node secara berkala. Di mode standar, tugas secara otomatis menggunakan sumber data yang ditentukan untuk lingkungan pengembangan atau produksi.

Resource komputasi, Node database

Data Map

Kumpulkan metadata dari sumber data. Anda dapat melihat struktur tabel dan informasi lineage.

Sumber data yang didukung dan metode pengumpulan metadata

Data Analysis

Hubungkan ke database untuk pemrosesan, analisis, transformasi, dan visualisasi data.

Sumber data yang didukung

Data Service

Buat layanan API berdasarkan struktur tabel sumber data untuk menyediakan antarmuka kueri data.

Sumber data yang didukung untuk pembuatan API

Isolasi lingkungan sumber data

Ruang kerja mode standar mendukung isolasi lingkungan sumber data—sumber data terpisah untuk pengembangan dan produksi mencegah operasi pengujian memengaruhi data produksi. Untuk informasi lebih lanjut, lihat Deskripsi lingkungan sumber data.

Jenis sumber data

DataWorks mendukung dua jenis sumber data:

Perbandingan

Jenis standar

Jenis metadata

Tujuan utama

Menyimpan detail koneksi untuk akses data fisik, digunakan untuk membaca, menulis, dan komputasi.

Menyimpan detail koneksi untuk pusat metadata data lake. Hanya digunakan untuk pengumpulan dan tata kelola metadata.

Objek target

Data fisik itu sendiri.

Informasi deskriptif tentang data (metadata), seperti struktur database, tabel, dan kolom.

Tersedia untuk eksekusi tugas

Ya. Reader dan writer tugas sinkronisasi harus mereferensikan jenis sumber data ini.

Tidak. Tidak dapat digunakan sebagai input atau output tugas.

Contoh khas

MySQL, MaxCompute, Hologres, DLF, OSS, dan lainnya.

Paimon Catalog.

Ringkasan: Gunakan sumber data standar untuk membaca, menulis, atau komputasi data. Gunakan sumber data metadata untuk membawa struktur tabel Paimon dan data lake lainnya ke DataWorks guna tata kelola dan peninjauan.

Prasyarat

Sebelum mengonfigurasi sumber data, pastikan hal-hal berikut:

  • Persyaratan izin: Anda harus memiliki peran Workspace Administrator atau Operator di ruang kerja target, atau merupakan RAM user dengan kebijakan AliyunDataWorksFullAccess atau AdministratorAccess. Otorisasi: Berikan izin kepada RAM user dan Kelola peran dan anggota ruang kerja.

  • Detail koneksi: Siapkan informasi koneksi: instans atau titik akhir (Endpoint/JDBC URL), port, nama database, username, dan password.

  • Konektivitas jaringan: Pastikan resource group DataWorks dapat mengakses sumber data Anda. Jika sumber data Anda dapat diakses melalui Internet dan Anda menggunakan resource group serverless, Anda harus mengonfigurasi Internet NAT Gateway dan EIP untuk VPC yang terkait dengan resource group tersebut.

Catatan

  • Batasan penggunaan: Sumber data yang dibuat dengan metode cross-region, cross-account, atau AccessKey hanya dapat digunakan untuk sinkronisasi data, bukan untuk pengembangan data atau penjadwalan tugas.

  • Perbedaan pembuatan modul: Di mode standar, sumber data yang dibuat di Administration mencakup informasi lingkungan pengembangan dan produksi. Sumber data yang dibuat di Data Integration hanya mencakup informasi lingkungan produksi. Buat dan kelola semua sumber data di Administration.

Metode pembuatan: Otomatis dan manual

Metode pembuatan

Deskripsi

Skenario yang berlaku

Pembuatan otomatis

Saat Anda mengaitkan resource komputasi (seperti MaxCompute atau Hologres) dengan ruang kerja, sistem secara otomatis membuat dan mengelola sumber data yang sesuai. Siklus hidup dan izinnya diwariskan dari resource komputasi tersebut.

Disarankan: Saat sumber data digunakan untuk pengembangan data, Anda harus menggunakan metode ini. Jika tidak, tugas tidak dapat dijalankan.

Pembuatan manual

Tentukan secara manual detail koneksi, kredensial autentikasi, dan parameter lainnya untuk sumber data. Anda dapat mengontrol siklus hidup dan penugasan izin sumber data tersebut.

Berlaku untuk semua jenis sumber data, terutama untuk Data Integration, Data Service, atau skenario yang memerlukan kontrol izin detail halus.

Titik masuk

  1. Masuk ke Konsol DataWorks. Di wilayah target, klik More > Management Center di panel navigasi sebelah kiri. Pilih ruang kerja dari daftar drop-down dan klik Go to Management Center.

  2. Di panel navigasi sebelah kiri, klik Data Sources untuk membuka halaman Data Sources.

  3. Klik Add Connection di pojok kiri atas halaman.

Buat sumber data

Langkah 1: Pilih mode koneksi

DataWorks mendukung mode Instance Mode dan User-created Data Store with Public IP Addresses untuk mengonfigurasi koneksi sumber data.

Skenario 1: Mode instans (akun Alibaba Cloud saat ini)

Jika sumber data Anda adalah layanan Alibaba Cloud (seperti ApsaraDB RDS atau PolarDB) di bawah akun saat ini, pilih Instance Mode. Tentukan Region dan Instance. Sistem secara otomatis memperoleh detail koneksi.

  • Jika membeli instans baru, gunakan VPC yang sama dengan resource group DataWorks untuk meminimalkan konfigurasi jaringan.

  • Jika Anda sudah memiliki instans sumber data dan VPC-nya berbeda dari VPC yang digunakan oleh resource group DataWorks, pastikan untuk mengonfigurasi konektivitas jaringan guna memastikan akses sumber data yang tepat.

Skenario 2: Mode instans (akun Alibaba Cloud lain)

Saat menambahkan sumber data dalam mode instans, jika Anda perlu mengakses instans di bawah Another Alibaba Cloud Account, Anda dapat mengonfigurasi ID of Another Alibaba Cloud Account dan Name of Role Assigned to RAM User untuk membuat sumber data lintas akun.

Saat membuat sumber data lintas akun, pastikan bahwa:

Skenario 3: Mode string koneksi

Untuk sumber data yang dikelola sendiri di instans ECS, di pusat data lokal, atau di jaringan publik, gunakan mode string koneksi. Konfigurasikan secara manual alamat jaringan (Endpoint/JDBC URL), port, nama database, dan kredensial (username/password/AccessKey).

Penting

Saat Anda menggunakan mode string koneksi, DataWorks secara otomatis mengurai URL JDBC. Jika URL berisi parameter yang tidak didukung, sistem secara otomatis menghapus parameter tersebut. Untuk mempertahankan parameter khusus, untuk menghubungi dukungan teknis.

Langkah 2: Masukkan detail koneksi

Di mode standar, Anda harus mengonfigurasi detail koneksi secara terpisah untuk lingkungan pengembangan dan lingkungan produksi. Anda dapat memilih untuk menggunakan konfigurasi yang sama atau berbeda untuk kedua lingkungan tersebut.

  • Nama sumber data: Harus unik dalam ruang kerja. Kami menyarankan Anda menggunakan nama yang secara jelas mengidentifikasi bisnis dan lingkungan, seperti rds_mysql_order_dev.

  • Deskripsi sumber data: Jelaskan secara singkat tujuan sumber data tersebut.

  • Detail koneksi: Berdasarkan mode koneksi yang dijelaskan di atas, masukkan instans atau alamat URL, port, dan informasi lainnya untuk sumber data.

Langkah 3: Atur kredensial autentikasi

DataWorks mendukung beberapa metode autentikasi. Atur kredensial berdasarkan jenis sumber data dan halaman konfigurasi. Pastikan kredensial memiliki izin database yang diperlukan.

Metode autentikasi

Kasus penggunaan

Username dan password

Berlaku untuk sebagian besar jenis database (seperti ApsaraDB RDS dan StarRocks). DataWorks mengakses sumber data melalui otentikasi username dan password.

RAM account

Beberapa metode didukung seperti dijelaskan di bawah. Berlaku untuk layanan Alibaba Cloud yang mendukung autentikasi akun RAM, seperti MaxCompute dan Hologres. Anda dapat menetapkan akun berdasarkan izin yang diperlukan.

  • Alibaba Cloud Account: Akun Alibaba Cloud dari penyewa saat ini. Akun ini memiliki izin tertinggi. Gunakan dengan hati-hati.

  • Alibaba Cloud RAM Sub-account: Anda dapat menentukan RAM user lain di bawah akun Alibaba Cloud saat ini untuk mengakses sumber data.

  • Alibaba Cloud RAM role: Akses melalui asumsi peran, yang mendukung kontrol izin detail halus dengan tingkat keamanan lebih tinggi. Panduan konfigurasi: Konfigurasikan peran RAM untuk sumber data.

  • Task Owner: Akun RAM dari pemilik yang ditentukan pada tugas atau node.

  • Executor: Akun yang sedang login.

Otentikasi Kerberos

Mekanisme autentikasi pihak ketiga. Berlaku untuk komponen data besar seperti Hive, HDFS, dan HBase. Otentikasi Kerberos memerlukan pengunggahan file autentikasi seperti Keytab dan krb5.conf. Panduan konfigurasi: Konfigurasikan otentikasi Kerberos.

AccessKey

Pasangan AccessKey adalah kredensial akses permanen yang terdiri dari AccessKey ID dan AccessKey Secret. Berlaku untuk sumber data seperti OSS dan Tablestore. Pasangan AccessKey memiliki tingkat keamanan lebih rendah — gunakan autentikasi berbasis peran RAM bila tersedia.

Rahasia generik KMS

Simpan kredensial akses sumber data di Alibaba Cloud Key Management Service (KMS). Saat membuat sumber data, atur Access identity ke Key Management Service, pilih Kms Region tempat rahasia generik KMS berada, dan pilih rahasia generik target dari KMS List. Setelah rahasia diputar, DataWorks secara otomatis menggunakan kredensial terbaru, dan tidak perlu dikonfigurasi ulang di DataWorks. Anda harus terlebih dahulu membuat rahasia generik di KMS. Untuk informasi lebih lanjut, lihat Kelola dan gunakan rahasia generik. Konten rahasia generik KMS mendukung dua format JSON berikut:

{ "username": "biz_rw", "password": "S3cr3t!" }
{ "AccessKeyId": "LTAI...", "AccessKeySecret": "..." }

Jenis sumber data yang saat ini mendukung rahasia generik KMS: DB2, FTP, MongoDB, MySQL, Oracle, PolarDB, PolarDB-O, PostgreSQL, PolarDB-X 2.0, SQL Server.

Catatan

Setelah konten rahasia generik KMS diubah, DataWorks menyimpan cache rahasia tersebut hingga 5 menit. Rahasia baru akan berlaku paling lama dalam waktu 5 menit.

Jika database Anda telah mengaktifkan autentikasi SSL, aktifkan juga SSL saat membuat sumber data. Aktifkan autentikasi SSL untuk sumber data PostgreSQL.

Langkah 4: Uji konektivitas

Di bagian bawah halaman, klik Test Connectivity untuk setiap resource group yang terkait dengan ruang kerja.

  • Jika Connectable ditampilkan, konfigurasi sudah benar.

  • Jika Cannot Connect ditampilkan, sistem menyediakan alat diagnostik untuk membantu pemecahan masalah. Penyebab umum meliputi kredensial salah, masalah jaringan (daftar izin IP belum dikonfigurasi), atau gateway NAT yang tidak ada.

  • Di mode standar, pastikan bahwa baik lingkungan pengembangan maupun lingkungan produksi menampilkan Connectable. Jika tidak, kesalahan akan terjadi selama penggunaan selanjutnya.

Anda dapat mengonfigurasi jaringan berdasarkan mode konfigurasi sumber data, wilayah, kepemilikan instans, dan lokasi penerapan:

Skenario

Instruksi

Sumber data adalah layanan Alibaba Cloud dan dimiliki oleh akun Alibaba Cloud yang sama serta berada di wilayah yang sama dengan ruang kerja DataWorks.

Hubungkan sumber data (akun dan wilayah sama)

Sumber data adalah layanan Alibaba Cloud dan dimiliki oleh akun Alibaba Cloud yang sama dengan ruang kerja DataWorks, tetapi berada di wilayah yang berbeda.

Hubungkan sumber data di bawah akun Alibaba Cloud yang sama lintas wilayah berbeda

Sumber data adalah layanan Alibaba Cloud, tetapi dimiliki oleh akun Alibaba Cloud yang berbeda dari ruang kerja DataWorks.

Hubungkan ke sumber data lintas akun

Sumber data diterapkan di instans ECS Alibaba Cloud.

Hubungkan ke sumber data ECS yang dikelola sendiri

Sumber data diterapkan di pusat data lokal.

Hubungkan ke sumber data lokal

Sumber data memiliki titik akhir publik.

Hubungkan ke sumber data melalui internet

Kelola sumber data

Di halaman manajemen sumber data, filter sumber data berdasarkan Data Source Type dan Data Source Name. Anda juga dapat melakukan operasi berikut pada sumber data:image

Edit, kloning, dan kelola izin

  • Edit: Ubah konfigurasi sumber data sesuai kebutuhan. Nama sumber data dan lingkungan yang berlaku tidak dapat diubah.

    Sumber data yang dibuat secara otomatis saat Anda mengaitkan resource komputasi di Administration tidak dapat diedit langsung. Untuk mengubahnya, edit di halaman manajemen resource komputasi.
  • Cloning: Kloning sumber data untuk membuat yang baru dengan konfigurasi yang sama secara cepat.

  • Manage Permissions: Anda dapat mengklik ikon image untuk mengelola izin penggunaan lintas ruang kerja untuk sumber data. Manajemen izin sumber data memungkinkan Anda memberikan akses ke sumber data saat ini untuk ruang kerja lain atau pengguna tertentu di ruang kerja lain. Setelah Anda memberikan izin Allowed, pengguna dapat melihat dan menggunakan sumber data tetapi tidak dapat mengeditnya.

    Masalah izin sumber data lainnya: FAQ izin sumber data.

Hapus sumber data dan dampaknya

Di daftar sumber data, klik tombol hapus untuk menghapus sumber data. Namun, sumber data yang dibuat secara otomatis saat Anda mengaitkan resource komputasi di Administration tidak dapat dihapus langsung. Di Administration, klik Computing Resources di panel navigasi kiri Administration, temukan resource komputasi, dan klik Disassociate. Setelah diputuskan kaitannya, sumber data yang sesuai juga akan dihapus.

Dampak penghapusan sumber data pada modul Data Integration adalah sebagai berikut:

Pemeriksaan awal: Sebelum menghapus sumber data, verifikasi apakah sumber data tersebut terkait dengan tugas sinkronisasi apa pun di lingkungan produksi.

Solusi: Jika tugas terkait ada, gunakan pengeditan batch untuk mengubah sumber data tugas tersebut, lalu kirim ulang dan terapkan.

Skenario penghapusan

Dampak

Hapus kedua lingkungan pengembangan dan produksi

• Tugas produksi akan gagal total dan tidak dapat dijalankan.

• Sumber data tidak akan terlihat saat Anda mengonfigurasi tugas baru di lingkungan pengembangan.

Hapus hanya lingkungan pengembangan

• Tugas produksi dapat berjalan normal.

• Namun, saat Anda mengedit tugas, metadata (seperti struktur tabel) tidak dapat diambil.

• Sumber data tidak akan terlihat saat Anda mengonfigurasi tugas baru di lingkungan pengembangan.

Hapus hanya lingkungan produksi.

• Tugas produksi akan gagal total dan tidak dapat dijalankan.

• Tugas yang menggunakan sumber data ini di lingkungan pengembangan tidak dapat dikirim dan diterapkan ke lingkungan produksi.

Dampak pada modul lain adalah sebagai berikut:

Modul

Tingkat risiko

Dampak utama dan solusi

Operation Center

Tinggi

Dampak: Semua tugas komputasi periodik dan Data Integration yang bergantung pada sumber data ini akan gagal.

Solusi: Gunakan pengeditan batch untuk mengubah sumber data tugas tersebut, lalu terapkan ulang.

Data Service API

Tinggi

Dampak: Semua API yang dihasilkan dan orkestrasi API berdasarkan sumber data ini akan gagal dipanggil.

Solusi: Ganti sumber data untuk API yang terpengaruh.

Data Analysis

Sedang

Dampak: Di modul DataAnalysis, tugas kueri yang menargetkan sumber data ini akan gagal.

Solusi: Beralih ke sumber data lain yang tersedia saat menjalankan kueri SQL.

Data Quality

Sedang

Dampak: Tugas dengan aturan pemantauan kualitas data yang dikonfigurasi akan melaporkan pengecualian pemeriksaan.

Solusi: Buka Operation Center dan putuskan kaitan tugas dari aturan DQC, atau ubah aturan tersebut.

Jika sumber data telah diberikan untuk penggunaan lintas ruang kerja, menghapus sumber data tersebut juga akan menyebabkan tugas yang menggunakan sumber data ini di ruang kerja lain gagal.

Topik lanjutan

Deskripsi lingkungan sumber data

Mode ruang kerja: Dasar vs. standar

DataWorks menyediakan ruang kerja mode dasar dan mode standar. Mode dasar dan mode standar.

  • Mode dasar: Satu lingkungan. Semua operasi pengembangan langsung memengaruhi produksi. Cocok untuk verifikasi cepat atau pengujian pribadi.

  • Mode standar: Direkomendasikan untuk penggunaan perusahaan. Memiliki lingkungan pengembangan dan produksi bawaan. Anda dapat mengonfigurasi sumber data berbeda (seperti database pengujian dan produksi) atau izin akses berbeda untuk setiap lingkungan guna mencapai isolasi data.

Isolasi lingkungan sumber data

Ruang kerja dalam mode standar mendukung isolasi lingkungan sumber data. Sumber data dengan nama yang sama dapat memiliki dua konfigurasi — satu untuk pengembangan dan satu untuk produksi — yang terhubung ke database atau instans berbeda. Hal ini mengisolasi data yang diakses selama pengujian dan penjadwalan produksi, mencegah data produksi terkontaminasi oleh operasi debugging.

Catatan
  • Di modul Data Integration, hanya tugas sinkronisasi batch tabel tunggal di ruang kerja mode standar yang mendukung isolasi sumber data antara lingkungan pengembangan dan produksi. Jenis tugas sinkronisasi lainnya menggunakan sumber data lingkungan produksi.

  • Sumber data yang hanya dikonfigurasi untuk lingkungan produksi dan tidak memiliki informasi lingkungan pengembangan tidak dapat dipilih saat Anda mengonfigurasi node di Data Studio.

  • Jika Anda meningkatkan ruang kerja dari mode dasar ke mode standar, sumber data asli akan dibagi menjadi dua sumber data untuk lingkungan produksi dan pengembangan. Tingkatkan ruang kerja dari mode dasar ke mode standar.

Hubungan dengan sumber data Integrasi Data

Mode dasar:

Saat ruang kerja dalam mode dasar, hanya ada satu lingkungan. Sumber data yang dibuat di Integrasi Data dan yang dibuat di Administration identik.

Mode standar:

  • Saat Anda membuat sumber data di Administration, sumber data dengan nama yang sama secara otomatis dibuat di Integrasi Data. Keduanya berbagi konfigurasi lingkungan produksi sumber data tersebut.

  • Saat Anda membuat sumber data di Integrasi Data, sumber data dengan nama yang sama juga secara otomatis dibuat di Administration. Namun, sumber data ini hanya memiliki informasi lingkungan produksi, dan lingkungan pengembangan akan menunjukkan informasi yang hilang. Anda harus melengkapi informasi lingkungan pengembangan sebelum sumber data dapat digunakan di Data Studio.

  • Untuk memastikan integritas informasi sumber data, kami menyarankan agar Anda selalu membuat dan mengelola semua sumber data di Administration.

FAQ

  • T: Tugas yang dikonfigurasi dengan sumber data di ruang kerja mode standar berhasil di lingkungan pengembangan tetapi gagal selama penjadwalan produksi. Mengapa?

    J:

    1. Periksa apakah uji konektivitas berhasil untuk kedua lingkungan pengembangan dan produksi sumber data tersebut.

    2. Periksa apakah data di database lingkungan pengembangan dan produksi konsisten dan memenuhi persyaratan bisnis.

    3. Apa fungsi sumber data lingkungan pengembangan dan produksi?

      Anda dapat mengonfigurasi sumber data terpisah untuk lingkungan pengembangan dan produksi. Sumber data lingkungan pengembangan hanya digunakan untuk pengembangan dan debugging node, sedangkan sumber data lingkungan produksi menangani penjadwalan periodik untuk node yang diterapkan. Pemisahan ketat ini mencegah operasi pengujian memengaruhi data produksi.

  • T: Mengapa uji konektivitas sumber data gagal?

    J: Hal ini biasanya disebabkan oleh alasan berikut. Periksa satu per satu. Untuk konfigurasi konektivitas jaringan, lihat Konfigurasikan konektivitas jaringan.

    • Kredensial salah: Periksa apakah username dan password yang Anda masukkan benar.

    • Target akses salah: Periksa apakah nama database, bucket, atau target koneksi lain yang Anda masukkan benar, dan apakah akun serta password memiliki izin akses yang diperlukan.

    • Alamat atau port salah: Periksa apakah alamat koneksi sumber data dan nomor port benar. Jika nama domain host ditentukan sebagai alamat, pastikan nama domain tersebut dapat di-resolve dengan benar. Lihat Resolusi DNS PrivateZone.

    • Masalah jaringan: Periksa apakah sumber data dan resource group terhubung. Jika sumber data memiliki kontrol daftar izin, periksa apakah Blok CIDR vSwitch yang terkait dengan resource group telah ditambahkan ke daftar izin. Jika Anda menggunakan resource group serverless untuk menghubungkan ke sumber data jaringan publik, periksa apakah gateway NAT telah dikonfigurasi.

  • T: Apa perbedaan antara resource komputasi dan sumber data?

    J:

    • Resource komputasi adalah instans resource di DataWorks yang dapat menjalankan tugas pemrosesan dan analisis data serta memiliki kemampuan komputasi. Biasanya merujuk pada mesin komputasi dasar, seperti MaxCompute, Hologres, atau AnalyticDB, dan terutama digunakan untuk tugas pengembangan dan penjadwalan data.

    • Sumber data di DataWorks digunakan untuk menghubungkan ke berbagai layanan penyimpanan data dan menyediakan kemampuan penyimpanan dan manajemen data. Sumber data menyediakan antarmuka untuk membaca dan menulis data, dan terutama digunakan untuk tugas sinkronisasi dan integrasi. Selain itu, sumber data juga mendukung fitur seperti node database, API Layanan Data, dan analisis kueri.

  • T: Apa perbedaan antara sumber data DLF dan sumber data Paimon Catalog?

    J: Sumber data DLF adalah jenis sumber data standar yang dapat digunakan untuk Integrasi Data dan Analisis Data. Sumber data ini juga mendukung manajemen metadata untuk tipe tabel Paimon, Iceberg, dan lainnya yang menggunakan metadata terdaftar DLF. Sumber data Paimon Catalog hanya digunakan untuk pengumpulan metadata format lake Paimon dari sumber non-DLF, mendukung fitur tata kelola seperti pengambilan metadata, peninjauan, dan pemantauan kualitas. Saat ini tidak mendukung sinkronisasi data.