All Products
Search
Document Center

DataWorks:Pengumpulan metadata

Last Updated:Aug 28, 2026

DataWorks Data Map menyediakan fitur Metadata Collection yang memungkinkan Anda mengkonsolidasikan dan mengelola metadata dari berbagai sumber data DataWorks secara terpusat. Di Data Map, Anda dapat melihat metadata yang telah diagregasi dari semua sumber Anda. Topik ini menjelaskan cara membuat crawler untuk mengumpulkan dan mengkonsolidasikan metadata dari berbagai sumber data ke dalam DataWorks.

Ikhtisar

Pengumpulan metadata merupakan fitur inti untuk membangun Data Map tingkat enterprise dan mencapai manajemen aset data terpadu. Crawler secara otomatis mengekstraksi metadata teknis (seperti database, tabel, dan kolom), alur data, serta informasi partisi dari sumber data DataWorks (seperti MaxCompute, Hologres, MySQL, dan CDH Hive) yang tersebar di berbagai ruang kerja dalam wilayah yang sama, lalu mengkonsolidasikan informasi tersebut ke dalam DataWorks Data Map guna menciptakan tampilan data terpadu.

Pengumpulan metadata memungkinkan Anda:

  • Membangun tampilan data terpadu: Menghilangkan silodata dengan mengelola metadata dari berbagai sumber heterogen secara terpusat.

  • Memungkinkan penemuan dan pencarian data: Memungkinkan konsumen data menemukan data yang mereka butuhkan secara cepat dan akurat.

  • Menjalankan analisis alur data end-to-end: Melacak asal-usul dan aliran data secara jelas untuk memfasilitasi analisis dampak dan troubleshooting.

  • Memberdayakan tata kelola data: Menerapkan Klasifikasi Data, kontrol akses, pemantauan kualitas, dan manajemen siklus hidup berdasarkan metadata yang komprehensif.

Penagihan

Secara default, setiap tugas pengumpulan mengonsumsi 0,25 CU dikalikan dengan durasi eksekusi tugas, sehingga dikenakan biaya unit komputasi. Setiap pengumpulan yang berhasil menghasilkan sebuah instans penjadwalan, sehingga dikenakan biaya penjadwalan.

Batasan

  • Jika sumber data menggunakan daftar izin (allowlist) untuk kontrol akses, Anda harus mengonfigurasinya terlebih dahulu. Untuk informasi selengkapnya, lihat Daftar izin pengumpulan metadata.

  • Penerapan DataWorks dan sumber data harus berada dalam wilayah yang sama. Jika Anda harus mengumpulkan metadata lintas wilayah, gunakan titik akhir publik saat membuat sumber data. Untuk informasi selengkapnya, lihat Buat sumber data.

  • Pengumpulan metadata tidak didukung untuk sumber data AnalyticDB for MySQL yang telah mengaktifkan SSL.

  • Versi baru pengumpulan metadata hanya mendukung kelompok sumber daya Serverless yang baru. Kelompok sumber daya lama tidak didukung. Pastikan Anda telah membuat dan mengikat kelompok sumber daya Serverless baru sebelum menggunakan fitur pengumpulan metadata.

Titik masuk

  1. Masuk ke Konsol DataWorks. Di wilayah target, klik Data Governance > Data Map di panel navigasi sebelah kiri. Pada halaman yang muncul, klik Go to Data Map.

  2. Di panel navigasi sebelah kiri, klik image untuk membuka halaman pengumpulan metadata.

Crawler bawaan

Crawler bawaan telah dikonfigurasi sebelumnya dan dieksekusi secara otomatis (near real-time) oleh platform DataWorks. Crawler ini digunakan untuk mengumpulkan metadata inti yang terintegrasi erat dengan DataWorks. Anda tidak perlu membuatnya sendiri—cukup mengelola cakupan pengumpulan.

Penting

Jika Anda tidak menemukan tabel target di Data Map, buka My Data > My Tools > Refresh Table Metadata dan sinkronkan tabel terkait secara manual.

MaxCompute default crawler

Crawler ini mengumpulkan metadata dari proyek MaxCompute di bawah akun Anda. Anda dapat membuka halaman detail, klik Modify Data Scope untuk memilih proyek yang akan dikumpulkan, dan klik Permission Configurations untuk mengonfigurasi visibilitas metadata dalam penyewa.

  1. Di bagian Built-in pada halaman pengumpulan metadata, temukan kartu MaxCompute Default Crawler dan klik Details.

  2. Halaman detail MaxCompute Default Crawler terdiri dari dua tab: Basic Information dan Data Scope.

    • Basic Information: Menampilkan properti dasar crawler, seperti jenis dan metode pengumpulan. Informasi ini hanya bisa dibaca.

    • Data Scope: Mengelola proyek MaxCompute mana saja yang dikumpulkan metadata-nya oleh crawler ini.

  3. Ubah cakupan pengumpulan:

    1. Beralih ke tab Data Scope dan klik tombol Modify Data Scope.

    2. Pada dialog yang muncul, pilih atau hapus centang proyek MaxCompute yang ingin Anda kumpulkan metadata-nya.

      Penting

      Secara default, cakupan mencakup semua proyek MaxCompute yang terkait dengan ruang kerja di wilayah saat ini di bawah penyewa Anda. Setelah Anda mengubah cakupan data, objek metadata yang dikumpulkan di Data Map akan sesuai dengan cakupan data saat ini. Metadata dari proyek yang dihapus tidak akan terlihat.

    3. Klik OK untuk menyimpan perubahan.

  4. Konfigurasi visibilitas metadata:

    • Pada daftar Data Scope, temukan proyek target dan klik Permission Configurations di kolom Actions.

    • Pilih kebijakan visibilitas sesuai kebutuhan tata kelola data Anda:

      • Public Within Tenant: Semua anggota dalam penyewa dapat mencari dan melihat metadata proyek ini.

      • Only members in the associated workspace can search and view.: Hanya anggota ruang kerja tertentu yang dapat mengakses metadata proyek ini, sehingga memastikan isolasi data.

DLF default crawler

Penting

Untuk mengaktifkan pengumpulan metadata DLF secara real-time, Anda harus memberikan izin Data Reader kepada peran terkait layanan AliyunServiceRoleForDataworksOnEmr di konsol DLF.

DLF Default Crawler mengumpulkan metadata dari Data Lake Formation (DLF) di bawah akun Anda.

  1. Di bagian Built-in pada halaman pengumpulan metadata, temukan kartu DLF Default Crawler dan klik Details untuk melihat informasi dasar.

  2. Beralih ke tab Data Scope untuk melihat daftar Katalog DLF yang termasuk dalam cakupan pengumpulan beserta jumlah tabel yang dikandungnya.

    Secara default, semua katalog yang dapat diakses (termasuk DLF dan DLF-Legacy) dikumpulkan.

Crawler kustom

Crawler kustom memungkinkan Anda mengelola metadata secara terpusat lintas lingkungan dan mesin.

  • Untuk sumber data reguler

    Anda dapat membuat crawler kustom untuk sumber data terstruktur atau semi-terstruktur tradisional seperti Hologres, StarRocks, MySQL, Oracle, dan CDH Hive. Dengan mengonfigurasi tugas pengumpulan, sistem melakukan penguraian mendalam terhadap struktur fisik database dan tabel di sumber untuk mencapai ekstraksi dan sinkronisasi metadata otomatis seperti atribut kolom, indeks, dan partisi.

  • Untuk sumber data bertipe metadata (katalog)

    Untuk metadata format lake native yang dideklarasikan sendiri dan tidak dikelola DLF, seperti Paimon Catalog, Apache Gravitino, dan sumber data bertipe metadata lainnya, Anda juga dapat membuat crawler untuk pengumpulan langsung.

Create Custom Crawler

  1. Di bagian daftar crawler kustom pada halaman pengumpulan metadata, klik Create Metadata Crawler.

  2. Pilih jenis pengumpulan: Pada halaman pemilihan jenis, pilih jenis sumber data target yang akan dikumpulkan, misalnya Hologres, StarRocks.

  3. Konfigurasi pengaturan dasar dan kelompok sumber daya:

    • Basic Configurations:

      • Select a workspace: Pilih ruang kerja yang berisi sumber data.

      • Select Data Source: Pilih sumber data target yang telah dibuat sebelumnya dari daftar drop-down. Setelah dipilih, sistem akan menampilkan detail sumber data secara otomatis.

      • Name: Beri nama crawler agar mudah diidentifikasi nanti. Secara default, nama crawler sama dengan nama sumber data.

    • Resource Group Configuration:

      • Resource Group: Pilih kelompok sumber daya Serverless untuk menjalankan tugas pengumpulan.

      • Test Network Connectivity: Langkah ini sangat penting. Klik Test Network Connectivity untuk memastikan kelompok sumber daya dapat mengakses sumber data.

        Penting
  4. Konfigurasi pengumpulan metadata:

    • Collection Scope: Tentukan database (database/schema) yang akan dikumpulkan. Jika sumber data berada pada granularitas database, database yang sesuai dengan sumber data dipilih secara default. Anda dapat memilih database tambahan di luar sumber data.

      Penting
      • Setiap database hanya dapat dikonfigurasi dalam satu crawler. Jika database tampak abu-abu, artinya sudah sedang dikumpulkan oleh crawler lain.

      • Setelah Anda mempersempit cakupan pengumpulan, metadata di luar cakupan tersebut tidak lagi dapat dicari di Data Map.

  5. Konfigurasi peningkatan cerdas dan rencana pengumpulan:

    • Intelligent enhancement (Beta):

      • AI-generated descriptions: Saat diaktifkan, sistem menggunakan kemampuan model bahasa besar untuk secara otomatis menghasilkan deskripsi bisnis untuk tabel dan kolom Anda setelah metadata dikumpulkan, sehingga sangat meningkatkan keterbacaan dan kegunaan metadata. Setelah pengumpulan selesai, Anda dapat melihat informasi hasil AI (seperti deskripsi tabel dan kolom) pada halaman detail objek tabel di Data Map.

    • Collection Plan:

      • Trigger Mode: Pilih manual atau periodik.

        • Manual: Crawler hanya berjalan saat Anda memicunya secara manual. Cocok untuk pengumpulan satu kali atau berdasarkan permintaan.

        • Periodik: Konfigurasikan tugas terjadwal (misalnya bulanan, harian, mingguan, atau per jam), dan sistem akan secara otomatis memperbarui metadata secara berkala.

          Untuk mengonfigurasi tugas terjadwal tingkat menit, pilih siklus pengumpulan per jam dan pilih semua granularitas tingkat menit untuk menerapkan tugas terjadwal yang berjalan setiap 5 menit.
          Penting

          Hanya sumber data di lingkungan produksi yang mendukung pengumpulan periodik.

  6. Simpan konfigurasi: Klik Save atau Save and Run untuk menyelesaikan pembuatan crawler.

Manage custom crawlers

Setelah crawler dibuat, crawler tersebut akan muncul di daftar crawler kustom. Anda dapat melakukan operasi manajemen berikut:

  • Operasi daftar: Di daftar, Anda dapat langsung Run, Stop, atau Delete crawler. Gunakan fitur Filter dan Search di bagian atas untuk menemukan crawler target dengan cepat.

    Penting

    Setelah Anda menghapus crawler metadata, objek metadata yang dikumpulkan oleh crawler ini di Data Map menjadi tidak valid. Anda tidak dapat lagi mencari atau melihat objek dan detailnya dari crawler ini. Lakukan dengan hati-hati.

  • Operasi batch: Pilih beberapa crawler di daftar crawler dan gunakan Batch Run atau Batch Stop di bagian bawah daftar untuk memicu atau menghentikan beberapa tugas pengumpulan sekaligus, sehingga meningkatkan efisiensi manajemen.

  • Status crawler: Daftar crawler menampilkan status terkini setiap crawler. Status umum meliputi Not Run, Waiting, Running, Successful, Failed, dan Manually Terminated.

    Catatan

    Jika sumber data yang terkait dengan crawler telah diputus atau menjadi tidak valid, crawler tersebut masuk ke status frozen. Crawler yang dibekukan tidak dapat dijalankan dan hanya dapat dihapus.

  • Lihat detail dan log: Klik nama crawler target untuk membuka halaman detailnya.

    • Basic Information: Lihat semua item konfigurasi crawler.

    • Data Scope: Lihat atau Modify Data Scope.

      Jika belum ada pengumpulan yang dilakukan, jumlah tabel dan waktu pembaruan terakhir akan kosong.
      Sumber data berikut tidak mendukung modifikasi cakupan: EMR Hive, CDH Hive, Lindorm, ElasticSearch, OTS, MongoDB, dan AnalyticDB for Spark dalam AnalyticDB MySQL.
    • Run Logs: Lacak riwayat eksekusi setiap tugas pengumpulan. Anda dapat melihat waktu mulai, durasi, status, dan volume data yang dikumpulkan untuk setiap tugas. Saat tugas gagal, klik View Logs sebagai titik masuk utama untuk menemukan dan menyelesaikan masalah.

  • Picu pengumpulan secara manual: Di pojok kanan atas halaman detail, klik tombol Collect Metadata untuk segera memicu tugas pengumpulan. Ini berguna ketika Anda ingin segera melihat tabel yang baru dibuat di Data Map.

Langkah selanjutnya

Setelah metadata berhasil dikumpulkan, Anda dapat memanfaatkan berbagai kemampuan Data Map secara optimal:

  • Cari tabel yang telah dikumpulkan di Data Map dan lihat detailnya, informasi kolom, partisi, serta pratinjau data. Untuk informasi selengkapnya, lihat View table details.

  • Analisis alur hulu dan hilir suatu tabel untuk memahami alur pemrosesan data end-to-end. Untuk informasi selengkapnya, lihat Data lineage.

  • Tambahkan aset ke Pengumpulan Data untuk mengorganisasi dan mengelola data Anda dari perspektif bisnis. Untuk informasi selengkapnya, lihat Create a Data Collection.

FAQ

Lampiran: Cakupan pengumpulan dan ketepatan waktu

Data source

Data Source Type

Collection Mode

Collection granularity

Metadata update timeliness

Table/Column

Partition

Lineage

MaxCompute

Automatically collected by the system by default

Instance

Proyek reguler: Real-time

Proyek eksternal: T+1

Wilayah Tiongkok daratan: Real-time

Wilayah internasional: T+1

Real-time

Data Lake Formation (DLF)

Instance

Real-time

Penting

Untuk mengaktifkan pengumpulan real-time, Anda harus memberikan izin Data Reader kepada peran terkait layanan AliyunServiceRoleForDataworksOnEmr di konsol DLF. Untuk informasi selengkapnya, lihat bagian DLF default crawler di atas.

Real-time

Alur data didukung untuk metadata DLF dari mesin Serverless Spark, Serverless StarRocks, Serverless Flink, dan EMR Impala. Mesin lain tidak didukung.

Penting

Untuk kluster EMR, Anda harus mengaktifkan EMR_HOOK.

Untuk menampilkan alur data tugas EMR Impala, Anda harus mengaktifkan pencatatan alur data di konfigurasi Impala kluster EMR. Fitur ini hanya didukung untuk kluster EMR DataLake dan saat ini berada dalam tahap rilis terbatas. Hubungi dukungan teknis Alibaba Cloud untuk mengaktifkan fitur ini sebelum digunakan. Untuk detail konfigurasi, lihat Data lineage.

Hologres

Create a crawler manually

Database

Tergantung pada siklus pengumpulan

Not supported

Real-time

EMR Hive

Instance

Tergantung pada siklus pengumpulan

Tergantung pada siklus pengumpulan

Real-time

Penting

Anda harus mengaktifkan EMR_HOOK untuk kluster tersebut.

Untuk menampilkan alur data tugas EMR Impala, Anda harus mengaktifkan pencatatan alur data di konfigurasi Impala kluster EMR. Fitur ini hanya didukung untuk kluster EMR DataLake dan saat ini berada dalam tahap rilis terbatas. Hubungi dukungan teknis Alibaba Cloud untuk mengaktifkan fitur ini sebelum digunakan. Untuk detail konfigurasi, lihat Data lineage.

CDH Hive

Instance

Tergantung pada siklus pengumpulan

Real-time

Real-time

StarRocks

Database

  • Instance mode: Real-time.

  • Connection string mode: Tergantung pada siklus pengumpulan.

Not supported

Real-time

Penting

Hanya instance mode yang mendukung pengumpulan alur data. Connection string mode tidak mendukung pengumpulan alur data.

AnalyticDB for MySQL

Database

Tergantung pada siklus pengumpulan

Not supported

Real-time

Catatan

Anda harus atau mengajukan Tiket untuk mengaktifkan fitur alur data pada Instans AnalyticDB for MySQL.

AnalyticDB for Spark

Instance

Real-time

Not supported

Real-time

AnalyticDB for PostgreSQL

Database

Tergantung pada siklus pengumpulan

Not supported

Real-time

Lindorm

Instance

Tergantung pada siklus pengumpulan

Not supported

Real-time

OTS

Instance

Tergantung pada siklus pengumpulan

Not supported

Not supported

MongoDB

Instance

Tergantung pada siklus pengumpulan

Not supported

Not supported

ElasticSearch

Instance

Tergantung pada siklus pengumpulan

Not supported

Pembaruan T+1

Paimon Catalog

Catalog

Tergantung pada siklus pengumpulan

Tergantung pada siklus pengumpulan

Not supported

Apache Gravitino

Catalog

Tergantung pada siklus pengumpulan

Tergantung pada siklus pengumpulan

Not supported

Jenis sumber data lainnya (MySQL, PostgreSQL, SQL Server, Oracle, ClickHouse, SelectDB, OceanBase, dll.)

Database

Tergantung pada siklus pengumpulan

Not supported

Not supported

Catatan
  • "Tergantung pada siklus pengumpulan" dalam tabel berarti metadata diperbarui secara berkala berdasarkan rencana pengumpulan yang Anda konfigurasi untuk crawler (misalnya bulanan, harian, mingguan, atau per jam).

  • AnalyticDB for Spark dan AnalyticDB for MySQL menggunakan titik masuk pengumpulan metadata yang sama.

Task code

Data Map mendukung pencarian dan navigasi cepat kode tugas. Berikut ini menjelaskan cakupan kode yang dapat dicari.

Code source

Collection scope

Collection trigger method

Data Studio

Data Studio - Create a node and edit code

Automatic collection

Legacy Data Studio

Legacy Data Studio - Create a node and edit code

Data Analysis

Data Analysis - Create an SQL query and edit code

Data Service

Data Service - Create an API Data Push service

API assets

Data Map mendukung penampilan metadata API Data Service, sebagaimana dijelaskan di bawah ini:

API Type

Collection scope

Collection trigger method

API generation (wizard mode)

Data Service - Create an API in wizard mode

Automatic collection

API generation (script mode)

Data Service - Create an API in script mode

Register API

Data Service - Register an API

API orchestration

Data Service - Create an API orchestration

AI assets

Data Map mendukung penampilan dan pengelolaan aset AI, serta menyediakan alur data aset AI untuk melacak asal-usul, penggunaan, dan evolusi data serta model. Berikut ini menjelaskan dukungan untuk setiap jenis aset AI.

Asset type

Collection scope

Collection trigger method

Dataset

  • PAI - Create a dataset/Register a dataset

  • DataWorks - Create a dataset

Automatic collection

AI model

PAI - Model training task/Register a model/Deploy a model service

Algorithm task

PAI - Training task/Workflow task/Distributed training task

Model service

PAI - Deploy a model service (EAS deployment)

Workspace

Data Map mendukung penampilan metadata ruang kerja, sebagaimana dijelaskan di bawah ini:

Project

Collection Mode

Collection trigger method

Workspace

DataWorks - Create a workspace

Automatic collection