Layanan alur data aset AI merupakan layanan teknis penting yang digunakan untuk mengoptimalkan manajemen aset AI perusahaan. Layanan ini mampu melacak dan memahami secara komprehensif asal-usul serta evolusi data dan model guna meningkatkan transparansi aset dan efisiensi manajemen secara signifikan, sekaligus memberikan dukungan kuat serta keunggulan kompetitif bagi perusahaan di industri AI.
Pendahuluan
Layanan alur data aset AI dirancang untuk membantu perusahaan mengelola dan mengoptimalkan aset AI secara efisien dengan melacak serta memahami asal-usul, penggunaan, dan evolusi data serta model. Layanan ini mencakup berbagai jenis aset AI, termasuk set data (versi), pipeline pemrosesan data, pekerjaan pelatihan, model (versi), layanan model, dan metadata terkait lainnya. Halaman detail setiap aset menyediakan titik masuk untuk melihat informasi alur data guna memudahkan akses dan analisis.

Layanan alur data aset AI cocok untuk skenario aplikasi berikut:
Manajemen aset AI: Layanan ini menyediakan informasi alur data aset yang detail sehingga perusahaan dapat memperoleh wawasan mengenai asal-usul dan penggunaan aset AI mereka. Hal ini meningkatkan kualitas data dan model serta memastikan praktik AI perusahaan mematuhi standar regulasi, mendukung manajemen data dan pengambilan keputusan yang akurat.
Pelacakan model: Dalam konteks praktik AI yang bertanggung jawab, menjaga transparansi model AI sangat penting. Layanan ini memungkinkan perusahaan melacak set data, metode rekayasa fitur, dan penyesuaian parameter yang digunakan dalam pelatihan model guna memenuhi kepatuhan regulasi, memverifikasi hasil eksperimen, serta melakukan audit model.
Pemecahan masalah dan optimasi: Informasi alur data aset dapat digunakan untuk menemukan akar penyebab masalah kinerja pada layanan AI secara cepat. Misalnya, penurunan tiba-tiba pada akurasi prediksi model dapat dilacak hingga perubahan pada pemrosesan data hulu. Graf alur data membantu perusahaan mengidentifikasi dan menyelesaikan masalah tersebut dengan cepat.
Peningkatan penggunaan sumber daya: Memahami dependensi tugas memungkinkan perusahaan mengalokasikan sumber daya komputasi secara rasional, mencegah perhitungan berulang, dan mengurangi biaya. Informasi alur data juga membantu perusahaan mengidentifikasi dependensi antara tugas dan data serta menentukan tugas mana yang dapat dieksekusi secara paralel dalam eksperimen berskala besar, sehingga meningkatkan efisiensi penggunaan dan pemrosesan sumber daya.
Peningkatan efisiensi kolaborasi: Beberapa tim dapat berbagi infrastruktur yang sama untuk penelitian dalam organisasi besar. Informasi alur data yang jelas memfasilitasi komunikasi lintas tim dan berbagi pengetahuan, serta mempercepat proses inovasi.
Prasyarat
Untuk menggunakan layanan alur data aset AI, aktifkan DataWorks di Konsol DataWorks.
DataWorks Edisi Standar: Jika Anda memerlukan layanan alur data aset AI umum, aktifkan DataWorks Edisi Standar.
DataWorks Edisi Profesional: Jika Anda memerlukan kemampuan pelaporan alur data untuk pekerjaan pelatihan Deep Learning Containers (DLC) dan pipeline, aktifkan DataWorks Edisi Profesional.
Untuk informasi lebih lanjut mengenai edisi DataWorks, lihat DataWorks: Fitur berdasarkan edisi.
Lineage metode pelaporan dan titik masuk
Pelaporan alur data mengacu pada pencatatan dan pembuatan otomatis atau manual berbagai metadata terkait model AI serta hubungan antara metadata dan model selama pengembangan, pelatihan, penerapan, dan pemeliharaan di Platform for AI (PAI). Pelaporan alur data mencakup operasi berikut.
Buat set data
Set data mendukung manajemen versi. Setiap versi merupakan aset alur data independen. Anda dapat melihat informasi alur data versi set data tertentu serta hubungan hulu dan hilir versi tersebut.
Struktur informasi lineage
Titik masuk: Buat dan kelola set data
Titik masuk untuk melihat informasi alur data: Di daftar set data, temukan set data yang diinginkan dan klik nama set data tersebut. Di bagian Version Details pada halaman detail set data, klik View Lineage untuk melihat informasi alur data.
Praproses data
Titik masuk: Jika Anda menjalankan tugas analisis data di lingkungan produksi berdasarkan engine MaxCompute di DataWorks dan input/output-nya berupa tabel MaxCompute atau path OSS, Anda juga dapat melihat dan menganalisis informasi alur data. Misalnya, Anda memperoleh tabel MaxCompute setelah menjalankan beberapa tugas SQL dan mendaftarkan tabel tersebut sebagai set data PAI. Anda dapat melacak tugas yang menghasilkan tabel tersebut berdasarkan informasi alur data.
Titik masuk untuk melihat informasi alur data: Di daftar set data, temukan set data yang diinginkan dan klik nama set data tersebut. Di bagian Version Details pada halaman detail set data, klik View Lineage untuk melihat informasi alur data.
Buat pekerjaan pelabelan
Saat membuat pekerjaan pelabelan data di iTAG, Anda harus menentukan set data input. Setelah pekerjaan pelabelan dibuat, sistem secara otomatis menampilkan informasi alur data dalam struktur berikut.
Struktur Informasi Silsilah
Titik masuk
Buat pekerjaan pelabelan
Di panel navigasi sebelah kiri Konsol PAI, klik Data Preparation > Intelligent Labeling (iTAG) untuk membuka halaman pelabelan cerdas. Di area Quick Start, klik kartu Create Task untuk membuat tugas pelabelan.
Ekspor data hasil pelabelan
Di halaman pelabelan cerdas iTAG, klik Go to Management Page di pojok kanan atas.
Di daftar tugas, klik Get Labeling Results di kolom Actions. Di kotak dialog, konfigurasikan opsi berikut:
Data Format: Pilih
csvExport to Dataset: Pilih Yes
OSS Output Path: Tentukan path output
Klik OK.
Titik masuk untuk melihat informasi alur data: Di daftar set data berlabel, temukan set data berlabel yang diinginkan dan klik nama set data sumbernya. Di bagian Version Details pada halaman detail set data, klik View Lineage untuk melihat informasi alur data.
Buat pekerjaan pipeline
Anda dapat menganggap pekerjaan pipeline sebagai aset independen. Saat mengirimkan pekerjaan pipeline di Machine Learning Designer, jika pipeline tersebut berisi komponen Read Table, Read File Data, Model Register, atau Dataset Register, sistem secara otomatis melaporkan informasi alur data dalam struktur berikut setelah pekerjaan pipeline dieksekusi.
Struktur informasi lineage
Titik masuk: Buat pipeline
Di halaman detail pipeline, tambahkan komponen terkait sesuai kebutuhan bisnis Anda. Dalam contoh ini, komponen Read File Data dan Dataset Register ditambahkan.
Titik masuk untuk melihat informasi alur data: Di daftar pekerjaan pipeline, temukan pekerjaan pipeline yang diinginkan dan klik nama pekerjaan tersebut. Di bagian Basic Information pada halaman detail pipeline, klik View Lineage untuk melihat informasi alur data.
Halaman analisis alur data menampilkan diagram aliran data: dari kiri ke kanan, node file OSS
dataset_input/, node PAI Flow, dan node set datad_prod_20241119l424/v2, yang menunjukkan bahwa data mengalir dari OSS melalui PAI Flow ke set data PAI. Header halaman menyediakan tiga opsi toggle: Hide Sibling Nodes on Expand, Enable Thumbnail, dan Enable Cycle Detection.
Buat pekerjaan pelatihan model
Model Gallery
Setelah pekerjaan pelatihan model yang Anda kirim dieksekusi di Model Gallery, sistem secara otomatis menampilkan informasi alur data dalam struktur berikut.
Struktur informasi silsilah
Titik masuk: Latih model
Di panel navigasi sebelah kiri, pilih Quick Start > Model Gallery. Temukan model yang mendukung pelatihan dan klik tombol Train pada kartu model tersebut.
Titik masuk untuk melihat informasi alur data: Di daftar model, temukan model yang diinginkan dan klik nama model tersebut. Di daftar versi model pada halaman detail model, pilih versi model yang diinginkan dan klik nomor versinya. Di panel Model Version, klik View Lineage untuk melihat informasi alur data.
DLC
Saat mengirimkan pekerjaan pelatihan model, Anda dapat melaporkan informasi alur data secara manual serta mengonfigurasi input dan output sesuai kebutuhan bisnis Anda. Solusi ini cocok untuk pengguna yang memiliki keterampilan teknis tingkat lanjut dan bisnis yang mapan. Jika tidak, akurasi informasi alur data dapat terpengaruh. Jika Anda memiliki pertanyaan, hubungi manajer bisnis Anda untuk menambahkan Anda ke daftar putih guna mengakses fitur ini.
Daftarkan model
Model mendukung manajemen versi. Setiap versi berfungsi sebagai aset alur data independen. Anda dapat melihat informasi alur data versi model tertentu serta hubungan hulu dan hilir model tersebut.
Struktur informasi silsilah
Titik masuk: Daftarkan model
Di panel navigasi sebelah kiri Konsol PAI, pilih AI Asset Management > Models untuk membuka halaman manajemen model, lalu klik Register New Model.
CatatanAnda dapat mendaftarkan model secara manual. Setelah pekerjaan pelatihan yang Anda kirim di Model Gallery dieksekusi, model yang dihasilkan juga akan didaftarkan secara otomatis sebagai model di ruang kerja saat ini. Untuk informasi lebih lanjut, lihat Model Gallery.
Titik masuk untuk melihat informasi alur data: Di daftar model, temukan model yang diinginkan dan klik nama model tersebut. Di daftar versi model pada halaman detail model, pilih versi model yang diinginkan dan klik nomor versinya. Di panel Model Version, klik View Lineage untuk melihat informasi alur data.
Terapkan layanan model
Model mendukung manajemen versi. Setiap versi berfungsi sebagai aset alur data independen. Anda dapat melihat informasi alur data versi model tertentu serta hubungan hulu dan hilir model tersebut.
Struktur informasi alur data
Titik masuk: Daftarkan model
Pilih AI Asset Management > Models. Di halaman Model, temukan model yang diinginkan dan klik Deploy in EAS di kolom Actions.
Di tab Events pada halaman Workspace Details, klik Create Event Rule. Di panel Create Event Rule, atur parameter Event Type ke Models dan pilih Version Approved dari daftar drop-down.
Klik Create Event Rule. Di panel sebelah kanan, atur Event Type ke Model dan pilih event Model Version Approved. Konfigurasikan Rule Name, Rule Description, Event Scope, dan Event Target (misalnya mengaktifkan DingTalk Notification dan memasukkan URL Webhook) sesuai kebutuhan.
Ketika nilai parameter Version Approval Status untuk versi model tertentu berubah dari Pending menjadi Approved, layanan model akan diperbarui secara otomatis.
Di panel navigasi sebelah kiri, pilih AI Asset Management > Models. Buka daftar versi model untuk melihat status persetujuan setiap versi (misalnya, versi 0.6.0 menampilkan Approved).
Titik masuk untuk melihat informasi alur data: Di daftar layanan model, temukan layanan model yang diinginkan dan klik nama layanan tersebut. Di tab Overview pada halaman detail layanan model, klik View Lineage di bagian Basic Information untuk melihat informasi alur data.
CatatanJika layanan di Elastic Algorithm Service (EAS) memiliki beberapa versi, layanan tersebut berkorespondensi dengan instans EAS yang sama dalam informasi alur data. Untuk menganalisis versi layanan tertentu, perbarui nilai VersionId layanan tersebut guna menemukan versi yang dimaksud.