All Products
Search
Document Center

Platform For AI:Buat dan kelola dataset

Last Updated:Jun 04, 2026

PAI AI Asset Management memungkinkan Anda membuat dan mengelola dataset beserta versinya. Gunakan pengendalian versi dataset untuk mereproduksi eksperimen, melacak alur data, serta kembali ke versi sebelumnya bila diperlukan.

Ikhtisar dataset

PAI mendukung dua jenis dataset: dataset dasar dan dataset berlabel. Dataset dasar berisi data mentah yang tidak berlabel untuk pre-training model, sedangkan dataset berlabel berisi data yang telah dianotasi secara manual untuk fine-tuning dan evaluasi.

Item

Dataset dasar

Dataset berlabel

Definisi

Data mentah yang tidak berlabel.

Data dengan label yang ditambahkan secara manual.

Pemrosesan data

Pembersihan data, deduplikasi, dan lainnya.

Pelabelan data, validasi, dan lainnya.

Kasus penggunaan

  • Unsupervised learning

  • Pre-train model untuk menangkap fitur umum.

  • Supervised learning dan evaluasi model

  • Fine-tune model untuk meningkatkan performa pada task tertentu.

Akses halaman Dataset

  1. Masuk ke Konsol PAI.

  2. Di pojok kiri atas, pilih Wilayah.

  3. Di panel navigasi sebelah kiri, klik Workspaces, lalu klik nama workspace yang dituju.

  4. Di panel navigasi sebelah kiri, pilih AI Computing Asset Management > Dataset.

Buat dataset dasar

Pada tab Custom Dataset, klik Create Dataset, lalu pilih Basic untuk Data Type. Anda dapat membuat dataset dari berbagai opsi Storage, termasuk Object Storage Service (OSS) dan sistem file (General-purpose NAS, Extreme NAS, CPFS, dan AI-CPFS).

Tipe penyimpanan: OSS

Parameter

Deskripsi

Content Type

Pilih tipe data: Image, Text, Audio, Video, Tabular, atau General. Memilih tipe spesifik membantu menyaring dataset dalam skenario pelabelan.

Owner

Pilih pemilik dataset. Hanya administrator workspace yang dapat mengonfigurasi parameter ini.

Import Format/OSS Path

  • Jika format impor adalah file, pilih file untuk OSS path. Dataset akan dipetakan ke file tersebut. Umumnya digunakan untuk dataset iTAG.

  • Jika format impor adalah folder, OSS path harus berupa path folder yang dapat dimount. Umumnya digunakan untuk DSW, DLC, atau EAS.

Default Mount Path

Path mount data default, umumnya digunakan di DSW dan DLC:

  • Di DSW, mount sistem file ke path ini saat membuat instans.

  • Di DLC, sistem membaca file dari direktori ini. Contohnya, python /root/data/file.py.

Enable Version Acceleration

Saat Anda mengatur Import Format ke Folder, Anda dapat mengaktifkan dataset version acceleration. Parameter utama:

  • Kapasitas Maksimum: Kapasitas slot akselerasi. Harus lebih besar dari atau sama dengan ukuran dataset.

  • Accelerated Mount Target: Secara default menggunakan titik pemasangan internal. Anda dapat memilih titik pemasangan yang sudah ada atau membuat yang baru.

    Catatan

    Saat menggunakan sumber daya Lingjun Intelligent Computing, jika Anda memilih Accelerated Mount Target untuk Create Mount Target, pilih VPC untuk Mount Target Type. VPC dan vSwitch harus sesuai dengan sumber daya Lingjun Intelligent Computing Anda.

  • Accelerated Version Default Mount Path: Path mount default untuk versi yang diakselerasi.

Tipe penyimpanan: sistem file

Parameter

Deskripsi

Content Type

Pilih tipe data: Image, Text, Audio, Video, Tabular, atau General. Memilih tipe spesifik membantu menyaring dataset dalam skenario pelabelan.

Owner

Pilih pemilik dataset. Hanya administrator workspace yang dapat mengonfigurasi parameter ini.

File System

Pilih sistem file yang sesuai dengan Storage yang dipilih.

Mount Target

Konfigurasikan titik pemasangan untuk mengakses sistem file NAS.

File System Path

Tentukan path penyimpanan yang sudah ada di sistem file NAS. Contohnya, /.

Default Mount Path

Path mount data default, umumnya digunakan di DSW dan DLC:

  • Di DSW, mount sistem file ke path ini saat membuat instans.

  • Di DLC, sistem membaca file dari direktori ini. Contohnya, python /root/data/file.py.

Enable Version Acceleration

Jika Storage adalah General-purpose NAS, Extreme NAS, atau CPFS, Anda dapat mengaktifkan dataset version acceleration. Parameter utama:

  • Kapasitas Maksimum: Kapasitas slot akselerasi. Harus lebih besar dari atau sama dengan ukuran dataset.

  • Accelerated Version Default Mount Path: Path mount default untuk versi yang diakselerasi.

Buat versi dataset dasar

Pada tab Custom Dataset, klik Create Version di kolom Actions untuk dataset yang dituju.

Catatan penting:

  • Nama dataset, tipe penyimpanan, dan tipe data diwariskan dari V1 dan tidak dapat diubah.

  • Nomor versi di-generate secara otomatis dan tidak dapat diubah.

  • Parameter lainnya sama seperti pada Buat dataset dasar.

Lihat dataset publik

PAI menyediakan dataset publik bawaan seperti MMLU, CMMLU, dan GSM8K. Pada tab Public Dataset, Anda dapat mengklik nama dataset untuk melihat informasi dasarnya.

Setiap dataset menampilkan Dataset Name/ID, Type, Task, Language, Size, Data Volume, dan Publisher.

Kelola dataset

Untuk dataset kustom, Anda dapat melihat riwayat versi, membuat versi baru, menjadikan dataset publik, atau menghapusnya. Untuk dataset berlabel, Anda dapat melihat data, menjadikan dataset publik, atau menghapusnya.

Catatan penting:

  • Untuk dataset yang Visibility-nya diatur ke Visible Only to the Dataset Owner, Anda dapat mengklik Set Dataset to Public untuk membagikannya kepada seluruh anggota di workspace. Setelah dataset dijadikan publik, tindakan ini tidak dapat dibatalkan. Lakukan dengan hati-hati.

  • Jika Pengguna RAM mengalami error access denied saat melihat data dataset, berikan izin yang diperlukan kepada Pengguna RAM tersebut.

  • Menghapus dataset dapat memengaruhi task yang sedang Berjalan dan bergantung padanya. Tindakan ini tidak dapat dibatalkan. Lakukan dengan hati-hati.