All Products
Search
Document Center

Alibaba Cloud Model Studio:Alibaba Cloud Model Studio - Ringkasan data pelatihan

Last Updated:Aug 26, 2026

Seri model Qwen dan Wan yang terintegrasi dalam Alibaba Cloud Model Studio dikembangkan secara internal dan dilatih menggunakan berbagai sumber data, termasuk informasi publik di internet, data non-publik dari mitra pihak ketiga, data dari layanan pelabelan serta kontraktor berbayar, dan synthetic data yang dihasilkan oleh model proprietary kami. Model-model tersebut dilatih pada set data yang mencakup triliunan token teks, gambar, video, dan audio. Tanggal pertama penggunaan set data selama pengembangan model kami mendahului Januari 2022.

Data pelatihan dirancang secara sistematis dan dikurasi secara cermat untuk mendukung kemampuan inti layanan inferensi dalam bidang-bidang seperti pemahaman bahasa umum, reasoning advanced, interaksi multimodal, pemrosesan konteks panjang, dan generasi visual. Selain menyediakan pengetahuan dunia, data pelatihan juga memastikan bahwa model mengirimkan tanggapan yang efisien, aman, dan akurat terhadap berbagai permintaan pengguna—baik yang bersifat spesialis maupun multimodal—melalui alignment task, fusi modalitas, serta peningkatan kemampuan inferensi. Set data kami dapat mencakup materi yang dilindungi hak cipta, merek dagang, atau paten, serta materi dalam domain publik. Penggunaan synthetic data bertujuan mengatasi keterbatasan ketersediaan data pelatihan, memungkinkan penanganan task kompleks, meningkatkan generalisasi dan performa persepsi model, serta menjamin keamanan dan ketangguhan model.

Kami menerapkan mekanisme pembersihan dan penyaringan yang ketat guna menjaga kualitas data dan mengurangi potensi risiko. Selama tahap preprocessing, langkah-langkah penyaringan diterapkan untuk meminimalkan informasi pribadi dalam set data pelatihan. Data bisnis pelanggan Alibaba Cloud Model Studio tidak akan digunakan untuk mengembangkan atau meningkatkan model kami, kecuali jika pelanggan memberikan persetujuan eksplisit secara terpisah. Kami telah membangun kerangka tata kelola data yang ketat, didukung oleh langkah-langkah komprehensif dalam pembersihan, pemrosesan, dan optimasi struktural data, untuk memastikan kualitas, keamanan, dan keragaman data melalui tahapan-tahapan berikut:

  1. Fase pre-training:
    Kami menerapkan prosedur pembersihan dan penyaringan yang ketat terhadap data pelatihan mentah, termasuk screening otomatis terhadap konten tidak aman dan mekanisme tinjauan manual, untuk secara sistematis menghapus konten berbahaya atau sensitif. Langkah-langkah ini dirancang agar model, selama inferensi, dapat secara proaktif mengidentifikasi dan mengurangi dampak bias, sehingga meningkatkan keadilan dan netralitas keluaran model.

  2. Fase pasca-pelatihan:

    1. Augmentasi dan optimasi data untuk language model. Pada tingkat kualitas data, kami telah mengembangkan kerangka anotasi detail halus yang mencakup beberapa dimensi, seperti nilai edukatif, cakupan domain, jenis bahasa, kompleksitas reasoning, dan tingkat keamanan. Data berkualitas tinggi dipilih berdasarkan anotasi tersebut. Secara paralel, kami secara proaktif menyuntikkan synthetic data yang dihasilkan oleh model proprietary spesialis kami (seperti Qwen-Math dan Qwen-Coder). Praktik ini secara signifikan meningkatkan performa model dalam kemampuan inti, termasuk pemahaman multibahasa, reasoning kompleks, dan pemodelan konteks panjang, sekaligus memperkuat kontrolabilitas data pelatihan.
    2. Pemrosesan khusus untuk model generatif visual. Untuk data multimodal, kami melakukan preprocessing terarah, termasuk OCR berpresisi tinggi dan parsing struktur dokumen, anotasi semantik spasial 2D/3D, serta alignment temporal eksplisit antara frame video dan konten teks. Kami juga secara sistematis membangun set data sintetis multimodal berskala besar. Upaya ini bertujuan memperkuat alignment lintas-modalitas antara visi dan bahasa, mendukung pemahaman informasi berdimensi tinggi seperti dokumen kompleks dan video berdurasi panjang, serta menyediakan fondasi pelatihan berkualitas tinggi bagi aplikasi advanced, termasuk generasi visual dan interaksi berbasis Agen.
    3. Alignment keamanan. Kami membangun set data keamanan khusus untuk melakukan safety alignment, sehingga meningkatkan kemampuan keamanan intrinsik model.

Tujuan utama seluruh proses ini adalah meningkatkan kualitas data dan alignment task, memastikan keamanan model serta kepatuhan regulasi, serta mencapai secara tepat tujuan performa yang diinginkan dari layanan inferensi di berbagai skenario—umum, spesialis, maupun multimodal.