Model Gallery mengintegrasikan PAI-DLC dan PAI-EAS untuk mendukung penerapan dan pelatihan model bahasa besar open-source tanpa perlu menulis kode. Topik ini menjelaskan cara menerapkan, melakukan fine-tuning, dan mengevaluasi model Qwen3-0.6B.
1. Prasyarat
Untuk mengaktifkan PAI dan membuat ruang kerja, masuk ke Konsol PAI menggunakan Akun Alibaba Cloud Anda, pilih Wilayah di pojok kiri atas, lalu aktifkan layanan dengan otorisasi satu klik.
2. Penagihan
Contoh dalam topik ini menggunakan Sumber daya publik untuk membuat task PAI-DLC dan layanan PAI-EAS, yang dikenai biaya berdasarkan skema bayar sesuai penggunaan. Untuk detailnya, lihat Penagihan PAI-DLC dan Penagihan PAI-EAS.
3. Penerapan model
3.1 Terapkan model
Masuk ke Konsol PAI. Di panel navigasi sebelah kiri, klik Model Gallery, cari kartu Qwen3-0.6B, lalu klik Deploy.
Halaman konfigurasi telah diisi sebelumnya dengan parameter default. Klik Deploy > Confirm. Proses penerapan membutuhkan waktu sekitar lima menit. Penerapan berhasil ketika status berubah menjadi In operation.
Secara default, model diterapkan menggunakan Sumber daya publik dan dikenai biaya berdasarkan skema bayar sesuai penggunaan.
Spesifikasi sumber daya penerapan default adalah
ecs.gn7i-c8g1.2xlarge(8 vCPU, 30 GiB, NVIDIA A10 × 1), yang berbiaya sekitar CNY 10,5/jam. Setelah meninjau konfigurasi, klik Deploy di bagian bawah panel.
3.2 Panggil model
Lihat informasi pemanggilan. Di halaman detail layanan, klik View Call Information untuk mendapatkan Internet Endpoint dan Token.
Untuk melihat detail job penerapan nanti, di panel navigasi sebelah kiri, klik Model Gallery > Job Management > Deployment Jobs. Lalu, klik Service name yang dituju.
Di kotak dialog invocation information yang muncul, lihat Internet Endpoint dan VPC endpoint masing-masing di tab Shared Gateway dan VPC High-Speed Direct Connection.
Panggil model menggunakan salah satu metode berikut.
Online debugging
Beralih ke halaman Online Debugging. Layanan model bahasa besar mendukung Conversation Debugging dan API Debugging.
Klien Cherry Studio
Cherry Studio adalah klien populer untuk berinteraksi dengan model bahasa besar. Klien ini mengintegrasikan fitur MCP, yang memungkinkan Anda berdialog dengan model secara mudah.
Sambungkan ke model Qwen3 yang diterapkan di PAI
Instal klien
Unduh dan instal klien dari Cherry Studio.
Anda juga dapat mengunjungi
https://github.com/CherryHQ/cherry-studio/releasesuntuk mengunduh klien.Tambahkan penyedia.
Klik tombol
Settings di pojok kiri bawah. Di bagian Model Provider, klik Add.Di bidang Provider Name, masukkan nama kustom, misalnya Platform for AI (PAI), lalu atur tipe penyedia ke OpenAI.
Klik OK.
Di bidang API Key, masukkan Token Anda. Di bidang API Host, masukkan endpoint Anda.
Klik Add. Di bidang model ID, masukkan
Qwen3-0.6B(peka huruf besar/kecil) untuk menambahkan model.Anda dapat mengklik Check di samping API Key untuk memverifikasi konektivitas.
Klik ikon
untuk kembali ke halaman obrolan. Di bagian atas jendela, alihkan ke model Qwen3-0.6B yang baru saja Anda tambahkan untuk memulai percakapan.
Python SDK
from openai import OpenAI import os # Jika Anda belum mengatur variabel lingkungan, Anda dapat langsung memberikan Token layanan Anda. Contoh: token = 'YTA1NTEzMzY3ZTY4Z******************' token = os.environ.get("Token") # Jangan hapus "/v1" di akhir endpoint. client = OpenAI( api_key=token, base_url=f'<your_endpoint>/v1', ) if token is None: print("Harap konfigurasikan variabel lingkungan Token, atau tetapkan nilai token langsung ke variabel token.") exit() query = 'Hello, who are you?' messages = [{'role': 'user', 'content': query}] resp = client.chat.completions.create(model='Qwen3-0.6B', messages=messages, max_tokens=512, temperature=0) query = messages[0]['content'] response = resp.choices[0].message.content print(f'query: {query}') print(f'response: {response}')
3.3 Pengingat penting
Layanan model ini menggunakan Sumber daya publik dan dikenai biaya berdasarkan skema bayar sesuai penggunaan. Untuk menghindari biaya yang tidak perlu, hentikan atau hapus layanan tersebut saat Anda tidak lagi membutuhkannya.
Anda dapat melakukannya di tab Job Management > Deployment Jobs, pada kolom Actions layanan yang dituju.
4. Fine-tuning model
Untuk meningkatkan performa model dalam domain tertentu, Anda dapat melakukan fine-tuning menggunakan set data spesifik domain. Bagian ini menyajikan skenario untuk menunjukkan tujuan dan langkah-langkah fine-tuning model.
4.1 Kasus penggunaan
Di industri logistik, Anda sering perlu mengekstraksi informasi terstruktur (seperti penerima, alamat, dan nomor telepon) dari teks bahasa alami. Model dengan parameter besar, seperti Qwen3-235B-A22B, bekerja baik dalam tugas ini tetapi mahal dan memiliki latensi tinggi. Untuk menyeimbangkan performa dan biaya, Anda dapat terlebih dahulu menggunakan model berparameter besar untuk memberi label data, lalu menggunakan data tersebut untuk melakukan fine-tuning pada model berparameter kecil, seperti Qwen3-0.6B, agar mencapai performa serupa dalam tugas tersebut. Proses ini juga dikenal sebagai distilasi model.
Pada tugas ini, model Qwen3-0.6B asli memiliki akurasi sebesar 50%. Setelah fine-tuning, akurasinya dapat melebihi 90%.
Contoh informasi alamat penerima | Contoh informasi terstruktur |
Amina Patel - Nomor telepon (474) 598-1543 - 1425 S 5th St, Apt 3B, Allentown, Pennsylvania 18104 | |
4.2 Persiapan data
Tugas ini melibatkan distilasi model dari model guru (Qwen3-235B-A22B) ke model Qwen3-0.6B. Pertama, Anda harus menggunakan API model guru untuk mengekstraksi informasi alamat penerima ke dalam data JSON terstruktur. Menghasilkan data JSON ini bisa memakan waktu. Oleh karena itu, artikel ini menyediakan training dataset contohtrain.json dan set validasieval.json yang dapat Anda unduh dan gunakan langsung.
Dalam distilasi model, model dengan lebih banyak parameter disebut model guru. Data yang digunakan dalam artikel ini dihasilkan secara sintetis oleh model besar dan tidak mengandung informasi pengguna sensitif apa pun.
Tayang
4.3 Fine-tune model
Di panel navigasi sebelah kiri, klik Model Gallery. Cari kartu Qwen3-0.6B dan klik Fine-tune.
Konfigurasikan parameter untuk job pelatihan. Konfigurasikan hanya parameter kunci berikut dan pertahankan nilai default untuk yang lainnya.
Training Mode: Pilihan default adalah SFT (Supervised Fine-Tuning) menggunakan metode LoRA.
LoRA adalah teknik fine-tuning efisien yang menghemat sumber daya pelatihan dengan hanya memodifikasi subset parameter model.
Training dataset: Pertama, unduh training dataset contoh train.json. Lalu, di halaman konfigurasi, pilih OSS file or directory, klik ikon
untuk memilih bucket, klik Upload File untuk mengunggah dataset yang telah diunduh ke Object Storage Service (OSS), lalu pilih file tersebut.Validate dataset: Pertama, unduh dataset validasi eval.json. Lalu, klik Add validation dataset dan ikuti prosedur yang sama seperti untuk training dataset untuk mengunggah dan memilih file.
Dataset validasi mengevaluasi performa model pada data yang belum pernah dilihat selama pelatihan.
Model output path: Secara default, sistem menyimpan model yang telah difine-tuning ke OSS. Jika direktori OSS target kosong, klik Create folder dan pilih direktori yang baru dibuat.
Resource Group Type: Pilih Public Resource Group. Task fine-tuning ini memerlukan sekitar 5 GB Memori GPU. Konsol telah memfilter tipe instans yang memenuhi persyaratan ini. Pilih tipe instans, seperti
ecs.gn7i-c16g1.4xlarge.Hyperparameters:
learning_rate: Atur ke 0,0005num_train_epochs: Atur ke 4per_device_train_batch_size: Atur ke 8seq_length: Atur ke 512
Lalu, klik Train > OK. Job pelatihan memasuki status Creating. Saat status berubah menjadi In operation, fine-tuning model dimulai.
Lihat job pelatihan hingga selesai. Proses fine-tuning membutuhkan waktu sekitar 10 menit. Selama waktu ini, halaman detail job menampilkan log dan kurva metrik. Setelah job pelatihan selesai, sistem menyimpan model yang telah difine-tuning ke direktori OSS yang ditentukan.
Untuk melihat detail job pelatihan nanti, di panel navigasi sebelah kiri, klik Model Gallery > Job Management > Training Jobs, lalu klik nama job.
4.4 Menerapkan model yang telah difine-tuning
Di halaman detail job pelatihan, klik Deploy untuk membuka halaman konfigurasi penerapan. Untuk Resource Type, pilih Public Resources. Menerapkan model 0,6B memerlukan sekitar 5 GB Memori GPU. Daftar di bawah Instance Type secara otomatis menampilkan spesifikasi yang kompatibel. Pilih salah satu, seperti ecs.gn7i-c8g1.2xlarge. Pertahankan parameter lain pada nilai default, lalu klik Deploy > OK.
Penerapan membutuhkan waktu sekitar 5 menit dan selesai saat status berubah menjadi Running.
Untuk melihat detail job pelatihan, di panel navigasi sebelah kiri, klik Model Gallery > Job Management > Training Jobs, lalu klik nama job.
Jika tombol Deploy dinonaktifkan setelah job pelatihan berhasil, artinya model output masih dalam proses pendaftaran. Tunggu sekitar satu menit hingga tombol diaktifkan.
Langkah-langkah untuk memanggil model sama seperti yang dijelaskan dalam 3.2 Panggil model.
4.5 Evaluasi model yang telah difine-tuning
Sebelum menerapkan model yang telah difine-tuning ke lingkungan produksi, evaluasi performanya untuk memastikan stabilitas dan akurasinya. Evaluasi ini membantu mencegah masalah tak terduga setelah penerapan.
Siapkan data uji
Siapkan dataset uji yang tidak tumpang tindih dengan data pelatihan Anda untuk mengevaluasi performa model. Kode uji akurasi di bawah ini secara otomatis mengunduh set uji untuk tujuan ini.
Menggunakan dataset uji yang terpisah dari data pelatihan memastikan penilaian yang tidak bias terhadap kemampuan generalisasi model pada data yang belum pernah dilihat. Praktik ini mencegah skor yang terlalu tinggi akibat mengevaluasi model pada data yang sudah pernah dilihatnya.
Rancang metrik evaluasi
Metrik evaluasi harus selaras erat dengan tujuan bisnis Anda. Untuk studi kasus solusi ini, selain memvalidasi JSON yang dihasilkan, Anda juga harus memverifikasi bahwa pasangan kunci-nilai tersebut benar.
Tentukan metrik evaluasi secara programatik. Untuk implementasi dalam contoh ini, lihat metode compare_address_info dalam kode uji akurasi di bawah ini.Validasi model yang telah difine-tuning
Jalankan kode uji berikut untuk menghasilkan akurasi model pada set uji.
Output:
Semua prediksi selesai! Hasil telah disimpan ke predicted_labels.jsonl
Jumlah sampel: 400
Tanggapan benar: 382
Tanggapan salah: 18
Akurasi: 95,5 %Karena seed acak yang digunakan dalam fine-tuning model dan sifat stokastik output model bahasa besar, akurasi yang Anda capai mungkin berbeda dari hasil yang ditunjukkan dalam solusi ini. Variasi ini normal.
Akurasinya 95,5%, peningkatan signifikan dibandingkan akurasi 50% model Qwen3-0.6B asli. Ini menunjukkan bahwa fine-tuning secara substansial meningkatkan performanya dalam ekstraksi informasi terstruktur di domain logistik.
Panduan ini hanya menggunakan 4 epoch pelatihan untuk mengurangi waktu pelatihan, yang meningkatkan akurasi menjadi 95,5%. Anda dapat lebih meningkatkan akurasi dengan menambah jumlah epoch pelatihan.
4.6 Catatan penting
Layanan model dalam topik ini menggunakan Sumber daya publik dan dikenai biaya berdasarkan skema bayar sesuai penggunaan. Saat Anda tidak lagi membutuhkan layanan tersebut, hentikan atau hapus untuk menghindari biaya lebih lanjut.
Dokumen terkait
Untuk mempelajari lebih lanjut tentang fitur Model Gallery seperti evaluasi dan kompresi, lihat Model Gallery.
Untuk mempelajari lebih lanjut tentang fitur EAS seperti Auto Scaling, uji stres, dan Pemantauan Peringatan, lihat Ikhtisar EAS.

