Tutorial ini menjelaskan cara membangun pipeline klasifikasi sentimen di Machine Learning Platform for AI (PAI) untuk mengkategorikan ulasan pelanggan secara otomatis sebagai positif atau negatif. Setelah menyelesaikan tutorial ini, Anda akan memiliki model klasifikasi biner yang telah dilatih dengan akurasi sekitar 75%, mampu mengklasifikasikan dengan benar sekitar 3 dari 4 ulasan, serta dapat menerapkan model tersebut untuk mengklasifikasikan volume besar ulasan baru secara Batch.
Latar Belakang
Platform online menerima ribuan ulasan setiap hari. Melacak sentimen secara manual pada skala tersebut lambat dan rentan kesalahan. PAI menyediakan template pipeline preset yang menggabungkan vektorisasi teks dan regresi logistik untuk mengotomatiskan proses ini. Template ini dibangun berdasarkan 11.987 ulasan berlabel dari platform layanan pesan-antar dan dapat diterapkan dalam waktu satu hingga dua hari. Pipeline yang sama juga berlaku untuk klasifikasi spam dan analisis sentimen komentar berita.
Set Data
Pipeline ini menggunakan data nyata yang telah dimasking yang dikumpulkan dari platform layanan pesan-antar. Set data berisi dua bidang:
| Field | Tipe Data | Deskripsi |
|---|---|---|
| label | DOUBLE | Label sentimen: 1 = ulasan positif, 0 = ulasan negatif |
| review | STRING | Teks ulasan |
Prasyarat
Sebelum memulai, pastikan Anda telah memiliki:
Ruang kerja PAI
Bucket Object Storage Service (OSS) untuk menyimpan data dan model temporary
Bangun pipeline
Langkah 1: Buka Machine Learning Designer
Masuk ke Konsol PAI.
Di panel navigasi kiri, klik Workspaces. Di halaman Workspaces, klik nama ruang kerja yang ingin Anda kelola.
Di panel navigasi kiri, pilih Model Training > Visualized Modeling (Designer).
Langkah 2: Buat pipeline dari template preset
Di halaman Visualized Modeling (Designer), klik tab Preset Templates.
Temukan template Public Opinion Risk Control Based on Takeaway Reviews dan klik Create.
Di kotak dialog Create Pipeline, tinjau parameter-parameter tersebut. Parameter Data Storage menetapkan path bucket OSS tempat pipeline menyimpan data dan model temporary selama waktu proses. Pertahankan nilai default kecuali Anda memerlukan path bucket tertentu.
Klik OK.
Pipeline siap dalam waktu sekitar 10 detik.
Di tab Pipelines, klik ganda pipeline Public Opinion Risk Control Based on Takeaway Reviews untuk membukanya.
Kanvas menampilkan lima kelompok komponen:

| Bagian | Fungsinya |
|---|---|
| ① | Mengimpor set data ulasan |
| ② | Mengimpor stopwords (kata bantu dan tanda baca). Unggah tabel stopword Anda seperti yang ditunjukkan: |
| ③ | Melakukan vektorisasi teks menggunakan Doc2Vec. Komponen Doc2Vec-1 mengonversi setiap ulasan menjadi vektor semantik, di mana setiap baris merepresentasikan makna satu ulasan. Untuk memeriksa output, klik kanan Doc2Vec di kanvas dan pilih View Data > View Document Vector Table. |
| ④ | Melatih model. Komponen Split-1 membagi data yang telah divectorisasi menjadi set data pelatihan dan set data prediksi. Komponen Logistic Regression for Binary Classification-1 kemudian melatih model klasifikasi biner pada set data pelatihan. |
| ⑤ | Mengevaluasi kualitas model menggunakan Matriks kebingungan |
Langkah 3: Jalankan pipeline dan tinjau hasilnya
Di pojok kiri atas kanvas, klik
untuk menjalankan pipeline.Setelah eksekusi selesai, klik kanan Confusion Matrix di kanvas dan klik Visual Analysis.
Di bagian Confusion Matrix, klik tab Statistics untuk melihat metrik performa model.
Model mencapai akurasi sekitar 75% pada set data berlabel yang terdiri dari 11.987 ulasan, artinya model berhasil mengklasifikasikan dengan benar sekitar 3 dari 4 ulasan. Akurasi akan meningkat seiring penambahan jumlah ulasan berlabel yang digunakan untuk pelatihan.
Langkah Selanjutnya
Ganti set data sampel dengan ulasan berlabel milik Anda sendiri untuk melatih model yang disesuaikan dengan bisnis Anda.
Terapkan model yang telah dilatih untuk mengklasifikasikan ulasan baru secara Batch.
Kembangkan pendekatan pipeline ini untuk tugas klasifikasi teks terkait lainnya, seperti penyaringan spam atau analisis sentimen berita.