Komponen Word2Vec menggunakan jaringan saraf untuk memetakan kata ke vektor berdimensi-K. Vektor tersebut menangkap hubungan semantik sehingga memungkinkan operasi matematis yang sesuai dengan makna linguistik. Komponen ini menerima kolom kata atau korpus teks sebagai input dan menghasilkan tabel vektor kata serta kosakata.
Catatan penggunaan
Sambungkan komponen Word2Vec ke output komponen word frequency statistics.
Output komponen word frequency statistics berupa kumpulan tripel yang berisi kata dan jumlah kemunculannya. Komponen Word2Vec mengambil output ini, mengonversi data menjadi daftar kata tunggal, lalu memproses seluruh daftar tersebut sebagai satu dokumen.
Konfigurasi komponen
Anda dapat mengonfigurasi komponen Word2Vec dengan salah satu cara berikut.
Metode 1: Konfigurasi melalui GUI
Konfigurasikan parameter komponen pada halaman pipeline di Machine Learning Designer.
|
Tab |
Parameter |
Deskripsi |
|
Field Settings |
Select word column |
Kolom kata yang digunakan untuk pelatihan. Untuk kinerja terbaik, kami menyarankan agar jumlah kata tidak melebihi 10 juta. |
|
Parameter Settings |
Word feature dimension |
Jumlah dimensi untuk fitur kata. Nilai valid: 0 hingga 1.000. Nilai default: 100. |
|
Language model |
Model bahasa yang digunakan untuk pelatihan. Nilai valid: skip-gram model dan CBOW model. Nilai default: skip-gram model. |
|
|
Word window size |
Ukuran jendela kata. Nilainya harus bilangan bulat positif. Nilai default: 5. |
|
|
Use random window |
Menentukan apakah akan menggunakan jendela acak. Diaktifkan secara default. |
|
|
Minimum word frequency |
Nilainya harus bilangan bulat positif. Nilai default: 5. |
|
|
Use hierarchical softmax |
Menentukan apakah akan menggunakan hierarchical softmax. Diaktifkan secara default. |
|
|
Negative sampling |
Jumlah contoh negatif yang digunakan. Nilai 0 menonaktifkan fitur ini. Nilai default: 0. |
|
|
Downsampling threshold |
Ambang batas untuk downsampling kata yang sering muncul. Nilai 0 menonaktifkan fitur ini. Nilai default: 0. |
|
|
Initial learning rate |
Nilainya harus lebih besar dari 0. Nilai default: 0,025. |
|
|
Number of iterations |
Nilainya harus 1 atau lebih. Nilai default: 1. |
|
|
Tuning |
Number of cores |
Secara default, sistem mengalokasikan sumber daya secara otomatis. |
|
Memory size per core |
Secara default, sistem mengalokasikan sumber daya secara otomatis. |
Metode 2: Gunakan perintah PAI
Konfigurasikan komponen dengan menggunakan perintah PAI. Anda dapat menjalankan perintah PAI melalui komponen SQL Script. Untuk informasi selengkapnya, lihat SQL Script.
pai -name Word2Vec
-project algo_public
-DinputTableName=w2v_input
-DwordColName=word
-DoutputTableName=w2v_output;
|
Parameter |
Wajib |
Deskripsi |
Default |
|
inputTableName |
Ya |
Nama tabel kosakata input. |
Tidak ada |
|
inputTablePartitions |
Tidak |
Partisi tabel input untuk tokenisasi. Format: |
Tidak ada |
|
wordColName |
Ya |
Nama kolom kata. Setiap baris dalam kolom ini harus berisi satu kata. String </s> merepresentasikan karakter baris baru. |
Tidak ada |
|
inVocabularyTableName |
Tidak |
Tabel output dari operasi wordcount pada kosakata input. |
Sistem melakukan operasi wordcount pada tabel input. |
|
inVocabularyPartitions |
Tidak |
Partisi tabel output dari operasi word count. |
Semua partisi tabel yang ditentukan oleh inVocabularyTableName. |
|
layerSize |
Tidak |
Jumlah dimensi untuk fitur kata. Nilai valid: 0 hingga 1.000. |
100 |
|
cbow |
Tidak |
Menentukan model pelatihan. Atur ke 0 untuk model skip-gram atau 1 untuk model CBOW. |
0 |
|
window |
Tidak |
Ukuran jendela kata. Harus berupa bilangan bulat positif. |
5 |
|
minCount |
Tidak |
Frekuensi minimum kata untuk pemotongan. Harus berupa bilangan bulat positif. |
5 |
|
hs |
Tidak |
Menentukan apakah akan menggunakan hierarchical softmax. Atur ke 1 untuk mengaktifkan atau 0 untuk menonaktifkan. |
1 |
|
negative |
Tidak |
Jumlah contoh negatif. Harus berupa bilangan bulat positif. Nilai 0 menonaktifkan fitur ini. |
0 |
|
sample |
Tidak |
Ambang batas untuk downsampling. Nilai valid berkisar antara 1e-3 hingga 1e-5. Nilai 0 menonaktifkan fitur ini. |
0 |
|
alpha |
Tidak |
Tingkat pembelajaran awal. Harus lebih besar dari 0. |
0,025 |
|
iterTrain |
Tidak |
Jumlah iterasi pelatihan. Harus 1 atau lebih. |
1 |
|
randomWindow |
Tidak |
Menentukan jenis jendela kata. Nilai 0 menunjukkan ukuran jendela tetap yang diatur oleh parameter window. Nilai 1 menunjukkan ukuran jendela acak antara 1 dan 5. |
1 |
|
outVocabularyTableName |
Tidak |
Nama tabel output untuk kosakata. |
Tidak ada |
|
outputTableName |
Ya |
Nama tabel output untuk vektor kata. |
Tidak ada |
|
lifecycle |
Tidak |
Siklus hidup tabel output dalam satuan hari. Harus berupa bilangan bulat positif. |
Tidak ada |
|
coreNum |
Tidak |
Jumlah core. Parameter ini hanya berlaku jika memSizePerCore juga diatur. Harus berupa bilangan bulat positif. |
Dialokasikan secara otomatis |
|
memSizePerCore |
Tidak |
Ukuran memori per core dalam MB. Parameter ini hanya berlaku jika coreNum juga diatur. Harus berupa bilangan bulat positif. |
Dialokasikan secara otomatis |
FAQ
Jika muncul pesan error "Vocab size is zero! vocab_size: 0", artinya kosakata kosong. Untuk mengatasi masalah ini, turunkan nilai parameter minCount.