All Products
Search
Document Center

Platform For AI:Word2Vec

Last Updated:Jun 21, 2026

Komponen Word2Vec menggunakan jaringan saraf untuk memetakan kata ke vektor berdimensi-K. Vektor tersebut menangkap hubungan semantik sehingga memungkinkan operasi matematis yang sesuai dengan makna linguistik. Komponen ini menerima kolom kata atau korpus teks sebagai input dan menghasilkan tabel vektor kata serta kosakata.

Catatan penggunaan

Sambungkan komponen Word2Vec ke output komponen word frequency statistics.

Catatan

Output komponen word frequency statistics berupa kumpulan tripel yang berisi kata dan jumlah kemunculannya. Komponen Word2Vec mengambil output ini, mengonversi data menjadi daftar kata tunggal, lalu memproses seluruh daftar tersebut sebagai satu dokumen.

Konfigurasi komponen

Anda dapat mengonfigurasi komponen Word2Vec dengan salah satu cara berikut.

Metode 1: Konfigurasi melalui GUI

Konfigurasikan parameter komponen pada halaman pipeline di Machine Learning Designer.

Tab

Parameter

Deskripsi

Field Settings

Select word column

Kolom kata yang digunakan untuk pelatihan. Untuk kinerja terbaik, kami menyarankan agar jumlah kata tidak melebihi 10 juta.

Parameter Settings

Word feature dimension

Jumlah dimensi untuk fitur kata. Nilai valid: 0 hingga 1.000. Nilai default: 100.

Language model

Model bahasa yang digunakan untuk pelatihan. Nilai valid: skip-gram model dan CBOW model. Nilai default: skip-gram model.

Word window size

Ukuran jendela kata. Nilainya harus bilangan bulat positif. Nilai default: 5.

Use random window

Menentukan apakah akan menggunakan jendela acak. Diaktifkan secara default.

Minimum word frequency

Nilainya harus bilangan bulat positif. Nilai default: 5.

Use hierarchical softmax

Menentukan apakah akan menggunakan hierarchical softmax. Diaktifkan secara default.

Negative sampling

Jumlah contoh negatif yang digunakan. Nilai 0 menonaktifkan fitur ini. Nilai default: 0.

Downsampling threshold

Ambang batas untuk downsampling kata yang sering muncul. Nilai 0 menonaktifkan fitur ini. Nilai default: 0.

Initial learning rate

Nilainya harus lebih besar dari 0. Nilai default: 0,025.

Number of iterations

Nilainya harus 1 atau lebih. Nilai default: 1.

Tuning

Number of cores

Secara default, sistem mengalokasikan sumber daya secara otomatis.

Memory size per core

Secara default, sistem mengalokasikan sumber daya secara otomatis.

Metode 2: Gunakan perintah PAI

Konfigurasikan komponen dengan menggunakan perintah PAI. Anda dapat menjalankan perintah PAI melalui komponen SQL Script. Untuk informasi selengkapnya, lihat SQL Script.

pai -name Word2Vec
    -project algo_public
    -DinputTableName=w2v_input
    -DwordColName=word
    -DoutputTableName=w2v_output;

Parameter

Wajib

Deskripsi

Default

inputTableName

Ya

Nama tabel kosakata input.

Tidak ada

inputTablePartitions

Tidak

Partisi tabel input untuk tokenisasi. Format: partition_name=value. Untuk partisi multi-level, gunakan name1=value1/name2=value2. Pisahkan beberapa partisi dengan koma (,).

Tidak ada

wordColName

Ya

Nama kolom kata. Setiap baris dalam kolom ini harus berisi satu kata. String </s> merepresentasikan karakter baris baru.

Tidak ada

inVocabularyTableName

Tidak

Tabel output dari operasi wordcount pada kosakata input.

Sistem melakukan operasi wordcount pada tabel input.

inVocabularyPartitions

Tidak

Partisi tabel output dari operasi word count.

Semua partisi tabel yang ditentukan oleh inVocabularyTableName.

layerSize

Tidak

Jumlah dimensi untuk fitur kata. Nilai valid: 0 hingga 1.000.

100

cbow

Tidak

Menentukan model pelatihan. Atur ke 0 untuk model skip-gram atau 1 untuk model CBOW.

0

window

Tidak

Ukuran jendela kata. Harus berupa bilangan bulat positif.

5

minCount

Tidak

Frekuensi minimum kata untuk pemotongan. Harus berupa bilangan bulat positif.

5

hs

Tidak

Menentukan apakah akan menggunakan hierarchical softmax. Atur ke 1 untuk mengaktifkan atau 0 untuk menonaktifkan.

1

negative

Tidak

Jumlah contoh negatif. Harus berupa bilangan bulat positif. Nilai 0 menonaktifkan fitur ini.

0

sample

Tidak

Ambang batas untuk downsampling. Nilai valid berkisar antara 1e-3 hingga 1e-5. Nilai 0 menonaktifkan fitur ini.

0

alpha

Tidak

Tingkat pembelajaran awal. Harus lebih besar dari 0.

0,025

iterTrain

Tidak

Jumlah iterasi pelatihan. Harus 1 atau lebih.

1

randomWindow

Tidak

Menentukan jenis jendela kata. Nilai 0 menunjukkan ukuran jendela tetap yang diatur oleh parameter window. Nilai 1 menunjukkan ukuran jendela acak antara 1 dan 5.

1

outVocabularyTableName

Tidak

Nama tabel output untuk kosakata.

Tidak ada

outputTableName

Ya

Nama tabel output untuk vektor kata.

Tidak ada

lifecycle

Tidak

Siklus hidup tabel output dalam satuan hari. Harus berupa bilangan bulat positif.

Tidak ada

coreNum

Tidak

Jumlah core. Parameter ini hanya berlaku jika memSizePerCore juga diatur. Harus berupa bilangan bulat positif.

Dialokasikan secara otomatis

memSizePerCore

Tidak

Ukuran memori per core dalam MB. Parameter ini hanya berlaku jika coreNum juga diatur. Harus berupa bilangan bulat positif.

Dialokasikan secara otomatis

FAQ

Jika muncul pesan error "Vocab size is zero! vocab_size: 0", artinya kosakata kosong. Untuk mengatasi masalah ini, turunkan nilai parameter minCount.