Statistik frekuensi kata adalah metode analisis teks yang mengonversi teks menjadi fitur numerik dengan menghitung kemunculan setiap kata. Hasilnya menyediakan data dasar untuk ekstraksi fitur dalam tugas Natural Language Processing berikutnya, seperti klasifikasi teks, Pengelompokan, dan Pengambilan informasi.
Algoritma
Frekuensi kata mengacu pada jumlah kemunculan suatu kata dalam korpus tertentu dan digunakan untuk mengukur tingkat kepentingannya dalam teks. Untuk menghitung frekuensi kata, Komponen pertama-tama melakukan tokenisasi konten dokumen (docContent) menjadi kata-kata. Selanjutnya, untuk setiap dokumen, Komponen menghasilkan ID dokumen (docId) beserta data kata terkait sesuai urutan input. Terakhir, Komponen menghitung jumlah kemunculan setiap kata dalam dokumen tersebut. Proses ini mengungkap struktur leksikal teks dan mendukung tugas analisis teks lanjutan seperti klasifikasi teks, pemodelan topik, dan Pengambilan informasi.
Input dan output
Port input
Port Keluaran
Konfigurasi komponen
Metode 1: Designer
Pada halaman pipeline Designer, tambahkan komponen Word Frequency Statistics dan konfigurasikan parameternya di panel kanan.
|
Grup parameter |
Parameter |
Deskripsi |
|
Field Settings |
Document ID column |
Pilih kolom ID dokumen ( |
|
Document content column |
Pilih kolom konten dokumen ( |
|
|
Tuning |
Number of cores |
Jumlah core untuk Pekerjaan. |
|
Memory size per core |
Memori yang dialokasikan untuk setiap core, dalam MB. |
Metode 2: Perintah PAI
Anda juga dapat mengonfigurasi komponen Word Frequency Statistics dengan menjalankan perintah PAI di komponen SQL Script. Untuk informasi selengkapnya, lihat Run a PAI command in the SQL Script component.
pai -name doc_word_stat
-project algo_public
-DinputTableName=tdl_doc_test_split_word
-DdocId=docid
-DdocContent=content
-DoutputTableNameMulti=doc_test_stat_multi
-DoutputTableNameTriple=doc_test_stat_triple
-DinputTablePartitions="region=cctv_news"
-Dlifecycle=7
|
Parameter |
Wajib |
Bawaan |
Deskripsi |
|
inputTableName |
Ya |
None |
Nama tabel input. |
|
docId |
Ya |
None |
Nama kolom ID dokumen. Anda hanya dapat menentukan satu kolom. |
|
docContent |
Ya |
None |
Nama kolom konten dokumen. Anda hanya dapat menentukan satu kolom. |
|
outputTableNameMulti |
Ya |
None |
Nama tabel output yang menyimpan kata-kata yang telah ditokenisasi sesuai urutan aslinya. Tabel ini berisi ID dokumen (dari kolom |
|
outputTableNameTriple |
Tidak |
None |
Nama tabel output untuk hitungan frekuensi kata. Output berformat triple yang berisi ID dokumen, kata, dan jumlah frekuensinya. |
|
inputTablePartitions |
Tidak |
Semua partisi |
Partisi tabel input yang akan diproses. Format berikut didukung:
Catatan
Untuk menentukan beberapa nilai partisi, pisahkan dengan koma, misalnya |
|
lifecycle |
Tidak |
-1 |
siklus hidup tabel output, dalam hari. Nilainya harus berupa bilangan bulat positif. Nilai -1 menunjukkan bahwa tabel bersifat permanen. |