All Products
Search
Document Center

Platform For AI:Statistik frekuensi kata

Last Updated:Jun 21, 2026

Statistik frekuensi kata adalah metode analisis teks yang mengonversi teks menjadi fitur numerik dengan menghitung kemunculan setiap kata. Hasilnya menyediakan data dasar untuk ekstraksi fitur dalam tugas Natural Language Processing berikutnya, seperti klasifikasi teks, Pengelompokan, dan Pengambilan informasi.

Algoritma

Frekuensi kata mengacu pada jumlah kemunculan suatu kata dalam korpus tertentu dan digunakan untuk mengukur tingkat kepentingannya dalam teks. Untuk menghitung frekuensi kata, Komponen pertama-tama melakukan tokenisasi konten dokumen (docContent) menjadi kata-kata. Selanjutnya, untuk setiap dokumen, Komponen menghasilkan ID dokumen (docId) beserta data kata terkait sesuai urutan input. Terakhir, Komponen menghitung jumlah kemunculan setiap kata dalam dokumen tersebut. Proses ini mengungkap struktur leksikal teks dan mendukung tugas analisis teks lanjutan seperti klasifikasi teks, pemodelan topik, dan Pengambilan informasi.

Input dan output

Port input

Split Word

Port Keluaran

Konfigurasi komponen

Metode 1: Designer

Pada halaman pipeline Designer, tambahkan komponen Word Frequency Statistics dan konfigurasikan parameternya di panel kanan.

Grup parameter

Parameter

Deskripsi

Field Settings

Document ID column

Pilih kolom ID dokumen (docId).

Document content column

Pilih kolom konten dokumen (docContent). Teks dalam kolom ini ditokenisasi dan digunakan untuk menghitung frekuensi kata.

Tuning

Number of cores

Jumlah core untuk Pekerjaan.

Memory size per core

Memori yang dialokasikan untuk setiap core, dalam MB.

Metode 2: Perintah PAI

Anda juga dapat mengonfigurasi komponen Word Frequency Statistics dengan menjalankan perintah PAI di komponen SQL Script. Untuk informasi selengkapnya, lihat Run a PAI command in the SQL Script component.

pai -name doc_word_stat
    -project algo_public
    -DinputTableName=tdl_doc_test_split_word
    -DdocId=docid
    -DdocContent=content
    -DoutputTableNameMulti=doc_test_stat_multi
    -DoutputTableNameTriple=doc_test_stat_triple
    -DinputTablePartitions="region=cctv_news"
    -Dlifecycle=7

Parameter

Wajib

Bawaan

Deskripsi

inputTableName

Ya

None

Nama tabel input.

docId

Ya

None

Nama kolom ID dokumen. Anda hanya dapat menentukan satu kolom.

docContent

Ya

None

Nama kolom konten dokumen. Anda hanya dapat menentukan satu kolom.

outputTableNameMulti

Ya

None

Nama tabel output yang menyimpan kata-kata yang telah ditokenisasi sesuai urutan aslinya. Tabel ini berisi ID dokumen (dari kolom docId) dan data tokenisasi terkait. Kata-kata ditampilkan secara berurutan sesuai kemunculannya dalam dokumen asli.

outputTableNameTriple

Tidak

None

Nama tabel output untuk hitungan frekuensi kata. Output berformat triple yang berisi ID dokumen, kata, dan jumlah frekuensinya.

inputTablePartitions

Tidak

Semua partisi

Partisi tabel input yang akan diproses. Format berikut didukung:

  • partition_name=value

  • name1=value1/name2=value2: partisi multi-level

Catatan

Untuk menentukan beberapa nilai partisi, pisahkan dengan koma, misalnya name1=value1,value2.

lifecycle

Tidak

-1

siklus hidup tabel output, dalam hari. Nilainya harus berupa bilangan bulat positif. Nilai -1 menunjukkan bahwa tabel bersifat permanen.