All Products
Search
Document Center

Platform For AI:Tampilan data

Last Updated:Jun 21, 2026

Dalam pembelajaran mesin, algoritma data pivoting merupakan metode untuk visualisasi set data dan analisis data eksplorasi. Algoritma ini memanfaatkan grafik, tabel, serta alat visualisasi lainnya guna mengungkap struktur, distribusi, dan hubungan dalam data, sehingga membantu pengguna memahami fitur, mengidentifikasi pola, serta mendeteksi anomali. Algoritma ini sangat penting pada tahap prapemrosesan data dan rekayasa fitur karena menjadi panduan untuk pemodelan dan analisis selanjutnya.

Konfigurasi komponen

Metode 1: Gunakan Konsol

Di Machine Learning Designer, tambahkan komponen Data Pivoting ke pipeline dan konfigurasikan parameternya di panel sebelah kanan.

Jenis parameter

Parameter

Deskripsi

Fields Setting

Feature Columns

Menentukan kolom fitur yang akan digunakan untuk visualisasi dan analisis. Komponen kemudian menampilkan distribusi dan hubungan antar kolom tersebut dalam bentuk grafik atau tabel.

Target Column

Menentukan variabel target, yang biasanya berupa label atau variabel respons, untuk prediksi atau analisis.

Enumeration Features

Memperlakukan fitur yang dipilih sebagai fitur enumerasi.

k:v,k:v sparse data format

Menentukan apakah akan menggunakan data sparse dalam format key-value.

Parameter Settings

Number of bins for continuous features

Menentukan jumlah interval diskret (bins) untuk membagi fitur kontinu guna visualisasi dan analisis.

Tuning

Number of cores

Jumlah core untuk komputasi. Nilainya harus berupa bilangan bulat positif.

Memory per core

Jumlah memori untuk setiap core, dalam satuan MB. Nilainya harus berupa bilangan bulat antara 1 hingga 65536.

Metode 2: Gunakan perintah PAI

Anda dapat mengonfigurasi parameter komponen Data Pivoting dengan menjalankan perintah PAI di komponen SQL Script. Untuk informasi lebih lanjut, lihat Skenario 4: Jalankan perintah PAI di komponen SQL Script.

PAI
-name fe_meta_runner
-project algo_public
-DinputTable="pai_dense_10_10"
-DoutputTable="pai_temp_2263_20384_1"
-DmapTable="pai_temp_2263_20384_2"
-DselectedCols="pdays,previous,emp_var_rate,cons_price_idx,cons_conf_idx,euribor3m,nr_employed,age,campaign,poutcome"
-DlabelCol="y"
-DcategoryCols="previous"
-Dlifecycle="28"-DmaxBins="5" ;

Parameter

Wajib

Default

Deskripsi

inputTable

Ya

None

Nama tabel input.

inputTablePartitions

Tidak

None

Partisi dari tabel input yang akan digunakan untuk pelatihan. Format berikut didukung:

  • partition_name=value

  • name1=value1/name2=value2: untuk partisi multi-level

Catatan

Untuk menentukan beberapa nilai untuk satu kunci partisi, pisahkan nilai-nilai tersebut dengan koma (,), contohnya name1=value1,value2.

outputTable

Ya

None

Nama tabel output.

mapTable

Ya

None

Tabel pemetaan output. Untuk menyiapkan data bagi pelatihan pembelajaran mesin, Data Pivoting mengumpulkan statistik untuk fitur STRING dan memetakannya ke ID integer (label encoding).

selectedCols

Ya

None

Nama kolom yang dipilih dari tabel input.

labelCol

Tidak

None

Kolom label.

categoryCols

Tidak

None

Menentukan kolom numerik (INT atau DOUBLE) yang akan diperlakukan sebagai fitur enumerasi.

maxBins

Tidak

100

Menentukan jumlah maksimum interval untuk diskretisasi jarak sama pada fitur kontinu.

isSparse

Tidak

false

Menentukan apakah data input berada dalam format sparse. Nilai yang valid adalah true dan false.

itemSpliter

Tidak

A comma (,)

Menentukan delimiter yang memisahkan pasangan kunci-nilai jika data input berada dalam format sparse.

kvSpliter

Tidak

A colon (:)

Menentukan delimiter yang memisahkan kunci dan nilai jika data input berada dalam format sparse.

lifecycle

Tidak

28

Siklus hidup tabel.

coreNum

Tidak

System-determined

Jumlah core CPU yang digunakan untuk pekerjaan. Harus berupa bilangan bulat positif. Nilai yang valid: [1, 9999].

memSizePerCore

Tidak

System-determined

Jumlah memori untuk setiap core, dalam satuan MB. Nilainya harus berupa bilangan bulat antara 1 hingga 65536.

Contoh

  1. Siapkan data uji seperti yang ditunjukkan pada tabel berikut.

    Age

    Workclass

    Fwlght

    Edu

    Edu_num

    Married

    C

    Family

    Race

    Sex

    Gail

    Loss

    Work_year

    Country

    Income

    39

    State-gov

    77516

    Bachelors

    13

    Never-married

    Adm-clerical

    Not-in-family

    White

    Male

    2174.0

    0.0

    40.0

    United-States

    <=50K

    50

    Self-emp-not-inc

    83311

    Bachelors

    13

    Married-civ-spouse

    Exec-managerial

    Husband

    White

    Male

    0.0

    0.0

    13.0

    United-States

    <=50K

    38

    Private

    215646

    HS-grad

    9

    Divorced

    Handlers-cleaners

    Not-in-family

    White

    Male

    0.0

    0.0

    40.0

    United-States

    <=50K

    53

    Private

    234721

    11th

    7

    Married-civ-spouse

    Handlers-cleaners

    Husband

    Black

    Male

    0.0

    0.0

    40.0

    United-States

    <=50K

    28

    Private

    338409

    Bachelors

    13

    Married-civ-spouse

    Prof-specialty

    Wife

    Black

    Female

    0.0

    0.0

    40.0

    Other

    <=50K

    37

    Private

    284582

    Masters

    14

    Married-civ-spouse

    Exec-managerial

    Wife

    White

    Female

    0.0

    0.0

    40.0

    United-States

    <=50K

    49

    Private

    160187

    9th

    5

    Married-spouse-absent

    Other-service

    Not-in-family

    Black

    Female

    0.0

    0.0

    16.0

    Jamaica

    <=50K

    52

    Self-emp-not-inc

    209642

    HS-grad

    9

    Married-civ-spouse

    Exec-managerial

    Husband

    White

    Male

    0.0

    0.0

    45.0

    United-States

    >50K

    31

    Private

    45781

    Masters

    14

    Never-married

    Prof-specialty

    Not-in-family

    White

    Female

    14084.0

    0.0

    50.0

    United-States

    >50K

    42

    Private

    159449

    Bachelors

    13

    Married-civ-spouse

    Exec-managerial

    Husband

    White

    Male

    5178.0

    0.0

    40.0

    United-States

    >50K

  2. Tambahkan komponen Read Table dan Data Pivoting ke pipeline, lalu hubungkan keduanya.

    image

    Di tab Fields Setting komponen Data Pivoting, pilih income sebagai kolom target dan 14 bidang lainnya sebagai kolom fitur. Perlakukan bidang edu_num bertipe BIGINT sebagai fitur enumerasi. Tab Fields Setting komponen Data Pivoting akan menunjukkan bahwa masing-masing bidang Feature Columns, Target Column, dan Enumeration Features telah memilih 14, 1, dan 1 bidang.

  3. Klik image di pojok kiri atas untuk menjalankan pipeline.

  4. Setelah pipeline selesai, klik kanan komponen Data Pivoting dan pilih View Data untuk melihat hasilnya:

    • Output: Untuk menyiapkan data bagi algoritma pembelajaran mesin, kolom STRING seperti family, race, sex, dan income dipetakan ke nilai numerik. Tabel data pelatihan hasilnya berisi 15 kolom: age, fwlght, edu_num, edu, workclass, married, c, family, race, sex, country, gail, loss, work_year, dan income. Kolom country disorot untuk menunjukkan bahwa ini merupakan kolom fitur STRING.

    • String Column Feature Mapping Table

      Catatan

      Jika tidak ada kolom fitur bertipe STRING yang dipilih, String Column Feature Mapping Table akan kosong.

      Tabel String Column Feature Mapping Table berisi tiga kolom: feature_name, feature_value, dan map_id. Setiap baris memetakan nilai fitur kategorikal ke ID numerik. Sebagai contoh, untuk fitur edu_num, nilai 13 dipetakan ke 1 dan 14 dipetakan ke 2. Untuk fitur edu, nilai '11th' dipetakan ke 1 dan 'Bachelors' dipetakan ke 3, dan seterusnya.

    • Output Meta Table: Tabel metadata fitur output berisi 10 kolom (feature_name, feature_id, feature_type, feature_value, mean, std, min_value, max_value, label_num, dan distribute_info) dan 15 baris data fitur. feature_type dapat berupa label (untuk income), enum (untuk edu_num, edu, workclass, married, c, family, race, sex, dan country), atau num (untuk age, fwlght, gail, loss, dan work_year). Untuk fitur numerik (num), kolom mean, std, min_value, dan max_value berisi nilai statistik tertentu. Untuk fitur enumerasi (enum) dan label, kolom-kolom tersebut semuanya berisi -1.0. Kolom feature_value menampilkan nilai enumerasi atau rentang numerik untuk setiap fitur, sedangkan kolom distribute_info menunjukkan distribusi nilai fitur. distribute_info menunjukkan jumlah catatan untuk setiap interval setelah rentang nilai fitur dibagi menjadi interval yang sama.