All Products
Search
Document Center

Platform For AI:Penskalalan fitur

Last Updated:Apr 26, 2026

Komponen penskalalan fitur mendukung transformasi penskalalan umum untuk fitur numerik dalam format dense atau sparse.

Ikhtisar

Komponen penskalalan fitur dapat:

  • Menerapkan fungsi penskalalan umum, seperti log2, log10, ln, abs, dan sqrt.

  • Memproses data dalam format dense maupun sparse.

Konfigurasi komponen

Anda dapat mengonfigurasi komponen penskalalan fitur dengan salah satu cara berikut.

Metode 1: Gunakan Konsol

Konfigurasikan parameter komponen dalam pipeline Designer.

Tab

Parameter

Deskripsi

Fields setting

Scaled features

Fitur yang akan diskalakan.

Label column

Jika Anda menentukan parameter ini, Anda dapat melihat histogram distribusi x-y antara fitur dan variabel target.

Is k:v,k:v sparse feature

Menentukan apakah data pelatihan bersifat sparse. Data sparse biasanya disimpan dalam satu bidang, bukan beberapa bidang.

Keep original transformed features

Menentukan apakah fitur asli dipertahankan. Jika opsi ini dipilih, fitur baru yang telah diskalakan akan dibuat dengan awalan scale_.

Parameters setting

Scaling function

Komponen feature scaling mendukung fungsi penskalalan berikut:

  • log2

  • log10

  • ln

  • abs

  • sqrt

Metode 2: Gunakan CLI

Konfigurasikan parameter komponen menggunakan perintah PAI. Anda dapat menjalankan perintah tersebut dalam komponen SQL script.

PAI -name fe_scale_runner -project algo_public
    -Dlifecycle=28
    -DscaleMethod=log2
    -DscaleCols=nr_employed
    -DinputTable=pai_dense_10_1
    -DoutputTable=pai_temp_2262_20380_1;

Parameter

Wajib

Deskripsi

Bawaan

inputTable

Ya

Nama tabel input.

N/A

inputTablePartitions

Tidak

Partisi dari tabel input yang digunakan untuk pelatihan. Tentukan partisi dalam format Partition_name=value.

Untuk partisi multi-level, gunakan format name1=value1/name2=value2;.

Pisahkan beberapa partisi dengan koma (,).

Semua partisi dalam tabel input.

outputTable

Ya

Tabel output untuk hasil yang telah diskalakan.

N/A

scaleCols

Ya

Fitur yang akan diskalakan.

Komponen secara otomatis memfilter fitur sparse. Hanya fitur numerik yang dapat dipilih.

N/A

labelCol

Tidak

Kolom label.

Jika Anda menentukan parameter ini, Anda dapat melihat histogram distribusi x-y antara fitur dan variabel target.

N/A

categoryCols

Tidak

Kolom yang diperlakukan sebagai fitur kategorikal. Kolom-kolom ini tidak diskalakan.

""

scaleMethod

Tidak

Metode penskalalan. Nilai yang valid:

  • log2

  • log10

  • ln

  • abs

  • sqrt

log2

scaleTopN

Tidak

Ketika parameter scaleCols tidak dipilih, sistem secara otomatis memilih fitur TopN yang akan diskalakan.

10

isSparse

Tidak

Menentukan apakah fitur bersifat sparse dan dalam format k:v.

dense

itemSpliter

Tidak

Delimiter untuk item dalam fitur sparse.

,

kvSpliter

Tidak

Delimiter antara kunci dan nilai dalam item fitur sparse.

:

lifecycle

Tidak

Siklus hidup tabel output, dalam satuan hari.

7

coreNum

Tidak

Jumlah node. Nilainya harus berupa bilangan bulat positif dalam rentang [1, 9999]. Parameter ini digunakan bersama dengan parameter memSizePerCore.

Dialokasikan secara otomatis.

memSizePerCore

Tidak

Ukuran memori per core dalam MB. Nilainya harus berupa bilangan bulat positif dalam rentang [2048, 64 * 1024].

Dialokasikan secara otomatis.

Contoh

  • Data masukan

    Gunakan skrip SQL berikut untuk menghasilkan data masukan.

    create table if not exists pai_dense_10_1 as
    select
        nr_employed
    from bank_data limit 10;
  • Pengaturan parameter

    Pilih nr_employed sebagai fitur yang akan diskalakan. Hanya fitur numerik yang didukung. Untuk Scaling Function, pilih log2.

  • Hasil

    nr_employed

    12.352071021075528

    12.34313018339218

    12.285286613666395

    12.316026916036957

    12.309533196497519

    12.352071021075528

    12.316026916036957

    12.316026916036957

    12.309533196497519

    12.316026916036957