All Products
Search
Document Center

Platform For AI:Ikhtisar komponen Designer

Last Updated:Aug 22, 2026

Komponen algoritma yang direkomendasikan

Komponen algoritma yang direkomendasikan mencakup algoritma tujuan umum, seperti pembacaan data, skrip SQL, dan skrip Python. Kategori ini juga mencakup algoritma untuk pemrosesan model bahasa besar (seperti LLM dan LVM), pelatihan, serta inferensi. Gunakan komponen algoritma berbasis DLC karena mendukung sumber daya heterogen dan lingkungan kustom guna meningkatkan fleksibilitas.

Jenis komponen

Komponen

Deskripsi

Custom component

Custom Component

Membuat custom component di AI Asset Management. Gunakan custom component tersebut di Designer untuk pelatihan model bersama komponen resmi.

Source/Target

Read OSS Data

Membaca file atau folder dari path tertentu dalam bucket Object Storage Service (OSS).

Read CSV file

Membaca file CSV dari OSS, HTTP, atau HDFS.

Read Table

Membaca data dari tabel MaxCompute dalam proyek saat ini.

Write to Table

Menulis data hulu ke tabel MaxCompute.

Custom script

SQL script

Menjalankan pernyataan SQL kustom di MaxCompute.

Python script

Menginstal paket dependensi dan menjalankan fungsi Python kustom.

Tools

Register Dataset

Mendaftarkan dataset ke AI Asset Management.

Register Model

Mendaftarkan model ke AI Asset Management.

Update EAS Service (Beta)

Memanggil eascmd untuk memperbarui layanan Elastic Algorithm Service (EAS) tertentu. Layanan harus berada dalam status running. Setiap pembaruan membuat versi layanan baru.

LLM data processing

Data conversion

Export MaxCompute Table to OSS

Mengekspor tabel MaxCompute ke OSS.

Import OSS Data to MaxCompute Table

Mengimpor data dari OSS ke tabel MaxCompute.

LLM data processing (DLC)

LLM-MD5 Deduplication (DLC)

Menghitung hash MD5 dari konten teks dan menghapus entri duplikat.

LLM-Text Normalization (DLC)

Menjalankan normalisasi Unicode pada teks dan mengonversi karakter Tionghoa Tradisional menjadi Tionghoa Sederhana.

LLM-Special Content Removal (DLC)

Menghapus URL dan membersihkan format HTML untuk mengekstraksi teks biasa.

LLM-Special Character Ratio Filter (DLC)

Menyaring sampel berdasarkan rasio karakter khusus terhadap panjang total teks.

LLM-Copyright Information Removal (DLC)

Menghapus informasi hak cipta dari teks, seperti komentar dalam header file kode.

LLM-Count Filter (DLC)

Menyaring sampel berdasarkan rasio karakter numerik dan alfabet terhadap panjang total teks.

LLM-Length Filter (DLC)

Menyaring sampel berdasarkan panjang total teks, panjang rata-rata baris, dan panjang maksimum baris.

LLM-Text Quality Scoring and Language Identification - FastText (DLC)

Mengidentifikasi bahasa teks, menghitung skor kualitas, dan menyaring sampel berdasarkan bahasa dan rentang skor yang ditentukan.

LLM-Sensitive Word Filter (DLC)

Menyaring sampel yang mengandung kata dari kamus kata sensitif tertentu.

LLM-Sensitive Information Masking (DLC)

Menyamarkan informasi sensitif, seperti alamat email, nomor telepon, dan nomor identitas.

LLM-Document Similarity Deduplication (DLC)

Mendeduplikasi dokumen dengan menghitung skor kemiripan menggunakan SimHash.

LLM-N-Gram Repetition Ratio Filter (DLC)

Menyaring sampel berdasarkan rasio pengulangan N-gram tingkat karakter atau tingkat kata.

LLM-Expand LaTeX Macro Definition (DLC)

Digunakan untuk data dalam format dokumen TEX. Melakukan ekspansi inline semua makro yang tidak memiliki parameter. Jika sebuah makro terdiri dari huruf dan angka serta tidak memiliki parameter, nama makro diganti dengan nilainya.

LLM-Remove LaTeX Bibliography (DLC)

Menghapus bagian bibliografi dari dokumen LaTeX.

LLM-Remove LaTeX Comment Lines (DLC)

Menghapus baris komentar dan komentar inline dari teks sumber LaTeX.

LLM-Remove LaTeX Document Header (DLC)

Digunakan untuk data dalam format dokumen TEX. Menemukan string pertama yang cocok dengan format bab <section-type>[optional-args]{name}, menghapus semua konten sebelumnya, dan menyimpan semua konten setelah bab pertama yang cocok, termasuk judul bab tersebut.

LLM data processing (MaxCompute)

LLM-MD5 Deduplication (MaxCompute)

Menghitung hash MD5 dari konten teks dan menghapus entri duplikat.

LLM-Text Normalization (MaxCompute)

Menjalankan normalisasi Unicode dan mengonversi karakter Tionghoa Tradisional menjadi Tionghoa Sederhana.

LLM-Special Content Removal (MaxCompute)

Menghapus konten seperti navigasi, informasi penulis, URL, dan format HTML.

LLM-Special Characters Ratio Filter (MaxCompute)

Menyaring sampel berdasarkan rasio karakter khusus terhadap panjang total teks.

LLM-Copyright Information Removal (MaxCompute)

Menghapus informasi hak cipta dari teks, seperti komentar dalam header file kode.

LLM-Count Filter (MaxCompute)

Menyaring sampel berdasarkan jumlah huruf, angka, dan delimiter.

LLM-Length Filter (MaxCompute)

Menyaring sampel berdasarkan panjang total teks, panjang rata-rata baris, dan panjang maksimum baris.

LLM-Text Quality Scoring and Language Identification (MaxCompute)

Mengidentifikasi bahasa teks, menghitung skor kualitas, dan menyaring sampel berdasarkan bahasa dan rentang skor yang ditentukan.

LLM-Sensitive Word Filter (MaxCompute)

Menyaring sampel yang mengandung kata dari kamus kata sensitif tertentu.

LLM-Sensitive Information Masking (MaxCompute)

Menyamarkan informasi sensitif, seperti alamat email, nomor telepon, dan nomor identitas.

LLM-N-Gram Repetition Ratio Filter (MaxCompute)

Menyaring sampel berdasarkan rasio pengulangan N-gram tingkat karakter atau tingkat kata.

LLM-Expand LaTeX Macro Definition (MaxCompute)

Menyisipkan definisi makro tanpa parameter secara inline dalam data berformat TEX.

LLM-Remove LaTeX Bibliography (MaxCompute)

Menghapus bagian bibliografi dari dokumen LaTeX.

LLM-Remove LaTeX Comment Lines (MaxCompute)

Menghapus baris komentar dan komentar inline dari teks sumber LaTeX.

LLM-Remove LaTeX Document Header (MaxCompute)

Menghapus semua konten yang mendahului deklarasi bagian pertama dalam dokumen LaTeX.

LVM data processing (DLC)

Video preprocessing operators

LVM-Text Area Filter (DLC)

Menyaring data video berdasarkan jumlah teks yang ada dalam frame.

LVM-Motion Filter (DLC)

Menyaring data video berdasarkan rentang kecepatan gerakan tertentu.

LVM-Aesthetics Filter (DLC)

Menyaring data video yang berada di bawah skor kualitas estetika tertentu.

LVM-Aspect Ratio Filter (DLC)

Menyaring data video berdasarkan rentang rasio aspek tertentu.

LVM-Duration Filter (DLC)

Menyaring data video berdasarkan rentang durasi tertentu.

LVM-Video-Text Similarity Filter (DLC)

Menyaring data video berdasarkan skor kemiripan semantik antara video dan teks terkaitnya.

LVM-Compliance Filter (DLC)

Menyaring data video berdasarkan skor Not Safe For Work (NSFW)-nya.

LVM-Resolution Filter (DLC)

Menyaring data video berdasarkan rentang resolusi tertentu.

LVM-Watermark Filter (DLC)

Menyaring data video yang mengandung watermark.

LVM-Tag Filter (DLC)

Menyaring data video yang tidak sesuai dengan kumpulan tag tertentu.

LVM-Tag Generation (DLC)

Menghasilkan tag deskriptif untuk frame video.

LVM-Frame Text Generation (DLC)

Menghasilkan teks deskriptif untuk frame video.

LVM-Video Text Generation (DLC)

Menghasilkan teks deskriptif untuk seluruh video.

Image preprocessing operators

LVM-Image Aesthetics Filter (DLC)

Menyaring data gambar yang berada di bawah skor kualitas estetika tertentu.

LVM-Image Aspect Ratio Filter (DLC)

Menyaring data gambar berdasarkan rentang rasio aspek tertentu.

LVM-Image Face Ratio Filter (DLC)

Menyaring data gambar berdasarkan rasio luas wajah terhadap luas total gambar.

LVM-Image Compliance Filter (DLC)

Menyaring data gambar berdasarkan skor Not Safe For Work (NSFW)-nya.

LVM-Image Resolution Filter (DLC)

Menyaring data gambar berdasarkan rentang resolusi tertentu.

LVM-Image Size Filter (DLC)

Menyaring data gambar berdasarkan rentang ukuran file tertentu.

LVM-Image-Text Matching Filter (DLC)

Menyaring pasangan gambar-teks berdasarkan skor kecocokannya.

LVM-Image-Text Similarity Filter (DLC)

Menyaring pasangan gambar-teks berdasarkan skor kemiripan semantiknya.

LVM-Image Watermark Filter (DLC)

Menyaring data gambar yang mengandung watermark.

LVM-Image Captioning (DLC)

Menghasilkan deskripsi bahasa alami untuk gambar.

LLM training and inference

BERT Model Offline Inference

Menjalankan inferensi offline menggunakan model klasifikasi BERT pra-latih untuk mengklasifikasikan teks dalam tabel input.

Komponen algoritma tradisional

Penting

Komponen lawas ini tidak lagi aktif dipelihara. Stabilitas dan Service Level Agreements (SLA) tidak dijamin. Gantilah komponen lawas di lingkungan produksi dengan komponen algoritma yang direkomendasikan untuk memastikan stabilitas.

Jenis komponen

Komponen

Deskripsi

Data preprocessing

Random sampling

Menjalankan sampling acak dan independen pada data input berdasarkan rasio atau jumlah tertentu.

Weighted sampling

Menghasilkan sampel dari data input menggunakan metode seleksi berbobot.

Filter and Map

Menyaring baris data berdasarkan ekspresi SQL dan mengganti nama kolom output.

Stratified sampling

Membagi data menjadi kelompok berdasarkan kolom tertentu dan melakukan sampling acak dalam setiap kelompok.

JOIN

Menggabungkan dua tabel berdasarkan kunci gabungan, mirip dengan pernyataan JOIN SQL.

Merge Columns

Menggabungkan kolom dari dua tabel. Kedua tabel harus memiliki jumlah baris yang sama.

Merge rows (UNION)

Menambahkan baris dari dua tabel. Kedua tabel harus memiliki jumlah dan tipe kolom terpilih yang sama.

Type Transformation

Mengonversi tipe data kolom tertentu menjadi String, Double, atau Integer. Mengisi nilai yang hilang jika konversi gagal.

Add ID Column

Menambahkan kolom ID numerik berurutan sebagai kolom pertama tabel.

Split

Membagi dataset secara acak menjadi dua subset, biasanya untuk membuat set pelatihan dan pengujian.

Fill Missing Values

Mengisi nilai yang hilang dalam kolom tertentu menggunakan metode yang dipilih, seperti mean, median, modus, atau nilai kustom.

Normalization

Menyesuaikan ulang fitur numerik ke rentang umum, seperti [0, 1]. Mendukung format data padat dan jarang.

Standardization

Menyesuaikan ulang fitur agar memiliki mean 0 dan deviasi standar 1 (normalisasi z-score).

KV to table

Mengonversi tabel dari format Key-Value (KV) jarang ke format tabel padat.

Table to KV

Mengonversi tabel padat ke format Key-Value (KV) jarang.

Feature engineering

Feature importance filtering

Menyaring N fitur teratas berdasarkan skor pentingnya fitur yang dihasilkan oleh komponen lain.

Principal Component Analysis

Menjalankan Principal Component Analysis (PCA) untuk mengurangi dimensi dataset dengan mengubah fitur menjadi kumpulan komponen utama yang tidak berkorelasi secara linear.

Feature scaling

Menjalankan transformasi penskalaan min-maks, log, atau z-score pada fitur numerik.

Feature discretization

Mengonversi fitur numerik kontinu menjadi fitur kategorikal diskrit (bin).

Feature Anomaly Smoothing

Membatasi nilai fitur anomali ke rentang tertentu. Mendukung format data jarang dan padat.

Singular Value Decomposition

Menjalankan Singular Value Decomposition (SVD) pada matriks.

Anomaly Detection

Mendeteksi outlier dalam data yang mengandung fitur kontinu dan kategorikal.

Linear model feature importance

Menghitung skor pentingnya fitur menggunakan model regresi linier atau regresi logistik.

Discrete feature analysis

Menganalisis distribusi statistik fitur diskrit.

Random Forest Feature Importance Evaluation

Menghitung skor pentingnya fitur menggunakan model Random Forest yang telah dilatih.

Filter-based Feature Selection

Memilih subset fitur menggunakan metode filter seperti Chi-squared, indeks Gini, atau Information Gain.

Feature Encoding

Mengkodekan fitur non-linear menjadi fitur linear menggunakan model Gradient Boosting Decision Tree (GBDT).

One-Hot Encoding

Mengonversi fitur kategorikal menjadi representasi vektor biner. Output dalam format Key-Value (KV) jarang.

Statistical analysis

Data View

Memberikan ringkasan visual distribusi data dan statistik untuk kolom yang dipilih.

Covariance

Menghitung kovarians antara dua variabel acak untuk mengukur bagaimana keduanya berubah bersama.

Empirical Probability Density Plot

Menghasilkan plot kepadatan probabilitas menggunakan distribusi empiris atau estimasi kepadatan kernel.

Full Table Statistics

Menghitung statistik deskriptif untuk semua kolom atau subset kolom dalam tabel.

Chi-Square Goodness-of-Fit Test

Digunakan untuk variabel kategorikal. Menguji apakah frekuensi observasi aktual dan frekuensi teoretis konsisten di seluruh kategori variabel kategorikal multinomial tunggal. Hipotesis nol menyatakan tidak ada perbedaan antara frekuensi observasi dan teoretis.

Box plot

Grafik box plot adalah grafik statistik yang digunakan untuk menampilkan dispersi dataset. Terutama digunakan untuk mencerminkan karakteristik distribusi data mentah dan juga dapat digunakan untuk membandingkan karakteristik distribusi beberapa dataset.

Scatter chart

Grafik sebaran adalah plot distribusi titik data pada sistem koordinat Kartesius dalam analisis regresi.

Correlation Matrix

Algoritma koefisien korelasi menghitung koefisien korelasi antara setiap kolom dalam matriks. Nilainya berkisar dari [-1,1]. Selama perhitungan, jumlah didasarkan pada jumlah elemen yang tidak kosong di kedua kolom. Jumlah tersebut dapat bervariasi antar pasangan kolom yang berbeda.

Two-Sample T-Test

Berdasarkan prinsip statistik, komponen ini menguji apakah terdapat perbedaan signifikan antara rata-rata dua sampel.

One-Sample T-Test

Menguji apakah terdapat perbedaan signifikan antara rata-rata populasi suatu variabel dan nilai tertentu. Sampel yang diuji harus mengikuti distribusi normal.

Normality test

Menggunakan nilai observasi untuk menentukan apakah populasi mengikuti distribusi normal. Ini merupakan jenis penting uji hipotesis goodness-of-fit khusus dalam pengambilan keputusan statistik.

Lorenz curve

Menampilkan secara visual distribusi pendapatan suatu negara atau wilayah.

Percentile

Istilah statistik yang digunakan untuk menghitung persentil data dalam kolom tabel.

Pearson coefficient

Koefisien korelasi linear yang mencerminkan tingkat korelasi linear antara dua variabel.

Histogram

Histogram, juga dikenal sebagai grafik distribusi massa, adalah grafik laporan statistik yang menggunakan serangkaian batang vertikal atau segmen garis dengan ketinggian bervariasi untuk merepresentasikan distribusi data.

Machine learning

Prediction

Inputnya adalah model yang telah dilatih dan data prediksi, sedangkan outputnya adalah hasil prediksi.

XGBoost Training

Algoritma ini memperluas dan meningkatkan algoritma boosting. Mudah digunakan dan kuat, serta banyak digunakan dalam berbagai sistem produksi dan kompetisi pembelajaran mesin. Saat ini mendukung klasifikasi dan regresi.

XGBoost Prediction

Algoritma ini memperluas dan meningkatkan algoritma boosting. Mudah digunakan dan kuat, serta banyak digunakan dalam berbagai sistem produksi dan kompetisi pembelajaran mesin. Saat ini mendukung klasifikasi dan regresi.

Linear Support Vector Machine

Metode pembelajaran mesin berdasarkan teori pembelajaran statistik. Meningkatkan kemampuan generalisasi mesin belajar dengan meminimalkan risiko struktural, sehingga meminimalkan risiko empiris dan rentang kepercayaan.

Logistic regression for binary classification

Algoritma klasifikasi biner yang mendukung format data jarang dan padat.

GBDT for Binary Classification

Komponen ini bekerja dengan menetapkan ambang batas. Jika nilai fitur lebih besar dari ambang batas, maka merupakan contoh positif. Jika tidak, maka merupakan contoh negatif.

PS-SMART for Binary Classification

Parameter Server (PS) dirancang untuk menangani tugas pelatihan offline dan online skala besar. Scalable Multiple Additive Regression Tree (SMART) adalah algoritma iteratif yang berbasis pada Gradient Boosting Decision Tree (GBDT) dan diimplementasikan pada PS.

PS-SMART for Multiclass Classification

Parameter Server (PS) dirancang untuk menangani tugas pelatihan offline dan online skala besar. Scalable Multiple Additive Regression Tree (SMART) adalah algoritma iteratif yang berbasis pada Gradient Boosting Decision Tree (GBDT) dan diimplementasikan pada PS.

K-Nearest Neighbors

Untuk setiap baris data dalam tabel prediksi, komponen ini memilih K catatan dengan jarak terdekat dari tabel pelatihan. Kelas dengan frekuensi tertinggi di antara K catatan tersebut ditetapkan sebagai kelas untuk baris tersebut.

Logistic regression for multiclass classification

Algoritma klasifikasi biner. Model regresi logistik yang disediakan oleh PAI mendukung klasifikasi multikelas serta format data jarang dan padat.

Random Forests

Pengklasifikasi yang terdiri atas beberapa pohon keputusan, dengan hasil klasifikasi ditentukan berdasarkan modus dari kelas-kelas yang dihasilkan oleh masing-masing pohon.

Naive Bayes

Algoritma klasifikasi probabilistik berdasarkan teorema Bayes dengan asumsi independensi.

K-Means Clustering

Pertama, komponen ini memilih secara acak K objek sebagai pusat kluster awal untuk setiap kluster. Kemudian, menghitung jarak antara objek yang tersisa dan setiap pusat kluster, menetapkannya ke kluster terdekat, dan menghitung ulang pusat kluster untuk setiap kluster.

DBSCAN

Gunakan komponen DBSCAN untuk membangun model pengelompokan.

Gaussian Mixture Model training

Gunakan komponen GMM Training untuk mengimplementasikan klasifikasi model.

DBSCAN Prediction

Gunakan komponen DBSCAN Prediction untuk memprediksi kluster tempat titik data baru berada berdasarkan model pelatihan DBSCAN.

GMM prediction

Gunakan komponen GMM Prediction untuk melakukan prediksi pengelompokan berdasarkan model campuran Gaussian yang telah dilatih.

GBDT regression

Algoritma pohon keputusan iteratif yang cocok untuk skenario regresi linear dan non-linear.

Linear regression

Model yang menganalisis hubungan linear antara variabel dependen dan beberapa variabel independen.

PS-SMART regression

Komponen ini dirancang untuk menangani tugas pelatihan offline dan online skala besar. SMART adalah algoritma iteratif yang berbasis pada GBDT dan diimplementasikan pada PS.

PS linear regression

Model yang menganalisis hubungan linear antara variabel dependen dan beberapa variabel independen. Parameter Server (PS) dirancang untuk menangani tugas pelatihan offline dan online skala besar.

Binary classification evaluation

Menghitung metrik seperti AUC, KS, dan F1-score, serta menghasilkan kurva KS, kurva PR, kurva ROC, grafik LIFT, dan grafik Gain.

Regression Model Evaluation

Mengevaluasi kualitas model algoritma regresi berdasarkan hasil prediksi dan hasil mentah, serta menghasilkan metrik evaluasi dan histogram residual.

Clustering model evaluation

Mengevaluasi kualitas model pengelompokan berdasarkan data mentah dan hasil pengelompokan, serta menghasilkan metrik evaluasi.

Confusion Matrix

Cocok untuk pembelajaran terawasi dan sesuai dengan matriks pencocokan dalam pembelajaran tidak terawasi.

Multiclass classification evaluation

Mengevaluasi kualitas model algoritma klasifikasi multikelas berdasarkan hasil prediksi dan hasil mentah model klasifikasi, serta menghasilkan metrik evaluasi seperti Accuracy, Kappa, dan F1-Score.

Deep learning

Deep learning frameworks and activation instructions

PAI mendukung framework deep learning. Gunakan framework dan sumber daya perangkat keras ini untuk menjalankan algoritma deep learning.

Time series

x13_arima

Algoritma Arima untuk penyesuaian musiman yang dikemas berdasarkan X-13ARIMA-SEATS open source.

x13_auto_arima

Termasuk program pemilihan model ARIMA otomatis, yang terutama berdasarkan program oleh Gomez dan Maravall (1998) yang diimplementasikan dalam TRMO (1996) dan revisi selanjutnya.

Prophet

Menjalankan prediksi deret waktu Prophet pada setiap baris data MTable dan memberikan hasil prediksi untuk periode waktu berikutnya.

MTable assembler

Mengagregasi tabel menjadi MTable berdasarkan kolom pengelompokan.

MTable expander

Memperluas MTable menjadi tabel.

Recommendation methods

FM Algorithm

Algoritma Factorization Machine (FM) mempertimbangkan interaksi antar fitur. Ini adalah model non-linear yang cocok untuk skenario rekomendasi di e-commerce, periklanan, dan siaran langsung.

ALS Matrix Factorization

Algoritma Alternating Least Squares (ALS) melakukan dekomposisi model pada matriks jarang dan mengevaluasi nilai item yang hilang untuk mendapatkan model pelatihan dasar.

Swing Training

Algoritma recall item. Gunakan komponen Swing Training untuk mengukur kemiripan item berdasarkan prinsip User-Item-User.

Swing prediction

Komponen prediksi pemrosesan batch untuk Swing. Gunakan komponen ini untuk melakukan prediksi offline berdasarkan model pelatihan Swing dan data prediksi.

Collaborative filtering (etrec)

etrec adalah algoritma collaborative filtering berbasis item. Input terdiri dari dua kolom, dan output adalah N item paling mirip.

Vector retrieval evaluation

Menghitung tingkat hit recall. Tingkat hit digunakan untuk mengevaluasi kualitas hasil. Tingkat hit yang lebih tinggi menunjukkan bahwa vektor yang dihasilkan oleh pelatihan mencapai hasil recall yang lebih akurat.

Anomaly detection

Local Outlier Factor Anomaly Detection

Menentukan apakah sampel merupakan anomali berdasarkan nilai Local Outlier Factor (LOF)-nya.

IForest Anomaly Detection

Menggunakan algoritma sub-sampling untuk mengurangi kompleksitas komputasi. Dapat mengidentifikasi anomali dalam data dan memiliki efek aplikasi signifikan dalam deteksi anomali.

One-Class SVM Anomaly Detection

Berbeda dari SVM tradisional, ini adalah algoritma pembelajaran tidak terawasi. Gunakan One-Class SVM Anomaly Detection untuk memprediksi anomali dengan mempelajari batas.

Natural Language Processing

Text Summarization Prediction

Mengekstraksi, memperhalus, atau merangkum informasi kunci dari urutan teks yang panjang dan berulang. Peringkasan judul berita adalah kasus khusus peringkasan teks. Gunakan komponen Text Summarization Prediction untuk memanggil model pra-latih tertentu guna memprediksi teks berita dan menghasilkan judul berita.

Machine Reading Comprehension Prediction

Menjalankan prediksi offline dengan model pelatihan pemahaman membaca mesin yang dihasilkan.

Text Summarization Training

Mengekstraksi, memperhalus, atau merangkum informasi kunci dari urutan teks yang panjang dan berulang. Peringkasan judul berita adalah kasus khusus peringkasan teks. Gunakan komponen Text Summarization Training untuk melatih model yang menghasilkan judul berita guna merangkum ide sentral dan informasi kunci artikel berita.

Machine Reading Comprehension Training

Melatih model pemahaman membaca mesin yang dapat dengan cepat memahami dan menjawab pertanyaan berdasarkan dokumen yang diberikan.

Split Word

Berdasarkan sistem analisis leksikal AliWS (Alibaba Word Segmenter), komponen ini melakukan tokenisasi pada konten kolom tertentu. Token yang dihasilkan dipisahkan oleh spasi.

Trituple to KV

Mengonversi tabel tripel (row,col,value) menjadi tabel key-value (KV) (row,[col_id:value]).

String similarity

Operasi dasar dalam pembelajaran mesin, terutama digunakan dalam pengambilan informasi, pemrosesan bahasa alami, dan bioinformatika.

String Similarity-Top N

Menghitung kemiripan string dan menyaring N data paling mirip.

Stop Word Filter

Metode pra-pemrosesan dalam analisis teks yang digunakan untuk menyaring kebisingan (seperti "the", "is", atau "a") dari hasil tokenisasi.

ngram-count

Langkah dalam pelatihan model bahasa. Menghasilkan n-gram berdasarkan kata dan menghitung kemunculan setiap n-gram di seluruh korpus.

Text summarization

Teks pendek yang sederhana dan koheren yang secara komprehensif dan akurat mencerminkan ide sentral dokumen. Peringkasan otomatis menggunakan komputer untuk secara otomatis mengekstraksi konten ringkasan dari dokumen asli.

Keyword extraction

Teknik penting dalam pemrosesan bahasa alami. Mengekstraksi kata dari teks yang sangat relevan dengan makna dokumen.

Sentence splitting

Membagi teks menjadi kalimat berdasarkan tanda baca. Komponen ini terutama digunakan untuk pra-pemrosesan sebelum peringkasan teks, mengonversi paragraf menjadi format satu kalimat per baris.

Semantic Vector Distance

Berdasarkan hasil vektor semantik dari algoritma (seperti penyematan kata yang dihasilkan oleh Word2Vec), komponen ini menghitung kata (atau kalimat) ekstensi untuk kata (atau kalimat) yang diberikan dengan menemukan himpunan vektor dengan jarak terdekat. Salah satu kasus penggunaan adalah mengembalikan daftar kata paling mirip berdasarkan kata input dan penyematan kata yang dihasilkan oleh Word2Vec.

Doc2Vec

Gunakan komponen algoritma Doc2Vec untuk memetakan dokumen ke vektor. Inputnya adalah kosakata, dan outputnya adalah tabel vektor dokumen, tabel vektor kata, atau kosakata.

Conditional random field

Conditional random field (CRF) adalah model distribusi probabilistik dari sekumpulan variabel acak output yang diberikan sekumpulan variabel acak input. Karakteristiknya adalah asumsi bahwa variabel acak output membentuk medan acak Markov.

Document similarity

Membangun di atas kemiripan string untuk menghitung kemiripan antar pasangan dokumen atau kalimat berdasarkan kata.

PMI

Algoritma ini menghitung kemunculan bersama semua kata dalam beberapa dokumen dan menghitung pointwise mutual information (PMI) antar setiap pasangan.

Conditional random field prediction

Komponen algoritma berbasis model prediksi online linearCRF, terutama digunakan untuk masalah penandaan urutan.

Split Word (Generate Model)

Berdasarkan sistem analisis leksikal AliWS (Alibaba Word Segmenter), komponen ini menghasilkan model tokenisasi berdasarkan parameter dan kamus kustom.

Word Count

Mengambil string sebagai input (dimasukkan secara manual atau dibaca dari file) dan menggunakan program untuk menghitung jumlah total kata dan frekuensi setiap kata.

TF-IDF

Teknik pembobotan umum untuk pengambilan informasi dan penambangan teks. Sering digunakan dalam mesin pencari sebagai ukuran atau penilaian relevansi antara dokumen dan kueri pengguna.

PLDA

Di PAI, Anda dapat mengatur parameter topik untuk komponen PLDA guna mengabstraksi topik berbeda dari setiap dokumen.

Word2Vec

Komponen algoritma Word2Vec menggunakan jaringan saraf untuk memetakan kata ke vektor dalam ruang berdimensi-K melalui pelatihan. Mendukung operasi pada vektor yang merepresentasikan kata, sesuai dengan semantiknya. Inputnya adalah kolom kata atau kosakata, dan outputnya adalah tabel vektor kata dan kosakata.

Network analysis

Tree depth

Menghasilkan kedalaman dan ID pohon setiap node.

k-Core

Menemukan struktur subgraf yang saling terhubung erat dalam graf yang memenuhi coreness tertentu. Angka core maksimum suatu node disebut angka core graf tersebut.

Single-Source Shortest Path

Menggunakan algoritma Dijkstra. Diberikan titik awal, menghasilkan jalur terpendek dari titik tersebut ke semua node lainnya.

PageRank

Berasal dari peringkat pencarian web. Menggunakan struktur tautan halaman web untuk menghitung peringkat setiap halaman.

Label propagation clustering

Label Propagation Algorithm (LPA) adalah metode pembelajaran semi-terawasi berbasis graf. Ide dasarnya adalah label (komunitas) suatu node bergantung pada informasi label node tetangganya. Tingkat pengaruh ditentukan oleh kemiripan node, dan stabilitas dicapai melalui propagasi iteratif.

Label propagation classification

Algoritma klasifikasi semi-terawasi yang menggunakan informasi label node berlabel untuk memprediksi label node yang tidak berlabel.

Modularity

Metrik untuk mengevaluasi struktur jaringan komunitas. Menilai ketatnya komunitas dalam struktur jaringan. Nilai di atas 0,3 biasanya menunjukkan struktur komunitas yang jelas.

Maximal Connected Subgraph

Dalam graf tak berarah G, jika jalur menghubungkan vertex A ke vertex B, maka A dan B terhubung. Jika graf G berisi beberapa subgraf di mana semua vertex dalam setiap subgraf saling terhubung, tetapi tidak ada vertex antar subgraf yang saling terhubung, subgraf-subgraf tersebut disebut subgraf terhubung maksimal.

Vertex clustering coefficient

Dalam graf tak berarah G, komponen ini menghitung kerapatan di sekitar setiap node. Kerapatan jaringan bintang adalah 0, dan kerapatan jaringan yang terhubung penuh adalah 1.

Edge clustering coefficient

Dalam graf tak berarah G, algoritma ini menghitung kerapatan di sekitar setiap edge.

Count Triangles

Dalam graf tak berarah G, komponen ini menghasilkan semua segitiga.

Finance

Data Transformation Module

Gunakan komponen ini untuk melakukan normalisasi, diskretisasi, pengindeksan, atau transformasi Weight of Evidence (WOE) pada data.

Scorecard training

Alat pemodelan umum dalam penilaian risiko kredit. Mendiskretisasi variabel asli dengan mengelompokkan input, lalu menggunakan model linear, seperti regresi logistik atau regresi linier, untuk pelatihan model. Termasuk fitur seperti pemilihan fitur dan transformasi skor.

Scorecard Prediction

Memberi skor data mentah berdasarkan hasil model yang dihasilkan oleh komponen Scorecard Training.

Binning

Menjalankan diskretisasi fitur dengan membagi data kontinu menjadi beberapa interval diskrit. Komponen Binning mendukung binning frekuensi sama, binning lebar sama, dan binning otomatis.

Population Stability Index (PSI)

Indikator penting untuk mengukur pergeseran yang disebabkan oleh perubahan sampel. Umum digunakan untuk mengukur stabilitas sampel.

Visual algorithms

Image Classification Training (torch)

Jika skenario bisnis Anda melibatkan klasifikasi gambar, gunakan komponen Image Classification Training (torch) untuk membangun model klasifikasi gambar guna inferensi model.

Video Classification Training

Gunakan komponen algoritma Video Classification Training untuk melatih model dan mendapatkan model klasifikasi video guna inferensi.

Image Detection Training (easycv)

Membangun model deteksi objek untuk mendeteksi dan membingkai entitas berisiko tinggi dalam gambar.

Image Self-Supervised Training

Langsung melatih gambar mentah tanpa label untuk mendapatkan model ekstraksi fitur gambar.

Image metric learning training (raw)

Membangun model pembelajaran metrik untuk inferensi model.

Image Keypoint Training

Jika skenario bisnis Anda melibatkan deteksi keypoint terkait manusia, gunakan komponen Image Keypoint Training untuk membangun model keypoint guna inferensi model.

Tools

Offline Model (OfflineModel) related components

Struktur data yang disimpan di MaxCompute. Model yang dihasilkan oleh algoritma machine learning tradisional berbasis framework PAICommand disimpan dalam format model offline di proyek MaxCompute yang sesuai. Gunakan komponen terkait Offline Model untuk mendapatkan model offline guna prediksi offline.

General-Purpose Model Export

Gunakan komponen General-Purpose Model Export untuk mengekspor model yang dilatih di MaxCompute ke path OSS tertentu.

Custom scripts

PyAlink Script

Memanggil algoritma Alink untuk klasifikasi, regresi, dan rekomendasi. Skrip PyAlink juga terintegrasi mulus dengan komponen algoritma Designer lainnya untuk membangun dan memvalidasi jejak bisnis.

Time Window SQL Script

Menambahkan fitur eksekusi loop multi-tanggal ke komponen SQL Script standar. Digunakan untuk eksekusi paralel tugas SQL harian dalam periode waktu tertentu.

Beta components

Lasso Regression Training

Algoritma estimasi kompresi.

Lasso regression prediction

Mendukung format data jarang dan padat. Gunakan komponen ini untuk memprediksi variabel numerik, seperti jumlah pinjaman dan suhu.

Ridge regression prediction

Memprediksi variabel numerik, termasuk harga rumah, volume penjualan, dan kelembapan.

Ridge regression training

Metode regularisasi paling umum untuk analisis regresi masalah ill-posed.