すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:デザイナーコンポーネントの概要

最終更新日:Sep 15, 2026

推奨アルゴリズムコンポーネント

推奨アルゴリズムコンポーネントには、データ読み取り、SQL スクリプト、Python スクリプトなどの一般的な汎用アルゴリズムが含まれます。このカテゴリには、大規模言語モデル (LLM) や大規模視覚モデル (LVM) などのデータ処理、トレーニング、推論用のアルゴリズムも含まれます。異種リソースとカスタム環境をサポートし、柔軟性を向上させるため、DLC ベースのアルゴリズムコンポーネントの使用を推奨します。

コンポーネントタイプ

コンポーネント

説明

カスタムコンポーネント

カスタムコンポーネント

AI 資産管理にカスタムコンポーネントを作成します。Designer で、公式コンポーネントと合わせてカスタムコンポーネントをモデルトレーニングに使用します。

ソース/ターゲット

OSS データの読み取り

Object Storage Service (OSS) バケット内の指定されたパスからファイルまたはフォルダーを読み取ります。

CSV ファイルの読み取り

OSS、HTTP、または HDFS から CSV ファイルを読み取ります。

テーブルの読み取り

現在のプロジェクトの MaxCompute テーブルからデータを読み取ります。

テーブルへの書き込み

アップストリームデータを MaxCompute テーブルに書き込みます。

カスタムスクリプト

SQL スクリプト

MaxCompute でカスタム SQL ステートメントを実行します。

Python スクリプト

依存関係パッケージをインストールし、カスタム Python 関数を実行します。

ツール

データセットの登録

データセットを AI 資産管理に登録します。

モデルの登録

モデルを AI 資産管理に登録します。

EAS サービスの更新 (ベータ)

eascmd を呼び出して、指定された Elastic Algorithm Service (EAS) サービスを更新します。サービスは running 状態である必要があります。更新のたびに、新しいサービスバージョンが作成されます。

LLM データ処理

データ変換

MaxCompute テーブルの OSS へのエクスポート

MaxCompute テーブルを OSS にエクスポートします。

OSS データの MaxCompute テーブルへのインポート

OSS から MaxCompute テーブルにデータをインポートします。

LLM データ処理 (DLC)

LLM-MD5 重複排除 (DLC)

テキストコンテンツの MD5 ハッシュを計算し、重複するエントリを削除します。

LLM-テキスト正規化 (DLC)

テキストに対して Unicode 正規化を実行し、繁体字中国語の文字を簡体字中国語に変換します。

LLM-特殊コンテンツ削除 (DLC)

URL を削除し、HTML フォーマットを取り除いてプレーンテキストを抽出します。

LLM-特殊文字率フィルター (DLC)

特殊文字とテキスト全長との比率に基づいてサンプルをフィルター処理します。

LLM-著作権情報削除 (DLC)

コードファイルのヘッダーにあるコメントなど、テキストから著作権情報を削除します。

LLM-カウントフィルター (DLC)

英数字とテキスト全長との比率に基づいてサンプルをフィルター処理します。

LLM-長さフィルター (DLC)

テキストの全長、平均行長、最大行長に基づいてサンプルをフィルター処理します。

LLM-テキスト品質スコアリングと言語識別 - FastText (DLC)

テキストの言語を識別し、品質スコアを計算し、指定された言語とスコア範囲に基づいてサンプルをフィルター処理します。

LLM-機密単語フィルター (DLC)

指定された機密単語辞書に含まれる単語を含むサンプルをフィルター処理します。

LLM-機密情報のマスキング (DLC)

メールアドレス、電話番号、ID 番号などの機密情報をマスキングします。

LLM-ドキュメント類似度による重複排除 (DLC)

SimHash 類似度スコアを計算して、ドキュメントの重複を排除します。

LLM-N-Gram 繰り返し率フィルター (DLC)

文字レベルまたは単語レベルの N-gram 繰り返し率に基づいてサンプルをフィルター処理します。

LLM-LaTeX マクロ定義の展開 (DLC)

TEX ドキュメント形式のデータに使用します。パラメーターのないすべてのマクロをインライン展開します。マクロが文字と数字で構成され、パラメーターがない場合、マクロ名は値に置き換えられます。

LLM-LaTeX 参考文献の削除 (DLC)

LaTeX ドキュメントから参考文献セクションを削除します。

LLM-LaTeX コメント行の削除 (DLC)

LaTeX ソーステキストからコメント行とインラインコメントを削除します。

LLM-LaTeX ドキュメントヘッダーの削除 (DLC)

TEX ドキュメント形式のデータに使用します。<section-type>[optional-args]{name} という章の形式に一致する最初の文字列を検索し、その文字列より前のすべてのコンテンツを削除し、最初に一致した章以降のすべてのコンテンツ (章のタイトルを含む) を保持します。

LLM データ処理 (MaxCompute)

LLM-MD5 重複排除 (MaxCompute)

テキストコンテンツの MD5 ハッシュを計算し、重複するエントリを削除します。

LLM-テキスト正規化 (MaxCompute)

Unicode 正規化を実行し、繁体字中国語の文字を簡体字中国語に変換します。

LLM-特殊コンテンツ削除 (MaxCompute)

ナビゲーション、著者情報、URL、HTML フォーマットなどのコンテンツを削除します。

LLM-特殊文字率フィルター (MaxCompute)

特殊文字とテキスト全長との比率に基づいてサンプルをフィルター処理します。

LLM-著作権情報削除 (MaxCompute)

コードファイルのヘッダーにあるコメントなど、テキストから著作権情報を削除します。

LLM-カウントフィルター (MaxCompute)

文字、数字、区切り文字の数に基づいてサンプルをフィルター処理します。

LLM-長さフィルター (MaxCompute)

テキストの全長、平均行長、最大行長に基づいてサンプルをフィルター処理します。

LLM-テキスト品質スコアリングと言語識別 (MaxCompute)

テキストの言語を識別し、品質スコアを計算し、指定された言語とスコア範囲に基づいてサンプルをフィルター処理します。

LLM-機密単語フィルター (MaxCompute)

指定された機密単語辞書に含まれる単語を含むサンプルをフィルター処理します。

LLM-機密情報のマスキング (MaxCompute)

メールアドレス、電話番号、ID 番号などの機密情報をマスキングします。

LLM-N-Gram 繰り返し率フィルター (MaxCompute)

文字レベルまたは単語レベルの N-gram 繰り返し率に基づいてサンプルをフィルター処理します。

LLM-LaTeX マクロ定義の展開 (MaxCompute)

TEX 形式のデータでパラメーターなしのマクロ定義をインライン化します。

LLM-LaTeX 参考文献の削除 (MaxCompute)

LaTeX ドキュメントから参考文献セクションを削除します。

LLM-LaTeX コメント行の削除 (MaxCompute)

LaTeX ソーステキストからコメント行とインラインコメントを削除します。

LLM-LaTeX ドキュメントヘッダーの削除 (MaxCompute)

LaTeX ドキュメントの最初のセクション宣言より前のすべてのコンテンツを削除します。

LVM データ処理 (DLC)

動画前処理オペレーター

LVM-テキストエリアフィルター (DLC)

フレーム内に存在するテキストの量に基づいて動画データをフィルター処理します。

LVM-モーションフィルター (DLC)

指定されたモーション速度の範囲に基づいて動画データをフィルター処理します。

LVM-美的フィルター (DLC)

指定された美的品質スコアを下回る動画データをフィルター処理します。

LVM-アスペクト比フィルター (DLC)

指定されたアスペクト比の範囲に基づいて動画データをフィルター処理します。

LVM-デュレーションフィルター (DLC)

指定されたデュレーションの範囲に基づいて動画データをフィルター処理します。

LVM-動画-テキスト類似度フィルター (DLC)

動画と関連テキスト間のセマンティック類似度スコアに基づいて動画データをフィルター処理します。

LVM-コンプライアンスフィルター (DLC)

NSFW (Not Safe For Work) スコアに基づいて動画データをフィルター処理します。

LVM-解像度フィルター (DLC)

指定された解像度の範囲に基づいて動画データをフィルター処理します。

LVM-ウォーターマークフィルター (DLC)

ウォーターマークを含む動画データをフィルター処理します。

LVM-タグフィルター (DLC)

指定されたタグのセットと一致しない動画データをフィルター処理します。

LVM-タグ生成 (DLC)

動画フレームの説明的なタグを生成します。

LVM-フレームテキスト生成 (DLC)

動画フレームの説明テキストを生成します。

LVM-動画テキスト生成 (DLC)

動画全体の説明テキストを生成します。

画像前処理オペレーター

LVM-画像美的フィルター (DLC)

指定された美的品質スコアを下回る画像データをフィルター処理します。

LVM-画像アスペクト比フィルター (DLC)

指定されたアスペクト比の範囲に基づいて画像データをフィルター処理します。

LVM-画像顔比率フィルター (DLC)

顔領域と画像総領域の比率に基づいて画像データをフィルター処理します。

LVM-画像コンプライアンスフィルター (DLC)

NSFW (Not Safe For Work) スコアに基づいて画像データをフィルター処理します。

LVM-画像解像度フィルター (DLC)

指定された解像度の範囲に基づいて画像データをフィルター処理します。

LVM-画像サイズフィルター (DLC)

指定されたファイルサイズの範囲に基づいて画像データをフィルター処理します。

LVM-画像-テキストマッチングフィルター (DLC)

マッチングスコアに基づいて画像とテキストのペアをフィルター処理します。

LVM-画像-テキスト類似度フィルター (DLC)

セマンティック類似度スコアに基づいて画像とテキストのペアをフィルター処理します。

LVM-画像ウォーターマークフィルター (DLC)

ウォーターマークを含む画像データをフィルター処理します。

LVM-画像キャプション生成 (DLC)

画像の自然言語による説明を生成します。

LLM トレーニングと推論

BERT モデルのオフライン推論

事前学習済みの BERT 分類モデルを使用してオフライン推論を実行し、入力テーブルのテキストを分類します。

従来のアルゴリズムコンポーネント

重要

これらのレガシーコンポーネントは、現在、アクティブにメンテナンスされていません。安定性およびサービスレベルアグリーメント (SLA) は保証されません。本番環境では、安定性を確保するために、レガシーコンポーネントを推奨のアルゴリズムコンポーネントに置き換えてください。

コンポーネントタイプ

コンポーネント

説明

データ前処理

ランダムサンプリング

指定された比率または数に基づいて、入力データからランダムな独立サンプリングを実行します。

重み付きサンプリング

重み付き選択法を使用して、入力データからサンプルを生成します。

フィルターとマップ

SQL 式に基づいてデータ行をフィルター処理し、出力列の名前を変更します。

層化サンプリング

指定された列に基づいてデータをグループに分割し、各グループ内でランダムサンプリングを実行します。

JOIN

SQL の JOIN ステートメントと同様に、結合キーに基づいて 2 つのテーブルを結合します。

列の結合

2 つのテーブルの列を結合します。両方のテーブルの行数は同じである必要があります。

行のマージ (UNION)

2 つのテーブルの行をマージします。両方のテーブルで、選択した列の数とデータ型が同じである必要があります。

型変換

指定された列のデータ型を String、Double、または Integer に変換します。変換に失敗した場合は、その値を欠損値として扱います。

ID 列の追加

テーブルの最初の列として、連続した数値 ID 列を追加します。

分割

データセットをランダムに 2 つのサブセットに分割します。通常、トレーニングセットとテストセットを作成するために使用されます。

欠損値の補完

平均、中央値、最頻値、またはカスタム値など、選択した方法を使用して指定された列の欠損値を補完します。

正規化

数値特徴量を [0, 1] などの共通の範囲に再スケーリングします。密形式と疎形式の両方のデータをサポートします。

標準化

特徴量を平均 0、標準偏差 1 になるように再スケーリングします (z スコア正規化)。

KV からテーブルへ

テーブルを疎なキー-値 (KV) 形式から密なテーブル形式に変換します。

テーブルから KV へ

密なテーブルを疎なキー-値 (KV) 形式に変換します。

特徴量エンジニアリング

特徴量の重要度によるフィルタリング

他のコンポーネントによって生成された重要度スコアに基づいて、上位 N 個の特徴量をフィルター処理します。

主成分分析

主成分分析 (PCA) を実行し、特徴量を線形的に無相関な主成分のセットに変換することで、データセットの次元を削減します。

特徴量スケーリング

最小-最大、対数、または z スコアのスケーリング変換を数値特徴量に適用します。

特徴量の離散化

連続的な数値特徴量を離散的なカテゴリ特徴量 (ビン) に変換します。

特徴異常の平滑化

異常な特徴量の値を指定された範囲にクランプします。密形式と疎形式の両方のデータをサポートします。

特異値分解

行列に対して特異値分解 (SVD) を実行します。

異常検知

連続特徴量とカテゴリ特徴量の両方を含むデータ内の外れ値を検出します。

線形モデルの特徴量重要度

線形回帰またはロジスティック回帰モデルを使用して、特徴量の重要度スコアを計算します。

離散特徴分析

離散特徴量の統計的分布を分析します。

ランダムフォレスト特徴量重要度評価

トレーニング済みのランダムフォレストモデルを使用して、特徴量の重要度スコアを計算します。

フィルター法による特徴量選択

カイ二乗、ジニ係数、情報利得などのフィルター法を使用して、特徴量のサブセットを選択します。

特徴量エンコーディング

勾配ブースティング決定木 (GBDT) モデルを使用して、非線形特徴量を線形特徴量にエンコードします。

ワンホットエンコーディング

カテゴリ特徴量をバイナリベクトル表現に変換します。出力は疎なキー-値 (KV) 形式です。

統計分析

データビュー

選択された列のデータ分布と統計の視覚的な概要を提供します。

共分散

2 つの確率変数間の共分散を計算して、それらがどのように一緒に変化するかを測定します。

経験的確率密度プロット

経験分布またはカーネル密度推定のいずれかを使用して、確率密度プロットを生成します。

テーブル全体の統計

テーブル内のすべての列または列のサブセットの記述統計を計算します。

カイ二乗適合度検定

カテゴリ変数に使用されます。単一の多項カテゴリ変数のカテゴリ全体で、観測された度数と理論上の度数が一致するかどうかを検定します。帰無仮説は、観測された度数と理論上の度数に差がないというものです。

箱ひげ図

データセットのばらつきを表示する統計グラフです。主に元データの分布特性の把握や、複数データセットの分布比較に使用されます。

散布図

回帰分析におけるデカルト座標系上のデータポイントの分布図です。

相関行列

相関係数アルゴリズムは、行列内の各列間の相関係数を計算します。値の範囲は [-1, 1] です。計算時のカウントは、両方の列で空でない要素の数に基づきます。このカウントは、列のペアごとに異なる場合があります。

2 標本 t 検定

統計的原則に基づき、2 つのサンプルの平均間に有意な差があるかどうかを検定します。

1 標本 t 検定

変数の母集団平均と指定値の間に有意な差があるかどうかを検定します。検定対象のサンプルは正規分布に従う必要があります。

正規性検定

観測値を使用して、母集団が正規分布に従うかどうかを判断します。統計的意思決定において重要な、適合度検定の一種です。

ローレンツ曲線

国または地域の所得分布を視覚的に表示します。

パーセンタイル

テーブル列のデータのパーセンタイルを計算するために使用される統計用語です。

ピアソン係数

2 つの変数間の線形相関の程度を反映する線形相関係数です。

ヒストグラム

ヒストグラムは、度数分布図とも呼ばれ、データ分布を可視化する統計グラフの一種です。一連の垂直な棒または線分の高さで度数を表します。

機械学習

予測

入力はトレーニング済みモデルと予測データで、出力は予測結果です。

XGBoost トレーニング

XGBoost アルゴリズムを使用して、入力データから分類または回帰モデルをトレーニングします。XGBoost は、勾配ブースティングを拡張・最適化したアルゴリズムであり、その高い性能と効率性から広く利用されています。

XGBoost 予測

トレーニング済みの XGBoost モデルと予測対象のデータセットを使用して、分類または回帰の予測結果を生成します。

線形サポートベクターマシン

統計的学習理論に基づく機械学習手法です。構造的リスクを最小化することで学習器の汎化能力を向上させ、経験的リスクと信頼範囲を最小化します。

二項分類ロジスティック回帰

二項分類アルゴリズムで、密形式と疎形式の両方のデータをサポートします。

GBDT による二項分類

複数の決定木を逐次的に学習させるアンサンブル手法です。前の木の誤差を次の木が修正するように学習を重ねることで、高精度な二項分類モデルを構築します。

PS-SMART による二項分類

Parameter Server (PS) は、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。Scalable Multiple Additive Regression Tree (SMART) は、Gradient Boosting Decision Tree (GBDT) に基づいて PS 上に実装された反復アルゴリズムです。

PS-SMARTによる多クラス分類

Parameter Server (PS) は、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。Scalable Multiple Additive Regression Tree (SMART) は、Gradient Boosting Decision Tree (GBDT) に基づいて PS 上に実装された反復アルゴリズムです。

k 近傍法

予測対象テーブルの各行に対し、トレーニングテーブルから最も距離が近い K 個のレコードを選択します。これら K 個のレコードの中で最頻出のクラスが、その行のクラスとして割り当てられます。

多クラス分類ロジスティック回帰

多クラス分類のためのロジスティック回帰アルゴリズムです。PAI が提供するモデルは、密形式と疎形式の両方のデータをサポートします。

ランダムフォレスト

複数の決定木を含む分類器です。その分類結果は、個々の木が出力するクラスの最頻値によって決定されます。

ナイーブベイズ

独立性の仮定を持つベイズの定理に基づく確率的分類アルゴリズムです。

k 平均法クラスタリング

まず、ランダムに K 個のオブジェクトを初期クラスタ中心として選択します。次に、残りのオブジェクトと各クラスタ中心との距離を計算し、それらを最も近いクラスタに割り当て、各クラスタのクラスタ中心を再計算します。

DBSCAN

DBSCAN コンポーネントを使用して、クラスタリングモデルを構築します。

混合ガウスモデルトレーニング

GMM トレーニングコンポーネントを使用して、モデル分類を実装します。

DBSCAN 予測

DBSCAN 予測コンポーネントを使用して、DBSCAN トレーニングモデルに基づいて新しいデータポイントが属するクラスターを予測します。

GMM 予測

GMM 予測コンポーネントを使用して、トレーニング済みの混合ガウスモデルに基づいてクラスタリング予測を実行します。

GBDT 回帰

線形および非線形の回帰シナリオに適した反復決定木アルゴリズムです。

線形回帰

従属変数と複数の独立変数との間の線形関係を分析するモデルです。

PS-SMART 回帰

このコンポーネントは、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。SMART は、GBDT に基づいて PS 上に実装された反復アルゴリズムです。

PS 線形回帰

従属変数と複数の独立変数との間の線形関係を分析するモデルです。Parameter Server (PS) は、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。

二項分類評価

AUC、KS、F1 スコアなどの評価指標を計算し、KS 曲線、PR 曲線、ROC 曲線、LIFT チャート、Gain チャートを出力します。

回帰モデル評価

予測結果と実測値に基づいて回帰モデルの品質を評価し、評価指標と残差ヒストグラムを出力します。

クラスタリングモデル評価

元データとクラスタリング結果に基づいてクラスタリングモデルの品質を評価し、評価指標を出力します。

混同行列

教師あり学習に適しており、教師なし学習におけるマッチング行列に対応します。

多クラス分類評価

分類モデルの予測結果と実測値に基づいて多クラス分類アルゴリズムモデルの品質を評価し、Accuracy、Kappa、F1 スコアなどの評価指標を出力します。

ディープラーニング

ディープラーニングフレームワークとアクティベーション手順

PAI がサポートするディープラーニングフレームワークとハードウェアリソースを使用して、ディープラーニングアルゴリズムを実行します。

時系列

x13_arima

オープンソースの X-13ARIMA-SEATS をベースに、季節調整のための Arima アルゴリズムをカプセル化したものです。

x13_auto_arima

自動 ARIMA モデル選択プログラムが含まれており、これは主に TRMO (1996) で実装された Gomez and Maravall (1998) のプログラムとその後の改訂に基づいています。

Prophet

MTable データの各行に対して Prophet 時系列予測を実行し、次の期間の予測結果を提供します。

MTable アセンブラー

グルーピング列に基づいてテーブルを MTable に集約します。

MTable エキスパンダー

MTable をテーブルに展開します。

推薦手法

FM アルゴリズム

因子分解マシン (FM) アルゴリズムは、特徴量間の相互作用を考慮します。これは、eコマース、広告、ライブストリーミングなどの推薦シナリオに適した非線形モデルです。

ALS 行列分解

交互最小二乗 (ALS) アルゴリズムは、疎行列に対してモデル分解を実行し、欠損アイテムの値を評価して基本的なトレーニングモデルを取得します。

Swing トレーニング

アイテムリコールアルゴリズムです。Swing トレーニングコンポーネントを使用して、User-Item-User の原則に基づいてアイテムの類似性を測定します。

Swing 予測

Swing のためのバッチ処理予測コンポーネントです。このコンポーネントを使用して、Swing トレーニングモデルと予測データに基づいてオフライン予測を実行します。

協調フィルタリング (etrec)

etrec は、アイテムベースの協調フィルタリングアルゴリズムです。入力は 2 つの列で構成され、出力は最も類似度が高い上位 N 個のアイテムです。

ベクトル検索評価

リコールのヒット率を計算します。ヒット率は結果の品質評価に使用されます。ヒット率が高いほど、トレーニングで生成されたベクトルがより正確なリコール結果を達成したことを示します。

異常検知

局所外れ値因子 (LOF) による異常検知

局所外れ値因子 (LOF) の値に基づいて、サンプルが異常であるかどうかを判断します。

iForest 異常検知

サブサンプリングにより計算の複雑さを軽減します。データ内の異常を特定でき、異常検知において高い効果を発揮します。

One-Class SVM 異常検知

これは従来の SVM とは異なる、教師なし学習アルゴリズムです。境界を学習することで異常を予測します。

自然言語処理

テキスト要約予測

冗長な長文から重要な情報を抽出、要約します。ニュースの見出し生成もテキスト要約の一例です。このコンポーネントは、指定した事前学習済みモデルを呼び出してニュース記事を要約し、見出しを生成します。

機械読解予測

生成された機械読解トレーニングモデルを使用してオフライン予測を実行します。

テキスト要約トレーニング

冗長な長文から重要な情報を抽出、要約します。ニュースの見出し生成もテキスト要約の一例です。このコンポーネントは、ニュース記事の要点や重要情報を要約し、見出しを生成するモデルをトレーニングします。

機械読解トレーニング

与えられたドキュメントに基づいて質問を迅速に理解し、回答できる機械読解モデルをトレーニングします。

単語分割

AliWS (Alibaba Word Segmenter) 字句解析システムに基づき、指定された列のテキストを単語に分割 (トークン化) します。分割された単語はスペースで区切られます。

3 タプルから KV へ

3 タプルテーブル (row, col, value) をキー-値 (KV) テーブル (row, [col_id:value]) に変換します。

文字列類似度

機械学習における基本的な操作で、主に情報検索、自然言語処理、バイオインフォマティクスで使用されます。

文字列類似度-Top N

文字列の類似度を計算し、類似度が最も高い上位 N 件のデータを抽出します。

ストップワードフィルター

テキスト分析の前処理手法の一つで、トークン化された結果からノイズとなる単語 (「the」、「is」、「a」など) を除去するために使用されます。

N-gram カウント

言語モデルをトレーニングするステップの一つです。単語ベースで n-gram を生成し、コーパス全体における各 n-gram の出現回数をカウントします。

テキスト要約

ドキュメントの主旨を包括的かつ正確に反映した、簡潔で一貫性のある短いテキストのことです。自動要約では、コンピュータが元のドキュメントから要約内容を自動的に抽出します。

キーワード抽出

自然言語処理における重要な技術の一つです。テキストから、ドキュメントの意味と関連性が非常に高い単語を抽出します。

文分割

句読点に基づいてテキストを文に分割します。主にテキスト要約の前処理として使用され、段落を 1 文 1 行の形式に変換します。

意味ベクトル距離

Word2Vec によって生成された単語埋め込みなどの意味ベクトルに基づき、最も距離の近いベクトル群を探すことで、与えられた単語 (または文) の拡張単語 (または文) を計算します。ユースケースの 1 つとして、入力単語と Word2Vec で生成された単語埋め込みを基に、最も類似した単語のリストを返すことが挙げられます。

Doc2Vec

Doc2Vec アルゴリズムコンポーネントを使用して、ドキュメントをベクトルにマッピングします。入力は語彙であり、出力はドキュメントベクトルテーブル、単語ベクトルテーブル、または語彙です。

条件付き確率場

条件付き確率場 (CRF) は、入力確率変数のセットが与えられた場合の出力確率変数のセットの確率分布モデルです。出力確率変数がマルコフ確率場を形成すると仮定する点が特徴です。

文書類似度

文字列の類似度をベースに、単語単位でドキュメントまたは文のペア間の類似度を計算します。

PMI

複数のドキュメントにおける全単語の共起をカウントし、各ペア間の自己相互情報量 (PMI) を計算します。

条件付き確率場予測

linearCRF オンライン予測モデルに基づくアルゴリズムコンポーネントで、主に系列ラベリング問題に使用されます。

単語分割 (モデル生成)

AliWS (Alibaba Word Segmenter) 字句解析システムに基づき、パラメーターとカスタム辞書を使用してトークン化モデルを生成します。

単語カウント

文字列 (手動入力またはファイルから読み込み) を入力とし、プログラムで単語の総数と各単語の出現頻度をカウントします。

TF-IDF

情報検索やテキストマイニングで一般的に使用される重み付け手法です。検索エンジンにおいて、ドキュメントとユーザークエリとの関連度を評価する指標としてよく使用されます。

PLDA

PAI では、PLDA コンポーネントのトピックパラメーターを設定することで、各ドキュメントから異なるトピックを抽出できます。

Word2Vec

Word2Vec は、ニューラルネットワークを用いて、トレーニングを通じて単語を K 次元空間のベクトルにマッピングするアルゴリズムです。単語を表すベクトルに対する操作をサポートしており、その操作は単語の意味に対応します。入力は単語列または語彙、出力は単語ベクトルテーブルと語彙です。

ネットワーク分析

ツリーの深さ

各ノードの深さとツリー ID を出力します。

k-core

指定されたコアネスを満たす、グラフ内の密接に接続された部分グラフ構造を検索します。ノードの最大コア数は、グラフのコア数と呼ばれます。

単一始点最短経路

ダイクストラ法を使用します。開始点が与えられると、その点から他のすべてのノードへの最短経路を出力します。

PageRank

Web 検索ランキングに由来します。Web ページのリンク構造を使用して、各ページのランクを計算します。

ラベル伝播クラスタリング

ラベル伝播アルゴリズム (LPA) は、グラフベースの半教師あり学習手法です。基本的な考え方は、ノードのラベル (コミュニティ) が隣接ノードのラベル情報に依存するというものです。影響の度合いはノードの類似性によって決定され、反復的な伝播によって安定性が達成されます。

ラベル伝播分類

ラベル付けされたノードのラベル情報を使用して、ラベル付けされていないノードのラベルを予測する半教師あり分類アルゴリズムです。

モジュール性

コミュニティネットワーク構造を評価するための指標です。ネットワーク構造内のコミュニティの緊密さを評価します。通常、0.3 を超える値は、明確なコミュニティ構造を示します。

最大連結部分グラフ

無向グラフ G において、頂点 A と頂点 B を結ぶパスが存在する場合、A と B は連結していると見なされます。グラフ G に、各部分グラフ内のすべての頂点は互いに連結しているものの、異なる部分グラフの頂点間は連結していない、という性質を持つ部分グラフが複数含まれる場合、それらを最大連結部分グラフと呼びます。

頂点クラスタリング係数

無向グラフ G において、このコンポーネントは各ノードの周りの密度を計算します。星型ネットワークの密度は 0 で、完全連結ネットワークの密度は 1 です。

辺クラスタリング係数

無向グラフ G において、このアルゴリズムは各辺の周りの密度を計算します。

三角形カウント

無向グラフ G において、このコンポーネントはすべての三角形を出力します。

金融

データ変換モジュール

このコンポーネントを使用して、データに対して正規化、離散化、インデックス化、または Weight of Evidence (WOE) 変換を実行します。

スコアカードトレーニング

信用リスク評価で一般的に使用されるモデリングツールです。入力変数をビニングによって離散化した後、ロジスティック回帰や線形回帰などの線形モデルでトレーニングを行います。特徴量選択やスコア変換などの機能も含まれます。

スコアカード予測

スコアカードトレーニングコンポーネントによって生成されたモデル結果に基づいて、元データをスコアリングします。

ビニング

連続データを複数の離散的な間隔に分割することで、特徴量の離散化を実行します。ビニングコンポーネントは、等頻度ビニング、等幅ビニング、および自動ビニングをサポートしています。

ポピュレーション安定性インデックス (PSI)

サンプル変動によって引き起こされるシフトを測定するための重要な指標です。一般的に、サンプルの安定性を測定するために使用されます。

画像アルゴリズム

画像分類トレーニング (torch)

ビジネスシナリオで画像分類が必要な場合、このコンポーネントを使用して推論用の画像分類モデルを構築します。

動画分類トレーニング

このコンポーネントを使用してモデルをトレーニングし、推論用の動画分類モデルを取得します。

画像検出トレーニング (easycv)

物体検出モデルを構築し、画像内の高リスクエンティティを検出して矩形で囲みます。

自己教師あり画像トレーニング

ラベル付けされていない元画像を直接トレーニングし、画像特徴抽出用のモデルを取得します。

画像距離学習トレーニング (raw)

推論用の距離学習モデルを構築します。

画像キーポイントトレーニング

人物関連のキーポイント検出を行うビジネスシナリオの場合、このコンポーネントを使用して推論用のキーポイントモデルを構築します。

ツール

オフラインモデル関連コンポーネント

MaxCompute に保存されるデータ構造の一種です。PAICommand フレームワークに基づく従来の機械学習アルゴリズムで生成されたモデルは、対応する MaxCompute プロジェクトにオフラインモデル形式で保存されます。このコンポーネントは、オフライン予測のためにオフラインモデルを取得する際に使用します。

汎用モデルのエクスポート

汎用モデルのエクスポートコンポーネントを使用して、MaxCompute でトレーニングされたモデルを指定された OSS パスにエクスポートします。

カスタムスクリプト

PyAlink スクリプト

分類、回帰、推薦のための Alink アルゴリズムを呼び出します。PyAlink スクリプトは、他の Designer アルゴリズムコンポーネントとシームレスに連携し、ビジネスフローの構築と検証を可能にします。

タイムウィンドウ SQL スクリプト

標準の SQL スクリプトコンポーネントに、複数日にわたるループ実行機能を追加します。特定の期間内の日次 SQL タスクを並列実行するために使用されます。

ベータ版コンポーネント

ラッソ回帰トレーニング

圧縮推定アルゴリズムです。

ラッソ回帰予測

密形式と疎形式の両方のデータをサポートします。このコンポーネントは、ローン金額や気温などの数値を予測するために使用します。

リッジ回帰予測

住宅価格、販売量、湿度などの数値を予測します。

リッジ回帰トレーニング

悪条件問題の回帰分析で最も一般的に使用される正則化手法です。