推奨アルゴリズムコンポーネント
推奨アルゴリズムコンポーネントには、データ読み取り、SQL スクリプト、Python スクリプトなどの一般的な汎用アルゴリズムが含まれます。このカテゴリには、大規模言語モデル (LLM) や大規模視覚モデル (LVM) などのデータ処理、トレーニング、推論用のアルゴリズムも含まれます。異種リソースとカスタム環境をサポートし、柔軟性を向上させるため、DLC ベースのアルゴリズムコンポーネントの使用を推奨します。
|
コンポーネントタイプ |
コンポーネント |
説明 |
||
|
カスタムコンポーネント |
AI 資産管理にカスタムコンポーネントを作成します。Designer で、公式コンポーネントと合わせてカスタムコンポーネントをモデルトレーニングに使用します。 |
|||
|
ソース/ターゲット |
Object Storage Service (OSS) バケット内の指定されたパスからファイルまたはフォルダーを読み取ります。 |
|||
|
OSS、HTTP、または HDFS から CSV ファイルを読み取ります。 |
||||
|
現在のプロジェクトの MaxCompute テーブルからデータを読み取ります。 |
||||
|
アップストリームデータを MaxCompute テーブルに書き込みます。 |
||||
|
カスタムスクリプト |
MaxCompute でカスタム SQL ステートメントを実行します。 |
|||
|
依存関係パッケージをインストールし、カスタム Python 関数を実行します。 |
||||
|
ツール |
データセットの登録 |
データセットを AI 資産管理に登録します。 |
||
|
モデルの登録 |
モデルを AI 資産管理に登録します。 |
|||
|
EAS サービスの更新 (ベータ) |
|
|||
|
LLM データ処理 |
データ変換 |
MaxCompute テーブルを OSS にエクスポートします。 |
||
|
OSS から MaxCompute テーブルにデータをインポートします。 |
||||
|
LLM データ処理 (DLC) |
テキストコンテンツの MD5 ハッシュを計算し、重複するエントリを削除します。 |
|||
|
テキストに対して Unicode 正規化を実行し、繁体字中国語の文字を簡体字中国語に変換します。 |
||||
|
URL を削除し、HTML フォーマットを取り除いてプレーンテキストを抽出します。 |
||||
|
特殊文字とテキスト全長との比率に基づいてサンプルをフィルター処理します。 |
||||
|
コードファイルのヘッダーにあるコメントなど、テキストから著作権情報を削除します。 |
||||
|
英数字とテキスト全長との比率に基づいてサンプルをフィルター処理します。 |
||||
|
テキストの全長、平均行長、最大行長に基づいてサンプルをフィルター処理します。 |
||||
|
テキストの言語を識別し、品質スコアを計算し、指定された言語とスコア範囲に基づいてサンプルをフィルター処理します。 |
||||
|
指定された機密単語辞書に含まれる単語を含むサンプルをフィルター処理します。 |
||||
|
メールアドレス、電話番号、ID 番号などの機密情報をマスキングします。 |
||||
|
SimHash 類似度スコアを計算して、ドキュメントの重複を排除します。 |
||||
|
文字レベルまたは単語レベルの N-gram 繰り返し率に基づいてサンプルをフィルター処理します。 |
||||
|
TEX ドキュメント形式のデータに使用します。パラメーターのないすべてのマクロをインライン展開します。マクロが文字と数字で構成され、パラメーターがない場合、マクロ名は値に置き換えられます。 |
||||
|
LaTeX ドキュメントから参考文献セクションを削除します。 |
||||
|
LaTeX ソーステキストからコメント行とインラインコメントを削除します。 |
||||
|
TEX ドキュメント形式のデータに使用します。<section-type>[optional-args]{name} という章の形式に一致する最初の文字列を検索し、その文字列より前のすべてのコンテンツを削除し、最初に一致した章以降のすべてのコンテンツ (章のタイトルを含む) を保持します。 |
||||
|
LLM データ処理 (MaxCompute) |
テキストコンテンツの MD5 ハッシュを計算し、重複するエントリを削除します。 |
|||
|
Unicode 正規化を実行し、繁体字中国語の文字を簡体字中国語に変換します。 |
||||
|
ナビゲーション、著者情報、URL、HTML フォーマットなどのコンテンツを削除します。 |
||||
|
特殊文字とテキスト全長との比率に基づいてサンプルをフィルター処理します。 |
||||
|
コードファイルのヘッダーにあるコメントなど、テキストから著作権情報を削除します。 |
||||
|
文字、数字、区切り文字の数に基づいてサンプルをフィルター処理します。 |
||||
|
テキストの全長、平均行長、最大行長に基づいてサンプルをフィルター処理します。 |
||||
|
テキストの言語を識別し、品質スコアを計算し、指定された言語とスコア範囲に基づいてサンプルをフィルター処理します。 |
||||
|
指定された機密単語辞書に含まれる単語を含むサンプルをフィルター処理します。 |
||||
|
メールアドレス、電話番号、ID 番号などの機密情報をマスキングします。 |
||||
|
文字レベルまたは単語レベルの N-gram 繰り返し率に基づいてサンプルをフィルター処理します。 |
||||
|
TEX 形式のデータでパラメーターなしのマクロ定義をインライン化します。 |
||||
|
LaTeX ドキュメントから参考文献セクションを削除します。 |
||||
|
LaTeX ソーステキストからコメント行とインラインコメントを削除します。 |
||||
|
LaTeX ドキュメントの最初のセクション宣言より前のすべてのコンテンツを削除します。 |
||||
|
LVM データ処理 (DLC) |
動画前処理オペレーター |
フレーム内に存在するテキストの量に基づいて動画データをフィルター処理します。 |
||
|
指定されたモーション速度の範囲に基づいて動画データをフィルター処理します。 |
||||
|
指定された美的品質スコアを下回る動画データをフィルター処理します。 |
||||
|
指定されたアスペクト比の範囲に基づいて動画データをフィルター処理します。 |
||||
|
指定されたデュレーションの範囲に基づいて動画データをフィルター処理します。 |
||||
|
動画と関連テキスト間のセマンティック類似度スコアに基づいて動画データをフィルター処理します。 |
||||
|
NSFW (Not Safe For Work) スコアに基づいて動画データをフィルター処理します。 |
||||
|
指定された解像度の範囲に基づいて動画データをフィルター処理します。 |
||||
|
ウォーターマークを含む動画データをフィルター処理します。 |
||||
|
指定されたタグのセットと一致しない動画データをフィルター処理します。 |
||||
|
動画フレームの説明的なタグを生成します。 |
||||
|
動画フレームの説明テキストを生成します。 |
||||
|
動画全体の説明テキストを生成します。 |
||||
|
画像前処理オペレーター |
指定された美的品質スコアを下回る画像データをフィルター処理します。 |
|||
|
指定されたアスペクト比の範囲に基づいて画像データをフィルター処理します。 |
||||
|
顔領域と画像総領域の比率に基づいて画像データをフィルター処理します。 |
||||
|
NSFW (Not Safe For Work) スコアに基づいて画像データをフィルター処理します。 |
||||
|
指定された解像度の範囲に基づいて画像データをフィルター処理します。 |
||||
|
指定されたファイルサイズの範囲に基づいて画像データをフィルター処理します。 |
||||
|
マッチングスコアに基づいて画像とテキストのペアをフィルター処理します。 |
||||
|
セマンティック類似度スコアに基づいて画像とテキストのペアをフィルター処理します。 |
||||
|
ウォーターマークを含む画像データをフィルター処理します。 |
||||
|
画像の自然言語による説明を生成します。 |
||||
|
LLM トレーニングと推論 |
事前学習済みの BERT 分類モデルを使用してオフライン推論を実行し、入力テーブルのテキストを分類します。 |
|||
従来のアルゴリズムコンポーネント
これらのレガシーコンポーネントは、現在、アクティブにメンテナンスされていません。安定性およびサービスレベルアグリーメント (SLA) は保証されません。本番環境では、安定性を確保するために、レガシーコンポーネントを推奨のアルゴリズムコンポーネントに置き換えてください。
|
コンポーネントタイプ |
コンポーネント |
説明 |
|
データ前処理 |
指定された比率または数に基づいて、入力データからランダムな独立サンプリングを実行します。 |
|
|
重み付き選択法を使用して、入力データからサンプルを生成します。 |
||
|
SQL 式に基づいてデータ行をフィルター処理し、出力列の名前を変更します。 |
||
|
指定された列に基づいてデータをグループに分割し、各グループ内でランダムサンプリングを実行します。 |
||
|
SQL の |
||
|
2 つのテーブルの列を結合します。両方のテーブルの行数は同じである必要があります。 |
||
|
2 つのテーブルの行をマージします。両方のテーブルで、選択した列の数とデータ型が同じである必要があります。 |
||
|
指定された列のデータ型を String、Double、または Integer に変換します。変換に失敗した場合は、その値を欠損値として扱います。 |
||
|
テーブルの最初の列として、連続した数値 ID 列を追加します。 |
||
|
データセットをランダムに 2 つのサブセットに分割します。通常、トレーニングセットとテストセットを作成するために使用されます。 |
||
|
平均、中央値、最頻値、またはカスタム値など、選択した方法を使用して指定された列の欠損値を補完します。 |
||
|
数値特徴量を [0, 1] などの共通の範囲に再スケーリングします。密形式と疎形式の両方のデータをサポートします。 |
||
|
特徴量を平均 0、標準偏差 1 になるように再スケーリングします (z スコア正規化)。 |
||
|
テーブルを疎なキー-値 (KV) 形式から密なテーブル形式に変換します。 |
||
|
密なテーブルを疎なキー-値 (KV) 形式に変換します。 |
||
|
特徴量エンジニアリング |
他のコンポーネントによって生成された重要度スコアに基づいて、上位 N 個の特徴量をフィルター処理します。 |
|
|
主成分分析 (PCA) を実行し、特徴量を線形的に無相関な主成分のセットに変換することで、データセットの次元を削減します。 |
||
|
最小-最大、対数、または z スコアのスケーリング変換を数値特徴量に適用します。 |
||
|
連続的な数値特徴量を離散的なカテゴリ特徴量 (ビン) に変換します。 |
||
|
異常な特徴量の値を指定された範囲にクランプします。密形式と疎形式の両方のデータをサポートします。 |
||
|
行列に対して特異値分解 (SVD) を実行します。 |
||
|
連続特徴量とカテゴリ特徴量の両方を含むデータ内の外れ値を検出します。 |
||
|
線形回帰またはロジスティック回帰モデルを使用して、特徴量の重要度スコアを計算します。 |
||
|
離散特徴量の統計的分布を分析します。 |
||
|
トレーニング済みのランダムフォレストモデルを使用して、特徴量の重要度スコアを計算します。 |
||
|
カイ二乗、ジニ係数、情報利得などのフィルター法を使用して、特徴量のサブセットを選択します。 |
||
|
勾配ブースティング決定木 (GBDT) モデルを使用して、非線形特徴量を線形特徴量にエンコードします。 |
||
|
カテゴリ特徴量をバイナリベクトル表現に変換します。出力は疎なキー-値 (KV) 形式です。 |
||
|
統計分析 |
選択された列のデータ分布と統計の視覚的な概要を提供します。 |
|
|
2 つの確率変数間の共分散を計算して、それらがどのように一緒に変化するかを測定します。 |
||
|
経験分布またはカーネル密度推定のいずれかを使用して、確率密度プロットを生成します。 |
||
|
テーブル内のすべての列または列のサブセットの記述統計を計算します。 |
||
|
カテゴリ変数に使用されます。単一の多項カテゴリ変数のカテゴリ全体で、観測された度数と理論上の度数が一致するかどうかを検定します。帰無仮説は、観測された度数と理論上の度数に差がないというものです。 |
||
|
データセットのばらつきを表示する統計グラフです。主に元データの分布特性の把握や、複数データセットの分布比較に使用されます。 |
||
|
回帰分析におけるデカルト座標系上のデータポイントの分布図です。 |
||
|
相関係数アルゴリズムは、行列内の各列間の相関係数を計算します。値の範囲は [-1, 1] です。計算時のカウントは、両方の列で空でない要素の数に基づきます。このカウントは、列のペアごとに異なる場合があります。 |
||
|
統計的原則に基づき、2 つのサンプルの平均間に有意な差があるかどうかを検定します。 |
||
|
変数の母集団平均と指定値の間に有意な差があるかどうかを検定します。検定対象のサンプルは正規分布に従う必要があります。 |
||
|
観測値を使用して、母集団が正規分布に従うかどうかを判断します。統計的意思決定において重要な、適合度検定の一種です。 |
||
|
国または地域の所得分布を視覚的に表示します。 |
||
|
テーブル列のデータのパーセンタイルを計算するために使用される統計用語です。 |
||
|
2 つの変数間の線形相関の程度を反映する線形相関係数です。 |
||
|
ヒストグラムは、度数分布図とも呼ばれ、データ分布を可視化する統計グラフの一種です。一連の垂直な棒または線分の高さで度数を表します。 |
||
|
機械学習 |
入力はトレーニング済みモデルと予測データで、出力は予測結果です。 |
|
|
XGBoost アルゴリズムを使用して、入力データから分類または回帰モデルをトレーニングします。XGBoost は、勾配ブースティングを拡張・最適化したアルゴリズムであり、その高い性能と効率性から広く利用されています。 |
||
|
トレーニング済みの XGBoost モデルと予測対象のデータセットを使用して、分類または回帰の予測結果を生成します。 |
||
|
統計的学習理論に基づく機械学習手法です。構造的リスクを最小化することで学習器の汎化能力を向上させ、経験的リスクと信頼範囲を最小化します。 |
||
|
二項分類アルゴリズムで、密形式と疎形式の両方のデータをサポートします。 |
||
|
複数の決定木を逐次的に学習させるアンサンブル手法です。前の木の誤差を次の木が修正するように学習を重ねることで、高精度な二項分類モデルを構築します。 |
||
|
Parameter Server (PS) は、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。Scalable Multiple Additive Regression Tree (SMART) は、Gradient Boosting Decision Tree (GBDT) に基づいて PS 上に実装された反復アルゴリズムです。 |
||
|
Parameter Server (PS) は、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。Scalable Multiple Additive Regression Tree (SMART) は、Gradient Boosting Decision Tree (GBDT) に基づいて PS 上に実装された反復アルゴリズムです。 |
||
|
予測対象テーブルの各行に対し、トレーニングテーブルから最も距離が近い K 個のレコードを選択します。これら K 個のレコードの中で最頻出のクラスが、その行のクラスとして割り当てられます。 |
||
|
多クラス分類のためのロジスティック回帰アルゴリズムです。PAI が提供するモデルは、密形式と疎形式の両方のデータをサポートします。 |
||
|
複数の決定木を含む分類器です。その分類結果は、個々の木が出力するクラスの最頻値によって決定されます。 |
||
|
独立性の仮定を持つベイズの定理に基づく確率的分類アルゴリズムです。 |
||
|
まず、ランダムに K 個のオブジェクトを初期クラスタ中心として選択します。次に、残りのオブジェクトと各クラスタ中心との距離を計算し、それらを最も近いクラスタに割り当て、各クラスタのクラスタ中心を再計算します。 |
||
|
DBSCAN コンポーネントを使用して、クラスタリングモデルを構築します。 |
||
|
GMM トレーニングコンポーネントを使用して、モデル分類を実装します。 |
||
|
DBSCAN 予測コンポーネントを使用して、DBSCAN トレーニングモデルに基づいて新しいデータポイントが属するクラスターを予測します。 |
||
|
GMM 予測コンポーネントを使用して、トレーニング済みの混合ガウスモデルに基づいてクラスタリング予測を実行します。 |
||
|
線形および非線形の回帰シナリオに適した反復決定木アルゴリズムです。 |
||
|
従属変数と複数の独立変数との間の線形関係を分析するモデルです。 |
||
|
このコンポーネントは、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。SMART は、GBDT に基づいて PS 上に実装された反復アルゴリズムです。 |
||
|
従属変数と複数の独立変数との間の線形関係を分析するモデルです。Parameter Server (PS) は、大規模なオフラインおよびオンラインのトレーニングタスクを処理するように設計されています。 |
||
|
AUC、KS、F1 スコアなどの評価指標を計算し、KS 曲線、PR 曲線、ROC 曲線、LIFT チャート、Gain チャートを出力します。 |
||
|
予測結果と実測値に基づいて回帰モデルの品質を評価し、評価指標と残差ヒストグラムを出力します。 |
||
|
元データとクラスタリング結果に基づいてクラスタリングモデルの品質を評価し、評価指標を出力します。 |
||
|
教師あり学習に適しており、教師なし学習におけるマッチング行列に対応します。 |
||
|
分類モデルの予測結果と実測値に基づいて多クラス分類アルゴリズムモデルの品質を評価し、Accuracy、Kappa、F1 スコアなどの評価指標を出力します。 |
||
|
ディープラーニング |
PAI がサポートするディープラーニングフレームワークとハードウェアリソースを使用して、ディープラーニングアルゴリズムを実行します。 |
|
|
時系列 |
オープンソースの X-13ARIMA-SEATS をベースに、季節調整のための Arima アルゴリズムをカプセル化したものです。 |
|
|
自動 ARIMA モデル選択プログラムが含まれており、これは主に TRMO (1996) で実装された Gomez and Maravall (1998) のプログラムとその後の改訂に基づいています。 |
||
|
MTable データの各行に対して Prophet 時系列予測を実行し、次の期間の予測結果を提供します。 |
||
|
グルーピング列に基づいてテーブルを MTable に集約します。 |
||
|
MTable をテーブルに展開します。 |
||
|
推薦手法 |
因子分解マシン (FM) アルゴリズムは、特徴量間の相互作用を考慮します。これは、eコマース、広告、ライブストリーミングなどの推薦シナリオに適した非線形モデルです。 |
|
|
交互最小二乗 (ALS) アルゴリズムは、疎行列に対してモデル分解を実行し、欠損アイテムの値を評価して基本的なトレーニングモデルを取得します。 |
||
|
アイテムリコールアルゴリズムです。Swing トレーニングコンポーネントを使用して、User-Item-User の原則に基づいてアイテムの類似性を測定します。 |
||
|
Swing のためのバッチ処理予測コンポーネントです。このコンポーネントを使用して、Swing トレーニングモデルと予測データに基づいてオフライン予測を実行します。 |
||
|
etrec は、アイテムベースの協調フィルタリングアルゴリズムです。入力は 2 つの列で構成され、出力は最も類似度が高い上位 N 個のアイテムです。 |
||
|
リコールのヒット率を計算します。ヒット率は結果の品質評価に使用されます。ヒット率が高いほど、トレーニングで生成されたベクトルがより正確なリコール結果を達成したことを示します。 |
||
|
異常検知 |
局所外れ値因子 (LOF) の値に基づいて、サンプルが異常であるかどうかを判断します。 |
|
|
サブサンプリングにより計算の複雑さを軽減します。データ内の異常を特定でき、異常検知において高い効果を発揮します。 |
||
|
これは従来の SVM とは異なる、教師なし学習アルゴリズムです。境界を学習することで異常を予測します。 |
||
|
自然言語処理 |
冗長な長文から重要な情報を抽出、要約します。ニュースの見出し生成もテキスト要約の一例です。このコンポーネントは、指定した事前学習済みモデルを呼び出してニュース記事を要約し、見出しを生成します。 |
|
|
生成された機械読解トレーニングモデルを使用してオフライン予測を実行します。 |
||
|
冗長な長文から重要な情報を抽出、要約します。ニュースの見出し生成もテキスト要約の一例です。このコンポーネントは、ニュース記事の要点や重要情報を要約し、見出しを生成するモデルをトレーニングします。 |
||
|
与えられたドキュメントに基づいて質問を迅速に理解し、回答できる機械読解モデルをトレーニングします。 |
||
|
AliWS (Alibaba Word Segmenter) 字句解析システムに基づき、指定された列のテキストを単語に分割 (トークン化) します。分割された単語はスペースで区切られます。 |
||
|
3 タプルテーブル (row, col, value) をキー-値 (KV) テーブル (row, [col_id:value]) に変換します。 |
||
|
機械学習における基本的な操作で、主に情報検索、自然言語処理、バイオインフォマティクスで使用されます。 |
||
|
文字列の類似度を計算し、類似度が最も高い上位 N 件のデータを抽出します。 |
||
|
テキスト分析の前処理手法の一つで、トークン化された結果からノイズとなる単語 (「the」、「is」、「a」など) を除去するために使用されます。 |
||
|
言語モデルをトレーニングするステップの一つです。単語ベースで n-gram を生成し、コーパス全体における各 n-gram の出現回数をカウントします。 |
||
|
ドキュメントの主旨を包括的かつ正確に反映した、簡潔で一貫性のある短いテキストのことです。自動要約では、コンピュータが元のドキュメントから要約内容を自動的に抽出します。 |
||
|
自然言語処理における重要な技術の一つです。テキストから、ドキュメントの意味と関連性が非常に高い単語を抽出します。 |
||
|
句読点に基づいてテキストを文に分割します。主にテキスト要約の前処理として使用され、段落を 1 文 1 行の形式に変換します。 |
||
|
Word2Vec によって生成された単語埋め込みなどの意味ベクトルに基づき、最も距離の近いベクトル群を探すことで、与えられた単語 (または文) の拡張単語 (または文) を計算します。ユースケースの 1 つとして、入力単語と Word2Vec で生成された単語埋め込みを基に、最も類似した単語のリストを返すことが挙げられます。 |
||
|
Doc2Vec アルゴリズムコンポーネントを使用して、ドキュメントをベクトルにマッピングします。入力は語彙であり、出力はドキュメントベクトルテーブル、単語ベクトルテーブル、または語彙です。 |
||
|
条件付き確率場 (CRF) は、入力確率変数のセットが与えられた場合の出力確率変数のセットの確率分布モデルです。出力確率変数がマルコフ確率場を形成すると仮定する点が特徴です。 |
||
|
文字列の類似度をベースに、単語単位でドキュメントまたは文のペア間の類似度を計算します。 |
||
|
複数のドキュメントにおける全単語の共起をカウントし、各ペア間の自己相互情報量 (PMI) を計算します。 |
||
|
linearCRF オンライン予測モデルに基づくアルゴリズムコンポーネントで、主に系列ラベリング問題に使用されます。 |
||
|
AliWS (Alibaba Word Segmenter) 字句解析システムに基づき、パラメーターとカスタム辞書を使用してトークン化モデルを生成します。 |
||
|
文字列 (手動入力またはファイルから読み込み) を入力とし、プログラムで単語の総数と各単語の出現頻度をカウントします。 |
||
|
情報検索やテキストマイニングで一般的に使用される重み付け手法です。検索エンジンにおいて、ドキュメントとユーザークエリとの関連度を評価する指標としてよく使用されます。 |
||
|
PAI では、PLDA コンポーネントのトピックパラメーターを設定することで、各ドキュメントから異なるトピックを抽出できます。 |
||
|
Word2Vec は、ニューラルネットワークを用いて、トレーニングを通じて単語を K 次元空間のベクトルにマッピングするアルゴリズムです。単語を表すベクトルに対する操作をサポートしており、その操作は単語の意味に対応します。入力は単語列または語彙、出力は単語ベクトルテーブルと語彙です。 |
||
|
ネットワーク分析 |
各ノードの深さとツリー ID を出力します。 |
|
|
指定されたコアネスを満たす、グラフ内の密接に接続された部分グラフ構造を検索します。ノードの最大コア数は、グラフのコア数と呼ばれます。 |
||
|
ダイクストラ法を使用します。開始点が与えられると、その点から他のすべてのノードへの最短経路を出力します。 |
||
|
Web 検索ランキングに由来します。Web ページのリンク構造を使用して、各ページのランクを計算します。 |
||
|
ラベル伝播アルゴリズム (LPA) は、グラフベースの半教師あり学習手法です。基本的な考え方は、ノードのラベル (コミュニティ) が隣接ノードのラベル情報に依存するというものです。影響の度合いはノードの類似性によって決定され、反復的な伝播によって安定性が達成されます。 |
||
|
ラベル付けされたノードのラベル情報を使用して、ラベル付けされていないノードのラベルを予測する半教師あり分類アルゴリズムです。 |
||
|
コミュニティネットワーク構造を評価するための指標です。ネットワーク構造内のコミュニティの緊密さを評価します。通常、0.3 を超える値は、明確なコミュニティ構造を示します。 |
||
|
無向グラフ G において、頂点 A と頂点 B を結ぶパスが存在する場合、A と B は連結していると見なされます。グラフ G に、各部分グラフ内のすべての頂点は互いに連結しているものの、異なる部分グラフの頂点間は連結していない、という性質を持つ部分グラフが複数含まれる場合、それらを最大連結部分グラフと呼びます。 |
||
|
無向グラフ G において、このコンポーネントは各ノードの周りの密度を計算します。星型ネットワークの密度は 0 で、完全連結ネットワークの密度は 1 です。 |
||
|
無向グラフ G において、このアルゴリズムは各辺の周りの密度を計算します。 |
||
|
無向グラフ G において、このコンポーネントはすべての三角形を出力します。 |
||
|
金融 |
このコンポーネントを使用して、データに対して正規化、離散化、インデックス化、または Weight of Evidence (WOE) 変換を実行します。 |
|
|
信用リスク評価で一般的に使用されるモデリングツールです。入力変数をビニングによって離散化した後、ロジスティック回帰や線形回帰などの線形モデルでトレーニングを行います。特徴量選択やスコア変換などの機能も含まれます。 |
||
|
スコアカードトレーニングコンポーネントによって生成されたモデル結果に基づいて、元データをスコアリングします。 |
||
|
連続データを複数の離散的な間隔に分割することで、特徴量の離散化を実行します。ビニングコンポーネントは、等頻度ビニング、等幅ビニング、および自動ビニングをサポートしています。 |
||
|
サンプル変動によって引き起こされるシフトを測定するための重要な指標です。一般的に、サンプルの安定性を測定するために使用されます。 |
||
|
画像アルゴリズム |
ビジネスシナリオで画像分類が必要な場合、このコンポーネントを使用して推論用の画像分類モデルを構築します。 |
|
|
このコンポーネントを使用してモデルをトレーニングし、推論用の動画分類モデルを取得します。 |
||
|
物体検出モデルを構築し、画像内の高リスクエンティティを検出して矩形で囲みます。 |
||
|
ラベル付けされていない元画像を直接トレーニングし、画像特徴抽出用のモデルを取得します。 |
||
|
推論用の距離学習モデルを構築します。 |
||
|
人物関連のキーポイント検出を行うビジネスシナリオの場合、このコンポーネントを使用して推論用のキーポイントモデルを構築します。 |
||
|
ツール |
MaxCompute に保存されるデータ構造の一種です。PAICommand フレームワークに基づく従来の機械学習アルゴリズムで生成されたモデルは、対応する MaxCompute プロジェクトにオフラインモデル形式で保存されます。このコンポーネントは、オフライン予測のためにオフラインモデルを取得する際に使用します。 |
|
|
汎用モデルのエクスポートコンポーネントを使用して、MaxCompute でトレーニングされたモデルを指定された OSS パスにエクスポートします。 |
||
|
カスタムスクリプト |
分類、回帰、推薦のための Alink アルゴリズムを呼び出します。PyAlink スクリプトは、他の Designer アルゴリズムコンポーネントとシームレスに連携し、ビジネスフローの構築と検証を可能にします。 |
|
|
標準の SQL スクリプトコンポーネントに、複数日にわたるループ実行機能を追加します。特定の期間内の日次 SQL タスクを並列実行するために使用されます。 |
||
|
ベータ版コンポーネント |
圧縮推定アルゴリズムです。 |
|
|
密形式と疎形式の両方のデータをサポートします。このコンポーネントは、ローン金額や気温などの数値を予測するために使用します。 |
||
|
住宅価格、販売量、湿度などの数値を予測します。 |
||
|
悪条件問題の回帰分析で最も一般的に使用される正則化手法です。 |