このコンポーネントは、重み付きサンプリングを使用してサンプルデータを生成します。重み列は DOUBLE 型または BIGINT 型である必要があります。レコードは、この列の値に基づいてサンプリングされます。たとえば、重み 1.2 のレコードは、重み 1.0 のレコードよりもサンプリングされる確率が高くなります。
コンポーネントの設定
重み付きサンプリングコンポーネントのパラメーターは、次のいずれかの方法で設定できます。
方法 1:GUI の使用
Designer のワークフローページで、コンポーネントパラメーターを設定できます。
タブ | パラメーター | 説明 |
[パラメーター設定] | [サンプルサイズ] | 正の整数。 |
[サンプリング率] | (0, 1) の範囲の浮動小数点数。 | |
[復元抽出] | このオプションを選択すると、復元抽出が有効になります。デフォルトでは、非復元抽出が実行されます。 | |
[重み列] | 重み付けに使用する列を選択します。この列は DOUBLE 型または BIGINT 型である必要があります。各値は、対応するレコードの重みを表します。正規化は不要です。 | |
[ランダムシード] | デフォルトでシステムによって生成されます。 | |
[実行チューニング] | [コア数] | 値は正の整数である必要があります。デフォルト値はシステムによって自動的に割り当てられます。 |
[カーネルメモリ割り当て] | (1, 65536) の範囲の正の整数。デフォルトでは、システムによってメモリが自動的に割り当てられます。 |
方法 2:PAI コマンドの使用
SQL スクリプトコンポーネントで PAI コマンドを使用して、コンポーネントのパラメーターを設定できます。詳細については「SQL スクリプト」をご参照ください。
PAI -name WeightedSample
-project algo_public
-Dlifecycle="28"
-DoutputTableName="test2"
-DprobCol="previous"
-Dreplace="false"
-DsampleSize="500"
-DinputTablePartitions="pt=20150501"
-DinputTableName="bank_data_partition";パラメーター名 | 必須 | 説明 | デフォルト値 |
inputTableName | はい | 入力テーブルの名前。 | なし |
inputTablePartitions | いいえ | トレーニングに使用する入力テーブルのパーティション。次のフォーマットがサポートされています:
説明 複数のパーティションを指定する場合は、カンマ (,) で区切ります。 | すべてのパーティション |
outputTableName | はい | 出力テーブル。 | なし |
sampleSize | いいえ | 生成するサンプルの数。 説明
| なし |
sampleRatio | いいえ | サンプリング率。このパラメーターには、(0, 1) の範囲の浮動小数点数を指定します。 | なし |
probCol | はい | 重み付けに使用する列。各値は、対応するレコードの重みを表します。正規化は不要です。この列は DOUBLE 型または BIGINT 型である必要があります。 | なし |
replace | いいえ | 復元抽出を実行するかどうかを指定します。このパラメーターはブール値です。 | false (デフォルトでは非復元抽出が実行されます。) |
randomSeed | いいえ | ランダムシード。値は正の整数である必要があります。 | システムによって値が自動的に割り当てられます。 |
lifecycle | いいえ | 出力テーブルのライフサイクル (日数) 。値は [1, 3650] の範囲の整数である必要があります。 | なし |
coreNum | いいえ | コンピューティング用のコア数。値は正の整数である必要があります。 | システムによって自動的に割り当てられます。 |
memSizePerCore | いいえ | 各コアのメモリサイズ (MB) です。値は (1, 65536) の範囲の整数である必要があります。 | システムによって自動的に割り当てられます。 |