Add ID Column コンポーネントは、データテーブルを処理するアルゴリズムです。テーブルの最初の列として一意の ID 列を挿入し、各行にシリアル番号を割り当てることで、データの識別と管理を支援します。
アルゴリズムの説明
このアルゴリズムは、1,000,000,000 × 1,023 のスケールをサポートします。
コンポーネントの設定
方法 1:GUI の使用
Designer ワークフローに [Add ID Column] コンポーネントを追加します。右側のペインでコンポーネントのパラメーターを設定します。
|
パラメータータイプ |
パラメーター |
説明 |
|
パラメーター設定 |
デフォルトで全列選択 |
出力テーブルに含める列を選択します。デフォルトでは、すべての列が選択されます。 |
|
シリアル番号 |
デフォルト値は append_id です。 |
|
|
実行チューニング |
コンピューティングコア数 |
コア数。 |
|
コアあたりのメモリ |
各コアのメモリサイズ (MB)。値の範囲は (1, 65536) です。 |
方法 2:PAI コマンドの使用
PAI コマンドを使用して [Add ID Column] コンポーネントのパラメーターを設定します。SQL スクリプトコンポーネントで PAI コマンドを実行できます。詳細については、「SQL スクリプト」をご参照ください。
PAI -name AppendId
-project algo_public
-DinputTableName=maple_test_appendid_basic_input
-DoutputTableName=maple_test_appendid_basic_output;
|
パラメーター |
必須 |
デフォルト値 |
説明 |
|
inputTableName |
はい |
なし |
入力テーブルの名前。 |
|
selectedColNames |
いいえ |
すべての列 |
出力テーブルに含める入力テーブルの列。列名はコンマ (,) で区切ります。INT 型と DOUBLE 型の列がサポートされています。入力がスパースフォーマットの場合、文字列型の列もサポートされます。 |
|
inputTablePartitions |
いいえ |
すべてのパーティション |
トレーニングに使用される入力テーブルのパーティション。次のフォーマットがサポートされています:
説明
複数のパーティションを指定する場合は、コンマ (,) で区切ります。 |
|
outputTableName |
はい |
なし |
出力テーブル。 |
|
IDColName |
いいえ |
append_id |
ID 列の名前。 |
|
lifecycle |
いいえ |
なし |
出力テーブルのライフサイクル。 |
|
coreNum |
いいえ |
システム割り当て |
コア数。 |
|
memSizePerCore |
いいえ |
システム割り当て |
各コアのメモリサイズ (MB)。値の範囲は (1, 65536) です。 |
例
PAI -name AppendId
-project algo_public
-DinputTableName=maple_test_appendid_basic_input
-DoutputTableName=maple_test_appendid_basic_output;
-
データ生成
col0
col1
col2
col3
col4
10
0.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true
11
1.0
aaaa
Thu Oct 01 00:00:00 CST 2015
false
12
2.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true
13
3.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true
14
4.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true
-
出力テーブル
append_id
col0
col1
col2
col3
col4
0
10
0.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true
1
11
1.0
aaaa
Thu Oct 01 00:00:00 CST 2015
false
2
12
2.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true
3
13
3.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true
4
14
4.0
aaaa
Thu Oct 01 00:00:00 CST 2015
true