クライアントツールを使用して、複数のタイプのトレーニングジョブを送信できます。このトピックでは、ジョブの送信に使用するコマンドについて、呼び出し構文、パラメーターの説明、および使用例を説明します。
ジョブ送信の共通パラメータ
DLC コマンドラインを使用して TensorFlow (tfjob)、PyTorch (pytorchjob)、または XGBoost (xgboostjob) ジョブを送信する場合、一連の共通パラメータが適用されます。共通パラメータを以下に示します。
表 1. ジョブ送信の共通パラメータ
パラメータ | 必須 | 説明 | タイプ | ジョブパラメータファイルでのサポート |
name | はい | ジョブの名前。複数のジョブに同じ名前を使用できます。 | STRING | はい |
command | はい | 各ノードの起動コマンド。 | STRING | はい |
data_sources | いいえ | マウントするデータセット。
カンマ (,) で区切ることで、複数のデータセットを同時にバインドできます。デフォルト値は空です。 | STRING | はい |
spot_spec | いいえ | 使用するスポットリソースの設定。形式は
たとえば、最大入札額を 50% オフに設定するには、次のように設定します。
スポットインスタンスタイプは、ジョブフレームワークのロール固有のパラメータ (たとえば、PyTorchJob の場合は --master_spec と --worker_spec) を使用して設定します。 | STRING | はい |
elastic_spot_specs | いいえ | 複数のインスタンスタイプを持つ Elastic スポットリソースの設定。形式は
カンマ (
| STRING | はい |
data_source_uris | いいえ | 直接マウントするデータソースパス。形式は
カンマ (,) で区切ることで、複数のデータソースパスを同時にバインドできます。デフォルト値は空です。 | STRING | はい |
code_source | いいえ | コードソース ID。コード設定ページで確認できます。単一の値のみ指定できます。デフォルト値は空です。 | STRING | はい |
code_branch | いいえ | コードリポジトリのブランチ。このパラメータは code_source パラメータと一緒に使用します。 | STRING | はい |
code_commit | いいえ | コードリポジトリのコミット ID。このパラメータは code_source パラメータと一緒に使用します。 | STRING | はい |
thirdparty_libs | いいえ | Python のサードパーティライブラリ。複数のライブラリはカンマ (,) で区切ります。デフォルト値は空です。 | STRING | はい |
thirdparty_lib_dir | いいえ | Python のサードパーティライブラリをインストールするために使用される requirements.txt ファイルを含むディレクトリ。デフォルト値は空です。 | STRING | いいえ |
vpc_id | いいえ | ジョブがアクセスできる Virtual Private Cloud (VPC) の ID。デフォルト値は空です。 | STRING | はい |
switch_id | いいえ (vpc_id が指定されている場合は必須) | ジョブがアクセスする VPC 内の vSwitch の ID。デフォルト値は空です。 | STRING | はい |
security_group_id | いいえ (vpc_id が指定されている場合は必須) | ジョブがアクセスする VPC 内のセキュリティグループの ID。デフォルト値は空です。 | STRING | はい |
job_file | いいえ | ジョブパラメータファイル。job_file 内のパラメータが優先されます。形式は | STRING | いいえ |
interactive | いいえ | ジョブをインタラクティブモードで開始するかどうか。 | BOOL | はい |
job_max_running_time_minutes | いいえ | ジョブの最大実行時間。デフォルト値は 0 で、最大実行時間が設定されていないことを意味します。 | INT64 | はい |
success_policy | いいえ | TFJob でのみサポート。有効な値は次のとおりです。
未指定の場合、デフォルトで AllWorkers が使用されます。 | STRING | はい |
envs | いいえ | ワーカーノードの環境変数。形式は | StringToString | はい |
tags | いいえ | ジョブのタグ。形式は | StringToString | はい |
oversold_type | いいえ | アイドル状態の計算リソースの使用方法。有効な値は次のとおりです。
| STRING | はい |
driver | いいえ | ジョブで使用する GPU ドライバーのバージョン。 | STRING | はい |
default_route | いいえ | VPC が選択されている場合の、パブリックネットワークへのアクセス方法。有効な値は次のとおりです。
| STRING | はい |
priority | いいえ | ジョブの優先度。デフォルト値は 1 です。値の範囲は 1 から 9 で、各値の意味は次のとおりです。
| INT32 | はい |
exit_code_on_stopped | いいえ | インタラクティブモードのジョブが停止された場合の、コマンドラインツールの終了コード。デフォルト値は 0 です。 | INT32 | はい |
job_reserved_minutes | いいえ | ジョブ終了後の保持期間 (分)。デフォルト値は 0 です。 | INT32 | はい |
job_reserved_policy | いいえ | ジョブの保持ポリシー。有効な値は次のとおりです。
| STRING | はい |
TensorFlow トレーニングジョブの送信 (submit tfjob)
-
機能
TensorFlow トレーニングジョブを送信します。
-
構文
コマンドラインパラメーターまたはジョブパラメーターファイルのいずれかを使用して TensorFlow ジョブを送信できます。
./dlc submit tfjob [flags] -
パラメーター
コマンドラインパラメーターを使用して TensorFlow ジョブを送信する場合、コマンド内のパラメーターを実際の値に置き換えます。ジョブパラメーターファイルを使用して送信する場合、ファイルに
<parameterName>=<parameterValue>の形式でパラメーターを記述します。TensorFlow ジョブを送信するための共通パラメーターは、このトピックの冒頭に記載されています。以下は TensorFlow ジョブに固有のパラメーターです。表 2. TensorFlow ジョブ固有のパラメーター
パラメーター
必須
説明
タイプ
ジョブパラメーターファイルでサポート
workspace_id
はい
ワークスペース ID。デフォルト値は空です。ワークスペースの作成方法については、「ワークスペースの作成と管理」をご参照ください。
STRING
はい
chief
いいえ
TensorFlow Chief ノードを有効にするかどうかを指定します。有効な値は次のとおりです。
false :デフォルト。TensorFlow Chief ノードを無効にします。
true :TensorFlow Chief ノードを有効にします。
BOOL
はい
chief_image
いいえ
TensorFlow Chief ノードのイメージ。デフォルト値は空です。
STRING
はい
chief_spec
いいえ
TensorFlow Chief ノードで使用されるインスタンスタイプ。デフォルト値は空です。
STRING
はい
master_image
いいえ
TensorFlow マスターノードのイメージ。デフォルト値は空です。
STRING
はい
master_spec
いいえ
TensorFlow マスターノードで使用されるインスタンスタイプ。デフォルト値は空です。
STRING
はい
masters
いいえ
TensorFlow マスターノード数。デフォルト値は 0 です。
INT
はい
ps
いいえ
TensorFlow パラメータサーバーノード数。デフォルト値は 0 です。
INT
はい
ps_image
いいえ
TensorFlow パラメータサーバーノードのイメージ。デフォルト値は空です。
STRING
はい
ps_spec
いいえ
TensorFlow パラメータサーバーノードで使用されるインスタンスタイプ。デフォルト値は空です。
STRING
はい
worker_image
いいえ
TensorFlow ワーカーノードのイメージ。デフォルト値は空です。
STRING
はい
worker_spec
いいえ
TensorFlow ワーカーノードで使用されるインスタンスタイプ。デフォルト値は空です。
STRING
はい
workers
いいえ
TensorFlow ワーカーノード数。デフォルト値は 0 です。
INT
はい
evaluator_image
いいえ
TensorFlow エバリュエーターノードのイメージ。デフォルト値は空です。
STRING
はい
evaluator_spec
いいえ
TensorFlow エバリュエーターノードで使用されるインスタンスタイプ。デフォルト値は空です。
STRING
はい
evaluators
いいえ
TensorFlow エバリュエーターノード数。デフォルト値は 0 です。
INT
はい
graphlearn_image
いいえ
TensorFlow GraphLearn ノードのイメージ。デフォルト値は空です。
STRING
はい
graphlearn_spec
いいえ
TensorFlow GraphLearn ノードで使用されるインスタンスタイプ。デフォルト値は空です。
STRING
はい
graphlearns
いいえ
TensorFlow GraphLearn ノード数。デフォルト値は 0 です。
INT
はい
表 3. 専用リソースグループに TensorFlow ジョブを送信する場合の固有パラメーター
パラメーター
必須
説明
タイプ
ジョブパラメーターファイルでサポート
resource_id
いいえ (専用リソースグループにジョブを送信する場合は必須)
専用リソースクォータの ID。デフォルト値は空です。専用リソースクォータの作成方法については、「一般的なコンピューティングリソースクォータ」をご参照ください。
STRING
はい
priority
いいえ
ジョブ優先度。デフォルト値は 1 です。
INT
はい
chief_cpu
いいえ
TensorFlow Chief ノードで使用される CPU 数。デフォルト値は空です。
STRING
はい
chief_gpu
いいえ
TensorFlow Chief ノードで使用される GPU 数。デフォルト値は空です。
STRING
はい
chief_gpu_type
いいえ
TensorFlow Chief ノードで使用される GPU タイプ。デフォルト値は空です。例:GU50。
STRING
はい
chief_memory
いいえ
TensorFlow Chief ノードで使用されるメモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。
STRING
はい
chief_shared_memory
いいえ
TensorFlow Chief ノードの共有メモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。
STRING
はい
master_cpu
いいえ
TensorFlow マスターノードで使用される CPU 数。デフォルト値は空です。
STRING
はい
master_gpu
いいえ
TensorFlow マスターノードで使用される GPU 数。デフォルト値は空です。
STRING
はい
master_gpu_type
いいえ
TensorFlow マスターノードで使用される GPU タイプ。デフォルト値は空です。例:GU50。
STRING
はい
master_memory
いいえ
TensorFlow マスターノードで使用されるメモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。
STRING
はい
master_shared_memory
いいえ
TensorFlow マスターノードの共有メモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。
STRING
はい
*_cpu
いいえ
TensorFlow ノードで使用される CPU 数。デフォルト値は空です。 は、ps、worker、evaluator、graphlearn のいずれかです。
STRING
はい
*_gpu
いいえ
TensorFlow ノードで使用される GPU 数。デフォルト値は空です。 は、ps、worker、evaluator、graphlearn のいずれかです。
STRING
はい
*_gpu_type
いいえ
TensorFlow ノードで使用される GPU タイプ。デフォルト値は空です。例:GU50。 は、ps、worker、evaluator、graphlearn のいずれかです。
STRING
はい
*_memory
いいえ
TensorFlow ノードで使用されるメモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。 は、ps、worker、evaluator、graphlearn のいずれかです。
STRING
はい
*_shared_memory
いいえ
TensorFlow ノードの共有メモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。 は、ps、worker、evaluator、graphlearn のいずれかです。
STRING
はい
-
例
-
コマンドラインパラメーターを使用して、ワーカー 2 つと PS ノード 1 つを持つ分散ジョブを送信する例:
./dlc submit tfjob --name=test_2021 --ps=1 \ --ps_spec=ecs.g6.8xlarge \ --ps_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04 \ --workers=2 \ --worker_spec=ecs.g6.4xlarge \ --worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04 \ --command="python /root/data/dist_mnist/code/dist-main.py --max_steps=10000 --data_dir=/root/data/dist_mnist/data/" \ --workspace_id=***** \ --data_sources=d-pcsah1t86b********:v1:/mnt/data/次のような結果が返されます。
+----------------------------------+--------------------------------------+ | JobId | RequestId | +----------------------------------+--------------------------------------+ | dlcmp6vwljkz**** | xxxxxxxx-79AF-4EFC-9CE9-xxxxxxxxxxxx | +----------------------------------+--------------------------------------+ -
ジョブパラメーターファイルを使用して、ワーカー 2 つと PS ノード 1 つを持つ分散ジョブを送信する例:
./dlc submit tfjob --job_file=job_file.dist_mnist.1ps2wここで、job_file.dist_mnist.1ps2w はジョブパラメーターファイルです。パラメーターは
<parameterName>=<parameterValue>の形式で指定されます。job_file.dist_mnist.1ps2w の内容は次のとおりです。name=test_2021 workers=2 worker_spec=ecs.g6.4xlarge worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04 ps=1 ps_spec=ecs.g6.8xlarge ps_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04 command=python /root/data/dist_mnist/code/dist-main.py --max_steps=10000 --data_dir=/root/data/dist_mnist/data/ workspace_id=***** data_sources=d-pcsah1t86b********:v1:/mnt/data/
-
PyTorch トレーニングジョブの送信
-
機能
PyTorch トレーニングジョブの送信に使用します。
-
構文
コマンドラインパラメーターまたはジョブパラメーターファイルのいずれかを使用して PyTorch ジョブを送信できます。
./dlc submit pytorchjob [flags] -
パラメーター
コマンドラインパラメーターを使用して PyTorch ジョブを送信する場合は、コマンド内のパラメーターを実際の値に置き換えます。ジョブパラメーターファイルを使用して送信する場合は、
<parameterName>=<parameterValue>の形式でファイルにパラメーターを記述します。PyTorch ジョブの送信に関する共通パラメーターは、このトピックの冒頭に記載されています。以下は PyTorch ジョブ固有のパラメーターです。表 4. PyTorch ジョブ固有のパラメーター
パラメーター
必須
説明
タイプ
ジョブパラメーターファイルでのサポート
workspace_id
はい
ワークスペース ID です。デフォルト値は空です。ワークスペースの作成方法については、「Create and manage workspaces」をご参照ください。
STRING
はい
master_image
いいえ
PyTorch マスターノードのイメージです。デフォルト値は空です。
STRING
はい
master_spec
いいえ
PyTorch マスターノードが使用するインスタンスタイプです。デフォルト値は空です。
STRING
はい
masters
いいえ
PyTorch マスターノードの数です。デフォルト値は 0 です。
INT
はい
worker_image
いいえ
PyTorch ワーカーノードのイメージです。デフォルト値は空です。
STRING
はい
worker_spec
いいえ
PyTorch ワーカーノードが使用するインスタンスタイプです。デフォルト値は空です。
STRING
はい
workers
いいえ
PyTorch ワーカーノードの数です。デフォルト値は 0 です。
INT
はい
表 5. 専用リソースグループへの PyTorch ジョブの送信に固有のパラメーター
パラメーター
必須
説明
タイプ
ジョブパラメーターファイルでのサポート
resource_id
いいえ (専用リソースグループにジョブを送信する場合は必須)
専用リソースクォータの ID です。デフォルト値は空です。専用リソースクォータの作成方法については、「General computing resource quotas」をご参照ください。
STRING
はい
priority
いいえ
ジョブ優先度です。デフォルト値は 1 です。
INT
はい
master_cpu
いいえ
PyTorch マスターノードが使用する CPU の数です。デフォルト値は空です。
STRING
はい
master_gpu
いいえ
PyTorch マスターノードが使用する GPU の数です。デフォルト値は空です。
STRING
はい
master_gpu_type
いいえ
PyTorch マスターノードが使用する GPU のタイプです。デフォルト値は空です。例: GU50。
STRING
はい
master_memory
いいえ
PyTorch マスターノードが使用するメモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。
STRING
はい
master_shared_memory
いいえ
PyTorch マスターノードの共有メモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。
STRING
はい
worker_cpu
いいえ
PyTorch ワーカーノードが使用する CPU の数です。デフォルト値は空です。
STRING
はい
worker_gpu
いいえ
PyTorch ワーカーノードが使用する GPU の数です。デフォルト値は空です。
STRING
はい
worker_gpu_type
いいえ
PyTorch ワーカーノードが使用する GPU のタイプです。デフォルト値は空です。例: GU50。
STRING
はい
worker_memory
いいえ
PyTorch ワーカーノードが使用するメモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。
STRING
はい
worker_shared_memory
いいえ
PyTorch ワーカーノードの共有メモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。
STRING
はい
-
例
コマンドラインパラメーターを使用して GPU モデルトレーニングジョブを送信する例は、次のとおりです。
./dlc submit pytorchjob --name=test_pt_face \ --workers=1 \ --worker_spec=ecs.gn6e-c12g1.3xlarge \ --worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/pytorch-training:1.7.1-gpu-py37-cu110-ubuntu18.04 \ --command="apt-get update; apt-get -y --allow-downgrades install libpcre3=2:8.38-3.1 libpcre3-dev libgl1-mesa-glx libglib2.0-dev; cd /root/data/face; python train.py --num_workers 0 --save_folder outputs" \ --data_sources=d-pcsah1t86b********:v1:/mnt/data/ \ --workspace_id=*****コマンドラインパラメーターを使用してスポットリソースを使用するモデルトレーニングジョブを送信する例は、次のとおりです。
./dlc submit pytorchjob --name=test_pt_face \ --workers=1 \ --elastic_spot_specs=ml.gp7vf.16.40xlarge:discount:1,ml.gu8tef.8.46xlarge:discount:1,ml.gu8tf.8.40xlarge:discount:0.5 \ --worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/pytorch-training:1.7.1-gpu-py37-cu110-ubuntu18.04 \ --command="apt-get update; apt-get -y --allow-downgrades install libpcre3=2:8.38-3.1 libpcre3-dev libgl1-mesa-glx libglib2.0-dev; cd /root/data/face; python train.py --num_workers 0 --save_folder outputs" \ --workspace_id=*****システムは次のような結果を返します:
+----------------------------------+--------------------------------------+ | JobId | RequestId | +----------------------------------+--------------------------------------+ | dlcu704xxuxk**** | xxxxxxxx-79AF-4EFC-9CE9-xxxxxxxxxxxx | +----------------------------------+--------------------------------------+
XGBoost トレーニングジョブの送信 (submit xgboostjob)
-
機能
XGBoost トレーニングジョブを送信するために使用します。
-
構文
コマンドラインパラメーターまたはジョブパラメーターファイルのいずれかを使用して XGBoost ジョブを送信できます。
./dlc submit xgboostjob [flags] -
パラメーター
コマンドラインパラメーターを使用して XGBoost ジョブを送信する場合、コマンド内のパラメーターを実際の値に置き換えます。ジョブパラメーターファイルを使用して送信する場合、ファイルに
<parameterName>=<parameterValue>の形式でパラメーターを記述します。XGBoost ジョブを送信するための共通パラメーターは、このトピックの冒頭に記載されています。以下は XGBoost ジョブに固有のパラメーターです:表 6. XGBoost ジョブ固有のパラメーター
パラメーター
必須
説明
タイプ
ジョブパラメーターファイルでサポート
workspace_id
はい
ワークスペース ID です。デフォルト値は空です。ワークスペースの作成方法については、「ワークスペースの作成と管理」をご参照ください。
STRING
はい
master_image
いいえ
XGBoost マスターノードのイメージです。デフォルト値は空です。
STRING
はい
master_spec
いいえ
XGBoost マスターノードが使用するインスタンスタイプです。デフォルト値は空です。
STRING
はい
masters
いいえ
XGBoost マスターノードの数です。デフォルト値は 0 です。
INT
はい
worker_image
いいえ
XGBoost ワーカーノードのイメージです。デフォルト値は空です。
STRING
はい
worker_spec
いいえ
XGBoost ワーカーノードが使用するインスタンスタイプです。デフォルト値は空です。
STRING
はい
workers
いいえ
XGBoost ワーカーノードの数です。デフォルト値は 0 です。
INT
はい
表 7. 専用リソースグループに XGBoost ジョブを送信する場合の固有パラメーター
パラメーター
必須
説明
タイプ
ジョブパラメーターファイルでサポート
resource_id
いいえ (専用リソースグループにジョブを送信する場合は必須)
専用リソースクォータの ID です。デフォルト値は空です。リソースクォータの作成方法については、「汎用コンピューティングリソースクォータ」をご参照ください。
STRING
はい
priority
いいえ
ジョブの優先度です。デフォルト値は 1 です。
INT
はい
master_cpu
いいえ
XGBoost マスターノードが使用する CPU の数です。デフォルト値は空です。
STRING
はい
master_gpu
いいえ
XGBoost マスターノードが使用する GPU の数です。デフォルト値は空です。
STRING
はい
master_gpu_type
いいえ
XGBoost マスターノードが使用する GPU のタイプです。デフォルト値は空です。例:GU50
STRING
はい
master_memory
いいえ
XGBoost マスターノードが使用するメモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi
STRING
はい
master_shared_memory
いいえ
XGBoost マスターノードの共有メモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi
STRING
はい
worker_cpu
いいえ
XGBoost ワーカーノードが使用する CPU の数です。デフォルト値は空です。
STRING
はい
worker_gpu
いいえ
XGBoost ワーカーノードが使用する GPU の数です。デフォルト値は空です。
STRING
はい
worker_gpu_type
いいえ
XGBoost ワーカーノードが使用する GPU のタイプです。デフォルト値は空です。例:GU50
STRING
はい
worker_memory
いいえ
XGBoost ワーカーノードが使用するメモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi
STRING
はい
worker_shared_memory
いいえ
XGBoost ワーカーノードの共有メモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi
STRING
はい
-
例
コマンドラインパラメーターを使用して XGBoost ジョブを送信します。例:
./dlc submit xgboostjob --name=test_xgboost \ --workers=1 \ --worker_spec=ecs.gn6e-c12g1.3xlarge \ --worker_image=xgboost-training:1.6.0-cpu-py36-ubuntu18.04 \ --command="python /root/code/horovod/xgboost/main.py --job_type=Train --xgboost_parameter=objective:multi:softprob,num_class:3 --n_estimators=50 --model_path=autoAI/xgb-opt/2" \ --data_sources=d-pcsah1t86b********:v1:/mnt/data/ \ --workspace_id=*****システムは次のような結果を返します:
+----------------------------------+--------------------------------------+ | JobId | RequestId | +----------------------------------+--------------------------------------+ | dlc1nvu3gli0**** | xxxxxxxx-79AF-4EFC-9CE9-xxxxxxxxxxxx | +----------------------------------+--------------------------------------+
ジョブ送信の高度なパラメーター
特定のノードへのジョブのスケジューリング
Lingjun インテリジェントコンピューティングまたは汎用コンピューティングのリソースクォータを使用してジョブを送信する場合、DLC コマンドラインでパラメーターを設定することで、ジョブを特定のノードにスケジューリングできます。
この機能は現在、ホワイトリストに登録されたユーザーのみが利用できます。アクセスが必要な場合は、アカウントマネージャーに連絡してホワイトリストへの追加を依頼してください。
-
パラメーター
パラメーター
説明
値の例
--allow_nodes="${allow_nodes}"
ノード名のリストを指定します。複数のノード名はカンマ (,) で区切ります。ノード名の間にスペースを含めないでください。
lingjuc47iextvg9-****,lingjuc47iextvg9-****
--deny_nodes="${deny_nodes}"
除外するノードのリストを指定します。複数のノード名はカンマ (,) で区切ります。ノード名の間にスペースを含めないでください。
lingjuc47iextvg9-****,lingjuc47iextvg9-****
-
例
コマンドラインパラメーター
コマンドラインパラメーターを使用してジョブを送信します。例:
-
スケジューリングノードの指定なし
./dlc submit pytorchjob --name=assign_node_test_no_node \--workers=1 \ --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \ --command="sleep 1000" \ --workspace_id='****' \ --resource_id='quotau2h98mt****' \ --worker_cpu="1" \ --worker_memory='2Gi' -
スケジューリングノードの指定
./dlc submit pytorchjob --name=assign_node_test_2_allow_nodes \--workers=1 \ --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \ --command="sleep 1000" \ --workspace_id='****' \ --resource_id='quotau2h98mt****' \ --worker_cpu="1" \ --worker_memory='2Gi' \ --allow_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****" -
特定のノードの除外
./dlc submit pytorchjob --name=assign_node_test_two_deny_nodes \--workers=1 \ --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \ --command="sleep 1000" \ --workspace_id='****' \ --resource_id='quotau2h98mt****' \ --worker_cpu="1" \ --worker_memory='2Gi' \ --deny_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****" -
スケジューリングノードの指定と特定のノードの除外
./dlc submit pytorchjob --name=assign_node_test_two_allow_two_deny \--workers=1 \ --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \ --command="sleep 1000" \ --workspace_id='****' \ --resource_id='quotau2h98mt****' \ --worker_cpu="1" \ --worker_memory='2Gi' \ --allow_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****" \ --deny_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****"
ファイルベースの設定
ファイルベースの設定を使用してジョブを送信します。例:
./dlc submit pytorchjob -f job_fileここで、job_file はジョブパラメーターファイルです。内容は次のとおりです:
-
スケジューリングノードの指定なし
name=assign_node_test_no_node workers=1 worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 command=sleep 1000 workspace_id=**** resource_id=quotau2h98mt**** worker_cpu=1 worker_memory=2Gi -
スケジューリングノードの指定
name=assign_node_test_2_allow_nodes workers=1 worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 command=sleep 1000 workspace_id=**** resource_id=quotau2h98mt**** worker_cpu=1 worker_memory=2Gi allow_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-**** -
特定のノードの除外
name=assign_node_test_two_deny_nodes workers=1 worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 command=sleep 1000 workspace_id=**** resource_id=quotau2h98mt**** worker_cpu=1 worker_memory=2Gi deny_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-**** -
スケジューリングノードの指定と特定のノードの除外
name=assign_node_test_two_allow_two_deny workers=1 worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 command=sleep 1000 workspace_id=**** resource_id=quotau2h98mt**** worker_cpu=1 worker_memory=2Gi allow_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-**** deny_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-****
-
ジョブ送信時の従量課金在庫確認の無効化
DLC コマンドラインで disable_ecs_stock_check パラメーターを設定することで、従量課金の在庫確認を無効にできます。
-
パラメーター
パラメーター
説明
値の例
disable_ecs_stock_check
従量課金の在庫確認を無効にするかどうかを指定します。有効な値:
false (デフォルト):従量課金の在庫確認を有効にします。
true:従量課金の在庫確認を無効にします。
true または false
-
例
コマンドラインパラメーター
コマンドラインパラメーターを使用してジョブを送信します。例:
-
従量課金在庫確認の有効化
./dlc submit pytorchjob \ --name=test_skip_checking3 \ --command='sleep 1000' \ --workspace_id=**** \ --priority=1 \ --workers=1 \ --worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04 \ --worker_spec=ecs.g6.xlarge -
従量課金在庫確認の無効化
./dlc submit pytorchjob \ --name=test_skip_checking3 \ --command='sleep 1000' \ --workspace_id=**** \ --priority=1 \ --workers=1 \ --worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04 \ --worker_spec=ecs.g6.xlarge \ --disable_ecs_stock_check=true
ファイルベースの設定
ファイルベースの設定を使用してジョブを送信します。例:
./dlc submit pytorchjob -f job_fileここで、job_file はジョブパラメーターファイルです。内容は次のとおりです:
-
従量課金在庫確認の有効化
name=test_skip_checking3 workers=1 worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04 command=sleep 1000 workspace_id=**** worker_spec=ecs.g6.xlarge -
従量課金在庫確認の無効化
name=test_skip_checking3 workers=1 worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04 command=sleep 1000 workspace_id=**** worker_spec=ecs.g6.xlarge disable_ecs_stock_check=true
-
関連ドキュメント
ジョブの送信に成功すると、クライアントツールでジョブを管理できます。詳細については、「トレーニングジョブを停止するコマンド」および「ログまたはジョブを照会するコマンド」をご参照ください。
送信したジョブは、コンソールでも管理できます。詳細については、「トレーニングジョブの管理」をご参照ください。