すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:コマンドの送信

最終更新日:Aug 25, 2026

クライアントツールを使用して、複数のタイプのトレーニングジョブを送信できます。このトピックでは、ジョブの送信に使用するコマンドについて、呼び出し構文、パラメーターの説明、および使用例を説明します。

ジョブ送信の共通パラメータ

DLC コマンドラインを使用して TensorFlow (tfjob)、PyTorch (pytorchjob)、または XGBoost (xgboostjob) ジョブを送信する場合、一連の共通パラメータが適用されます。共通パラメータを以下に示します。

表 1. ジョブ送信の共通パラメータ

パラメータ

必須

説明

タイプ

ジョブパラメータファイルでのサポート

name

はい

ジョブの名前。複数のジョブに同じ名前を使用できます。

STRING

はい

command

はい

各ノードの起動コマンド。

STRING

はい

data_sources

いいえ

マウントするデータセット。--data_sources=<datasets_id>:<version>:<mount_path> の形式でデータセットのバージョンとマウントパスを指定できます。各項目の説明は次のとおりです。

  • <datasets_id>: データセット ID に置き換えます。[データセット] ページで確認できます。

  • <version>:データセットのバージョン。例: v1

  • <mount_path>: マウントパスに置き換えます (例: /mnt/data/)。

カンマ (,) で区切ることで、複数のデータセットを同時にバインドできます。デフォルト値は空です。

STRING

はい

spot_spec

いいえ

使用するスポットリソースの設定。形式は <limit_type>:<limit_value> です。各項目の説明は次のとおりです。

  • <limit_type>:入札上限タイプ。次の 2 つの値がサポートされています。

    • discount:最大割引率

    • price:最高価格

  • <limit_value>:最高価格または最大割引率。

たとえば、最大入札額を 50% オフに設定するには、次のように設定します。

--spot_spec=discount:0.5

スポットインスタンスタイプは、ジョブフレームワークのロール固有のパラメータ (たとえば、PyTorchJob の場合は --master_spec と --worker_spec) を使用して設定します。

STRING

はい

elastic_spot_specs

いいえ

複数のインスタンスタイプを持つ Elastic スポットリソースの設定。形式は

<instance_type>:<limit_type>:<limit_value> です。各項目の説明は次のとおりです。

  • <instance_type>:インスタンスタイプ。利用可能なタイプはコンソールで確認できます。サポートされているスポットインスタンスタイプはリージョンによって異なります。

  • <limit_type>:入札上限タイプ。次の 2 つの値がサポートされています。

    • discount:最大割引率

    • price:最高価格

  • <limit_value>:最高価格または最大割引率。

カンマ (,) で区切って複数の候補インスタンスタイプを指定できます。ジョブは、最初に入札に成功したインスタンスタイプで実行されます。例:

--elastic_spot_specs=ml.gp7vf.16.40xlarge:discount:1,ml.gu8tef.8.46xlarge:discount:0.8,ml.gu8tf.8.40xlarge:discount:0.5

STRING

はい

data_source_uris

いいえ

直接マウントするデータソースパス。形式は --data_source_uris=<uri>::<mount_path> です。各項目の説明は次のとおりです。

  • <uri>:データソースのストレージパス。例: oss://examplebucket.oss-cn-hangzhou-internal.aliyuncs.com/path/

  • <mount_path>:マウントパス。例: /mnt/data/

カンマ (,) で区切ることで、複数のデータソースパスを同時にバインドできます。デフォルト値は空です。

STRING

はい

code_source

いいえ

コードソース ID。コード設定ページで確認できます。単一の値のみ指定できます。デフォルト値は空です。

STRING

はい

code_branch

いいえ

コードリポジトリのブランチ。このパラメータは code_source パラメータと一緒に使用します。

STRING

はい

code_commit

いいえ

コードリポジトリのコミット ID。このパラメータは code_source パラメータと一緒に使用します。

STRING

はい

thirdparty_libs

いいえ

Python のサードパーティライブラリ。複数のライブラリはカンマ (,) で区切ります。デフォルト値は空です。

STRING

はい

thirdparty_lib_dir

いいえ

Python のサードパーティライブラリをインストールするために使用される requirements.txt ファイルを含むディレクトリ。デフォルト値は空です。

STRING

いいえ

vpc_id

いいえ

ジョブがアクセスできる Virtual Private Cloud (VPC) の ID。デフォルト値は空です。

STRING

はい

switch_id

いいえ (vpc_id が指定されている場合は必須)

ジョブがアクセスする VPC 内の vSwitch の ID。デフォルト値は空です。

STRING

はい

security_group_id

いいえ (vpc_id が指定されている場合は必須)

ジョブがアクセスする VPC 内のセキュリティグループの ID。デフォルト値は空です。

STRING

はい

job_file

いいえ

ジョブパラメータファイル。job_file 内のパラメータが優先されます。形式は key=value で、キー名はコマンドラインパラメータ名と一致します。設定の詳細については、「ジョブ送信の高度なパラメータ」をご参照ください。

STRING

いいえ

interactive

いいえ

ジョブをインタラクティブモードで開始するかどうか。

BOOL

はい

job_max_running_time_minutes

いいえ

ジョブの最大実行時間。デフォルト値は 0 で、最大実行時間が設定されていないことを意味します。

INT64

はい

success_policy

いいえ

TFJob でのみサポート。有効な値は次のとおりです。

  • ChiefWorker:Chief ノードの Pod が正常に完了するとすぐにジョブは成功します。

  • AllWorkers:すべてのノードが正常に完了した場合にのみジョブは成功します。

未指定の場合、デフォルトで AllWorkers が使用されます。

STRING

はい

envs

いいえ

ワーカーノードの環境変数。形式は key1=value1,key2=value2 です。複数の環境変数はカンマ (,) で区切ります。各環境変数のキーと値は等号 (=) で区切ります。

StringToString

はい

tags

いいえ

ジョブのタグ。形式は key1=value1,key2=value2 です。複数のタグはカンマ (,) で区切ります。各タグのキーと値は等号 (=) で区切ります。

StringToString

はい

oversold_type

いいえ

アイドル状態の計算リソースの使用方法。有効な値は次のとおりです。

  • AcceptQuotaOverSold (許容) :ジョブはアイドル状態の計算リソースを使用できます。

  • ForceQuotaOverSold (アイドルのみ) :ジョブはアイドル状態の計算リソースのみを使用します。

  • ForbiddenQuotaOverSold (非許容) :ジョブは関連付けられたクォータ内のリソースのみを使用し、アイドル状態の計算リソースは使用しません。

STRING

はい

driver

いいえ

ジョブで使用する GPU ドライバーのバージョン。

STRING

はい

default_route

いいえ

VPC が選択されている場合の、パブリックネットワークへのアクセス方法。有効な値は次のとおりです。

  • eth0 (デフォルト) :パブリックゲートウェイを介してパブリックネットワークにアクセスします。

  • eth1 :選択した VPC のプライベートゲートウェイを介してパブリックネットワークにアクセスします。

STRING

はい

priority

いいえ

ジョブの優先度。デフォルト値は 1 です。値の範囲は 1 から 9 で、各値の意味は次のとおりです。

  • 1 は最も低い優先度です。

  • 9 は最も高い優先度です。

INT32

はい

exit_code_on_stopped

いいえ

インタラクティブモードのジョブが停止された場合の、コマンドラインツールの終了コード。デフォルト値は 0 です。

INT32

はい

job_reserved_minutes

いいえ

ジョブ終了後の保持期間 (分)。デフォルト値は 0 です。

INT32

はい

job_reserved_policy

いいえ

ジョブの保持ポリシー。有効な値は次のとおりです。

  • Always (デフォルト) :ジョブが成功したか失敗したかに関わらず保持します。

  • OnFailure:ジョブが失敗した場合にのみ保持します。

  • OnSucceed:ジョブが成功した場合にのみ保持します。

STRING

はい

TensorFlow トレーニングジョブの送信 (submit tfjob)

  • 機能

    TensorFlow トレーニングジョブを送信します。

  • 構文

    コマンドラインパラメーターまたはジョブパラメーターファイルのいずれかを使用して TensorFlow ジョブを送信できます。

    ./dlc submit tfjob [flags]
  • パラメーター

    コマンドラインパラメーターを使用して TensorFlow ジョブを送信する場合、コマンド内のパラメーターを実際の値に置き換えます。ジョブパラメーターファイルを使用して送信する場合、ファイルに <parameterName>=<parameterValue> の形式でパラメーターを記述します。TensorFlow ジョブを送信するための共通パラメーターは、このトピックの冒頭に記載されています。以下は TensorFlow ジョブに固有のパラメーターです。

    表 2. TensorFlow ジョブ固有のパラメーター

    パラメーター

    必須

    説明

    タイプ

    ジョブパラメーターファイルでサポート

    workspace_id

    はい

    ワークスペース ID。デフォルト値は空です。ワークスペースの作成方法については、「ワークスペースの作成と管理」をご参照ください。

    STRING

    はい

    chief

    いいえ

    TensorFlow Chief ノードを有効にするかどうかを指定します。有効な値は次のとおりです。

    • false :デフォルト。TensorFlow Chief ノードを無効にします。

    • true :TensorFlow Chief ノードを有効にします。

    BOOL

    はい

    chief_image

    いいえ

    TensorFlow Chief ノードのイメージ。デフォルト値は空です。

    STRING

    はい

    chief_spec

    いいえ

    TensorFlow Chief ノードで使用されるインスタンスタイプ。デフォルト値は空です。

    STRING

    はい

    master_image

    いいえ

    TensorFlow マスターノードのイメージ。デフォルト値は空です。

    STRING

    はい

    master_spec

    いいえ

    TensorFlow マスターノードで使用されるインスタンスタイプ。デフォルト値は空です。

    STRING

    はい

    masters

    いいえ

    TensorFlow マスターノード数。デフォルト値は 0 です。

    INT

    はい

    ps

    いいえ

    TensorFlow パラメータサーバーノード数。デフォルト値は 0 です。

    INT

    はい

    ps_image

    いいえ

    TensorFlow パラメータサーバーノードのイメージ。デフォルト値は空です。

    STRING

    はい

    ps_spec

    いいえ

    TensorFlow パラメータサーバーノードで使用されるインスタンスタイプ。デフォルト値は空です。

    STRING

    はい

    worker_image

    いいえ

    TensorFlow ワーカーノードのイメージ。デフォルト値は空です。

    STRING

    はい

    worker_spec

    いいえ

    TensorFlow ワーカーノードで使用されるインスタンスタイプ。デフォルト値は空です。

    STRING

    はい

    workers

    いいえ

    TensorFlow ワーカーノード数。デフォルト値は 0 です。

    INT

    はい

    evaluator_image

    いいえ

    TensorFlow エバリュエーターノードのイメージ。デフォルト値は空です。

    STRING

    はい

    evaluator_spec

    いいえ

    TensorFlow エバリュエーターノードで使用されるインスタンスタイプ。デフォルト値は空です。

    STRING

    はい

    evaluators

    いいえ

    TensorFlow エバリュエーターノード数。デフォルト値は 0 です。

    INT

    はい

    graphlearn_image

    いいえ

    TensorFlow GraphLearn ノードのイメージ。デフォルト値は空です。

    STRING

    はい

    graphlearn_spec

    いいえ

    TensorFlow GraphLearn ノードで使用されるインスタンスタイプ。デフォルト値は空です。

    STRING

    はい

    graphlearns

    いいえ

    TensorFlow GraphLearn ノード数。デフォルト値は 0 です。

    INT

    はい

    表 3. 専用リソースグループに TensorFlow ジョブを送信する場合の固有パラメーター

    パラメーター

    必須

    説明

    タイプ

    ジョブパラメーターファイルでサポート

    resource_id

    いいえ (専用リソースグループにジョブを送信する場合は必須)

    専用リソースクォータの ID。デフォルト値は空です。専用リソースクォータの作成方法については、「一般的なコンピューティングリソースクォータ」をご参照ください。

    STRING

    はい

    priority

    いいえ

    ジョブ優先度。デフォルト値は 1 です。

    INT

    はい

    chief_cpu

    いいえ

    TensorFlow Chief ノードで使用される CPU 数。デフォルト値は空です。

    STRING

    はい

    chief_gpu

    いいえ

    TensorFlow Chief ノードで使用される GPU 数。デフォルト値は空です。

    STRING

    はい

    chief_gpu_type

    いいえ

    TensorFlow Chief ノードで使用される GPU タイプ。デフォルト値は空です。例:GU50。

    STRING

    はい

    chief_memory

    いいえ

    TensorFlow Chief ノードで使用されるメモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。

    STRING

    はい

    chief_shared_memory

    いいえ

    TensorFlow Chief ノードの共有メモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。

    STRING

    はい

    master_cpu

    いいえ

    TensorFlow マスターノードで使用される CPU 数。デフォルト値は空です。

    STRING

    はい

    master_gpu

    いいえ

    TensorFlow マスターノードで使用される GPU 数。デフォルト値は空です。

    STRING

    はい

    master_gpu_type

    いいえ

    TensorFlow マスターノードで使用される GPU タイプ。デフォルト値は空です。例:GU50。

    STRING

    はい

    master_memory

    いいえ

    TensorFlow マスターノードで使用されるメモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。

    STRING

    はい

    master_shared_memory

    いいえ

    TensorFlow マスターノードの共有メモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。

    STRING

    はい

    *_cpu

    いいえ

    TensorFlow ノードで使用される CPU 数。デフォルト値は空です。 は、ps、worker、evaluator、graphlearn のいずれかです。

    STRING

    はい

    *_gpu

    いいえ

    TensorFlow ノードで使用される GPU 数。デフォルト値は空です。 は、ps、worker、evaluator、graphlearn のいずれかです。

    STRING

    はい

    *_gpu_type

    いいえ

    TensorFlow ノードで使用される GPU タイプ。デフォルト値は空です。例:GU50。 は、ps、worker、evaluator、graphlearn のいずれかです。

    STRING

    はい

    *_memory

    いいえ

    TensorFlow ノードで使用されるメモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。 は、ps、worker、evaluator、graphlearn のいずれかです。

    STRING

    はい

    *_shared_memory

    いいえ

    TensorFlow ノードの共有メモリリソース。デフォルト値は空です。例:500 Mi、1 Gi。 は、ps、worker、evaluator、graphlearn のいずれかです。

    STRING

    はい

    • コマンドラインパラメーターを使用して、ワーカー 2 つと PS ノード 1 つを持つ分散ジョブを送信する例:

      ./dlc submit tfjob --name=test_2021 --ps=1 \
        --ps_spec=ecs.g6.8xlarge \
        --ps_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04 \
        --workers=2 \
        --worker_spec=ecs.g6.4xlarge \
        --worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04 \
        --command="python /root/data/dist_mnist/code/dist-main.py --max_steps=10000 --data_dir=/root/data/dist_mnist/data/" \
        --workspace_id=***** \
        --data_sources=d-pcsah1t86b********:v1:/mnt/data/

      次のような結果が返されます。

      +----------------------------------+--------------------------------------+
      |              JobId               |              RequestId               |
      +----------------------------------+--------------------------------------+
      | dlcmp6vwljkz****                 | xxxxxxxx-79AF-4EFC-9CE9-xxxxxxxxxxxx |
      +----------------------------------+--------------------------------------+
    • ジョブパラメーターファイルを使用して、ワーカー 2 つと PS ノード 1 つを持つ分散ジョブを送信する例:

      ./dlc submit tfjob --job_file=job_file.dist_mnist.1ps2w

      ここで、job_file.dist_mnist.1ps2w はジョブパラメーターファイルです。パラメーターは <parameterName>=<parameterValue> の形式で指定されます。job_file.dist_mnist.1ps2w の内容は次のとおりです。

      name=test_2021
      workers=2
      worker_spec=ecs.g6.4xlarge
      worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04
      ps=1
      ps_spec=ecs.g6.8xlarge
      ps_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04
      command=python /root/data/dist_mnist/code/dist-main.py --max_steps=10000 --data_dir=/root/data/dist_mnist/data/
      workspace_id=*****
      data_sources=d-pcsah1t86b********:v1:/mnt/data/

PyTorch トレーニングジョブの送信

  • 機能

    PyTorch トレーニングジョブの送信に使用します。

  • 構文

    コマンドラインパラメーターまたはジョブパラメーターファイルのいずれかを使用して PyTorch ジョブを送信できます。

    ./dlc submit pytorchjob [flags]
  • パラメーター

    コマンドラインパラメーターを使用して PyTorch ジョブを送信する場合は、コマンド内のパラメーターを実際の値に置き換えます。ジョブパラメーターファイルを使用して送信する場合は、<parameterName>=<parameterValue> の形式でファイルにパラメーターを記述します。PyTorch ジョブの送信に関する共通パラメーターは、このトピックの冒頭に記載されています。以下は PyTorch ジョブ固有のパラメーターです。

    表 4. PyTorch ジョブ固有のパラメーター

    パラメーター

    必須

    説明

    タイプ

    ジョブパラメーターファイルでのサポート

    workspace_id

    はい

    ワークスペース ID です。デフォルト値は空です。ワークスペースの作成方法については、「Create and manage workspaces」をご参照ください。

    STRING

    はい

    master_image

    いいえ

    PyTorch マスターノードのイメージです。デフォルト値は空です。

    STRING

    はい

    master_spec

    いいえ

    PyTorch マスターノードが使用するインスタンスタイプです。デフォルト値は空です。

    STRING

    はい

    masters

    いいえ

    PyTorch マスターノードの数です。デフォルト値は 0 です。

    INT

    はい

    worker_image

    いいえ

    PyTorch ワーカーノードのイメージです。デフォルト値は空です。

    STRING

    はい

    worker_spec

    いいえ

    PyTorch ワーカーノードが使用するインスタンスタイプです。デフォルト値は空です。

    STRING

    はい

    workers

    いいえ

    PyTorch ワーカーノードの数です。デフォルト値は 0 です。

    INT

    はい

    表 5. 専用リソースグループへの PyTorch ジョブの送信に固有のパラメーター

    パラメーター

    必須

    説明

    タイプ

    ジョブパラメーターファイルでのサポート

    resource_id

    いいえ (専用リソースグループにジョブを送信する場合は必須)

    専用リソースクォータの ID です。デフォルト値は空です。専用リソースクォータの作成方法については、「General computing resource quotas」をご参照ください。

    STRING

    はい

    priority

    いいえ

    ジョブ優先度です。デフォルト値は 1 です。

    INT

    はい

    master_cpu

    いいえ

    PyTorch マスターノードが使用する CPU の数です。デフォルト値は空です。

    STRING

    はい

    master_gpu

    いいえ

    PyTorch マスターノードが使用する GPU の数です。デフォルト値は空です。

    STRING

    はい

    master_gpu_type

    いいえ

    PyTorch マスターノードが使用する GPU のタイプです。デフォルト値は空です。例: GU50。

    STRING

    はい

    master_memory

    いいえ

    PyTorch マスターノードが使用するメモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。

    STRING

    はい

    master_shared_memory

    いいえ

    PyTorch マスターノードの共有メモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。

    STRING

    はい

    worker_cpu

    いいえ

    PyTorch ワーカーノードが使用する CPU の数です。デフォルト値は空です。

    STRING

    はい

    worker_gpu

    いいえ

    PyTorch ワーカーノードが使用する GPU の数です。デフォルト値は空です。

    STRING

    はい

    worker_gpu_type

    いいえ

    PyTorch ワーカーノードが使用する GPU のタイプです。デフォルト値は空です。例: GU50。

    STRING

    はい

    worker_memory

    いいえ

    PyTorch ワーカーノードが使用するメモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。

    STRING

    はい

    worker_shared_memory

    いいえ

    PyTorch ワーカーノードの共有メモリリソースです。デフォルト値は空です。例: 500 Mi、1 Gi。

    STRING

    はい

  • コマンドラインパラメーターを使用して GPU モデルトレーニングジョブを送信する例は、次のとおりです。

    ./dlc submit pytorchjob --name=test_pt_face \
      --workers=1 \
      --worker_spec=ecs.gn6e-c12g1.3xlarge \
      --worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/pytorch-training:1.7.1-gpu-py37-cu110-ubuntu18.04 \
      --command="apt-get update; apt-get -y --allow-downgrades install libpcre3=2:8.38-3.1 libpcre3-dev libgl1-mesa-glx libglib2.0-dev; cd /root/data/face; python train.py --num_workers 0 --save_folder outputs" \
      --data_sources=d-pcsah1t86b********:v1:/mnt/data/ \
      --workspace_id=*****

    コマンドラインパラメーターを使用してスポットリソースを使用するモデルトレーニングジョブを送信する例は、次のとおりです。

    ./dlc submit pytorchjob --name=test_pt_face \
      --workers=1 \
      --elastic_spot_specs=ml.gp7vf.16.40xlarge:discount:1,ml.gu8tef.8.46xlarge:discount:1,ml.gu8tf.8.40xlarge:discount:0.5 \
      --worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/pytorch-training:1.7.1-gpu-py37-cu110-ubuntu18.04 \
      --command="apt-get update; apt-get -y --allow-downgrades install libpcre3=2:8.38-3.1 libpcre3-dev libgl1-mesa-glx libglib2.0-dev; cd /root/data/face; python train.py --num_workers 0 --save_folder outputs" \
      --workspace_id=*****

    システムは次のような結果を返します:

    +----------------------------------+--------------------------------------+
    |              JobId               |              RequestId               |
    +----------------------------------+--------------------------------------+
    | dlcu704xxuxk****                 | xxxxxxxx-79AF-4EFC-9CE9-xxxxxxxxxxxx |
    +----------------------------------+--------------------------------------+

XGBoost トレーニングジョブの送信 (submit xgboostjob)

  • 機能

    XGBoost トレーニングジョブを送信するために使用します。

  • 構文

    コマンドラインパラメーターまたはジョブパラメーターファイルのいずれかを使用して XGBoost ジョブを送信できます。

    ./dlc submit xgboostjob [flags]
  • パラメーター

    コマンドラインパラメーターを使用して XGBoost ジョブを送信する場合、コマンド内のパラメーターを実際の値に置き換えます。ジョブパラメーターファイルを使用して送信する場合、ファイルに <parameterName>=<parameterValue> の形式でパラメーターを記述します。XGBoost ジョブを送信するための共通パラメーターは、このトピックの冒頭に記載されています。以下は XGBoost ジョブに固有のパラメーターです:

    表 6. XGBoost ジョブ固有のパラメーター

    パラメーター

    必須

    説明

    タイプ

    ジョブパラメーターファイルでサポート

    workspace_id

    はい

    ワークスペース ID です。デフォルト値は空です。ワークスペースの作成方法については、「ワークスペースの作成と管理」をご参照ください。

    STRING

    はい

    master_image

    いいえ

    XGBoost マスターノードのイメージです。デフォルト値は空です。

    STRING

    はい

    master_spec

    いいえ

    XGBoost マスターノードが使用するインスタンスタイプです。デフォルト値は空です。

    STRING

    はい

    masters

    いいえ

    XGBoost マスターノードの数です。デフォルト値は 0 です。

    INT

    はい

    worker_image

    いいえ

    XGBoost ワーカーノードのイメージです。デフォルト値は空です。

    STRING

    はい

    worker_spec

    いいえ

    XGBoost ワーカーノードが使用するインスタンスタイプです。デフォルト値は空です。

    STRING

    はい

    workers

    いいえ

    XGBoost ワーカーノードの数です。デフォルト値は 0 です。

    INT

    はい

    表 7. 専用リソースグループに XGBoost ジョブを送信する場合の固有パラメーター

    パラメーター

    必須

    説明

    タイプ

    ジョブパラメーターファイルでサポート

    resource_id

    いいえ (専用リソースグループにジョブを送信する場合は必須)

    専用リソースクォータの ID です。デフォルト値は空です。リソースクォータの作成方法については、「汎用コンピューティングリソースクォータ」をご参照ください。

    STRING

    はい

    priority

    いいえ

    ジョブの優先度です。デフォルト値は 1 です。

    INT

    はい

    master_cpu

    いいえ

    XGBoost マスターノードが使用する CPU の数です。デフォルト値は空です。

    STRING

    はい

    master_gpu

    いいえ

    XGBoost マスターノードが使用する GPU の数です。デフォルト値は空です。

    STRING

    はい

    master_gpu_type

    いいえ

    XGBoost マスターノードが使用する GPU のタイプです。デフォルト値は空です。例:GU50

    STRING

    はい

    master_memory

    いいえ

    XGBoost マスターノードが使用するメモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi

    STRING

    はい

    master_shared_memory

    いいえ

    XGBoost マスターノードの共有メモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi

    STRING

    はい

    worker_cpu

    いいえ

    XGBoost ワーカーノードが使用する CPU の数です。デフォルト値は空です。

    STRING

    はい

    worker_gpu

    いいえ

    XGBoost ワーカーノードが使用する GPU の数です。デフォルト値は空です。

    STRING

    はい

    worker_gpu_type

    いいえ

    XGBoost ワーカーノードが使用する GPU のタイプです。デフォルト値は空です。例:GU50

    STRING

    はい

    worker_memory

    いいえ

    XGBoost ワーカーノードが使用するメモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi

    STRING

    はい

    worker_shared_memory

    いいえ

    XGBoost ワーカーノードの共有メモリリソースです。デフォルト値は空です。例:500 Mi、1 Gi

    STRING

    はい

  • コマンドラインパラメーターを使用して XGBoost ジョブを送信します。例:

    ./dlc submit xgboostjob --name=test_xgboost \
      --workers=1 \
      --worker_spec=ecs.gn6e-c12g1.3xlarge \
      --worker_image=xgboost-training:1.6.0-cpu-py36-ubuntu18.04 \
      --command="python /root/code/horovod/xgboost/main.py --job_type=Train --xgboost_parameter=objective:multi:softprob,num_class:3 --n_estimators=50 --model_path=autoAI/xgb-opt/2" \
      --data_sources=d-pcsah1t86b********:v1:/mnt/data/ \
      --workspace_id=*****

    システムは次のような結果を返します:

    +----------------------------------+--------------------------------------+
    |              JobId               |              RequestId               |
    +----------------------------------+--------------------------------------+
    | dlc1nvu3gli0****                 | xxxxxxxx-79AF-4EFC-9CE9-xxxxxxxxxxxx |
    +----------------------------------+--------------------------------------+

ジョブ送信の高度なパラメーター

特定のノードへのジョブのスケジューリング

Lingjun インテリジェントコンピューティングまたは汎用コンピューティングのリソースクォータを使用してジョブを送信する場合、DLC コマンドラインでパラメーターを設定することで、ジョブを特定のノードにスケジューリングできます。

説明

この機能は現在、ホワイトリストに登録されたユーザーのみが利用できます。アクセスが必要な場合は、アカウントマネージャーに連絡してホワイトリストへの追加を依頼してください。

  • パラメーター

    パラメーター

    説明

    値の例

    --allow_nodes="${allow_nodes}"

    ノード名のリストを指定します。複数のノード名はカンマ (,) で区切ります。ノード名の間にスペースを含めないでください。

    lingjuc47iextvg9-****,lingjuc47iextvg9-****

    --deny_nodes="${deny_nodes}"

    除外するノードのリストを指定します。複数のノード名はカンマ (,) で区切ります。ノード名の間にスペースを含めないでください。

    lingjuc47iextvg9-****,lingjuc47iextvg9-****

  • コマンドラインパラメーター

    コマンドラインパラメーターを使用してジョブを送信します。例:

    • スケジューリングノードの指定なし

      ./dlc submit pytorchjob --name=assign_node_test_no_node  \--workers=1 \
          --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \
          --command="sleep 1000" \
          --workspace_id='****' \
          --resource_id='quotau2h98mt****' \
          --worker_cpu="1" \
          --worker_memory='2Gi'  
    • スケジューリングノードの指定

      ./dlc submit pytorchjob --name=assign_node_test_2_allow_nodes  \--workers=1 \
          --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \
          --command="sleep 1000" \
          --workspace_id='****' \
          --resource_id='quotau2h98mt****' \
          --worker_cpu="1" \
          --worker_memory='2Gi' \
          --allow_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****" 
    • 特定のノードの除外

       ./dlc submit pytorchjob --name=assign_node_test_two_deny_nodes  \--workers=1 \
          --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \
          --command="sleep 1000" \
          --workspace_id='****' \
          --resource_id='quotau2h98mt****' \
          --worker_cpu="1" \
          --worker_memory='2Gi' \
          --deny_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****"
    • スケジューリングノードの指定と特定のノードの除外

      ./dlc submit pytorchjob --name=assign_node_test_two_allow_two_deny  \--workers=1 \
          --worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04 \
          --command="sleep 1000" \
          --workspace_id='****' \
          --resource_id='quotau2h98mt****' \
          --worker_cpu="1" \
          --worker_memory='2Gi' \
          --allow_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****" \
          --deny_nodes="lingjuc47iextvg9-****,lingjuc47iextvg9-****"

    ファイルベースの設定

    ファイルベースの設定を使用してジョブを送信します。例:

    ./dlc submit pytorchjob -f job_file

    ここで、job_file はジョブパラメーターファイルです。内容は次のとおりです:

    • スケジューリングノードの指定なし

      name=assign_node_test_no_node
      workers=1
      worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04
      command=sleep 1000
      workspace_id=****
      resource_id=quotau2h98mt****
      worker_cpu=1
      worker_memory=2Gi
      
    • スケジューリングノードの指定

      name=assign_node_test_2_allow_nodes
      workers=1
      worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04
      command=sleep 1000
      workspace_id=****
      resource_id=quotau2h98mt****
      worker_cpu=1
      worker_memory=2Gi
      allow_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-****
      
    • 特定のノードの除外

      name=assign_node_test_two_deny_nodes
      workers=1
      worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04
      command=sleep 1000
      workspace_id=****
      resource_id=quotau2h98mt****
      worker_cpu=1
      worker_memory=2Gi
      deny_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-****
      
    • スケジューリングノードの指定と特定のノードの除外

      name=assign_node_test_two_allow_two_deny
      workers=1
      worker_image=dsw-registry-vpc.****.cr.aliyuncs.com/pai/easyanimate:1.1.5-pytorch2.2.0-gpu-py310-cu118-ubuntu22.04
      command=sleep 1000
      workspace_id=****
      resource_id=quotau2h98mt****
      worker_cpu=1
      worker_memory=2Gi
      allow_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-****
      deny_nodes=lingjuc47iextvg9-****,lingjuc47iextvg9-****
      

ジョブ送信時の従量課金在庫確認の無効化

DLC コマンドラインで disable_ecs_stock_check パラメーターを設定することで、従量課金の在庫確認を無効にできます。

  • パラメーター

    パラメーター

    説明

    値の例

    disable_ecs_stock_check

    従量課金の在庫確認を無効にするかどうかを指定します。有効な値:

    • false (デフォルト):従量課金の在庫確認を有効にします。

    • true:従量課金の在庫確認を無効にします。

    true または false

  • コマンドラインパラメーター

    コマンドラインパラメーターを使用してジョブを送信します。例:

    • 従量課金在庫確認の有効化

      ./dlc submit pytorchjob \
          --name=test_skip_checking3 \
          --command='sleep 1000' \
          --workspace_id=**** \
          --priority=1 \
          --workers=1 \
          --worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04 \
          --worker_spec=ecs.g6.xlarge  
    • 従量課金在庫確認の無効化

      ./dlc submit pytorchjob \
          --name=test_skip_checking3 \
          --command='sleep 1000' \
          --workspace_id=**** \
          --priority=1 \
          --workers=1 \
          --worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04 \
          --worker_spec=ecs.g6.xlarge \
          --disable_ecs_stock_check=true
       

    ファイルベースの設定

    ファイルベースの設定を使用してジョブを送信します。例:

    ./dlc submit pytorchjob -f job_file

    ここで、job_file はジョブパラメーターファイルです。内容は次のとおりです:

    • 従量課金在庫確認の有効化

      name=test_skip_checking3
      workers=1
      worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04
      command=sleep 1000
      workspace_id=****
      worker_spec=ecs.g6.xlarge
      
    • 従量課金在庫確認の無効化

      name=test_skip_checking3
      workers=1
      worker_image=registry.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.12PAI-gpu-py36-cu101-ubuntu18.04
      command=sleep 1000
      workspace_id=****
      worker_spec=ecs.g6.xlarge
      disable_ecs_stock_check=true
      

関連ドキュメント