PAI-DLC memungkinkan Anda membuat pekerjaan pelatihan single-node atau terdistribusi dengan cepat. Kubernetes secara otomatis menyediakan node komputasi di latar belakang, sehingga menghilangkan kebutuhan untuk membeli mesin secara manual atau mengonfigurasi lingkungan runtime. Layanan ini mendukung framework pembelajaran mendalam populer seperti TensorFlow dan PyTorch serta menyediakan opsi konfigurasi sumber daya yang fleksibel.
Mulai cepat
Dengan menggunakan pengenalan digit tulisan tangan MNIST sebagai contoh, panduan ini akan memandu Anda melalui pelatihan single-node dengan satu GPU dan pelatihan terdistribusi multi-node dengan multi-GPU menggunakan DLC. Untuk detail selengkapnya, lihat Memulai Deep Learning Containers (DLC).
Referensi parameter Konsol
Informasi dasar
|
Parameter |
Deskripsi |
|
Job Name |
Tetapkan nama yang mudah dikenali untuk pekerjaan. |
|
Tag |
Terapkan tag standar pada pekerjaan Anda. Tag menjadi dasar untuk mengarsipkan pekerjaan berdasarkan label, menganalisis distribusi pekerjaan, dan melacak konsumsi sumber daya. Batasan berikut berlaku:
Untuk panduan tentang penandaan standar, lihatStandarisasi penandaan untuk DLC, DSW, dan EAS. |
|
Task Description |
Gunakan bidang ini untuk menjelaskan tujuan, latar belakang, atau konteks lain dari pekerjaan. |
Informasi lingkungan
|
Parameter |
Deskripsi |
|
Image Configuration |
Selain Alibaba Cloud Image, jenis gambar berikut juga didukung:
|
|
Mount dataset |
Dataset menyediakan file data yang dibutuhkan untuk pelatihan model. Dua jenis dataset berikut didukung:
Mount Path: Jalur tempat dataset dipasang di dalam kontainer DLC, misalnya Penting
Jika Anda menggunakan dataset CPFS, Anda harus mengonfigurasi VPC untuk DLC yang sesuai dengan VPC CPFS. Jika tidak, pekerjaan yang dikirimkan mungkin tetap berada dalam status Preparing environment untuk waktu yang lama. |
|
Mount storage |
Anda juga dapat memasang jalur sumber data secara langsung untuk membaca data yang dibutuhkan atau menyimpan file antara dan hasil.
Untuk informasi lebih lanjut, lihatGunakan penyimpanan cloud. |
|
Startup Command |
Tetapkan perintah startup pekerjaan. Perintah shell didukung. DLC secara otomatis menyuntikkanvariabel lingkungan umum PyTorch dan TensorFlow seperti
Penting
Jalur pemasangan yang dikonfigurasi untuk kode (seperti /mnt/data) adalah lokasi file kode Anda di dalam kontainer DLC. Perintah startup Anda harus mereferensikan file kode menggunakan jalur ini. Contohnya, jika jalur pemasangan kode adalah /mnt/data dan file kode Anda adalah train.py, perintah startup harus: python /mnt/data/train.py |
Informasi sumber daya
|
Parameter |
Deskripsi |
|
Resource Type |
Default ke General Computing. Lingjun Intelligence Resources tersedia di wilayah berikut: Tiongkok (Ulanqab), Singapura, Tiongkok (Shenzhen), Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Guangzhou), Tiongkok (Hong Kong), Malaysia, Jerman, dan Atlanta. |
|
Source |
|
|
Framework |
Framework dan alat pelatihan pembelajaran mendalam berikut didukung: TensorFlow, PyTorch, ElasticBatch, XGBoost, OneFlow, MPIJob, Ray, Custom, DataJuicer, dan MPI. Catatan
Ketika Resource Quota diatur ke sumber daya Lingjun, hanya pekerjaan TensorFlow, PyTorch, ElasticBatch, MPIJob, dan Ray yang didukung. |
|
Job Resource |
Berdasarkan Framework yang dipilih, Anda dapat mengonfigurasi sumber daya untuk tipe node Worker, PS, Chief, Evaluator, dan GraphLearn. Saat menggunakan framework Ray, Anda dapat mengklik Add Role untuk menyesuaikan peran Worker, memungkinkan eksekusi campuran sumber daya heterogen.
|
|
Scheduling Policy |
Anda dapat menyesuaikan strategi penjadwalan sumber daya kontainer berdasarkan skenario bisnis dan karakteristik pekerjaan Anda:
|
DLC tidak mendukung modifikasi langsung tipe instans pekerjaan yang telah dikirimkan. Untuk mengubah tipe instans (misalnya, beralih ke instans yang mendukung jaringan berkinerja tinggi eRDMA, seperti ecs.ebmgn8v.48xlarge), gunakan fitur Clone Job untuk membuat pekerjaan baru, pilih tipe instans target, lalu kirimkan. Platform secara otomatis mengaktifkan jaringan berkinerja tinggi dan mengonfigurasi parameter terkait NCCL. Untuk mengubah versi NVIDIA driver dan CUDA instans, gunakan fitur konfigurasi instans untuk mengubah versi driver (misalnya, ke versi 580). Platform secara otomatis menarik gambar DLC yang sesuai berdasarkan konfigurasi baru guna memperbarui lingkungan runtime, menyelesaikan perubahan driver, peningkatan CUDA, atau penggantian driver GPU.
Konfigurasi VPC
Jika tidak ada VPC yang dikonfigurasi, jaringan publik dan gateway publik akan digunakan. Karena gateway publik memiliki bandwidth terbatas, pekerjaan mungkin mengalami perlambatan atau gagal berjalan dengan baik selama eksekusi.
-
Mengonfigurasi VPC serta memilih vSwitch dan security group yang sesuai meningkatkan bandwidth jaringan, stabilitas, dan keamanan. Kluster yang menjalankan pekerjaan Anda juga dapat langsung mengakses layanan di dalam VPC tersebut.
PentingSaat menggunakan VPC, pastikan bahwa instans kelompok sumber daya pekerjaan, penyimpanan dataset (OSS), dan repositori kode semuanya berada dalam VPC yang sama di wilayah yang sama, serta konektivitas jaringan telah dibangun.
Saat menggunakan dataset CPFS, Anda harus mengonfigurasi VPC yang sesuai dengan VPC CPFS. Jika tidak, pekerjaan pelatihan DLC yang dikirimkan mungkin tetap berada dalam status Preparing environment untuk waktu yang lama.
Saat mengirimkan pekerjaan DLC menggunakan sumber daya spot Lingjun, Anda harus mengonfigurasi VPC.
Sebagai tambahan, Anda dapat mengonfigurasi Internet Access Gateway. Dua opsi berikut didukung:
Public Gateway: Bandwidth terbatas. Selama periode konkurensi tinggi atau saat mengunduh file besar, kecepatan jaringan mungkin tidak memenuhi permintaan.
Private Gateway: Untuk mengatasi keterbatasan bandwidth gateway publik, Anda dapat membuat gateway NAT di VPC DLC, mengaitkan EIP, dan mengonfigurasi entri SNAT. Untuk detail selengkapnya, lihat Tingkatkan akses internet dengan gateway privat.
Toleransi kesalahan dan diagnostik
|
Parameter |
Deskripsi |
|
Automatic Fault Tolerance |
Setelah mengaktifkan fitur Automatic Fault Tolerance dan mengonfigurasi parameter terkait, sistem menyediakan kemampuan pemantauan dan kontrol pekerjaan. Sistem dapat mendeteksi kesalahan tingkat algoritma secara real-time dan mengambil tindakan korektif, meningkatkan pemanfaatan GPU. Untuk detail selengkapnya, lihatAIMaster: Mesin toleransi kesalahan otomatis elastis. Catatan
Saat toleransi kesalahan otomatis diaktifkan, sistem meluncurkan instans AIMaster bersama instans pekerjaan, yang mengonsumsi sumber daya komputasi tambahan. Detail penggunaan sumber daya instans AIMaster:
|
|
Sanity Check |
Setelah mengaktifkan fitur Sanity Check, pemeriksaan kesehatan memeriksa secara menyeluruh sumber daya yang terlibat dalam pelatihan, secara otomatis mengisolasi node yang rusak, dan memicu operasi otomatis latar belakang. Hal ini secara efektif mengurangi kemungkinan masalah selama tahap awal pelatihan dan meningkatkan tingkat keberhasilan pelatihan. Untuk detail selengkapnya, lihatSanityCheck: Pemeriksaan kesehatan komputasi. Catatan
Fitur pemeriksaan kesehatan hanya didukung untuk pekerjaan pelatihan PyTorch yang dikirimkan dengan kuota sumber daya Lingjun dan ketika jumlah GPU lebih dari 0. |
Peran dan izin
Konfigurasi peran RAM instans dijelaskan di bawah ini. Untuk detail selengkapnya, lihat Konfigurasi peran RAM untuk DLC.
|
Instance RAM role |
Deskripsi |
|
Default Role of PAI |
Beroperasi berdasarkan peran layanan AliyunPAIDLCDefaultRole, yang hanya memiliki akses ke MaxCompute dan OSS, dengan izin yang lebih terperinci. Kredensial sementara yang dikeluarkan berdasarkan peran default PAI:
|
|
Custom Role |
Pilih atau tentukan peran RAM kustom. Saat mengakses layanan cloud dari dalam instans menggunakan kredensial sementara STS, izinnya konsisten dengan peran kustom tersebut. |
|
Does Not Associate Role |
Tidak ada peran RAM yang dikaitkan dengan pekerjaan DLC. Ini adalah opsi default. |
Dokumentasi terkait
Lihat informasi dasar pekerjaan, tampilan sumber daya, dan log operasi. Untuk detail selengkapnya, lihat Detail pelatihan.
Lihat detail penagihan untuk eksekusi pekerjaan. Untuk detail selengkapnya, lihat Detail penagihan.
Untuk masalah umum pekerjaan DLC dan solusinya, lihat FAQ tentang DLC.
Untuk kasus penggunaan DLC, lihat Kasus penggunaan DLC.
FAQ
T: Apa yang harus saya lakukan jika mendapatkan error BadRequest tentang memilih sumber data NAS dengan titik pemasangan saat membuat pekerjaan pelatihan?
Error ini terjadi ketika sumber data NAS tidak memiliki titik pemasangan. Buat titik pemasangan baru di konsol NAS, lalu pilih sebagai sumber data di konfigurasi Mount dataset atau Mount storage saat membuat pekerjaan pelatihan, kemudian kirim ulang pekerjaan.
T: Apakah pekerjaan pelatihan DLC dapat mengekspor metrik ke Weights & Biases (W&B)?
Ya, DLC mendukung ekspor metrik pelatihan ke W&B, tetapi prasyarat berikut harus dipenuhi:
Konektivitas jaringan: Pastikan node pelatihan PAI dapat mengakses titik akhir publik api.wandb.ai. Jika menggunakan VPC, konfigurasikan gateway NAT.
Manajemen kunci: Suntikkan kunci API W&B melalui variabel lingkungan. Jangan hardcode di kode Anda.
Kepatuhan: Unggah hanya metrik skalar non-sensitif. Jangan unggah data mentah atau detail model sensitif.
T: Apakah pekerjaan DLC yang gagal tetap muncul di daftar pekerjaan?
Hal ini bergantung pada alasan kegagalannya:
Pekerjaan yang gagal karena sumber daya tidak mencukupi sementara muncul di daftar pekerjaan konsol DLC dan dihapus setelah penghapusan.
Ketika API mengembalikan error langsung (dengan RequestID) karena parameter permintaan tidak valid, tidak ada catatan yang disimpan di daftar pekerjaan. Pesan error hanya ditampilkan di halaman operasi.
T: Apa yang harus saya lakukan jika melihat pesan "perlindungan keamanan akun dipicu" atau "alokasi sumber daya ditangguhkan" saat membuat pekerjaan DLC?
Pesan ini biasanya dipicu oleh kebijakan pengendalian risiko akun. Gunakan alat diagnostik mandiri Alibaba Cloud (https://smartservice.console.alibabacloud.com/service/self-service-center/search?questionId=27591) untuk mendiagnosis mengapa pembayaran atau alokasi sumber daya tidak dapat dilanjutkan, lalu ajukan banding. Setelah banding disetujui, Anda dapat mencoba kembali membuat pekerjaan.
Lampiran
Buat pekerjaan menggunakan SDK atau CLI
Python SDK
Langkah 1: Instal alat Credentials Alibaba Cloud
Saat Anda memanggil OpenAPI menggunakan SDK Alibaba Cloud untuk mengelola sumber daya, Anda harus menginstal alat Credentials untuk mengonfigurasi kredensial Anda. Persyaratan:
Versi Python >= 3.7.
Gunakan SDK Alibaba Cloud V2.0.
pip install alibabacloud_credentials
Langkah 2: Dapatkan AccessKey akun Anda
Contoh ini menggunakan informasi AccessKey (AK) untuk mengonfigurasi kredensial akses. Untuk mencegah kebocoran kredensial, kami sarankan Anda menyimpan AccessKey di variabel lingkungan. Nama variabel lingkungan untuk ID dan secret adalah ALIBABA_CLOUD_ACCESS_KEY_ID dan ALIBABA_CLOUD_ACCESS_KEY_SECRET.
Untuk informasi tentang cara mendapatkan AccessKey, lihat Buat AccessKey.
Untuk informasi tentang cara mengonfigurasi variabel lingkungan, lihat Konfigurasi variabel lingkungan.
Untuk metode konfigurasi kredensial lainnya, lihat Instal alat Credentials.
Langkah 3: Instal Python SDK
-
Instal SDK workspace.
pip install alibabacloud_aiworkspace20210204==3.0.1 -
Instal SDK DLC.
pip install alibabacloud_pai_dlc20201203==1.4.17
Langkah 4: Kirim pekerjaan
Kirim pekerjaan menggunakan sumber daya publik
Kode contoh berikut menunjukkan cara membuat dan mengirim pekerjaan:
Kirim pekerjaan menggunakan kuota sumber daya langganan
Masuk ke Konsol PAI.
Lihat ID ruang kerja: Di panel navigasi kiri, klik Workspace List. Temukan ruang kerja target, klik ikon ⓘ di sebelah nama, lalu lihat dan salin Workspace ID di panel informasi yang muncul.
Lihat ID kuota sumber daya dari kelompok sumber daya khusus Anda. Di panel navigasi kiri, pilih AI Computing Resources > Resource Quota. Klik tab General Computing Resources, lalu dapatkan ID Kuota dari kolom Name/ID di daftar kuota sumber daya.
-
Gunakan kode berikut untuk membuat dan mengirim pekerjaan. Untuk daftar gambar publik yang dapat Anda gunakan, lihat Langkah 2: Siapkan gambar.
from alibabacloud_pai_dlc20201203.client import Client from alibabacloud_credentials.client import Client as CredClient from alibabacloud_tea_openapi.models import Config from alibabacloud_pai_dlc20201203.models import ( CreateJobRequest, JobSpec, ResourceConfig, GetJobRequest ) # 初始化一个Client,用来访问DLC的API。 region = 'cn-hangzhou' # 阿里云账号AccessKey拥有所有API的访问权限,建议您使用RAM用户进行API访问或日常运维。 # 强烈建议不要把AccessKey ID和AccessKey Secret保存到工程代码里,否则可能导致AccessKey泄露,威胁您账号下所有资源的安全。 # 本示例通过Credentials SDK默认从环境变量中读取AccessKey,来实现身份验证为例。 cred = CredClient() client = Client( config=Config( credential=cred, region_id=region, endpoint=f'pai-dlc.{region}.aliyuncs.com', ) ) # 声明任务的资源配置,关于镜像选择可以参考文档中公共镜像列表,也可以传入自己的镜像地址。 spec = JobSpec( type='Worker', image=f'registry-vpc.cn-hangzhou.aliyuncs.com/pai-dlc/tensorflow-training:1.15-cpu-py36-ubuntu18.04', pod_count=1, resource_config=ResourceConfig(cpu='1', memory='2Gi') ) # 声明任务的执行内容。 req = CreateJobRequest( resource_id='<替换成您自己的资源配额ID>', workspace_id='<替换成您自己的WorkspaceID>', display_name='sample-dlc-job', job_type='TFJob', job_specs=[spec], user_command='echo "Hello World"', ) # 提交任务。 response = client.create_job(req) # 获取任务ID。 job_id = response.body.job_id # 查询任务状态。 job = client.get_job(job_id, GetJobRequest()).body print('job status:', job.status) # 查看任务执行的命令。 job.user_command
Kirim pekerjaan menggunakan sumber daya spot
SpotDiscountLimit (Diskon spot) ``
#!/usr/bin/env python3 from alibabacloud_tea_openapi.models import Config from alibabacloud_credentials.client import Client as CredClient from alibabacloud_pai_dlc20201203.client import Client as DLCClient from alibabacloud_pai_dlc20201203.models import CreateJobRequest region_id = '<region-id>' # Region ID where the DLC job runs. Example: cn-hangzhou for China (Hangzhou). cred = CredClient() workspace_id = '12**' # Workspace ID of the DLC job. dlc_client = DLCClient( Config(credential=cred, region_id=region_id, endpoint='pai-dlc.{}.aliyuncs.com'.format(region_id), protocol='http')) create_job_resp = dlc_client.create_job(CreateJobRequest().from_map({ 'WorkspaceId': workspace_id, 'DisplayName': 'sample-spot-job', 'JobType': 'PyTorchJob', 'JobSpecs': [ { "Type": "Worker", "Image": "dsw-registry-vpc.<region-id>.cr.aliyuncs.com/pai/pytorch-training:1.12-cpu-py39-ubuntu20.04", "PodCount": 1, "EcsSpec": 'ecs.g7.xlarge', "SpotSpec": { "SpotStrategy": "SpotWithPriceLimit", "SpotDiscountLimit": 0.4, } }, ], 'UserVpc': { "VpcId": "vpc-0jlq8l7qech3m2ta2", "SwitchId": "vsw-0jlc46eg4k3pivwpz8", "SecurityGroupId": "sg-0jl4bd9wwh5auei9**", }, "UserCommand": "echo 'Hello World' && ls -R /mnt/data/ && sleep 30 && echo 'DONE'", })) job_id = create_job_resp.body.job_id print(f'jobId is {job_id}')``SpotPriceLimit (Harga spot) ``
#!/usr/bin/env python3 from alibabacloud_tea_openapi.models import Config from alibabacloud_credentials.client import Client as CredClient from alibabacloud_pai_dlc20201203.client import Client as DLCClient from alibabacloud_pai_dlc20201203.models import CreateJobRequest region_id = '<region-id>' cred = CredClient() workspace_id = '12**' dlc_client = DLCClient( Config(credential=cred, region_id=region_id, endpoint='pai-dlc.{}.aliyuncs.com'.format(region_id), protocol='http')) create_job_resp = dlc_client.create_job(CreateJobRequest().from_map({ 'WorkspaceId': workspace_id, 'DisplayName': 'sample-spot-job', 'JobType': 'PyTorchJob', 'JobSpecs': [ { "Type": "Worker", "Image": "dsw-registry-vpc.<region-id>.cr.aliyuncs.com/pai/pytorch-training:1.12-cpu-py39-ubuntu20.04", "PodCount": 1, "EcsSpec": 'ecs.g7.xlarge', "SpotSpec": { "SpotStrategy": "SpotWithPriceLimit", "SpotPriceLimit": 0.011, } }, ], 'UserVpc': { "VpcId": "vpc-0jlq8l7qech3m2ta2", "SwitchId": "vsw-0jlc46eg4k3pivwpz8", "SecurityGroupId": "sg-0jl4bd9wwh5auei9**", }, "UserCommand": "echo 'Hello World' && ls -R /mnt/data/ && sleep 30 && echo 'DONE'", })) job_id = create_job_resp.body.job_id print(f'jobId is {job_id}')``
Konfigurasi utama dijelaskan sebagai berikut:
Parameter | Deskripsi |
SpotStrategy | Strategi penawaran. Jenis penawaran hanya berlaku ketika parameter ini diatur keSpotWithPriceLimit. |
SpotDiscountLimit | Menggunakan diskon spot sebagai metode penawaran. Note
|
SpotPriceLimit | Menggunakan harga spot sebagai metode penawaran. |
UserVpc | Diperlukan saat Anda mengirimkan pekerjaan menggunakan sumber daya spot Lingjun. Konfigurasikan VPC, vSwitch, dan ID security group dari wilayah tempat pekerjaan berjalan. |
Saat Anda membuat pekerjaan DLC dengan memanggil API atau menggunakan SDK (createJob), Anda tidak dapat mengunggah file kode lokal secara langsung. Unggah kode Anda ke salah satu lokasi berikut terlebih dahulu:
Repositori Git: Buat konfigurasi kode di AI Assets Management dan tautkan ke URL repositori Git.
Penyimpanan OSS: Setelah mengunggah kode ke OSS, buat tersedia untuk pekerjaan dengan memasangnya sebagai dataset.
Gambar kustom: Kemas kode ke dalam gambar Docker.
Baris perintah
Langkah 1: Unduh klien dan selesaikan autentikasi pengguna
Unduh alat klien Linux 64-bit atau Mac sesuai sistem operasi Anda, lalu selesaikan autentikasi pengguna. Untuk detail selengkapnya, lihat Sebelum memulai.
Langkah 2: Kirim pekerjaan
Masuk ke Konsol PAI.
-
Ikuti instruksi berikut untuk melihat ID ruang kerja Anda (WorkspaceID) di halaman daftar ruang kerja.
Di panel navigasi kiri, klik Workspace List. Temukan ruang kerja target, klik ikon ⓘ di sebelah kanan namanya, lalu lihat Workspace ID di panel informasi yang muncul.
-
Ikuti instruksi berikut untuk melihat ID kuota sumber daya Anda.
Di panel navigasi kiri, pilih AI Computing Resources > Resource Quota. Pilih tab untuk jenis sumber daya target Anda (seperti General Computing Resources), lalu dapatkan ID kuota sumber daya dari kolom Name/ID di daftar kuota sumber daya.
-
Siapkan file parameter berdasarkan konten berikut
tfjob.params. Untuk informasi lebih lanjut tentang cara mengonfigurasi file parameter, lihat Perintah yang digunakan untuk mengirim pekerjaan.name=test_cli_tfjob_001 workers=1 worker_cpu=4 worker_gpu=0 worker_memory=4Gi worker_shared_memory=4Gi worker_image=registry-vpc.cn-beijing.aliyuncs.com/pai-dlc/tensorflow-training:1.12.2PAI-cpu-py27-ubuntu16.04 command=echo good && sleep 120 resource_id=<your_resource_quota_id> workspace_id=<your_workspace_id> -
Gunakan kode contoh berikut untuk meneruskan parameter params_file. Ini mengirimkan pekerjaan DLC ke ruang kerja dan kuota sumber daya yang ditentukan.
./dlc submit tfjob --job_file ./tfjob.params -
Gunakan perintah berikut untuk melihat pekerjaan DLC yang Anda kirimkan.
./dlc get job <jobID>
Daftar parameter lanjutan
|
Parameter (kunci) |
Jenis framework yang didukung |
Deskripsi |
Nilai parameter |
|
|
ALL |
Mengonfigurasi kebijakan rilis sumber daya kustom. Parameter ini opsional. Jika Anda tidak mengonfigurasinya, semua sumber daya Pod dilepaskan ketika pekerjaan berakhir. Jika Anda mengonfigurasinya, satu-satunya nilai yang didukung adalah pod-exit, yang melepaskan sumber daya Pod ketika Pod keluar. |
pod-exit |
|
|
ALL |
Menentukan apakah akan mengaktifkan frame jumbo. Parameter ini hanya didukung oleh AI Computing Resources - General Computing 2.0 Nilai default adalah false, yang berarti dinonaktifkan. |
|
|
|
ALL |
Menentukan apakah akan mengaktifkan IBGDA saat driver GPU dimuat. |
|
|
|
ALL |
Menentukan apakah akan menginstal modul kernel GDRCopy. Versi yang saat ini diinstal adalah 2.4.4. |
|
|
|
ALL |
Menentukan apakah akan mengaktifkan NUMA. |
|
|
|
ALL |
Saat Anda mengirimkan pekerjaan, parameter ini memeriksa apakah total sumber daya (spesifikasi node) dalam kuota memenuhi spesifikasi semua peran dalam pekerjaan. |
|
|
|
PyTorch |
Menentukan apakah akan mengizinkan konektivitas jaringan antar worker.
Setelah diaktifkan, nama domain setiap worker adalah nama worker, seperti |
|
|
|
PyTorch |
Memungkinkan Anda menentukan port jaringan yang terbuka pada setiap worker. Anda dapat menggunakan parameter ini bersama dengan Jika tidak dikonfigurasi, hanya port 23456 yang terbuka pada master secara default. Pastikan Anda tidak memasukkan port 23456 dalam daftar port kustom ini. Penting
Parameter ini saling eksklusif dengan |
Kumpulan string yang dipisahkan titik koma, di mana setiap string adalah nomor port tunggal atau rentang port yang dihubungkan dengan tanda hubung, seperti |
|
|
PyTorch |
Memungkinkan Anda meminta sejumlah port jaringan untuk dibuka pada setiap worker. Anda dapat menggunakan parameter ini bersama dengan Jika tidak dikonfigurasi, hanya port 23456 yang terbuka pada master secara default. DLC secara acak menetapkan port ke worker berdasarkan jumlah port yang ditentukan dalam parameter. Nomor port yang ditetapkan diteruskan ke worker melalui variabel lingkungan Penting
|
Bilangan bulat (maksimum: 65536) |
|
|
Ray |
Saat framework adalah Ray, Anda dapat mengonfigurasi RayRuntimeEnv secara manual untuk menentukan lingkungan runtime. Penting
Variabel lingkungan dan konfigurasi pustaka pihak ketiga ditimpa oleh konfigurasi ini. |
Konfigurasikan variabel lingkungan dan pustaka pihak ketiga ( |
|
|
Ray |
Alamat Redis GCS eksternal. |
String |
|
|
Ray |
Username Redis GCS eksternal. |
String |
|
|
Ray |
Password Redis GCS eksternal. |
String |
|
|
Ray |
Jumlah percobaan ulang untuk submitter. |
Bilangan bulat positif (int) |
|
|
Ray |
Mengonfigurasi memori bersama untuk node. Contohnya, untuk mengonfigurasi 1 GiB memori bersama untuk setiap node, gunakan konfigurasi berikut:
|
Bilangan bulat positif (int) |
untuk memilih metode penawaran: