All Products
Search
Document Center

Platform For AI:Ikhtisar DLC

Last Updated:Jun 12, 2026

Deep Learning Containers (DLC) menyediakan lingkungan pelatihan berbasis Kubernetes yang siap pakai. Mulai pekerjaan pelatihan tanpa perlu menyiapkan kluster secara manual, dengan dukungan berbagai framework, Layanan Komputasi AI Lingjun, dan GPU.

Manfaat

  • Sumber daya komputasi beragam:

    Mendukung instans ECS, ECI, Shenlong Bare Metal, dan bare metal Lingjun di Layanan Komputasi AI Lingjun maupun sumber daya komputasi umum, dengan penjadwalan hibrida daya komputasi heterogen.

  • Berbagai jenis pekerjaan terdistribusi:

    Mendukung lebih dari 10 framework—Megatron, DeepSpeed, PyTorch, TensorFlow, Slurm, Ray, MPI, XGBoost—tanpa memerlukan kluster terpisah. Menyediakan image bawaan, lingkungan runtime kustom, serta pengiriman pekerjaan melalui Konsol, SDK, atau CLI.

  • Stabilitas tinggi:

    Untuk pelatihan model besar, DLC menyediakan AIMaster (toleransi kesalahan), EasyCKPT (checkpoint), SanityCheck (pemeriksaan kesehatan), dan self-healing node. Fitur-fitur ini mendeteksi dan memulihkan kegagalan secara otomatis, sehingga mengurangi kehilangan daya komputasi.

  • Kinerja tinggi:

    Framework akselerasi bawaan meningkatkan efisiensi pelatihan melalui parallelisme data, parallelisme pipeline, pemisahan operator, dan strategi parallel bersarang. Fitur tambahan mencakup eksplorasi otomatis strategi parallel, optimasi memori multi-dimensi, penjadwalan yang mempertimbangkan topologi, serta pustaka komunikasi teroptimalkan dengan fusi dan kompresi grup gradien. Dioptimalkan untuk pre-training model dasar, pelatihan lanjutan, dan penyelarasan.

Jenis sumber daya

Pilih jenis sumber daya saat mengirimkan pekerjaan pelatihan:

  • Layanan Komputasi AI Lingjun: Sumber daya komputasi yang dirancang untuk pelatihan model besar dan tugas pembelajaran mendalam skala sangat besar, seperti kendaraan otonom dan penelitian ilmiah.

  • Sumber daya komputasi umum: Cocok untuk kebutuhan pelatihan standar. Mendukung berbagai skala dan jenis tugas pembelajaran mesin.

Kedua jenis sumber daya tersedia dalam cara berikut:

  • Kuota sumber daya: Beli langganan ke Layanan Komputasi AI Lingjun atau sumber daya komputasi umum untuk manajemen sumber daya yang fleksibel.

  • Sumber daya publik: Gunakan sumber daya komputasi sesuai kebutuhan tanpa pembelian di muka. Ditagih berdasarkan skema pay-as-you-go.

  • Sumber daya preemptible: Dapatkan daya komputasi AI Lingjun dengan biaya lebih rendah menggunakan instans preemptible.

Kasus penggunaan

  • Pra-pemrosesan data

    Kustomisasi lingkungan runtime untuk pra-pemrosesan data secara paralel secara offline.

  • Pelatihan terdistribusi skala besar

    Jalankan pelatihan terdistribusi offline skala besar dengan framework open-source. Mendukung ribuan node secara simultan.

  • Inferensi offline

    Jalankan pekerjaan inferensi offline untuk meningkatkan pemanfaatan GPU yang menganggur.

Alur kerja

Alur kerja khas DLC:

  1. Persiapan

    Siapkan sumber daya komputasi, image, set data, dan repositori kode. Persiapan.

  2. Buat pekerjaan pelatihan

    Kirimkan pekerjaan pelatihan melalui Konsol, SDK, atau CLI. Buat pekerjaan pelatihan.

    Fitur lanjutan yang tersedia:

    • Toleransi kesalahan otomatis: Meluncurkan instans AIMaster untuk memantau pekerjaan dan memulihkan kegagalan secara otomatis.

    • Pemeriksaan kesehatan: Menjalankan SanityCheck pada sumber daya sebelum pelatihan dan secara otomatis mengisolasi node yang rusak untuk mengurangi kegagalan startup pekerjaan.

    • EasyCKPT: Menyimpan dan memulihkan model PyTorch besar tanpa kehilangan data, serta mendukung pelatihan lanjutan dari checkpoint.

    • Konfigurasi RDMA: Konfigurasikan jaringan RDMA untuk sumber daya Layanan Komputasi AI Lingjun guna mempercepat komunikasi antar-node dalam pelatihan terdistribusi.

    • Konfigurasi penyimpanan: Akses data pelatihan di OSS, NAS, CPFS, atau MaxCompute dengan mengonfigurasinya dalam kode Anda atau memasangnya sebagai volume.

    • Penerusan log SLS: Teruskan log pekerjaan DLC ke Logstore Log Service (SLS) tertentu untuk analisis dan pemantauan kustom.

    • Sumber daya preemptible: Gunakan sumber daya preemptible dari Layanan Komputasi AI Lingjun untuk mendapatkan daya komputasi AI dengan biaya lebih rendah.

    • Tingkatkan kecepatan akses jaringan publik: Secara default, DLC menggunakan gateway bersama dengan bandwidth terbatas untuk mengakses internet publik. Anda dapat membuat gateway khusus untuk meningkatkan kecepatan unggah dan unduh jaringan.

    • PerfTracker: Jika pekerjaan Anda mengalami masalah kinerja, gunakan PerfTracker, tool analisis dan diagnosis kinerja online. Tool ini menghasilkan laporan analisis dan mendiagnosis penyebab degradasi kinerja secara otomatis.

    • ACCL: ACCL adalah pustaka komunikasi kolektif yang dibangun di atas NCCL. Pustaka ini memberikan kinerja komunikasi lebih tinggi untuk pekerjaan Anda dan mencakup kemampuan diagnosis kesalahan serta self-healing.

  3. Tampilkan dan kelola pekerjaan pelatihan

    Setelah mengirimkan pekerjaan, tampilkan detail pekerjaan pelatihan untuk memantau status. Anda juga dapat menghentikan, mengkloning, berbagi, atau menghapus pekerjaan. Kelola pekerjaan pelatihan.

  4. Pantau pekerjaan pelatihan

    Pantau pekerjaan pelatihan dengan cara berikut:

  5. Konfigurasikan pekerjaan pelatihan terjadwal

    Untuk pelatihan berkelanjutan dan tuning model dengan data atau hiperparameter yang diperbarui, konfigurasikan penjadwalan offline untuk mengirimkan pekerjaan DLC secara berkala.

Jelajahi tutorial DLC untuk kasus penggunaan tambahan.

Topik terkait