All Products
Search
Document Center

Intelligent Computing LINGJUN:Ikhtisar Layanan Komputasi AI Lingjun

Last Updated:Aug 21, 2026

Layanan Komputasi AI Lingjun dirancang untuk skenario artificial intelligence, menyediakan layanan cloud publik komputasi AI yang stabil, efisien, dan sangat ekstensibel. Lingjun mendukung penskalaan jaringan berkinerja tinggi hingga 100.000 kartu GPU, dengan satu pekerjaan (job) yang mendukung ekstensibilitas hingga skala 10.000 kartu. Produk ini menyediakan fitur siap pakai, termasuk manajemen O&M dan manajemen job kluster. Layanan ini menghadirkan daya komputasi berskala besar dan berkerapatan tinggi untuk LLM/AIGC, kendaraan otonom, pencarian dan rekomendasi, scientific intelligence, kuantisasi finansial, serta industri dan domain lainnya. Dikombinasikan dengan kemampuan pemantauan komprehensif dan pemulihan kesalahan otomatis, produk ini menyediakan fondasi inovatif yang mengintegrasikan kinerja tinggi, ekstensibilitas tinggi, dan stabilitas tinggi bagi bisnis Anda—memberikan keunggulan sebagai pelopor di era AI.

Keunggulan Utama

  • Kluster Skala Ultra-Besar untuk Pelatihan dan Inferensi Terintegrasi

    Dirancang untuk LLM AI saat ini dan masa depan, solusi ini mendukung penerapan dan manajemen cepat kluster hingga 100.000 GPU serta kompatibel dengan framework pembelajaran mendalam utama. Lingjun menggunakan arsitektur jaringan berkinerja tinggi (HPN, High Performance Network) untuk mengatasi tantangan skalabilitas. Jaringan lapis tunggal mendukung ekstensi skala ribuan GPU, sedangkan jaringan dua lapis mendukung ekstensi skala puluhan ribu GPU. Dengan skalabilitas tinggi dan stabilitas kuat, solusi ini memberikan dukungan daya komputasi tangguh bagi pengembangan LLM di era AGI.

  • Stabil dan Andal

    Berdasarkan kebijakan paralelisme job, stabilitas ditingkatkan melalui desain self-healing interaksi layanan cloud dan optimasi sistematis lintas arsitektur perangkat keras dan perangkat lunak lapis platform. Solusi ini menyediakan deteksi event kegagalan detail halus, mendukung pemantauan waktu nyata dan penanganan status abnormal di berbagai level, termasuk node tepi, kartu GPU, dan layanan penjadwalan, sehingga mengurangi probabilitas kegagalan dan cakupan dampaknya serta meningkatkan ketangguhan job. Sistem ini memberikan pemulihan afinitas kegagalan dalam hitungan menit, dengan laju deteksi kegagalan melebihi 98%, secara efektif mendukung pelatihan LLM MoE berparameter triliunan untuk mencapai periode validitas pelatihan lebih dari 99%.

  • Kombinasi Penyimpanan Fleksibel dalam Berbagai Bentuk

    Menggunakan jalur akses data RDMA ber-throughput tinggi dan latensi rendah serta sistem file paralel terdistribusi CPFS, kluster puluhan ribu kartu dapat memperoleh sampel pelatihan secara kontinu dan efisien selama prosedur pelatihan. Kemampuan cache berkinerja tinggi dan latensi rendah memenuhi kebutuhan kinerja penyimpanan untuk skenario seperti preload data dan penyimpanan checkpoint. Dikombinasikan dengan produk seperti EBS dan OSS, solusi ini juga memenuhi kebutuhan penyimpanan data multi-spesifikasi dan multi-jenis untuk blok, objek, dan lainnya. Pengguna dapat beralih dengan cepat antar mode akses penyimpanan berbeda melalui pergantian spesifikasi tanpa melepaskan lease. Trafik penyimpanan dipisahkan dari trafik komputasi. Optimasi komunikasi tingkat kluster checkpoint asinkron didukung untuk mencegah trafik penyimpanan mengganggu trafik komputasi dan menyebabkan jitter komunikasi paralel.

  • Fondasi Daya Komputasi

    Menyediakan jenis resource komputasi termasuk instans bare metal (kluster) dan instans kontainer untuk menstandarkan dan menskalakan resource komputasi AI. Instans bare metal menyediakan kemampuan komunikasi dan interkoneksi setara. Dipadukan dengan CPU generasi terbaru, solusi ini menawarkan sumber daya disk lokal yang memadai yang mendukung GPU Direct Storage. Solusi ini mendukung antarmuka Kubernetes standar dan solusi jaringan kontainer, serta dapat mengintegrasikan security container untuk melakukan virtualisasi resource komputasi, penyimpanan, dan jaringan—menghadirkan daya komputasi cerdas terkolam bagi aplikasi platform lapis atas, dengan peningkatan utilisasi resource hingga 3x dalam beberapa skenario.

Fitur

Mendukung Inovasi AI Berkelanjutan dengan Daya Komputasi Paralel Puluhan Ribu Kartu

  • Skenario Umum

    Layanan Komputasi AI Lingjun dirancang untuk skenario komputasi paralel AI berorientasi masa depan, termasuk pelatihan model dasar skala besar, pelatihan dan fine-tuning model multimodal MoE, serta inferensi paralel model dengan parameter hingga skala triliunan. Menghadirkan ratusan exaflops (EFLOPS) kinerja floating-point per detik, desain terintegrasi perangkat keras-perangkat lunaknya memberikan kinerja lebih tinggi dan stabilitas lebih baik dalam footprint yang sama. Solusi ini mendukung inovasi berkelanjutan di berbagai industri termasuk model dasar, kendaraan otonom, scientific intelligence, fintech, pencarian dan rekomendasi, serta lainnya.

  • Arsitektur Non-Konvergen Skala Ultra-Besar

    Dirancang dengan kinerja aplikasi AI dan stabilitas job sebagai inti, solusi ini menerapkan pengendalian kemacetan jaringan berdasarkan bandwidth fisik dan topologi jaringan, serta mengombinasikan library komunikasi untuk mencapai optimasi beban trafik. Latensi end-to-end serendah 2 μs. Berdasarkan kolaborasi end-to-end jaringan, kluster jaringan dioptimalkan secara sistematis lintas desain arsitektur, topologi jaringan, pemilihan jalur, dan pembatasan kecepatan untuk mencapai ekstensi linear skala ultra-besar. Solusi ini menghadirkan derajat ekstensi eksplisit lebih dari 96% pada skala 10.000 GPU dengan operasi steady-state jaringan yang stabil, sekaligus mendukung ekstensi konvergen Scale-up & Scale-out skala ultra-besar di tingkat kluster 100.000 GPU. Resource pertukaran data dan interkoneksi dalam kluster dikoordinasikan, dan batas kinerja throughput didekati melalui tuning sistematis untuk meningkatkan ketangguhan sistem.

  • Wilayah yang Tersedia

    Layanan Komputasi AI Lingjun mendukung wilayah berikut: Tiongkok (Hangzhou), Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Shenzhen), Tiongkok (Guangzhou), Tiongkok (Zhongwei), Tiongkok (Hohhot), Tiongkok (Zhangjiakou), Tiongkok (Ulanqab), Tiongkok (Heyuan), Hong Kong (Tiongkok), Singapura, Jepang (Tokyo), AS (Atlanta), Jerman (Frankfurt), Malaysia (Johor), Malaysia (Kuala Lumpur), UEA (Dubai), dan Thailand (Bangkok). Layanan Komputasi AI Lingjun mendukung metode penagihan langganan (periode tetap) dan bayar sesuai penggunaan. Anda perlu mengajukan permintaan penggunaan resource kepada tim penjualan Alibaba Cloud.

Instans komputasi cerdas berkinerja-tinggi

  • Dukungan Berbagai Jenis Kartu GPU pada Instans Komputasi Akselerasi Lingjun

    Layanan Komputasi AI Lingjun adalah layanan kluster bare metal untuk skenario komputasi akselerasi. Berbasis instans komputasi heterogen Lingjun, solusi ini dilengkapi GPU (Graphics Processing Units), interkoneksi antar-chip berkecepatan tinggi, dan interkoneksi jaringan berkecepatan tinggi. Arsitektur keseluruhan dirancang mengelilingi dimensi domain Scale-up: semua GPU dalam satu instans komputasi akselerasi Lingjun berbagi interkoneksi antar-chip berkecepatan tinggi, dan setiap kartu GPU mendukung komunikasi interkoneksi setara RDMA di dimensi kluster. Selain itu, instans mendukung penempatan GPU seimbang, NVMe lokal, dan NIC antarmuka jaringan RDMA berkinerja tinggi, yang memungkinkan fitur seperti afinitas NUMA.

  • Dukungan Instans Kontainer Kubernetes dan Serverless Terstandarisasi dengan Optimasi Skenario AI

    Penerapan kluster siap digunakan. Anda dapat memanfaatkan daya komputasi GPU berbasis kontainer melalui instans kontainer Serverless ACS dan layanan kluster Kubernetes sesuai kebutuhan. Kubernetes telah menyelesaikan abstraksi dan orkestrasi resource heterogen seperti CPU dan GPU. Untuk skenario AI, produk ini juga menyediakan peningkatan termasuk optimasi operator, pemisahan PD, penerapan paralel EP dan load balancing, serta penjadwalan berbasis cache-aware. Solusi ini juga mendukung pemasangan penyimpanan dan penggunaan jaringan sesuai permintaan.

  • Akses Penyimpanan Data Berkinerja Tinggi

    Untuk memenuhi kebutuhan ekstrem pemuatan data dalam skenario pelatihan seperti penyimpanan checkpoint berkecepatan tinggi dan layanan komputasi cerdas, Layanan Komputasi AI Lingjun mendukung pemasangan fleksibel penyimpanan file terdistribusi berkinerja tinggi (CPFS) berbasis RDMA, serta mendukung kemampuan offloading endpoint VPC/EBS untuk mencapai interoperabilitas standar antar produk cloud.

Manajemen kluster otomatis

  • Interaksi Filter Multidimensi dan Manajemen Kluster Otomatis

    Layanan Komputasi AI Lingjun mendukung penugasan node tepi bare metal Lingjun dan kemampuan penjadwalan kolam sumber daya. Kluster mendukung penggunaan produk Kubernetes native Alibaba Cloud seperti ACK sebagai layanan manajemen kluster kontainer, CPFS sebagai penyimpanan file paralel berkinerja tinggi, EBS sebagai disk sistem dan disk data, PAI sebagai layanan platform artificial intelligence, dan pemantauan ARMS Prometheus. Seluruh prosedur penerapan kluster diselesaikan dengan satu klik, dan kluster komputasi cerdas berkinerja tinggi siap digunakan dalam hitungan menit.

  • Sistem Pemulihan Kesalahan Otomatis Menjamin Stabilitas Job Komputasi Paralel

    Sistem pemulihan kesalahan otomatis Lingjun dibangun di atas kerangka pemantauan komprehensif, menghadirkan kemampuan perlindungan pelanggan dan pemrosesan self-healing otomatis yang mencakup kegagalan multidimensi di OS Lingjun, GPU, jaringan berkinerja tinggi, DPU, dan lainnya. Kebijakan konsumsi kesalahan detail halus dan migrasi dingin kesalahan otomatis meminimalkan downtime pengguna. Lingjun juga telah membangun platform inspeksi otomatis untuk mendeteksi kesehatan keseluruhan kluster komputasi cerdas. Solusi ini menyediakan deteksi status kesehatan kluster multidimensi dan periodik yang mencakup daya komputasi heterogen GPU dan komunikasi kolektif antar-node, serta mendukung deteksi berkelanjutan dalam berbagai mode termasuk deteksi kluster single-node, dual-node, dan multi-node. Hal ini menghadirkan pencegahan proaktif sejati (mengurangi probabilitas kegagalan) dan toleransi kesalahan pasca-kegagalan (meningkatkan efisiensi resolusi masalah dan mengurangi kehilangan daya komputasi pelatihan), secara progresif mendorong strategi shift-left terhadap kegagalan.

Pemantauan Kluster Komprehensif

  • Kemampuan Observabilitas dan O&M

    Lingjun menyediakan dasbor data pemantauan di Konsol, termasuk resource komputasi heterogen GPU, pemantauan dan peringatan jaringan RDMA berkinerja tinggi tingkat detik, serta kemampuan lokalisasi kesalahan. Solusi ini juga mendukung tampilan log operasi dan job O&M, serta tampilan informasi resource dan lingkungan, memberikan visibilitas kepada pengguna terhadap penggunaan resource dan status berjalan seluruh kluster. Berdasarkan fondasi data pemantauan, Lingjun juga mendukung kemampuan O&M dasar berbasis GUI, seperti restart sistem, diagnosis O&M kluster dan node, serta kemampuan terminal web.

Pembelian dan Penagihan

  • Pembelian Produk: Masuk ke Konsol Lingjun untuk membeli resource node tepi. Untuk informasi lebih lanjut, lihat Beli Node Lingjun.

  • Penagihan Produk: Layanan Komputasi AI Lingjun mendukung metode penagihan langganan (epoch tetap) dan bayar sesuai penggunaan. Untuk informasi lebih lanjut, lihat Penagihan Produk.

Penggunaan

Setelah membeli node komputasi Lingjun, Anda harus membuat kluster untuk menggunakan resource tersebut. Untuk petunjuk lengkap, silakan merujuk ke Buat Kluster Dasar Lingjun.