All Products
Search
Document Center

Container Service for Kubernetes:Terapkan layanan inferensi AI di kluster ACK

Last Updated:Aug 21, 2026

Dengan menggunakan Arena CLI dan penjadwalan workload AI dalam cloud-native AI suite ACK, Anda dapat menerapkan model yang telah dilatih sebagai layanan inferensi di kluster Kubernetes. ACK mendukung skalabilitas elastis, berbagi GPU, dan pemantauan kinerja untuk mengurangi biaya operasional. Topik ini menjelaskan cara menerapkan layanan inferensi model dengan ACK dan cloud-native AI suite.

Penting

NVIDIA Triton Server dan TensorFlow Serving dalam ack-arena adalah komponen open source gratis yang disediakan oleh komunitas open source pihak ketiga atau perusahaan. Anda dapat memilih untuk menginstal komponen yang sesuai dan mengonfigurasi server guna menerapkan model inferensi sebagai layanan, lalu menggunakan alat pengujian dan optimasi model terkait.

Namun, Alibaba Cloud tidak bertanggung jawab atas stabilitas, batasan layanan, dan kepatuhan keamanan komponen pihak ketiga tersebut. Anda harus memperhatikan secara cermat situs resmi komunitas open source pihak ketiga atau perusahaan serta pembaruan di platform hosting kode, dan membaca serta mematuhi lisensi open source yang berlaku. Anda bertanggung jawab atas segala risiko potensial terkait pengembangan aplikasi, maintenance, troubleshooting, dan keamanan akibat penggunaan komponen pihak ketiga.

Cloud-native AI suite mendukung jenis layanan inferensi berikut.

Inference service type

Description

References

Shared GPU inference tasks

Gunakan Arena untuk menjalankan beberapa tugas inferensi pada GPU bersama guna meningkatkan pemanfaatan GPU.

Submit an inference task to use shared GPU resources

TensorFlow model inference services

Gunakan Arena dan TensorFlow Serving untuk menerapkan model TensorFlow sebagai layanan inferensi.

Deploy a TensorFlow model inference service

PyTorch model inference services

Gunakan NVIDIA Triton Inference Server atau TorchServe untuk menerapkan model PyTorch sebagai layanan inferensi.

Submit an inference task to use shared GPU resources

Containerized elastic inference services

Terapkan layanan inferensi elastis pada Elastic Compute Service (ECS) atau Elastic Container Instance untuk meningkatkan elastisitas dan mengurangi biaya.