Dengan menggunakan Arena CLI dan penjadwalan workload AI dalam cloud-native AI suite ACK, Anda dapat menerapkan model yang telah dilatih sebagai layanan inferensi di kluster Kubernetes. ACK mendukung skalabilitas elastis, berbagi GPU, dan pemantauan kinerja untuk mengurangi biaya operasional. Topik ini menjelaskan cara menerapkan layanan inferensi model dengan ACK dan cloud-native AI suite.
NVIDIA Triton Server dan TensorFlow Serving dalam ack-arena adalah komponen open source gratis yang disediakan oleh komunitas open source pihak ketiga atau perusahaan. Anda dapat memilih untuk menginstal komponen yang sesuai dan mengonfigurasi server guna menerapkan model inferensi sebagai layanan, lalu menggunakan alat pengujian dan optimasi model terkait.
Namun, Alibaba Cloud tidak bertanggung jawab atas stabilitas, batasan layanan, dan kepatuhan keamanan komponen pihak ketiga tersebut. Anda harus memperhatikan secara cermat situs resmi komunitas open source pihak ketiga atau perusahaan serta pembaruan di platform hosting kode, dan membaca serta mematuhi lisensi open source yang berlaku. Anda bertanggung jawab atas segala risiko potensial terkait pengembangan aplikasi, maintenance, troubleshooting, dan keamanan akibat penggunaan komponen pihak ketiga.
Cloud-native AI suite mendukung jenis layanan inferensi berikut.
|
Inference service type |
Description |
References |
|
Shared GPU inference tasks |
Gunakan Arena untuk menjalankan beberapa tugas inferensi pada GPU bersama guna meningkatkan pemanfaatan GPU. |
|
|
TensorFlow model inference services |
Gunakan Arena dan TensorFlow Serving untuk menerapkan model TensorFlow sebagai layanan inferensi. |
|
|
PyTorch model inference services |
Gunakan NVIDIA Triton Inference Server atau TorchServe untuk menerapkan model PyTorch sebagai layanan inferensi. |
|
|
Containerized elastic inference services |
Terapkan layanan inferensi elastis pada Elastic Compute Service (ECS) atau Elastic Container Instance untuk meningkatkan elastisitas dan mengurangi biaya. |