Gaussian Mixture Models (GMMs) adalah model probabilistik yang merepresentasikan K distribusi Gaussian dalam suatu populasi lengkap. Anda dapat menggunakan komponen GMM Training untuk melatih model tersebut.
Sumber daya komputasi yang didukung
Komponen GMM Training dijalankan pada salah satu sumber daya komputasi berikut:
MaxCompute
Realtime Compute for Apache Flink
Deep Learning Containers (DLC) dari Platform for AI (PAI)
Estimasi penggunaan sumber daya
Gunakan panduan berikut untuk menentukan ukuran worker sebelum mengirimkan pekerjaan pelatihan.
Memori per worker
Hitung memori minimum per worker (dalam MB) menggunakan:
M × M × K × 8 × 2 × 12 / 1024 / 1024Di mana:
M = jumlah dimensi vektor
K = jumlah komponen Gaussian (parameter
k)
Untuk sebagian besar beban kerja, 8 GB (8.192 MB) per worker sudah cukup.
Pertahankan dimensi vektor (M) di bawah 200. Dimensi yang lebih tinggi secara signifikan meningkatkan kebutuhan memori.
Jumlah pekerja
Sebagai titik awal, gunakan 5 × X worker, dengan X adalah ukuran data masukan dalam GB.
Jika sumber daya terbatas, kurangi jumlah worker. Menambahkan lebih banyak worker mempercepat pelatihan hingga titik tertentu—setelah itu, overhead komunikasi antar-worker melebihi manfaat paralelisasi. Sesuaikan jumlah worker untuk menemukan pengaturan optimal bagi set data Anda.