Anda dapat memperoleh layanan inferensi independen dengan sumber daya khusus melalui penerapan untuk memenuhi kebutuhan bisnis pada berbagai tingkat kinerja, seperti konkurensi tinggi dan latensi rendah.
Metode penagihan
Sebelum penerapan, Anda dapat melihat perkiraan biaya per jam berbagai model di Konsol Penerapan Model.
CatatanMetode penagihan tidak dapat diubah setelah layanan dibuat. Untuk beralih, Anda harus menghentikan model yang diterapkan secara offline, lalu menerapkannya kembali.
Provisioned Throughput (PTU, Provisioned Throughput Unit) (Throughput tinggi; kinerja tinggi) | Model Unit (Metrik kinerja kustom; isolasi sumber daya) | Token-based usage (Bayar sesuai penggunaan setelah fine-tuning/validasi efek) | |||
|---|---|---|---|---|---|
Definisi | Metode penerapan model yang menyediakan sumber daya platform untuk menjamin kapasitas throughput TPM tertentu; tidak ada pembatasan laju dalam kuota yang dijamin. | Metode penerapan model yang mengonfigurasi daya komputasi berdasarkan durasi penggunaan dan jumlah Model Unit, dengan sumber daya khusus. | Metode penerapan model yang menggunakan Tokens input dan Tokens output yang dihasilkan per panggilan sebagai dasar pengukuran penggunaan. | ||
Keunggulan |
|
| Tidak dikenai biaya saat tidak digunakan. | ||
Model yang didukung | Beberapa model yang telah dikonfigurasi sebelumnya | Beberapa model yang telah dikonfigurasi sebelumnya dan semua model yang telah difine-tune | Beberapa model yang telah difine-tune dengan LoRA | ||
Kasus penggunaan |
|
| Validasi efek model fine-tuned | ||
Diagram penagihan |
|
|
| ||
Metode penagihan | Berdasarkan durasi penggunaan dan throughput yang disediakan Bayar sesuai penggunaan, paket harian | Berdasarkan durasi penggunaan dan jumlah Model Unit Bayar sesuai penggunaan, paket bulanan | Berdasarkan penggunaan Token model Bayar sesuai penggunaan | ||
Metode penskalaan | Peningkatan/penurunan throughput mandiri | Peningkatan/penurunan Model Unit mandiri | Kirim permohonan di konsol dan tunggu tinjauan manual. | ||
Batasan produk |
| Setelah pembelian prabayar, jika Anda membatalkan lebih awal dalam bulan pertama, harga satuan harian (≈ harga satuan bulanan / 30) akan ditagih sebesar 1,2 kali lipat. |
| ||
Untuk melihat statistik historis penggunaan Token dan jumlah panggilan untuk setiap panggilan, buka: Pemantauan Model.
Rincian penagihan
Penagihan berdasarkan durasi penggunaan (Provisioned Throughput)
Biaya = Durasi penggunaan × (Harga satuan TPM input × TPM input + Harga satuan TPM output × TPM output)
Postpaid dihitung per jam: satuan durasi penggunaan adalah jam, dan harga satuan diambil dari kolom "1 jam berkelanjutan" pada tabel di bawah ini; prepaid dihitung per hari: satuan durasi penggunaan adalah hari, dan harga satuan diambil dari kolom "1 hari berkelanjutan" pada tabel di bawah ini.
- Pesanan prepaid berlaku secara real time setelah pembayaran, dengan periode validitas N hari yang berakhir pukul 23.59 pada hari ke-N. Jika pesanan dilakukan setelah pukul 22.00, tanggal kedaluwarsa akan diperpanjang secara otomatis 1 hari.
- Setelah pesanan prepaid kedaluwarsa, layanan akan dihentikan dengan penundaan 2 jam, dan sumber daya akan dipertahankan selama 14 jam setelah penghentian lalu dilepas.
- Pesanan prepaid tidak dapat menghentikan layanan lebih awal.
- Untuk penagihan postpaid, jika akun mengalami tunggakan, sumber daya yang diterapkan akan tetap dipertahankan dan ditagih selama 24 jam, di mana layanan masih dapat digunakan secara normal. Setelah 24 jam, sistem menghentikan penagihan, penerapan model memasuki status tunggakan, dan sumber daya dasar akan dihapus, tetapi tugas penerapan model akan dipertahankan. Setelah tunggakan dilunasi, sistem akan mengalokasikan ulang sumber daya dan memulihkan penggunaan (biaya akan terus berjalan setelah pemulihan). Jika Anda tidak ingin terus dikenai biaya, Anda dapat menghapus tugas penerapan model, dan penagihan akan berhenti setelah penghapusan berhasil.
Saat input model melebihi Token input maksimum, panggilan terkait akan secara otomatis beralih ke mode bayar sesuai penggunaan model saat ini; saat TPM yang dibeli terlampaui, akan ditangani sesuai strategi overflow yang dipilih saat pembuatan ("auto-overflow" beralih ke bayar sesuai penggunaan, "use-only-PTU-capacity" mengembalikan 429). Saat ini, kinerja inferensi mungkin menurun dan akan tunduk pada pengendalian lalu lintas publik model snapshot saat ini di ruang bisnis, dan biaya akan dikenakan sesuai standar pemanggilan model (bayar sesuai penggunaan).
- Dalam kasus ini (hanya di bawah strategi "auto-overflow"), Header respons API akan mencakup:
x-dashscope-ptu-overflow:true. - Untuk statistik TPM, buka: Pemantauan Model.
Untuk aturan spesifik pengurangan biaya dan pengembalian dana dalam skenario skala turun (downgrade), silakan merujuk ke: Aturan pengembalian dana untuk downgrade konfigurasi.
CatatanPenerapan PTU mendukung koefisien kapasitas bertingkat input panjang dan diskon cache; lihat Input panjang dan caching Provisioned Throughput untuk detailnya.
Singapura
Qwen
Nama Model | Kode Model | Token Input Maks | Input Pascabayar Per 10K TPM/Jam | Output Postpaid Per 1K TPM/Jam | Input Prabayar Per 10K TPM/Hari | Prepaid Output Per 1K TPM/Hari |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $4,8 | $1,44 | $57,6 | $17,28 |
Qwen3.7-Flash-2026-07-15 Hubungi manajer bisnis Anda untuk mengaktifkan | qwen3.7-flash-2026-07-15 | 128K | $0,072 | $0,031 | $0,864 | $0,374 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $1,92 | $1,8 | $72 | $21,6 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0,96 | $0,384 | $11,52 | $4,608 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $1,2 | $0,72 | $14,4 | $8,64 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0,96 | $0,576 | $11,52 | $6,912 |
DeepSeek
Nama model | Kode model | Maksimum input token | Input bayar sesuai penggunaan Per 10K TPM/jam | Output bayar sesuai penggunaan Per 1K TPM/jam | Input prepaid Per 10K TPM/hari | Keluaran Prabayar Per 1K TPM/hari |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0,72 | $0,144 | $8,64 | $1,728 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $1,44 | $0,288 | $17,28 | $3,456 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $0,96 | $1,728 | $103,68 | $20,736 |
Qwen-VL
Nama model | Kode model | Maksimum token input | Input bayar sesuai penggunaan Per 10K TPM/jam | Output bayar sesuai penggunaan Per 1K TPM/jam | Input Prabayar Per 10K TPM/hari | Keluaran Prabayar Per 1K TPM/hari |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0,48 | $0,384 | $5,76 | $4,608 |
GLM
Nama model | Kode model | Maksimum token input | Input bayar sesuai penggunaan Per 10K TPM/jam | Output bayar sesuai penggunaan Per 1K TPM/jam | Input Prabayar Per 10K TPM/hari | Output prepaid Per 1K TPM/hari |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $5,04 | $1,584 | $60,48 | $19,008 |
China Utara 2 (Beijing)
Qwen
Nama model | Kode model | Maksimum token input | Input bayar sesuai penggunaan Per 10K TPM/jam | Output bayar sesuai penggunaan Per 1K TPM/jam | Input prepaid Per 10K TPM/hari | Keluaran Prabayar Per 1K TPM/hari |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $3,96 | $1,188 | $47,53 | $14,258 |
Qwen3.7-Flash-2026-07-15 Hubungi manajer bisnis Anda untuk mengaktifkan | qwen3.7-flash-2026-07-15 | 128K | $0,066 | $0,026 | $0,792 | $0,317 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $3,96 | $1,188 | $47,53 | $14,258 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0,66 | $0,264 | $7,92 | $3,168 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $0,67 | $0,066 | $7,93 | $4,753 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0,26 | $0,16 | $3,17 | $1,9 |
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | 128K | $1,11 | $0,45 | $13,32 | $5,4 |
Qwen-Flash-2025-07-28 | qwen-flash-2025-07-28 | 128K | $0,06 | $0,06 | $0,72 | $0,72 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | 128K | $0,28 | Non-thinking: $0,07 Thinking: $0,28 | $3,36 | Non-thinking: $0,84 Thinking: $3,36 |
DeepSeek
Nama Model | Kode Model | Token Input Maks | Input Postpaid Per 10K TPM/jam | Keluaran Pascabayar Per 1K TPM/jam | Input Prepaid Per 10K TPM/hari | Output Prepaid Per 1K TPM/hari |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0,5 | $0,099 | $5,94 | $1,188 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $0,99 | $0,198 | $11,88 | $2,376 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $5,94 | $1,188 | $71,3 | $14,26 |
DeepSeek-v3 | deepseek-v3 | 64K | $0,99 | $0,396 | $11,9 | $4,75 |
Qwen-VL
Nama Model | Kode Model | Token Input Maksimum | Postpaid Input Per 10K TPM/jam | Output Postpaid Per 1K TPM/jam | Input Prabayar Per 10K TPM/hari | Output Prabayar Per 1K TPM/hari |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0,35 | $0,35 | $4,2 | $4,2 |
GLM
Nama Model | Kode Model | Token Input Maksimum | Postpaid Input Per 10K TPM/jam | Postpaid Output Per 1K TPM/jam | Input Prabayar Per 10K TPM/hari | Keluaran Prabayar Per 1K TPM/hari |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $3,96 | $1,386 | $47,53 | $16,635 |
Penagihan berdasarkan durasi penggunaan (Model Unit)
Biaya = Durasi penggunaan (jam) × Jumlah Model Unit × Harga satuan Model Unit
"Harga satuan Model Unit" mengacu pada kolom "Harga satuan per jam" dalam tabel di bawah ini untuk skenario postpaid; sedangkan untuk penagihan prepaid langganan bulanan, rumusnya menjadi Jumlah langganan bulanan × Jumlah Model Unit × Harga satuan bulanan.
- Untuk pembelian prepaid pada bulan pertama, jika Anda membatalkan langganan lebih awal dalam bulan tersebut, harga satuan harian (≈ Harga satuan bulanan / 30) akan dikenakan sebesar 1,2 kali lipat (penggunaan kurang dari satu hari dikenai biaya sebagai satu hari penuh).
CatatanSumber daya komputasi untuk metode postpaid Model Unit dialokasikan berdasarkan prinsip siapa cepat dia dapat. Jika pembelian gagal, pengembalian dana penuh akan diberikan.
Singapura
Generasi Teks
Nama Model | Kode Model | Spesifikasi Unit Model | Harga Satuan Per Jam (USD) Penagihan Minimum: Menit | Harga Satuan Langganan Bulanan (USD) Penagihan Minimum: Hari |
|---|---|---|---|---|
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 | $88 | $41.832 |
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU2 x 8 | $112 | $52.392 |
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU2 x 8 | $112 | $52.392 |
Qwen3.5-27B | qwen3.5-27b | MU1 x 2 | $22 | $10.458 |
Qwen3.5-9B | qwen3.5-9b | MU1 x 2 | $22 | $10.458 |
GLM-5.1 | glm-5.1 | MU2 x 8 | $112 | $52.392 |
MU3 x 8 | $216 | $102.696 | ||
DeepSeek-v4-Flash | deepseek-v4-flash | MU2 x 8 | $112 | $52.392 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $44 | $20.916 |
Multimodal
Nama Model | Kode Model | Spesifikasi Unit Model | Harga Satuan Per Jam ($) Penagihan Minimum: Menit | Harga Satuan Langganan Bulanan ($) Penagihan Minimum: Hari |
|---|---|---|---|---|
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $112 | $52.392 |
Jenis model:
- Instruct – Setelah diterapkan, model menjalankan inferensi dalam mode non-thinking.
China (Beijing)
Generasi teks
Qwen
Nama Model | Kode Model | Spesifikasi Unit Model | Harga Satuan Per Jam ($) Penagihan Minimum: Menit | Harga Satuan Langganan Bulanan ($) Penagihan minimum: hari |
|---|---|---|---|---|
Qwen3.6-35B-A3B | qwen3.6-35b-a3b | MU1 x 8 | $59,408 | $28.734,256 |
MU2 x 8 | $69,312 | $33.044,72 | ||
MU3 x 8 | $150,72 | $72.577,152 | ||
MU8 x 1 | $6,464 | $3.080,477 | ||
MU9 x 1 | Rp7.014 | $3.383,024 | ||
Qwen3.6-27B | qwen3.6-27b | MU9 x 1 | $7,014 | $3.383,024 |
Qwen3.6-Flash-2026-04-16 | qwen3.6-flash-2026-04-16 | MU1 x 2 | $14,852 | $7.183,564 |
MU3 x 8 | $150,72 | $72.577,152 | ||
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 MU1 x 16 (mode disagregasi PD) | $59,408 Mode disagregasi PD: $118,816 | $28.734,256 Mode disagregasi PD: $57.468,512 |
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU3 x 8 MU3 x 16 (mode disagregasi PD) | $150,72 Mode disagregasi PD: $301,44 | $72.577,152 Mode disagregasi PD: $145.154,304 |
MU6 x 16 | $55,008 | $26.599,92 | ||
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU1 x 4 | $29,704 | $14.367,128 |
MU6 x 16 | $55,008 | $26.599,92 | ||
Qwen3.5-35B-A3B | qwen3.5-35b-a3b | MU1 x 2 | $14,852 | $7.183,564 |
MU2 x 8 | $69,312 | $33.044,72 | ||
MU3 x 8 | $150,72 | $72.577,152 | ||
MU9 x 1 | $7,014 | $3.383,024 | ||
Qwen3.5-27B | qwen3.5-27b | MU2 x 8 | $69.312 | $33.044,72 |
MU3 x 8 | $150,72 | $72.577,152 | ||
MU8 x 1 | $6.464 | $3.080,477 | ||
MU9 x 1 | $7.014 | $3.383,024 | ||
Qwen3.5-9B | qwen3.5-9b | MU1 x 2 | $14,852 | $7.183,564 |
MU2 x 8 | $69,312 | $33.044,72 | ||
Qwen3.5-Flash-2026-02-23 | qwen3.5-flash-2026-02-23 | MU1 x 2 | $14,852 | $7.183,564 |
Qwen3.5-Plus-2026-02-15 | qwen3.5-plus-2026-02-15 | MU1 x 8 MU1 x 16 (mode disagregasi PD) | $59,408 Mode disagregasi PD: $118,816 | $28.734,256 Mode disagregasi PD: $57.468,512 |
MU2 x 8 | $69,312 | $33.044,72 | ||
MU3 x 8 MU3 x 16 (mode disagregasi PD) | $150,72 Mode disagregasi PD: $301,44 | $72.577,152 Mode disagregasi PD: $145.154,304 | ||
Qwen3-235B-A22B-Instruct-2507 | qwen3-235b-a22b-instruct-2507 | MU1 x 4 | $29,704 | $14.367,128 |
MU2 x 8 | $69.312 | $33.044,72 | ||
MU3 x 8 | $150,72 | $72.577,152 | ||
Qwen3-32B | qwen3-32b | MU6 x 16 | $55.008 | $26.599,92 |
Qwen3-30B-A3B-Thinking-2507 | qwen3-30b-a3b-thinking-2507 | MU1 x 2 | $14.852 | $7.183,564 |
Qwen3-8B | qwen3-8b | MU1 x 2 | $14,852 | $7.183,564 |
MU2 x 2 | $17,328 | $8.261,18 | ||
Qwen3-4B | qwen3-4b | MU1 x 2 | $14,852 | $7.183,564 |
MU5 x 1 | $2,888 | $1.394,329 | ||
Qwen3-Embedding-0.6B | qwen3-embedding-0.6b | MU5 x 1 | $2,888 | $1.394,329 |
MU6 x 1 | $3,438 | $1.662,495 | ||
Qwen3-MoE-Rerank-0.6B | qwen3-moe-rerank-0.6b | MU5 x 1 | $2,888 | $1.394,329 |
Qwen3-Rerank-0.6B | qwen3-rerank-0.6b | MU5 x 1 | $2,888 | $1.394,329 |
MU6 x 1 | $3,438 | $1.662,495 | ||
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | MU2 x 8 | $69,312 | $33.044,72 |
MU3 x 8 | $150,72 | $72.577,152 | ||
Qwen3-Rerank | qwen3-rerank | MU5 x 1 | $2,888 | $1.394,329 |
Qwen2.5-Open-Source-72B | qwen2.5-72b-instruct | MU1 x 8 | $59.408 | $28.734,256 |
Qwen2.5-Open-Source-14B | qwen2.5-14b-instruct | MU1 x 2 | $14,852 | $7.183,564 |
Qwen2.5-Open-Source-7B | qwen2.5-7b-instruct | MU1 x 2 | $14.852 | $7.183,564 |
MU5 x 1 | $2,888 | $1.394,329 | ||
Qwen-Plus-2025-07-28 | qwen-plus-2025-07-28 | MU1 x 4 MU1 x 16 (mode pemisahan PD) | $29.704 Mode pemisahan PD: $118,816 | $14.367,128 Mode pemisahan PD: $57.468,512 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | MU1 x 4 | $29.704 | $14.367,128 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $29,704 | $14.367,128 |
GLM
Nama Model | Kode Model | Spesifikasi Unit Model | Harga Satuan Per Jam ($) Penagihan Minimum: Menit | Harga Satuan ($) Penagihan Minimum: Hari |
|---|---|---|---|---|
GLM-5.1 | glm-5.1 | MU2 x 8 | $69.312 | $33.044,72 |
MU3 x 16 (mode pemisahan PD) | Mode pemisahan PD: $301,44 | Mode pemisahan PD: $145.154,304 | ||
MU6 x 16 | $55,008 | $26.599,92 | ||
GLM-5 | glm-5 | MU3 x 16 (mode pemisahan PD) | Mode pemisahan PD: $301,44 | Mode pemisahan PD: $145.154,304 |
GLM-4.7 | glm-4.7 | MU6 x 32 (mode pemisahan PD) | Mode pemisahan PD: $110,016 | Mode pemisahan PD: $53.199,84 |
DeepSeek
Nama model | Kode model | Spesifikasi unit model | Harga satuan per jam ($) Penagihan minimum: menit | Harga langganan bulanan ($) Penagihan minimum: hari |
|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | MU1 x 8 | $59,408 | $28.734,256 |
MU3 x 8 | $150,72 | $72.577,152 | ||
DeepSeek-v3.2 | deepseek-v3.2 | MU2 x 16 (mode pemisahan PD) | Mode pemisahan PD: $138,624 | Mode pemisahan PD: $66.089,44 |
Model lainnya
Nama model | Kode model | Spesifikasi unit model | Harga satuan per jam ($) Penagihan minimum: menit | Harga langganan bulanan ($) Penagihan minimum: hari |
|---|---|---|---|---|
Kimi-K2.5 | kimi-k2.5 | MU2 x 8 | $69,312 | $33.044,72 |
Multimodal
Qwen VL
Nama model | Kode model | Spesifikasi unit model | Harga satuan per jam ($) Penagihan minimum: menit | Harga langganan bulanan ($) Penagihan minimum: hari |
|---|---|---|---|---|
Qwen3-VL-235B-A22B-Thinking | qwen3-vl-235b-a22b-thinking | MU1 x 8 | $59.408 | $28.734,256 |
MU2 x 8 | $69,312 | $33.044,72 | ||
MU3 x 8 | $150,72 | $72.577,152 | ||
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $69,312 | $33.044,72 |
MU3 x 8 | $150,72 | $72.577,152 | ||
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | MU1 x 2 | $14,852 | $7.183,564 |
MU5 x 1 | $2,888 | $1.394,329 | ||
Qwen3-VL-4B-Instruct | qwen3-vl-4b-instruct | MU1 x 2 | $14,852 | $7.183,564 |
Qwen3-VL-2B-Instruct | qwen3-vl-2b-instruct | MU5 x 1 | $2,888 | $1.394,329 |
Qwen3-VL-Embedding-2B | qwen3-vl-embedding-2b | MU5 x 1 | $2,888 | $1.394,329 |
Qwen3-VL-Flash-2025-10-15 | qwen3-vl-flash-2025-10-15 | MU1 x 4 | $29,704 | $14.367,128 |
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | MU1 x 4 | $29,704 | $14.367,128 |
Qwen-VL-Max-2025-08-13 | qwen-vl-max-2025-08-13 | MU6 x 4 | $13,752 | $6.649,98 |
Qwen Omni
Nama model | Kode model | Spesifikasi unit model | Harga satuan per jam ($) Penagihan minimum: menit | Harga langganan bulanan ($) Penagihan minimum: hari |
|---|---|---|---|---|
Qwen3.5-Omni-Flash | qwen3.5-omni-flash | MU8 x 1 | $6,464 | $3.080,477 |
MU9 x 1 | $7,014 | $3.383,024 |
Jenis model:
- Instruct – Setelah diterapkan, model menjalankan inferensi dalam mode non-thinking.
- Thinking – Setelah diterapkan, model menjalankan inferensi dalam mode thinking.
Berdasarkan penggunaan token model
Biaya = Jumlah token input model × Harga satuan input model + Jumlah token output model × Harga satuan output model (unit penagihan minimum: 1 token)
- Penagihan berdasarkan penggunaan token model hanya didukung setelah Anda menyelesaikan pelatihan SFT efisien pada model dasar berikut dan memperoleh model kustom.
Singapura
Model dasar | Kode model | Input $/Juta token | Output $/Juta token |
|---|---|---|---|
Qwen3-14B | qwen3-14b | Mode non-thinking: $0,35 Mode thinking: $0,35 | Mode non-thinking: $1,4 Mode berpikir: $4,2 |
Beijing
Model dasar | Kode model | Input $/Juta token | Output $/Juta token |
|---|---|---|---|
Qwen3.5-27B | qwen3.5-27b | <128K $0,086 128K-256K $0,258 | <128K $0,688 128K–256K $2.064 |
Qwen3-32B | qwen3-32b | Mode non-thinking: $0,287 Mode thinking: $0,287 | Mode non-thinking: $1,147 Mode thinking: $2,868 |
Qwen3-14B | qwen3-14b | Mode non-thinking: $0,144 Mode thinking: $0,144 | Mode non-thinking: $0,574 Mode thinking: $1,434 |
Qwen3-8B | qwen3-8b | Mode non-thinking: $0,072 Mode thinking: $0,072 | Mode non-thinking: $0,287 Mode thinking: $0,717 |
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | $0,072 | $0,287 |
Untuk menerapkan lebih banyak model, rujuk ke solusi ini dan pilih rencana penerapan yang paling sesuai dengan kebutuhan bisnis Anda.
Metode penerapan
Anda dapat menerapkan model di konsol. Ikuti langkah-langkah berikut:
Jika Anda mendapat pesan izin tidak mencukupi, rujuk ke: Apa yang harus saya lakukan jika muncul pesan "izin tidak mencukupi" saat penerapan?
|
|
| |
Biaya akan dikenakan setelah model berhasil diterapkan. |
Konfigurasi penerapan
Model Unit
Item konfigurasi | Rincian konfigurasi |
|---|---|
Nama layanan | Nama kustom untuk layanan penerapan. |
Model | Pilih model yang akan diterapkan, termasuk model preset platform dan model yang telah difine-tune. |
Jenis unit model | Pilih spesifikasi penerapan. Spesifikasi berbeda sesuai dengan daya komputasi dan kinerja berbeda. |
Jumlah replika | Tetapkan jumlah awal replika penerapan, yang memengaruhi kemampuan pemrosesan konkuren layanan. |
Template penerapan | Pilih template penerapan (misalnya, "penerapan single-node"). Template berbeda sesuai dengan skema konfigurasi sumber daya berbeda. Hanya tersedia dalam mode penagihan unit model. |
Mode inferensi model | Untuk beberapa model, saat diterapkan dalam modeModel Unit, Anda dapat mengonfigurasi mode inferensi, konteks maksimum, dan lainnya.
|
Konteks maksimum | Mode penerapanModel Unit beberapa model mendukung pengaturan ini. Panjang konteks maksimum bergantung pada jenis model. |
Pembatasan laju layanan | Mode penerapanModel Unit beberapa model mendukung pengaturan ini, yang dapat membatasi RPM dan TPM panggilan model. |
Halaman daftar penerapan
Setelah penerapan berhasil, Anda dapat melihat dan mengelola semua layanan penerapan di halaman daftar penerapan. Halaman daftar berisi informasi berikut:
- Nama layanan: Nama layanan penerapan. Klik untuk melihat detail penerapan.
- Nama model: Model yang digunakan untuk penerapan.
- Kode Model: Pengidentifikasi unik yang dihasilkan setelah model berhasil diterapkan, digunakan untuk menentukan model saat memanggil API.
- Status penerapan/Status event: Termasuk Menunggu penerapan, Menerapkan, Running, Penerapan gagal, Offline, Layanan dijeda, Dihentikan, Menghapus, Langganan ditangguhkan/Pembayaran tertunda ditangguhkan, Memulihkan layanan, Running (Mengubah konfigurasi), Running (Perubahan gagal), dan status lainnya.
- Metode penagihan: Metode penagihan layanan penerapan saat ini.
- Detail penerapan: Informasi konfigurasi seperti jenis unit model dan jumlah replika.
- Detail pembatasan laju: Menampilkan konfigurasi pembatasan laju layanan penerapan saat ini, seperti RPM (permintaan per menit) dan TPM (token per menit).
- Waktu layanan: Menampilkan waktu pembuatan dan waktu kedaluwarsa layanan penerapan.
- Operasi: Bergantung pada status penerapan dan metode penagihan, Anda dapat melakukan operasi seperti Perbarui, Pantau, Penskalaan, Perpanjang, Offline, Hapus, dan Coba.
Panggilan pasca-penerapan
Setelah model berhasil diterapkan, Anda dapat memanggilnya melalui antarmuka yang kompatibel OpenAI, DashScope, dan Assistant SDK.
Saat memanggil model yang berhasil diterapkan, nilai model harus berupa kode model yang dihasilkan setelah penerapan berhasil. Buka konsol penerapan model untuk mendapatkan Model Code.
import os
import dashscope
messages = [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
# Jika Anda belum mengonfigurasi variabel lingkungan, ganti baris berikut dengan Bailian API Key Anda: api_key="sk-xxx",
api_key=os.getenv("DASHSCOPE_API_KEY"),
model="qwen3-max-xxx-xxx", # Harap ganti dengan kode yang dikembalikan setelah model berhasil diterapkan
messages=messages,
result_format="message",
enable_thinking=False,
)
print(response)
import os
from openai import OpenAI
client = OpenAI(
# Jika Anda belum mengonfigurasi variabel lingkungan, ganti baris berikut dengan Bailian API Key Anda: api_key="sk-xxx",
api_key=os.getenv('DASHSCOPE_API_KEY'),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3-max-xxx-xxx", # Harap ganti dengan kode yang dikembalikan setelah model berhasil diterapkan
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
],
extra_body={"enable_thinking": False},
)
print(completion)
Penskalaan Layanan Penerapan
- Throughput preset (ditagih berdasarkan durasi): Klik tombol Scaling untuk layanan mandiri, menyesuaikan jumlah instans secara manual. Untuk aturan pengurangan biaya dan pengembalian dana terperinci, silakan merujuk ke: Aturan pengembalian dana untuk downgrade konfigurasi.
- Model unit (ditagih berdasarkan durasi): Klik tombol Scaling untuk layanan mandiri, menyesuaikan jumlah instans secara manual.
Selain itu, Anda dapat mengonfigurasi kebijakan penskalaan otomatis (termasuk ambang batas penskalaan, jumlah replika minimum/maksimum, penskalaan terjadwal, dll.) melalui tombol konfigurasi penskalaan di kolom operasi.
Menonaktifkan Layanan Penerapan
Buka Konsol Penerapan Model, temukan layanan penerapan yang ingin Anda hentikan, lalu klik operasi yang sesuai berdasarkan jenis penagihan:
- Model unit prepaid: Klik Deactivate dan konfirmasi.
- Postpaid: Klik Delete dan konfirmasi.
Tidak akan ada penagihan lebih lanjut setelah operasi selesai.
Operasi Lainnya
Selain menonaktifkan, kolom operasi di halaman daftar penerapan juga mendukung operasi berikut:
- Perbarui: Perbarui versi model layanan yang diterapkan, mendukung pembaruan penuh atau pembaruan batch (rilis canary).
- Hapus: Layanan bayar sesuai penggunaan dapat dihapus langsung untuk menghentikan penagihan.
- Perpanjang: Layanan prepaid dapat diperpanjang untuk memperpanjang waktu layanan, dan mendukung perpanjangan otomatis.
- Beli paket kapasitas: Beli paket kapasitas untuk penerapan throughput preset.
FAQ
Bisakah saya mengunggah dan menerapkan model saya sendiri?
Mengunggah dan menerapkan model Anda sendiri belum didukung. Kami menyarankan Anda terus mengikuti pembaruan terbaru Alibaba Cloud Model Studio.
Selain itu, Platform Kecerdasan Buatan Alibaba Cloud PAI menyediakan kemampuan untuk menerapkan model Anda sendiri. Anda dapat merujuk ke Penerapan Model Bahasa Besar PAI-LLM untuk mempelajari metode penerapan.
Apa yang harus saya lakukan jika muncul pesan "izin tidak mencukupi" saat penerapan?
-
Jika muncul pesan "Missing permission for this module", pastikan akun Anda memiliki izin Model Deployment - Operation di halaman pengelolaan izin ruang bisnis.
Jika Anda tidak dapat beroperasi secara normal, hubungi organisasi atau administrator TI Anda untuk menambahkan izin terkait atau memeriksa masalah izin atas nama Anda.
-
Jika terjadi kesalahan "ruang bisnis xx tidak memiliki izin untuk menerapkan model xx" selama penerapan, buka halaman Pengelolaan Ruang Bisnis Model Studio untuk menambahkan izin penerapan model yang sesuai untuk ruang bisnis yang sesuai.
Kesalahan pemanggilan API:
Workspace xxx does not have deployment privilege for model xxxx.
Jika muncul pesan izin tidak mencukupi, hubungi organisasi atau administrator TI Anda untuk menambahkan izin terkait atau beroperasi atas nama Anda.




