All Products
Search
Document Center

Alibaba Cloud Model Studio:Penerapan model

Last Updated:Sep 09, 2026

Anda dapat memperoleh layanan inferensi independen dengan sumber daya khusus melalui penerapan untuk memenuhi kebutuhan bisnis pada berbagai tingkat kinerja, seperti konkurensi tinggi dan latensi rendah.

Metode penagihan

Sebelum penerapan, Anda dapat melihat perkiraan biaya per jam berbagai model di Konsol Penerapan Model.

CatatanMetode penagihan tidak dapat diubah setelah layanan dibuat. Untuk beralih, Anda harus menghentikan model yang diterapkan secara offline, lalu menerapkannya kembali.

Provisioned Throughput (PTU, Provisioned Throughput Unit)

(Throughput tinggi; kinerja tinggi)

Model Unit

(Metrik kinerja kustom; isolasi sumber daya)

Token-based usage

(Bayar sesuai penggunaan setelah fine-tuning/validasi efek)

Definisi

Metode penerapan model yang menyediakan sumber daya platform untuk menjamin kapasitas throughput TPM tertentu; tidak ada pembatasan laju dalam kuota yang dijamin.

Metode penerapan model yang mengonfigurasi daya komputasi berdasarkan durasi penggunaan dan jumlah Model Unit, dengan sumber daya khusus.

Metode penerapan model yang menggunakan Tokens input dan Tokens output yang dihasilkan per panggilan sebagai dasar pengukuran penggunaan.

Keunggulan

  1. Menyediakan kapasitas throughput stabil, latensi lebih rendah, dan kepastian sumber daya lebih kuat untuk lingkungan produksi beban tinggi.

  2. Dibandingkan dengan penagihan berbasis Token, TPS (Tokens yang dihasilkan per detik) biasanya meningkat sekitar 1,5 hingga 2,0 kali lipat.

  3. Mendukung pengaturan perpanjangan otomatis.

  1. Metrik kinerja seperti latensi/throughput dapat dikustomisasi.

  2. Mendukung pengaturan perpanjangan otomatis.

Tidak dikenai biaya saat tidak digunakan.

Model yang didukung

Beberapa model yang telah dikonfigurasi sebelumnya

Beberapa model yang telah dikonfigurasi sebelumnya dan semua model yang telah difine-tune

Beberapa model yang telah difine-tune dengan LoRA

Kasus penggunaan

  1. Layanan pelanggan cerdas untuk aplikasi perbankan (lalu lintas stabil, memerlukan pengalaman konkuren terjamin).

  2. moderasi konten real-time untuk platform sosial (memerlukan pemrosesan stabil untuk tugas pipeline yang dapat diprediksi).

  3. API terjemahan cloud publik (menyediakan jaminan layanan garis dasar bagi pengguna paket standar).

  1. Model besar eksklusif E-dagang yang telah difine-tune (menerapkan model privat, penskalaan manual selama promosi besar).

  2. Model skrining molekul perusahaan farmasi (memerlukan sumber daya khusus untuk tugas berdurasi panjang).

  3. Simulasi mengemudi otonom (memerlukan komputasi berkelanjutan berdurasi panjang).

Validasi efek model fine-tuned

Diagram penagihan

image

image

image

Metode penagihan

Berdasarkan durasi penggunaan dan throughput yang disediakan

Bayar sesuai penggunaan, paket harian

Berdasarkan durasi penggunaan dan jumlah Model Unit

Bayar sesuai penggunaan, paket bulanan

Berdasarkan penggunaan Token model

Bayar sesuai penggunaan

Metode penskalaan

Peningkatan/penurunan throughput mandiri

Peningkatan/penurunan Model Unit mandiri

Kirim permohonan di konsol dan tunggu tinjauan manual.

Batasan produk

  1. Tagihan prabayar dihitung harian. Tidak tersedia pengembalian dana lebih awal.

  2. Jika penggunaan dalam satu unit waktu melebihi throughput yang dibeli, akan ditangani sesuai strategi overflow yang dipilih saat pembuatan: auto-overflow beralih ke penagihan pemanggilan model bayar sesuai penggunaan untuk model tersebut, sedangkan use-only-PTU-capacity mengembalikan kode 429.

Setelah pembelian prabayar, jika Anda membatalkan lebih awal dalam bulan pertama, harga satuan harian (≈ harga satuan bulanan / 30) akan ditagih sebesar 1,2 kali lipat.

  1. Hanya mendukung beberapa model setelah fine-tuning efisien (LoRA).

  2. Akan dilepas secara otomatis jika tidak digunakan dalam satu bulan.

Untuk melihat statistik historis penggunaan Token dan jumlah panggilan untuk setiap panggilan, buka: Pemantauan Model.

Rincian penagihan

Penagihan berdasarkan durasi penggunaan (Provisioned Throughput)

Biaya = Durasi penggunaan × (Harga satuan TPM input × TPM input + Harga satuan TPM output × TPM output)

Postpaid dihitung per jam: satuan durasi penggunaan adalah jam, dan harga satuan diambil dari kolom "1 jam berkelanjutan" pada tabel di bawah ini; prepaid dihitung per hari: satuan durasi penggunaan adalah hari, dan harga satuan diambil dari kolom "1 hari berkelanjutan" pada tabel di bawah ini.

  • Pesanan prepaid berlaku secara real time setelah pembayaran, dengan periode validitas N hari yang berakhir pukul 23.59 pada hari ke-N. Jika pesanan dilakukan setelah pukul 22.00, tanggal kedaluwarsa akan diperpanjang secara otomatis 1 hari.
  • Setelah pesanan prepaid kedaluwarsa, layanan akan dihentikan dengan penundaan 2 jam, dan sumber daya akan dipertahankan selama 14 jam setelah penghentian lalu dilepas.
  • Pesanan prepaid tidak dapat menghentikan layanan lebih awal.
  • Untuk penagihan postpaid, jika akun mengalami tunggakan, sumber daya yang diterapkan akan tetap dipertahankan dan ditagih selama 24 jam, di mana layanan masih dapat digunakan secara normal. Setelah 24 jam, sistem menghentikan penagihan, penerapan model memasuki status tunggakan, dan sumber daya dasar akan dihapus, tetapi tugas penerapan model akan dipertahankan. Setelah tunggakan dilunasi, sistem akan mengalokasikan ulang sumber daya dan memulihkan penggunaan (biaya akan terus berjalan setelah pemulihan). Jika Anda tidak ingin terus dikenai biaya, Anda dapat menghapus tugas penerapan model, dan penagihan akan berhenti setelah penghapusan berhasil.

Saat input model melebihi Token input maksimum, panggilan terkait akan secara otomatis beralih ke mode bayar sesuai penggunaan model saat ini; saat TPM yang dibeli terlampaui, akan ditangani sesuai strategi overflow yang dipilih saat pembuatan ("auto-overflow" beralih ke bayar sesuai penggunaan, "use-only-PTU-capacity" mengembalikan 429). Saat ini, kinerja inferensi mungkin menurun dan akan tunduk pada pengendalian lalu lintas publik model snapshot saat ini di ruang bisnis, dan biaya akan dikenakan sesuai standar pemanggilan model (bayar sesuai penggunaan).

  • Dalam kasus ini (hanya di bawah strategi "auto-overflow"), Header respons API akan mencakup: x-dashscope-ptu-overflow:true.
  • Untuk statistik TPM, buka: Pemantauan Model.

Untuk aturan spesifik pengurangan biaya dan pengembalian dana dalam skenario skala turun (downgrade), silakan merujuk ke: Aturan pengembalian dana untuk downgrade konfigurasi.

CatatanPenerapan PTU mendukung koefisien kapasitas bertingkat input panjang dan diskon cache; lihat Input panjang dan caching Provisioned Throughput untuk detailnya.

Singapura

Qwen

Nama Model

Kode Model

Token Input Maks

Input Pascabayar

Per 10K TPM/Jam

Output Postpaid

Per 1K TPM/Jam

Input Prabayar

Per 10K TPM/Hari

Prepaid Output

Per 1K TPM/Hari

Qwen3.8-Max

qwen3.8-max

1M

$4,8

$1,44

$57,6

$17,28

Qwen3.7-Flash-2026-07-15 Hubungi manajer bisnis Anda untuk mengaktifkan

qwen3.7-flash-2026-07-15

128K

$0,072

$0,031

$0,864

$0,374

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$1,92

$1,8

$72

$21,6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0,96

$0,384

$11,52

$4,608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1,2

$0,72

$14,4

$8,64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0,96

$0,576

$11,52

$6,912

DeepSeek

Nama model

Kode model

Maksimum input token

Input bayar sesuai penggunaan

Per 10K TPM/jam

Output bayar sesuai penggunaan

Per 1K TPM/jam

Input prepaid

Per 10K TPM/hari

Keluaran Prabayar

Per 1K TPM/hari

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0,72

$0,144

$8,64

$1,728

DeepSeek-v4-Flash-0731

deepseek-v4-flash-0731

64K

$1,44

$0,288

$17,28

$3,456

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$0,96

$1,728

$103,68

$20,736

Qwen-VL

Nama model

Kode model

Maksimum token input

Input bayar sesuai penggunaan

Per 10K TPM/jam

Output bayar sesuai penggunaan

Per 1K TPM/jam

Input Prabayar

Per 10K TPM/hari

Keluaran Prabayar

Per 1K TPM/hari

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0,48

$0,384

$5,76

$4,608

GLM

Nama model

Kode model

Maksimum token input

Input bayar sesuai penggunaan

Per 10K TPM/jam

Output bayar sesuai penggunaan

Per 1K TPM/jam

Input Prabayar

Per 10K TPM/hari

Output prepaid

Per 1K TPM/hari

GLM-5.2

glm-5.2

1M

$5,04

$1,584

$60,48

$19,008

China Utara 2 (Beijing)

Qwen

Nama model

Kode model

Maksimum token input

Input bayar sesuai penggunaan

Per 10K TPM/jam

Output bayar sesuai penggunaan

Per 1K TPM/jam

Input prepaid

Per 10K TPM/hari

Keluaran Prabayar

Per 1K TPM/hari

Qwen3.8-Max

qwen3.8-max

1M

$3,96

$1,188

$47,53

$14,258

Qwen3.7-Flash-2026-07-15 Hubungi manajer bisnis Anda untuk mengaktifkan

qwen3.7-flash-2026-07-15

128K

$0,066

$0,026

$0,792

$0,317

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$3,96

$1,188

$47,53

$14,258

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0,66

$0,264

$7,92

$3,168

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$0,67

$0,066

$7,93

$4,753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0,26

$0,16

$3,17

$1,9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128K

$1,11

$0,45

$13,32

$5,4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128K

$0,06

$0,06

$0,72

$0,72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128K

$0,28

Non-thinking: $0,07

Thinking: $0,28

$3,36

Non-thinking: $0,84

Thinking: $3,36

DeepSeek

Nama Model

Kode Model

Token Input Maks

Input Postpaid

Per 10K TPM/jam

Keluaran Pascabayar

Per 1K TPM/jam

Input Prepaid

Per 10K TPM/hari

Output Prepaid

Per 1K TPM/hari

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0,5

$0,099

$5,94

$1,188

DeepSeek-v4-Flash-0731

deepseek-v4-flash-0731

64K

$0,99

$0,198

$11,88

$2,376

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$5,94

$1,188

$71,3

$14,26

DeepSeek-v3

deepseek-v3

64K

$0,99

$0,396

$11,9

$4,75

Qwen-VL

Nama Model

Kode Model

Token Input Maksimum

Postpaid Input

Per 10K TPM/jam

Output Postpaid

Per 1K TPM/jam

Input Prabayar

Per 10K TPM/hari

Output Prabayar

Per 1K TPM/hari

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0,35

$0,35

$4,2

$4,2

GLM

Nama Model

Kode Model

Token Input Maksimum

Postpaid Input

Per 10K TPM/jam

Postpaid Output

Per 1K TPM/jam

Input Prabayar

Per 10K TPM/hari

Keluaran Prabayar

Per 1K TPM/hari

GLM-5.2

glm-5.2

1M

$3,96

$1,386

$47,53

$16,635

Penagihan berdasarkan durasi penggunaan (Model Unit)

Biaya = Durasi penggunaan (jam) × Jumlah Model Unit × Harga satuan Model Unit

"Harga satuan Model Unit" mengacu pada kolom "Harga satuan per jam" dalam tabel di bawah ini untuk skenario postpaid; sedangkan untuk penagihan prepaid langganan bulanan, rumusnya menjadi Jumlah langganan bulanan × Jumlah Model Unit × Harga satuan bulanan.

  • Untuk pembelian prepaid pada bulan pertama, jika Anda membatalkan langganan lebih awal dalam bulan tersebut, harga satuan harian (≈ Harga satuan bulanan / 30) akan dikenakan sebesar 1,2 kali lipat (penggunaan kurang dari satu hari dikenai biaya sebagai satu hari penuh).

CatatanSumber daya komputasi untuk metode postpaid Model Unit dialokasikan berdasarkan prinsip siapa cepat dia dapat. Jika pembelian gagal, pengembalian dana penuh akan diberikan.

Singapura

Generasi Teks

Nama Model

Kode Model

Spesifikasi Unit Model

Harga Satuan Per Jam (USD)

Penagihan Minimum: Menit

Harga Satuan Langganan Bulanan (USD)

Penagihan Minimum: Hari

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$88

$41.832

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU2 x 8

$112

$52.392

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU2 x 8

$112

$52.392

Qwen3.5-27B

qwen3.5-27b

MU1 x 2

$22

$10.458

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$22

$10.458

GLM-5.1

glm-5.1

MU2 x 8

$112

$52.392

MU3 x 8

$216

$102.696

DeepSeek-v4-Flash

deepseek-v4-flash

MU2 x 8

$112

$52.392

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$44

$20.916

Multimodal

Nama Model

Kode Model

Spesifikasi Unit Model

Harga Satuan Per Jam ($)

Penagihan Minimum: Menit

Harga Satuan Langganan Bulanan ($)

Penagihan Minimum: Hari

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$112

$52.392

Jenis model:

  • Instruct – Setelah diterapkan, model menjalankan inferensi dalam mode non-thinking.

China (Beijing)

Generasi teks

Qwen

Nama Model

Kode Model

Spesifikasi Unit Model

Harga Satuan Per Jam ($)

Penagihan Minimum: Menit

Harga Satuan Langganan Bulanan ($)

Penagihan minimum: hari

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

MU1 x 8

$59,408

$28.734,256

MU2 x 8

$69,312

$33.044,72

MU3 x 8

$150,72

$72.577,152

MU8 x 1

$6,464

$3.080,477

MU9 x 1

Rp7.014

$3.383,024

Qwen3.6-27B

qwen3.6-27b

MU9 x 1

$7,014

$3.383,024

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

$14,852

$7.183,564

MU3 x 8

$150,72

$72.577,152

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

MU1 x 16 (mode disagregasi PD)

$59,408

Mode disagregasi PD: $118,816

$28.734,256

Mode disagregasi PD: $57.468,512

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU3 x 8

MU3 x 16 (mode disagregasi PD)

$150,72

Mode disagregasi PD: $301,44

$72.577,152

Mode disagregasi PD: $145.154,304

MU6 x 16

$55,008

$26.599,92

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

$29,704

$14.367,128

MU6 x 16

$55,008

$26.599,92

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

$14,852

$7.183,564

MU2 x 8

$69,312

$33.044,72

MU3 x 8

$150,72

$72.577,152

MU9 x 1

$7,014

$3.383,024

Qwen3.5-27B

qwen3.5-27b

MU2 x 8

$69.312

$33.044,72

MU3 x 8

$150,72

$72.577,152

MU8 x 1

$6.464

$3.080,477

MU9 x 1

$7.014

$3.383,024

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$14,852

$7.183,564

MU2 x 8

$69,312

$33.044,72

Qwen3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

$14,852

$7.183,564

Qwen3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

MU1 x 16 (mode disagregasi PD)

$59,408

Mode disagregasi PD: $118,816

$28.734,256

Mode disagregasi PD: $57.468,512

MU2 x 8

$69,312

$33.044,72

MU3 x 8

MU3 x 16 (mode disagregasi PD)

$150,72

Mode disagregasi PD: $301,44

$72.577,152

Mode disagregasi PD: $145.154,304

Qwen3-235B-A22B-Instruct-2507

qwen3-235b-a22b-instruct-2507

MU1 x 4

$29,704

$14.367,128

MU2 x 8

$69.312

$33.044,72

MU3 x 8

$150,72

$72.577,152

Qwen3-32B

qwen3-32b

MU6 x 16

$55.008

$26.599,92

Qwen3-30B-A3B-Thinking-2507

qwen3-30b-a3b-thinking-2507

MU1 x 2

$14.852

$7.183,564

Qwen3-8B

qwen3-8b

MU1 x 2

$14,852

$7.183,564

MU2 x 2

$17,328

$8.261,18

Qwen3-4B

qwen3-4b

MU1 x 2

$14,852

$7.183,564

MU5 x 1

$2,888

$1.394,329

Qwen3-Embedding-0.6B

qwen3-embedding-0.6b

MU5 x 1

$2,888

$1.394,329

MU6 x 1

$3,438

$1.662,495

Qwen3-MoE-Rerank-0.6B

qwen3-moe-rerank-0.6b

MU5 x 1

$2,888

$1.394,329

Qwen3-Rerank-0.6B

qwen3-rerank-0.6b

MU5 x 1

$2,888

$1.394,329

MU6 x 1

$3,438

$1.662,495

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

$69,312

$33.044,72

MU3 x 8

$150,72

$72.577,152

Qwen3-Rerank

qwen3-rerank

MU5 x 1

$2,888

$1.394,329

Qwen2.5-Open-Source-72B

qwen2.5-72b-instruct

MU1 x 8

$59.408

$28.734,256

Qwen2.5-Open-Source-14B

qwen2.5-14b-instruct

MU1 x 2

$14,852

$7.183,564

Qwen2.5-Open-Source-7B

qwen2.5-7b-instruct

MU1 x 2

$14.852

$7.183,564

MU5 x 1

$2,888

$1.394,329

Qwen-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

MU1 x 16 (mode pemisahan PD)

$29.704

Mode pemisahan PD: $118,816

$14.367,128

Mode pemisahan PD: $57.468,512

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

$29.704

$14.367,128

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$29,704

$14.367,128

GLM

Nama Model

Kode Model

Spesifikasi Unit Model

Harga Satuan Per Jam ($)

Penagihan Minimum: Menit

Harga Satuan ($)

Penagihan Minimum: Hari

GLM-5.1

glm-5.1

MU2 x 8

$69.312

$33.044,72

MU3 x 16 (mode pemisahan PD)

Mode pemisahan PD: $301,44

Mode pemisahan PD: $145.154,304

MU6 x 16

$55,008

$26.599,92

GLM-5

glm-5

MU3 x 16 (mode pemisahan PD)

Mode pemisahan PD: $301,44

Mode pemisahan PD: $145.154,304

GLM-4.7

glm-4.7

MU6 x 32 (mode pemisahan PD)

Mode pemisahan PD: $110,016

Mode pemisahan PD: $53.199,84

DeepSeek

Nama model

Kode model

Spesifikasi unit model

Harga satuan per jam ($)

Penagihan minimum: menit

Harga langganan bulanan ($)

Penagihan minimum: hari

DeepSeek-v4-Flash

deepseek-v4-flash

MU1 x 8

$59,408

$28.734,256

MU3 x 8

$150,72

$72.577,152

DeepSeek-v3.2

deepseek-v3.2

MU2 x 16 (mode pemisahan PD)

Mode pemisahan PD: $138,624

Mode pemisahan PD: $66.089,44

Model lainnya

Nama model

Kode model

Spesifikasi unit model

Harga satuan per jam ($)

Penagihan minimum: menit

Harga langganan bulanan ($)

Penagihan minimum: hari

Kimi-K2.5

kimi-k2.5

MU2 x 8

$69,312

$33.044,72

Multimodal

Qwen VL

Nama model

Kode model

Spesifikasi unit model

Harga satuan per jam ($)

Penagihan minimum: menit

Harga langganan bulanan ($)

Penagihan minimum: hari

Qwen3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 8

$59.408

$28.734,256

MU2 x 8

$69,312

$33.044,72

MU3 x 8

$150,72

$72.577,152

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$69,312

$33.044,72

MU3 x 8

$150,72

$72.577,152

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$14,852

$7.183,564

MU5 x 1

$2,888

$1.394,329

Qwen3-VL-4B-Instruct

qwen3-vl-4b-instruct

MU1 x 2

$14,852

$7.183,564

Qwen3-VL-2B-Instruct

qwen3-vl-2b-instruct

MU5 x 1

$2,888

$1.394,329

Qwen3-VL-Embedding-2B

qwen3-vl-embedding-2b

MU5 x 1

$2,888

$1.394,329

Qwen3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

$29,704

$14.367,128

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

$29,704

$14.367,128

Qwen-VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

$13,752

$6.649,98

Qwen Omni

Nama model

Kode model

Spesifikasi unit model

Harga satuan per jam ($)

Penagihan minimum: menit

Harga langganan bulanan ($)

Penagihan minimum: hari

Qwen3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

$6,464

$3.080,477

MU9 x 1

$7,014

$3.383,024

Jenis model:

  • Instruct – Setelah diterapkan, model menjalankan inferensi dalam mode non-thinking.
  • Thinking – Setelah diterapkan, model menjalankan inferensi dalam mode thinking.

Berdasarkan penggunaan token model

Biaya = Jumlah token input model × Harga satuan input model + Jumlah token output model × Harga satuan output model (unit penagihan minimum: 1 token)

  • Penagihan berdasarkan penggunaan token model hanya didukung setelah Anda menyelesaikan pelatihan SFT efisien pada model dasar berikut dan memperoleh model kustom.

Singapura

Model dasar

Kode model

Input

$/Juta token

Output

$/Juta token

Qwen3-14B

qwen3-14b

Mode non-thinking: $0,35

Mode thinking: $0,35

Mode non-thinking: $1,4

Mode berpikir: $4,2

Beijing

Model dasar

Kode model

Input

$/Juta token

Output

$/Juta token

Qwen3.5-27B

qwen3.5-27b

<128K $0,086

128K-256K $0,258

<128K $0,688

128K–256K $2.064

Qwen3-32B

qwen3-32b

Mode non-thinking: $0,287

Mode thinking: $0,287

Mode non-thinking: $1,147

Mode thinking: $2,868

Qwen3-14B

qwen3-14b

Mode non-thinking: $0,144

Mode thinking: $0,144

Mode non-thinking: $0,574

Mode thinking: $1,434

Qwen3-8B

qwen3-8b

Mode non-thinking: $0,072

Mode thinking: $0,072

Mode non-thinking: $0,287

Mode thinking: $0,717

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

$0,072

$0,287

Untuk menerapkan lebih banyak model, rujuk ke solusi ini dan pilih rencana penerapan yang paling sesuai dengan kebutuhan bisnis Anda.

Metode penerapan

Anda dapat menerapkan model di konsol. Ikuti langkah-langkah berikut:

Jika Anda mendapat pesan izin tidak mencukupi, rujuk ke: Apa yang harus saya lakukan jika muncul pesan "izin tidak mencukupi" saat penerapan?

  1. Buka konsol penerapan model.

image

image

  1. Masukkan nama layanan, pilih model dan metode penagihan, biarkan pengaturan lainnya tetap default, lalu klik OK.

  1. Saat status penerapan adalah Running, model telah berhasil diterapkan.

Biaya akan dikenakan setelah model berhasil diterapkan.

Konfigurasi penerapan

Model Unit

Item konfigurasi

Rincian konfigurasi

Nama layanan

Nama kustom untuk layanan penerapan.

Model

Pilih model yang akan diterapkan, termasuk model preset platform dan model yang telah difine-tune.

Jenis unit model

Pilih spesifikasi penerapan. Spesifikasi berbeda sesuai dengan daya komputasi dan kinerja berbeda.

Jumlah replika

Tetapkan jumlah awal replika penerapan, yang memengaruhi kemampuan pemrosesan konkuren layanan.

Template penerapan

Pilih template penerapan (misalnya, "penerapan single-node"). Template berbeda sesuai dengan skema konfigurasi sumber daya berbeda. Hanya tersedia dalam mode penagihan unit model.

Mode inferensi model

Untuk beberapa model, saat diterapkan dalam modeModel Unit, Anda dapat mengonfigurasi mode inferensi, konteks maksimum, dan lainnya.

  • Instruct - Model melakukan inferensi dalam mode non-thinking setelah penerapan.

  • Thinking - Model melakukan inferensi dalam mode thinking setelah penerapan.

Konteks maksimum

Mode penerapanModel Unit beberapa model mendukung pengaturan ini. Panjang konteks maksimum bergantung pada jenis model.

Pembatasan laju layanan

Mode penerapanModel Unit beberapa model mendukung pengaturan ini, yang dapat membatasi RPM dan TPM panggilan model.

Halaman daftar penerapan

Setelah penerapan berhasil, Anda dapat melihat dan mengelola semua layanan penerapan di halaman daftar penerapan. Halaman daftar berisi informasi berikut:

  • Nama layanan: Nama layanan penerapan. Klik untuk melihat detail penerapan.
  • Nama model: Model yang digunakan untuk penerapan.
  • Kode Model: Pengidentifikasi unik yang dihasilkan setelah model berhasil diterapkan, digunakan untuk menentukan model saat memanggil API.
  • Status penerapan/Status event: Termasuk Menunggu penerapan, Menerapkan, Running, Penerapan gagal, Offline, Layanan dijeda, Dihentikan, Menghapus, Langganan ditangguhkan/Pembayaran tertunda ditangguhkan, Memulihkan layanan, Running (Mengubah konfigurasi), Running (Perubahan gagal), dan status lainnya.
  • Metode penagihan: Metode penagihan layanan penerapan saat ini.
  • Detail penerapan: Informasi konfigurasi seperti jenis unit model dan jumlah replika.
  • Detail pembatasan laju: Menampilkan konfigurasi pembatasan laju layanan penerapan saat ini, seperti RPM (permintaan per menit) dan TPM (token per menit).
  • Waktu layanan: Menampilkan waktu pembuatan dan waktu kedaluwarsa layanan penerapan.
  • Operasi: Bergantung pada status penerapan dan metode penagihan, Anda dapat melakukan operasi seperti Perbarui, Pantau, Penskalaan, Perpanjang, Offline, Hapus, dan Coba.

Panggilan pasca-penerapan

Setelah model berhasil diterapkan, Anda dapat memanggilnya melalui antarmuka yang kompatibel OpenAI, DashScope, dan Assistant SDK.

Saat memanggil model yang berhasil diterapkan, nilai model harus berupa kode model yang dihasilkan setelah penerapan berhasil. Buka konsol penerapan model untuk mendapatkan Model Code.

image
import os
import dashscope

messages = [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
    # Jika Anda belum mengonfigurasi variabel lingkungan, ganti baris berikut dengan Bailian API Key Anda: api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-max-xxx-xxx",  # Harap ganti dengan kode yang dikembalikan setelah model berhasil diterapkan
    messages=messages,
    result_format="message",
    enable_thinking=False,
)
print(response)
import os
from openai import OpenAI

client = OpenAI(
    # Jika Anda belum mengonfigurasi variabel lingkungan, ganti baris berikut dengan Bailian API Key Anda: api_key="sk-xxx",
    api_key=os.getenv('DASHSCOPE_API_KEY'),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3-max-xxx-xxx",  # Harap ganti dengan kode yang dikembalikan setelah model berhasil diterapkan
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Who are you?"},
    ],
    extra_body={"enable_thinking": False},
)
print(completion)

Penskalaan Layanan Penerapan

  • Throughput preset (ditagih berdasarkan durasi): Klik tombol Scaling untuk layanan mandiri, menyesuaikan jumlah instans secara manual. Untuk aturan pengurangan biaya dan pengembalian dana terperinci, silakan merujuk ke: Aturan pengembalian dana untuk downgrade konfigurasi.
  • Model unit (ditagih berdasarkan durasi): Klik tombol Scaling untuk layanan mandiri, menyesuaikan jumlah instans secara manual.

Selain itu, Anda dapat mengonfigurasi kebijakan penskalaan otomatis (termasuk ambang batas penskalaan, jumlah replika minimum/maksimum, penskalaan terjadwal, dll.) melalui tombol konfigurasi penskalaan di kolom operasi.

Menonaktifkan Layanan Penerapan

Buka Konsol Penerapan Model, temukan layanan penerapan yang ingin Anda hentikan, lalu klik operasi yang sesuai berdasarkan jenis penagihan:

  • Model unit prepaid: Klik Deactivate dan konfirmasi.
  • Postpaid: Klik Delete dan konfirmasi.

Tidak akan ada penagihan lebih lanjut setelah operasi selesai.

image

Operasi Lainnya

Selain menonaktifkan, kolom operasi di halaman daftar penerapan juga mendukung operasi berikut:

  • Perbarui: Perbarui versi model layanan yang diterapkan, mendukung pembaruan penuh atau pembaruan batch (rilis canary).
  • Hapus: Layanan bayar sesuai penggunaan dapat dihapus langsung untuk menghentikan penagihan.
  • Perpanjang: Layanan prepaid dapat diperpanjang untuk memperpanjang waktu layanan, dan mendukung perpanjangan otomatis.
  • Beli paket kapasitas: Beli paket kapasitas untuk penerapan throughput preset.

FAQ

Bisakah saya mengunggah dan menerapkan model saya sendiri?

Mengunggah dan menerapkan model Anda sendiri belum didukung. Kami menyarankan Anda terus mengikuti pembaruan terbaru Alibaba Cloud Model Studio.

Selain itu, Platform Kecerdasan Buatan Alibaba Cloud PAI menyediakan kemampuan untuk menerapkan model Anda sendiri. Anda dapat merujuk ke Penerapan Model Bahasa Besar PAI-LLM untuk mempelajari metode penerapan.

Apa yang harus saya lakukan jika muncul pesan "izin tidak mencukupi" saat penerapan?

  1. Jika muncul pesan "Missing permission for this module", pastikan akun Anda memiliki izin Model Deployment - Operation di halaman pengelolaan izin ruang bisnis.

    PixPin_2025-11-27_15-09-44

    Jika Anda tidak dapat beroperasi secara normal, hubungi organisasi atau administrator TI Anda untuk menambahkan izin terkait atau memeriksa masalah izin atas nama Anda.

  2. Jika terjadi kesalahan "ruang bisnis xx tidak memiliki izin untuk menerapkan model xx" selama penerapan, buka halaman Pengelolaan Ruang Bisnis Model Studio untuk menambahkan izin penerapan model yang sesuai untuk ruang bisnis yang sesuai.

    Kesalahan pemanggilan API: Workspace xxx does not have deployment privilege for model xxxx.

    PixPin_2025-11-27_15-03-57 PixPin_2025-11-27_15-06-41

    Jika muncul pesan izin tidak mencukupi, hubungi organisasi atau administrator TI Anda untuk menambahkan izin terkait atau beroperasi atas nama Anda.