All Products
Search
Document Center

Alibaba Cloud Model Studio:Buat penerapan

Last Updated:Jun 07, 2026

Buat tugas penerapan model.

Prasyarat

Penerapan model

Endpoint

POST https://dashscope-intl.aliyuncs.com/api/v1/deployments

Contoh permintaan

Provisioned Throughput (PTU)

Catatan

Setelah menjalankan perintah penerapan, penagihan dimulai segera setelah layanan berhasil diterapkan, meskipun Anda tidak menggunakannya. Sebelum melanjutkan, kami sarankan Anda meninjau aturan penagihan layanan.

Metode penagihan provisioned throughput mengenakan biaya berdasarkan durasi penggunaan. Metode ini cocok untuk skenario yang memerlukan throughput stabil, konkurensi tinggi, latensi rendah, dan trafik yang dapat diprediksi. Dalam mode ini, platform menyediakan throughput/konkurensi dan kecepatan generasi, yang tidak dapat Anda sesuaikan.

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_flash",
    "model_name": "qwen-flash-2025-07-28",
    "plan": "ptu",
    "ptu_capacity": {
        "input_tpm": 10000,
	"output_tpm": 1000
    }
}'

Model unit

Catatan
  • Setelah menjalankan perintah penerapan, penagihan dimulai segera setelah layanan berhasil diterapkan, meskipun Anda tidak menggunakannya. Sebelum melanjutkan, kami sarankan Anda meninjau aturan penagihan layanan.

  • Sumber daya komputasi untuk paket model unit post-paid dialokasikan berdasarkan prinsip siapa cepat dia dapat. Jika pembelian gagal, pengembalian dana penuh akan diberikan.

Metode penagihan model unit mengenakan biaya berdasarkan durasi penggunaan. Metode penagihan ini ideal untuk tugas inferensi berskala besar setelah fine-tuning model, menawarkan sumber daya khusus dengan penyesuaian performa dan biaya yang fleksibel. Anda dapat menyesuaikan throughput/konkurensi dan kecepatan generasi.

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_plus",
    "model_name": "qwen-plus-2025-12-01",
    "plan": "mu",
    "deploy_spec": "MU1",
    "enable_thinking": true,
    "capacity": 4,
    "max_context_length": 10000,
    "rpm_limit": 500,
    "tpm_limit": 1000
}'

Mode penerapan model unit mendukung pengaturan tambahan berikut:

Parameter

Deskripsi

Model inference mode

Metode Model Unit memungkinkan Anda mengonfigurasi parameter seperti mode inferensi dan max context untuk beberapa model.

  • Instruct – Setelah diterapkan, model menjalankan inferensi dalam instruct mode.

  • Thinking - Setelah penerapan, model menjalankan inferensi dalam mode thinking.

Max context

Pengaturan ini tersedia untuk beberapa model yang diterapkan menggunakan metode Model Unit. Panjang konteks maksimum bervariasi tergantung jenis model.

Service throttling

Pengaturan ini tersedia untuk beberapa model yang diterapkan menggunakan metode Model Unit. Anda dapat mengatur batas permintaan per menit (RPM) dan token per menit (TPM).

Untuk mempelajari cara mengonfigurasi pengaturan ini menggunakan API, lihat Buat tugas penerapan model menggunakan API.

Token usage

Dengan penagihan berbasis penggunaan token, Anda dikenai biaya berdasarkan penggunaan token. Metode ini cocok untuk skenario yang sensitif terhadap biaya di mana persyaratan konkurensi dan latensi tidak kritis. Mode ini menawarkan keuntungan harga terbaik; platform menyediakan throughput/konkurensi dan kecepatan generasi, yang tidak dapat Anda sesuaikan.

curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model_name": "qwen3-8b-ft-202511132025-0260",
    "plan": "lora",
    "capacity": 1,
    "name": "qwen3-8b-ft"
}'
Parameter capacity wajib tetapi saat ini tidak berpengaruh. Untuk meminta penskalaan, buka console penerapan model dan kirim formulir.

Parameter permintaan

Parameter

Tipe

Lokasi

Wajib

Deskripsi

model_name

String

body

Yes

Nama model yang akan diterapkan. Ini sesuai dengan ID model di My Models. Anda juga bisa mendapatkan ID ini dari output operasi Create Training Job atau Create Import Job.

plan

String

body

Yes

Rencana penerapan. Metode penagihan berikut didukung:

Metode penagihan

Pengaturan rencana

Billing by model unit

"plan": "mu"

Billing by compute unit

"plan": "cu"

Provisioned throughput

"plan": "ptu"

LoRA shared deployment (billed by token usage)

"plan": "lora"

Anda dapat dengan cepat menemukan rencana penerapan yang didukung untuk model fine-tuned di My Models.

Catatan

Model CosyVoice hasil fine-tuning saat ini hanya mendukung "plan": "mu".

name

String

body

Yes

Nama tampilan model di console.

capacity

Integer

body

No

Wajib hanya ketika "plan": "mu" ditentukan. Menentukan jumlah unit sumber daya untuk penerapan. Nilainya harus kelipatan bilangan bulat dari base_capacity. Batasan bervariasi berdasarkan nilai deploy_spec. Misalnya, untuk MU2, nilainya harus kelipatan 8, sedangkan untuk MU5, nilainya bisa 1. Contoh: "capacity": 1.

Catatan

Model CosyVoice saat ini menyediakan dua templat penerapan berikut dengan batasan capacity yang sesuai:

  • penerapan single-node: capacity harus kelipatan bilangan bulat dari 1, seperti 1, 2, 3, 4, atau 5.

  • penerapan single-node - edisi inferensi kompleks flagship: capacity harus kelipatan bilangan bulat dari 8, seperti 8, 16, 24, atau 32.

billing_method

String

body

No

Wajib hanya ketika "plan": "mu" ditentukan. Saat ini, hanya "POST_PAY" (Post-paid) yang didukung. Contoh: "billing_method": "POST_PAY".

deploy_spec

String

body

No

Pengaturan ini hanya berlaku ketika "plan": "mu" ditentukan.

Untuk detail dukungan fitur, lihat Dukungan fitur untuk penerapan model unit.

Parameter ini wajib ketika "plan": "mu" ditentukan. Contoh: "deploy_spec": "MU1".

Catatan

Anda bisa mendapatkan nilai ini dari bidang template_id yang dikembalikan oleh operasi Get Deployable Model List.

enable_thinking

Boolean

body

No

Didukung oleh beberapa model. Anda dapat mengatur ini ke true atau false.

max_context_length

Number

body

No

Didukung oleh beberapa model. Contoh: "max_context_length": 131072.

rpm_limit

Number

body

No

Didukung oleh beberapa model. Menentukan jumlah maksimum permintaan per menit (RPM).

tpm_limit

Number

body

No

Didukung oleh beberapa model. Menentukan jumlah maksimum token per menit (TPM).

ptu_capacity

Object

body

No

Pengaturan ini hanya berlaku ketika "plan": "ptu" ditentukan.

Untuk detail dukungan fitur, lihat Dukungan Fitur untuk Penerapan PTU.

Jika Anda tidak menentukan parameter ini, sistem secara default menggunakan 10.000 input_tpm dan 1.000 output_tpm.

Contoh: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.

Contoh: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.

ptu_capacity.input_tpm

Number

body

No

Didukung oleh semua model. Menentukan jumlah maksimum token input per menit (TPM).

ptu_capacity.output_tpm

Number

body

No

Didukung oleh semua model. Menentukan jumlah maksimum token output per menit (TPM).

ptu_capacity.thinking_output_tpm

Number

body

No

Didukung oleh beberapa model. Menentukan jumlah maksimum token output thinking yang disediakan per menit (TPM).

suffix

String

body

No

Setelah model diterapkan, nama model baru dihasilkan. Parameter suffix menentukan akhiran untuk nama baru ini. Akhiran tersebut harus unik secara global dan memiliki panjang maksimum 8 karakter. Anda dapat mengabaikan akhiran untuk penerapan pertama model. Jika Anda menerapkan model yang sama beberapa kali, Anda harus menentukan akhiran unik untuk setiap penerapan.

Lihat parameter output deployed_model untuk informasi lebih lanjut.

Model yang didukung

Lihat fitur yang didukung dan penagihan.

Pay-as-you-go

biaya = durasi penggunaan × (harga TPM input × TPM input + harga TPM output × TPM output)

Untuk penagihan pay-as-you-go, penggunaan dihitung per jam, dan kolom "durasi 1 jam" mencantumkan harga satuan. Untuk penagihan langganan, penggunaan dihitung per hari, dan kolom "durasi 1 hari" mencantumkan harga satuan.

  • Langganan diaktifkan setelah pembayaran dan berlaku selama N hari, berakhir pada pukul 23:59 pada hari ke-N. Untuk pesanan yang dilakukan setelah pukul 22:00, tanggal kedaluwarsa diperpanjang otomatis 1 hari.

  • Setelah langganan kedaluwarsa, layanan dihentikan setelah periode tenggang 2 jam. Sumber daya kemudian disimpan selama 14 jam sebelum dilepas.

  • Anda tidak dapat menghentikan langganan lebih awal.

  • Untuk pay-as-you-go, jika akun memiliki saldo jatuh tempo, sumber daya yang diterapkan disimpan dan penagihan berlanjut selama 24 jam sebelum dilepas secara otomatis.

Ketika input model melebihi batas token maksimum atau TPM yang dibeli, panggilan ke model tersebut secara otomatis beralih ke mode pay-as-you-go. Dalam mode ini, performa inferensi dapat menurun, pembatasan laju tunduk pada batas trafik publik model snapshot saat ini di ruang kerja Anda, dan biaya dikenakan sesuai tarif standar pay-as-you-go.

  • Header respons API akan menyertakan x-dashscope-ptu-overflow:true.

  • Untuk melihat statistik TPM, buka console Model Studio.

Lihat Aturan Pengembalian Dana Penurunan Spesifikasi Konfigurasi untuk detail penyesuaian biaya dan pengembalian dana untuk skala-masuk (penurunan spesifikasi).

Singapura
Qwen

Nama model

Kode model

Maksimum token input

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128.000

$1,2

$0,72

$14,4

$8,64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128.000

$0,96

$0,576

$11,52

$6.912

Qwen-VL

Nama model

Kode model

Token input maks

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128.000

$0,48

$0,384

$5,76

$4,608

DeepSeek

Nama model

Kode model

Maksimum token input

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

DeepSeek-v3.2

deepseek-v3.2

64.000

$2,05

$0,616

$24,62

$7,387

China (Beijing)
Qwen

Nama model

Kode model

Maksimum token masukan

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

128.000

$3,96

$1,188

$47,53

$14,258

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

128.000

$0,4

$0,238

$4,75

$2,852

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128.000

$0,67

$0,397

$7,93

$4,753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128.000

$0,26

$0,16

$3,17

$1,9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128.000

$1,11

$0,45

$13,32

$5,4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128.000

$0,06

$0,06

$0,72

$0,72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128.000

$0,28

non-thinking: $0,07

thinking: $0,28

$3,36

non-thinking: $0,84

thinking: $3,36

DeepSeek

Nama model

Kode model

Token input maks

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

DeepSeek-v4-Pro

deepseek-v4-pro

64.000

$5,94

$1,188

$71,3

$14,26

DeepSeek-v3.2

deepseek-v3.2

64.000

$1,04

$0,16

$12,48

$1,92

DeepSeek-v3

deepseek-v3

64.000

$0,99

$0,396

$11,9

$4,75

Qwen-VL

Nama model

Kode model

Maksimum token input

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128.000

$0,35

$0,35

$4,2

$4,2

Model lain

Nama model

Kode model

Maksimum token input

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

GLM-5.1

glm-5.1

64.000

$2,97

$1,19

$35,65

$14,26

Penagihan berdasarkan durasi

biaya = penggunaan (jam) × jumlah unit model × harga unit model

Untuk pay-as-you-go, harga unit model sama dengan harga satuan per jam dalam tabel di bawah. Untuk langganan bulanan, rumusnya adalah jumlah bulan langganan × jumlah unit model × harga satuan bulanan.

  • Jika Anda membatalkan pembelian prabayar dalam bulan pertama, Anda akan ditagih sebesar 1,2 kali tarif harian (sekitar tarif bulanan / 30). Setiap hari parsial ditagih sebagai hari penuh.

Catatan

Kami mengalokasikan sumber daya komputasi untuk unit model pay-as-you-go berdasarkan prinsip siapa cepat dia dapat. Jika pembelian gagal, kami memberikan pengembalian dana penuh.

Singapura
Generasi teks

Nama model

Kode model

Unit model

Harga per jam ($)

Harga bulanan ($)

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$88

$41.832

Qwen3.5-39B-A17B

qwen3.5-39b-a17b

MU2 x 8

$112

$52.392

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU2 x 8

$112

$52.392

Qwen3-32B

qwen3-32b

MU1 x 4

$44

$20.916

MU2 x 8

$112

$52.392

Qwen3-14B

qwen3-14b

MU1 x 4

$44

$20.916

GLM-5.1

glm-5.1

MU2 x 8

$112

$52.392

DeepSeek-V4-Flash

deepseek-v4-flash

MU1 x 8

$88

$41.832

Multimodal

Nama model

Kode model

Unit model

Harga per jam ($)

Harga bulanan ($)

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$112

$52.392

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$22

$10.458

Jenis model:

  • Instruct: Menjalankan inferensi dalam mode non-thinking setelah penerapan.

China Utara 2 (Beijing)
Generasi teks
Qwen

Model

Kode

Spesifikasi unit

Tarif per jam ($)

Tarif bulanan ($)

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

MU8 x 1

$6.464

$3.080,477

MU9 x 1

$7,014

$3.383,024

Qwen3.6-27B

qwen3.6-27b

MU9 x 1

$7,014

$3.383,024

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

$14,852

$7.183,564

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$59.408

$28.734,256

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU2 x 8

$69,312

$33.044,72

MU3 x 8

$150,72

$72.577,152

MU6 x 16

$55.008

$26.599,92

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

$29,704

$14.367,128

MU2 x 8

$69,312

$33.044,72

MU6 x 16

$55,008

$26.599,92

MU9 x 2

$14.028

$6.766,048

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

$14,852

$7.183,564

MU2 x 8

$69,312

$33.044,72

MU8 x 1

$6.464

$3.080,477

MU9 x 1

$7,014

$3.383,024

Qwen3.5-27B

qwen3.5-27b

MU1 x 2

$14,852

$7.183,564

MU9 x 1

$7,014

$3.383,024

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$14,852

$7.183,564

MU8 x 1

$6,464

$3.080,477

MU9 x 1

$7.014

$3.383,024

Qwen3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

$14,852

$7.183,564

Qwen3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

$59,408

$28.734,256

MU3 x 8

$150,72

$72.577,152

Qwen3-235B-A22B-Instruct

qwen3-235b-a22b-instruct-2507

MU1 x 4

$29.704

$14.367,128

MU2 x 8

$69,312

$33.044,72

Qwen3-Next-80B-A3B-Instruct

qwen3-next-80b-a3b-instruct

MU1 x 2

$14,852

$7.183,564

Qwen3-32B

qwen3-32b

MU1 x 4

$29,704

$14.367,128

MU6 x 4

$13,752

$6.649,98

Qwen3-30B-A3B

qwen3-30b-a3b

MU9 x 2

$14,028

$6.766,048

Qwen3-30B-A3B-Instruct-2507

qwen3-30b-a3b-instruct-2507

MU1 x 4

$29,704

$14.367,128

MU2 x 8

$69.312

$33.044,72

Qwen3-8B

qwen3-8b

MU1 x 2

$14,852

$7.183,564

MU2 x 2

$17,328

$8.261,18

MU5 x 1

$2,888

$1.394,329

Qwen3-4B

qwen3-4b

MU1 x 2

$14.852

$7.183,564

MU5 x 1

$2,888

$1.394,329

Qwen3-1.7B

qwen3-1.7b

MU1 x 2

$14.852

$7.183,564

MU5 x 1

$2,888

$1.394,329

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

$69.312

$33.044,72

MU3 x 8

$150,72

$72.577,152

Qwen2.5-72B

qwen2.5-72b-instruct

MU1 x 4

$29,704

$14.367,128

Qwen2.5-32B

qwen2.5-32b-instruct

MU1 x 4

$29,704

$14.367,128

Qwen2.5-14B

qwen2.5-14b-instruct

MU1 x 2

$14.852

$7.183,564

Qwen2.5-7B

qwen2.5-7b-instruct

MU1 x 2

$14,852

$7.183,564

MU5 x 1

$2,888

$1.394,329

Qwen2.5-3B-Instruct

qwen2.5-3b-instruct

MU5 x 1

$2,888

$1.394,329

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

MU1 x 4

$29,704

$14.367,128

Qwen-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

$29,704

$14.367,128

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

$29,704

$14.367,128

GLM

Nama model

Kode model

Unit

Harga per jam ($)

Harga bulanan ($)

GLM-5

glm-5

MU3 x 8

$150,72

$72.577,15

GLM-4.7

glm-4.7

MU6 x 16

$55,01

$26.599,92

DeepSeek

Nama model

Kode model

Spesifikasi unit

Harga per jam ($)

Harga bulanan ($)

DeepSeek-V4-Flash

deepseek-v4-flash

MU1 x 8

$59,41

$28.734,26

DeepSeek-V3.2

deepseek-v3.2

MU2 x 8

$69,31

$33.044,72

Model lain

Nama model

ID Model

Spesifikasi unit

Harga per jam ($)

Harga bulanan ($)

MiniMax-M2.5

MiniMax-M2.5

MU1 x 8

$59,41

$28.734,26

Kimi-K2.5

kimi-k2.5

MU2 x 8

$69,31

$33.044,72

Multimodal
Qwen-VL

Nama model

Kode model

Spesifikasi unit

Harga per jam ($)

Harga bulanan ($)

Qwen3-VL-235B-A22B-Instruct

qwen3-vl-235b-a22b-instruct

MU1 x 4

$29,704

$14.367,128

Qwen3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 4

$29,704

$14.367,128

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$69,312

$33.044,72

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$14,852

$7.183,564

Qwen3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

$29,704

$14.367,128

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

$29,704

$14.367,128

Qwen-VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

$13,752

$6.649,98

Qwen-VL-OCR-2025-11-20

qwen-vl-ocr-2025-11-20

MU6 x 4

$13,752

$6.649,98

Qwen-Omni

Nama model

Kode model

Spesifikasi unit

Harga per jam ($)

Harga bulanan ($)

Qwen3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

$6.464

$3.080,477

MU9 x 1

$7.014

$3.383,024

Qwen3.5-Omni-Plus

qwen3.5-omni-plus

MU9 x 8

$56,112

$27.064,192

Jenis model:

  • Instruct - Menjalankan inferensi dalam mode non-thinking setelah diterapkan.

  • Thinking - Menjalankan inferensi dalam mode thinking setelah diterapkan.

Penagihan berbasis token

biaya = (jumlah token input × harga per token input) + (jumlah token output × harga per token output) (unit penagihan minimum: 1 token)

  • Penagihan berbasis token hanya berlaku untuk model kustom yang telah difine-tune dari model dasar berikut.

Singapura

Model dasar

Kode model

Input

USD/1.000 token

Output

USD/1.000 token

Qwen3-14B

qwen3-14b

$0,00035

mode non-thinking: $0,0014

mode thinking: $0,0042

Contoh respons

Perintah mengembalikan hasil berikut:

{
  "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
  "output": {
    "deployed_model": "emo-35b3f106-sample01",
    "gmt_create": "2025-06-17T11:00:38.68",
    "gmt_modified": "2025-06-17T11:00:38.68",
    "status": "PENDING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 1,
    "ready_capacity": 0,
    "workspace_id": "llm-v71tlv3d***",
    "charge_type": "post_paid",
    "creator": "175805416***",
    "modifier": "175805416***"
  }
}

Parameter respons

Parameter

Tipe

Deskripsi

request_id

String

ID permintaan.

output

Object

Detail tugas penerapan.

deployed_model

String

Pengidentifikasi unik untuk model yang diterapkan. ID ini digunakan dalam operasi API, seperti menanyakan detail penerapan, memodifikasi pembatasan laju penerapan, penskalaan penerapan, dan menghapus penerapan, serta diteruskan sebagai parameter SDK saat Anda memanggil model.

gmt_create

String

Waktu pembuatan tugas penerapan.

gmt_modified

String

Waktu modifikasi terakhir tugas penerapan.

status

String

Status tugas penerapan.

  • PENDING: Tugas sedang dibuat.

  • UPDATING: Tugas sedang diperbarui.

  • RUNNING: Tugas penerapan sedang berjalan, dan model yang diterapkan dapat memproses permintaan.

  • STOPPED: Tugas penerapan dihentikan dan tidak ditagih.

  • DELETING: Tugas sedang dihapus.

  • FAILED: Pembuatan atau pembaruan tugas gagal.

model_name

String

Nama model yang digunakan dalam tugas penerapan.

base_model

String

ID model dasar yang digunakan dalam tugas penerapan.

base_capacity

Number

Jumlah minimum unit sumber daya yang diperlukan untuk menjalankan model dasar.

capacity

Number

Jumlah unit sumber daya yang digunakan oleh tugas penerapan.

ready_capacity

Number

Jumlah unit sumber daya yang siap memproses permintaan segera. Kecepatan inisialisasi sumber daya atau status perangkat keras dapat membatasi nilai ini.

workspace_id

String

ID ruang kerja tugas penerapan.

charge_type

String

Metode penagihan untuk tugas penerapan.

post_paid: Post-paid.

creator

String

UID pengguna yang membuat tugas penerapan.

modifier

String

UID pengguna yang terakhir memodifikasi tugas penerapan.

plan

String

Model penagihan untuk tugas penerapan. Parameter ini tidak dikembalikan untuk beberapa model penagihan.

Dikembalikan hanya untuk penerapan Model Unit.

model_unit_spec

String

Spesifikasi unit model.

enable_thinking

Boolean

Menentukan apakah mode Thinking diaktifkan. Fitur ini hanya tersedia untuk model tertentu.

max_context_length

Number

Panjang konteks maksimum.

rpm_limit

String

Jumlah maksimum permintaan per menit (RPM).

tpm_limit

Number

Jumlah maksimum token per menit (TPM).

Dikembalikan hanya untuk penerapan throughput provisioned (PTU).

ptu_capacity

Object

Parameter ini hanya berlaku ketika "plan": "ptu" ditetapkan.

Contoh: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.

ptu_capacity.input_tpm

Number

Jumlah maksimum token input per menit (TPM) untuk model yang diterapkan. Fitur ini didukung oleh semua model.

ptu_capacity.output_tpm

Number

Jumlah maksimum token output per menit (TPM) untuk model yang diterapkan. Fitur ini didukung oleh semua model.

ptu_capacity.thinking_output_tpm

Number

Jumlah maksimum token output thinking per menit (TPM) untuk model yang diterapkan. Fitur ini hanya tersedia untuk model tertentu.

Respons kesalahan

Contoh respons

{
    "request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
    "message": "Model: qwen-plus-20230703-cx7f not found!",
    "code": "NotFound"
}

Parameter respons

Parameter

Tipe

Deskripsi

request_id

String

ID unik permintaan.

code

String

Kode kesalahan.

message

String

Pesan kesalahan.

Kesalahan berikut dapat terjadi jika permintaan gagal:

Kode Kesalahan

Pesan Kesalahan

Alasan

NotFound

Model: xxx not found!

  • Anda membuat tugas penerapan menggunakan model yang tidak ada.

  • Anda menanyakan, memperbarui, atau menghapus tugas penerapan yang menggunakan model yang tidak ada.

Conflict

Deployed model xxx already exists, please specify a suffix.

Anda membuat tugas penerapan dengan akhiran yang sudah digunakan.

InvalidParameter

Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000!

Anda membuat atau memperbarui tugas penerapan dengan jumlah unit kapasitas yang tidak valid.