Buat tugas penerapan model.
Prasyarat
-
Baca Pengantar penerapan model dan Terapkan model menggunakan API untuk memahami cara kerja penerapan model dan alur kerja dasar di Alibaba Cloud Model Studio.
-
Konfigurasikan Kunci API Anda untuk Model Studio. Untuk detailnya, lihat Dapatkan Kunci API.
Penerapan model
Endpoint
POST https://dashscope-intl.aliyuncs.com/api/v1/deployments
Contoh permintaan
Provisioned Throughput (PTU)
Setelah menjalankan perintah penerapan, penagihan dimulai segera setelah layanan berhasil diterapkan, meskipun Anda tidak menggunakannya. Sebelum melanjutkan, kami sarankan Anda meninjau aturan penagihan layanan.
Metode penagihan provisioned throughput mengenakan biaya berdasarkan durasi penggunaan. Metode ini cocok untuk skenario yang memerlukan throughput stabil, konkurensi tinggi, latensi rendah, dan trafik yang dapat diprediksi. Dalam mode ini, platform menyediakan throughput/konkurensi dan kecepatan generasi, yang tidak dapat Anda sesuaikan.
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"name": "my_qwen_flash",
"model_name": "qwen-flash-2025-07-28",
"plan": "ptu",
"ptu_capacity": {
"input_tpm": 10000,
"output_tpm": 1000
}
}'Model unit
Setelah menjalankan perintah penerapan, penagihan dimulai segera setelah layanan berhasil diterapkan, meskipun Anda tidak menggunakannya. Sebelum melanjutkan, kami sarankan Anda meninjau aturan penagihan layanan.
Sumber daya komputasi untuk paket model unit post-paid dialokasikan berdasarkan prinsip siapa cepat dia dapat. Jika pembelian gagal, pengembalian dana penuh akan diberikan.
Metode penagihan model unit mengenakan biaya berdasarkan durasi penggunaan. Metode penagihan ini ideal untuk tugas inferensi berskala besar setelah fine-tuning model, menawarkan sumber daya khusus dengan penyesuaian performa dan biaya yang fleksibel. Anda dapat menyesuaikan throughput/konkurensi dan kecepatan generasi.
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"name": "my_qwen_plus",
"model_name": "qwen-plus-2025-12-01",
"plan": "mu",
"deploy_spec": "MU1",
"enable_thinking": true,
"capacity": 4,
"max_context_length": 10000,
"rpm_limit": 500,
"tpm_limit": 1000
}'Mode penerapan model unit mendukung pengaturan tambahan berikut:
|
Parameter |
Deskripsi |
|
Model inference mode |
Metode Model Unit memungkinkan Anda mengonfigurasi parameter seperti mode inferensi dan max context untuk beberapa model.
|
|
Max context |
Pengaturan ini tersedia untuk beberapa model yang diterapkan menggunakan metode Model Unit. Panjang konteks maksimum bervariasi tergantung jenis model. |
|
Service throttling |
Pengaturan ini tersedia untuk beberapa model yang diterapkan menggunakan metode Model Unit. Anda dapat mengatur batas permintaan per menit (RPM) dan token per menit (TPM). |
Untuk mempelajari cara mengonfigurasi pengaturan ini menggunakan API, lihat Buat tugas penerapan model menggunakan API.
Token usage
Dengan penagihan berbasis penggunaan token, Anda dikenai biaya berdasarkan penggunaan token. Metode ini cocok untuk skenario yang sensitif terhadap biaya di mana persyaratan konkurensi dan latensi tidak kritis. Mode ini menawarkan keuntungan harga terbaik; platform menyediakan throughput/konkurensi dan kecepatan generasi, yang tidak dapat Anda sesuaikan.
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model_name": "qwen3-8b-ft-202511132025-0260",
"plan": "lora",
"capacity": 1,
"name": "qwen3-8b-ft"
}'Parameter capacity wajib tetapi saat ini tidak berpengaruh. Untuk meminta penskalaan, buka console penerapan model dan kirim formulir.Parameter permintaan
|
Parameter |
Tipe |
Lokasi |
Wajib |
Deskripsi |
|||||||||||
|
model_name |
String |
body |
Yes |
Nama model yang akan diterapkan. Ini sesuai dengan ID model di My Models. Anda juga bisa mendapatkan ID ini dari output operasi Create Training Job atau Create Import Job. |
|||||||||||
|
plan |
String |
body |
Yes |
Rencana penerapan. Metode penagihan berikut didukung:
Anda dapat dengan cepat menemukan rencana penerapan yang didukung untuk model fine-tuned di My Models. Catatan
Model CosyVoice hasil fine-tuning saat ini hanya mendukung |
|||||||||||
|
name |
String |
body |
Yes |
Nama tampilan model di console. |
|||||||||||
|
capacity |
Integer |
body |
No |
Wajib hanya ketika Catatan
Model CosyVoice saat ini menyediakan dua templat penerapan berikut dengan batasan
|
|||||||||||
|
billing_method |
String |
body |
No |
Wajib hanya ketika |
|||||||||||
|
deploy_spec |
String |
body |
No |
Pengaturan ini hanya berlaku ketika Untuk detail dukungan fitur, lihat Dukungan fitur untuk penerapan model unit. |
Parameter ini wajib ketika Catatan
Anda bisa mendapatkan nilai ini dari bidang |
||||||||||
|
enable_thinking |
Boolean |
body |
No |
Didukung oleh beberapa model. Anda dapat mengatur ini ke |
|||||||||||
|
max_context_length |
Number |
body |
No |
Didukung oleh beberapa model. Contoh: |
|||||||||||
|
rpm_limit |
Number |
body |
No |
Didukung oleh beberapa model. Menentukan jumlah maksimum permintaan per menit (RPM). |
|||||||||||
|
tpm_limit |
Number |
body |
No |
Didukung oleh beberapa model. Menentukan jumlah maksimum token per menit (TPM). |
|||||||||||
|
ptu_capacity |
Object |
body |
No |
Pengaturan ini hanya berlaku ketika Untuk detail dukungan fitur, lihat Dukungan Fitur untuk Penerapan PTU. Jika Anda tidak menentukan parameter ini, sistem secara default menggunakan |
Contoh: Contoh: |
||||||||||
|
ptu_capacity.input_tpm |
Number |
body |
No |
Didukung oleh semua model. Menentukan jumlah maksimum token input per menit (TPM). |
|||||||||||
|
ptu_capacity.output_tpm |
Number |
body |
No |
Didukung oleh semua model. Menentukan jumlah maksimum token output per menit (TPM). |
|||||||||||
|
ptu_capacity.thinking_output_tpm |
Number |
body |
No |
Didukung oleh beberapa model. Menentukan jumlah maksimum token output thinking yang disediakan per menit (TPM). |
|||||||||||
|
suffix |
String |
body |
No |
Setelah model diterapkan, nama model baru dihasilkan. Parameter suffix menentukan akhiran untuk nama baru ini. Akhiran tersebut harus unik secara global dan memiliki panjang maksimum 8 karakter. Anda dapat mengabaikan akhiran untuk penerapan pertama model. Jika Anda menerapkan model yang sama beberapa kali, Anda harus menentukan akhiran unik untuk setiap penerapan. Lihat parameter output deployed_model untuk informasi lebih lanjut. |
|||||||||||
Model yang didukung
Contoh respons
Perintah mengembalikan hasil berikut:
{
"request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
"output": {
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38.68",
"gmt_modified": "2025-06-17T11:00:38.68",
"status": "PENDING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 1,
"ready_capacity": 0,
"workspace_id": "llm-v71tlv3d***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
}
Parameter respons
|
Parameter |
Tipe |
Deskripsi |
|
request_id |
String |
ID permintaan. |
|
output |
Object |
Detail tugas penerapan. |
|
deployed_model |
String |
Pengidentifikasi unik untuk model yang diterapkan. ID ini digunakan dalam operasi API, seperti menanyakan detail penerapan, memodifikasi pembatasan laju penerapan, penskalaan penerapan, dan menghapus penerapan, serta diteruskan sebagai parameter SDK saat Anda memanggil model. |
|
gmt_create |
String |
Waktu pembuatan tugas penerapan. |
|
gmt_modified |
String |
Waktu modifikasi terakhir tugas penerapan. |
|
status |
String |
Status tugas penerapan.
|
|
model_name |
String |
Nama model yang digunakan dalam tugas penerapan. |
|
base_model |
String |
ID model dasar yang digunakan dalam tugas penerapan. |
|
base_capacity |
Number |
Jumlah minimum unit sumber daya yang diperlukan untuk menjalankan model dasar. |
|
capacity |
Number |
Jumlah unit sumber daya yang digunakan oleh tugas penerapan. |
|
ready_capacity |
Number |
Jumlah unit sumber daya yang siap memproses permintaan segera. Kecepatan inisialisasi sumber daya atau status perangkat keras dapat membatasi nilai ini. |
|
workspace_id |
String |
ID ruang kerja tugas penerapan. |
|
charge_type |
String |
Metode penagihan untuk tugas penerapan.
|
|
creator |
String |
UID pengguna yang membuat tugas penerapan. |
|
modifier |
String |
UID pengguna yang terakhir memodifikasi tugas penerapan. |
|
plan |
String |
Model penagihan untuk tugas penerapan. Parameter ini tidak dikembalikan untuk beberapa model penagihan. |
|
Dikembalikan hanya untuk penerapan Model Unit. |
||
|
model_unit_spec |
String |
Spesifikasi unit model. |
|
enable_thinking |
Boolean |
Menentukan apakah mode Thinking diaktifkan. Fitur ini hanya tersedia untuk model tertentu. |
|
max_context_length |
Number |
Panjang konteks maksimum. |
|
rpm_limit |
String |
Jumlah maksimum permintaan per menit (RPM). |
|
tpm_limit |
Number |
Jumlah maksimum token per menit (TPM). |
|
Dikembalikan hanya untuk penerapan throughput provisioned (PTU). |
||
|
ptu_capacity |
Object |
Parameter ini hanya berlaku ketika Contoh: |
|
ptu_capacity.input_tpm |
Number |
Jumlah maksimum token input per menit (TPM) untuk model yang diterapkan. Fitur ini didukung oleh semua model. |
|
ptu_capacity.output_tpm |
Number |
Jumlah maksimum token output per menit (TPM) untuk model yang diterapkan. Fitur ini didukung oleh semua model. |
|
ptu_capacity.thinking_output_tpm |
Number |
Jumlah maksimum token output thinking per menit (TPM) untuk model yang diterapkan. Fitur ini hanya tersedia untuk model tertentu. |
Respons kesalahan
Contoh respons
{
"request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
"message": "Model: qwen-plus-20230703-cx7f not found!",
"code": "NotFound"
}
Parameter respons
|
Parameter |
Tipe |
Deskripsi |
|
request_id |
String |
ID unik permintaan. |
|
code |
String |
Kode kesalahan. |
|
message |
String |
Pesan kesalahan. |
Kesalahan berikut dapat terjadi jika permintaan gagal:
|
Kode Kesalahan |
Pesan Kesalahan |
Alasan |
|
NotFound |
Model: xxx not found! |
|
|
Conflict |
Deployed model xxx already exists, please specify a suffix. |
Anda membuat tugas penerapan dengan akhiran yang sudah digunakan. |
|
InvalidParameter |
Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000! |
Anda membuat atau memperbarui tugas penerapan dengan jumlah unit kapasitas yang tidak valid. |