Panggil titik akhir GET /api/v1/quotas untuk menanyakan kuota batas laju setiap model di bawah Kunci API saat ini, termasuk batas laju permintaan (QPS/RPM) dan batas penggunaan (TPM), sehingga Anda dapat memahami serta merencanakan penggunaan API secara efektif.
Prasyarat
Kunci API telah dibuat dan dikonfigurasi sebagai variabel lingkungan DASHSCOPE_API_KEY. Untuk informasi lebih lanjut, lihat Konfigurasikan kunci API dalam variabel lingkungan.
Permintaan
Metode HTTP: GET
URL PermintaanGanti {WorkspaceId} dengan ID ruang kerja Anda.
Region | Endpoint |
|---|---|
Singapore |
|
China (Beijing) |
|
China (Hong Kong) |
|
Germany (Frankfurt) |
|
US (Virginia) |
|
Setel Authorization: Bearer {API_KEY} pada header permintaan.
Parameter permintaan
Semua parameter diteruskan melalui string kueri.
Parameter | Type | Required | Description |
|---|---|---|---|
name | String | No | Pencarian fuzzy berdasarkan nama model. Contoh: |
model | String | No | Pencocokan eksak berdasarkan ID model. Contoh: |
page_no | Integer | No | Nomor halaman, dimulai dari 1. Default: |
page_size | Integer | No | Jumlah model yang dikembalikan per halaman. Default: |
Parameter respons
Parameter | Type | Description |
|---|---|---|
request_id | String | ID permintaan, digunakan untuk troubleshooting. |
output.total | Number | Jumlah total model yang sesuai dengan kriteria kueri. |
output.page_no | Number | Nomor halaman saat ini. |
output.page_size | Number | Jumlah entri per halaman. |
output.quotas[].model | String | ID model. |
output.quotas[].workspace_id | String | ID ruang kerja. |
output.quotas[].model_limit | Object | Batas laju tingkat akun. Ini merepresentasikan batas laju keseluruhan untuk model di bawah akun saat ini. Berisi bidang-bidang berikut:
|
output.quotas[].workspace_limit | Object | Batas laju tingkat ruang kerja. Anda dapat mengatur batas laju individual untuk setiap ruang kerja, tetapi jumlah gabungan batas di semua ruang kerja tidak boleh melebihi |
Detail batas laju
Model Studio menerapkan batas laju pada dua tingkatan:
- model_limit (tingkat akun): Batas laju keseluruhan untuk model di bawah akun saat ini, yang dibagi di seluruh ruang kerja.
- workspace_limit (tingkat ruang kerja): Anda dapat mengonfigurasi batas laju individual untuk setiap ruang kerja. Jumlah gabungan batas di semua ruang kerja tidak boleh melebihi batas
model_limit.
Field | Meaning | Example |
|---|---|---|
request_limit + request_limit_period | Request rate limit |
|
usage_limit + usage_limit_period | Usage limit |
|
async_user_queue_limit | Async queue limit | Jumlah maksimum tugas yang dapat masuk antrian saat menggunakan panggilan asinkron. |
async_user_concurrency_limit | Async concurrency limit | Jumlah maksimum tugas yang dapat dieksekusi secara bersamaan saat menggunakan panggilan asinkron. |
Contoh permintaan
Contoh 1: Menanyakan kuota untuk semua modelcurl "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/quotas?page_no=1&page_size=100" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header "Content-Type: application/json"
Contoh 2: Menanyakan kuota untuk model tertentu
curl "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/quotas?model=qwen3-max" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header "Content-Type: application/json"
Contoh respons
{
"code": null,
"message": null,
"success": true,
"output": {
"total": 453,
"page_no": 1,
"page_size": 10,
"quotas": [
{
"model": "qwen3-max",
"workspace_id": "ws-o72y059armtglf1u",
"model_limit": {
"request_limit": 500,
"request_limit_period": 1,
"usage_limit": 500000,
"usage_limit_field": "total_tokens",
"usage_limit_period": 6,
"async_user_queue_limit": null,
"async_user_concurrency_limit": null
},
"workspace_limit": null
},
{
"model": "wan2.6-i2v-flash",
"workspace_id": "ws-o72y059armtglf1u",
"model_limit": {
"request_limit": 5,
"request_limit_period": 1,
"usage_limit": null,
"usage_limit_field": null,
"usage_limit_period": null,
"async_user_queue_limit": 500,
"async_user_concurrency_limit": 5
},
"workspace_limit": null
},
{
"model": "qwen-image-max",
"workspace_id": "ws-o72y059armtglf1u",
"model_limit": {
"request_limit": 2,
"request_limit_period": 60,
"usage_limit": 1000000,
"usage_limit_field": "total_tokens",
"usage_limit_period": 60,
"async_user_queue_limit": null,
"async_user_concurrency_limit": null
},
"workspace_limit": null
}
]
},
"request_id": "2043b55f-f0d2-95ee-a449-234e1ee57042"
}
Pada contoh sebelumnya:
qwen3-max: Maksimal 500 permintaan per detik dan maksimal 500.000 token per 6 detik. Tidak ada batas tingkat ruang kerja yang ditetapkan.wan2.6-i2v-flash: Maksimal 5 permintaan per detik tanpa batas penggunaan. Batas antrian tugas asinkron adalah 500 dan batas konkurensi asinkron adalah 5.qwen-image-max: Maksimal 2 permintaan per menit dan maksimal 1.000.000 token per menit. Tidak ada batas tingkat ruang kerja yang ditetapkan.
Kode kesalahan
Jika pemanggilan gagal, pesan kesalahan akan dikembalikan. Untuk informasi lebih lanjut tentang kode kesalahan dan solusinya, lihat Pesan kesalahan.
Dokumentasi terkait
- List models
- Rate limiting