All Products
Search
Document Center

Alibaba Cloud Model Studio:Daftar kuota model

Last Updated:Sep 02, 2026

Panggil titik akhir GET /api/v1/quotas untuk menanyakan kuota batas laju setiap model di bawah Kunci API saat ini, termasuk batas laju permintaan (QPS/RPM) dan batas penggunaan (TPM), sehingga Anda dapat memahami serta merencanakan penggunaan API secara efektif.

Prasyarat

Kunci API telah dibuat dan dikonfigurasi sebagai variabel lingkungan DASHSCOPE_API_KEY. Untuk informasi lebih lanjut, lihat Konfigurasikan kunci API dalam variabel lingkungan.

Permintaan

Metode HTTP: GET

URL Permintaan

Ganti {WorkspaceId} dengan ID ruang kerja Anda.

Region

Endpoint

Singapore

https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/quotas

China (Beijing)

https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/quotas

China (Hong Kong)

https://{WorkspaceId}.cn-hongkong.maas.aliyuncs.com/api/v1/quotas

Germany (Frankfurt)

https://{WorkspaceId}.eu-central-1.maas.aliyuncs.com/api/v1/quotas

US (Virginia)

https://{WorkspaceId}.us-east-1.maas.aliyuncs.com/api/v1/quotas

Otentikasi

Setel Authorization: Bearer {API_KEY} pada header permintaan.

Parameter permintaan

Semua parameter diteruskan melalui string kueri.

Parameter

Type

Required

Description

name

String

No

Pencarian fuzzy berdasarkan nama model. Contoh: qwen

model

String

No

Pencocokan eksak berdasarkan ID model. Contoh: qwen3-max

page_no

Integer

No

Nomor halaman, dimulai dari 1. Default: 1.

page_size

Integer

No

Jumlah model yang dikembalikan per halaman. Default: 20.

Parameter respons

Parameter

Type

Description

request_id

String

ID permintaan, digunakan untuk troubleshooting.

output.total

Number

Jumlah total model yang sesuai dengan kriteria kueri.

output.page_no

Number

Nomor halaman saat ini.

output.page_size

Number

Jumlah entri per halaman.

output.quotas[].model

String

ID model.

output.quotas[].workspace_id

String

ID ruang kerja.

output.quotas[].model_limit

Object

Batas laju tingkat akun. Ini merepresentasikan batas laju keseluruhan untuk model di bawah akun saat ini. Berisi bidang-bidang berikut:

  • request_limit (Number): Nilai batas laju permintaan.

  • request_limit_period (Number): Periode waktu untuk batas laju permintaan, dalam detik. Nilai 60 menunjukkan per menit (RPM), dan nilai 1 menunjukkan per detik (QPS).

  • usage_limit (Number): Nilai batas penggunaan. Nilai null menunjukkan tidak ada batas penggunaan.

  • usage_limit_field (String): Jenis batas penggunaan, seperti total_tokens.

  • usage_limit_period (Number): Periode waktu untuk batas penggunaan, dalam detik.

  • async_user_queue_limit (Number): Jumlah maksimum tugas asinkron yang dapat masuk antrian.

  • async_user_concurrency_limit (Number): Jumlah maksimum tugas asinkron yang dapat dieksekusi secara konkuren.

output.quotas[].workspace_limit

Object

Batas laju tingkat ruang kerja. Anda dapat mengatur batas laju individual untuk setiap ruang kerja, tetapi jumlah gabungan batas di semua ruang kerja tidak boleh melebihi model_limit. Nilai null menunjukkan bahwa tidak ada batas tingkat ruang kerja yang ditetapkan. Berisi bidang-bidang yang sama seperti model_limit.

Detail batas laju

Model Studio menerapkan batas laju pada dua tingkatan:

  • model_limit (tingkat akun): Batas laju keseluruhan untuk model di bawah akun saat ini, yang dibagi di seluruh ruang kerja.
  • workspace_limit (tingkat ruang kerja): Anda dapat mengonfigurasi batas laju individual untuk setiap ruang kerja. Jumlah gabungan batas di semua ruang kerja tidak boleh melebihi batas model_limit.
Jenis batas laju

Field

Meaning

Example

request_limit + request_limit_period

Request rate limit

request_limit=60, request_limit_period=60 berarti maksimal 60 permintaan per menit (RPM). request_limit=5, request_limit_period=1 berarti maksimal 5 permintaan per detik (QPS).

usage_limit + usage_limit_period

Usage limit

usage_limit=100000, usage_limit_field=total_tokens, usage_limit_period=60 berarti maksimal 100.000 token per menit (TPM). Nilai null menunjukkan tidak ada batas penggunaan.

async_user_queue_limit

Async queue limit

Jumlah maksimum tugas yang dapat masuk antrian saat menggunakan panggilan asinkron.

async_user_concurrency_limit

Async concurrency limit

Jumlah maksimum tugas yang dapat dieksekusi secara bersamaan saat menggunakan panggilan asinkron.

Contoh permintaan

Contoh 1: Menanyakan kuota untuk semua model
curl "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/quotas?page_no=1&page_size=100" \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header "Content-Type: application/json"
Contoh 2: Menanyakan kuota untuk model tertentu
curl "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/quotas?model=qwen3-max" \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header "Content-Type: application/json"

Contoh respons

{
    "code": null,
    "message": null,
    "success": true,
    "output": {
        "total": 453,
        "page_no": 1,
        "page_size": 10,
        "quotas": [
            {
                "model": "qwen3-max",
                "workspace_id": "ws-o72y059armtglf1u",
                "model_limit": {
                    "request_limit": 500,
                    "request_limit_period": 1,
                    "usage_limit": 500000,
                    "usage_limit_field": "total_tokens",
                    "usage_limit_period": 6,
                    "async_user_queue_limit": null,
                    "async_user_concurrency_limit": null
                },
                "workspace_limit": null
            },
            {
                "model": "wan2.6-i2v-flash",
                "workspace_id": "ws-o72y059armtglf1u",
                "model_limit": {
                    "request_limit": 5,
                    "request_limit_period": 1,
                    "usage_limit": null,
                    "usage_limit_field": null,
                    "usage_limit_period": null,
                    "async_user_queue_limit": 500,
                    "async_user_concurrency_limit": 5
                },
                "workspace_limit": null
            },
            {
                "model": "qwen-image-max",
                "workspace_id": "ws-o72y059armtglf1u",
                "model_limit": {
                    "request_limit": 2,
                    "request_limit_period": 60,
                    "usage_limit": 1000000,
                    "usage_limit_field": "total_tokens",
                    "usage_limit_period": 60,
                    "async_user_queue_limit": null,
                    "async_user_concurrency_limit": null
                },
                "workspace_limit": null
            }
        ]
    },
    "request_id": "2043b55f-f0d2-95ee-a449-234e1ee57042"
}

Pada contoh sebelumnya:

  • qwen3-max: Maksimal 500 permintaan per detik dan maksimal 500.000 token per 6 detik. Tidak ada batas tingkat ruang kerja yang ditetapkan.
  • wan2.6-i2v-flash: Maksimal 5 permintaan per detik tanpa batas penggunaan. Batas antrian tugas asinkron adalah 500 dan batas konkurensi asinkron adalah 5.
  • qwen-image-max: Maksimal 2 permintaan per menit dan maksimal 1.000.000 token per menit. Tidak ada batas tingkat ruang kerja yang ditetapkan.

Kode kesalahan

Jika pemanggilan gagal, pesan kesalahan akan dikembalikan. Untuk informasi lebih lanjut tentang kode kesalahan dan solusinya, lihat Pesan kesalahan.

Dokumentasi terkait

  • List models
  • Rate limiting