Qwen3 adalah seri model bahasa besar terbaru dari tim Qwen di Alibaba Cloud. Seri ini mencakup dua model MoE dan enam model padat, dengan peningkatan dalam kemampuan reasoning, mengikuti instruksi, agen, serta multibahasa. PAI-Model Gallery menyediakan semua 22 model tersebut, termasuk versi Base dan FP8. Topik ini menggunakan Qwen3-235B-A22B sebagai contoh untuk menunjukkan cara menerapkan, memanggil, melakukan fine-tuning, dan mengevaluasi model dalam seri ini di Model Gallery.
Deploy and invoke a model
Deploy a model
Contoh ini menerapkan model Qwen3-235B-A22B dengan SGLang.
Buka halaman Model Gallery.
Masuk ke PAI console dan pilih Wilayah di pojok kiri atas. Ganti wilayah untuk menemukan sumber daya komputasi yang tersedia.
Pada panel navigasi sebelah kiri, pilih Workspaces, lalu klik nama ruang kerja target Anda untuk membukanya.
Pada panel navigasi sebelah kiri, pilih QuickStart > Model Gallery.
Pada daftar model di sisi kanan halaman Model Gallery, klik kartu model Qwen3-235B-A22B untuk membuka halaman detail model.
Di pojok kanan atas, klik Deploy. Konfigurasikan parameter berikut dan biarkan sisanya pada nilai default untuk menerapkan model ke platform layanan inferensi EAS.
Deployment Method: Atur Inference Engine ke SGLang dan Deployment Template ke Single-Node.
Resource Information: Untuk Resource Type, pilih public resources. Sistem akan merekomendasikan tipe instans yang sesuai. Untuk konfigurasi minimum setiap model, lihat Lampiran: Sumber daya komputasi dan batas token.
PentingJika tidak ada spesifikasi instans yang tersedia, berarti public resources di wilayah tersebut sedang habis stoknya. Pertimbangkan opsi berikut:
Ganti wilayah. China (Ulanqab) menyediakan lebih banyak sumber daya preemptible Lingjun (ml.gu7ef.8xlarge-gu100, ml.gu7xf.8xlarge-gu108, ml.gu8xf.8xlarge-gu108, ml.gu8tf.8.40xlarge). Sumber daya preemptible dapat ditarik kembali, jadi atur penawaran Anda dengan hati-hati.
Gunakan kelompok sumber daya EAS. Buka halaman langganan sumber daya khusus EAS untuk membeli sumber daya khusus EAS.
Debug online
Di bagian bawah halaman Service details, klik debugging online. Gambar berikut menunjukkan contohnya.

Invoke the API
Dapatkan titik akhir layanan dan token.
Di Model Gallery > Job Management > Deployment Jobs, klik nama layanan dari layanan yang telah diterapkan untuk membuka halaman detail layanan.
Klik View Call Information untuk mendapatkan Internet Endpoint dan token.

Contoh pemanggilan API chat
/v1/chat/completionsuntuk layanan yang diterapkan dengan SGLang.curl -X POST \ -H "Content-Type: application/json" \ -H "Authorization: <EAS_TOKEN>" \ -d '{ "model": "<model_name, obtained from the /v1/models API>", "messages": [ { "role": "system", "content": "You are a helpful assistant." }, { "role": "user", "content": "hello!" } ] }' \ <EAS_ENDPOINT>/v1/chat/completionsfrom openai import OpenAI ##### Konfigurasi API ##### # Ganti <EAS_ENDPOINT> dengan titik akhir layanan dan <EAS_TOKEN> dengan token layanan. openai_api_key = "<EAS_TOKEN>" openai_api_base = "<EAS_ENDPOINT>/v1" client = OpenAI( api_key=openai_api_key, base_url=openai_api_base, ) models = client.models.list() model = models.data[0].id print(model) stream = True chat_completion = client.chat.completions.create( messages=[ {"role": "user", "content": "Hello, could you please introduce yourself"} ], model=model, max_completion_tokens=2048, stream=stream, ) if stream: for chunk in chat_completion: print(chunk.choices[0].delta.content, end="") else: result = chat_completion.choices[0].message.content print(result)Ganti <EAS_ENDPOINT> dengan titik akhir layanan dan <EAS_TOKEN> dengan token layanan.
Metode pemanggilan bervariasi tergantung metode penerapan. Untuk metode pemanggilan lainnya, lihat Panggil API untuk layanan LLM yang telah diterapkan.
Third-party integration
Untuk menyambungkan ke Chatbox, Dify, atau Cherry Studio, lihat Integrasikan dengan klien pihak ketiga.
Advanced configuration
Edit konfigurasi JSON layanan untuk mengaktifkan fitur lanjutan, seperti menyesuaikan batas token dan mengaktifkan tool calling (Function Calling).
Prosedur: Pada halaman penerapan, edit JSON di bagian Service Configuration. Jika layanan sudah diterapkan, perbarui untuk mengakses halaman penerapan.

Modify token limit
Model Qwen3 secara native mendukung 32.768 token. Skala RoPE memperluas kapasitas ini hingga 131.072, meskipun performa mungkin sedikit menurun. Ubah bidang containers.script dalam JSON konfigurasi layanan:
vLLM:
vllm serve ... --rope-scaling '{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":32768}' --max-model-len 131072SGLang:
python -m sglang.launch_server ... --json-model-override-args '{"rope_scaling":{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":32768}}'
Parse tool calls
vLLM dan SGLang dapat mengurai konten tool calling yang dihasilkan model menjadi pesan terstruktur. Ubah bidang containers.script dalam JSON konfigurasi layanan:
vLLM:
vllm serve ... --enable-auto-tool-choice --tool-call-parser hermesSGLang:
python -m sglang.launch_server ... --tool-call-parser qwen25
Control thinking mode
Qwen3 menggunakan mode thinking secara default. Sakelar keras (hard switch) menonaktifkan thinking sepenuhnya; sakelar lunak (soft switch) memungkinkan model mengikuti instruksi Anda tentang apakah perlu berpikir atau tidak.
Use the soft switch/no_think
Contoh berikut menunjukkan badan permintaan:
{
"model": "<MODEL_NAME>",
"messages": [
{
"role": "user",
"content": "/no_think Hello!"
}
],
"max_tokens": 1024
}Hard switch
Kontrol melalui parameter API (vLLM dan SGLang): Tambahkan parameter
chat_template_kwargske pemanggilan API. Contoh:curl -X POST \ -H "Content-Type: application/json" \ -H "Authorization: <EAS_TOKEN>" \ -d '{ "model": "<MODEL_NAME>", "messages": [ { "role": "user", "content": "Give me a short introduction to large language models." } ], "temperature": 0.7, "top_p": 0.8, "max_tokens": 8192, "presence_penalty": 1.5, "chat_template_kwargs": {"enable_thinking": false} }' \ <EAS_ENDPOINT>/v1/chat/completionsfrom openai import OpenAI # # Ganti <EAS_ENDPOINT> dengan titik akhir layanan dan <EAS_TOKEN> dengan token layanan. openai_api_key = "<<EAS_TOKEN>" openai_api_base = "<EAS_ENDPOINT>/v1" client = OpenAI( api_key=openai_api_key, base_url=openai_api_base, ) chat_response = client.chat.completions.create( model="<MODEL_NAME>", messages=[ {"role": "user", "content": "Give me a short introduction to large language models."}, ], temperature=0.7, top_p=0.8, presence_penalty=1.5, extra_body={"chat_template_kwargs": {"enable_thinking": False}}, ) print("Chat response:", chat_response)Ganti <EAS_ENDPOINT> dengan titik akhir layanan, <EAS_TOKEN> dengan token, dan <MODEL_NAME> dengan nama model dari API
/v1/models.Nonaktifkan dengan memodifikasi konfigurasi layanan (BladeLLM): Gunakan templat chat yang mencegah model menghasilkan konten thinking saat startup.
Di halaman model di Model Gallery, periksa apakah tersedia metode untuk menonaktifkan mode thinking untuk BladeLLM. Misalnya, untuk Qwen3-8B, ubah bidang
containers.scriptdalam JSON konfigurasi layanan untuk menonaktifkan mode thinking:blade_llm_server ... --chat_template /model_dir/no_thinking.jinjaBuat sendiri templat chat Anda, misalnya
no_thinking.jinja, pasang dari OSS, lalu perbarui bidangcontainers.scriptdalam JSON konfigurasi layanan.
Parse thinking content
Untuk mengeluarkan konten think secara terpisah, ubah bidang containers.script dalam JSON konfigurasi layanan:
vLLM:
vllm serve ... --enable-reasoning --reasoning-parser qwen3SGLang:
python -m sglang.launch_server ... --reasoning-parser deepseek-r1
Fine-tune a model
Qwen3-32B, 14B, 8B, 4B, 1,7B, dan 0,6B mendukung SFT (fine-tuning parameter penuh, LoRA, dan QLoRA) serta pelatihan GRPO.
Gunakan pengiriman tugas pelatihan satu-klik untuk melatih model khusus bagi skenario bisnis perusahaan Anda.


Evaluate a model
Untuk petunjuk lengkap mengenai evaluasi model, lihat evaluasi model dan Praktik terbaik untuk evaluasi LLM.
Lampiran: Sumber daya komputasi dan batas token
Tabel berikut mencantumkan konfigurasi penerapan minimum setiap model Qwen3, serta jumlah maksimum token yang didukung setiap tipe instans di bawah framework inferensi berbeda.
Di antara model FP8, hanya Qwen3-235B-A22B yang memerlukan daya komputasi lebih rendah dibandingkan model aslinya. Model FP8 lainnya memerlukan daya komputasi yang sama dengan versi non-FP8-nya, sehingga tidak dicantumkan dalam tabel. Sebagai contoh, untuk daya komputasi yang diperlukan oleh Qwen3-30B-A3B-FP8, lihat Qwen3-30B-A3B.
Model | Token maks (input + output) | Konfigurasi minimum | |
Penerapan SGLang yang Dipercepat | Penerapan dipercepat vLLM | ||
Qwen3-235B-A22B | 32.768 (dengan skala RoPE: 131.072) | 32.768 (dengan skala RoPE: 131.072) | 8 × GPU H / GU120 (8 × 96 GB VARM) |
Qwen3-235B-A22B-FP8 | 32.768 (dengan skala RoPE: 131.072) | 32.768 (dengan skala RoPE: 131.072) | 4 × GPU H / GU120 (4 × 96 GB VARM) |
Qwen3-30B-A3B Qwen3-30B-A3B-Base Qwen3-32B | 32.768 (dengan skala RoPE: 131.072) | 32.768 (dengan skala RoPE: 131.072) | 1 × GPU H / GU120 (96 GB VARM) |
Qwen3-14B Qwen3-14B-Base | 32.768 (dengan skala RoPE: 131.072) | 32.768 (dengan skala RoPE: 131.072) | 1 × GPU L / GU60 (48 GB VARM) |
Qwen3-8B Qwen3-4B Qwen3-1,7B Qwen3-0,6B Qwen3-8B-Base Qwen3-4B-Base Qwen3-1,7B-Base Qwen3-0.6B-Base | 32.768 (dengan skala RoPE: 131.072) | 32.768 (dengan skala RoPE: 131.072) | 1 × A10 / GU30 (24 GB VARM) Penting Model 8B dengan skala RoPE memerlukan 48 GB VARM. |
FAQ
Q: Apakah layanan model yang diterapkan di PAI mendukung sesi yang menyimpan konteks lintas beberapa permintaan?
Tidak. API layanan model yang diterapkan di PAI bersifat tanpa status (stateless). Setiap pemanggilan sepenuhnya independen, dan server tidak menyimpan konteks atau status sesi antarpermintaan.
Untuk menerapkan percakapan multi-putaran, klien harus menyimpan riwayat percakapan dan menyertakannya pada setiap permintaan. Untuk contoh permintaan, lihat Bagaimana cara menerapkan percakapan multi-putaran?