All Products
Search
Document Center

Platform For AI:Terapkan, fine-tune, dan evaluasi model Qwen3 di PAI

Last Updated:Aug 26, 2026

Qwen3 adalah seri model bahasa besar terbaru dari tim Qwen di Alibaba Cloud. Seri ini mencakup dua model MoE dan enam model padat, dengan peningkatan dalam kemampuan reasoning, mengikuti instruksi, agen, serta multibahasa. PAI-Model Gallery menyediakan semua 22 model tersebut, termasuk versi Base dan FP8. Topik ini menggunakan Qwen3-235B-A22B sebagai contoh untuk menunjukkan cara menerapkan, memanggil, melakukan fine-tuning, dan mengevaluasi model dalam seri ini di Model Gallery.

Deploy and invoke a model

Deploy a model

Contoh ini menerapkan model Qwen3-235B-A22B dengan SGLang.

  1. Buka halaman Model Gallery.

    1. Masuk ke PAI console dan pilih Wilayah di pojok kiri atas. Ganti wilayah untuk menemukan sumber daya komputasi yang tersedia.

    2. Pada panel navigasi sebelah kiri, pilih Workspaces, lalu klik nama ruang kerja target Anda untuk membukanya.

    3. Pada panel navigasi sebelah kiri, pilih QuickStart > Model Gallery.

  2. Pada daftar model di sisi kanan halaman Model Gallery, klik kartu model Qwen3-235B-A22B untuk membuka halaman detail model.

  3. Di pojok kanan atas, klik Deploy. Konfigurasikan parameter berikut dan biarkan sisanya pada nilai default untuk menerapkan model ke platform layanan inferensi EAS.

    • Deployment Method: Atur Inference Engine ke SGLang dan Deployment Template ke Single-Node.

    • Resource Information: Untuk Resource Type, pilih public resources. Sistem akan merekomendasikan tipe instans yang sesuai. Untuk konfigurasi minimum setiap model, lihat Lampiran: Sumber daya komputasi dan batas token.

      Penting

      Jika tidak ada spesifikasi instans yang tersedia, berarti public resources di wilayah tersebut sedang habis stoknya. Pertimbangkan opsi berikut:

      • Ganti wilayah. China (Ulanqab) menyediakan lebih banyak sumber daya preemptible Lingjun (ml.gu7ef.8xlarge-gu100, ml.gu7xf.8xlarge-gu108, ml.gu8xf.8xlarge-gu108, ml.gu8tf.8.40xlarge). Sumber daya preemptible dapat ditarik kembali, jadi atur penawaran Anda dengan hati-hati.

      • Gunakan kelompok sumber daya EAS. Buka halaman langganan sumber daya khusus EAS untuk membeli sumber daya khusus EAS.

Debug online

Di bagian bawah halaman Service details, klik debugging online. Gambar berikut menunjukkan contohnya.

image

Invoke the API

  1. Dapatkan titik akhir layanan dan token.

    1. Di Model Gallery > Job Management > Deployment Jobs, klik nama layanan dari layanan yang telah diterapkan untuk membuka halaman detail layanan.

    2. Klik View Call Information untuk mendapatkan Internet Endpoint dan token.

      image

  2. Contoh pemanggilan API chat /v1/chat/completions untuk layanan yang diterapkan dengan SGLang.

    curl -X POST \
        -H "Content-Type: application/json" \
        -H "Authorization: <EAS_TOKEN>" \
        -d '{
            "model": "<model_name, obtained from the /v1/models API>",
            "messages": [
            {
                "role": "system",
                "content": "You are a helpful assistant."
            },
            {
                "role": "user",
                "content": "hello!"
            }
            ]
        }' \
        <EAS_ENDPOINT>/v1/chat/completions
    from openai import OpenAI
    
    ##### Konfigurasi API #####
    # Ganti <EAS_ENDPOINT> dengan titik akhir layanan dan <EAS_TOKEN> dengan token layanan.
    openai_api_key = "<EAS_TOKEN>"
    openai_api_base = "<EAS_ENDPOINT>/v1"
    
    client = OpenAI(
        api_key=openai_api_key,
        base_url=openai_api_base,
    )
    
    models = client.models.list()
    model = models.data[0].id
    print(model)
    
    stream = True
    chat_completion = client.chat.completions.create(
        messages=[
            {"role": "user", "content": "Hello, could you please introduce yourself"}
        ],
        model=model,
        max_completion_tokens=2048,
        stream=stream,
    )
    
    if stream:
        for chunk in chat_completion:
            print(chunk.choices[0].delta.content, end="")
    else:
        result = chat_completion.choices[0].message.content
        print(result)

    Ganti <EAS_ENDPOINT> dengan titik akhir layanan dan <EAS_TOKEN> dengan token layanan.

Metode pemanggilan bervariasi tergantung metode penerapan. Untuk metode pemanggilan lainnya, lihat Panggil API untuk layanan LLM yang telah diterapkan.

Third-party integration

Untuk menyambungkan ke Chatbox, Dify, atau Cherry Studio, lihat Integrasikan dengan klien pihak ketiga.

Advanced configuration

Edit konfigurasi JSON layanan untuk mengaktifkan fitur lanjutan, seperti menyesuaikan batas token dan mengaktifkan tool calling (Function Calling).

Prosedur: Pada halaman penerapan, edit JSON di bagian Service Configuration. Jika layanan sudah diterapkan, perbarui untuk mengakses halaman penerapan.

image

Modify token limit

Model Qwen3 secara native mendukung 32.768 token. Skala RoPE memperluas kapasitas ini hingga 131.072, meskipun performa mungkin sedikit menurun. Ubah bidang containers.script dalam JSON konfigurasi layanan:

  • vLLM:

    vllm serve ... --rope-scaling '{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":32768}' --max-model-len 131072
  • SGLang:

    python -m sglang.launch_server ... --json-model-override-args '{"rope_scaling":{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":32768}}'

Parse tool calls

vLLM dan SGLang dapat mengurai konten tool calling yang dihasilkan model menjadi pesan terstruktur. Ubah bidang containers.script dalam JSON konfigurasi layanan:

  • vLLM:

    vllm serve ... --enable-auto-tool-choice --tool-call-parser hermes
  • SGLang:

    python -m sglang.launch_server ... --tool-call-parser qwen25

Control thinking mode

Qwen3 menggunakan mode thinking secara default. Sakelar keras (hard switch) menonaktifkan thinking sepenuhnya; sakelar lunak (soft switch) memungkinkan model mengikuti instruksi Anda tentang apakah perlu berpikir atau tidak.

Use the soft switch/no_think

Contoh berikut menunjukkan badan permintaan:

{
  "model": "<MODEL_NAME>",
  "messages": [
    {
      "role": "user",
      "content": "/no_think Hello!"
    }
  ],
  "max_tokens": 1024
}

Hard switch

  • Kontrol melalui parameter API (vLLM dan SGLang): Tambahkan parameter chat_template_kwargs ke pemanggilan API. Contoh:

    curl -X POST \
        -H "Content-Type: application/json" \
        -H "Authorization: <EAS_TOKEN>" \
        -d '{
            "model": "<MODEL_NAME>",
            "messages": [
                {
                    "role": "user",
                    "content": "Give me a short introduction to large language models."
                }
            ],
            "temperature": 0.7,
            "top_p": 0.8,
            "max_tokens": 8192,
            "presence_penalty": 1.5,
            "chat_template_kwargs": {"enable_thinking": false}
        }' \
        <EAS_ENDPOINT>/v1/chat/completions
    from openai import OpenAI
    # # Ganti <EAS_ENDPOINT> dengan titik akhir layanan dan <EAS_TOKEN> dengan token layanan.
    openai_api_key = "<<EAS_TOKEN>"
    openai_api_base = "<EAS_ENDPOINT>/v1"
    
    client = OpenAI(
        api_key=openai_api_key,
        base_url=openai_api_base,
    )
    
    chat_response = client.chat.completions.create(
        model="<MODEL_NAME>",
        messages=[
            {"role": "user", "content": "Give me a short introduction to large language models."},
        ],
        temperature=0.7,
        top_p=0.8,
        presence_penalty=1.5,
        extra_body={"chat_template_kwargs": {"enable_thinking": False}},
    )
    print("Chat response:", chat_response)

    Ganti <EAS_ENDPOINT> dengan titik akhir layanan, <EAS_TOKEN> dengan token, dan <MODEL_NAME> dengan nama model dari API /v1/models.

  • Nonaktifkan dengan memodifikasi konfigurasi layanan (BladeLLM): Gunakan templat chat yang mencegah model menghasilkan konten thinking saat startup.

    • Di halaman model di Model Gallery, periksa apakah tersedia metode untuk menonaktifkan mode thinking untuk BladeLLM. Misalnya, untuk Qwen3-8B, ubah bidang containers.script dalam JSON konfigurasi layanan untuk menonaktifkan mode thinking:

      blade_llm_server ... --chat_template /model_dir/no_thinking.jinja
    • Buat sendiri templat chat Anda, misalnya no_thinking.jinja, pasang dari OSS, lalu perbarui bidang containers.script dalam JSON konfigurasi layanan.

      image

Parse thinking content

Untuk mengeluarkan konten think secara terpisah, ubah bidang containers.script dalam JSON konfigurasi layanan:

  • vLLM:

    vllm serve ... --enable-reasoning --reasoning-parser qwen3
  • SGLang:

    python -m sglang.launch_server ... --reasoning-parser deepseek-r1

Fine-tune a model

  • Qwen3-32B, 14B, 8B, 4B, 1,7B, dan 0,6B mendukung SFT (fine-tuning parameter penuh, LoRA, dan QLoRA) serta pelatihan GRPO.

  • Gunakan pengiriman tugas pelatihan satu-klik untuk melatih model khusus bagi skenario bisnis perusahaan Anda.

image

image

Evaluate a model

Untuk petunjuk lengkap mengenai evaluasi model, lihat evaluasi model dan Praktik terbaik untuk evaluasi LLM.

Lampiran: Sumber daya komputasi dan batas token

Tabel berikut mencantumkan konfigurasi penerapan minimum setiap model Qwen3, serta jumlah maksimum token yang didukung setiap tipe instans di bawah framework inferensi berbeda.

Catatan

Di antara model FP8, hanya Qwen3-235B-A22B yang memerlukan daya komputasi lebih rendah dibandingkan model aslinya. Model FP8 lainnya memerlukan daya komputasi yang sama dengan versi non-FP8-nya, sehingga tidak dicantumkan dalam tabel. Sebagai contoh, untuk daya komputasi yang diperlukan oleh Qwen3-30B-A3B-FP8, lihat Qwen3-30B-A3B.

Model

Token maks (input + output)

Konfigurasi minimum

Penerapan SGLang yang Dipercepat

Penerapan dipercepat vLLM

Qwen3-235B-A22B

32.768 (dengan skala RoPE: 131.072)

32.768 (dengan skala RoPE: 131.072)

8 × GPU H / GU120

(8 × 96 GB VARM)

Qwen3-235B-A22B-FP8

32.768 (dengan skala RoPE: 131.072)

32.768 (dengan skala RoPE: 131.072)

4 × GPU H / GU120

(4 × 96 GB VARM)

Qwen3-30B-A3B

Qwen3-30B-A3B-Base

Qwen3-32B

32.768 (dengan skala RoPE: 131.072)

32.768 (dengan skala RoPE: 131.072)

1 × GPU H / GU120

(96 GB VARM)

Qwen3-14B

Qwen3-14B-Base

32.768 (dengan skala RoPE: 131.072)

32.768 (dengan skala RoPE: 131.072)

1 × GPU L / GU60

(48 GB VARM)

Qwen3-8B

Qwen3-4B

Qwen3-1,7B

Qwen3-0,6B

Qwen3-8B-Base

Qwen3-4B-Base

Qwen3-1,7B-Base

Qwen3-0.6B-Base

32.768 (dengan skala RoPE: 131.072)

32.768 (dengan skala RoPE: 131.072)

1 × A10 / GU30

(24 GB VARM)

Penting

Model 8B dengan skala RoPE memerlukan 48 GB VARM.

FAQ

Q: Apakah layanan model yang diterapkan di PAI mendukung sesi yang menyimpan konteks lintas beberapa permintaan?

Tidak. API layanan model yang diterapkan di PAI bersifat tanpa status (stateless). Setiap pemanggilan sepenuhnya independen, dan server tidak menyimpan konteks atau status sesi antarpermintaan.

Untuk menerapkan percakapan multi-putaran, klien harus menyimpan riwayat percakapan dan menyertakannya pada setiap permintaan. Untuk contoh permintaan, lihat Bagaimana cara menerapkan percakapan multi-putaran?