All Products
Search
Document Center

MaxCompute:Biaya inferensi AI

Last Updated:Aug 14, 2026

MaxCompute AI inference adalah fitur siap pakai berbasis bayar sesuai penggunaan yang memungkinkan Anda menggunakan model besar untuk pemrosesan data atau inferensi offline. Topik ini menjelaskan aturan penagihan untuk inferensi AI.

Ikhtisar

Layanan MaxCompute AI inference menyediakan inferensi model besar, memungkinkan Anda memanggil model siap pakai langsung dari pekerjaan SQL dan MaxFrame menggunakan fungsi AI bawaan. Penagihan dilakukan secara bayar sesuai penggunaan berdasarkan jumlah total token input dan output.

  • Wilayah yang didukung: Layanan inferensi model hanya tersedia di wilayah berikut.

    • Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), dan Tiongkok (Ulanqab)

    • Internasional: Singapura

  • Model yang didukung: Untuk menggunakan model berikut, Anda harus terlebih dahulu mengaktifkan layanan inferensi model di wilayah target, seperti Tiongkok (Beijing).

    Model

    Jenis

    Deskripsi

    qwen3.8-max

    Mendukung input data multimodal

    Model unggulan Mixture of Experts (MoE) dari seri Qwen 3.8 dengan 2,4 triliun parameter. Model ini memiliki peningkatan signifikan dalam kemampuan pemrograman dan produktivitas kantor, serta dapat memprogram secara otonom selama lebih dari sepuluh hari untuk menghasilkan proyek lengkap. Model ini ideal untuk skenario sangat kompleks seperti pemrograman otonom, otomatisasi kantor tingkat lanjut, penelitian ilmiah, dan tugas berdurasi panjang.

    qwen3.7-max

    Hanya menerima input teks

    Model unggulan dari seri Qwen 3.7, menampilkan peningkatan komprehensif dalam inferensi, pembuatan kode, dan pemahaman multibahasa. Cocok untuk tugas-tugas sangat kompleks.

    qwen3.7-plus

    Mendukung input data multimodal

    Model seimbang dari seri Qwen 3.7 yang menawarkan keseimbangan baik antara kinerja dan biaya. Cocok untuk skenario perusahaan seperti analisis teks panjang dan percakapan multi-putaran.

    qwen3.7-flash

    Mendukung input data multimodal

    Model ringan, berkecepatan tinggi, dan native vision-language dari seri Qwen 3.7. Menampilkan peningkatan pemahaman multimodal dan kemampuan eksekusi agen, menjadikannya ideal untuk layanan online berkonkurensi tinggi dengan latensi rendah serta tugas multimodal ringan.

    qwen3.7-text-embedding

    Hanya menerima input teks

    Model vektor teks multibahasa terpadu ini, dilatih pada Qwen 3.7, menawarkan peningkatan kinerja signifikan dalam pengambilan teks, pengelompokan, dan klasifikasi dibandingkan versi text-embedding-v4.

    qwen3-vl-embedding

    Mendukung input data multimodal

    Model penyematan vektor multimodal Qwen yang mendukung representasi vektor untuk input campuran gambar dan teks. Cocok untuk skenario pengambilan lintas-modal dan pencocokan gambar-teks.

    text-embedding-v4

    Hanya menerima input teks

    Model penyematan vektor teks berpresisi tinggi yang cocok untuk pencarian semantik, pengelompokan, dan perhitungan kemiripan.

    qwen3.6-plus

    Mendukung input data multimodal

    Model seimbang dari seri Qwen 3.6 yang menawarkan keseimbangan baik antara kinerja dan biaya. Cocok untuk skenario bisnis umum seperti dialog, ringkasan, dan analisis.

    qwen3.6-flash

    Mendukung input data multimodal

    Model ringan dan berkecepatan tinggi dari seri Qwen 3.6. Memberikan respons cepat dengan biaya rendah, menjadikannya ideal untuk layanan online berkonkurensi tinggi dengan latensi rendah.

    deepseek-v4-pro

    Hanya menerima input teks

    Model inferensi unggulan generasi keempat dari DeepSeek. Unggul dalam tugas-tugas sulit seperti matematika, pemrograman, dan penalaran logis kompleks.

    deepseek-v4-flash

    Hanya menerima input teks

    Model ringan generasi keempat dari DeepSeek. Menawarkan inferensi cepat dan sangat hemat biaya, cocok untuk percakapan sehari-hari dan tugas inferensi ringan.

    qwen3.5-397b-a17b

    Mendukung input data multimodal

    Model Mixture of Experts (MoE) dari seri Qwen 3.5. Menampilkan aktivasi parameter efisien, basis pengetahuan luas, dan kemampuan penalaran multi-langkah. Dirancang untuk deduksi logis tingkat kesulitan tinggi, pembuatan kode full-stack, dan tanya jawab pengetahuan mendalam.

    qwen3.5-omni-plus

    Mendukung input data multimodal

    Qwen3.5-Omni adalah model besar omni-modal terbaru dari Qwen. Cocok untuk skenario seperti pembuatan teks, asisten suara, dan analisis multimedia, memberikan pengalaman pemahaman dan interaksi multimodal yang alami dan lancar.

    qwen3-asr-flash

    Mendukung input data multimodal

    Model pengenalan ucapan ringan dari seri Qwen 3. Memberikan transkripsi real-time dengan latensi rendah dan konkurensi tinggi, cocok untuk skenario pemrosesan audio real-time seperti membuat notulen rapat, subtitel siaran langsung, dan mengenali perintah suara.

    tongyi-embedding-vision-plus

    Mendukung input data multimodal

    Tongyi-Embedding-Vision adalah model representasi multimodal visual yang dibangun di atas model bahasa besar (LLM). Cocok untuk berbagai tugas downstream, termasuk pencarian gambar-ke-gambar, pencarian teks-ke-gambar, pencarian teks-ke-video, pencarian video-ke-video, pencarian teks-ke-teks, dan pencarian teks-ke-gambar-dan-teks.

    qwen3-max (Segera dihentikan)

    Hanya menerima input teks

    Model bahasa besar berkinerja-tinggi dari seri Qwen, cocok untuk inferensi kompleks dan pembuatan konten.

    Penting

    Model qwen3-max akan segera dihentikan. Untuk memastikan kelangsungan layanan, migrasikan layanan terkait Anda ke model baru sesegera mungkin. Untuk informasi lebih lanjut, lihat Kebijakan Penghentian Model.

Catatan

Anda dikenai biaya layanan inferensi model hanya saat menggunakan model publik yang tercantum di atas dalam pekerjaan MaxFrame Overview dan SQL menggunakan fungsi AI. Anda hanya dikenai biaya untuk pekerjaan yang berhasil; pekerjaan yang gagal tidak dikenai biaya.

Aturan penagihan

Layanan inferensi model ditagih berdasarkan penggunaan token. Dimensi penagihan meliputi:

  • Wilayah

  • Jenis model

  • Jenis token: Membedakan antara token input dan output serta menunjukkan tier harga berbasis penggunaan.

Harga

Satu pekerjaan SQL atau MaxFrame dapat melibatkan beberapa pemanggilan model. Untuk model dengan tier harga, sistem menghitung jumlah token input untuk setiap pemanggilan model secara terpisah untuk menentukan tier harga (jenis token). Sistem kemudian mengukur dan menagih penggunaan untuk setiap jenis token secara terpisah.

Penting
  • Saat menerapkan layanan di wilayah Tiongkok, sumber daya komputasi inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

  • Saat menerapkan layanan di wilayah internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

qwen3.7-max

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Token masukan

Skenario Penggunaan

Jenis

Harga satuan (per 1 juta token)

0 < token ≤ 1.048.576

Input model

input_token_tier1

USD 1,98

Input model

(cache hit implisit)

input_token_tier1_cached

USD 0,396

Input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

USD 0,198

Input model

(buat cache eksplisit)

input_token_tier1_create_cache

USD 2,475

Output model (non-thinking)

output_token_tier1

USD 5,9412

Output model (mode thinking)

output_token_tier1_thinking

USD 5,9412

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Token masukan

Skenario Penggunaan

Jenis

Harga satuan (per 1 juta token)

0 < token ≤ 1.048.576

Input model

input_token_tier1

USD 3

Input model

(cache hit implisit)

input_token_tier1_cached

USD 0,6

Input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

USD 0,3

Input model

(buat cache eksplisit)

input_token_tier1_create_cache

USD 3,75

Output model (non-thinking)

output_token_tier1

USD 9

Output model (mode thinking)

output_token_tier1_thinking

USD 9

qwen3.7-plus

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Token input

Skema penggunaan

Jenis token

Harga (per 1 juta token)

0 < token ≤ 262.144

input model

input_token_tier1

USD 0,3312

input model

(cache hit implisit)

input_token_tier1_cached

USD 0,06624

input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

USD 0,03312

input model

(buat cache eksplisit)

input_token_tier1_create_cache

USD 0,414

output model (non-thinking)

output_token_tier1

USD 1,3212

output model (mode thinking)

output_token_tier1_thinking

USD 1,3212

262.144 < token ≤ 1.048.576

input model

input_token_tier2

USD 0,9912

input model

(cache hit implisit)

input_token_tier2_cached

USD 0,19824

input model

(cache hit eksplisit)

input_token_tier2_cached_explicit

USD 0,09912

input model

(buat cache eksplisit)

input_token_tier2_create_cache

USD 1,239

output model (non-thinking)

output_token_tier2

USD 3,9612

output model (mode thinking)

output_token_tier2_thinking

USD 3,9612

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Token masukan

Skema penggunaan

Jenis token

Harga (per 1 juta token)

0 < token ≤ 262.144

input model

input_token_tier1

USD 0,48

input model

(cache hit implisit)

input_token_tier1_cached

USD 0,096

input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

USD 0,048

input model

(buat cache eksplisit)

input_token_tier1_create_cache

USD 0,6

output model (non-thinking)

output_token_tier1

USD 1,92

output model (mode thinking)

output_token_tier1_thinking

USD 1,92

262.144 < token ≤ 1.048.576

input model

input_token_tier2

USD 1,44

input model

(cache hit implisit)

input_token_tier2_cached

USD 0,288

input model

(cache hit eksplisit)

input_token_tier2_cached_explicit

USD 0,144

input model

(buat cache eksplisit)

input_token_tier2_create_cache

USD 1,8

output model (non-thinking)

output_token_tier2

USD 5,76

output model (mode thinking)

output_token_tier2_thinking

USD 5,76

qwen3-vl-embedding

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Tier

Kasus penggunaan

Jenis token

Harga satuan

Teks

Input model

input_token_tier1_text

0,12 USD

Gambar & video

Input model

input_token_tier1_image

0,3096 USD

text-embedding-v4

Model text-embedding-v4 hanya ditagih berdasarkan token input model. Tidak ada biaya untuk output model dan tidak ada tier harga. Semua penggunaan ditagih sebagai input_token_tier1.

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Tier

Kasus penggunaan

Jenis token

Harga satuan (per juta token)

Tidak ada tier

input model

input_token_tier1

0,0864 USD

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Tier

Kasus penggunaan

Jenis token

Harga satuan (per juta token)

Tidak ada tier

input model

input_token_tier1

0,084 USD

qwen3.6-plus

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Jumlah token input

Skenario Penggunaan

Jenis token

Harga

0 < token ≤ 262.144

Input model

input_token_tier1

0,3312 USD

Input model

(cache hit implisit)

input_token_tier1_cached

0,06624 USD

Input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

0,03312 USD

Input model

(buat cache eksplisit)

input_token_tier1_create_cache

0,414 USD

Output model (non-thinking)

output_token_tier1

1,9812 USD

Output model (mode thinking)

output_token_tier1_thinking

1,9812 USD

262.144 < token ≤ 1.048.576

Input model

input_token_tier2

1,3212 USD

Input model

(cache hit implisit)

input_token_tier2_cached

0,26424 USD

Input model

(cache hit eksplisit)

input_token_tier2_cached_explicit

0,13212 USD

Input model

(buat cache eksplisit)

input_token_tier2_create_cache

1,6515 USD

Output model (non-thinking)

output_token_tier2

7,9224 USD

Output model (mode thinking)

output_token_tier2_thinking

7,9224 USD

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Jumlah token input

Skema penggunaan

Jenis token

Harga

0 < token ≤ 262.144

Input model

input_token_tier1

0,6 USD

Input model

(cache hit implisit)

input_token_tier1_cached

0,12 USD

Input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

0,06 USD

Input model

(buat cache eksplisit)

input_token_tier1_create_cache

0,75 USD

Output model (non-thinking)

output_token_tier1

3,6 USD

Output model (mode thinking)

output_token_tier1_thinking

3,6 USD

262.144 < token ≤ 1.048.576

Input model

input_token_tier2

2,4 USD

Input model

(cache hit implisit)

input_token_tier2_cached

0,48 USD

Input model

(cache hit eksplisit)

input_token_tier2_cached_explicit

0,24 USD

Input model

(buat cache eksplisit)

input_token_tier2_create_cache

3 USD

Output model (non-thinking)

output_token_tier2

7,2 USD

Output model (mode thinking)

output_token_tier2_thinking

7,2 USD

qwen3.6-flash

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Token per inferensi

Skenario

Jenis

Harga

0 < token ≤ 262.144

Input model

input_token_tier1

USD 0,198

Input model

(Cache hit implisit)

input_token_tier1_cached

USD 0,0396

Input model

(Cache hit eksplisit)

input_token_tier1_cached_explicit

USD 0,0198

Input model

(Buat cache eksplisit)

input_token_tier1_create_cache

USD 0,2475

Output model (Non-thinking)

output_token_tier1

USD 1,188

Keluaran Model (Mode Berpikir)

output_token_tier1_thinking

USD 1,188

262.144 < token ≤ 1.048.576

Input model

input_token_tier2

USD 0,792

Input model

(Cache hit implisit)

input_token_tier2_cached

USD 0,1584

Input model

(Cache hit eksplisit)

input_token_tier2_cached_explicit

USD 0,0792

Input model

(Buat cache eksplisit)

input_token_tier2_create_cache

USD 0,99

Output model (Non-thinking)

output_token_tier2

USD 4,7532

Output model (Mode thinking)

output_token_tier2_thinking

USD 4,7532

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Token per inferensi

Skenario

Jenis

Harga

0 < token ≤ 262.144

Input model

input_token_tier1

USD 0,3

Input model

(Cache hit implisit)

input_token_tier1_cached

USD 0,06

Input model

(Cache hit eksplisit)

input_token_tier1_cached_explicit

USD 0,03

Input model

(Buat cache eksplisit)

input_token_tier1_create_cache

USD 0,375

Output model (Non-thinking)

output_token_tier1

USD 1,8

Output model (Mode thinking)

output_token_tier1_thinking

USD 1,8

262.144 < token ≤ 1.048.576

Input model

input_token_tier2

USD 1,2

Input model

(Cache hit implisit)

input_token_tier2_cached

USD 0,24

Input model

(Cache hit eksplisit)

input_token_tier2_cached_explicit

USD 0,12

Input model

(Buat cache eksplisit)

input_token_tier2_create_cache

USD 1,5

Output model (Non-thinking)

output_token_tier2

USD 4,8

Output model (Mode thinking)

output_token_tier2_thinking

USD 4,8

deepseek-v4-pro

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Tier

Skenario Penggunaan

Jenis token

Harga (per juta token)

Tidak ada tier

input model

input_token_tier1

1,98 USD

input model

(hit cache implisit)

input_token_tier1_cached

0,396 USD

input model

(hit cache eksplisit)

input_token_tier1_cached_explicit

0,198 USD

input model

(buat cache eksplisit)

input_token_tier1_create_cache

2,475 USD

output model (non-thinking)

output_token_tier1

3,9612 USD

output model (mode thinking)

output_token_tier1_thinking

3,9612 USD

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Token masukan

Skema penggunaan

Jenis token

Harga (per juta token)

0 < Token ≤ 1.048.576

input model

input_token_tier1

2,88 USD

input model

(hit cache implisit)

input_token_tier1_cached

0,576 USD

input model

(hit cache eksplisit)

input_token_tier1_cached_explicit

0,288 USD

Masukan model

(buat cache eksplisit)

input_token_tier1_create_cache

3,6 USD

output model (non-thinking)

output_token_tier1

5,76 USD

output model (mode thinking)

output_token_tier1_thinking

5,76 USD

deepseek-v4-flash

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Tier harga

Skenario

Jenis token

Harga satuan (per juta token)

Tidak ada tier

input model

input_token_tier1

0,1656 USD

input model (cache hit implisit)

(cache hit implisit)

input_token_tier1_cached

0,03312 USD

input model (cache hit eksplisit)

(Cache hit eksplisit)

input_token_tier1_cached_explicit

0,01656 USD

input model (pembuatan cache eksplisit)

(pembuatan cache eksplisit)

input_token_tier1_create_cache

0,207 USD

output model (non-thinking)

output_token_tier1

0,33 USD

output model (mode thinking)

output_token_tier1_thinking

0,33 USD

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Tier harga

Skenario

Jenis token

Harga satuan (per juta token)

0 < token ≤ 1.048.576

input model

input_token_tier1

0,24 USD

input model (cache hit implisit)

(cache hit implisit)

input_token_tier1_cached

0,048 USD

input model (cache hit eksplisit)

(cache hit eksplisit)

input_token_tier1_cached_explicit

0,024 USD

input model (pembuatan cache eksplisit)

(Buat cache eksplisit)

input_token_tier1_create_cache

0,3 USD

output model (non-thinking)

output_token_tier1

0,48 USD

output model (mode thinking)

output_token_tier1_thinking

0,48 USD

qwen3.5-397b-a17b

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Token input

Kasus penggunaan

Jenis token

Harga satuan

0 < token ≤ 131.072

input model

input_token_tier1

0,2064 USD

input model

(cache hit implisit)

input_token_tier1_cached

0,04128 USD

input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

0,02064 USD

input model

(buat cache eksplisit)

input_token_tier1_create_cache

0,258 USD

output model (non-thinking)

output_token_tier1

1,2384 USD

output model (mode thinking)

output_token_tier1_thinking

1,2384 USD

131.072 < token ≤ 262.144

input model

input_token_tier2

0,516 USD

input model

(cache hit implisit)

input_token_tier2_cached

0,1032 USD

input model

(cache hit eksplisit)

input_token_tier2_cached_explicit

0,0516 USD

input model

(buat cache eksplisit)

input_token_tier2_create_cache

0,645 USD

output model (non-thinking)

output_token_tier2

3,096 USD

output model (mode thinking)

output_token_tier2_thinking

3,096 USD

qwen3-asr-flash

qwen3-asr-flash hanya ditagih berdasarkan token input model. Tidak ada biaya untuk output model atau tier harga. Semua penggunaan ditagih sebagai input_token_tier1.

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Tier harga

Kasus penggunaan

Jenis token

Harga (per juta token)

Tidak ada tier

input model

input_token_tier1

1,536 USD

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Tier harga

Kasus penggunaan

Jenis token

Harga (per juta token)

Tidak ada tier

input model

input_token_tier1

1,68 USD

qwen3-max (segera dihentikan)

Tiongkok daratan

Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung:

Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)

Token input per inferensi

Skenario

Jenis token

Harga (per juta token)

0 < Token ≤ 32.768

masukan model

input_token_tier1

0,4308 USD

input model

(cache hit implisit)

input_token_tier1_cached

0,08616 USD

input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

0,04308 USD

input model

(buat cache eksplisit)

input_token_tier1_create_cache

0,5385 USD

output model (non-thinking)

output_token_tier1

1,7208 USD

output model (mode thinking)

output_token_tier1_thinking

1,7208 USD

32.768 < Token ≤ 131.072

input model

input_token_tier2

0,6888 USD

masukan model

(cache hit implisit)

input_token_tier2_cached

0,13776 USD

input model

(cache hit eksplisit)

input_token_tier2_cached_explicit

0,06888 USD

input model

(buat cache eksplisit)

input_token_tier2_create_cache

0,861 USD

output model (non-thinking)

output_token_tier2

2,7528 USD

output model (mode thinking)

output_token_tier2_thinking

2,7528 USD

131.072 < Token ≤ 258.048

input model

input_token_tier3

1,2048 USD

input model

(cache hit implisit)

input_token_tier3_cached

0,24096 USD

input model

(cache hit eksplisit)

input_token_tier3_cached_explicit

0,12048 USD

input model

(buat cache eksplisit)

input_token_tier3_create_cache

1,506 USD

output model (non-thinking)

output_token_tier3

4,8168 USD

output model (mode thinking)

output_token_tier3_thinking

4,8168 USD

Internasional

Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.

Wilayah yang didukung: Singapura

Input Tokens per Inference

Skenario

Jenis token

Harga (per juta token)

0 < Token ≤ 32.768

input model

input_token_tier1

1,44 USD

input model

(cache hit implisit)

input_token_tier1_cached

0,288 USD

input model

(cache hit eksplisit)

input_token_tier1_cached_explicit

0,144 USD

input model

(buat cache eksplisit)

input_token_tier1_create_cache

1,8 USD

output model (non-thinking)

output_token_tier1

7,2 USD

output model (mode thinking)

output_token_tier1_thinking

7,2 USD

32.768 < Token ≤ 131.072

input model

input_token_tier2

2,88 USD

input model

(cache hit implisit)

input_token_tier2_cached

0,576 USD

input model

(cache hit eksplisit)

input_token_tier2_cached_explicit

0,288 USD

input model

(buat cache eksplisit)

input_token_tier2_create_cache

3,6 USD

output model (non-thinking)

output_token_tier2

14,4 USD

output model (mode thinking)

output_token_tier2_thinking

14,4 USD

131.072 < Token ≤ 258.048

input model

input_token_tier3

3,6 USD

masukan model

(cache hit implisit)

input_token_tier3_cached

0,72 USD

input model

(cache hit eksplisit)

input_token_tier3_cached_explicit

0,36 USD

input model

(buat cache eksplisit)

input_token_tier3_create_cache

4,5 USD

output model (non-thinking)

output_token_tier3

18 USD

output model (mode thinking)

output_token_tier3_thinking

18 USD

Penagihan

  • Frekuensi penagihan: Ditagih per jam.

    Karena adanya keterlambatan agregasi data, biaya inferensi mungkin memerlukan beberapa jam untuk muncul pada tagihan Anda setelah pekerjaan selesai. Informasi dalam Manajemen Penagihan Alibaba Cloud bersifat final.

  • Lihat tagihan Anda

    1. Masuk ke konsol Manajemen Penagihan Alibaba Cloud.

    2. Di panel navigasi kiri, pilih Billing > Bill Details.

    3. Pada halaman Bill Details, atur Product Name ke MaxCompute dan Product Name ke layanan komputasi model MaxCompute.

FAQ

  • T: Bagaimana cara memperkirakan biaya inferensi?
    J: Anda dapat memperkirakan biaya berdasarkan tabel harga dan panjang token input serta output yang diharapkan. Misalnya, pekerjaan dengan 1.000 pemanggilan inferensi menggunakan model qwen3-max, di mana setiap pemanggilan rata-rata menghasilkan 2.000 token input dan 1.000 token output, akan dikenai biaya sekitar CNY 18 untuk layanan komputasi model.

  • T: Apakah tersedia tier gratis atau uji coba?
    J: Layanan komputasi model hanya tersedia dengan skema bayar sesuai penggunaan dan tidak memiliki tier gratis. Kami menyarankan untuk menguji terlebih dahulu dengan dataset kecil guna memvalidasi performa dan memperkirakan biaya.

  • T: Bisakah saya menetapkan batas pengeluaran untuk mencegah biaya berlebih?
    J: Tidak, layanan ini tidak mendukung batas pengeluaran atau penggunaan. Untuk mengontrol biaya, pantau penggunaan Anda dengan meninjau tagihan Anda.

Dokumentasi terkait