MaxCompute AI inference adalah fitur siap pakai berbasis bayar sesuai penggunaan yang memungkinkan Anda menggunakan model besar untuk pemrosesan data atau inferensi offline. Topik ini menjelaskan aturan penagihan untuk inferensi AI.
Ikhtisar
Layanan MaxCompute AI inference menyediakan inferensi model besar, memungkinkan Anda memanggil model siap pakai langsung dari pekerjaan SQL dan MaxFrame menggunakan fungsi AI bawaan. Penagihan dilakukan secara bayar sesuai penggunaan berdasarkan jumlah total token input dan output.
Wilayah yang didukung: Layanan inferensi model hanya tersedia di wilayah berikut.
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), dan Tiongkok (Ulanqab)
Internasional: Singapura
Model yang didukung: Untuk menggunakan model berikut, Anda harus terlebih dahulu mengaktifkan layanan inferensi model di wilayah target, seperti Tiongkok (Beijing).
Model
Jenis
Deskripsi
qwen3.8-maxMendukung input data multimodal
Model unggulan Mixture of Experts (MoE) dari seri Qwen 3.8 dengan 2,4 triliun parameter. Model ini memiliki peningkatan signifikan dalam kemampuan pemrograman dan produktivitas kantor, serta dapat memprogram secara otonom selama lebih dari sepuluh hari untuk menghasilkan proyek lengkap. Model ini ideal untuk skenario sangat kompleks seperti pemrograman otonom, otomatisasi kantor tingkat lanjut, penelitian ilmiah, dan tugas berdurasi panjang.
qwen3.7-maxHanya menerima input teks
Model unggulan dari seri Qwen 3.7, menampilkan peningkatan komprehensif dalam inferensi, pembuatan kode, dan pemahaman multibahasa. Cocok untuk tugas-tugas sangat kompleks.
qwen3.7-plusMendukung input data multimodal
Model seimbang dari seri Qwen 3.7 yang menawarkan keseimbangan baik antara kinerja dan biaya. Cocok untuk skenario perusahaan seperti analisis teks panjang dan percakapan multi-putaran.
qwen3.7-flashMendukung input data multimodal
Model ringan, berkecepatan tinggi, dan native vision-language dari seri Qwen 3.7. Menampilkan peningkatan pemahaman multimodal dan kemampuan eksekusi agen, menjadikannya ideal untuk layanan online berkonkurensi tinggi dengan latensi rendah serta tugas multimodal ringan.
qwen3.7-text-embeddingHanya menerima input teks
Model vektor teks multibahasa terpadu ini, dilatih pada Qwen 3.7, menawarkan peningkatan kinerja signifikan dalam pengambilan teks, pengelompokan, dan klasifikasi dibandingkan versi text-embedding-v4.
qwen3-vl-embeddingMendukung input data multimodal
Model penyematan vektor multimodal Qwen yang mendukung representasi vektor untuk input campuran gambar dan teks. Cocok untuk skenario pengambilan lintas-modal dan pencocokan gambar-teks.
text-embedding-v4Hanya menerima input teks
Model penyematan vektor teks berpresisi tinggi yang cocok untuk pencarian semantik, pengelompokan, dan perhitungan kemiripan.
qwen3.6-plusMendukung input data multimodal
Model seimbang dari seri Qwen 3.6 yang menawarkan keseimbangan baik antara kinerja dan biaya. Cocok untuk skenario bisnis umum seperti dialog, ringkasan, dan analisis.
qwen3.6-flashMendukung input data multimodal
Model ringan dan berkecepatan tinggi dari seri Qwen 3.6. Memberikan respons cepat dengan biaya rendah, menjadikannya ideal untuk layanan online berkonkurensi tinggi dengan latensi rendah.
deepseek-v4-proHanya menerima input teks
Model inferensi unggulan generasi keempat dari DeepSeek. Unggul dalam tugas-tugas sulit seperti matematika, pemrograman, dan penalaran logis kompleks.
deepseek-v4-flashHanya menerima input teks
Model ringan generasi keempat dari DeepSeek. Menawarkan inferensi cepat dan sangat hemat biaya, cocok untuk percakapan sehari-hari dan tugas inferensi ringan.
qwen3.5-397b-a17bMendukung input data multimodal
Model Mixture of Experts (MoE) dari seri Qwen 3.5. Menampilkan aktivasi parameter efisien, basis pengetahuan luas, dan kemampuan penalaran multi-langkah. Dirancang untuk deduksi logis tingkat kesulitan tinggi, pembuatan kode full-stack, dan tanya jawab pengetahuan mendalam.
qwen3.5-omni-plusMendukung input data multimodal
Qwen3.5-Omni adalah model besar omni-modal terbaru dari Qwen. Cocok untuk skenario seperti pembuatan teks, asisten suara, dan analisis multimedia, memberikan pengalaman pemahaman dan interaksi multimodal yang alami dan lancar.
qwen3-asr-flashMendukung input data multimodal
Model pengenalan ucapan ringan dari seri Qwen 3. Memberikan transkripsi real-time dengan latensi rendah dan konkurensi tinggi, cocok untuk skenario pemrosesan audio real-time seperti membuat notulen rapat, subtitel siaran langsung, dan mengenali perintah suara.
tongyi-embedding-vision-plusMendukung input data multimodal
Tongyi-Embedding-Vision adalah model representasi multimodal visual yang dibangun di atas model bahasa besar (LLM). Cocok untuk berbagai tugas downstream, termasuk pencarian gambar-ke-gambar, pencarian teks-ke-gambar, pencarian teks-ke-video, pencarian video-ke-video, pencarian teks-ke-teks, dan pencarian teks-ke-gambar-dan-teks.
qwen3-max(Segera dihentikan)Hanya menerima input teks
Model bahasa besar berkinerja-tinggi dari seri Qwen, cocok untuk inferensi kompleks dan pembuatan konten.
PentingModel
qwen3-maxakan segera dihentikan. Untuk memastikan kelangsungan layanan, migrasikan layanan terkait Anda ke model baru sesegera mungkin. Untuk informasi lebih lanjut, lihat Kebijakan Penghentian Model.
Anda dikenai biaya layanan inferensi model hanya saat menggunakan model publik yang tercantum di atas dalam pekerjaan MaxFrame Overview dan SQL menggunakan fungsi AI. Anda hanya dikenai biaya untuk pekerjaan yang berhasil; pekerjaan yang gagal tidak dikenai biaya.
Aturan penagihan
Layanan inferensi model ditagih berdasarkan penggunaan token. Dimensi penagihan meliputi:
Wilayah
Jenis model
Jenis token: Membedakan antara token input dan output serta menunjukkan tier harga berbasis penggunaan.
Harga
Satu pekerjaan SQL atau MaxFrame dapat melibatkan beberapa pemanggilan model. Untuk model dengan tier harga, sistem menghitung jumlah token input untuk setiap pemanggilan model secara terpisah untuk menentukan tier harga (jenis token). Sistem kemudian mengukur dan menagih penggunaan untuk setiap jenis token secara terpisah.
Saat menerapkan layanan di wilayah Tiongkok, sumber daya komputasi inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Saat menerapkan layanan di wilayah internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
qwen3.7-max
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Token masukan | Skenario Penggunaan | Jenis | Harga satuan (per 1 juta token) |
0 < token ≤ 1.048.576 | Input model |
| USD 1,98 |
Input model (cache hit implisit) |
| USD 0,396 | |
Input model (cache hit eksplisit) |
| USD 0,198 | |
Input model (buat cache eksplisit) |
| USD 2,475 | |
Output model (non-thinking) |
| USD 5,9412 | |
Output model (mode thinking) |
| USD 5,9412 |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Token masukan | Skenario Penggunaan | Jenis | Harga satuan (per 1 juta token) |
0 < token ≤ 1.048.576 | Input model |
| USD 3 |
Input model (cache hit implisit) |
| USD 0,6 | |
Input model (cache hit eksplisit) |
| USD 0,3 | |
Input model (buat cache eksplisit) |
| USD 3,75 | |
Output model (non-thinking) |
| USD 9 | |
Output model (mode thinking) |
| USD 9 |
qwen3.7-plus
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Token input | Skema penggunaan | Jenis token | Harga (per 1 juta token) |
0 < token ≤ 262.144 | input model |
| USD 0,3312 |
input model (cache hit implisit) |
| USD 0,06624 | |
input model (cache hit eksplisit) |
| USD 0,03312 | |
input model (buat cache eksplisit) |
| USD 0,414 | |
output model (non-thinking) |
| USD 1,3212 | |
output model (mode thinking) |
| USD 1,3212 | |
262.144 < token ≤ 1.048.576 | input model |
| USD 0,9912 |
input model (cache hit implisit) |
| USD 0,19824 | |
input model (cache hit eksplisit) |
| USD 0,09912 | |
input model (buat cache eksplisit) |
| USD 1,239 | |
output model (non-thinking) |
| USD 3,9612 | |
output model (mode thinking) |
| USD 3,9612 |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Token masukan | Skema penggunaan | Jenis token | Harga (per 1 juta token) |
0 < token ≤ 262.144 | input model |
| USD 0,48 |
input model (cache hit implisit) |
| USD 0,096 | |
input model (cache hit eksplisit) |
| USD 0,048 | |
input model (buat cache eksplisit) |
| USD 0,6 | |
output model (non-thinking) |
| USD 1,92 | |
output model (mode thinking) |
| USD 1,92 | |
262.144 < token ≤ 1.048.576 | input model |
| USD 1,44 |
input model (cache hit implisit) |
| USD 0,288 | |
input model (cache hit eksplisit) |
| USD 0,144 | |
input model (buat cache eksplisit) |
| USD 1,8 | |
output model (non-thinking) |
| USD 5,76 | |
output model (mode thinking) |
| USD 5,76 |
qwen3-vl-embedding
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Tier | Kasus penggunaan | Jenis token | Harga satuan |
Teks | Input model |
| 0,12 USD |
Gambar & video | Input model |
| 0,3096 USD |
text-embedding-v4
Model text-embedding-v4 hanya ditagih berdasarkan token input model. Tidak ada biaya untuk output model dan tidak ada tier harga. Semua penggunaan ditagih sebagai input_token_tier1.
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Tier | Kasus penggunaan | Jenis token | Harga satuan (per juta token) |
Tidak ada tier | input model |
| 0,0864 USD |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Tier | Kasus penggunaan | Jenis token | Harga satuan (per juta token) |
Tidak ada tier | input model |
| 0,084 USD |
qwen3.6-plus
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Jumlah token input | Skenario Penggunaan | Jenis token | Harga |
0 < token ≤ 262.144 | Input model |
| 0,3312 USD |
Input model (cache hit implisit) |
| 0,06624 USD | |
Input model (cache hit eksplisit) |
| 0,03312 USD | |
Input model (buat cache eksplisit) |
| 0,414 USD | |
Output model (non-thinking) |
| 1,9812 USD | |
Output model (mode thinking) |
| 1,9812 USD | |
262.144 < token ≤ 1.048.576 | Input model |
| 1,3212 USD |
Input model (cache hit implisit) |
| 0,26424 USD | |
Input model (cache hit eksplisit) |
| 0,13212 USD | |
Input model (buat cache eksplisit) |
| 1,6515 USD | |
Output model (non-thinking) |
| 7,9224 USD | |
Output model (mode thinking) |
| 7,9224 USD |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Jumlah token input | Skema penggunaan | Jenis token | Harga |
0 < token ≤ 262.144 | Input model |
| 0,6 USD |
Input model (cache hit implisit) |
| 0,12 USD | |
Input model (cache hit eksplisit) |
| 0,06 USD | |
Input model (buat cache eksplisit) |
| 0,75 USD | |
Output model (non-thinking) |
| 3,6 USD | |
Output model (mode thinking) |
| 3,6 USD | |
262.144 < token ≤ 1.048.576 | Input model |
| 2,4 USD |
Input model (cache hit implisit) |
| 0,48 USD | |
Input model (cache hit eksplisit) |
| 0,24 USD | |
Input model (buat cache eksplisit) |
| 3 USD | |
Output model (non-thinking) |
| 7,2 USD | |
Output model (mode thinking) |
| 7,2 USD |
qwen3.6-flash
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Token per inferensi | Skenario | Jenis | Harga |
0 < token ≤ 262.144 | Input model |
| USD 0,198 |
Input model (Cache hit implisit) |
| USD 0,0396 | |
Input model (Cache hit eksplisit) |
| USD 0,0198 | |
Input model (Buat cache eksplisit) |
| USD 0,2475 | |
Output model (Non-thinking) |
| USD 1,188 | |
Keluaran Model (Mode Berpikir) |
| USD 1,188 | |
262.144 < token ≤ 1.048.576 | Input model |
| USD 0,792 |
Input model (Cache hit implisit) |
| USD 0,1584 | |
Input model (Cache hit eksplisit) |
| USD 0,0792 | |
Input model (Buat cache eksplisit) |
| USD 0,99 | |
Output model (Non-thinking) |
| USD 4,7532 | |
Output model (Mode thinking) |
| USD 4,7532 |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Token per inferensi | Skenario | Jenis | Harga |
0 < token ≤ 262.144 | Input model |
| USD 0,3 |
Input model (Cache hit implisit) |
| USD 0,06 | |
Input model (Cache hit eksplisit) |
| USD 0,03 | |
Input model (Buat cache eksplisit) |
| USD 0,375 | |
Output model (Non-thinking) |
| USD 1,8 | |
Output model (Mode thinking) |
| USD 1,8 | |
262.144 < token ≤ 1.048.576 | Input model |
| USD 1,2 |
Input model (Cache hit implisit) |
| USD 0,24 | |
Input model (Cache hit eksplisit) |
| USD 0,12 | |
Input model (Buat cache eksplisit) |
| USD 1,5 | |
Output model (Non-thinking) |
| USD 4,8 | |
Output model (Mode thinking) |
| USD 4,8 |
deepseek-v4-pro
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Tier | Skenario Penggunaan | Jenis token | Harga (per juta token) |
Tidak ada tier | input model |
| 1,98 USD |
input model (hit cache implisit) |
| 0,396 USD | |
input model (hit cache eksplisit) |
| 0,198 USD | |
input model (buat cache eksplisit) |
| 2,475 USD | |
output model (non-thinking) |
| 3,9612 USD | |
output model (mode thinking) |
| 3,9612 USD |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Token masukan | Skema penggunaan | Jenis token | Harga (per juta token) |
0 < Token ≤ 1.048.576 | input model |
| 2,88 USD |
input model (hit cache implisit) |
| 0,576 USD | |
input model (hit cache eksplisit) |
| 0,288 USD | |
Masukan model (buat cache eksplisit) |
| 3,6 USD | |
output model (non-thinking) |
| 5,76 USD | |
output model (mode thinking) |
| 5,76 USD |
deepseek-v4-flash
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Tier harga | Skenario | Jenis token | Harga satuan (per juta token) |
Tidak ada tier | input model |
| 0,1656 USD |
input model (cache hit implisit) (cache hit implisit) |
| 0,03312 USD | |
input model (cache hit eksplisit) (Cache hit eksplisit) |
| 0,01656 USD | |
input model (pembuatan cache eksplisit) (pembuatan cache eksplisit) |
| 0,207 USD | |
output model (non-thinking) |
| 0,33 USD | |
output model (mode thinking) |
| 0,33 USD |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Tier harga | Skenario | Jenis token | Harga satuan (per juta token) |
0 < token ≤ 1.048.576 | input model |
| 0,24 USD |
input model (cache hit implisit) (cache hit implisit) |
| 0,048 USD | |
input model (cache hit eksplisit) (cache hit eksplisit) |
| 0,024 USD | |
input model (pembuatan cache eksplisit) (Buat cache eksplisit) |
| 0,3 USD | |
output model (non-thinking) |
| 0,48 USD | |
output model (mode thinking) |
| 0,48 USD |
qwen3.5-397b-a17b
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Token input | Kasus penggunaan | Jenis token | Harga satuan |
0 < token ≤ 131.072 | input model |
| 0,2064 USD |
input model (cache hit implisit) |
| 0,04128 USD | |
input model (cache hit eksplisit) |
| 0,02064 USD | |
input model (buat cache eksplisit) |
| 0,258 USD | |
output model (non-thinking) |
| 1,2384 USD | |
output model (mode thinking) |
| 1,2384 USD | |
131.072 < token ≤ 262.144 | input model |
| 0,516 USD |
input model (cache hit implisit) |
| 0,1032 USD | |
input model (cache hit eksplisit) |
| 0,0516 USD | |
input model (buat cache eksplisit) |
| 0,645 USD | |
output model (non-thinking) |
| 3,096 USD | |
output model (mode thinking) |
| 3,096 USD |
qwen3-asr-flash
qwen3-asr-flash hanya ditagih berdasarkan token input model. Tidak ada biaya untuk output model atau tier harga. Semua penggunaan ditagih sebagai input_token_tier1.
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Tier harga | Kasus penggunaan | Jenis token | Harga (per juta token) |
Tidak ada tier | input model |
| 1,536 USD |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Tier harga | Kasus penggunaan | Jenis token | Harga (per juta token) |
Tidak ada tier | input model |
| 1,68 USD |
qwen3-max (segera dihentikan)
Tiongkok daratan
Untuk penerapan di wilayah Tiongkok, sumber daya komputasi untuk inferensi model dibatasi hanya di Tiongkok daratan, dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung:
Tiongkok daratan: Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Hangzhou), Tiongkok (Shenzhen), Tiongkok (Ulanqab)
Token input per inferensi | Skenario | Jenis token | Harga (per juta token) |
0 < Token ≤ 32.768 | masukan model |
| 0,4308 USD |
input model (cache hit implisit) |
| 0,08616 USD | |
input model (cache hit eksplisit) |
| 0,04308 USD | |
input model (buat cache eksplisit) |
| 0,5385 USD | |
output model (non-thinking) |
| 1,7208 USD | |
output model (mode thinking) |
| 1,7208 USD | |
32.768 < Token ≤ 131.072 | input model |
| 0,6888 USD |
masukan model (cache hit implisit) |
| 0,13776 USD | |
input model (cache hit eksplisit) |
| 0,06888 USD | |
input model (buat cache eksplisit) |
| 0,861 USD | |
output model (non-thinking) |
| 2,7528 USD | |
output model (mode thinking) |
| 2,7528 USD | |
131.072 < Token ≤ 258.048 | input model |
| 1,2048 USD |
input model (cache hit implisit) |
| 0,24096 USD | |
input model (cache hit eksplisit) |
| 0,12048 USD | |
input model (buat cache eksplisit) |
| 1,506 USD | |
output model (non-thinking) |
| 4,8168 USD | |
output model (mode thinking) |
| 4,8168 USD |
Internasional
Untuk penerapan di Wilayah Internasional, sumber daya komputasi untuk inferensi model dijadwalkan secara dinamis di seluruh dunia (tidak termasuk Tiongkok daratan), dan data statis disimpan di wilayah yang dipilih.
Wilayah yang didukung: Singapura
Input Tokens per Inference | Skenario | Jenis token | Harga (per juta token) |
0 < Token ≤ 32.768 | input model |
| 1,44 USD |
input model (cache hit implisit) |
| 0,288 USD | |
input model (cache hit eksplisit) |
| 0,144 USD | |
input model (buat cache eksplisit) |
| 1,8 USD | |
output model (non-thinking) |
| 7,2 USD | |
output model (mode thinking) |
| 7,2 USD | |
32.768 < Token ≤ 131.072 | input model |
| 2,88 USD |
input model (cache hit implisit) |
| 0,576 USD | |
input model (cache hit eksplisit) |
| 0,288 USD | |
input model (buat cache eksplisit) |
| 3,6 USD | |
output model (non-thinking) |
| 14,4 USD | |
output model (mode thinking) |
| 14,4 USD | |
131.072 < Token ≤ 258.048 | input model |
| 3,6 USD |
masukan model (cache hit implisit) |
| 0,72 USD | |
input model (cache hit eksplisit) |
| 0,36 USD | |
input model (buat cache eksplisit) |
| 4,5 USD | |
output model (non-thinking) |
| 18 USD | |
output model (mode thinking) |
| 18 USD |
Penagihan
Frekuensi penagihan: Ditagih per jam.
Karena adanya keterlambatan agregasi data, biaya inferensi mungkin memerlukan beberapa jam untuk muncul pada tagihan Anda setelah pekerjaan selesai. Informasi dalam Manajemen Penagihan Alibaba Cloud bersifat final.
Lihat tagihan Anda
Masuk ke konsol Manajemen Penagihan Alibaba Cloud.
Di panel navigasi kiri, pilih .
Pada halaman Bill Details, atur Product Name ke MaxCompute dan Product Name ke layanan komputasi model MaxCompute.
FAQ
T: Bagaimana cara memperkirakan biaya inferensi?
J: Anda dapat memperkirakan biaya berdasarkan tabel harga dan panjang token input serta output yang diharapkan. Misalnya, pekerjaan dengan 1.000 pemanggilan inferensi menggunakan model qwen3-max, di mana setiap pemanggilan rata-rata menghasilkan 2.000 token input dan 1.000 token output, akan dikenai biaya sekitar CNY 18 untuk layanan komputasi model.T: Apakah tersedia tier gratis atau uji coba?
J: Layanan komputasi model hanya tersedia dengan skema bayar sesuai penggunaan dan tidak memiliki tier gratis. Kami menyarankan untuk menguji terlebih dahulu dengan dataset kecil guna memvalidasi performa dan memperkirakan biaya.T: Bisakah saya menetapkan batas pengeluaran untuk mencegah biaya berlebih?
J: Tidak, layanan ini tidak mendukung batas pengeluaran atau penggunaan. Untuk mengontrol biaya, pantau penggunaan Anda dengan meninjau tagihan Anda.