Setelah Anda mengaktifkan layanan Flink AI, pemanggilan inferensi ke model bawaan akan dikenai biaya pemanggilan model. Biaya ini ditagih berdasarkan penggunaan token, terpisah dari biaya sumber daya komputasi CU ruang kerja.
Ikhtisar Penagihan
Sumber Daya Komputasi (CU): Sumber daya komputasi yang diperlukan untuk eksekusi pekerjaan, ditagih dengan cara yang sama seperti penagihan CU yang sudah ada.
Biaya Pemanggilan Layanan AI: Biaya yang timbul akibat pemanggilan model bawaan, ditagih secara terpisah berdasarkan penggunaan token.
Untuk penagihan produk cloud terkait, lihat Billable Items.
Aturan Penagihan
Unit Penagihan: USD/1K token. Token input dan token output ditagih secara terpisah.
Siklus Penagihan: Diselesaikan satu kali per menit (berdasarkan waktu UTC+8), menghasilkan tagihan dan memotong biaya.
Dimensi Penagihan: Ditagih berdasarkan kombinasi
Region × Model × Input Volume Tier × Token Type. Biaya permintaan per menit = Σ(penggunaan token per jenis × harga satuan).Tingkat Gratis: 1 juta token pertama per akun utama per region per bulan kalender (berdasarkan waktu UTC+8) gratis (gabungan input dan output). Penggunaan melebihi batas ini akan ditagih sesuai harga yang tercantum.
Deskripsi Jenis Token
Token yang dihasilkan oleh setiap permintaan inferensi diukur berdasarkan jenis berikut:
Standard Input Token: Ditagih dengan harga satuan input dasar.
Standard Output Token: Ditagih dengan harga satuan output dasar.
Implicit Cache Hit Input Token: Ditagih sebesar 20% dari harga input dasar.
Explicit Cache Creation Input Token: Ditagih sebesar 125% dari harga input dasar.
Explicit Cache Hit Input Token: Ditagih sebesar 10% dari harga input dasar.
Biaya permintaan per menit = Σ(penggunaan token per jenis × harga satuan). Harga satuan token jenis cache = harga satuan input dasar × koefisien penagihan.
Harga
Harga aktual mengacu pada halaman pembelian produk dan laporan penagihan.
Harga Dasar Model Inferensi
Tabel berikut menunjukkan harga satuan dasar untuk Standard Input Token dan Standard Output Token. Token jenis cache ditagih berdasarkan harga dasar ini dikalikan dengan koefisien yang sesuai. Untuk detailnya, lihat Cache Token Billing Coefficients.
China (Daratan Utama): seperti China East 1 (Hangzhou), China North 2 (Beijing), dll.
Di Luar China (Daratan Utama): termasuk China (Hong Kong), Singapura, AS, dan semua wilayah lain di luar daratan utama.
China (Daratan Utama)
Model | Input Volume Tier (1K tokens) | Input (USD/1K tokens) | Output (USD/1K tokens) |
qwen3.7-max | 0~1,000 | 0.00198 | 0.005941 |
qwen3.6-plus | 0~256 | 0.00033 | 0.00198 |
256~1,000 | 0.00132 | 0.007921 | |
qwen3.6-flash | 0~256 | 0.000198 | 0.001188 |
256~1,000 | 0.000792 | 0.004753 | |
qwen3.5-plus | 0~128 | 0.000132 | 0.000792 |
128~256 | 0.00033 | 0.00198 | |
256~1,000 | 0.00066 | 0.003961 | |
qwen3.5-flash | 0~128 | 0.000033 | 0.00033 |
128~256 | 0.000132 | 0.00132 | |
256~1,000 | 0.000198 | 0.00198 |
Di Luar China (Daratan Utama)
Model | Input Volume Tier (1K tokens) | Input (USD/1K tokens) | Output (USD/1K tokens) |
qwen3.7-max | 0~1,000 | 0.003093 | 0.009276 |
qwen3.6-plus | 0~256 | 0.000619 | 0.00371 |
256~1,000 | 0.002474 | 0.007421 | |
qwen3.6-flash | 0~256 | 0.000309 | 0.001855 |
256~1,000 | 0.001236 | 0.004947 | |
qwen3.5-plus | 0~128 | 0.000485 | 0.002906 |
128~256 | 0.000485 | 0.002906 | |
256~1,000 | 0.000606 | 0.003634 | |
qwen3.5-flash | 0~128 | 0.00012 | 0.000485 |
128~256 | 0.00012 | 0.000485 | |
256~1,000 | 0.000198 | 0.000485 |
Harga Model Embedding
China (Daratan Utama)
Model | Input Type | USD/1K tokens |
text-embedding-v4 | Text | 0.000083 |
qwen3-vl-embedding | Text | 0.000116 |
Image | 0.000297 |
Di Luar China (Daratan Utama)
Model | Input Type | USD/1K tokens |
text-embedding-v4 | Text | 0.000085 |
Koefisien Penagihan Token Cache
Biaya token jenis cache = harga satuan input dasar model yang sesuai × koefisien penagihan × penggunaan token. Untuk detailnya, lihat Context Cache.
Jenis Token | Koefisien Penagihan | Deskripsi |
Implicit cache hit | ×0.2 | Ditagih sebesar 20% dari harga input dasar |
Explicit cache creation | ×1.25 | Ditagih sebesar 125% dari harga input dasar |
Explicit cache hit | ×0.1 | Ditagih sebesar 10% dari harga input dasar |
Contoh Penagihan
Skenario: Menggunakan qwen3.6-plus di wilayah China North 2 (Beijing) (tingkat volume input 0–256K token), dengan konsumsi kumulatif 5.000K token input dan 1.200K token output.
Perhitungan Biaya:
Biaya input: 5.000 × 0,00033 = 1,65 USD
Biaya output: 1.200 × 0,00198 = 2,376 USD
Total: 4,026 USD
Rincian Tagihan
Tagihan dirinci berdasarkan region, ID ruang kerja, jenis penggunaan Flink, model, jenis token, dan tingkat volume input.
Unduh Tagihan
Masuk ke halaman Bill Details, lalu pilih periode penagihan.
Atur Product menjadi Realtime Compute for Apache Flink, dan atur Product Name menjadi 实时计算Flink版_AI_按量付费_国际站, lalu klik Search.
Klik ikon ekspor di pojok kanan atas daftar tagihan untuk mengunduh tagihan.
Buka file tagihan dan temukan kolom Instance ID (billing granularity). Bidang ini dipisahkan dengan titik koma (;) dalam format berikut:
Region;Workspace ID;Project Name;Flink Usage;Model;Token Type;Input Volume TierSegmen
Deskripsi
Region
Wilayah ruang kerja
Workspace ID
Pengidentifikasi unik ruang kerja Flink
Project Name
Saat ini kosong; bidang cadangan
Flink Usage
Skema penggunaan token; nilai yang valid:
ai_functionatauflink_agentsModel
Nama LLM yang dipanggil
Token Type
Input Token atau Output Token
Input Volume Tier
Penanda batas atas rentang token input, seperti 128, 256, 1000, dll.
Pembayaran Tertunda
Setelah terjadi pembayaran tertunda, layanan akan dihentikan. Semua pekerjaan yang menggunakan model bawaan tidak dapat memanggil model.
Layanan akan dipulihkan secara otomatis setelah Anda mengisi ulang akun.
Permintaan pemanggilan model selama periode tertunda tidak diproses, dan pekerjaan terkait mungkin mengalami error.
Hentikan Penagihan
Untuk menghentikan penagihan layanan AI, klik Disable Service pada halaman Layanan AI di Konsol. Setelah Anda menonaktifkan layanan:
Semua pekerjaan tidak akan dapat menggunakan layanan model bawaan.
Tidak akan ada lagi biaya pemanggilan layanan AI yang dikenakan.
Biaya sumber daya komputasi CU ruang kerja tidak terpengaruh.
Sebelum menonaktifkan layanan AI, pastikan tidak ada pekerjaan yang bergantung pada model bawaan. Jika tidak, pekerjaan tersebut mungkin mengalami kesalahan waktu proses.