All Products
Search
Document Center

Realtime Compute for Apache Flink:Penagihan Layanan AI (Pay-As-You-Go)

Last Updated:Jul 04, 2026

Setelah Anda mengaktifkan layanan Flink AI, pemanggilan inferensi ke model bawaan akan dikenai biaya pemanggilan model. Biaya ini ditagih berdasarkan penggunaan token, terpisah dari biaya sumber daya komputasi CU ruang kerja.

Ikhtisar Penagihan

  • Sumber Daya Komputasi (CU): Sumber daya komputasi yang diperlukan untuk eksekusi pekerjaan, ditagih dengan cara yang sama seperti penagihan CU yang sudah ada.

  • Biaya Pemanggilan Layanan AI: Biaya yang timbul akibat pemanggilan model bawaan, ditagih secara terpisah berdasarkan penggunaan token.

Untuk penagihan produk cloud terkait, lihat Billable Items.

Aturan Penagihan

  • Unit Penagihan: USD/1K token. Token input dan token output ditagih secara terpisah.

  • Siklus Penagihan: Diselesaikan satu kali per menit (berdasarkan waktu UTC+8), menghasilkan tagihan dan memotong biaya.

  • Dimensi Penagihan: Ditagih berdasarkan kombinasi Region × Model × Input Volume Tier × Token Type. Biaya permintaan per menit = Σ(penggunaan token per jenis × harga satuan).

  • Tingkat Gratis: 1 juta token pertama per akun utama per region per bulan kalender (berdasarkan waktu UTC+8) gratis (gabungan input dan output). Penggunaan melebihi batas ini akan ditagih sesuai harga yang tercantum.

Deskripsi Jenis Token

Token yang dihasilkan oleh setiap permintaan inferensi diukur berdasarkan jenis berikut:

  • Standard Input Token: Ditagih dengan harga satuan input dasar.

  • Standard Output Token: Ditagih dengan harga satuan output dasar.

  • Implicit Cache Hit Input Token: Ditagih sebesar 20% dari harga input dasar.

  • Explicit Cache Creation Input Token: Ditagih sebesar 125% dari harga input dasar.

  • Explicit Cache Hit Input Token: Ditagih sebesar 10% dari harga input dasar.

Biaya permintaan per menit = Σ(penggunaan token per jenis × harga satuan). Harga satuan token jenis cache = harga satuan input dasar × koefisien penagihan.

Harga

Penting

Harga aktual mengacu pada halaman pembelian produk dan laporan penagihan.

Harga Dasar Model Inferensi

Tabel berikut menunjukkan harga satuan dasar untuk Standard Input Token dan Standard Output Token. Token jenis cache ditagih berdasarkan harga dasar ini dikalikan dengan koefisien yang sesuai. Untuk detailnya, lihat Cache Token Billing Coefficients.

  • China (Daratan Utama): seperti China East 1 (Hangzhou), China North 2 (Beijing), dll.

  • Di Luar China (Daratan Utama): termasuk China (Hong Kong), Singapura, AS, dan semua wilayah lain di luar daratan utama.

China (Daratan Utama)

Model

Input Volume Tier (1K tokens)

Input (USD/1K tokens)

Output (USD/1K tokens)

qwen3.7-max

0~1,000

0.00198

0.005941

qwen3.6-plus

0~256

0.00033

0.00198

256~1,000

0.00132

0.007921

qwen3.6-flash

0~256

0.000198

0.001188

256~1,000

0.000792

0.004753

qwen3.5-plus

0~128

0.000132

0.000792

128~256

0.00033

0.00198

256~1,000

0.00066

0.003961

qwen3.5-flash

0~128

0.000033

0.00033

128~256

0.000132

0.00132

256~1,000

0.000198

0.00198

Di Luar China (Daratan Utama)

Model

Input Volume Tier (1K tokens)

Input (USD/1K tokens)

Output (USD/1K tokens)

qwen3.7-max

0~1,000

0.003093

0.009276

qwen3.6-plus

0~256

0.000619

0.00371

256~1,000

0.002474

0.007421

qwen3.6-flash

0~256

0.000309

0.001855

256~1,000

0.001236

0.004947

qwen3.5-plus

0~128

0.000485

0.002906

128~256

0.000485

0.002906

256~1,000

0.000606

0.003634

qwen3.5-flash

0~128

0.00012

0.000485

128~256

0.00012

0.000485

256~1,000

0.000198

0.000485

Harga Model Embedding

China (Daratan Utama)

Model

Input Type

USD/1K tokens

text-embedding-v4

Text

0.000083

qwen3-vl-embedding

Text

0.000116

Image

0.000297

Di Luar China (Daratan Utama)

Model

Input Type

USD/1K tokens

text-embedding-v4

Text

0.000085

Koefisien Penagihan Token Cache

Biaya token jenis cache = harga satuan input dasar model yang sesuai × koefisien penagihan × penggunaan token. Untuk detailnya, lihat Context Cache.

Jenis Token

Koefisien Penagihan

Deskripsi

Implicit cache hit

×0.2

Ditagih sebesar 20% dari harga input dasar

Explicit cache creation

×1.25

Ditagih sebesar 125% dari harga input dasar

Explicit cache hit

×0.1

Ditagih sebesar 10% dari harga input dasar

Contoh Penagihan

Skenario: Menggunakan qwen3.6-plus di wilayah China North 2 (Beijing) (tingkat volume input 0–256K token), dengan konsumsi kumulatif 5.000K token input dan 1.200K token output.

Perhitungan Biaya:

  • Biaya input: 5.000 × 0,00033 = 1,65 USD

  • Biaya output: 1.200 × 0,00198 = 2,376 USD

  • Total: 4,026 USD

Rincian Tagihan

Tagihan dirinci berdasarkan region, ID ruang kerja, jenis penggunaan Flink, model, jenis token, dan tingkat volume input.

Unduh Tagihan

  1. Masuk ke halaman Bill Details, lalu pilih periode penagihan.

  2. Atur Product menjadi Realtime Compute for Apache Flink, dan atur Product Name menjadi 实时计算Flink版_AI_按量付费_国际站, lalu klik Search.

  3. Klik ikon ekspor di pojok kanan atas daftar tagihan untuk mengunduh tagihan.

  4. Buka file tagihan dan temukan kolom Instance ID (billing granularity). Bidang ini dipisahkan dengan titik koma (;) dalam format berikut:

    Region;Workspace ID;Project Name;Flink Usage;Model;Token Type;Input Volume Tier

    Segmen

    Deskripsi

    Region

    Wilayah ruang kerja

    Workspace ID

    Pengidentifikasi unik ruang kerja Flink

    Project Name

    Saat ini kosong; bidang cadangan

    Flink Usage

    Skema penggunaan token; nilai yang valid: ai_function atau flink_agents

    Model

    Nama LLM yang dipanggil

    Token Type

    Input Token atau Output Token

    Input Volume Tier

    Penanda batas atas rentang token input, seperti 128, 256, 1000, dll.

Pembayaran Tertunda

  • Setelah terjadi pembayaran tertunda, layanan akan dihentikan. Semua pekerjaan yang menggunakan model bawaan tidak dapat memanggil model.

  • Layanan akan dipulihkan secara otomatis setelah Anda mengisi ulang akun.

  • Permintaan pemanggilan model selama periode tertunda tidak diproses, dan pekerjaan terkait mungkin mengalami error.

Hentikan Penagihan

Untuk menghentikan penagihan layanan AI, klik Disable Service pada halaman Layanan AI di Konsol. Setelah Anda menonaktifkan layanan:

  • Semua pekerjaan tidak akan dapat menggunakan layanan model bawaan.

  • Tidak akan ada lagi biaya pemanggilan layanan AI yang dikenakan.

  • Biaya sumber daya komputasi CU ruang kerja tidak terpengaruh.

Penting

Sebelum menonaktifkan layanan AI, pastikan tidak ada pekerjaan yang bergantung pada model bawaan. Jika tidak, pekerjaan tersebut mungkin mengalami kesalahan waktu proses.