All Products
Search
Document Center

Alibaba Cloud Model Studio:Event klien pengenalan ucapan real-time Paraformer

Last Updated:Sep 02, 2026

Dua event klien WebSocket mengontrol tugas pengenalan ucapan real-time Paraformer: run-task memulai tugas dengan pengaturan model dan audio, sedangkan finish-task mengakhiri tugas setelah aliran audio selesai. Halaman ini menjelaskan struktur pesan dan semantik bidang dari kedua event tersebut.

Panduan pengguna: Untuk detail model dan panduan pemilihan, lihat Speech-to-text.

Alur event: Untuk urutan interaksi event, lihat WebSocket API.

run-task

Deskripsi: Memulai tugas pengenalan ucapan dan mengonfigurasi parameter seperti model, format audio, dan laju sampel.

Kapan dikirim: Segera setelah koneksi WebSocket terbentuk.

Event respons: Server harus mengembalikan event task-started sebelum data audio dapat dikirim.

headerobject(Wajib)

Properti

actionstring(Wajib)

Jenis instruksi. Tetapkan ke run-task.

task_idstring(Wajib)

ID tugas yang dihasilkan klien dalam format UUID. Digunakan untuk menghubungkan event selanjutnya dengan tugas ini.

streamingstring(Wajib)

Tetapkan ke duplex.

payloadobject(Wajib)

Properti

task_groupstring(Wajib)

Kelompok tugas. Tetapkan ke audio.

taskstring(Wajib)

Jenis tugas. Tetapkan ke asr.

functionstring(Wajib)

Jenis fungsi. Tetapkan ke recognition.

modelstring(Wajib)

Nama model.

inputobject(Wajib)

Tetapkan ke {}.

parametersobject(Wajib)

Parameter pengenalan ucapan.

Properti

formatstring(Wajib)

Format audio.

Nilai yang valid:

  • pcm
  • wav
  • mp3
  • opus
  • speex
  • aac
  • amr

PentingParaformer menerapkan batasan berikut:

  • opus dan speex: Harus menggunakan enkapsulasi Ogg.
  • wav: Harus menggunakan encoding PCM.
  • amr: Hanya AMR-NB yang didukung.

sample_rateinteger(Wajib)

Laju sampel, dalam Hz.

Nilai yang valid:

  • Paraformer (berbeda-beda tergantung model):

    • paraformer-realtime-v2: Laju sampel apa pun.
    • paraformer-realtime-8k-v2: Hanya 8000 Hz.

vocabulary_idstring(Opsional)

ID kosakata hotword.

disfluency_removal_enabledboolean(Opsional)

PentingHanya Paraformer yang mendukung parameter ini.

Apakah akan menyaring kata-kata pengisi (filler words).

Default: false.

language_hintsarray[string](Opsional)

Bahasa audio yang akan dikenali. Tidak ada nilai default. Jika tidak ditetapkan, model akan mendeteksi bahasa secara otomatis.

Nilai yang valid:

  • Paraformer:

    • zh: Bahasa Tiongkok
    • en: Bahasa Inggris
    • ja: Bahasa Jepang
    • yue: Bahasa Kanton
    • ko: Bahasa Korea
    • de: Bahasa Jerman
    • fr: Bahasa Prancis
    • ru: Bahasa Rusia

semantic_punctuation_enabledboolean(Opsional)

PentingHanya Paraformer v2 yang mendukung parameter ini.

Apakah akan mengaktifkan segmentasi kalimat berbasis semantik.

Default: false.

  • true: Mengaktifkan segmentasi berbasis semantik dan menonaktifkan segmentasi berbasis VAD.
  • false (default): Mengaktifkan segmentasi berbasis VAD dan menonaktifkan segmentasi berbasis semantik.

Segmentasi berbasis semantik lebih akurat dan cocok untuk transkripsi rapat. Segmentasi berbasis VAD (Voice Activity Detection) memiliki latensi lebih rendah dan cocok untuk skenario interaktif.

max_sentence_silenceinteger(Opsional)

Penting

  • Hanya Paraformer v2 yang mendukung parameter ini.
  • Hanya berlaku ketika semantic_punctuation_enabled ditetapkan ke false.

Ambang batas kesenyapan untuk segmentasi kalimat berbasis VAD, dalam milidetik. Sistem mengakhiri kalimat saat ini jika kesenyapan setelah segmen ucapan melebihi ambang batas ini.

Default: 1300.

Rentang valid: [200, 6000].

multi_threshold_mode_enabledboolean(Opsional)

Penting

  • Hanya Paraformer v2 yang mendukung parameter ini.
  • Hanya berlaku ketika semantic_punctuation_enabled ditetapkan ke false.

Apakah akan mengaktifkan mode multi-ambang batas. Saat diaktifkan, mode ini mencegah segmentasi berbasis VAD menghasilkan segmen yang terlalu panjang.

Default: false.

punctuation_prediction_enabledboolean(Opsional)

PentingHanya Paraformer v2 yang mendukung parameter ini.

Apakah akan menambahkan tanda baca pada hasil pengenalan.

Default: true.

heartbeatboolean(Opsional)

PentingHanya Paraformer v2 yang mendukung parameter ini.

Apakah akan mengaktifkan paket heartbeat.

Default: false.

  • true: Menjaga koneksi tetap aktif meskipun hanya audio senyap yang dikirim.
  • false (default): Meskipun audio senyap terus-menerus dikirim, koneksi akan timeout dan ditutup setelah periode tertentu.

inverse_text_normalization_enabledboolean(Opsional)

PentingHanya Paraformer v2 yang mendukung parameter ini.

Apakah akan mengaktifkan Inverse Text Normalization (ITN). Saat diaktifkan, angka Tiongkok akan dikonversi menjadi angka Arab.

Default: true.

{
    "header": {
        "action": "run-task",
        "task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
        "streaming": "duplex"
    },
    "payload": {
        "task_group": "audio",
        "task": "asr",
        "function": "recognition",
        "model": "paraformer-realtime-v2",
        "parameters": {
            "format": "pcm",
            "sample_rate": 16000,
            "disfluency_removal_enabled": false,
            "language_hints": [
                "en"
            ]
        },
        "input": {}
    }
}

finish-task

Deskripsi: Memberi tahu server bahwa semua data audio telah dikirim dan meminta agar tugas diakhiri.

Kapan dikirim: Setelah semua data audio dikirim.

Event respons: Server mengembalikan event task-finished.

headerobject(Wajib)

Properti

actionstring(Wajib)

Jenis instruksi. Tetapkan ke finish-task.

task_idstring(Wajib)

ID tugas yang dihasilkan klien dalam format UUID. Harus sesuai dengan task_id yang digunakan dalam event run-task.

streamingstring(Wajib)

Tetapkan ke duplex.

payloadobject(Wajib)

Properti

inputobject(Wajib)

Tetapkan ke {}.

{
    "header": {
        "action": "finish-task",
        "task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
        "streaming": "duplex"
    },
    "payload": {
        "input": {}
    }
}