All Products
Search
Document Center

Alibaba Cloud Model Studio:API WebSocket untuk sintesis suara real-time Qwen-TTS

Last Updated:Sep 02, 2026

Lakukan koneksi ke layanan sintesis suara real-time Qwen-TTS melalui WebSocket. Dokumen ini mencakup titik akhir layanan, header permintaan, dan alur interaksi.

Untuk ikhtisar model dan panduan pemilihan, lihat Sintesis suara real-time.

API Realtime Qwen-TTS menggunakan protokol WebSocket. Aplikasi Java dan Python dapat memanfaatkan SDK DashScope untuk menghindari penanganan WebSocket secara manual, sedangkan bahasa lain dapat terhubung langsung menggunakan pustaka WebSocket.

Titik akhir layanan

Gunakan URL berikut dan tetapkan model melalui parameter kueri model:

Singapura

URL WebSocket: wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime?model=qwen3-tts-flash-realtime

Tiongkok (Beijing)

URL WebSocket: wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime?model=qwen3-tts-flash-realtime

PentingURL harus menggunakan protokol wss://. Tetapkan header Authorization (lihat Header permintaan) dan tentukan model menggunakan parameter kueri model.

Header permintaan

Tetapkan header permintaan berikut:

Parameter

Tipe

Wajib

Deskripsi

Authorization

string

Ya

Format: Bearer <your_api_key>. Ganti <your_api_key> dengan Kunci API Anda.

user-agent

string

Tidak

Identifikasi klien untuk pelacakan sumber di sisi server.

X-DashScope-WorkSpace

string

Tidak

ID ruang kerja Alibaba Cloud Model Studio.

PentingOtorisasi diverifikasi selama handshake WebSocket. Kunci API yang tidak valid atau tidak ada akan menyebabkan handshake gagal dengan kode HTTP 401/403.

Alur interaksi

Untuk penjelasan rinci mengenai event klien dan event server, lihat Event klien dan Event server.

API ini mendukung dua mode:

  • Mode ServerCommit: Server menentukan segmentasi teks dan waktu sintesis secara otomatis.
  • Mode Commit: Klien mengontrol kapan setiap segmen teks dikirimkan. Panggil input_text_buffer.commit secara eksplisit untuk memicu sintesis.

Detail mode

  • Pada mode ServerCommit, panggil input_text_buffer.append untuk menyimpan teks ke buffer. Sistem menentukan waktu sintesis secara otomatis.
  • Memanggil input_text_buffer.commit pada mode ServerCommit akan segera mensintesis buffer saat ini. Sesi kemudian kembali ke mode ServerCommit.
  • Pada mode Commit, input_text_buffer.append saja tidak memicu sintesis. Panggil input_text_buffer.commit untuk memulai sintesis.

qwen-tts

Langkah utama:
  1. Koneksi: Klien membuka koneksi WebSocket. Server mengembalikan event session.created ketika siap.

  2. Konfigurasi sesi: Klien mengirim session.update untuk mengatur voice, format, dan mode.

  3. Input teks: Klien mengirim input_text_buffer.append untuk menambahkan teks ke buffer.

  4. Pemicu sintesis:

    • Pada mode ServerCommit, sintesis dimulai secara otomatis. Klien dapat memanggil input_text_buffer.commit untuk memaksa sintesis segera.
    • Pada mode Commit, hanya input_text_buffer.commit yang memicu sintesis.
  5. Generasi audio: Server mengirim event response.created, lalu mengalirkan audio dalam bentuk base64 sebagai event response.audio.delta hingga event response.audio.done.

  6. Pengakhiran sesi: Klien mengirim session.finish untuk melepaskan sumber daya. Server mengembalikan session.finished dan menutup koneksi.

Setelah koneksi terbentuk, server mengembalikan event session.created berikut:

{
    "event_id": "event_xxx",
    "type": "session.created",
    "session": {
        "object": "realtime.session",
        "mode": "server_commit",
        "model": "qwen3-tts-flash-realtime",
        "voice": "Cherry",
        "response_format": "pcm",
        "sample_rate": 24000,
        "id": "sess_xxx"
    }
}