All Products
Search
Document Center

Alibaba Cloud Model Studio:Kloning suara

Last Updated:Sep 09, 2026

Kloning suara hanya memerlukan sampel audio berdurasi 10–20 detik untuk menghasilkan suara kustom yang sangat mirip tanpa perlu pelatihan model.

Ikhtisar

Kloning suara dirancang untuk skenario seperti asisten suara personalisasi, siaran eksklusif merek, dan konten audio kustom.

Alibaba Cloud Model Studio menyediakan kemampuan kloning suara melalui rangkaian model berikut:

  • Qwen-Audio-TTS / CosyVoice: Buat suara melalui SDK DashScope atau HTTP API. Mendukung sintesis suara . Tersedia di wilayah Beijing dan Singapura.
  • Qwen-Audio-Realtime: Qwen-Audio-Realtime adalah model dialog suara real-time (bukan model sintesis suara). Kloning suara digunakan untuk menyesuaikan suara TTS pada respons model dialog. Buat suara melalui SDK DashScope atau HTTP API. Hanya tersedia di wilayah China (Beijing).
  • Qwen-TTS: Buat suara melalui HTTP API. Mendukung sintesis suara real-time dan non-real-time. Tersedia di wilayah Beijing dan Singapura.

Untuk perbandingan detail dan rekomendasi pemilihan model, lihat Sintesis suara.

Prasyarat

  1. Konfigurasikan Kunci API dan tetapkan sebagai variabel lingkungan.
  2. Jika Anda memanggil API melalui SDK DashScope, instal SDK terbaru.
  3. Siapkan file audio: Audio harus memenuhi Persyaratan audio.

Memulai dengan cepat

Kloning suara melibatkan tiga langkah:

  1. Siapkan audio: Siapkan file audio yang memenuhi Persyaratan audio.
  2. Buat suara: Panggil API kloning suara untuk mengunggah audio dan membuat suara. Gunakan parameter target_model untuk menentukan model sintesis suara yang akan di-bind.
  3. Sintesis suara dengan suara hasil kloning: Panggil API sintesis suara dengan ID suara yang dikembalikan pada langkah sebelumnya.

Kloning suara Qwen-Audio-TTS

PentingKloning suara Qwen-Audio-TTS tersedia di wilayah Beijing dan Singapura.

Langkah 1: Buat suara

Panggil API kloning suara untuk mengunggah audio dan membuat suara. Parameter url menentukan URL file audio yang dapat diakses, dan parameter prefix berfungsi sebagai awalan nama suara.

Konfigurasi berikut untuk wilayah Singapura. Untuk menggunakan model di wilayah China (Beijing), ganti domain dengan https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya.

curl -X POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "create_voice",
        "target_model": "qwen-audio-3.0-tts-flash",
        "prefix": "myvoice",
        "url": "https://your-audio-url.wav"
    }
}'
Langkah 2: Sintesis suara dengan suara hasil kloning

Gunakan nilai voice_id yang dikembalikan pada langkah sebelumnya dalam permintaan berikut.

# coding=utf-8

import dashscope
from dashscope.audio.tts_v2 import *
import os

# Kunci API untuk wilayah Singapura dan Beijing berbeda. Dapatkan Kunci API Anda: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# Jika variabel lingkungan belum dikonfigurasi, ganti baris berikut dengan Kunci API Studio Model Anda: dashscope.api_key = "sk-xxx"
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')

# Berikut adalah konfigurasi untuk wilayah Singapura. Ganti "{WorkspaceId}" dengan ID ruang kerja Anda yang sebenarnya saat memanggil. Konfigurasi bervariasi berdasarkan wilayah.
dashscope.base_websocket_api_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'

# Kloning suara dan sintesis suara harus menggunakan model yang sama
model = "qwen-audio-3.0-tts-flash"
# Ganti parameter voice dengan suara kustom yang dihasilkan oleh kloning suara
voice = "voice_id"

# Instansiasi SpeechSynthesizer, meneruskan model, voice, dan parameter permintaan lainnya dalam konstruktor
synthesizer = SpeechSynthesizer(model=model, voice=voice)
# Kirim teks untuk sintesis dan dapatkan audio biner
audio = synthesizer.call("What's the weather like today?")
# Pengiriman teks pertama memerlukan pembentukan koneksi WebSocket, sehingga latensi paket pertama mencakup waktu penyiapan koneksi
print('[Metric] requestId: {}, first-packet latency: {} ms'.format(
    synthesizer.get_last_request_id(),
    synthesizer.get_first_package_delay()))

# Simpan audio ke file lokal
with open('output.mp3', 'wb') as f:
    f.write(audio)

Kloning suara Qwen-Audio-Realtime

PentingKloning suara Qwen-Audio-Realtime hanya tersedia di wilayah China (Beijing). Persyaratan audio sama dengan Qwen-Audio-TTS.

Langkah 1: Buat suara

Gunakan SDK DashScope atau HTTP API untuk memanggil API kloning suara, mengunggah audio, dan membuat suara. Parameter target_model menentukan nama model dialog real-time, dan parameter prefix berfungsi sebagai awalan nama suara.

Python

import os
import requests

# Jika tidak ditetapkan sebagai variabel lingkungan, ganti dengan Kunci API Anda: api_key = "sk-xxx"
api_key = os.environ.get('DASHSCOPE_API_KEY')

# Qwen-Audio-Realtime hanya tersedia di wilayah Beijing.
# Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya (gunakan Kunci API wilayah Beijing).
url = 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization'

response = requests.post(
    url,
    headers={
        'Authorization': f'Bearer {api_key}',
        'Content-Type': 'application/json'
    },
    json={
        'model': 'voice-enrollment',
        'input': {
            'action': 'create_voice',
            'target_model': 'qwen-audio-3.0-realtime-plus',
            'prefix': 'myvoice',
            'url': 'https://your-audio-url.wav'
        }
    }
)
result = response.json()
print('voice_id:', result['output']['voice_id'])

cURL

Kloning suara Qwen-Audio-Realtime hanya tersedia di wilayah Beijing. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya, dan gunakan Kunci API wilayah Beijing.

curl -X POST 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "create_voice",
        "target_model": "qwen-audio-3.0-realtime-plus",
        "prefix": "myvoice",
        "url": "https://your-audio-url.wav"
    }
}'
Langkah 2: Gunakan suara hasil kloning dalam sesi dialog real-time

Masukkan voice_id yang dikembalikan pada langkah sebelumnya ke parameter voice dalam event session.update. Untuk detailnya, lihat Konfigurasi suara.

{"type":"session.update","session":{"voice":"qwen-audio-3.0-realtime-plus-myvoice-xxxxxx"}}

Kloning suara CosyVoice

PentingKloning suara CosyVoice tersedia di wilayah Beijing (seri v3.5/v3/v2 ) dan wilayah Singapura (cosyvoice-v3-plus).

Di wilayah Singapura, cosyvoice-v3-flash saat ini tidak mendukung sintesis suara dengan suara hasil kloning. Untuk menggunakan suara hasil kloning di wilayah Singapura, gunakan qwen-audio-3.0-tts-flash sebagai gantinya.

Langkah 1: Buat suara

Panggil API kloning suara untuk mengunggah audio dan membuat suara. Parameter url menentukan URL file audio yang dapat diakses, dan parameter prefix berfungsi sebagai awalan nama suara.

Konfigurasi berikut untuk wilayah Singapura. Untuk menggunakan model di wilayah China (Beijing), ganti domain dengan https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya.

curl -X POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "create_voice",
        "target_model": "cosyvoice-v3.5-plus",
        "prefix": "myvoice",
        "url": "https://your-audio-url.wav"
    }
}'
Langkah 2: Sintesis suara dengan suara hasil kloning

Gunakan nilai voice_id yang dikembalikan pada langkah sebelumnya dalam permintaan berikut.

# coding=utf-8

import dashscope
from dashscope.audio.tts_v2 import *
import os

# Kunci API untuk wilayah Singapura dan Beijing berbeda. Dapatkan Kunci API Anda: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# Jika variabel lingkungan belum dikonfigurasi, ganti baris berikut dengan Kunci API Studio Model Anda: dashscope.api_key = "sk-xxx"
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')

# Berikut adalah konfigurasi untuk wilayah Singapura. Ganti "{WorkspaceId}" dengan ID ruang kerja Anda yang sebenarnya saat memanggil. Konfigurasi bervariasi berdasarkan wilayah.
dashscope.base_websocket_api_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'

# Kloning suara dan sintesis suara harus menggunakan model yang sama
model = "cosyvoice-v3.5-plus"
# Ganti parameter voice dengan suara kustom yang dihasilkan oleh kloning suara
voice = "voice_id"

# Instansiasi SpeechSynthesizer, meneruskan model, voice, dan parameter permintaan lainnya dalam konstruktor
synthesizer = SpeechSynthesizer(model=model, voice=voice)
# Kirim teks untuk sintesis dan dapatkan audio biner
audio = synthesizer.call("What's the weather like today?")
# Pengiriman teks pertama memerlukan pembentukan koneksi WebSocket, sehingga latensi paket pertama mencakup waktu penyiapan koneksi
print('[Metric] requestId: {}, first-packet latency: {} ms'.format(
    synthesizer.get_last_request_id(),
    synthesizer.get_first_package_delay()))

# Simpan audio ke file lokal
with open('output.mp3', 'wb') as f:
    f.write(audio)

Kloning suara Qwen-TTS

Contoh berikut menggunakan file audio lokal voice.mp3. Ganti dengan path file Anda yang sebenarnya saat menjalankan kode.

Pentingtarget_model yang ditentukan saat pembuatan suara harus persis sama dengan model yang digunakan untuk sintesis suara. Jika tidak, sintesis akan gagal.

Python

import os
import requests
import base64
import pathlib
import dashscope

# ======= Constants =======
DEFAULT_TARGET_MODEL = "qwen3-tts-vc-2026-01-22"  # Kloning suara dan sintesis suara harus menggunakan model yang sama
DEFAULT_PREFERRED_NAME = "guanyu"
DEFAULT_AUDIO_MIME_TYPE = "audio/mpeg"
VOICE_FILE_PATH = "voice.mp3"  # Path relatif ke file audio lokal yang digunakan untuk kloning suara

def create_voice(file_path: str,
                 target_model: str = DEFAULT_TARGET_MODEL,
                 preferred_name: str = DEFAULT_PREFERRED_NAME,
                 audio_mime_type: str = DEFAULT_AUDIO_MIME_TYPE) -> str:
    """
    Buat suara dan kembalikan parameter voice
    """
    # Kunci API untuk wilayah Singapura dan Beijing berbeda. Dapatkan Kunci API Anda: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
    # Jika variabel lingkungan belum dikonfigurasi, ganti baris berikut dengan Kunci API Studio Model Anda: api_key = "sk-xxx"
    api_key = os.getenv("DASHSCOPE_API_KEY")

    file_path_obj = pathlib.Path(file_path)
    if not file_path_obj.exists():
        raise FileNotFoundError(f"File audio tidak ditemukan: {file_path}")

    base64_str = base64.b64encode(file_path_obj.read_bytes()).decode()
    data_uri = f"data:{audio_mime_type};base64,{base64_str}"

    # Berikut adalah konfigurasi untuk wilayah Singapura.
    url = "https://dashscope-intl.aliyuncs.com/api/v1/services/audio/tts/customization"
    payload = {
        "model": "qwen-voice-enrollment", # Jangan ubah nilai ini
        "input": {
            "action": "create",
            "target_model": target_model,
            "preferred_name": preferred_name,
            "audio": {"data": data_uri}
        }
    }
    headers = {
        "Authorization": f"Bearer {api_key}",
        "Content-Type": "application/json"
    }

    resp = requests.post(url, json=payload, headers=headers)
    if resp.status_code != 200:
        raise RuntimeError(f"Gagal membuat suara: {resp.status_code}, {resp.text}")

    try:
        return resp.json()["output"]["voice"]
    except (KeyError, ValueError) as e:
        raise RuntimeError(f"Gagal mengurai respons suara: {e}")

if __name__ == '__main__':
    # Berikut adalah konfigurasi untuk wilayah Singapura.
    dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'

    text = "What's the weather like today?"
    response = dashscope.MultiModalConversation.call(
        model=DEFAULT_TARGET_MODEL,
        api_key=os.getenv("DASHSCOPE_API_KEY"),
        text=text,
        voice=create_voice(VOICE_FILE_PATH), # Ganti parameter voice dengan suara kustom yang dihasilkan oleh kloning suara
        stream=False
    )
    print(response)

cURL

Langkah 1: Buat suara

Ganti data dengan path file audio yang sebenarnya.

Konfigurasi berikut untuk wilayah Singapura.

curl -X POST 'https://dashscope-intl.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "create",
        "target_model": "qwen3-tts-vc-2026-01-22",
        "preferred_name": "guanyu",
        "audio": {
            "data": "https://xxx.wav"
        }
    }
}'
Langkah 2: Sintesis suara dengan suara hasil kloning

Ganti YOUR_VOICE_ID dengan nilai voice yang dikembalikan pada langkah sebelumnya.

Konfigurasi berikut untuk wilayah Singapura.

curl -X POST 'https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
    "model": "qwen3-tts-vc-2026-01-22",
    "input": {
        "text": "What's the weather like today?",
        "voice": "YOUR_VOICE_ID"
    }
}'

Persyaratan audio

Kualitas audio input secara langsung menentukan hasil kloning. Rangkaian model yang berbeda memiliki persyaratan audio yang berbeda. Siapkan sampel audio Anda sesuai dengan persyaratan model target Anda.

Qwen-Audio-TTS / Qwen-Audio-Realtime

Item

Persyaratan

Format yang didukung

WAV (16-bit), MP3, M4A

Durasi audio

Disarankan 10–20 detik, maksimal 60 detik

Ukuran file

≤ 10 MB

Laju sampel

≥ 16 kHz

Saluran

Mono atau stereo. Untuk audio stereo, hanya saluran pertama yang diproses. Pastikan saluran pertama berisi ucapan yang valid.

Konten

Audio harus berisi minimal 5 detik ucapan jelas dan berkelanjutan (tanpa suara latar). Bagian sisanya hanya boleh berisi jeda singkat (≤ 2 detik). Hindari musik latar, kebisingan ambient, atau suara lain di seluruh rekaman. Gunakan audio yang direkam dengan kecepatan berbicara normal — jangan unggah rekaman lagu atau bernyanyi.

Bahasa yang didukung

Bahasa Tionghoa (Mandarin, Kanton, Chongqing, Timur Laut, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Shanghai, Sichuan, dan dialek Yunnan), Inggris, Jepang, Korea, Rusia, Prancis, Jerman, Portugis, Thailand, Indonesia, Vietnam, Spanyol, Italia, Malaysia, Filipina, dan Arab

CosyVoice

Item

Persyaratan

Format yang didukung

WAV (16-bit), MP3, M4A

Durasi audio

Disarankan 10–20 detik, maksimal 60 detik

Ukuran file

≤ 10 MB

Laju sampel

≥ 16 kHz

Saluran

Mono atau stereo. Untuk audio stereo, hanya saluran pertama yang diproses. Pastikan saluran pertama berisi ucapan yang valid.

Konten

Audio harus berisi minimal 5 detik ucapan jelas dan berkelanjutan (tanpa suara latar). Bagian sisanya hanya boleh berisi jeda singkat (≤ 2 detik). Hindari musik latar, kebisingan ambient, atau suara lain di seluruh rekaman. Gunakan audio yang direkam dengan kecepatan berbicara normal — jangan unggah rekaman lagu atau bernyanyi.

Bahasa yang didukung

Bervariasi berdasarkan model sintesis suara (ditentukan oleh parameter target_model) yang menggerakkan suara:

  • cosyvoice-v3.5-plus, cosyvoice-v3.5-flash: Bahasa Tionghoa (Mandarin, Kanton, Timur Laut, Gansu, Guizhou, Henan, Hubei, Jiangxi, Min Selatan, Ningxia, Shanxi, Shaanxi, Shandong, Shanghai, Sichuan, Tianjin, dan dialek Yunnan), Inggris, Prancis, Jerman, Jepang, Korea, Rusia, Portugis, Thailand, Indonesia, dan Vietnam

  • cosyvoice-v3-plus: Bahasa Tionghoa (Mandarin, Kanton, Timur Laut, Gansu, Guizhou, Henan, Hubei, Jiangxi, Min Selatan, Ningxia, Shanxi, Shaanxi, Shandong, Shanghai, Sichuan, Tianjin, dan dialek Yunnan), Inggris, Prancis, Jerman, Jepang, Korea, dan Rusia

  • cosyvoice-v3-flash: Bahasa Tionghoa (Mandarin, Kanton, Timur Laut, Gansu, Guizhou, Henan, Hubei, Jiangxi, Min Selatan, Ningxia, Shanxi, Shaanxi, Shandong, Shanghai, Sichuan, Tianjin, dan dialek Yunnan), Inggris, Prancis, Jerman, Jepang, Korea, Rusia, Portugis, Thailand, Indonesia, dan Vietnam

  • cosyvoice-v2: Bahasa Tionghoa (Mandarin) dan Inggris

Qwen-TTS

Item

Persyaratan

Format yang didukung

WAV (16-bit), MP3, M4A

Durasi audio

Disarankan 10–20 detik, maksimal 60 detik

Ukuran file

≤ 10 MB

Laju sampel

≥ 24 kHz

Saluran

Mono

Konten

Audio harus berisi minimal 3 detik ucapan jelas dan berkelanjutan (tanpa suara latar). Bagian sisanya hanya boleh berisi jeda singkat (≤ 2 detik). Hindari musik latar, kebisingan ambient, atau suara lain di seluruh rekaman. Gunakan audio yang direkam dengan kecepatan berbicara normal — jangan unggah rekaman lagu atau bernyanyi.

Bahasa yang didukung

Bahasa Tionghoa, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia

CatatanUntuk hasil kloning terbaik, siapkan sampel Anda mengikuti Tips perekaman.

Tips perekaman

Audio input berkualitas tinggi merupakan fondasi untuk mencapai hasil kloning optimal.

Perangkat perekaman

Anda dapat menggunakan smartphone, perekam suara digital, atau perangkat perekaman profesional. Kami merekomendasikan perangkat yang mendukung perekaman laju sampel tinggi (≥ 24 kHz) untuk memenuhi persyaratan audio.

Lingkungan perekaman

Lokasi
  • Rekam di ruang kecil tertutup seluas 10 meter persegi atau kurang.
  • Utamakan ruangan dengan material penyerap suara seperti busa akustik, karpet, atau gorden.
  • Hindari aula terbuka, ruang konferensi, ruang kelas, dan ruang lain dengan gema tinggi.
Kontrol kebisingan
  • Kebisingan eksternal: Tutup pintu dan jendela untuk menghindari gangguan lalu lintas, konstruksi, dan lainnya.
  • Kebisingan internal: Matikan AC, kipas angin, ballast lampu neon, dan peralatan lainnya. Anda dapat merekam suara ambient dengan ponsel dan memutarnya dengan volume tinggi untuk mengidentifikasi sumber kebisingan potensial.
Kontrol gema
  • Gema menyebabkan suara menjadi buram dan mengurangi kejelasan.
  • Kurangi pantulan dari permukaan halus: tutup gorden, buka pintu lemari pakaian, dan letakkan pakaian atau selimut di atas meja dan lemari.
  • Gunakan benda tidak beraturan (seperti rak buku dan furnitur berlapis kain) untuk menciptakan pantulan difus.

Naskah perekaman

  • Tidak ada batasan konten khusus. Kami merekomendasikan agar konten disesuaikan dengan kasus penggunaan target Anda.
  • Hindari frasa pendek (seperti "halo" atau "ya"). Gunakan kalimat lengkap.
  • Pertahankan koherensi semantik dan hindari jeda berulang saat membaca (disarankan minimal 3 detik berkelanjutan tanpa gangguan).
  • Pertahankan kecepatan berbicara yang konsisten sepanjang rekaman. Hindari berbicara terlalu cepat di awal atau akhir, yang dapat menyebabkan tersendat selama sintesis.
  • Sertakan ekspresi emosional yang sesuai (seperti kehangatan, keramahan, atau keseriusan). Hindari membaca secara mekanis.
  • Jangan sertakan konten sensitif (seperti materi politik, pornografi, atau kekerasan). Hal ini akan menyebabkan kloning gagal.

Praktik terbaik

Menggunakan kamar tidur tipikal sebagai contoh, setelah menyelesaikan kontrol kebisingan dan gema:

  1. Pahami naskah terlebih dahulu, tetapkan nada karakter, dan sampaikan secara alami.
  2. Pertahankan jarak sekitar 10 cm dari perangkat perekaman untuk menghindari distorsi plosif atau sinyal lemah.

Manage custom voices

Setelah membuat suara, Anda dapat mengkueri dan mengelola suara yang ada melalui API (didukung oleh Qwen-Audio-TTS, Qwen-Audio-Realtime, Qwen-TTS, dan CosyVoice).

  • Daftar suara: Ambil daftar semua suara kustom di bawah akun saat ini.
  • Dapatkan detail suara (Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice saja): Lihat informasi detail tentang suara tertentu, seperti waktu pembuatan dan model sintesis suara yang di-bind.
  • Hapus suara: Hapus suara kustom yang tidak lagi diperlukan untuk mengosongkan kuota.

PentingAPI kueri dan hapus suara untuk Qwen-Audio-Realtime identik dengan API untuk Qwen-Audio-TTS.

Untuk detail endpoint dan parameter API untuk setiap model, lihat Referensi API.

Kuota dan penagihan

Kuota suara dan pembersihan otomatis

  • Batas suara: Setiap akun Alibaba Cloud Model Studio dapat membuat hingga 1.000 suara kustom untuk Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice dan hingga 1.000 untuk Qwen-TTS (kedua kuota dihitung secara independen). Setelah mencapai batas, permintaan pembuatan baru akan gagal dan mengembalikan error. Sistem tidak secara otomatis menghapus suara yang dibuat paling awal. Untuk membuat suara baru, hapus suara yang tidak diperlukan untuk mengosongkan kuota, atau tunggu suara yang tidak digunakan secara otomatis dibersihkan (lihat aturan pembersihan otomatis di bawah).
  • Perilaku setelah mencapai batas: Setelah mencapai batas 1.000 suara, panggilan berikutnya ke API pembuatan suara akan mengembalikan error kegagalan. Sistem tidak secara otomatis menghapus suara yang dibuat paling awal untuk memberi ruang. Anda harus secara manual menghapus suara yang tidak diperlukan untuk mengosongkan kuota sebelum dapat terus membuat suara.
  • Aturan pembersihan otomatis: Jika suara tidak digunakan untuk permintaan sintesis suara apa pun dalam satu tahun terakhir, sistem akan secara otomatis menghapusnya.

Aturan penagihan

  • Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice: Pembuatan suara gratis.

  • Qwen-TTS: Ditagih sebesar $0,01/suara. Pembuatan yang gagal tidak ditagih.

    Kuota gratis (hanya tersedia di wilayah Singapura):

    • Dalam 90 hari setelah mengaktifkan Alibaba Cloud Model Studio, Anda dapat membuat hingga 1.000 suara secara gratis.
    • Pembuatan yang gagal tidak mengurangi kuota gratis.
    • Menghapus suara tidak mengembalikan kuota gratis.
    • Setelah kuota gratis habis atau periode 90 hari berakhir, pembuatan suara ditagih sebesar $0,01/suara.

Model dan wilayah yang didukung

Singapura

Untuk memanggil model berikut, gunakan Kunci API untuk wilayah Singapura:

  • Qwen-Audio-TTS: qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash

  • CosyVoice: cosyvoice-v3-plus (cosyvoice-v3-flash saat ini tidak mendukung sintesis suara dengan suara hasil kloning di wilayah Singapura. Gunakan qwen-audio-3.0-tts-flash sebagai gantinya.)

  • Qwen-TTS:

    • Qwen3-TTS-VC-Realtime: qwen3-tts-vc-realtime-2026-01-15 (snapshot terbaru), qwen3-tts-vc-realtime-2025-11-27 (snapshot)
    • Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot terbaru)

China (Beijing)

Untuk memanggil model berikut, gunakan Kunci API untuk wilayah Beijing:

  • Qwen-Audio-TTS: qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash

  • Qwen-Audio-Realtime: qwen-audio-3.0-realtime-plus, qwen-audio-3.0-realtime-flash

  • CosyVoice: cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-plus, cosyvoice-v3-flash, cosyvoice-v2

  • Qwen-TTS:

    • Qwen3-TTS-VC-Realtime: qwen3-tts-vc-realtime-2026-01-15 (snapshot terbaru), qwen3-tts-vc-realtime-2025-11-27 (snapshot)
    • Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot terbaru)

Referensi API

Referensi API kloning suara

FAQ

T: Dapatkah saya menggunakan suara yang telah dibuat dengan model sintesis suara yang berbeda?

Tidak. Suara di-bind ke model sintesis suara tertentu melalui parameter target_model saat pembuatan dan tidak dapat digunakan lintas model. Jika Anda perlu menggunakan suara dari audio yang sama dengan beberapa model, buat suara terpisah untuk setiap model.

T: Berapa lama masa berlaku suara hasil kloning?

Suara yang dibuat oleh Qwen-Audio-TTS, Qwen-Audio-Realtime, Qwen-TTS, dan CosyVoice berlaku tanpa batas waktu secara default. Jika suara tidak digunakan untuk permintaan sintesis suara apa pun dalam satu tahun terakhir, sistem akan secara otomatis menghapusnya. Untuk detailnya, lihat Kuota suara dan pembersihan otomatis. Kami merekomendasikan untuk menyimpan ID suara. Anda dapat menggunakan API kueri untuk memeriksa apakah suara masih tersedia.

T: Apakah kualitas audio yang buruk memengaruhi hasil kloning?

Ya. Kualitas audio input secara langsung memengaruhi hasil kloning. Kebisingan latar, gema, dan banyak suara sekaligus mengurangi kemiripan dan kealamian suara hasil kloning. Kami merekomendasikan untuk menyiapkan sampel Anda mengikuti Persyaratan audio dan Tips perekaman.