Le clonage de voix requiert seulement un échantillon audio de 10 à 20 secondes pour générer une voix personnalisée très ressemblante, sans entraînement de modèle.
Présentation
Le clonage de voix est conçu pour des scénarios tels que les assistants vocaux personnalisés, les diffusions exclusives à une marque et la création de contenus audio sur mesure.
Alibaba Cloud Model Studio offre des fonctionnalités de clonage de voix via les séries de modèles suivantes :
- Qwen-Audio-TTS / CosyVoice : Créez des voix via le SDK DashScope ou l'API HTTP. Prend en charge la synthèse vocale en temps réel . Disponible dans les régions de Pékin et Singapour.
- Qwen-Audio-Realtime : Qwen-Audio-Realtime est un modèle de dialogue vocal en temps réel (et non un modèle de synthèse vocale). Le clonage de voix permet de personnaliser la voix TTS utilisée pour les réponses du modèle de dialogue. Créez des voix via le SDK DashScope ou l'API HTTP. Disponible uniquement dans la région China (Beijing).
- Qwen-TTS : Créez des voix via l'API HTTP. Prend en charge la synthèse vocale en temps réel et hors temps réel. Disponible dans les régions de Pékin et Singapour.
Pour des comparaisons détaillées et des recommandations de sélection de modèles, consultez Synthèse vocale.
Prérequis
- Configurez une clé API et définissez-la comme variable d'environnement.
- Si vous appelez l'API via le SDK DashScope, installez la dernière version du SDK.
- Préparez un fichier audio : L'audio doit respecter les Exigences audio.
Démarrage rapide
Le clonage de voix comprend trois étapes :
- Préparation de l'audio : Préparez un fichier audio conforme aux Exigences audio.
- Création d'une voix : Appelez l'API de clonage de voix pour télécharger l'audio et créer une voix. Utilisez le paramètre
target_modelpour spécifier le modèle de synthèse vocale à associer. - Synthèse vocale avec la voix clonée : Appelez l'API de synthèse vocale en utilisant l'ID de voix retourné à l'étape précédente.
Clonage de voix Qwen-Audio-TTS
ImportantLe clonage de voix Qwen-Audio-TTS est disponible dans les régions de Pékin et Singapour.
Appelez l'API de clonage de voix pour télécharger l'audio et créer une voix. Le paramètre url indique l'URL accessible du fichier audio, tandis que le paramètre prefix sert de préfixe au nom de la voix.
La configuration suivante concerne la région de Singapour. Pour utiliser un modèle dans la région China (Beijing), remplacez le domaine par https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Remplacez {WorkspaceId} par votre véritable ID d'espace de travail.
curl -X POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "voice-enrollment",
"input": {
"action": "create_voice",
"target_model": "qwen-audio-3.0-tts-flash",
"prefix": "myvoice",
"url": "https://your-audio-url.wav"
}
}'
Étape 2 : Synthèse vocale avec la voix clonée
Utilisez la valeur voice_id retournée à l'étape précédente dans la requête suivante.
# coding=utf-8
import dashscope
from dashscope.audio.tts_v2 import *
import os
# The API Keys for Singapore and Beijing regions are different. Get your API Key: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# If the environment variable is not configured, replace the following line with your Model Studio API Key: dashscope.api_key = "sk-xxx"
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
# The following is the configuration for the Singapore region. Replace "{WorkspaceId}" with your actual workspace ID when calling. The configuration varies by region.
dashscope.base_websocket_api_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'
# Voice cloning and speech synthesis must use the same model
model = "qwen-audio-3.0-tts-flash"
# Replace the voice parameter with the custom voice generated by voice cloning
voice = "voice_id"
# Instantiate SpeechSynthesizer, passing the model, voice, and other request parameters in the constructor
synthesizer = SpeechSynthesizer(model=model, voice=voice)
# Send text for synthesis and get binary audio
audio = synthesizer.call("What's the weather like today?")
# The first text submission requires establishing a WebSocket connection, so the first-packet latency includes the connection setup time
print('[Metric] requestId: {}, first-packet latency: {} ms'.format(
synthesizer.get_last_request_id(),
synthesizer.get_first_package_delay()))
# Save audio to a local file
with open('output.mp3', 'wb') as f:
f.write(audio)
Clonage de voix Qwen-Audio-Realtime
ImportantLe clonage de voix Qwen-Audio-Realtime est disponible uniquement dans la région China (Beijing). Les exigences audio sont identiques à celles de Qwen-Audio-TTS.
Utilisez le SDK DashScope ou l'API HTTP pour appeler l'API de clonage de voix, télécharger l'audio et créer une voix. Le paramètre target_model spécifie le nom du modèle de dialogue en temps réel, et le paramètre prefix sert de préfixe au nom de la voix.
Python
import os
import requests
# If not set as an environment variable, replace with your API Key: api_key = "sk-xxx"
api_key = os.environ.get('DASHSCOPE_API_KEY')
# Qwen-Audio-Realtime is available in the Beijing region only.
# Replace {WorkspaceId} with your actual Workspace ID (use a Beijing region API key).
url = 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization'
response = requests.post(
url,
headers={
'Authorization': f'Bearer {api_key}',
'Content-Type': 'application/json'
},
json={
'model': 'voice-enrollment',
'input': {
'action': 'create_voice',
'target_model': 'qwen-audio-3.0-realtime-plus',
'prefix': 'myvoice',
'url': 'https://your-audio-url.wav'
}
}
)
result = response.json()
print('voice_id:', result['output']['voice_id'])
cURL
Le clonage de voix Qwen-Audio-Realtime est disponible uniquement dans la région de Pékin. Remplacez {WorkspaceId} par votre véritable ID d'espace de travail et utilisez une clé API de la région de Pékin.
curl -X POST 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "voice-enrollment",
"input": {
"action": "create_voice",
"target_model": "qwen-audio-3.0-realtime-plus",
"prefix": "myvoice",
"url": "https://your-audio-url.wav"
}
}'
Transmettez la valeur voice_id retournée à l'étape précédente au paramètre voice dans l'événement session.update. Pour plus de détails, consultez Configuration de la voix.
{"type":"session.update","session":{"voice":"qwen-audio-3.0-realtime-plus-myvoice-xxxxxx"}}
Clonage de voix CosyVoice
ImportantLe clonage de voix CosyVoice est disponible dans la région de Pékin (séries v3.5/v3/v2 ) et dans la région de Singapour (cosyvoice-v3-plus).
Dans la région de Singapour, cosyvoice-v3-flash ne prend pas actuellement en charge la synthèse vocale avec des voix clonées. Pour utiliser une voix clonée dans cette région, optez plutôt pour qwen-audio-3.0-tts-flash.
Appelez l'API de clonage de voix pour télécharger l'audio et créer une voix. Le paramètre url indique l'URL accessible du fichier audio, tandis que le paramètre prefix sert de préfixe au nom de la voix.
La configuration suivante concerne la région de Singapour. Pour utiliser un modèle dans la région China (Beijing), remplacez le domaine par https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Remplacez {WorkspaceId} par votre véritable ID d'espace de travail.
curl -X POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "voice-enrollment",
"input": {
"action": "create_voice",
"target_model": "cosyvoice-v3.5-plus",
"prefix": "myvoice",
"url": "https://your-audio-url.wav"
}
}'
Étape 2 : Synthèse vocale avec la voix clonée
Utilisez la valeur voice_id retournée à l'étape précédente dans la requête suivante.
# coding=utf-8
import dashscope
from dashscope.audio.tts_v2 import *
import os
# The API Keys for Singapore and Beijing regions are different. Get your API Key: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# If the environment variable is not configured, replace the following line with your Model Studio API Key: dashscope.api_key = "sk-xxx"
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
# The following is the configuration for the Singapore region. Replace "{WorkspaceId}" with your actual workspace ID when calling. The configuration varies by region.
dashscope.base_websocket_api_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'
# Voice cloning and speech synthesis must use the same model
model = "cosyvoice-v3.5-plus"
# Replace the voice parameter with the custom voice generated by voice cloning
voice = "voice_id"
# Instantiate SpeechSynthesizer, passing the model, voice, and other request parameters in the constructor
synthesizer = SpeechSynthesizer(model=model, voice=voice)
# Send text for synthesis and get binary audio
audio = synthesizer.call("What's the weather like today?")
# The first text submission requires establishing a WebSocket connection, so the first-packet latency includes the connection setup time
print('[Metric] requestId: {}, first-packet latency: {} ms'.format(
synthesizer.get_last_request_id(),
synthesizer.get_first_package_delay()))
# Save audio to a local file
with open('output.mp3', 'wb') as f:
f.write(audio)
Clonage de voix Qwen-TTS
Les exemples suivants utilisent un fichier audio local nommé voice.mp3. Remplacez-le par le chemin réel de votre fichier lors de l'exécution du code.
ImportantLe paramètre target_model défini lors de la création de la voix doit correspondre exactement au modèle utilisé pour la synthèse vocale. Dans le cas contraire, la synthèse échouera.
Python
import os
import requests
import base64
import pathlib
import dashscope
# ======= Constants =======
DEFAULT_TARGET_MODEL = "qwen3-tts-vc-2026-01-22" # Voice cloning and speech synthesis must use the same model
DEFAULT_PREFERRED_NAME = "guanyu"
DEFAULT_AUDIO_MIME_TYPE = "audio/mpeg"
VOICE_FILE_PATH = "voice.mp3" # Relative path to the local audio file used for voice cloning
def create_voice(file_path: str,
target_model: str = DEFAULT_TARGET_MODEL,
preferred_name: str = DEFAULT_PREFERRED_NAME,
audio_mime_type: str = DEFAULT_AUDIO_MIME_TYPE) -> str:
"""
Create a voice and return the voice parameter
"""
# The API Keys for Singapore and Beijing regions are different. Get your API Key: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# If the environment variable is not configured, replace the following line with your Model Studio API Key: api_key = "sk-xxx"
api_key = os.getenv("DASHSCOPE_API_KEY")
file_path_obj = pathlib.Path(file_path)
if not file_path_obj.exists():
raise FileNotFoundError(f"Audio file not found: {file_path}")
base64_str = base64.b64encode(file_path_obj.read_bytes()).decode()
data_uri = f"data:{audio_mime_type};base64,{base64_str}"
# The following is the configuration for the Singapore region.
url = "https://dashscope-intl.aliyuncs.com/api/v1/services/audio/tts/customization"
payload = {
"model": "qwen-voice-enrollment", # Do not modify this value
"input": {
"action": "create",
"target_model": target_model,
"preferred_name": preferred_name,
"audio": {"data": data_uri}
}
}
headers = {
"Authorization": f"Bearer {api_key}",
"Content-Type": "application/json"
}
resp = requests.post(url, json=payload, headers=headers)
if resp.status_code != 200:
raise RuntimeError(f"Failed to create voice: {resp.status_code}, {resp.text}")
try:
return resp.json()["output"]["voice"]
except (KeyError, ValueError) as e:
raise RuntimeError(f"Failed to parse voice response: {e}")
if __name__ == '__main__':
# The following is the configuration for the Singapore region.
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
text = "What's the weather like today?"
response = dashscope.MultiModalConversation.call(
model=DEFAULT_TARGET_MODEL,
api_key=os.getenv("DASHSCOPE_API_KEY"),
text=text,
voice=create_voice(VOICE_FILE_PATH), # Replace the voice parameter with the custom voice generated by voice cloning
stream=False
)
print(response)
cURL
Étape 1 : Création d'une voixRemplacez data par le chemin réel du fichier audio.
La configuration suivante concerne la région de Singapour.
curl -X POST 'https://dashscope-intl.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "qwen-voice-enrollment",
"input": {
"action": "create",
"target_model": "qwen3-tts-vc-2026-01-22",
"preferred_name": "guanyu",
"audio": {
"data": "https://xxx.wav"
}
}
}'
Étape 2 : Synthèse vocale avec la voix clonéeRemplacez YOUR_VOICE_ID par la valeur voice retournée à l'étape précédente.
La configuration suivante concerne la région de Singapour.
curl -X POST 'https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "qwen3-tts-vc-2026-01-22",
"input": {
"text": "What's the weather like today?",
"voice": "YOUR_VOICE_ID"
}
}'
Exigences audio
La qualité de l'audio d'entrée détermine directement le résultat du clonage. Chaque série de modèles impose ses propres exigences audio. Préparez votre échantillon audio conformément aux spécifications de votre modèle cible.
Qwen-Audio-TTS / Qwen-Audio-Realtime
Élément | Exigence |
|---|---|
Formats pris en charge | WAV (16 bits), MP3, M4A |
Durée audio | 10 à 20 secondes recommandées, 60 secondes maximum |
Taille du fichier | ≤ 10 Mo |
Taux d'échantillonnage | ≥ 16 kHz |
Canaux | Mono ou stéréo. Pour l'audio stéréo, seul le premier canal est traité. Assurez-vous que ce premier canal contient une parole valide. |
Contenu | L'audio doit contenir au moins 5 secondes de parole continue et claire (sans bruit de fond). Le reste de l'enregistrement ne peut comporter que de brèves pauses (≤ 2 secondes). Évitez toute musique de fond, bruit ambiant ou autre voix. Utilisez un enregistrement réalisé à une vitesse de parole normale ; ne téléchargez pas de chansons ou d'enregistrements chantés. |
Langues prises en charge | Chinois (mandarin, cantonais, dialectes de Chongqing, du Nord-Est, du Gansu, du Guizhou, du Zhejiang, du Hebei, du Henan, du Hubei, du Hunan, du Jiangxi, de Ningbo, du Ningxia, de Qingdao, du Shaanxi, du Shanxi, du Shandong, de Shanghai, du Sichuan et du Yunnan), anglais, japonais, coréen, russe, français, allemand, portugais, thaï, indonésien, vietnamien, espagnol, italien, malais, filipino et arabe |
CosyVoice
| Élément | Exigence |
|---|---|
| Formats pris en charge | WAV (16 bits), MP3, M4A |
| Durée audio | 10 à 20 secondes recommandées, 60 secondes maximum |
| Taille du fichier | ≤ 10 Mo |
| Taux d'échantillonnage | ≥ 16 kHz |
| Canaux | Mono ou stéréo. Pour l'audio stéréo, seul le premier canal est traité. Assurez-vous que ce premier canal contient une parole valide. |
| Contenu | L'audio doit contenir au moins 5 secondes de parole continue et claire (sans bruit de fond). Le reste de l'enregistrement ne peut comporter que de brèves pauses (≤ 2 secondes). Évitez toute musique de fond, bruit ambiant ou autre voix. Utilisez un enregistrement réalisé à une vitesse de parole normale ; ne téléchargez pas de chansons ou d'enregistrements chantés. |
| Langues prises en charge | Varie selon le modèle de synthèse vocale (spécifié par le paramètre
|
Qwen-TTS
Élément | Exigence |
|---|---|
Formats pris en charge | WAV (16 bits), MP3, M4A |
Durée audio | 10 à 20 secondes recommandées, 60 secondes maximum |
Taille du fichier | ≤ 10 Mo |
Taux d'échantillonnage | ≥ 24 kHz |
Canaux | Mono |
Contenu | L'audio doit contenir au moins 3 secondes de parole continue et claire (sans bruit de fond). Le reste de l'enregistrement ne peut comporter que de brèves pauses (≤ 2 secondes). Évitez toute musique de fond, bruit ambiant ou autre voix. Utilisez un enregistrement réalisé à une vitesse de parole normale ; ne téléchargez pas de chansons ou d'enregistrements chantés. |
Langues prises en charge | Chinois, anglais, allemand, italien, portugais, espagnol, japonais, coréen, français et russe |
RemarquePour obtenir les meilleurs résultats de clonage, préparez votre échantillon en suivant les Conseils d'enregistrement.
Conseils d'enregistrement
Un audio d'entrée de haute qualité constitue la base indispensable pour obtenir des résultats de clonage optimaux.
Matériel d'enregistrement
Vous pouvez utiliser un smartphone, un dictaphone numérique ou un équipement d'enregistrement professionnel. Nous recommandons un appareil prenant en charge un taux d'échantillonnage élevé (≥ 24 kHz) afin de répondre aux exigences audio.
Environnement d'enregistrement
Lieu- Enregistrez dans un petit espace clos de 10 mètres carrés ou moins.
- Privilégiez les pièces dotées de matériaux absorbants tels que de la mousse acoustique, des tapis ou des rideaux.
- Évitez les halls ouverts, les salles de conférence, les salles de classe et autres espaces très réverbérants.
- Bruit extérieur : Fermez les portes et les fenêtres pour éviter les nuisances liées à la circulation, aux travaux ou à d'autres perturbations.
- Bruit intérieur : Éteignez les climatiseurs, ventilateurs, ballasts de lampes fluorescentes et autres appareils. Vous pouvez enregistrer le son ambiant avec votre téléphone et le réécouter à volume élevé pour identifier les sources potentielles de bruit.
- La réverbération rend le son flou et réduit sa clarté.
- Réduisez les réflexions sur les surfaces lisses : fermez les rideaux, ouvrez les portes des armoires et drapez des vêtements ou des couvertures sur les tables et les meubles.
- Utilisez des objets aux formes irrégulières (comme des bibliothèques et des meubles rembourrés) pour créer des réflexions diffuses.
Texte à lire
- Il n'y a aucune restriction spécifique concernant le contenu. Nous vous recommandons d'adapter le texte à votre cas d'utilisation cible.
- Évitez les phrases courtes (comme « bonjour » ou « oui »). Privilégiez des phrases complètes.
- Maintenez une cohérence sémantique et évitez les pauses fréquentes pendant la lecture (il est recommandé de parler en continu pendant au moins 3 secondes sans interruption).
- Gardez une vitesse de parole constante tout au long de l'enregistrement. Évitez de parler trop vite au début ou à la fin, ce qui pourrait provoquer des bégaiements lors de la synthèse.
- Adoptez une expression émotionnelle appropriée (chaleur, convivialité ou sérieux, par exemple). Évitez une lecture mécanique.
- N'incluez aucun contenu sensible (politique, pornographique ou violent). Cela entraînerait l'échec du clonage.
Bonnes pratiques
En prenant l'exemple d'une chambre typique, après avoir appliqué les mesures de contrôle du bruit et de la réverbération :
- Familiarisez-vous au préalable avec le texte, définissez le ton du personnage et exprimez-vous naturellement.
- Maintenez une distance d'environ 10 cm par rapport au dispositif d'enregistrement afin d'éviter toute distorsion due aux plosives ou un signal trop faible.
Gestion des voix personnalisées
Après avoir créé une voix, vous pouvez interroger et gérer les voix existantes via l'API (prise en charge par Qwen-Audio-TTS, Qwen-Audio-Realtime, Qwen-TTS et CosyVoice).
- Lister les voix : Récupérez la liste de toutes les voix personnalisées associées au compte actuel.
- Obtenir les détails d'une voix (Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice uniquement) : Consultez les informations détaillées d'une voix spécifique, telles que la date de création et le modèle de synthèse vocale associé.
- Supprimer une voix : Supprimez les voix personnalisées devenues inutiles afin de libérer du quota.
ImportantLes API d'interrogation et de suppression de voix pour Qwen-Audio-Realtime sont identiques à celles de Qwen-Audio-TTS.
Pour plus de détails sur les endpoints d'API et les paramètres de chaque modèle, consultez Référence API.
Quota et facturation
Quota de voix et nettoyage automatique
- Limite de voix : Chaque compte Alibaba Cloud Model Studio peut créer jusqu'à 1 000 voix personnalisées pour Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice et jusqu'à 1 000 pour Qwen-TTS (ces deux quotas sont calculés indépendamment). Une fois cette limite atteinte, les nouvelles demandes de création échoueront et renverront une erreur. Le système ne supprime pas automatiquement les voix créées en premier. Pour créer de nouvelles voix, supprimez celles dont vous n'avez plus besoin afin de libérer du quota, ou attendez que les voix inutilisées soient nettoyées automatiquement (voir les règles de nettoyage automatique ci-dessous).
- Comportement après atteinte de la limite : Une fois la limite de 1 000 voix atteinte, les appels ultérieurs à l'API de création de voix renverront une erreur d'échec. Le système n'évince pas automatiquement les voix les plus anciennes pour libérer de l'espace. Vous devez supprimer manuellement les voix inutiles pour libérer du quota avant de pouvoir continuer à en créer.
- Règle de nettoyage automatique : Si une voix n'a été utilisée pour aucune demande de synthèse vocale au cours de l'année écoulée, le système la supprime automatiquement.
Règles de facturation
-
Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice : La création de voix est gratuite.
-
Qwen-TTS : Facturé à 0,01 USD/voix. Les créations ayant échoué ne sont pas facturées.
Quota gratuit (disponible uniquement dans la région de Singapour) :
- Dans les 90 jours suivant l'activation d'Alibaba Cloud Model Studio, vous pouvez créer jusqu'à 1 000 voix gratuitement.
- Les créations ayant échoué ne sont pas décomptées du quota gratuit.
- La suppression d'une voix ne restaure pas le quota gratuit.
- Une fois le quota gratuit épuisé ou la période de 90 jours expirée, la création de voix est facturée à 0,01 USD/voix.
Modèles et régions pris en charge
Singapore
Pour appeler les modèles suivants, utilisez une clé API de la région de Singapour :
-
Qwen-Audio-TTS : qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash
-
CosyVoice : cosyvoice-v3-plus (
cosyvoice-v3-flashne prend pas actuellement en charge la synthèse vocale avec des voix clonées dans la région de Singapour. Utilisez plutôtqwen-audio-3.0-tts-flash.) -
Qwen-TTS :
- Qwen3-TTS-VC-Realtime : qwen3-tts-vc-realtime-2026-01-15 (dernier snapshot), qwen3-tts-vc-realtime-2025-11-27 (snapshot)
- Qwen3-TTS-VC : qwen3-tts-vc-2026-01-22 (dernier snapshot)
China (Beijing)
Pour appeler les modèles suivants, utilisez une clé API de la région de Pékin :
-
Qwen-Audio-TTS : qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash
-
Qwen-Audio-Realtime : qwen-audio-3.0-realtime-plus, qwen-audio-3.0-realtime-flash
-
CosyVoice : cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-plus, cosyvoice-v3-flash, cosyvoice-v2
-
Qwen-TTS :
- Qwen3-TTS-VC-Realtime : qwen3-tts-vc-realtime-2026-01-15 (dernier snapshot), qwen3-tts-vc-realtime-2025-11-27 (snapshot)
- Qwen3-TTS-VC : qwen3-tts-vc-2026-01-22 (dernier snapshot)
Référence API
Référence de l'API de clonage de voix
FAQ
Q : Puis-je utiliser une voix créée avec différents modèles de synthèse vocale ?
Non. Une voix est liée à un modèle de synthèse vocale spécifique via le paramètre target_model au moment de sa création et ne peut pas être utilisée avec d'autres modèles. Si vous souhaitez utiliser la voix issue d'un même audio avec plusieurs modèles, créez une voix distincte pour chacun d'eux.
Q : Quelle est la durée de validité d'une voix clonée ?
Les voix créées par Qwen-Audio-TTS, Qwen-Audio-Realtime, Qwen-TTS et CosyVoice sont valides indéfiniment par défaut. Si une voix n'a été utilisée pour aucune demande de synthèse vocale au cours de l'année écoulée, le système la supprime automatiquement. Pour plus de détails, consultez Quota de voix et nettoyage automatique. Nous vous recommandons de conserver l'ID de la voix. Vous pouvez utiliser l'API d'interrogation pour vérifier si une voix est toujours disponible.
Q : Une mauvaise qualité audio affecte-t-elle les résultats du clonage ?
Oui. La qualité de l'audio d'entrée influence directement le résultat du clonage. Le bruit de fond, la réverbération et la présence de plusieurs voix réduisent la similitude et le naturel de la voix clonée. Nous vous recommandons de préparer votre échantillon en suivant les Exigences audio et les Conseils d'enregistrement.