ImportantCe document s'applique uniquement à la région China (Beijing). Pour utiliser le modèle, vous devez disposer d'une clé API associée à la région China (Beijing).
Prétraiter les fichiers vidéo pour améliorer l'efficacité de la transcription (scénarios de reconnaissance audio)
L'API de reconnaissance vocale Paraformer est compatible avec les fichiers vidéo. Toutefois, ces fichiers sont généralement volumineux et leur transfert prend du temps. Prétraitez vos vidéos en extrayant la piste audio nécessaire à la reconnaissance vocale, puis compressez-la afin de réduire considérablement la taille du fichier et d'accroître le débit de transcription. Utilisez ffmpeg pour effectuer ce prétraitement.
Prérequis
Installez ffmpeg depuis ffmpeg.org.
Prétraitement des fichiers vidéo
Servez-vous de ffmpeg pour extraire la première piste audio, la rééchantillonner à 16 kHz et la compresser au format opus.
ffmpeg -i input-video-file -ac 1 -ar 16000 -acodec libopus output-audio-file.opus
Le fichier audio généré sera nettement plus léger que la vidéo d'origine. Envoyez ce fichier audio (via une URL) à l'API de transcription pour obtenir les résultats de la reconnaissance vocale.