Alibaba Cloud Model Studio propose des modèles Qwen et tiers pour le texte, l'image, l'audio et la vidéo.
Génération de texte
Image et vidéo
Compréhension
Extrayez des descriptions textuelles ou des données structurées à partir d'images et de vidéos
Génération
Générez des images et des vidéos à partir de texte ou d'images, avec prise en charge de l'édition, de la référence et de la sortie haute résolution
Audio et parole
Synthèse vocale (Text-to-Speech)
Pour la lecture de livres audio, la diffusion vocale, les avatars virtuels, etc.
Reconnaissance vocale
Approches ASR dédiées et basées sur LLM — choisissez en fonction de la précision et de la flexibilité
Speech-to-speech
Conversation vocale de bout en bout sans appels ASR et TTS séparés
Omni
Intègre les capacités de compréhension et de génération à travers les modalités texte, image, audio et vidéo
Embeddings et reranking
Convertissez du texte ou du contenu multimodal en vecteurs, combiné au reranking pour améliorer la précision de la recherche
Voir tous les modèles
Accédez à Model Plaza pour parcourir tous les modèles Qwen, tiers, spécifiques à un domaine et hérités.