L'inférence IA de MaxCompute est une nouvelle fonctionnalité prête à l'emploi et facturée au paiement à l'utilisation, qui vous permet d'exploiter des grands modèles pour le traitement des données ou l'inférence hors ligne. Cette rubrique décrit les règles de facturation applicables à l'inférence IA.
Présentation
Le service d'inférence IA de MaxCompute offre des capacités d'inférence de grands modèles. Il permet d'appeler directement des modèles prêts à l'emploi depuis des tâches SQL et MaxFrame via une fonction IA intégrée. La facturation s'effectue au paiement à l'utilisation, en fonction du nombre total de tokens d'entrée et de sortie.
-
Régions prises en charge : Le service d'inférence de modèles n'est disponible que dans les régions suivantes.
Chine continentale : Chine (Pékin), Chine (Shanghai), Chine (Hangzhou), Chine (Shenzhen) et Chine (Ulanqab)
International : Singapour
-
Modèles pris en charge : Pour utiliser les modèles ci-dessous, vous devez d'abord activer le service d'inférence de modèles dans la région cible, par exemple Chine (Pékin).
Modèle
Type
Description
qwen3.8-maxPrend en charge les entrées de données multimodales
Modèle phare Mixture of Experts (MoE) de la série Qwen 3.8, doté de 2,4 billions de paramètres. Il offre des capacités considérablement améliorées en programmation et en productivité bureautique, et peut programmer de manière autonome pendant plus de dix jours pour livrer des projets complets. Ce modèle est idéal pour les scénarios très complexes tels que la programmation autonome, l'automatisation bureautique avancée, la recherche scientifique et les tâches de longue durée.
qwen3.7-maxEntrée texte uniquement
Modèle phare de la série Qwen 3.7, bénéficiant d'améliorations complètes en matière d'inférence, de génération de code et de compréhension multilingue. Il convient aux tâches hautement complexes.
qwen3.7-plusPrend en charge les entrées de données multimodales
Modèle équilibré de la série Qwen 3.7 offrant un bon compromis entre performances et coût. Il est adapté aux scénarios d'entreprise tels que l'analyse de textes longs et les conversations multi-tours.
qwen3.7-flashPrend en charge les entrées de données multimodales
Modèle vision-langage natif, léger et rapide de la série Qwen 3.7. Il dispose de capacités renforcées de compréhension multimodale et d'exécution d'agents, ce qui le rend idéal pour les services en ligne à forte concurrence et faible latence, ainsi que pour les tâches multimodales légères.
qwen3.7-text-embeddingEntrée texte uniquement
Ce modèle vectoriel de texte multilingue unifié, entraîné sur Qwen 3.7, offre des améliorations significatives en matière de recherche de texte, de clustering et de classification par rapport à la version text-embedding-v4.
qwen3-vl-embeddingPrend en charge les entrées de données multimodales
Modèle d'embedding vectoriel multimodal Qwen prenant en charge les représentations vectorielles pour des entrées mixtes image et texte. Il convient aux scénarios de recherche cross-modale et de correspondance image-texte.
text-embedding-v4Entrée texte uniquement
Modèle d'embedding vectoriel de texte haute précision, adapté à la recherche sémantique, au clustering et au calcul de similarité.
qwen3.6-plusPrend en charge les entrées de données multimodales
Modèle équilibré de la série Qwen 3.6 offrant un bon compromis entre performances et coût. Il est adapté aux scénarios métier généraux tels que le dialogue, la synthèse et l'analyse.
qwen3.6-flashPrend en charge les entrées de données multimodales
Modèle léger et rapide de la série Qwen 3.6. Il fournit des réponses rapides à faible coût, ce qui le rend idéal pour les services en ligne à forte concurrence et faible latence.
deepseek-v4-proEntrée texte uniquement
Modèle d'inférence phare de quatrième génération de DeepSeek. Il excelle dans les tâches difficiles telles que les mathématiques, le codage et le raisonnement logique complexe.
deepseek-v4-flashEntrée texte uniquement
Modèle léger de quatrième génération de DeepSeek. Il offre une inférence rapide et un excellent rapport coût-efficacité, ce qui le rend adapté aux conversations quotidiennes et aux tâches d'inférence légères.
qwen3.5-397b-a17bPrend en charge les entrées de données multimodales
Modèle Mixture of Experts (MoE) de la série Qwen 3.5. Il se caractérise par une activation efficace des paramètres, une vaste base de connaissances et des capacités de raisonnement multi-étapes. Ce modèle est conçu pour la déduction logique complexe, la génération de code full-stack et les questions-réponses approfondies basées sur les connaissances.
qwen3.5-omni-plusPrend en charge les entrées de données multimodales
Qwen3.5-Omni est le tout dernier grand modèle omni-modal de Qwen. Il est adapté aux scénarios tels que la création de texte, les assistants vocaux et l'analyse multimédia, offrant une expérience de compréhension et d'interaction multimodale naturelle et fluide.
qwen3-asr-flashPrend en charge les entrées de données multimodales
Modèle léger de reconnaissance vocale de la série Qwen 3. Il assure une transcription en temps réel avec une faible latence et une forte concurrence, ce qui le rend adapté aux scénarios de traitement audio en temps réel tels que la génération de comptes-rendus de réunion, le sous-titrage en direct et la reconnaissance de commandes vocales.
tongyi-embedding-vision-plusPrend en charge les entrées de données multimodales
Tongyi-Embedding-Vision est un modèle de représentation multimodale visuelle construit sur un grand modèle de langage (LLM). Il convient à diverses tâches en aval, notamment la recherche image-image, texte-image, texte-vidéo, vidéo-vidéo, texte-texte et texte-image-et-texte.
qwen3-max(Retrait prochainement)Entrée texte uniquement
Grand modèle de langage haute performance de la série Qwen, adapté à l'inférence complexe et à la génération de contenu.
ImportantLe modèle
qwen3-maxsera bientôt retiré. Pour garantir la continuité du service, migrez vos services associés vers un nouveau modèle dès que possible. Pour plus d'informations, consultez Politique de retrait des modèles.
Les frais de service d'inférence de modèles ne s'appliquent que lorsque vous utilisez les modèles publics listés ci-dessus dans des tâches Présentation de MaxFrame et SQL via une fonction IA. Seules les tâches réussies sont facturées ; les tâches échouées n'engendrent aucun frais.
Règles de facturation
Le service d'inférence de modèle est facturé en fonction de la consommation de tokens. Les critères de facturation comprennent :
La région
Le type de modèle
Le type de token : fait la distinction entre les tokens d'entrée et de sortie, et détermine le niveau tarifaire applicable selon l'utilisation.