Déployez des modèles pré-entraînés de la plateforme ou vos propres modèles affinés pour obtenir un service d'inférence dédié et indépendant. Ce service répond aux exigences métier en matière de concurrence élevée, de faible latence et d'autres critères de performance.
Modes de facturation
Avant le déploiement, consultez le coût horaire estimé des modèles dans la console de déploiement.
RemarqueLe mode de facturation ne peut plus être modifié une fois le service créé. Pour en changer, vous devez d'abord retirer le modèle déployé, puis le redéployer.
Provisioned Throughput (PTU) (Débit élevé et hautes performances) | Model Unit (Métriques de performance personnalisées et isolation des ressources) | Consommation de tokens Paiement à l'usage après fine-tuning ou validation des résultats | |||
|---|---|---|---|---|---|
Définition | Mode de déploiement qui réserve des ressources de la plateforme afin de garantir un débit spécifique en tokens par minute (TPM). Aucune limitation de taux n'est appliquée dans la limite du quota garanti. | Mode de déploiement qui alloue de la puissance de calcul en fonction de la durée d'utilisation et du nombre d'unités de modèle. Les ressources sont dédiées. | Mode de déploiement où la consommation est mesurée selon les tokens d'entrée et de sortie de chaque appel d'API. | ||
Avantages |
|
| Aucun frais en cas de non-utilisation. | ||
Modèles pris en charge | Certains modèles pré-entraînés | Certains modèles pré-entraînés et tous les modèles affinés | Certains modèles affinés avec LoRA | ||
Cas d'usage |
|
| Validation des performances d'un modèle affiné | ||
Schéma de facturation |
|
|
| ||
Mode de facturation | Facturation basée sur la durée d'utilisation et le débit provisionné. Prend en charge le paiement à l'utilisation et l'abonnement journalier. | Facturation basée sur la durée d'utilisation et le nombre d'unités de modèle. Prend en charge le paiement à l'utilisation et l'abonnement mensuel. | Consommation de tokens par modèle Prend en charge le paiement à l'utilisation. | ||
Méthode de mise à l'échelle | Augmentation ou diminution du débit en libre-service | Augmentation ou diminution des Model Units en libre-service | Soumettez une demande dans la console et patientez jusqu'à la validation manuelle. | ||
Contraintes du produit |
| En cas de résiliation anticipée pendant le premier mois d'un achat prépayé, le tarif journalier, environ le tarif mensuel / 30, est multiplié par 1.2. |
| ||
Pour consulter la consommation de tokens et l'historique des appels d'une invocation unique, accédez à Model Monitoring.
Détail de la facturation
Facturation selon la durée d'utilisation (Provisioned Throughput)
Fee = Usage duration × (Input TPM unit price × Input TPM + Output TPM unit price × Output TPM)
Le postpaiement est calculé à l'heure, au tarif de la colonne « Continuous 1 hour » ci-dessous. Le prépaiement est calculé à la journée, au tarif de la colonne « Continuous 1 day ».
- La commande prépayée prend effet dès le paiement. Sa validité de N jours se termine à 23:59 le jour N. Si la commande est passée après 22:00, la date d'expiration est reportée de 1 jour.
- À l'expiration d'une commande prépayée, le service s'arrête après un délai de 2 heures. Les ressources sont conservées pendant 14 heures après l'arrêt, puis libérées.
- Une commande prépayée peut être résiliée par anticipation. La part consommée est recalculée avec un coefficient de 1.2 pour le remboursement. Consultez les règles de remboursement en cas de réduction de configuration.
- En postpaiement, si le compte est en défaut de paiement, les ressources restent disponibles et facturées pendant 24 heures. Ensuite, la facturation cesse, le déploiement passe en état d'impayé et les ressources sont supprimées, mais la tâche de déploiement est conservée. Après règlement, les ressources sont réattribuées et le service reprend, ainsi que la facturation. Pour arrêter les frais, supprimez la tâche de déploiement ; la facturation cesse après sa suppression effective.
Si l'entrée du modèle dépasse la limite de tokens d'entrée, l'appel bascule automatiquement vers le paiement à l'usage du modèle. Si le TPM acheté est dépassé, la stratégie choisie à la création s'applique : « auto-overflow » bascule vers le paiement à l'usage, tandis que « use-only-PTU-capacity » renvoie 429. Les performances peuvent alors diminuer et les limites de trafic public du modèle snapshot dans l'espace de travail s'appliquent. Les frais suivent le tarif des appels de modèle à l'usage.
- Dans ce cas, uniquement avec « auto-overflow », l'en-tête de réponse de l'API contient
x-dashscope-ptu-overflow:true. - Consultez les statistiques TPM dans Model Monitoring.
Pour les réductions de frais et remboursements lors d'une réduction de capacité, consultez les règles de remboursement en cas de réduction de configuration.
RemarqueLe déploiement PTU prend en charge des coefficients de capacité par palier pour les entrées longues et des remises de cache. Consultez Entrées longues et cache avec Provisioned Throughput.
Singapore
Qwen
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $4.8 | $1.44 | $57.6 | $17.28 |
Qwen3.7-Flash-2026-07-15 Contactez votre responsable commercial pour l'activer | qwen3.7-flash-2026-07-15 | 128K | $0.072 | $0.031 | $0.864 | $0.374 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $1.92 | $1.8 | $72 | $21.6 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.96 | $0.384 | $11.52 | $4.608 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $1.2 | $0.72 | $14.4 | $8.64 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.96 | $0.576 | $11.52 | $6.912 |
DeepSeek
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.72 | $0.144 | $8.64 | $1.728 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $1.44 | $0.288 | $17.28 | $3.456 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $0.96 | $1.728 | $103.68 | $20.736 |
Qwen VL
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.48 | $0.384 | $5.76 | $4.608 |
GLM
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $5.04 | $1.584 | $60.48 | $19.008 |
China North 2 (Beijing)
Qwen
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Flash-2026-07-15 Contactez votre responsable commercial pour l'activer | qwen3.7-flash-2026-07-15 | 128K | $0.066 | $0.026 | $0.792 | $0.317 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.66 | $0.264 | $7.92 | $3.168 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $0.67 | $0.066 | $7.93 | $4.753 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.26 | $0.16 | $3.17 | $1.9 |
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | 128K | $1.11 | $0.45 | $13.32 | $5.4 |
Qwen-Flash-2025-07-28 | qwen-flash-2025-07-28 | 128K | $0.06 | $0.06 | $0.72 | $0.72 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | 128K | $0.28 | Sans réflexion : $0.07 Avec réflexion : $0.28 | $3.36 | Sans réflexion : $0.84 Avec réflexion : $3.36 |
DeepSeek
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.5 | $0.099 | $5.94 | $1.188 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $0.99 | $0.198 | $11.88 | $2.376 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $5.94 | $1.188 | $71.3 | $14.26 |
DeepSeek-v3 | deepseek-v3 | 64K | $0.99 | $0.396 | $11.9 | $4.75 |
Qwen VL
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.35 | $0.35 | $4.2 | $4.2 |
GLM
Nom du modèle | Code du modèle | Nombre maximal de tokens d'entrée | Entrée en postpaiement Par 10K TPM et par heure | Sortie en postpaiement Par 1K TPM et par heure | Entrée en prépaiement Par 10K TPM et par jour | Sortie en prépaiement Par 1K TPM et par jour |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $3.96 | $1.386 | $47.53 | $16.635 |
Facturation selon la durée d'utilisation (Model Unit)
Cost = Usage duration (hours) × Number of Model Units × Model Unit unit price
En postpaiement, le tarif d'une Model Unit correspond à la colonne « Hourly unit price » ci-dessous. Pour un abonnement mensuel prépayé, le calcul devient nombre de mois d'abonnement × nombre de Model Units × tarif mensuel.
- En cas de résiliation anticipée pendant le premier mois prépayé, le tarif journalier, environ le tarif mensuel / 30, est multiplié par 1.2. Toute journée entamée est facturée intégralement.
RemarqueLes ressources de calcul Model Unit en postpaiement sont attribuées dans l'ordre des demandes. Si l'achat échoue, un remboursement intégral est effectué.
Singapore
Génération de texte
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 | $88 | $41,832 |
MU2 x 8 | $112 | $52,392 | ||
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU2 x 8 | $112 | $52,392 |
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU2 x 8 | $112 | $52,392 |
Qwen3.5-27B | qwen3.5-27b | MU1 x 2 | $22 | $10,458 |
Qwen3.5-9B | qwen3.5-9b | MU1 x 2 | $22 | $10,458 |
GLM-5.1 | glm-5.1 | MU2 x 8 | $112 | $52,392 |
MU3 x 8 | $216 | $102,696 | ||
DeepSeek-v4-Flash | deepseek-v4-flash | MU2 x 8 | $112 | $52,392 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $44 | $20,916 |
Multimodal
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $112 | $52,392 |
Types de modèles :
- Instruct : après déploiement, l'inférence s'effectue en mode sans réflexion.
China (Beijing)
Génération de texte
Qwen
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
Qwen3.8-27B | qwen3.8-27b | MU9 x 4 | $28.056 | $13,532.096 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3.6-35B-A3B | qwen3.6-35b-a3b | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU8 x 1 | $6.464 | $3,080.477 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.6-27B | qwen3.6-27b | MU9 x 1 | $7.014 | $3,383.024 |
Qwen3.6-Flash-2026-04-16 | qwen3.6-flash-2026-04-16 | MU1 x 2 | $14.852 | $7,183.564 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 MU1 x 16(mode de séparation préremplissage/décodage) | $59.408 Mode de séparation préremplissage/décodage : $118.816 | $28,734.256 Mode de séparation préremplissage/décodage : $57,468.512 |
MU2 x 8 | $69.312 | $33,044.72 | ||
Qwen3.5-397B-A17B | qwen3.5-397b-a17b | MU3 x 8 MU3 x 16(mode de séparation préremplissage/décodage) | $150.72 Mode de séparation préremplissage/décodage : $301.44 | $72,577.152 Mode de séparation préremplissage/décodage : $145,154.304 |
MU6 x 16 | $55.008 | $26,599.92 | ||
Qwen3.5-122B-A10B | qwen3.5-122b-a10b | MU1 x 4 | $29.704 | $14,367.128 |
MU6 x 16 | $55.008 | $26,599.92 | ||
Qwen3.5-35B-A3B | qwen3.5-35b-a3b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.5-27B | qwen3.5-27b | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
MU8 x 1 | $6.464 | $3,080.477 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
Qwen3.5-9B | qwen3.5-9b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 8 | $69.312 | $33,044.72 | ||
Qwen3.5-Flash-2026-02-23 | qwen3.5-flash-2026-02-23 | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3.5-Plus-2026-02-15 | qwen3.5-plus-2026-02-15 | MU1 x 8 MU1 x 16(mode de séparation préremplissage/décodage) | $59.408 Mode de séparation préremplissage/décodage : $118.816 | $28,734.256 Mode de séparation préremplissage/décodage : $57,468.512 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 MU3 x 16(mode de séparation préremplissage/décodage) | $150.72 Mode de séparation préremplissage/décodage : $301.44 | $72,577.152 Mode de séparation préremplissage/décodage : $145,154.304 | ||
Qwen3-235B-A22B-Instruct-2507 | qwen3-235b-a22b-instruct-2507 | MU1 x 4 | $29.704 | $14,367.128 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-32B | qwen3-32b | MU6 x 16 | $55.008 | $26,599.92 |
Qwen3-30B-A3B-Thinking-2507 | qwen3-30b-a3b-thinking-2507 | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3-4B | qwen3-4b | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen3-Embedding-0.6B | qwen3-embedding-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
Qwen3-MoE-Rerank-0.6B | qwen3-moe-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-Rerank-0.6B | qwen3-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-Rerank | qwen3-rerank | MU5 x 1 | $2.888 | $1,394.329 |
Qwen2.5-Open Source-72B | qwen2.5-72b-instruct | MU1 x 8 | $59.408 | $28,734.256 |
Qwen2.5-Open Source-14B | qwen2.5-14b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
Qwen2.5-Open Source-7B | qwen2.5-7b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen-Plus-2025-07-28 | qwen-plus-2025-07-28 | MU1 x 4 MU1 x 16(mode de séparation préremplissage/décodage) | $29.704 Mode de séparation préremplissage/décodage : $118.816 | $14,367.128 Mode de séparation préremplissage/décodage : $57,468.512 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $29.704 | $14,367.128 |
GLM
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
GLM-5.1 | glm-5.1 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 16(mode de séparation préremplissage/décodage) | Mode de séparation préremplissage/décodage : $301.44 | Mode de séparation préremplissage/décodage : $145,154.304 | ||
MU6 x 16 | $55.008 | $26,599.92 | ||
GLM-5 | glm-5 | MU3 x 16(mode de séparation préremplissage/décodage) | Mode de séparation préremplissage/décodage : $301.44 | Mode de séparation préremplissage/décodage : $145,154.304 |
GLM-4.7 | glm-4.7 | MU6 x 32(mode de séparation préremplissage/décodage) | Mode de séparation préremplissage/décodage : $110.016 | Mode de séparation préremplissage/décodage : $53,199.84 |
DeepSeek
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | MU1 x 8 | $59.408 | $28,734.256 |
MU3 x 8 | $150.72 | $72,577.152 | ||
DeepSeek-v3.2 | deepseek-v3.2 | MU2 x 16(mode de séparation préremplissage/décodage) | Mode de séparation préremplissage/décodage : $138.624 | Mode de séparation préremplissage/décodage : $66,089.44 |
Autres modèles
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
Kimi-K2.5 | kimi-k2.5 | MU2 x 8 | $69.312 | $33,044.72 |
Multimodal
Qwen VL
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
Qwen3-VL-235B-A22B-Thinking | qwen3-vl-235b-a22b-thinking | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
Qwen3-VL-4B-Instruct | qwen3-vl-4b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
Qwen3-VL-2B-Instruct | qwen3-vl-2b-instruct | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-VL-Embedding-2B | qwen3-vl-embedding-2b | MU5 x 1 | $2.888 | $1,394.329 |
Qwen3-VL-Flash-2025-10-15 | qwen3-vl-flash-2025-10-15 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen VL-Max-2025-08-13 | qwen-vl-max-2025-08-13 | MU6 x 4 | $13.752 | $6,649.98 |
Qwen Omni
Nom du modèle | Code du modèle | Caractéristiques des Model Units | Tarif horaire ($) Unité minimale de facturation : minute | Tarif mensuel ($) Unité minimale de facturation : jour |
|---|---|---|---|---|
Qwen3.5-Omni-Flash | qwen3.5-omni-flash | MU8 x 1 | $6.464 | $3,080.477 |
MU9 x 1 | $7.014 | $3,383.024 |
Types de modèles :
- Instruct : le modèle effectue l'inférence en mode sans réflexion après déploiement.
- Thinking : le modèle effectue l'inférence en mode de réflexion après déploiement.
Selon les tokens consommés par le modèle
Fee = Model input token count × Model input unit price + Model output token count × Model output unit price (minimum billing unit: 1 token)
- La facturation par tokens est disponible uniquement après un entraînement SFT efficace, c'est-à-dire un fine-tuning LoRA avec plan défini sur lora pour un déploiement par API, sur l'un des modèles de base suivants, aboutissant à un modèle personnalisé.
Singapore
Modèle de base | Code du modèle | Entrée $/million de tokens | Sortie $/million de tokens |
|---|---|---|---|
Qwen3-14B | qwen3-14b | Mode sans réflexion : $0.35 Mode de réflexion : $0.35 | Mode sans réflexion : $1.4 Mode de réflexion : $4.2 |
Beijing
Modèle de base | Code du modèle | Entrée $/million de tokens | Sortie $/million de tokens |
|---|---|---|---|
Qwen3.8-27B | qwen3.8-27b | $0.424 | $1.696 |
Qwen3.5-27B | qwen3.5-27b | <128K $0.086 128K-256K $0.258 | <128K $0.688 128K-256K $2.064 |
Qwen3-32B | qwen3-32b | Mode sans réflexion : $0.287 Mode de réflexion : $0.287 | Mode sans réflexion : $1.147 Mode de réflexion : $2.868 |
Qwen3-14B | qwen3-14b | Mode sans réflexion : $0.144 Mode de réflexion : $0.144 | Mode sans réflexion : $0.574 Mode de réflexion : $1.434 |
Qwen3-8B | qwen3-8b | Mode sans réflexion : $0.072 Mode de réflexion : $0.072 | Mode sans réflexion : $0.287 Mode de réflexion : $0.717 |
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | $0.072 | $0.287 |
Pour déployer des modèles supplémentaires, consultez cette solution et choisissez le plan de déploiement le plus adapté aux besoins de votre entreprise.
Méthodes de déploiement
Pour déployer des modèles dans la console, suivez les étapes ci-dessous :
En cas de permissions insuffisantes, consultez Que faire si un message indique des permissions insuffisantes lors du déploiement ?.
|
|
| |
Des frais sont engagés dès que le modèle est déployé avec succès. |
Configuration du déploiement
Model Unit
Configuration | Détails |
|---|---|
Nom du service | Nom personnalisé du service de déploiement. |
Modèle | Choisissez le modèle à déployer, prédéfini par la plateforme ou affiné par fine-tuning. |
Type de Model Unit | Choisissez les caractéristiques du déploiement, qui déterminent la puissance de calcul et les performances. |
Nombre de réplicas | Définissez le nombre initial de réplicas, qui influe sur la capacité de traitement simultané du service. |
Modèle de déploiement | Choisissez un modèle de déploiement, par exemple « single-node deployment ». Chaque modèle correspond à une configuration de ressources. Ce choix n'est disponible qu'avec la facturation Model Unit. |
Mode d'inférence du modèle | Pour certains modèles déployés en mode Model Unit, vous pouvez configurer le mode d'inférence, le contexte maximal et d'autres paramètres.
|
Contexte maximal | Ce paramètre est pris en charge pour le mode de déploiement Model Unit de certains modèles. La longueur maximale du contexte dépend du type de modèle. |
Limitation du service | Certains modèles déployés en mode Model Unit permettent de limiter les RPM et TPM des appels. |
Liste des déploiements
Une fois le déploiement réussi, vous pouvez consulter et gérer tous les services déployés depuis la page de liste des déploiements. Cette page présente les informations suivantes :
- Nom du service : cliquez sur le nom pour consulter les détails du déploiement.
- Nom du modèle : modèle utilisé pour le déploiement.
- Code du modèle : identifiant unique généré après le déploiement réussi, à utiliser dans les appels API.
- État du déploiement ou de l'événement : en attente, déploiement en cours, en service, échec du déploiement, mise hors ligne, service suspendu, arrêté, suppression, suspension d'abonnement ou pour impayé, reprise, en service avec modification de configuration ou échec de modification, entre autres.
- Mode de facturation : mode de facturation du service actuel.
- Détails du déploiement : configuration, dont le type de Model Unit et le nombre de réplicas.
- Détails des limites : configuration telle que les RPM (requêtes par minute) et TPM (tokens par minute).
- Période de service : dates de création et d'expiration.
- Opérations : selon l'état et la facturation, vous pouvez mettre à jour, surveiller, redimensionner, renouveler, mettre hors ligne, supprimer ou essayer le service.
Appels après déploiement
Après le déploiement réussi d'un modèle, vous pouvez l'appeler via une interface compatible OpenAI, Dashscope ou le SDK Assistant.
Lors de l'appel d'un modèle déployé avec succès, la valeur du paramètre model doit correspondre au code du modèle généré après son déploiement. Accédez à la Model Deployment console pour récupérer le Model Code.
import os
import dashscope
messages = [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
# If you have not configured environment variables, replace the next line with your Bailian API Key: api_key="sk-xxx",
api_key=os.getenv("DASHSCOPE_API_KEY"),
model="qwen3-max-xxx-xxx", # Please replace with the code returned after the model is successfully deployed
messages=messages,
result_format="message",
enable_thinking=False,
)
print(response)
import os
from openai import OpenAI
client = OpenAI(
# If you have not configured environment variables, replace the next line with your Bailian API Key: api_key="sk-xxx",
api_key=os.getenv('DASHSCOPE_API_KEY'),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3-max-xxx-xxx", # Please replace with the code returned after the model is successfully deployed
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
],
extra_body={"enable_thinking": False},
)
print(completion)
Redimensionner un service déployé
- Débit provisionné, facturé à la durée : cliquez sur Scaling pour ajuster manuellement le nombre d'instances. Pour les réductions et remboursements, consultez les règles de remboursement en cas de réduction de configuration.
- Model Unit, facturé à la durée : cliquez sur Scaling pour ajuster manuellement le nombre d'instances.
Il est également possible de cliquer sur le bouton Scaling Configuration dans la colonne Operation pour définir des politiques de mise à l'échelle automatique, comprenant les seuils de déclenchement, le nombre minimal et maximal de réplicas, ainsi que la mise à l'échelle planifiée.
Mettre un service déployé hors ligne
Accédez à la Model Deployment console, recherchez le service de déploiement à arrêter, puis cliquez sur l'action appropriée selon la méthode de facturation :
- Model Unit prépayé : cliquez sur Deactivate et confirmez.
- Postpaiement : cliquez sur Delete et confirmez.
La facturation s'arrête une fois l'opération terminée.
Autres opérations
Outre la désactivation, la colonne Operation de la page de liste des déploiements permet d'effectuer les actions suivantes :
- Update : met à jour la version du modèle, intégralement ou par lots (déploiement canari).
- Delete : supprime directement les services à l'usage pour arrêter la facturation.
- Renew : prolonge les services prépayés, avec renouvellement automatique possible.
- Buy capacity package : achète un forfait de capacité pour un déploiement à débit provisionné.
FAQ
Puis-je téléverser et déployer mes propres modèles ?
L'importation et le déploiement de vos propres modèles ne sont pas encore pris en charge. Nous vous conseillons de suivre les dernières mises à jour d'Alibaba Cloud Model Studio.
Par ailleurs, Alibaba Cloud Platform for AI (PAI) offre la possibilité de déployer vos propres modèles. Pour plus d'informations, reportez-vous à la section Déploiement de grands modèles de langage PAI-LLM.
Que faire si un message indique des permissions insuffisantes lors du déploiement ?
-
Si "Missing permission for this module" s'affiche, vérifiez que votre compte dispose de la permission Model Deployment - Operation dans la gestion des permissions de l'espace de travail.
Si vous ne parvenez pas à effectuer l'opération, contactez votre organisation ou votre administrateur informatique pour ajouter les permissions requises ou vérifier l'existence d'un problème de permissions.
-
Si le déploiement renvoie « xx business space does not have permission to deploy the xx model », accédez à Business Space Management pour autoriser le modèle concerné dans l'espace de travail correspondant.
Erreur d'appel API :
Workspace xxx does not have deployment privilege for model xxxx.
En cas d'erreur de permissions, rapprochez-vous de votre organisation ou de votre administrateur informatique pour obtenir les permissions nécessaires ou faire réaliser l'opération en votre nom.




