Tous les produits
Search
Centre de documentation

Alibaba Cloud Model Studio:Déploiement de modèle

Dernière mise à jour :Sep 07, 2026

Déployez des modèles pré-entraînés de la plateforme ou vos propres modèles affinés pour obtenir un service d'inférence dédié et indépendant. Ce service répond aux exigences métier en matière de concurrence élevée, de faible latence et d'autres critères de performance.

Modes de facturation

Avant le déploiement, consultez le coût horaire estimé des modèles dans la console de déploiement.

RemarqueLe mode de facturation ne peut plus être modifié une fois le service créé. Pour en changer, vous devez d'abord retirer le modèle déployé, puis le redéployer.

Provisioned Throughput (PTU)

(Débit élevé et hautes performances)

Model Unit

(Métriques de performance personnalisées et isolation des ressources)

Consommation de tokens

Paiement à l'usage après fine-tuning ou validation des résultats

Définition

Mode de déploiement qui réserve des ressources de la plateforme afin de garantir un débit spécifique en tokens par minute (TPM). Aucune limitation de taux n'est appliquée dans la limite du quota garanti.

Mode de déploiement qui alloue de la puissance de calcul en fonction de la durée d'utilisation et du nombre d'unités de modèle. Les ressources sont dédiées.

Mode de déploiement où la consommation est mesurée selon les tokens d'entrée et de sortie de chaque appel d'API.

Avantages

  1. Offre une capacité de débit stable, une latence réduite et une meilleure prévisibilité des ressources pour les environnements de production à forte charge.

  2. Par rapport à la facturation par tokens, le TPS (tokens générés par seconde) augmente généralement d'environ 1.5 à 2.0 fois.

  3. Prend en charge le renouvellement automatique.

  1. Les indicateurs de performance, tels que la latence et le débit, sont personnalisables.

  2. Prend en charge le renouvellement automatique.

Aucun frais en cas de non-utilisation.

Modèles pris en charge

Certains modèles pré-entraînés

Certains modèles pré-entraînés et tous les modèles affinés

Certains modèles affinés avec LoRA

Cas d'usage

  1. Service client intelligent pour une application bancaire (trafic stable, nécessite une expérience concurrentielle garantie).

  2. Modération de contenu en temps réel pour une plateforme de réseaux sociaux (nécessite un traitement stable de tâches de pipeline prévisibles).

  3. API de traduction sur cloud public (offre une garantie de service de base pour les utilisateurs du plan standard).

  1. Grand modèle affiné spécifique au e-commerce (déploiement d'un modèle privé avec mise à l'échelle manuelle lors des promotions).

  2. Modèle de criblage moléculaire pour une entreprise pharmaceutique (nécessite des ressources dédiées pour des tâches de longue durée).

  3. Simulation de conduite autonome (nécessite un calcul continu sur le long terme).

Validation des performances d'un modèle affiné

Schéma de facturation

image

image

image

Mode de facturation

Facturation basée sur la durée d'utilisation et le débit provisionné.

Prend en charge le paiement à l'utilisation et l'abonnement journalier.

Facturation basée sur la durée d'utilisation et le nombre d'unités de modèle.

Prend en charge le paiement à l'utilisation et l'abonnement mensuel.

Consommation de tokens par modèle

Prend en charge le paiement à l'utilisation.

Méthode de mise à l'échelle

Augmentation ou diminution du débit en libre-service

Augmentation ou diminution des Model Units en libre-service

Soumettez une demande dans la console et patientez jusqu'à la validation manuelle.

Contraintes du produit

  1. Prépaiement facturé à la journée. Résiliation anticipée possible ; la part consommée est recalculée avec un coefficient de 1.2 pour le remboursement.

  2. Si l'usage par unité de temps dépasse le débit acheté, la stratégie choisie à la création s'applique: le débordement automatique bascule vers la facturation à l'usage des appels du modèle ; le mode limité à la capacité PTU renvoie 429.

En cas de résiliation anticipée pendant le premier mois d'un achat prépayé, le tarif journalier, environ le tarif mensuel / 30, est multiplié par 1.2.

  1. Compatible uniquement avec certains modèles affinés via LoRA.

  2. Les ressources sont automatiquement libérées après un mois d'inactivité.

Pour consulter la consommation de tokens et l'historique des appels d'une invocation unique, accédez à Model Monitoring.

Détail de la facturation

Facturation selon la durée d'utilisation (Provisioned Throughput)

Fee = Usage duration × (Input TPM unit price × Input TPM + Output TPM unit price × Output TPM)

Le postpaiement est calculé à l'heure, au tarif de la colonne « Continuous 1 hour » ci-dessous. Le prépaiement est calculé à la journée, au tarif de la colonne « Continuous 1 day ».

  • La commande prépayée prend effet dès le paiement. Sa validité de N jours se termine à 23:59 le jour N. Si la commande est passée après 22:00, la date d'expiration est reportée de 1 jour.
  • À l'expiration d'une commande prépayée, le service s'arrête après un délai de 2 heures. Les ressources sont conservées pendant 14 heures après l'arrêt, puis libérées.
  • Une commande prépayée peut être résiliée par anticipation. La part consommée est recalculée avec un coefficient de 1.2 pour le remboursement. Consultez les règles de remboursement en cas de réduction de configuration.
  • En postpaiement, si le compte est en défaut de paiement, les ressources restent disponibles et facturées pendant 24 heures. Ensuite, la facturation cesse, le déploiement passe en état d'impayé et les ressources sont supprimées, mais la tâche de déploiement est conservée. Après règlement, les ressources sont réattribuées et le service reprend, ainsi que la facturation. Pour arrêter les frais, supprimez la tâche de déploiement ; la facturation cesse après sa suppression effective.

Si l'entrée du modèle dépasse la limite de tokens d'entrée, l'appel bascule automatiquement vers le paiement à l'usage du modèle. Si le TPM acheté est dépassé, la stratégie choisie à la création s'applique : « auto-overflow » bascule vers le paiement à l'usage, tandis que « use-only-PTU-capacity » renvoie 429. Les performances peuvent alors diminuer et les limites de trafic public du modèle snapshot dans l'espace de travail s'appliquent. Les frais suivent le tarif des appels de modèle à l'usage.

  • Dans ce cas, uniquement avec « auto-overflow », l'en-tête de réponse de l'API contient x-dashscope-ptu-overflow:true.
  • Consultez les statistiques TPM dans Model Monitoring.

Pour les réductions de frais et remboursements lors d'une réduction de capacité, consultez les règles de remboursement en cas de réduction de configuration.

RemarqueLe déploiement PTU prend en charge des coefficients de capacité par palier pour les entrées longues et des remises de cache. Consultez Entrées longues et cache avec Provisioned Throughput.

Singapore

Qwen

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

Qwen3.8-Max

qwen3.8-max

1M

$4.8

$1.44

$57.6

$17.28

Qwen3.7-Flash-2026-07-15 Contactez votre responsable commercial pour l'activer

qwen3.7-flash-2026-07-15

128K

$0.072

$0.031

$0.864

$0.374

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$1.92

$1.8

$72

$21.6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.96

$0.384

$11.52

$4.608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1.2

$0.72

$14.4

$8.64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.96

$0.576

$11.52

$6.912

DeepSeek

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.72

$0.144

$8.64

$1.728

DeepSeek-v4-Flash-0731

deepseek-v4-flash-0731

64K

$1.44

$0.288

$17.28

$3.456

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$0.96

$1.728

$103.68

$20.736

Qwen VL

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.48

$0.384

$5.76

$4.608

GLM

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

GLM-5.2

glm-5.2

1M

$5.04

$1.584

$60.48

$19.008

China North 2 (Beijing)

Qwen

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

Qwen3.8-Max

qwen3.8-max

1M

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Flash-2026-07-15 Contactez votre responsable commercial pour l'activer

qwen3.7-flash-2026-07-15

128K

$0.066

$0.026

$0.792

$0.317

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.66

$0.264

$7.92

$3.168

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$0.67

$0.066

$7.93

$4.753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.26

$0.16

$3.17

$1.9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128K

$1.11

$0.45

$13.32

$5.4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128K

$0.06

$0.06

$0.72

$0.72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128K

$0.28

Sans réflexion : $0.07

Avec réflexion : $0.28

$3.36

Sans réflexion : $0.84

Avec réflexion : $3.36

DeepSeek

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

DeepSeek-v4-Flash

deepseek-v4-flash

256K

$0.5

$0.099

$5.94

$1.188

DeepSeek-v4-Flash-0731

deepseek-v4-flash-0731

64K

$0.99

$0.198

$11.88

$2.376

DeepSeek-v4-Pro

deepseek-v4-pro

256K

$5.94

$1.188

$71.3

$14.26

DeepSeek-v3

deepseek-v3

64K

$0.99

$0.396

$11.9

$4.75

Qwen VL

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

128K

$0.35

$0.35

$4.2

$4.2

GLM

Nom du modèle

Code du modèle

Nombre maximal de tokens d'entrée

Entrée en postpaiement

Par 10K TPM et par heure

Sortie en postpaiement

Par 1K TPM et par heure

Entrée en prépaiement

Par 10K TPM et par jour

Sortie en prépaiement

Par 1K TPM et par jour

GLM-5.2

glm-5.2

1M

$3.96

$1.386

$47.53

$16.635

Facturation selon la durée d'utilisation (Model Unit)

Cost = Usage duration (hours) × Number of Model Units × Model Unit unit price

En postpaiement, le tarif d'une Model Unit correspond à la colonne « Hourly unit price » ci-dessous. Pour un abonnement mensuel prépayé, le calcul devient nombre de mois d'abonnement × nombre de Model Units × tarif mensuel.

  • En cas de résiliation anticipée pendant le premier mois prépayé, le tarif journalier, environ le tarif mensuel / 30, est multiplié par 1.2. Toute journée entamée est facturée intégralement.

RemarqueLes ressources de calcul Model Unit en postpaiement sont attribuées dans l'ordre des demandes. Si l'achat échoue, un remboursement intégral est effectué.

Singapore

Génération de texte

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

$88

$41,832

MU2 x 8

$112

$52,392

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU2 x 8

$112

$52,392

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU2 x 8

$112

$52,392

Qwen3.5-27B

qwen3.5-27b

MU1 x 2

$22

$10,458

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$22

$10,458

GLM-5.1

glm-5.1

MU2 x 8

$112

$52,392

MU3 x 8

$216

$102,696

DeepSeek-v4-Flash

deepseek-v4-flash

MU2 x 8

$112

$52,392

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$44

$20,916

Multimodal

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$112

$52,392

Types de modèles :

  • Instruct : après déploiement, l'inférence s'effectue en mode sans réflexion.

China (Beijing)

Génération de texte

Qwen

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

Qwen3.8-27B

qwen3.8-27b

MU9 x 4

$28.056

$13,532.096

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

MU1 x 8

$59.408

$28,734.256

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.6-27B

qwen3.6-27b

MU9 x 1

$7.014

$3,383.024

Qwen3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

$14.852

$7,183.564

MU3 x 8

$150.72

$72,577.152

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

MU1 x 16(mode de séparation préremplissage/décodage)

$59.408

Mode de séparation préremplissage/décodage : $118.816

$28,734.256

Mode de séparation préremplissage/décodage : $57,468.512

MU2 x 8

$69.312

$33,044.72

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

MU3 x 8

MU3 x 16(mode de séparation préremplissage/décodage)

$150.72

Mode de séparation préremplissage/décodage : $301.44

$72,577.152

Mode de séparation préremplissage/décodage : $145,154.304

MU6 x 16

$55.008

$26,599.92

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

$29.704

$14,367.128

MU6 x 16

$55.008

$26,599.92

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

$14.852

$7,183.564

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU9 x 1

$7.014

$3,383.024

Qwen3.5-27B

qwen3.5-27b

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Qwen3.5-9B

qwen3.5-9b

MU1 x 2

$14.852

$7,183.564

MU2 x 8

$69.312

$33,044.72

Qwen3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

$14.852

$7,183.564

Qwen3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

MU1 x 16(mode de séparation préremplissage/décodage)

$59.408

Mode de séparation préremplissage/décodage : $118.816

$28,734.256

Mode de séparation préremplissage/décodage : $57,468.512

MU2 x 8

$69.312

$33,044.72

MU3 x 8

MU3 x 16(mode de séparation préremplissage/décodage)

$150.72

Mode de séparation préremplissage/décodage : $301.44

$72,577.152

Mode de séparation préremplissage/décodage : $145,154.304

Qwen3-235B-A22B-Instruct-2507

qwen3-235b-a22b-instruct-2507

MU1 x 4

$29.704

$14,367.128

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-32B

qwen3-32b

MU6 x 16

$55.008

$26,599.92

Qwen3-30B-A3B-Thinking-2507

qwen3-30b-a3b-thinking-2507

MU1 x 2

$14.852

$7,183.564

Qwen3-4B

qwen3-4b

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-Embedding-0.6B

qwen3-embedding-0.6b

MU5 x 1

$2.888

$1,394.329

MU6 x 1

$3.438

$1,662.495

Qwen3-MoE-Rerank-0.6B

qwen3-moe-rerank-0.6b

MU5 x 1

$2.888

$1,394.329

Qwen3-Rerank-0.6B

qwen3-rerank-0.6b

MU5 x 1

$2.888

$1,394.329

MU6 x 1

$3.438

$1,662.495

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-Rerank

qwen3-rerank

MU5 x 1

$2.888

$1,394.329

Qwen2.5-Open Source-72B

qwen2.5-72b-instruct

MU1 x 8

$59.408

$28,734.256

Qwen2.5-Open Source-14B

qwen2.5-14b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen2.5-Open Source-7B

qwen2.5-7b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

MU1 x 16(mode de séparation préremplissage/décodage)

$29.704

Mode de séparation préremplissage/décodage : $118.816

$14,367.128

Mode de séparation préremplissage/décodage : $57,468.512

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

$29.704

$14,367.128

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

$29.704

$14,367.128

GLM

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

GLM-5.1

glm-5.1

MU2 x 8

$69.312

$33,044.72

MU3 x 16(mode de séparation préremplissage/décodage)

Mode de séparation préremplissage/décodage : $301.44

Mode de séparation préremplissage/décodage : $145,154.304

MU6 x 16

$55.008

$26,599.92

GLM-5

glm-5

MU3 x 16(mode de séparation préremplissage/décodage)

Mode de séparation préremplissage/décodage : $301.44

Mode de séparation préremplissage/décodage : $145,154.304

GLM-4.7

glm-4.7

MU6 x 32(mode de séparation préremplissage/décodage)

Mode de séparation préremplissage/décodage : $110.016

Mode de séparation préremplissage/décodage : $53,199.84

DeepSeek

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

DeepSeek-v4-Flash

deepseek-v4-flash

MU1 x 8

$59.408

$28,734.256

MU3 x 8

$150.72

$72,577.152

DeepSeek-v3.2

deepseek-v3.2

MU2 x 16(mode de séparation préremplissage/décodage)

Mode de séparation préremplissage/décodage : $138.624

Mode de séparation préremplissage/décodage : $66,089.44

Autres modèles

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

Kimi-K2.5

kimi-k2.5

MU2 x 8

$69.312

$33,044.72

Multimodal

Qwen VL

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

Qwen3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 8

$59.408

$28,734.256

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

$69.312

$33,044.72

MU3 x 8

$150.72

$72,577.152

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

$14.852

$7,183.564

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-4B-Instruct

qwen3-vl-4b-instruct

MU1 x 2

$14.852

$7,183.564

Qwen3-VL-2B-Instruct

qwen3-vl-2b-instruct

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-Embedding-2B

qwen3-vl-embedding-2b

MU5 x 1

$2.888

$1,394.329

Qwen3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

$29.704

$14,367.128

Qwen3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

$29.704

$14,367.128

Qwen VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

$13.752

$6,649.98

Qwen Omni

Nom du modèle

Code du modèle

Caractéristiques des Model Units

Tarif horaire ($)

Unité minimale de facturation : minute

Tarif mensuel ($)

Unité minimale de facturation : jour

Qwen3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

$6.464

$3,080.477

MU9 x 1

$7.014

$3,383.024

Types de modèles :

  • Instruct : le modèle effectue l'inférence en mode sans réflexion après déploiement.
  • Thinking : le modèle effectue l'inférence en mode de réflexion après déploiement.

Selon les tokens consommés par le modèle

Fee = Model input token count × Model input unit price + Model output token count × Model output unit price (minimum billing unit: 1 token)

  • La facturation par tokens est disponible uniquement après un entraînement SFT efficace, c'est-à-dire un fine-tuning LoRA avec plan défini sur lora pour un déploiement par API, sur l'un des modèles de base suivants, aboutissant à un modèle personnalisé.

Singapore

Modèle de base

Code du modèle

Entrée

$/million de tokens

Sortie

$/million de tokens

Qwen3-14B

qwen3-14b

Mode sans réflexion : $0.35

Mode de réflexion : $0.35

Mode sans réflexion : $1.4

Mode de réflexion : $4.2

Beijing

Modèle de base

Code du modèle

Entrée

$/million de tokens

Sortie

$/million de tokens

Qwen3.8-27B

qwen3.8-27b

$0.424

$1.696

Qwen3.5-27B

qwen3.5-27b

<128K $0.086

128K-256K $0.258

<128K $0.688

128K-256K $2.064

Qwen3-32B

qwen3-32b

Mode sans réflexion : $0.287

Mode de réflexion : $0.287

Mode sans réflexion : $1.147

Mode de réflexion : $2.868

Qwen3-14B

qwen3-14b

Mode sans réflexion : $0.144

Mode de réflexion : $0.144

Mode sans réflexion : $0.574

Mode de réflexion : $1.434

Qwen3-8B

qwen3-8b

Mode sans réflexion : $0.072

Mode de réflexion : $0.072

Mode sans réflexion : $0.287

Mode de réflexion : $0.717

Qwen3-VL-8B-Instruct

qwen3-vl-8b-instruct

$0.072

$0.287

Pour déployer des modèles supplémentaires, consultez cette solution et choisissez le plan de déploiement le plus adapté aux besoins de votre entreprise.

Méthodes de déploiement

Pour déployer des modèles dans la console, suivez les étapes ci-dessous :

En cas de permissions insuffisantes, consultez Que faire si un message indique des permissions insuffisantes lors du déploiement ?.

  1. Accédez à la console de déploiement des modèles.

image

image

  1. Saisissez un nom de service, sélectionnez un modèle ainsi qu'une méthode de facturation, conservez les autres paramètres par défaut, puis cliquez sur Confirm.

  1. Lorsque l'état du déploiement passe à Running, le modèle est déployé avec succès.

Des frais sont engagés dès que le modèle est déployé avec succès.

Configuration du déploiement

Model Unit

Configuration

Détails

Nom du service

Nom personnalisé du service de déploiement.

Modèle

Choisissez le modèle à déployer, prédéfini par la plateforme ou affiné par fine-tuning.

Type de Model Unit

Choisissez les caractéristiques du déploiement, qui déterminent la puissance de calcul et les performances.

Nombre de réplicas

Définissez le nombre initial de réplicas, qui influe sur la capacité de traitement simultané du service.

Modèle de déploiement

Choisissez un modèle de déploiement, par exemple « single-node deployment ». Chaque modèle correspond à une configuration de ressources. Ce choix n'est disponible qu'avec la facturation Model Unit.

Mode d'inférence du modèle

Pour certains modèles déployés en mode Model Unit, vous pouvez configurer le mode d'inférence, le contexte maximal et d'autres paramètres.

  • Instruct : le modèle effectue l'inférence en mode sans réflexion après déploiement.

  • Thinking : le modèle effectue l'inférence en mode de réflexion après déploiement.

Contexte maximal

Ce paramètre est pris en charge pour le mode de déploiement Model Unit de certains modèles. La longueur maximale du contexte dépend du type de modèle.

Limitation du service

Certains modèles déployés en mode Model Unit permettent de limiter les RPM et TPM des appels.

Liste des déploiements

Une fois le déploiement réussi, vous pouvez consulter et gérer tous les services déployés depuis la page de liste des déploiements. Cette page présente les informations suivantes :

  • Nom du service : cliquez sur le nom pour consulter les détails du déploiement.
  • Nom du modèle : modèle utilisé pour le déploiement.
  • Code du modèle : identifiant unique généré après le déploiement réussi, à utiliser dans les appels API.
  • État du déploiement ou de l'événement : en attente, déploiement en cours, en service, échec du déploiement, mise hors ligne, service suspendu, arrêté, suppression, suspension d'abonnement ou pour impayé, reprise, en service avec modification de configuration ou échec de modification, entre autres.
  • Mode de facturation : mode de facturation du service actuel.
  • Détails du déploiement : configuration, dont le type de Model Unit et le nombre de réplicas.
  • Détails des limites : configuration telle que les RPM (requêtes par minute) et TPM (tokens par minute).
  • Période de service : dates de création et d'expiration.
  • Opérations : selon l'état et la facturation, vous pouvez mettre à jour, surveiller, redimensionner, renouveler, mettre hors ligne, supprimer ou essayer le service.

Appels après déploiement

Après le déploiement réussi d'un modèle, vous pouvez l'appeler via une interface compatible OpenAI, Dashscope ou le SDK Assistant.

Lors de l'appel d'un modèle déployé avec succès, la valeur du paramètre model doit correspondre au code du modèle généré après son déploiement. Accédez à la Model Deployment console pour récupérer le Model Code.

image
import os
import dashscope

messages = [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
    # If you have not configured environment variables, replace the next line with your Bailian API Key: api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-max-xxx-xxx",  # Please replace with the code returned after the model is successfully deployed
    messages=messages,
    result_format="message",
    enable_thinking=False,
)
print(response)
import os
from openai import OpenAI

client = OpenAI(
    # If you have not configured environment variables, replace the next line with your Bailian API Key: api_key="sk-xxx",
    api_key=os.getenv('DASHSCOPE_API_KEY'),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3-max-xxx-xxx",  # Please replace with the code returned after the model is successfully deployed
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Who are you?"},
    ],
    extra_body={"enable_thinking": False},
)
print(completion)

Redimensionner un service déployé

  • Débit provisionné, facturé à la durée : cliquez sur Scaling pour ajuster manuellement le nombre d'instances. Pour les réductions et remboursements, consultez les règles de remboursement en cas de réduction de configuration.
  • Model Unit, facturé à la durée : cliquez sur Scaling pour ajuster manuellement le nombre d'instances.

Il est également possible de cliquer sur le bouton Scaling Configuration dans la colonne Operation pour définir des politiques de mise à l'échelle automatique, comprenant les seuils de déclenchement, le nombre minimal et maximal de réplicas, ainsi que la mise à l'échelle planifiée.

Mettre un service déployé hors ligne

Accédez à la Model Deployment console, recherchez le service de déploiement à arrêter, puis cliquez sur l'action appropriée selon la méthode de facturation :

  • Model Unit prépayé : cliquez sur Deactivate et confirmez.
  • Postpaiement : cliquez sur Delete et confirmez.

La facturation s'arrête une fois l'opération terminée.

image

Autres opérations

Outre la désactivation, la colonne Operation de la page de liste des déploiements permet d'effectuer les actions suivantes :

  • Update : met à jour la version du modèle, intégralement ou par lots (déploiement canari).
  • Delete : supprime directement les services à l'usage pour arrêter la facturation.
  • Renew : prolonge les services prépayés, avec renouvellement automatique possible.
  • Buy capacity package : achète un forfait de capacité pour un déploiement à débit provisionné.

FAQ

Puis-je téléverser et déployer mes propres modèles ?

L'importation et le déploiement de vos propres modèles ne sont pas encore pris en charge. Nous vous conseillons de suivre les dernières mises à jour d'Alibaba Cloud Model Studio.

Par ailleurs, Alibaba Cloud Platform for AI (PAI) offre la possibilité de déployer vos propres modèles. Pour plus d'informations, reportez-vous à la section Déploiement de grands modèles de langage PAI-LLM.

Que faire si un message indique des permissions insuffisantes lors du déploiement ?

  1. Si "Missing permission for this module" s'affiche, vérifiez que votre compte dispose de la permission Model Deployment - Operation dans la gestion des permissions de l'espace de travail.

    PixPin_2025-11-27_15-09-44

    Si vous ne parvenez pas à effectuer l'opération, contactez votre organisation ou votre administrateur informatique pour ajouter les permissions requises ou vérifier l'existence d'un problème de permissions.

  2. Si le déploiement renvoie « xx business space does not have permission to deploy the xx model », accédez à Business Space Management pour autoriser le modèle concerné dans l'espace de travail correspondant.

    Erreur d'appel API : Workspace xxx does not have deployment privilege for model xxxx.

    PixPin_2025-11-27_15-03-57 PixPin_2025-11-27_15-06-41

    En cas d'erreur de permissions, rapprochez-vous de votre organisation ou de votre administrateur informatique pour obtenir les permissions nécessaires ou faire réaliser l'opération en votre nom.