Le service PAI Token prend en charge l'appel de grands modèles open source et propriétaires. Utilisez-le pour l'évaluation et la distillation de modèles, ainsi que pour les charges de travail DSW et FeatureStore. La facturation repose sur la consommation réelle de tokens.
Règles de facturation
Lorsque vous activez le service PAI Token, la facturation au paiement à l'utilisation (postpayé) est activée par défaut. Vous êtes facturé en fonction du nombre de tokens d'entrée et de sortie.
Formule de facturation : Frais au paiement à l'utilisation = Nombre de tokens d'entrée × Prix unitaire des tokens d'entrée + Nombre de tokens de sortie × Prix unitaire des tokens de sortie
Réduction liée au cache : Les tokens d'entrée qui atteignent le cache de contexte peuvent bénéficier d'une réduction. Pour plus de détails, consultez la section Annexe : Réduction liée à la mise en cache du contexte.
Génération de texte — Qwen
Qwen Max
Chine (continentale)
Région prise en charge : Chine (Pékin).
|
ID du modèle |
Mode |
Jetons d'entrée par requête |
Prix unitaire d'entrée (pour 1 M de jetons) |
Prix unitaire de sortie (pour 1 M de jetons) Chaîne de réflexion + réponse |
|
qwen3.7-max |
Modes sans réflexion et avec réflexion |
0<Token≤1M |
$1,98 |
$5,9412 |
International
Région prise en charge : Singapour.
|
ID du modèle |
Mode |
Jetons d'entrée par requête |
Prix unitaire d'entrée (pour 1 M de jetons) |
Prix unitaire de sortie (pour 1 M de jetons) Chaîne de réflexion + réponse |
|
qwen3.7-max |
Modes sans réflexion et avec réflexion |
0<Token≤1M |
$3 |
$9 |
Qwen Plus
Chine (continentale)
Région prise en charge : Chine (Pékin).
|
ID du modèle |
Plage de jetons d'entrée par requête |
Prix unitaire d'entrée (pour 1 million de jetons) |
Prix unitaire de sortie (pour 1 million de jetons) |
|
|
Mode sans réflexion |
Mode de réflexion (chaîne de pensée + réponse) |
|||
|
qwen3.7-plus |
0<Token≤256K |
$0,3444 |
$1,3764 |
$1,3764 |
|
256K<Token≤1M |
$1,032 |
$4,128 |
$4,128 |
|
|
qwen3.6-plus |
0<Token≤256K |
$0,3312 |
$1,9812 |
$1,9812 |
|
256K<Token≤1M |
$1,3212 |
$7,9224 |
$7,9224 |
|
|
qwen3.5-plus |
0<Token≤128K |
$0,138 |
$0,8256 |
$0,8256 |
|
128K<Token≤256K |
$0,3444 |
$2,064 |
$2,064 |
|
|
256K<Token≤1M |
$0,6876 |
$4,128 |
$4,128 |
|
International
Région prise en charge : Singapour.
|
ID du modèle |
Plage de jetons d'entrée par requête |
Prix unitaire d'entrée (pour 1 million de jetons) |
Prix unitaire de sortie (pour 1 million de jetons) |
|
|
Mode sans réflexion |
Mode de réflexion (chaîne de pensée + réponse) |
|||
|
qwen3.6-plus |
0<Token≤256K |
$0,48 |
$1,92 |
$1,92 |
|
256K<Token≤1M |
$1,44 |
$5,76 |
$5,76 |
|
|
qwen3.6-plus |
0<Token≤256K |
$0,6 |
$3,6 |
$3,6 |
|
256K<Token≤1M |
$2,4 |
$7,2 |
$7,2 |
|
|
qwen3.5-plus |
0<Token≤256K |
$0,48 |
$2,88 |
$2,88 |
|
256K<Token≤1M |
$0,6 |
$3,6 |
$3,6 |
|
Génération de texte — modèles tiers
DeepSeek
Chine (continentale)
Région prise en charge : Chine (Pékin).
|
ID du modèle |
Prix unitaire d'entrée (pour 1 million de tokens) |
Prix unitaire de sortie (pour 1 million de tokens) Chaîne de réflexion + réponse |
|
deepseek-v4-pro |
$1,98 |
$3,9612 |
|
deepseek-v4-flash |
$0,1656 |
$0,33 |
International
Région prise en charge : Singapour.
|
ID du modèle |
Prix unitaire d'entrée (pour 1 million de tokens) |
Prix unitaire de sortie (pour 1 million de tokens) Chaîne de réflexion + réponse |
|
deepseek-v4-pro |
$2,88 |
$5,76 |
|
deepseek-v4-flash |
$0,24 |
$0,48 |
Kimi
Chine (continentale)
Région prise en charge : Chine (Pékin).
|
ID du modèle |
Prix unitaire d'entrée (pour 1 million de tokens) |
Prix unitaire de sortie (pour 1 million de tokens) |
|
kimi-k2.7-code |
$1,0728 |
$4,4556 |
|
kimi-k2.6 |
$1,07268 |
$4,45572 |
International
Région prise en charge : Singapour.
|
ID du modèle |
Prix unitaire d'entrée (pour 1 million de tokens) |
Prix unitaire de sortie (pour 1 million de tokens) |
|
kimi-k2.7-code |
$1,0728 |
$4,4556 |
GLM
Chine (continentale)
Région prise en charge : Chine (Pékin).
|
ID du modèle |
Mode |
Jetons d'entrée par requête |
Prix unitaire des jetons d'entrée (pour 1 million de jetons) |
Prix unitaire des jetons de sortie (pour 1 million de jetons) Chaîne de raisonnement + réponse |
|
glm-5.2 |
Modes sans réflexion et avec réflexion |
Pas de tarification par paliers |
1,32 $ |
4,6212 $ |
|
glm-5.1 |
Modes sans réflexion et avec réflexion |
0<Token≤32K |
0,99 $ |
3,9612 $ |
|
32K<Token≤200K |
1,32 $ |
4,6212 $ |
||
|
glm-5 |
Modes sans réflexion et avec réflexion |
0<Token≤32K |
0,6876 $ |
3,096 $ |
|
32K<Token≤166K |
1,032 $ |
3,7848 $ |
International
Région prise en charge : Singapour.
|
ID du modèle |
Mode |
Jetons d'entrée par requête |
Prix unitaire des jetons d'entrée (pour 1 million de jetons) |
Prix unitaire des jetons de sortie (pour 1 million de jetons) Chaîne de raisonnement + réponse |
|
glm-5.2 |
Modes sans réflexion et avec réflexion |
Pas de tarification par paliers |
1,68 $ |
5,28 $ |
|
glm-5.1 |
Modes sans réflexion et avec réflexion |
0<Token≤200K |
1,68 $ |
5,28 $ |
Embedding de texte
La facturation est basée uniquement sur les jetons d'entrée. Les jetons de sortie ne sont pas facturés.
Chine (continentale)
Région prise en charge : Chine (Pékin).
|
ID du modèle |
Prix unitaire des jetons d'entrée (pour 1 million de jetons) |
|
text-embedding-v4 |
0,0864 $ |
International
Région prise en charge : Singapour.
|
ID du modèle |
Prix unitaire des jetons d'entrée (pour 1 million de jetons) |
|
text-embedding-v4 |
0,084 $ |
Embedding multimodal
La facturation est basée uniquement sur les jetons d'entrée. Les jetons de sortie ne sont pas facturés.
Chine (continentale)
Région prise en charge : Chine (Pékin).
|
ID du modèle |
Prix unitaire des jetons d'entrée (pour 1 million de jetons) |
|
qwen3-vl-embedding |
Image/vidéo : 0,3096 $ Texte : 0,12 $ |
International
Région prise en charge : Singapour.
|
ID du modèle |
Prix unitaire des jetons d'entrée (pour 1 million de jetons) |
|
tongyi-embedding-vision-plus |
0,108 $ |
|
tongyi-embedding-vision-flash |
Image/vidéo : 0,036 $ Texte : 0,108 $ |
Annexe : Réduction liée à la mise en cache du contexte
|
Élément |
Cache explicite |
Cache implicite |
|
Facturation des jetons utilisés pour créer le cache |
125 % du prix unitaire des jetons d'entrée |
100 % du prix unitaire des jetons d'entrée |
|
Facturation des jetons d'entrée trouvés dans le cache (cache hit) |
10 % du prix unitaire des jetons d'entrée |
20 % du prix unitaire des jetons d'entrée |
FAQ
Le service PAI Token Service prend-il en charge les plans d'économies ? Les plans d'économies de Model Studio s'appliquent-ils à PAI Token Service ?
PAI Token Service ne prend pas en charge les plans d'économies. Les plans d'économies de Model Studio ne peuvent pas être appliqués à PAI Token Service.