Consultez les statistiques d'utilisation des modèles d'Alibaba Cloud Model Studio.
Pour plus d'informations sur les quotas gratuits, reportez-vous à Quota gratuit pour les nouveaux utilisateurs . Gérez l'utilisation de votre quota gratuit sur la page Free Quota .
Disponibilité
- Régions : Singapour uniquement. Pour plus d'informations, reportez-vous à Régions et domaines d'accès.
- Modèles : Tous les modèles répertoriés dans la Liste des modèles.
Consulter l'utilisation du quota gratuit
Dans la console
- Accédez à la page Free Quota et sélectionnez l'onglet du type de modèle pour consulter l'utilisation du quota gratuit de chaque modèle.
- Dans le tableau des modèles, localisez des modèles spécifiques grâce aux outils de recherche, de tri ou de filtrage. Activez ou désactivez l'option Free Quota Only individuellement ou par lot pour gérer les paramètres du quota gratuit.
RemarqueFree Quota Only : Lorsque cette option est activée, le service s'arrête automatiquement dès que le quota gratuit est épuisé (renvoi d'une erreur 403 : AllocationQuota.FreeTierOnly). Cela empêche toute facturation au-delà du quota gratuit. Pour poursuivre l'utilisation et payer selon la consommation réelle, maintenez cette fonctionnalité désactivée. Elle n'est disponible que si votre compte possède encore un quota gratuit non consommé. Une fois activée, elle reste verrouillée jusqu'à l'épuisement total du quota gratuit. Les quotas gratuits étant facturés à la minute, les données affichées dans la console peuvent présenter un léger délai. Référez-vous toujours à la valeur du quota gratuit indiquée dans la console.
Consulter l'utilisation des modèles
La console ne prend actuellement en charge que l'affichage de l'utilisation du quota gratuit. Pour consulter des statistiques d'utilisation détaillées, accédez à la page Bill Details et exportez la facture pour visualiser la consommation de tokens.
Consulter la vue d'ensemble des coûts
La page Cost Overview affiche le résumé des coûts des services Model Studio, incluant :
- Cartes de coûts : Visualisez les dépenses totales, les frais d'abonnement et le montant des factures pour la période de facturation en cours, avec des liens vers les détails.
- Tendances de facturation : Analysez l'évolution des coûts sous forme de graphique ou de liste. Filtrez par statistiques mensuelles ou quotidiennes, catégorie de produit, ID de clé API ou modèle.
- Alertes de coûts : Configurez des alertes pour recevoir des notifications en cas de dépenses anormales.
Unités d'utilisation
Dans Model Studio, les statistiques d'utilisation varient selon les modèles :
Type | Sous-catégorie | Unité | Facturation (invocation) |
|---|---|---|---|
Grand modèle linguistique | Facturé selon le nombre de tokens en entrée et en sortie. | ||
Modèle visuel | Images | Facturé selon le nombre d'images générées avec succès. | |
Secondes | Facturé selon le nombre de secondes vidéo générées avec succès. | ||
Modèle vocal | Seconde, caractère ou token | La facturation s'effectue soit à la durée audio (secondes), soit au nombre de caractères textuels, soit au nombre de tokens, selon le modèle utilisé. | |
Modèle omni-modal | Token | Le texte est facturé au nombre de tokens. Les autres modalités (audio, image, vidéo) sont facturées selon leur équivalent en tokens. | |
Modèle d'embedding | Token | Facturé selon le nombre de tokens du texte en entrée. | |
Embedding de texte |
Mise en production
Recommandations pour optimiser l'utilisation des modèles :
- Maîtriser la longueur des sorties : Limitez la quantité maximale de contenu généré par invocation afin de contrôler les coûts, en ajustant judicieusement la longueur de réflexion et en configurant le paramètre max_tokens.
- Adapter le modèle à la tâche : Pour des opérations simples comme la catégorisation ou le résumé, privilégiez des modèles légers et moins coûteux plutôt que des modèles puissants mais onéreux.
- Surveillance et alertes : Suivez les tendances d'utilisation et configurez des alertes pour être notifié rapidement en cas de consommation anormale.
- Optimisation des prompts : Des instructions concises et claires améliorent la qualité des réponses tout en réduisant le nombre de tokens inutiles en entrée.
- Recours à l'inférence par lot : Pour les traitements massifs ne nécessitant pas de réponse immédiate, l'inférence par lot s'avère souvent plus économique que les invocations en temps réel.
Glossaire
| Terme | Description |
|---|---|
| Token | Les grands modèles linguistiques traitent les entrées et les sorties sous forme de tokens. Un token peut correspondre à :
En règle générale, 1 caractère chinois équivaut environ à 1,5-2 tokens ; 1 lettre anglaise correspond à environ 0,25 token ; et 1 mot anglais représente environ 1,3 tokens :
Chaque modèle possède une limite maximale de tokens en entrée et en sortie (consultez la Liste des modèles). Tout dépassement de cette limite entraîne un échec. |
| Real-time | Désigne toutes les invocations directes et indirectes d'un modèle, couvrant principalement les scénarios suivants :
|
| Batches | Traitement de données à grande échelle effectué hors ligne pour les scénarios ne nécessitant pas de réponse en temps réel, via l'API Compatible OpenAI - Batch (entrée fichier). |
FAQ
Q : Comment vérifier l'utilisation totale des tokens pour mon compte Alibaba Cloud ?R : Connectez-vous avec votre compte Alibaba Cloud, accédez à la page Bill Details et exportez la facture.
@props:china
Sur la page Bill Details, filtrez et exportez la facture :
- Définissez le Billing Month sur le mois souhaité (par exemple
2025-05). - Sous Product Name, sélectionnez Model Studio.
- Cliquez sur l'icône de téléchargement située dans le coin supérieur droit du tableau pour exporter les données de facturation.
@/props