Pour utiliser des modèles dans MaxCompute afin de traiter des données ou d'effectuer une inférence hors ligne sans gérer vos propres ressources GPU, souscrivez au service de calcul de modèles MaxCompute pour répondre à vos exigences en matière d'inférence de modèles et de performances.
Régions et modèles pris en charge
-
Régions prises en charge : le service de calcul de modèles est disponible uniquement dans les régions suivantes.
Chine continentale : Chine (Pékin), Chine (Shanghai), Chine (Hangzhou), Chine (Shenzhen), Chine (Ulanqab)
International : Singapour
-
Modèles pris en charge
|
**Modèle**
|
**Entrée prise en charge**
|
**Description**
| | --- | --- | --- | |
`qwen3.7-max`
|
Entrée textuelle uniquement
|
Modèle phare de la série Qwen 3.7. Il offre des améliorations complètes en matière d'inférence, de génération de code et de compréhension multilingue, ce qui le rend adapté aux tâches hautement complexes.
| |
`qwen3.7-plus`
|
Entrée multimodale prise en charge
|
Modèle équilibré de la série Qwen 3.7 qui concilie performances et coûts, adapté aux scénarios de niveau entreprise tels que l'analyse de textes longs et les conversations multi-tours.
| |
`qwen3-vl-embedding`
|
Entrée multimodale prise en charge
|
Modèle d'incorporation multimodal Qwen. Il crée des représentations vectorielles à partir d'entrées mixtes image-texte et convient à la récupération intermodale et à la mise en correspondance image-texte.
| |
`text-embedding-v4`
|
Entrée textuelle uniquement
|
Modèle d'incorporation de texte haute précision adapté aux tâches telles que la recherche sémantique, le clustering et le calcul de similarité.
| |
`qwen3.6-plus`
|
Entrée multimodale prise en charge
|
Modèle équilibré de la série Qwen 3.6 qui concilie performances et coûts, adapté aux tâches générales telles que la conversation, la synthèse et l'analyse.
| |
`qwen3.6-flash`
|
Entrée multimodale prise en charge
|
Modèle léger et rapide de la série Qwen 3.6. Ses temps de réponse rapides et ses faibles coûts en font une solution idéale pour les services en ligne à forte concurrence et à faible latence.
| |
`deepseek-v4-pro`
|
Entrée textuelle uniquement
|
Modèle d'inférence phare de quatrième génération de DeepSeek. Il excelle dans les tâches difficiles telles que les mathématiques, la programmation et le raisonnement logique complexe.
| |
`deepseek-v4-flash`
|
Entrée textuelle uniquement
|
Modèle léger de quatrième génération de DeepSeek. Avec une inférence rapide et rentable, il est idéal pour la conversation quotidienne et les tâches de raisonnement légères.
| |
`qwen3.5-397b-a17b`
|
Entrée multimodale prise en charge
|
Modèle Mixture-of-Experts (MoE) de la série Qwen 3.5. Il se caractérise par une activation efficace des paramètres, une vaste base de connaissances et des capacités de raisonnement en plusieurs étapes. Il est conçu pour la déduction logique difficile, la génération de code full-stack et les questions-réponses approfondies.
| |
`qwen3-asr-flash`
|
Entrée multimodale prise en charge
|
Modèle léger de reconnaissance automatique de la parole (ASR) de la série Qwen 3. Sa transcription en temps réel à faible latence et à forte concurrence est idéale pour les scénarios de traitement audio tels que la transcription de réunions, le sous-titrage en direct et la reconnaissance de commandes vocales.
| |
`qwen3-max` (Sera obsolète)
|
Entrée textuelle uniquement
|
Grand modèle linguistique haute performance de la série Qwen, adapté à l'inférence complexe et à la génération de contenu.
|
Facturation
Pour plus de détails, consultez Frais de calcul de modèles (frais par jeton).
Avant de commencer
Il vous suffit d'activer le service une fois par région. Après l'activation, le service est disponible par défaut pour tous les projets de cette région.
Connectez-vous à la console MaxCompute et sélectionnez une région dans le coin supérieur gauche.
Dans le volet de navigation de gauche, choisissez .
-
Sur la page Quotas , cliquez sur New Quota .
Sur la page d'achat, pour Product Type, sélectionnez Service de calcul de modèles .
Sur la page du service de calcul de modèles MaxCompute, sélectionnez une région, acceptez le contrat de service, puis activez le service.
Une fois l'achat terminé, revenez à la console. Un quota Paiement à l'utilisation nommé
ai_InferenceQuotaapparaît sur la page Quota Management .
Accorder des permissions
Par défaut, aucun compte (y compris les comptes Alibaba Cloud) ni rôle ne dispose de l'autorisation de spécifier un quota au niveau du job. Vous devez explicitement accorder les autorisations requises avant de pouvoir utiliser cette fonctionnalité.
Créer un rôle
Connectez-vous à la console MaxCompute et sélectionnez une région dans le coin supérieur gauche.
Dans le volet de navigation de gauche, choisissez .
Sur la page Tenants , cliquez sur l'onglet Roles .
-
Dans l'onglet Roles , cliquez sur Add Role . Dans la boîte de dialogue Add Role , saisissez un Role Name personnalisé, fournissez le Policy Content , puis cliquez sur OK .
{ "Statement": [{ "Action": [ "odps:List", "odps:Usage"], "Effect": "Allow", "Resource": ["acs:odps:*:regions/*/quotas/*"]}], "Version": "1" }
Attribuer le rôle aux comptes
Votre compte Alibaba Cloud ou un utilisateur RAM disposant de l'autorisation Super_Administrator peut accorder ces autorisations. Le processus d'autorisation varie selon le type de compte.
Autorisation des comptes Alibaba Cloud
Exécutez les commandes suivantes pour autoriser un compte Alibaba Cloud :
-- Add the Alibaba Cloud account to the tenant and grant a tenant role to the account.
ADD TENANT USER <Aliyun$xxxx>;
GRANT TENANT ROLE <role_name> TO USER <Aliyun$xxxx>;
-- View the permissions of a tenant role or user.
SHOW GRANTS FOR TENANT ROLE <role_name>;
SHOW GRANTS FOR TENANT USER <user_name>;
SHOW PRINCIPALS FOR TENANT [ROLE] <role_name>;
Autorisation des utilisateurs RAM
Suivez ces étapes pour autoriser un utilisateur RAM :
Connectez-vous à la console MaxCompute et sélectionnez une région dans le coin supérieur gauche.
Dans le volet de navigation de gauche, choisissez .
Sur la page Tenants , cliquez sur l'onglet Users .
Dans l'onglet Users , recherchez l'utilisateur RAM cible et cliquez sur Modify Role dans la colonne Actions .
Dans la boîte de dialogue Edit Role , déplacez les rôles souhaités de la section Available Roles vers la section Added Roles , puis cliquez sur OK .
Utilisation
Utilisation dans les jobs MaxFrame
Pour utiliser le service de calcul de modèles MaxCompute, spécifiez un modèle pris en charge dans une fonction AI MaxFrame.
Exemple : Utilisation du modèle multimodal qwen3,6-plus pour la compréhension d'image
Pour plus de détails sur la syntaxe et des exemples, consultez Fonction AI MaxFrame .
Utilisation dans les jobs SQL
Pour utiliser le service de calcul de modèles MaxCompute dans un job SQL, spécifiez un modèle pris en charge dans une fonction AI. Le code suivant fournit un exemple :
SET odps.namespace.schema=true;
SELECT
prompt,
AI_GENERATE(
bigdata_public_modelset.default.`qwen3.7-max`,
DEFAULT_VERSION,
concat('Perform sentiment classification for the following review. The output must be exactly one of the following three options: Positive, Negative, Neutral. Review:', prompt)
) AS generated_text
FROM (
VALUES
('The weather is great today, and I''m in a good mood! It''s sunny and perfect for a walk.'),
('The weather is great today, and I''m in a good mood! It''s sunny.'),
('Technology is advancing rapidly, and AI is changing our lives.'),
('The prevention and control measures are excellent. Kudos to the healthcare workers!'),
('The quality of this product is very poor.')
) t (prompt);
Pour plus de détails sur la syntaxe et des exemples, consultez AI_GENERATE .