Tous les produits
Search
Centre de documentation

:Achat et utilisation du service de calcul de modèles MaxCompute

Dernière mise à jour :Aug 10, 2026

Pour utiliser des modèles dans MaxCompute afin de traiter des données ou d'effectuer une inférence hors ligne sans gérer vos propres ressources GPU, souscrivez au service de calcul de modèles MaxCompute pour répondre à vos exigences en matière d'inférence de modèles et de performances.

Régions et modèles pris en charge

  • Régions prises en charge : le service de calcul de modèles est disponible uniquement dans les régions suivantes.

    • Chine continentale : Chine (Pékin), Chine (Shanghai), Chine (Hangzhou), Chine (Shenzhen), Chine (Ulanqab)

    • International : Singapour

  • Modèles pris en charge

    |
    **Modèle**
    |
    **Entrée prise en charge**
    |
    **Description**
    | | --- | --- | --- | |
    `qwen3.7-max`
    |
    Entrée textuelle uniquement
    |
    Modèle phare de la série Qwen 3.7. Il offre des améliorations complètes en matière d'inférence, de génération de code et de compréhension multilingue, ce qui le rend adapté aux tâches hautement complexes.
    | |
    `qwen3.7-plus`
    |
    Entrée multimodale prise en charge
    |
    Modèle équilibré de la série Qwen 3.7 qui concilie performances et coûts, adapté aux scénarios de niveau entreprise tels que l'analyse de textes longs et les conversations multi-tours.
    | |
    `qwen3-vl-embedding`
    |
    Entrée multimodale prise en charge
    |
    Modèle d'incorporation multimodal Qwen. Il crée des représentations vectorielles à partir d'entrées mixtes image-texte et convient à la récupération intermodale et à la mise en correspondance image-texte.
    | |
    `text-embedding-v4`
    |
    Entrée textuelle uniquement
    |
    Modèle d'incorporation de texte haute précision adapté aux tâches telles que la recherche sémantique, le clustering et le calcul de similarité.
    | |
    `qwen3.6-plus`
    |
    Entrée multimodale prise en charge
    |
    Modèle équilibré de la série Qwen 3.6 qui concilie performances et coûts, adapté aux tâches générales telles que la conversation, la synthèse et l'analyse.
    | |
    `qwen3.6-flash`
    |
    Entrée multimodale prise en charge
    |
    Modèle léger et rapide de la série Qwen 3.6. Ses temps de réponse rapides et ses faibles coûts en font une solution idéale pour les services en ligne à forte concurrence et à faible latence.
    | |
    `deepseek-v4-pro`
    |
    Entrée textuelle uniquement
    |
    Modèle d'inférence phare de quatrième génération de DeepSeek. Il excelle dans les tâches difficiles telles que les mathématiques, la programmation et le raisonnement logique complexe.
    | |
    `deepseek-v4-flash`
    |
    Entrée textuelle uniquement
    |
    Modèle léger de quatrième génération de DeepSeek. Avec une inférence rapide et rentable, il est idéal pour la conversation quotidienne et les tâches de raisonnement légères.
    | |
    `qwen3.5-397b-a17b`
    |
    Entrée multimodale prise en charge
    |
    Modèle Mixture-of-Experts (MoE) de la série Qwen 3.5. Il se caractérise par une activation efficace des paramètres, une vaste base de connaissances et des capacités de raisonnement en plusieurs étapes. Il est conçu pour la déduction logique difficile, la génération de code full-stack et les questions-réponses approfondies.
    | |
    `qwen3-asr-flash`
    |
    Entrée multimodale prise en charge
    |
    Modèle léger de reconnaissance automatique de la parole (ASR) de la série Qwen 3. Sa transcription en temps réel à faible latence et à forte concurrence est idéale pour les scénarios de traitement audio tels que la transcription de réunions, le sous-titrage en direct et la reconnaissance de commandes vocales.
    | |
    `qwen3-max` (Sera obsolète)
    |
    Entrée textuelle uniquement
    |
    Grand modèle linguistique haute performance de la série Qwen, adapté à l'inférence complexe et à la génération de contenu.
    |







































































Facturation

Pour plus de détails, consultez Frais de calcul de modèles (frais par jeton).

Avant de commencer

Il vous suffit d'activer le service une fois par région. Après l'activation, le service est disponible par défaut pour tous les projets de cette région.

  1. Connectez-vous à la console MaxCompute et sélectionnez une région dans le coin supérieur gauche.

  2. Dans le volet de navigation de gauche, choisissez Manage Configurations > Quotas .

  3. Sur la page Quotas , cliquez sur New Quota .

    Sur la page d'achat, pour Product Type, sélectionnez Service de calcul de modèles .

  4. Sur la page du service de calcul de modèles MaxCompute, sélectionnez une région, acceptez le contrat de service, puis activez le service.

  5. Une fois l'achat terminé, revenez à la console. Un quota Paiement à l'utilisation nommé ai_InferenceQuota apparaît sur la page Quota Management .

Accorder des permissions

Par défaut, aucun compte (y compris les comptes Alibaba Cloud) ni rôle ne dispose de l'autorisation de spécifier un quota au niveau du job. Vous devez explicitement accorder les autorisations requises avant de pouvoir utiliser cette fonctionnalité.

Créer un rôle

  1. Connectez-vous à la console MaxCompute et sélectionnez une région dans le coin supérieur gauche.

  2. Dans le volet de navigation de gauche, choisissez Manage Configurations > Tenants .

  3. Sur la page Tenants , cliquez sur l'onglet Roles .

  4. Dans l'onglet Roles , cliquez sur Add Role . Dans la boîte de dialogue Add Role , saisissez un Role Name personnalisé, fournissez le Policy Content , puis cliquez sur OK .

    {
        "Statement": [{
                "Action": [
                    "odps:List",
                    "odps:Usage"],
                "Effect": "Allow",
                "Resource": ["acs:odps:*:regions/*/quotas/*"]}],
        "Version": "1"
    }

Attribuer le rôle aux comptes

Votre compte Alibaba Cloud ou un utilisateur RAM disposant de l'autorisation Super_Administrator peut accorder ces autorisations. Le processus d'autorisation varie selon le type de compte.

Autorisation des comptes Alibaba Cloud

Exécutez les commandes suivantes pour autoriser un compte Alibaba Cloud :

-- Add the Alibaba Cloud account to the tenant and grant a tenant role to the account.
ADD TENANT USER <Aliyun$xxxx>;
GRANT TENANT ROLE <role_name> TO USER <Aliyun$xxxx>;

-- View the permissions of a tenant role or user.
SHOW GRANTS FOR TENANT ROLE <role_name>;
SHOW GRANTS FOR TENANT USER <user_name>;
SHOW PRINCIPALS FOR TENANT [ROLE] <role_name>;

Autorisation des utilisateurs RAM

Suivez ces étapes pour autoriser un utilisateur RAM :

  1. Connectez-vous à la console MaxCompute et sélectionnez une région dans le coin supérieur gauche.

  2. Dans le volet de navigation de gauche, choisissez Manage Configurations > Tenants .

  3. Sur la page Tenants , cliquez sur l'onglet Users .

  4. Dans l'onglet Users , recherchez l'utilisateur RAM cible et cliquez sur Modify Role dans la colonne Actions .

  5. Dans la boîte de dialogue Edit Role , déplacez les rôles souhaités de la section Available Roles vers la section Added Roles , puis cliquez sur OK .

Utilisation

Utilisation dans les jobs MaxFrame

Pour utiliser le service de calcul de modèles MaxCompute, spécifiez un modèle pris en charge dans une fonction AI MaxFrame.

Exemple : Utilisation du modèle multimodal qwen3,6-plus pour la compréhension d'image

Exemple de code

import os

import pandas as pd
import maxframe.dataframe as md
from maxframe import new_session
from maxframe.config import options
from maxframe.learn.contrib.llm import ImageContentType
from maxframe.learn.utils import read_odps_model
from odps import ODPS

# Configure the execution engine: DPE first
options.dag.settings = {
    "engine_order": ["DPE", "MCSQL"],
}

# 1. Create an ODPS connection
o = ODPS(
    os.getenv("ALIBABA_CLOUD_ACCESS_KEY_ID"),
    os.getenv("ALIBABA_CLOUD_ACCESS_KEY_SECRET"),
    project="<your-project-name>",
    endpoint="<your-endpoint>",  # Example: https://service.cn-shanghai.maxcompute.aliyun.com/api
)

# 2. Configure the engine and create a session
# Note: Inference for Model Studio (Bailian) VL models runs on the DPE engine
# and is billed based on token consumption. No CU or GU provisioning needed.

# Create a MaxFrame session
session = new_session(o)
print(f"Session ID: {session.session_id}")
print(f"Logview: {session.get_logview_address()}")

# Load the VL model from the Model Studio (Bailian) public model set
image_llm = read_odps_model(
    "qwen3.6-plus", project="bigdata_public_modelset", odps_entry=o
)

## 4. Prepare image data from OSS

# Use the `oss://<endpoint>/<bucket>/<path>` format and pass your OSS access credentials through `storage_options`.
# OSS configuration
OSS_ENDPOINT = "oss-cn-shanghai-internal.aliyuncs.com"  # Replace with your OSS endpoint
OSS_BUCKET = "your-bucket"                              # Replace with your bucket name
OSS_PREFIX = "images"                                   # Replace with the image path prefix

storage_options = {
    "access_key_id": os.getenv("OSS_ACCESS_KEY_ID"),
    "access_key_secret": os.getenv("OSS_ACCESS_KEY_SECRET"),
}

# Construct a list of image URLs
image_urls = [
    f"oss://{OSS_ENDPOINT}/{OSS_BUCKET}/{OSS_PREFIX}/image{i}.jpg"
    for i in range(1, 9)
]

df = md.DataFrame({"image_url": image_urls})
df.execute()

## 5. Call the VL model for image understanding

# Pass the text prompt and OSS images to the model by using the `generate()` interface.

cp = image_llm.content_part

result_df = image_llm.generate(
    df,
    messages=[
        {
            "role": "user",
            "content": [
                cp.text("Describe this image in one sentence"),
                cp.image(
                    data=df.image_url,
                    type=ImageContentType.IMAGE_URL,
                    storage_options=storage_options,
                ),
            ],
        }
    ],
    simple_output=True,
    params={"max_tokens": 128},
)

## 6. Run the inference and view the results

# MaxFrame uses lazy execution. Call .execute() to trigger the actual computation.
result = result_df.execute()
print(result)

## 7. Clean up resources
session.destroy()
print("Session destroyed")

Pour plus de détails sur la syntaxe et des exemples, consultez Fonction AI MaxFrame .

Utilisation dans les jobs SQL

Pour utiliser le service de calcul de modèles MaxCompute dans un job SQL, spécifiez un modèle pris en charge dans une fonction AI. Le code suivant fournit un exemple :

SET odps.namespace.schema=true;

SELECT 
    prompt,
    AI_GENERATE(
        bigdata_public_modelset.default.`qwen3.7-max`,
        DEFAULT_VERSION,
        concat('Perform sentiment classification for the following review. The output must be exactly one of the following three options: Positive, Negative, Neutral. Review:', prompt)
    ) AS generated_text
FROM (
    VALUES 
        ('The weather is great today, and I''m in a good mood! It''s sunny and perfect for a walk.'),
        ('The weather is great today, and I''m in a good mood! It''s sunny.'),
        ('Technology is advancing rapidly, and AI is changing our lives.'),
        ('The prevention and control measures are excellent. Kudos to the healthcare workers!'),
        ('The quality of this product is very poor.')
) t (prompt);

Pour plus de détails sur la syntaxe et des exemples, consultez AI_GENERATE .