Tous les produits
Search
Centre de documentation

Data Management:Développer avec des notebooks

Dernière mise à jour :Aug 27, 2026

Cette rubrique explique comment utiliser un notebook DMS JupyterNotebook pour interroger et analyser des données. Un notebook est un document interactif qui intègre du code, du texte et des graphiques sur une seule page, ce qui facilite le partage de votre travail avec d'autres utilisateurs.

Interface du notebook

La barre d'outils offre les fonctionnalités suivantes :

  • image : Enregistre vos modifications dans le notebook.

  • image : Insère une cellule au-dessus de la cellule actuelle.

  • image : Supprime la cellule sélectionnée.

  • image : Coupe la cellule sélectionnée.

  • image : Copie la cellule sélectionnée.

  • image : Colle le contenu copié dans la cellule sélectionnée.

  • image : Exécute la cellule sélectionnée.

  • image : Arrête le noyau.

  • image : Redémarre le noyau.

  • image : Redémarre le noyau et réexécute l'intégralité du notebook.

  • image : Bascule le type de cellule entre Code, SQL, Markdown et Raw.

  • image : Ouvre l'interface de chat Copilot.

Fonctionnalités de DMS Jupyter Notebook

DMS Jupyter Notebook est compatible avec le Jupyter Notebook open source. Il propose également des fonctionnalités améliorées pour les requêtes SQL et la visualisation des données.

Noyau IPython

Son fonctionnement est presque identique à celui du Jupyter Notebook open source. Vous pouvez utiliser pip pour installer des packages d'extension et accéder à Internet.

  • Interrogez les données de table dans un notebook en utilisant la syntaxe Spark. Les exemples suivants illustrent cette syntaxe :

    • Syntaxe 1 :

      df = spark.sql("select * from customer limit 10").show();
    • Syntaxe 2 :

      %%spark_sql 
      select * from customer limit 10;
    • Syntaxe 3 :

      Dans une cellule, sélectionnez SQL > Spark SQL, puis saisissez votre instruction SQL.

      CREATE TABLE IF NOT EXISTS 'default'.'select_2' AS SELECT 2;
      Remarque

      Par défaut, une cellule Spark SQL affiche un maximum de 3 000 lignes. Pour modifier cette limite, modifiez la variable d'environnement DMS_SPARK_SQL_DEFAULT_LIMIT en saisissant le code suivant dans une cellule :

      os.environ['DMS_SPARK_SQL_DEFAULT_LIMIT'] = '3000';
  • Dans la barre d'outils du notebook, basculez le type de cellule de Code à SQL.

    La syntaxe utilisée dans les cellules SQL est presque identique à celle de l'entrepôt de données logique. Elle prend en charge les requêtes interbases de données et l'analyse en temps réel. Les exigences en matière de permissions sont cohérentes avec les permissions granulaires de DMS.

  • Référencez des variables dans les cellules SQL et Python (en utilisant le format ${variable_name}), personnalisez les noms de variables et consultez les types de variables. La section suivante décrit comment définir, afficher et référencer des variables dans un notebook.

    • Définir et référencer des variables

      Vous pouvez référencer une variable IPython dans SQL en utilisant ${var}, où var correspond au nom de la variable dans IPython.

      target_table = 'archieve_partitions'
      SELECT
          *
      FROM
          `datafactory`.`${target_table}`;
    • Afficher des variables

      Dans une cellule IPython, vous pouvez utiliser directement le nom de la variable, qui apparaît dans le coin inférieur gauche de l'ensemble de résultats. Le type de variable est pandas.core.frame.DataFrame. Pour renommer la variable, cliquez sur son nom et saisissez un nouveau nom.

  • Les ensembles de résultats SQL peuvent être visualisés en un clic. Les vues sous forme de tableau et de graphique sont prises en charge.

    Dans la vue graphique, le volet gauche constitue le panneau de configuration. Vous pouvez définir le Chart type (tel qu'un graphique linéaire), les champs X-axis et Y-axis, ainsi que les conditions de grouping et de filter. Le haut du panneau propose les boutons Try another et Download image.

Noyau PySpark

AnalyticDB Spark est pris en charge par défaut. Spark open source est également pris en charge.

Spark Magic fournit la commande magique %%help pour lister rapidement les commandes prises en charge.

Remarque

Spark Magic est une extension de Jupyter Notebook.

AnalyticDB Spark

Après avoir acheté un cluster AnalyticDB (édition Data Lakehouse), activé et acheté un groupe de ressources et créé un compte de base de données, vous pouvez utiliser les commandes suivantes :

Commande

Description

%%info

Vérifie ou résout les problèmes liés à la configuration d'AnalyticDB Spark.

%%sql

Soumet une instruction SQL à AnalyticDB Spark.

Effectue des opérations DDL en utilisant la syntaxe de lecture et d'écriture dans C-Store. Pour plus d'informations, consultez Lire et écrire dans des tables internes.

%%spark

Soumet du code Python à AnalyticDB Spark.

Remarque

Une session AnalyticDB Spark reste active pendant 20 minutes. Passé ce délai, la session expire et est supprimée. Vous pouvez redémarrer le noyau pour créer une nouvelle session.

Télécharger et télécharger des fichiers

Utilisez ossutil pour télécharger et télécharger les jeux de données dont vous avez besoin. Pour savoir comment configurer ossutil, consultez Configurer ossutil.

Procédure

  1. Créez un notebook.

    Dans l'onglet Files image, cliquez sur image et sélectionnez Notebook.

  2. Dans l'éditeur de cellules, rédigez du contenu au format SQL, Code, Markdown ou Raw.

  3. Utiliser Copilot pour générer du SQL.

  4. Après avoir vérifié que le SQL généré est correct, exécutez l'instruction et consultez l'ensemble de résultats.

    1. Dans la zone SQL générée par Copilot, cliquez sur Execute Query.

      L'instruction SQL est automatiquement insérée dans le document à gauche. Le résultat de la requête s'affiche également sous l'instruction SQL.

      • Affichage sous forme de tableau

        La requête renvoie sept lignes de la table ORDERS, incluant O_ORDERKEY (ID de commande), O_CUSTKEY (ID client) et O_ORDERSTATUS (statut de la commande). Le statut de commande pour tous les enregistrements est O.

      • Affichage sous forme de graphique

        Dans le panneau de configuration de la visualisation des données, définissez le type de graphique sur un line chart, sélectionnez O_ORDERDATE pour le champ de l'axe X et [Total] O_ORDERKEY pour le champ de l'axe Y. Cela génère un graphique linéaire montrant la tendance de O_ORDERKEY agrégée par date de commande.

  5. Une fois l'instruction SQL exécutée avec succès, vous pouvez référencer son ensemble de résultats comme une variable dans d'autres cellules SQL. Vous pouvez également renommer la variable.

    Par exemple, le résultat de la requête SQL crée automatiquement une variable nommée SQL_949364. Dans une cellule de code Python, exécutez SQL_RES=SQL_949364 pour assigner le résultat à une variable personnalisée nommée SQL_RES. La valeur de retour est un DataFrame pandas.

  6. Prédisez les tendances des données.

    1. Installez les packages Python d'apprentissage automatique en exécutant le code suivant dans une cellule.

      pip install pandas numpy matplotlib scikit-Learn
    2. Une fois les packages installés, saisissez du code Python pour prédire les données et visualiser les résultats.

Étapes suivantes

Publier un agent IA

FAQ

Q : Qui peut consulter les documents de notebook ?

R : Seuls les membres du même espace de travail et du même locataire peuvent les consulter. Si l'utilisateur cible ne fait pas partie du locataire actuel, ajoutez-le au même locataire que le créateur de l'espace de travail, puis ajoutez-le en tant que membre de l'espace de travail.