Cette rubrique explique comment utiliser un notebook DMS JupyterNotebook pour interroger et analyser des données. Un notebook est un document interactif qui intègre du code, du texte et des graphiques sur une seule page, ce qui facilite le partage de votre travail avec d'autres utilisateurs.
Interface du notebook
La barre d'outils offre les fonctionnalités suivantes :
: Enregistre vos modifications dans le notebook.
: Insère une cellule au-dessus de la cellule actuelle.
: Supprime la cellule sélectionnée.
: Coupe la cellule sélectionnée.
: Copie la cellule sélectionnée.
: Colle le contenu copié dans la cellule sélectionnée.
: Exécute la cellule sélectionnée.
: Arrête le noyau.
: Redémarre le noyau.
: Redémarre le noyau et réexécute l'intégralité du notebook.
: Bascule le type de cellule entre Code, SQL, Markdown et Raw.
: Ouvre l'interface de chat Copilot.
Fonctionnalités de DMS Jupyter Notebook
DMS Jupyter Notebook est compatible avec le Jupyter Notebook open source. Il propose également des fonctionnalités améliorées pour les requêtes SQL et la visualisation des données.
Noyau IPython
Son fonctionnement est presque identique à celui du Jupyter Notebook open source. Vous pouvez utiliser pip pour installer des packages d'extension et accéder à Internet.
-
Interrogez les données de table dans un notebook en utilisant la syntaxe Spark. Les exemples suivants illustrent cette syntaxe :
-
Syntaxe 1 :
df = spark.sql("select * from customer limit 10").show(); -
Syntaxe 2 :
%%spark_sql select * from customer limit 10; -
Syntaxe 3 :
Dans une cellule, sélectionnez , puis saisissez votre instruction SQL.
CREATE TABLE IF NOT EXISTS 'default'.'select_2' AS SELECT 2;RemarquePar défaut, une cellule Spark SQL affiche un maximum de 3 000 lignes. Pour modifier cette limite, modifiez la variable d'environnement DMS_SPARK_SQL_DEFAULT_LIMIT en saisissant le code suivant dans une cellule :
os.environ['DMS_SPARK_SQL_DEFAULT_LIMIT'] = '3000';
-
-
Dans la barre d'outils du notebook, basculez le type de cellule de Code à SQL.
La syntaxe utilisée dans les cellules SQL est presque identique à celle de l'entrepôt de données logique. Elle prend en charge les requêtes interbases de données et l'analyse en temps réel. Les exigences en matière de permissions sont cohérentes avec les permissions granulaires de DMS.
-
Référencez des variables dans les cellules SQL et Python (en utilisant le format
${variable_name}), personnalisez les noms de variables et consultez les types de variables. La section suivante décrit comment définir, afficher et référencer des variables dans un notebook.-
Définir et référencer des variables
Vous pouvez référencer une variable IPython dans SQL en utilisant ${var}, où var correspond au nom de la variable dans IPython.
target_table = 'archieve_partitions' SELECT * FROM `datafactory`.`${target_table}`; -
Afficher des variables
Dans une cellule IPython, vous pouvez utiliser directement le nom de la variable, qui apparaît dans le coin inférieur gauche de l'ensemble de résultats. Le type de variable est pandas.core.frame.DataFrame. Pour renommer la variable, cliquez sur son nom et saisissez un nouveau nom.
-
-
Les ensembles de résultats SQL peuvent être visualisés en un clic. Les vues sous forme de tableau et de graphique sont prises en charge.
Dans la vue graphique, le volet gauche constitue le panneau de configuration. Vous pouvez définir le Chart type (tel qu'un graphique linéaire), les champs X-axis et Y-axis, ainsi que les conditions de grouping et de filter. Le haut du panneau propose les boutons Try another et Download image.
Noyau PySpark
AnalyticDB Spark est pris en charge par défaut. Spark open source est également pris en charge.
Spark Magic fournit la commande magique %%help pour lister rapidement les commandes prises en charge.
Spark Magic est une extension de Jupyter Notebook.
AnalyticDB Spark
Après avoir acheté un cluster AnalyticDB (édition Data Lakehouse), activé et acheté un groupe de ressources et créé un compte de base de données, vous pouvez utiliser les commandes suivantes :
Commande | Description |
| Vérifie ou résout les problèmes liés à la configuration d'AnalyticDB Spark. |
| Soumet une instruction SQL à AnalyticDB Spark. |
Effectue des opérations DDL en utilisant la syntaxe de lecture et d'écriture dans C-Store. Pour plus d'informations, consultez Lire et écrire dans des tables internes. | |
| Soumet du code Python à AnalyticDB Spark. |
Une session AnalyticDB Spark reste active pendant 20 minutes. Passé ce délai, la session expire et est supprimée. Vous pouvez redémarrer le noyau pour créer une nouvelle session.
Télécharger et télécharger des fichiers
Utilisez ossutil pour télécharger et télécharger les jeux de données dont vous avez besoin. Pour savoir comment configurer ossutil, consultez Configurer ossutil.
Procédure
-
Créez un notebook.
Dans l'onglet Files
, cliquez sur
et sélectionnez Notebook. Dans l'éditeur de cellules, rédigez du contenu au format SQL, Code, Markdown ou Raw.
-
Après avoir vérifié que le SQL généré est correct, exécutez l'instruction et consultez l'ensemble de résultats.
-
Dans la zone SQL générée par Copilot, cliquez sur Execute Query.
L'instruction SQL est automatiquement insérée dans le document à gauche. Le résultat de la requête s'affiche également sous l'instruction SQL.
-
Affichage sous forme de tableau
La requête renvoie sept lignes de la table ORDERS, incluant
O_ORDERKEY(ID de commande),O_CUSTKEY(ID client) etO_ORDERSTATUS(statut de la commande). Le statut de commande pour tous les enregistrements estO. -
Affichage sous forme de graphique
Dans le panneau de configuration de la visualisation des données, définissez le type de graphique sur un line chart, sélectionnez O_ORDERDATE pour le champ de l'axe X et [Total] O_ORDERKEY pour le champ de l'axe Y. Cela génère un graphique linéaire montrant la tendance de O_ORDERKEY agrégée par date de commande.
-
-
-
Une fois l'instruction SQL exécutée avec succès, vous pouvez référencer son ensemble de résultats comme une variable dans d'autres cellules SQL. Vous pouvez également renommer la variable.
Par exemple, le résultat de la requête SQL crée automatiquement une variable nommée
SQL_949364. Dans une cellule de code Python, exécutezSQL_RES=SQL_949364pour assigner le résultat à une variable personnalisée nomméeSQL_RES. La valeur de retour est un DataFrame pandas. -
Prédisez les tendances des données.
-
Installez les packages Python d'apprentissage automatique en exécutant le code suivant dans une cellule.
pip install pandas numpy matplotlib scikit-Learn Une fois les packages installés, saisissez du code Python pour prédire les données et visualiser les résultats.
-
Étapes suivantes
FAQ
Q : Qui peut consulter les documents de notebook ?
R : Seuls les membres du même espace de travail et du même locataire peuvent les consulter. Si l'utilisateur cible ne fait pas partie du locataire actuel, ajoutez-le au même locataire que le créateur de l'espace de travail, puis ajoutez-le en tant que membre de l'espace de travail.