Superset est un outil léger d'intelligence décisionnelle (BI). Connectez-le aux sources de données E-MapReduce (EMR) Druid ou Hive pour exécuter des requêtes, créer des graphiques et publier des tableaux de bord, le tout depuis un navigateur. Les exemples présentés utilisent un cluster EMR V3.34.0.
Prérequis
Avant de commencer, assurez-vous de disposer des éléments suivants :
Un cluster EMR Hadoop ou Druid pour lequel vous avez sélectionné Superset comme service optionnel lors de la création. Pour obtenir des instructions, consultez Créer un cluster.
Un accès réseau depuis votre ordinateur vers le nœud emr-header-1 du cluster. L'interface utilisateur web de Superset n'est accessible que via un tunnel SSH vers ce nœud. Pour configurer cet accès, reportez-vous à Créer un tunnel SSH pour accéder aux interfaces utilisateur web des composants open source.
Limitations
Superset s'exécute uniquement sur le nœud emr-header-1 et ne peut pas être déployé en mode haute disponibilité (HA).
Knox ne permet pas d'accéder à l'interface utilisateur web de Superset.
Accéder à EMR Druid depuis Superset
Superset est étroitement intégré à EMR Druid. Vous pouvez interroger Druid en utilisant soit SQL, soit le langage de requête natif de Druid.
Étape 1 : Se connecter à Superset
Ouvrez l'interface utilisateur web de Superset via votre tunnel SSH. Le nom d'utilisateur et le mot de passe par défaut sont tous deux admin. Modifiez le mot de passe immédiatement après votre première connexion.
L'interface utilisateur s'affiche en anglais lors de la première connexion.
Étape 2 : Ajouter un cluster EMR Druid
Sélectionnez Sources > Druid Clusters.
Cliquez sur l'icône
.-
Dans la boîte de dialogue Add Druid Cluster , configurez les paramètres suivants.
Paramètre Description Broker Host Saisissez emr-header-1. Cette valeur est fixe.Broker Port Saisissez 1suivi du numéro de port Broker open source. Par exemple, si le port Broker est8082, saisissez18082.Cluster Name Saisissez le nom du cluster Druid que vous avez créé dans la console EMR. 
Cliquez sur Save.
Étape 3 : Ajouter une source de données
Sélectionnez Sources > Druid Datasources.
Cliquez sur l'icône
.-
Dans la boîte de dialogue Add Druid Datasource , configurez les paramètres suivants.
Paramètre Description Datasource Name Saisissez un nom pour la source de données. Cluster Sélectionnez le cluster EMR Druid ajouté à l'étape précédente. 
Cliquez sur Save. Après l'enregistrement, cliquez sur l'icône
pour spécifier les colonnes de dimension et les colonnes de métrique.
Étape 4 : Vérifier la connexion
Cliquez sur le nom de la source de données pour afficher les détails du cluster EMR Druid.

Accéder à une base de données Hive depuis Superset
Superset utilise SQLAlchemy pour se connecter aux bases de données relationnelles et aux moteurs de requête Big Data, notamment MySQL, Oracle, PostgreSQL, Microsoft SQL Server, Hive, Presto et Druid. Hive est installé par défaut sur les clusters EMR Hadoop.
Pour consulter les autres types de bases de données pris en charge, reportez-vous à la documentation des dialectes SQLAlchemy.
Étape 1 : Se connecter à Superset
Ouvrez l'interface utilisateur web de Superset via votre tunnel SSH. Le nom d'utilisateur et le mot de passe par défaut sont tous deux admin.
Étape 2 : Ajouter une base de données Hive
Sélectionnez Sources > Databases.
Cliquez sur l'icône
.-
Dans la boîte de dialogue Add Database , configurez les paramètres suivants.
Paramètre Description Database Saisissez un nom pour la connexion à la base de données. SQLAlchemy URI Saisissez hive://emr-header-1:10000/.
Cliquez sur Save.
Étape 3 : Ajouter une table
Sélectionnez Sources > Tables.
Cliquez sur l'icône
.-
Dans la boîte de dialogue Import a table definition , configurez les paramètres suivants.
Paramètre Description Database Sélectionnez la base de données ajoutée à l'étape précédente. Table Name Saisissez le nom d'une table présente dans cette base de données. Cet exemple utilise une table nommée test.
Cliquez sur Save.
Étape 4 : Interroger les données
Sélectionnez SQL Lab > SQL Editor.
Sélectionnez Hive JDBC Server comme base de données.
Sélectionnez default comme schéma.
Exécutez votre requête Hive.
FAQ
L'utilisateur admin voit « invalid login » lors de sa première connexion.
Ce problème survient sur les clusters EMR dont la version mineure est antérieure à la V4.6 ou à la V3.33. Pour le résoudre, exécutez les commandes suivantes sur le nœud maître en tant qu'utilisateur root :
Connectez-vous au nœud maître via SSH. Pour obtenir des instructions, consultez Se connecter à un cluster.
-
Activez l'environnement Superset :
source /usr/lib/superset-current/bin/activate -
Créez un compte administrateur :
superset fab create-adminSaisissez le nom d'utilisateur, le prénom, le nom, l'adresse e-mail, le mot de passe et sa confirmation lorsque vous y êtes invité. Les valeurs par défaut sont les suivantes :
Username [admin]: User first name [admin]: User last name [user]: Email [admin@fab.org]: Password: Repeat for confirmation: -
Initialisez la base de données :
superset db upgrade -
Initialisez Superset :
superset init
Une fois ces étapes terminées, créez un tunnel SSH et connectez-vous avec le compte que vous venez de créer.