Tous les produits
Search
Centre de documentation

E-MapReduce:Superset (disponible uniquement pour les utilisateurs existants)

Dernière mise à jour :Aug 09, 2026

Superset est un outil léger d'intelligence décisionnelle (BI). Connectez-le aux sources de données E-MapReduce (EMR) Druid ou Hive pour exécuter des requêtes, créer des graphiques et publier des tableaux de bord, le tout depuis un navigateur. Les exemples présentés utilisent un cluster EMR V3.34.0.

Prérequis

Avant de commencer, assurez-vous de disposer des éléments suivants :

Limitations

  • Superset s'exécute uniquement sur le nœud emr-header-1 et ne peut pas être déployé en mode haute disponibilité (HA).

  • Knox ne permet pas d'accéder à l'interface utilisateur web de Superset.

Accéder à EMR Druid depuis Superset

Superset est étroitement intégré à EMR Druid. Vous pouvez interroger Druid en utilisant soit SQL, soit le langage de requête natif de Druid.

Étape 1 : Se connecter à Superset

Ouvrez l'interface utilisateur web de Superset via votre tunnel SSH. Le nom d'utilisateur et le mot de passe par défaut sont tous deux admin. Modifiez le mot de passe immédiatement après votre première connexion.

L'interface utilisateur s'affiche en anglais lors de la première connexion.

Étape 2 : Ajouter un cluster EMR Druid

  1. Sélectionnez Sources > Druid Clusters.

  2. Cliquez sur l'icône Add.

  3. Dans la boîte de dialogue Add Druid Cluster , configurez les paramètres suivants.

    Paramètre Description
    Broker Host Saisissez emr-header-1. Cette valeur est fixe.
    Broker Port Saisissez 1 suivi du numéro de port Broker open source. Par exemple, si le port Broker est 8082, saisissez 18082.
    Cluster Name Saisissez le nom du cluster Druid que vous avez créé dans la console EMR.

    Add Druid

  4. Cliquez sur Save.

Étape 3 : Ajouter une source de données

  1. Sélectionnez Sources > Druid Datasources.

  2. Cliquez sur l'icône Add.

  3. Dans la boîte de dialogue Add Druid Datasource , configurez les paramètres suivants.

    Paramètre Description
    Datasource Name Saisissez un nom pour la source de données.
    Cluster Sélectionnez le cluster EMR Druid ajouté à l'étape précédente.

    datasource

  4. Cliquez sur Save. Après l'enregistrement, cliquez sur l'icône Edit pour spécifier les colonnes de dimension et les colonnes de métrique.

Étape 4 : Vérifier la connexion

Cliquez sur le nom de la source de données pour afficher les détails du cluster EMR Druid.

check-datasource

Accéder à une base de données Hive depuis Superset

Superset utilise SQLAlchemy pour se connecter aux bases de données relationnelles et aux moteurs de requête Big Data, notamment MySQL, Oracle, PostgreSQL, Microsoft SQL Server, Hive, Presto et Druid. Hive est installé par défaut sur les clusters EMR Hadoop.

Pour consulter les autres types de bases de données pris en charge, reportez-vous à la documentation des dialectes SQLAlchemy.

Étape 1 : Se connecter à Superset

Ouvrez l'interface utilisateur web de Superset via votre tunnel SSH. Le nom d'utilisateur et le mot de passe par défaut sont tous deux admin.

Étape 2 : Ajouter une base de données Hive

  1. Sélectionnez Sources > Databases.

  2. Cliquez sur l'icône Add.

  3. Dans la boîte de dialogue Add Database , configurez les paramètres suivants.

    Paramètre Description
    Database Saisissez un nom pour la connexion à la base de données.
    SQLAlchemy URI Saisissez hive://emr-header-1:10000/.

    DataBase

  4. Cliquez sur Save.

Étape 3 : Ajouter une table

  1. Sélectionnez Sources > Tables.

  2. Cliquez sur l'icône Add.

  3. Dans la boîte de dialogue Import a table definition , configurez les paramètres suivants.

    Paramètre Description
    Database Sélectionnez la base de données ajoutée à l'étape précédente.
    Table Name Saisissez le nom d'une table présente dans cette base de données. Cet exemple utilise une table nommée test.

    add table

  4. Cliquez sur Save.

Étape 4 : Interroger les données

  1. Sélectionnez SQL Lab > SQL Editor.

  2. Sélectionnez Hive JDBC Server comme base de données.

  3. Sélectionnez default comme schéma.

  4. Exécutez votre requête Hive.

FAQ

L'utilisateur admin voit « invalid login » lors de sa première connexion.

Ce problème survient sur les clusters EMR dont la version mineure est antérieure à la V4.6 ou à la V3.33. Pour le résoudre, exécutez les commandes suivantes sur le nœud maître en tant qu'utilisateur root :

  1. Connectez-vous au nœud maître via SSH. Pour obtenir des instructions, consultez Se connecter à un cluster.

  2. Activez l'environnement Superset :

    source /usr/lib/superset-current/bin/activate
  3. Créez un compte administrateur :

    superset fab create-admin

    Saisissez le nom d'utilisateur, le prénom, le nom, l'adresse e-mail, le mot de passe et sa confirmation lorsque vous y êtes invité. Les valeurs par défaut sont les suivantes :

    Username [admin]:
    User first name [admin]:
    User last name [user]:
    Email [admin@fab.org]:
    Password:
    Repeat for confirmation:
  4. Initialisez la base de données :

    superset db upgrade
  5. Initialisez Superset :

    superset init

Une fois ces étapes terminées, créez un tunnel SSH et connectez-vous avec le compte que vous venez de créer.