Aller au contenu principal

Types de visualisation de Notebook et d'éditeur SQL

Cette page présente les types de visualisations disponibles dans les Notebooks Databricks et dans l'éditeur SQL, et vous montre comment créer un exemple de chaque type de visualisation.

important

Cette page couvre les visualisations pour les Notebooks Databricks et l'éditeur SQL . Pour les visualisations dans les AI/BI dashboards, consultez les types de visualisation de AI/BI dashboard.

Graphique en aires

Les graphiques en aires combinent les courbes et les histogrammes pour montrer comment les valeurs numériques d’un ou plusieurs groupes changent au fil de la progression d’une deuxième variable, généralement le temps. Ils sont souvent utilisés pour montrer l'évolution du funnel de Ventes au fil du temps.

remarque

Les graphiques en aires prennent en charge les agrégations backend, fournissant un support pour les queries renvoyant plus de 64K lignes de données sans troncation du jeu de résultats.

Exemple de graphique en aires

Valeurs de configuration : Pour cette visualisation de graphique de zone, les valeurs suivantes ont été définies :

  • Colonne X :

    • Colonne du dataset : o_orderdate
    • Niveau de date : Years
  • Colonnes Y :

    • Colonne du dataset : o_totalprice
    • Type d’agrégation : Sum
  • Regrouper par (colonne du dataset) : o_orderpriority

  • Empilement : Stack

  • Nom de l'axe X (remplacer la valeur par default) : Order year

  • Nom de l'axe Y (remplace la valeur default) : Total price

Options de configuration : Pour les options de configuration des graphiques de zone, consultez les options de configuration de graphique.

**query SQL** : pour cette visualisation de graphique de zone, la query SQL suivante a été utilisée pour générer le dataset.

SQL
select * from samples.tpch.orders

Graphique à barres

Les diagrammes à barres représentent l’évolution des métriques au fil du temps ou la proportionnalité, de manière similaire à un graphique circulaire.

remarque

Les diagrammes à barres prennent en charge les agrégations backend, offrant un support pour les requêtes renvoyant plus de 64K lignes de données sans troncation de l'ensemble de résultats.

Exemple de graphique à barres

Valeurs de configuration : pour cette visualisation en diagramme à barres, les valeurs suivantes ont été définies :

  • Colonne X :

    • Colonne du dataset : o_orderdate
    • Niveau de date : Months
  • Colonnes Y :

    • Colonne du dataset : o_totalprice
    • Type d’agrégation : Sum
  • Regrouper par (colonne du dataset) : o_orderpriority

  • Empilement : Stack

  • Nom de l'axe X (remplacer la valeur par default) : Order month

  • Nom de l'axe Y (remplace la valeur default) : Total price

Options de configuration : Pour les options de configuration des graphiques à barres, consultez les options de configuration des graphiques.

Query SQL : Pour cette visualisation de graphique à barres, la query SQL suivante a été utilisée pour générer l'ensemble de données.

SQL
select * from samples.tpch.orders

Graphique à bulles

Les graphiques à bulles sont des nuages de points où la taille de chaque marqueur de point reflète une métrique pertinente.

remarque

Les graphiques à bulles prennent en charge les agrégations backend, offrant une prise en charge des requêtes retournant plus de 64 K lignes de données sans troncation du jeu de résultats.

Exemple de bulle

Valeurs de configuration : Pour cette visualisation de diagramme à bulles, les valeurs suivantes ont été définies :

  • X (colonne de dataset) : l_quantity
  • Colonnes Y (colonne du dataset) : l_extendedprice
  • Regrouper par (colonne du dataset) : l_returnflag
  • Colonne de taille des bulles (colonne de dataset) : l_tax
  • Coefficient de taille de bulle : 20
  • Taille de la bulle proportionnelle à : Area
  • Nom de l'axe X (remplacer la valeur par default) : Quantity
  • Nom de l'axe Y (remplace la valeur default) : Extended price

Options de configuration : Pour les options de configuration du graphique à bulles, consultez options de configuration du graphique.

Requête SQL : pour cette visualisation de graphique à bulles, la requête SQL suivante a été utilisée pour générer l'ensemble de données.

SQL
select * from samples.tpch.lineitem where l_quantity < 45

Diagramme en boîte

La visualisation de diagramme en boîte montre le résumé de la distribution des données numériques, optionnellement groupées par catégorie. En utilisant une visualisation de diagramme en boîte, vous pouvez rapidement comparer les plages de valeurs entre les catégories et visualiser les groupes de localité, de dispersion et d'asymétrie des valeurs à travers leurs quartiles. Dans chaque boîte, la ligne plus foncée représente l'intervalle interquartile. Pour plus d'informations sur l'interprétation des visualisations de boîtes à moustaches, consultez l'article sur les diagrammes en boîte sur Wikipédia.

remarque

Les diagrammes en boîte ne prennent en charge l'agrégation que pour un maximum de 64 000 lignes. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Exemple de graphique en boîte

Valeurs de configuration : pour cette visualisation de graphique en boîte, les valeurs suivantes ont été définies :

  • Colonne X (colonne du dataset) : l_returnflag
  • Colonnes Y (colonne du dataset) : l_extendedprice
  • Regrouper par (colonne du dataset) : l_shipmode
  • Nom de l'axe X (remplacer la valeur par default) : Return flag
  • Nom de l'axe Y (remplace la valeur default) : Extended price

Options de configuration : pour les options de configuration du graphique en boîte, voir options de configuration du graphique en boîte.

Requête SQL : Pour cette visualisation de diagramme en boîte, la requête SQL suivante a été utilisée pour générer le jeu de données.

SQL
select * from samples.tpch.lineitem

Analyse de cohorte

Une analyse de cohorte examine les résultats de groupes prédéfinis, appelés cohortes, à mesure qu'ils progressent à travers un ensemble d'étapes. La visualisation de cohorte agrège uniquement les données par date (elle permet des agrégations mensuelles). Il n'effectue pas d'autres agrégations de données au sein de l'ensemble de résultats. Toutes les autres agrégations sont effectuées au sein de la query elle-même.

Exemple de cohorte

Valeurs de configuration : Pour cette visualisation de cohorte, les valeurs suivantes ont été définies :

  • Date (compartiment) (colonne de base de données) : cohort_month
  • Étape (colonne de base de données) : months
  • Taille de la population du compartiment (colonne de base de données) : size
  • Valeur de l'étape (colonne de base de données) : active
  • Intervalle de temps : monthly

Options de configuration : Pour les options de configuration de cohorte, consultez les options de configuration des graphiques de cohorte.

Requête SQL : pour cette visualisation de cohorte, la requête SQL suivante a été utilisée pour générer le jeu de données.

SQL
-- match each customer with its cohort by month
with cohort_dates as (
SELECT o_custkey, min(date_trunc('month', o_orderdate)) as cohort_month
FROM samples.tpch.orders
GROUP BY 1
),
-- find the size of each cohort
cohort_size as (
SELECT cohort_month, count(distinct o_custkey) as size
FROM cohort_dates
GROUP BY 1
)
-- for each cohort and month thereafter, find the number of active customers
SELECT
cohort_dates.cohort_month,
ceil(months_between(date_trunc('month', samples.tpch.orders.o_orderdate), cohort_dates.cohort_month)) as months,
count(distinct samples.tpch.orders.o_custkey) as active,
first(size) as size
FROM samples.tpch.orders
left join cohort_dates on samples.tpch.orders.o_custkey = cohort_dates.o_custkey
left join cohort_size on cohort_dates.cohort_month = cohort_size.cohort_month
WHERE datediff(date_trunc('month', samples.tpch.orders.o_orderdate), cohort_dates.cohort_month) != 0
GROUP BY 1, 2
ORDER BY 1, 2

Graphique combiné

Les graphiques combinés combinent les graphiques linéaires et à barres pour présenter les changements au fil du temps avec proportionnalité.

remarque

Les graphiques combinés prennent en charge les agrégations de backend, offrant une prise en charge des requêtes renvoyant plus de 64 K lignes de données sans troncation du jeu de résultats.

Exemple de combinaison

Valeurs de configuration : Pour cette visualisation de graphique combiné, les valeurs suivantes ont été définies :

  • Colonne X :

    • Colonne du dataset : l_shipdate
    • Niveau de date : Months
  • Colonnes Y :

    • Première colonne du dataset : l_extendedprice
    • Type d'agrégation : moyenne
    • Deuxième colonne du dataset : l_quantity
    • Type d'agrégation : moyenne
  • Nom de l'axe X (remplacer la valeur par default) : Ship date

  • Nom de l'axe Y gauche (remplace la valeur default) : Quantity

  • Nom de l'axe Y droit (remplacer la valeur par default) : Average price

  • Séries :

    • Order1 (colonne du dataset) : AVG(l_extendedprice)
    • Axe Y : droite
    • Type : Courbes
    • Order2 (colonne de dataset) : AVG(l_quantity)
    • Axe Y : gauche
    • Type : Barres

Options de configuration : Pour les options de configuration de graphique combiné, consultez les options de configuration de graphique.

Requête SQL : Pour cette visualisation de graphique combiné, la requête SQL suivante a été utilisée pour générer le jeu de données.

SQL
select * from samples.tpch.lineitem

Affichage du compteur

Les compteurs affichent une seule valeur de manière proéminente, avec une option pour les comparer à une valeur cible. Pour utiliser les compteurs, spécifiez la ligne de données à afficher sur la visualisation du compteur pour la **colonne de valeur** et la **colonne cible**.

remarque

Le compteur ne prend en charge l’agrégation que pour un maximum de 64 000 lignes. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Contre-exemple

Valeurs de configuration : pour cette visualisation de compteur, les valeurs suivantes ont été définies :

  • Colonne de valeur

    • Colonne du dataset : avg(o_totalprice)
    • Ligne : 1
  • Colonne cible :

    • Colonne du dataset : avg(o_totalprice)
    • Ligne : 2
  • Format de la valeur cible : Activer

Requête SQL : Pour cette visualisation de compteur, la requête SQL suivante a été utilisée pour générer l'ensemble de données.

SQL
select o_orderdate, avg(o_totalprice)
from samples.tpch.orders
GROUP BY 1
ORDER BY 1 DESC

Visualisation de funnel

La visualisation en entonnoir aide à analyser l'évolution d'une métrique à différentes étapes. Pour utiliser le funnel, spécifiez une colonne step et une colonne value.

remarque

Funnel ne prend en charge l’agrégation que pour 64 000 lignes maximum. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Exemple de funnel

Valeurs de configuration : pour cette visualisation en entonnoir (funnel), les valeurs suivantes ont été définies :

  • Colonne d'étape (colonne du dataset) : o_orderstatus
  • Colonne de valeur (colonne du dataset) : Revenue

Requête SQL : Pour cette visualisation de l'entonnoir, la requête SQL suivante a été utilisée pour générer l'ensemble de données.

SQL
SELECT o_orderstatus, sum(o_totalprice) as Revenue
FROM samples.tpch.orders
GROUP BY 1

Graphique de carte thermique

Les cartes thermiques mélangent les caractéristiques des graphiques à barres, de l'empilement et des graphiques à bulles, vous permettant de visualiser des données numériques à l'aide de couleurs. Une palette de couleurs courante pour une carte thermique montre les valeurs les plus élevées en utilisant des couleurs plus chaudes, comme l'orange ou le rouge, et les valeurs les plus basses en utilisant des couleurs plus froides, comme le bleu ou le violet.

Par exemple, considérez la carte thermique suivante qui visualise les distances de courses de taxi les plus fréquentes chaque jour et regroupe les résultats par jour de la semaine, distance et tarif total.

remarque

Les cartes thermiques prennent en charge les agrégations de backend, offrant un support pour les requêtes renvoyant plus de 64K lignes de données sans troncation du jeu de résultats.

Exemple de carte thermique

Valeurs de configuration : pour cette visualisation de carte thermique, les valeurs suivantes ont été définies :

  • Colonne X (colonne du dataset) : o_orderpriority

  • Colonnes Y (colonne du dataset) : o_orderstatus

  • Colonne de couleur :

    • Colonne du dataset : o_totalprice
    • Type d’agrégation : Average
  • Nom de l'axe X (remplacer la valeur par default) : Order priority

  • Nom de l'axe Y (remplace la valeur par default) : Order status

  • Nom de la couleur (remplacer la valeur par default) : Average price

  • Jeu de couleurs (remplacer la valeur default) : YIGnBu

Options de configuration : Pour les options de configuration de la carte de chaleur, consultez les options de configuration du graphique de la carte de chaleur.

Requête SQL : Pour cette visualisation de carte thermique, la requête SQL suivante a été utilisée afin de générer le dataset.

SQL
select * from samples.tpch.orders

Graphiques d'histogramme

Un histogramme représente la fréquence à laquelle une valeur donnée apparaît dans un dataset. Un histogramme vous aide à comprendre si un dataset contient des valeurs regroupées autour d'un petit nombre de plages ou si elles sont plus dispersées. Un histogramme est affiché sous forme de graphique à barres dans lequel vous contrôlez le nombre de barres distinctes (également appelées compartiments).

remarque

Les graphiques en histogramme prennent en charge les agrégations backend, offrant un support pour les requêtes renvoyant plus de 64 000 lignes de données sans troncation de l'ensemble de résultats.

Exemple de graphique d&#39;histogramme

Valeurs de configuration : pour cette visualisation de diagramme d’histogramme, les valeurs suivantes ont été définies :

  • Colonne X (colonne du dataset) : o_totalprice
  • Nombre de compartiments : 20
  • Nom de l'axe X (remplacer la valeur par default) : Total price

Options de configuration : pour les options de configuration de graphique d'histogramme, reportez-vous aux options de configuration de graphique d'histogramme.

**Query SQL** : Pour cette visualisation de graphique d'histogramme, la query SQL suivante a été utilisée pour générer l'ensemble de données.

SQL
select * from samples.tpch.orders

Courbes

Les graphiques linéaires présentent l'évolution d'une ou plusieurs métriques au fil du temps.

remarque

Les graphiques linéaires prennent en charge les agrégations backend, ce qui permet des query renvoyant plus de 64 000 lignes de données sans troncation du jeu de résultats.

Exemple de courbes

Valeurs de configuration : pour cette visualisation de graphique linéaire, les valeurs suivantes ont été définies :

  • Colonne X :

    • Colonne du dataset : o_orderdate
    • Niveau de date : Years
  • Colonnes Y :

    • Colonne du dataset : o_totalprice
    • Type d’agrégation : Average
  • Regrouper par (colonne du dataset) : o_orderpriority

  • Nom de l'axe X (remplacer la valeur par default) : Order year

  • Nom de l'axe Y (remplace la valeur default) : Average price

**Options de configuration** : Pour les options de configuration de graphique linéaire, consultez les options de configuration de graphique.

query SQL : pour cette visualisation de graphique en courbes, la query SQL suivante a été utilisée pour générer le jeu de données.

SQL
select * from samples.tpch.orders

Visualisation de carte (choroplèthe)

Dans les visualisations de cartes choroplèthes, les localités géographiques, telles que les pays ou les États, sont colorées en fonction des valeurs agrégées de chaque colonne clé. La query doit renvoyer des emplacements géographiques par nom.

remarque

Les visualisations choroplèthes n'effectuent aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Exemple de carte choroplèthe

Valeurs de configuration : Pour cette visualisation choroplèthe, les valeurs suivantes ont été définies :

  • Mappage (colonne de dataset) : Countries
  • Colonne géographique (colonne de dataset) : Country
  • Type géographique : Nom abrégé
  • Colonne de valeur (colonne du dataset) : Revenue
  • Mode de regroupement : équidistant

Options de configuration : Pour les options de configuration du choroplèthe, consultez les options de configuration du choroplèthe.

Query SQL : pour cette visualisation choroplèthe, la query SQL suivante a été utilisée pour générer le dataset.

SQL
SELECT
initcap(n_name) as Country,
sum(c_acctbal)
FROM samples.tpch.customer
join samples.tpch.nation where n_nationkey = c_nationkey
GROUP BY 1

Visualisation de carte (marqueurs)

Dans les visualisations de marqueurs, un marqueur est placé à un ensemble de coordonnées sur la carte. Le résultat de la query doit renvoyer des paires de latitude et de longitude.

remarque

Le marqueur n'effectue aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Exemple de marqueur de carte

Cet exemple de marqueur est généré à partir d'un dataset qui inclut à la fois les valeurs de latitude et de longitude, qui ne sont pas disponibles dans les exemples de datasets Databricks. Pour les options de configuration de choroplèthe, consultez les options de configuration des marqueurs.

Graphiques à secteurs

Les graphiques à secteurs montrent la proportionnalité entre les métriques. Elles ne sont *pas* destinées à transmettre des données de série chronologique.

remarque

Les graphiques circulaires prennent en charge les agrégations backend, offrant un support pour les queries renvoyant plus de 64 000 lignes de données sans troncation de l’ensemble de résultats.

Exemple de graphique à secteurs

Valeurs de configuration : Pour cette visualisation en graphique circulaire, les valeurs suivantes ont été définies :

  • Colonne X (colonne du dataset) : o_orderpriority

  • Colonnes Y :

    • Colonne du dataset : o_totalprice
    • Type d’agrégation : Sum
  • Libellé (remplacement de la valeur default) : Total price

Options de configuration : Pour les options de configuration de graphique circulaire, voir les options de configuration de graphique.

Query SQL : Pour cette visualisation de graphique circulaire, la query SQL suivante a été utilisée pour générer l’ensemble de données.

SQL
select * from samples.tpch.orders

Visualisation de tableau croisé dynamique

Une visualisation de tableau croisé dynamique agrège les enregistrements d'un résultat de query dans un nouvel affichage tabulaire. C'est similaire aux instructions PIVOT ou GROUP BY en SQL. Vous configurez la visualisation de tableau croisé dynamique avec des champs à glisser-déposer.

remarque

Les tableaux croisés dynamiques prennent en charge les agrégations côté serveur, ce qui permet de gérer les queries renvoyant plus de 64K lignes de données sans troncation du jeu de résultats. Cependant, le tableau croisé dynamique (hérité) ne prend en charge l'agrégation que pour un maximum de 64 000 lignes. Si un dataset est supérieur à 64 000 lignes, les données seront tronquées.

Exemple de tableau croisé dynamique

Valeurs de configuration : Pour cette visualisation de tableau croisé dynamique, les valeurs suivantes ont été définies :

  • Sélectionnez les lignes (colonne du dataset) : l_returnflag
  • Sélectionner les colonnes (colonne du dataset) : l_shipmode
  • Cellule
    • Colonne du dataset : l_quantity
    • Type d'agrégation : Somme
    • Couleur des cellules par valeur : activé

Query SQL : Pour cette visualisation de tableau croisé dynamique, la query SQL suivante a été utilisée pour générer le jeu de données.

SQL
select * from samples.tpch.lineitem

Sankey

Un diagramme de Sankey visualise le flux d'un ensemble de valeurs à un autre.

remarque

Les visualisations Sankey n'effectuent aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Exemple Sankey :

SQL query : Pour cette visualisation de Sankey, la query SQL suivante a été utilisée pour générer le jeu de données.

SQL
SELECT pickup_zip as stage1, dropoff_zip as stage2, sum(fare_amount) as value
FROM samples.nyctaxi.trips
GROUP BY 1, 2
ORDER BY 3 DESC
LIMIT 10

Nuage de points

Les visualisations en nuage de points sont couramment utilisées pour montrer la relation entre deux variables numériques. De plus, une troisième dimension peut être encodée avec de la couleur pour montrer comment les variables numériques diffèrent entre les groupes.

remarque

Les graphiques de dispersion prennent en charge les agrégations côté serveur, ce qui permet de traiter les queries retournant plus de 64K lignes de données sans troncation du jeu de résultats.

Exemple de nuage de points

Valeurs de configuration : pour cette visualisation de nuage de points, les valeurs suivantes ont été définies :

  • Colonne X (colonne du dataset) : l_quantity
  • Colonne Y (colonne de dataset) : l_extendedprice
  • Regrouper par (colonne du dataset) : l_returnflag
  • Nom de l'axe X (remplacer la valeur par default) : Quantity
  • Nom de l'axe Y (remplace la valeur default) : Extended price

Options de configuration : Pour les options de configuration de graphique en nuage de points, consultez les options de configuration de graphique.

query SQL : pour cette visualisation de nuage de points, la query SQL suivante a été utilisée pour générer l'ensemble de données.

SQL
select * from samples.tpch.lineitem

Séquence Sunburst

Un diagramme en éventail permet de visualiser des données hiérarchiques à l'aide de cercles concentriques.

remarque

La séquence Sunburst n’effectue aucune agrégation de données dans le jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Exemple Sunburst

Query SQL : pour cette visualisation en rayons de soleil, la query SQL suivante a été utilisée pour générer le dataset.

SQL
SELECT pickup_zip as stage1, dropoff_zip as stage2, sum(fare_amount) as value
FROM samples.nyctaxi.trips
GROUP BY 1, 2
ORDER BY 3 DESC
LIMIT 10

Table

La visualisation de table affiche les données dans une table standard, mais avec la possibilité de réorganiser, de masquer et de formater manuellement les données. Les visualisations de tableau peuvent afficher jusqu'à 100 000 lignes.

remarque

Les visualisations de tableaux n'effectuent aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Les paramètres de formatage prennent en charge les types de données spéciaux, tels que les images, JSON et les URL. Pour plus de détails, veuillez consulter les options de configuration de la table.

Nuage de mots

Un nuage de mots représente visuellement la fréquence d’occurrence d’un mot dans les données.

remarque

Le nuage de mots ne prend en charge l'agrégation que pour un maximum de 64 000 lignes. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Exemple de nuage de mots

Valeurs de configuration : Pour cette visualisation de nuage de mots, les valeurs suivantes ont été définies : test

  • Colonne Mots (colonne dataset) : o_comment
  • Longueur maximale des mots : Min. = 5
  • Limite des fréquences : Min = 2

Requête SQL : Pour cette visualisation de nuage de mots, la requête SQL suivante a été utilisée pour générer le jeu de données.

SQL
select * from samples.tpch.orders