Types de visualisation de Notebook et d'éditeur SQL
Cette page présente les types de visualisations disponibles dans les Notebooks Databricks et dans l'éditeur SQL, et vous montre comment créer un exemple de chaque type de visualisation.
Cette page couvre les visualisations pour les Notebooks Databricks et l'éditeur SQL . Pour les visualisations dans les AI/BI dashboards, consultez les types de visualisation de AI/BI dashboard.
Graphique en aires
Les graphiques en aires combinent les courbes et les histogrammes pour montrer comment les valeurs numériques d’un ou plusieurs groupes changent au fil de la progression d’une deuxième variable, généralement le temps. Ils sont souvent utilisés pour montrer l'évolution du funnel de Ventes au fil du temps.
Les graphiques en aires prennent en charge les agrégations backend, fournissant un support pour les queries renvoyant plus de 64K lignes de données sans troncation du jeu de résultats.

Valeurs de configuration : Pour cette visualisation de graphique de zone, les valeurs suivantes ont été définies :
-
Colonne X :
- Colonne du dataset :
o_orderdate - Niveau de date :
Years
- Colonne du dataset :
-
Colonnes Y :
- Colonne du dataset :
o_totalprice - Type d’agrégation :
Sum
- Colonne du dataset :
-
Regrouper par (colonne du dataset) :
o_orderpriority -
Empilement :
Stack -
Nom de l'axe X (remplacer la valeur par default) :
Order year -
Nom de l'axe Y (remplace la valeur default) :
Total price
Options de configuration : Pour les options de configuration des graphiques de zone, consultez les options de configuration de graphique.
**query SQL** : pour cette visualisation de graphique de zone, la query SQL suivante a été utilisée pour générer le dataset.
select * from samples.tpch.orders
Graphique à barres
Les diagrammes à barres représentent l’évolution des métriques au fil du temps ou la proportionnalité, de manière similaire à un graphique circulaire.
Les diagrammes à barres prennent en charge les agrégations backend, offrant un support pour les requêtes renvoyant plus de 64K lignes de données sans troncation de l'ensemble de résultats.

Valeurs de configuration : pour cette visualisation en diagramme à barres, les valeurs suivantes ont été définies :
-
Colonne X :
- Colonne du dataset :
o_orderdate - Niveau de date :
Months
- Colonne du dataset :
-
Colonnes Y :
- Colonne du dataset :
o_totalprice - Type d’agrégation :
Sum
- Colonne du dataset :
-
Regrouper par (colonne du dataset) :
o_orderpriority -
Empilement :
Stack -
Nom de l'axe X (remplacer la valeur par default) :
Order month -
Nom de l'axe Y (remplace la valeur default) :
Total price
Options de configuration : Pour les options de configuration des graphiques à barres, consultez les options de configuration des graphiques.
Query SQL : Pour cette visualisation de graphique à barres, la query SQL suivante a été utilisée pour générer l'ensemble de données.
select * from samples.tpch.orders
Graphique à bulles
Les graphiques à bulles sont des nuages de points où la taille de chaque marqueur de point reflète une métrique pertinente.
Les graphiques à bulles prennent en charge les agrégations backend, offrant une prise en charge des requêtes retournant plus de 64 K lignes de données sans troncation du jeu de résultats.

Valeurs de configuration : Pour cette visualisation de diagramme à bulles, les valeurs suivantes ont été définies :
- X (colonne de dataset) :
l_quantity - Colonnes Y (colonne du dataset) :
l_extendedprice - Regrouper par (colonne du dataset) :
l_returnflag - Colonne de taille des bulles (colonne de dataset) :
l_tax - Coefficient de taille de bulle : 20
- Taille de la bulle proportionnelle à :
Area - Nom de l'axe X (remplacer la valeur par default) :
Quantity - Nom de l'axe Y (remplace la valeur default) :
Extended price
Options de configuration : Pour les options de configuration du graphique à bulles, consultez options de configuration du graphique.
Requête SQL : pour cette visualisation de graphique à bulles, la requête SQL suivante a été utilisée pour générer l'ensemble de données.
select * from samples.tpch.lineitem where l_quantity < 45
Diagramme en boîte
La visualisation de diagramme en boîte montre le résumé de la distribution des données numériques, optionnellement groupées par catégorie. En utilisant une visualisation de diagramme en boîte, vous pouvez rapidement comparer les plages de valeurs entre les catégories et visualiser les groupes de localité, de dispersion et d'asymétrie des valeurs à travers leurs quartiles. Dans chaque boîte, la ligne plus foncée représente l'intervalle interquartile. Pour plus d'informations sur l'interprétation des visualisations de boîtes à moustaches, consultez l'article sur les diagrammes en boîte sur Wikipédia.
Les diagrammes en boîte ne prennent en charge l'agrégation que pour un maximum de 64 000 lignes. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Valeurs de configuration : pour cette visualisation de graphique en boîte, les valeurs suivantes ont été définies :
- Colonne X (colonne du dataset) :
l_returnflag - Colonnes Y (colonne du dataset) :
l_extendedprice - Regrouper par (colonne du dataset) :
l_shipmode - Nom de l'axe X (remplacer la valeur par default) :
Return flag - Nom de l'axe Y (remplace la valeur default) :
Extended price
Options de configuration : pour les options de configuration du graphique en boîte, voir options de configuration du graphique en boîte.
Requête SQL : Pour cette visualisation de diagramme en boîte, la requête SQL suivante a été utilisée pour générer le jeu de données.
select * from samples.tpch.lineitem
Analyse de cohorte
Une analyse de cohorte examine les résultats de groupes prédéfinis, appelés cohortes, à mesure qu'ils progressent à travers un ensemble d'étapes. La visualisation de cohorte agrège uniquement les données par date (elle permet des agrégations mensuelles). Il n'effectue pas d'autres agrégations de données au sein de l'ensemble de résultats. Toutes les autres agrégations sont effectuées au sein de la query elle-même.

Valeurs de configuration : Pour cette visualisation de cohorte, les valeurs suivantes ont été définies :
- Date (compartiment) (colonne de base de données) :
cohort_month - Étape (colonne de base de données) :
months - Taille de la population du compartiment (colonne de base de données) :
size - Valeur de l'étape (colonne de base de données) :
active - Intervalle de temps :
monthly
Options de configuration : Pour les options de configuration de cohorte, consultez les options de configuration des graphiques de cohorte.
Requête SQL : pour cette visualisation de cohorte, la requête SQL suivante a été utilisée pour générer le jeu de données.
-- match each customer with its cohort by month
with cohort_dates as (
SELECT o_custkey, min(date_trunc('month', o_orderdate)) as cohort_month
FROM samples.tpch.orders
GROUP BY 1
),
-- find the size of each cohort
cohort_size as (
SELECT cohort_month, count(distinct o_custkey) as size
FROM cohort_dates
GROUP BY 1
)
-- for each cohort and month thereafter, find the number of active customers
SELECT
cohort_dates.cohort_month,
ceil(months_between(date_trunc('month', samples.tpch.orders.o_orderdate), cohort_dates.cohort_month)) as months,
count(distinct samples.tpch.orders.o_custkey) as active,
first(size) as size
FROM samples.tpch.orders
left join cohort_dates on samples.tpch.orders.o_custkey = cohort_dates.o_custkey
left join cohort_size on cohort_dates.cohort_month = cohort_size.cohort_month
WHERE datediff(date_trunc('month', samples.tpch.orders.o_orderdate), cohort_dates.cohort_month) != 0
GROUP BY 1, 2
ORDER BY 1, 2
Graphique combiné
Les graphiques combinés combinent les graphiques linéaires et à barres pour présenter les changements au fil du temps avec proportionnalité.
Les graphiques combinés prennent en charge les agrégations de backend, offrant une prise en charge des requêtes renvoyant plus de 64 K lignes de données sans troncation du jeu de résultats.

Valeurs de configuration : Pour cette visualisation de graphique combiné, les valeurs suivantes ont été définies :
-
Colonne X :
- Colonne du dataset :
l_shipdate - Niveau de date :
Months
- Colonne du dataset :
-
Colonnes Y :
- Première colonne du dataset :
l_extendedprice - Type d'agrégation : moyenne
- Deuxième colonne du dataset :
l_quantity - Type d'agrégation : moyenne
- Première colonne du dataset :
-
Nom de l'axe X (remplacer la valeur par default) :
Ship date -
Nom de l'axe Y gauche (remplace la valeur default) :
Quantity -
Nom de l'axe Y droit (remplacer la valeur par default) :
Average price -
Séries :
- Order1 (colonne du dataset) :
AVG(l_extendedprice) - Axe Y : droite
- Type : Courbes
- Order2 (colonne de dataset) :
AVG(l_quantity) - Axe Y : gauche
- Type : Barres
- Order1 (colonne du dataset) :
Options de configuration : Pour les options de configuration de graphique combiné, consultez les options de configuration de graphique.
Requête SQL : Pour cette visualisation de graphique combiné, la requête SQL suivante a été utilisée pour générer le jeu de données.
select * from samples.tpch.lineitem
Affichage du compteur
Les compteurs affichent une seule valeur de manière proéminente, avec une option pour les comparer à une valeur cible. Pour utiliser les compteurs, spécifiez la ligne de données à afficher sur la visualisation du compteur pour la **colonne de valeur** et la **colonne cible**.
Le compteur ne prend en charge l’agrégation que pour un maximum de 64 000 lignes. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Valeurs de configuration : pour cette visualisation de compteur, les valeurs suivantes ont été définies :
-
Colonne de valeur
- Colonne du dataset :
avg(o_totalprice) - Ligne : 1
- Colonne du dataset :
-
Colonne cible :
- Colonne du dataset :
avg(o_totalprice) - Ligne : 2
- Colonne du dataset :
-
Format de la valeur cible : Activer
Requête SQL : Pour cette visualisation de compteur, la requête SQL suivante a été utilisée pour générer l'ensemble de données.
select o_orderdate, avg(o_totalprice)
from samples.tpch.orders
GROUP BY 1
ORDER BY 1 DESC
Visualisation de funnel
La visualisation en entonnoir aide à analyser l'évolution d'une métrique à différentes étapes. Pour utiliser le funnel, spécifiez une colonne step et une colonne value.
Funnel ne prend en charge l’agrégation que pour 64 000 lignes maximum. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Valeurs de configuration : pour cette visualisation en entonnoir (funnel), les valeurs suivantes ont été définies :
- Colonne d'étape (colonne du dataset) :
o_orderstatus - Colonne de valeur (colonne du dataset) :
Revenue
Requête SQL : Pour cette visualisation de l'entonnoir, la requête SQL suivante a été utilisée pour générer l'ensemble de données.
SELECT o_orderstatus, sum(o_totalprice) as Revenue
FROM samples.tpch.orders
GROUP BY 1
Graphique de carte thermique
Les cartes thermiques mélangent les caractéristiques des graphiques à barres, de l'empilement et des graphiques à bulles, vous permettant de visualiser des données numériques à l'aide de couleurs. Une palette de couleurs courante pour une carte thermique montre les valeurs les plus élevées en utilisant des couleurs plus chaudes, comme l'orange ou le rouge, et les valeurs les plus basses en utilisant des couleurs plus froides, comme le bleu ou le violet.
Par exemple, considérez la carte thermique suivante qui visualise les distances de courses de taxi les plus fréquentes chaque jour et regroupe les résultats par jour de la semaine, distance et tarif total.
Les cartes thermiques prennent en charge les agrégations de backend, offrant un support pour les requêtes renvoyant plus de 64K lignes de données sans troncation du jeu de résultats.

Valeurs de configuration : pour cette visualisation de carte thermique, les valeurs suivantes ont été définies :
-
Colonne X (colonne du dataset) :
o_orderpriority -
Colonnes Y (colonne du dataset) :
o_orderstatus -
Colonne de couleur :
- Colonne du dataset :
o_totalprice - Type d’agrégation :
Average
- Colonne du dataset :
-
Nom de l'axe X (remplacer la valeur par default) :
Order priority -
Nom de l'axe Y (remplace la valeur par default) :
Order status -
Nom de la couleur (remplacer la valeur par default) :
Average price -
Jeu de couleurs (remplacer la valeur default) :
YIGnBu
Options de configuration : Pour les options de configuration de la carte de chaleur, consultez les options de configuration du graphique de la carte de chaleur.
Requête SQL : Pour cette visualisation de carte thermique, la requête SQL suivante a été utilisée afin de générer le dataset.
select * from samples.tpch.orders
Graphiques d'histogramme
Un histogramme représente la fréquence à laquelle une valeur donnée apparaît dans un dataset. Un histogramme vous aide à comprendre si un dataset contient des valeurs regroupées autour d'un petit nombre de plages ou si elles sont plus dispersées. Un histogramme est affiché sous forme de graphique à barres dans lequel vous contrôlez le nombre de barres distinctes (également appelées compartiments).
Les graphiques en histogramme prennent en charge les agrégations backend, offrant un support pour les requêtes renvoyant plus de 64 000 lignes de données sans troncation de l'ensemble de résultats.

Valeurs de configuration : pour cette visualisation de diagramme d’histogramme, les valeurs suivantes ont été définies :
- Colonne X (colonne du dataset) :
o_totalprice - Nombre de compartiments : 20
- Nom de l'axe X (remplacer la valeur par default) :
Total price
Options de configuration : pour les options de configuration de graphique d'histogramme, reportez-vous aux options de configuration de graphique d'histogramme.
**Query SQL** : Pour cette visualisation de graphique d'histogramme, la query SQL suivante a été utilisée pour générer l'ensemble de données.
select * from samples.tpch.orders
Courbes
Les graphiques linéaires présentent l'évolution d'une ou plusieurs métriques au fil du temps.
Les graphiques linéaires prennent en charge les agrégations backend, ce qui permet des query renvoyant plus de 64 000 lignes de données sans troncation du jeu de résultats.

Valeurs de configuration : pour cette visualisation de graphique linéaire, les valeurs suivantes ont été définies :
-
Colonne X :
- Colonne du dataset :
o_orderdate - Niveau de date :
Years
- Colonne du dataset :
-
Colonnes Y :
- Colonne du dataset :
o_totalprice - Type d’agrégation :
Average
- Colonne du dataset :
-
Regrouper par (colonne du dataset) :
o_orderpriority -
Nom de l'axe X (remplacer la valeur par default) :
Order year -
Nom de l'axe Y (remplace la valeur default) :
Average price
**Options de configuration** : Pour les options de configuration de graphique linéaire, consultez les options de configuration de graphique.
query SQL : pour cette visualisation de graphique en courbes, la query SQL suivante a été utilisée pour générer le jeu de données.
select * from samples.tpch.orders
Visualisation de carte (choroplèthe)
Dans les visualisations de cartes choroplèthes, les localités géographiques, telles que les pays ou les États, sont colorées en fonction des valeurs agrégées de chaque colonne clé. La query doit renvoyer des emplacements géographiques par nom.
Les visualisations choroplèthes n'effectuent aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Valeurs de configuration : Pour cette visualisation choroplèthe, les valeurs suivantes ont été définies :
- Mappage (colonne de dataset) :
Countries - Colonne géographique (colonne de dataset) :
Country - Type géographique : Nom abrégé
- Colonne de valeur (colonne du dataset) :
Revenue - Mode de regroupement : équidistant
Options de configuration : Pour les options de configuration du choroplèthe, consultez les options de configuration du choroplèthe.
Query SQL : pour cette visualisation choroplèthe, la query SQL suivante a été utilisée pour générer le dataset.
SELECT
initcap(n_name) as Country,
sum(c_acctbal)
FROM samples.tpch.customer
join samples.tpch.nation where n_nationkey = c_nationkey
GROUP BY 1
Visualisation de carte (marqueurs)
Dans les visualisations de marqueurs, un marqueur est placé à un ensemble de coordonnées sur la carte. Le résultat de la query doit renvoyer des paires de latitude et de longitude.
Le marqueur n'effectue aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Cet exemple de marqueur est généré à partir d'un dataset qui inclut à la fois les valeurs de latitude et de longitude, qui ne sont pas disponibles dans les exemples de datasets Databricks. Pour les options de configuration de choroplèthe, consultez les options de configuration des marqueurs.
Graphiques à secteurs
Les graphiques à secteurs montrent la proportionnalité entre les métriques. Elles ne sont *pas* destinées à transmettre des données de série chronologique.
Les graphiques circulaires prennent en charge les agrégations backend, offrant un support pour les queries renvoyant plus de 64 000 lignes de données sans troncation de l’ensemble de résultats.

Valeurs de configuration : Pour cette visualisation en graphique circulaire, les valeurs suivantes ont été définies :
-
Colonne X (colonne du dataset) :
o_orderpriority -
Colonnes Y :
- Colonne du dataset :
o_totalprice - Type d’agrégation :
Sum
- Colonne du dataset :
-
Libellé (remplacement de la valeur default) :
Total price
Options de configuration : Pour les options de configuration de graphique circulaire, voir les options de configuration de graphique.
Query SQL : Pour cette visualisation de graphique circulaire, la query SQL suivante a été utilisée pour générer l’ensemble de données.
select * from samples.tpch.orders
Visualisation de tableau croisé dynamique
Une visualisation de tableau croisé dynamique agrège les enregistrements d'un résultat de query dans un nouvel affichage tabulaire. C'est similaire aux instructions PIVOT ou GROUP BY en SQL. Vous configurez la visualisation de tableau croisé dynamique avec des champs à glisser-déposer.
Les tableaux croisés dynamiques prennent en charge les agrégations côté serveur, ce qui permet de gérer les queries renvoyant plus de 64K lignes de données sans troncation du jeu de résultats. Cependant, le tableau croisé dynamique (hérité) ne prend en charge l'agrégation que pour un maximum de 64 000 lignes. Si un dataset est supérieur à 64 000 lignes, les données seront tronquées.

Valeurs de configuration : Pour cette visualisation de tableau croisé dynamique, les valeurs suivantes ont été définies :
- Sélectionnez les lignes (colonne du dataset) :
l_returnflag - Sélectionner les colonnes (colonne du dataset) :
l_shipmode - Cellule
- Colonne du dataset :
l_quantity - Type d'agrégation : Somme
- Couleur des cellules par valeur : activé
- Colonne du dataset :
Query SQL : Pour cette visualisation de tableau croisé dynamique, la query SQL suivante a été utilisée pour générer le jeu de données.
select * from samples.tpch.lineitem
Sankey
Un diagramme de Sankey visualise le flux d'un ensemble de valeurs à un autre.
Les visualisations Sankey n'effectuent aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

SQL query : Pour cette visualisation de Sankey, la query SQL suivante a été utilisée pour générer le jeu de données.
SELECT pickup_zip as stage1, dropoff_zip as stage2, sum(fare_amount) as value
FROM samples.nyctaxi.trips
GROUP BY 1, 2
ORDER BY 3 DESC
LIMIT 10
Nuage de points
Les visualisations en nuage de points sont couramment utilisées pour montrer la relation entre deux variables numériques. De plus, une troisième dimension peut être encodée avec de la couleur pour montrer comment les variables numériques diffèrent entre les groupes.
Les graphiques de dispersion prennent en charge les agrégations côté serveur, ce qui permet de traiter les queries retournant plus de 64K lignes de données sans troncation du jeu de résultats.

Valeurs de configuration : pour cette visualisation de nuage de points, les valeurs suivantes ont été définies :
- Colonne X (colonne du dataset) :
l_quantity - Colonne Y (colonne de dataset) :
l_extendedprice - Regrouper par (colonne du dataset) :
l_returnflag - Nom de l'axe X (remplacer la valeur par default) :
Quantity - Nom de l'axe Y (remplace la valeur default) :
Extended price
Options de configuration : Pour les options de configuration de graphique en nuage de points, consultez les options de configuration de graphique.
query SQL : pour cette visualisation de nuage de points, la query SQL suivante a été utilisée pour générer l'ensemble de données.
select * from samples.tpch.lineitem
Séquence Sunburst
Un diagramme en éventail permet de visualiser des données hiérarchiques à l'aide de cercles concentriques.
La séquence Sunburst n’effectue aucune agrégation de données dans le jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.

Query SQL : pour cette visualisation en rayons de soleil, la query SQL suivante a été utilisée pour générer le dataset.
SELECT pickup_zip as stage1, dropoff_zip as stage2, sum(fare_amount) as value
FROM samples.nyctaxi.trips
GROUP BY 1, 2
ORDER BY 3 DESC
LIMIT 10
Table
La visualisation de table affiche les données dans une table standard, mais avec la possibilité de réorganiser, de masquer et de formater manuellement les données. Les visualisations de tableau peuvent afficher jusqu'à 100 000 lignes.
Les visualisations de tableaux n'effectuent aucune agrégation de données au sein du jeu de résultats. Toutes les agrégations doivent être calculées dans la requête elle-même.
Les paramètres de formatage prennent en charge les types de données spéciaux, tels que les images, JSON et les URL. Pour plus de détails, veuillez consulter les options de configuration de la table.
Nuage de mots
Un nuage de mots représente visuellement la fréquence d’occurrence d’un mot dans les données.
Le nuage de mots ne prend en charge l'agrégation que pour un maximum de 64 000 lignes. Si un dataset est plus grand que 64 000 lignes, les données seront tronquées.

Valeurs de configuration : Pour cette visualisation de nuage de mots, les valeurs suivantes ont été définies : test
- Colonne Mots (colonne dataset) :
o_comment - Longueur maximale des mots : Min. = 5
- Limite des fréquences : Min = 2
Requête SQL : Pour cette visualisation de nuage de mots, la requête SQL suivante a été utilisée pour générer le jeu de données.
select * from samples.tpch.orders