Tutoriel : query et visualiser des données à partir d'un Notebook
Ce tutoriel vous guide dans l'utilisation d'un notebook Databricks pour interroger des exemples de données stockées dans Unity Catalog à l'aide de SQL, Python, Scala et R, puis visualiser les résultats de la query dans le notebook.
Demandez à Genie Code (mode Agent) de le faire pour vous :
Create a new notebook that queries @samples.nyctaxi.trips and displays a bar chart showing the average fare amount by trip distance, grouped by the pickup zip code.
Exigences
Pour effectuer les tâches de cet article, vous devez satisfaire aux exigences suivantes :
- Votre workspace doit avoir Unity Catalog activé. Pour plus d'informations sur la prise en main de Unity Catalog, consultez Prise en main de Unity Catalog.
- Vous devez disposer des autorisations nécessaires pour utiliser une ressource de compute existante ou pour en créer une nouvelle. Découvrez compute ou consultez votre administrateur Databricks.
Étape 1 : Créer un nouveau Notebook
Pour créer un Notebook dans votre Workspace, cliquez sur Nouveau dans la barre latérale, puis cliquez sur Notebook . Un notebook vierge s'ouvre dans le Workspace.
Pour en savoir plus sur la création et la gestion des Notebooks, veuillez consulter Gérer les Notebooks Databricks.
Étape 2 : query une table
Interrogez la table samples.nyctaxi.trips dans Unity Catalog en utilisant la langue de votre choix. Cette table est l’un des jeux de données d’exemple inclus dans le catalogue samples.
- Copiez et collez le code suivant dans la nouvelle cellule de notebook vide. Ce code affiche les résultats de l’interrogation de la table
samples.nyctaxi.tripsdans Unity Catalog.
- SQL
- Python
- Scala
- R
SELECT * FROM samples.nyctaxi.trips
display(spark.read.table("samples.nyctaxi.trips"))
display(spark.read.table("samples.nyctaxi.trips"))
library(SparkR)
display(sql("SELECT * FROM samples.nyctaxi.trips"))
-
Appuyez sur
Shift+Enterpour exécuter la cellule, puis passez à la cellule suivante.Les résultats de la query apparaissent dans le notebook.
Étape 3 : afficher les données
Affichez le montant moyen du tarif par distance de trajet, regroupé par code postal de prise en charge.
-
À côté de l'onglet tab , cliquez sur + , puis sur Visualisation .
L'éditeur de visualisation s'affiche.
-
Dans le menu déroulant Type de visualisation , vérifiez que Barres est sélectionné.
-
fare_amountSélectionnez pour la **colonne X**. -
Sélectionnez
trip_distancepour la colonne Y . -
Sélectionnez
Averagecomme type d’agrégation. -
Sélectionnez
pickup_zipcomme colonne Regrouper par .
-
Cliquez sur Enregistrer .
Étapes suivantes
- Pour en savoir plus sur l'ajout de données d'un fichier CSV à Unity Catalog et la visualisation des données, consultez Didacticiel : Importer et visualiser des données CSV à partir d'un notebook.
- Pour savoir comment charger des données dans Databricks à l'aide d'Apache Spark, consultez Didacticiel : Charger et transformer des données à l'aide des DataFrames Apache Spark.
- Pour en savoir plus sur l'importation de données dans Databricks, consultez les connecteurs standard dans Lakeflow Connect.
- Pour en savoir plus sur l'interrogation des données avec Databricks, consultez Interroger les données.
- Pour en savoir plus sur les visualisations, consultez Visualisations dans les Notebook et l'éditeur SQL de Databricks.
- Pour en savoir plus sur les techniques d'analyse exploratoire des données (EDA), consultez Tutoriel : Techniques d'EDA à l'aide des Notebook Databricks.