Exemples de dataset
Il existe une variété de datasets d'exemple fournis par Databricks et mis à disposition par des tiers que vous pouvez utiliser dans votre workspace Databricks.
Datasets Unity Catalog
Unity Catalog fournit l'accès à un nombre de datasets d'exemple dans le catalogue samples. Vous pouvez consulter ces datasets dans l'interface utilisateur de l'Explorateur de catalogues et y faire référence directement dans un notebook ou dans l'éditeur SQL en utilisant le modèle <catalog-name>.<schema-name>.<table-name>.
Le tableau suivant répertorie les schémas disponibles dans le catalogue samples :
Jeu de données | Description |
|---|---|
Exemples de datasets basés sur des fichiers pour la création de pipelines de données, dans le volume | |
Enregistrements de trajets en taxi pour New York. | |
Dataset à petite échelle (environ 1 Go) issu du benchmark TPC-DS. | |
Dataset à grande échelle (environ 1 To) provenant du benchmark TPC-H. | |
Une plateforme simulée de réservation de voyages avec des utilisateurs, des propriétés, des réservations, des avis et plus encore. |
Databricks
Le schéma databricks contient le volume datasets, qui héberge une collection de datasets de fichiers fournis par Databricks que vous pouvez utiliser pour créer et tester des pipelines de données. Pour lister les datasets disponibles, exécutez :
- SQL
- Python
LIST '/Volumes/samples/databricks/datasets/'
display(dbutils.fs.ls("/Volumes/samples/databricks/datasets/"))
nyctaxi
Le schéma nyctaxi contient la table trips, qui contient des détails sur les trajets en taxi à New York. L'exemple suivant renvoie les 10 premiers enregistrements de cette table :
- SQL
- Python
SELECT * FROM samples.nyctaxi.trips LIMIT 10
display(spark.read.table("samples.nyctaxi.trips").limit(10))
tpcds_sf1
Le schéma tpcds_sf1 contient des données du benchmark TPC-DS. Pour lister les tables dans ce schéma, exécutez :
- SQL
- Python
SHOW TABLES IN samples.tpcds_sf1;
display(spark.sql("SHOW TABLES IN samples.tpcds_sf1"))
Pour plus de conseils sur l'utilisation de ce dataset pour évaluer les performances du système, consultez Utiliser le dataset d'échantillon TPC-DS pour évaluer les performances du système.
tpch
Le schéma tpch contient des données du TPC-H Benchmark. Pour lister les tables dans ce schéma, exécutez :
- SQL
- Python
SHOW TABLES IN samples.tpch
display(spark.sql("SHOW TABLES IN samples.tpch"))
wanderbricks
Le schéma wanderbricks contient un dataset de plateforme de réservation de voyages simulé. Pour plus de détails sur les tables du dataset wanderbricks, consultez Wanderbricks dataset.
Exemples de jeux de données tiers au format CSV
Databricks dispose d'outils intégrés pour upload rapidement des datasets d'exemple tiers sous forme de fichiers CSV (valeurs séparées par des virgules) dans les Workspaces Databricks. Voici quelques datasets d'exemple tiers populaires disponibles au format CSV :
Exemple de dataset | Pour download le dataset d'exemple au format CSV… |
|---|---|
Sur la page web **Données**, cliquez sur **Données de parc**, **Données Squirrel**, ou **Histoires**. | |
Dans le repository GitHub, cliquez sur le dossier **datasets**. Cliquez sur le sous-dossier qui contient le dataset cible, puis cliquez sur le fichier CSV du dataset. | |
Sur la page web des résultats de recherche, cliquez sur le résultat de recherche cible et, à côté de l'icône CSV , cliquez sur Download . | |
Sur la page web du dataset, sur l'onglet Données , sur l'onglet Données , à côté de diamonds.csv , cliquez sur l'icône download . | |
Durée du trajet en taxi à NYC (Nécessite un compte Kaggle) | Sur la page web du dataset, sur l'onglet Données , à côté de sample_submission.zip , cliquez sur le download icon. Pour trouver les fichiers CSV du dataset, extrayez le contenu du fichier ZIP download. |
Pour utiliser des jeux de données d'échantillons tiers dans votre workspace Databricks, faites ce qui suit :
- Suivez les instructions du tiers pour download le dataset sous forme de fichier CSV vers votre machine locale.
- Upload the CSV file depuis votre machine locale dans votre Workspace Databricks.
- Pour travailler avec les données importées, utilisez Databricks SQL pour query les données. Ou vous pouvez utiliser un notebook pour charger les données sous forme de DataFrame.
Datasets d'exemple tiers dans les bibliothèques
Certains tiers incluent des datasets d'échantillons dans des bibliothèques, telles que des packages Python Package Index (PyPI) ou des packages Comprehensive R Archive Network (CRAN). Pour plus d'informations, consultez la documentation du fournisseur de la bibliothèque.
- Pour installer une bibliothèque sur un cluster Databricks à l'aide de l'interface utilisateur du cluster, consultez Bibliothèques Compute-scoped.
- Pour installer une bibliothèque Python à l'aide d'un Notebook Databricks, consultez les bibliothèques Python délimitées au Notebook.
- Pour installer une bibliothèque R à l'aide d'un notebook Databricks, consultez Bibliothèques R à portée de notebook.
Datasets Databricks (databricks-datasets) montés sur DBFS
Databricks déconseille l'utilisation de DBFS et du stockage d'objets cloud monté pour la plupart des cas d'utilisation dans les workspaces Databricks compatibles Unity Catalog. Certains exemples de datasets montés sur DBFS sont disponibles dans Databricks
La disponibilité et l’emplacement des datasets Databricks peuvent être modifiés sans préavis.
Parcourir les datasets Databricks montés sur DBFS
Pour parcourir ces fichiers à partir d'un Notebook Python, Scala ou R, vous pouvez utiliser la référence des infrastructures publiques Databricks (dbutils). Le code suivant répertorie tous les datasets Databricks disponibles.
- Python
- Scala
- R
display(dbutils.fs.ls('/databricks-datasets'))
display(dbutils.fs.ls("/databricks-datasets"))
%fs ls "/databricks-datasets"