Aller au contenu principal

Exemples de dataset

Il existe une variété de datasets d'exemple fournis par Databricks et mis à disposition par des tiers que vous pouvez utiliser dans votre workspace Databricks.

Datasets Unity Catalog

Unity Catalog fournit l'accès à un nombre de datasets d'exemple dans le catalogue samples. Vous pouvez consulter ces datasets dans l'interface utilisateur de l'Explorateur de catalogues et y faire référence directement dans un notebook ou dans l'éditeur SQL en utilisant le modèle <catalog-name>.<schema-name>.<table-name>.

Le tableau suivant répertorie les schémas disponibles dans le catalogue samples :

Jeu de données

Description

databricks

Exemples de datasets basés sur des fichiers pour la création de pipelines de données, dans le volume datasets.

nyctaxi

Enregistrements de trajets en taxi pour New York.

tpcds_sf1

Dataset à petite échelle (environ 1 Go) issu du benchmark TPC-DS.

tpch

Dataset à grande échelle (environ 1 To) provenant du benchmark TPC-H.

wanderbricks

Une plateforme simulée de réservation de voyages avec des utilisateurs, des propriétés, des réservations, des avis et plus encore.

Jeu de données

Description

databricks

Exemples de datasets basés sur des fichiers pour la création de pipelines de données, dans le volume datasets.

nyctaxi

Enregistrements de trajets en taxi pour New York.

tpcds_sf1

Dataset à petite échelle (environ 1 Go) issu du benchmark TPC-DS.

tpch

Dataset à grande échelle (environ 1 To) provenant du benchmark TPC-H.

wanderbricks

Une plateforme simulée de réservation de voyages avec des utilisateurs, des propriétés, des réservations, des avis et plus encore.

Databricks

Le schéma databricks contient le volume datasets, qui héberge une collection de datasets de fichiers fournis par Databricks que vous pouvez utiliser pour créer et tester des pipelines de données. Pour lister les datasets disponibles, exécutez :

SQL
LIST '/Volumes/samples/databricks/datasets/'

nyctaxi

Le schéma nyctaxi contient la table trips, qui contient des détails sur les trajets en taxi à New York. L'exemple suivant renvoie les 10 premiers enregistrements de cette table :

SQL
SELECT * FROM samples.nyctaxi.trips LIMIT 10

tpcds_sf1

Le schéma tpcds_sf1 contient des données du benchmark TPC-DS. Pour lister les tables dans ce schéma, exécutez :

SQL
SHOW TABLES IN samples.tpcds_sf1;

Pour plus de conseils sur l'utilisation de ce dataset pour évaluer les performances du système, consultez Utiliser le dataset d'échantillon TPC-DS pour évaluer les performances du système.

tpch

Le schéma tpch contient des données du TPC-H Benchmark. Pour lister les tables dans ce schéma, exécutez :

SQL
SHOW TABLES IN samples.tpch

wanderbricks

Le schéma wanderbricks contient un dataset de plateforme de réservation de voyages simulé. Pour plus de détails sur les tables du dataset wanderbricks, consultez Wanderbricks dataset.

Exemples de jeux de données tiers au format CSV

Databricks dispose d'outils intégrés pour upload rapidement des datasets d'exemple tiers sous forme de fichiers CSV (valeurs séparées par des virgules) dans les Workspaces Databricks. Voici quelques datasets d'exemple tiers populaires disponibles au format CSV :

Exemple de dataset

Pour download le dataset d'exemple au format CSV…

Le Squirrel Census

Sur la page web **Données**, cliquez sur **Données de parc**, **Données Squirrel**, ou **Histoires**.

Collection de Datasets OWID

Dans le repository GitHub, cliquez sur le dossier **datasets**. Cliquez sur le sous-dossier qui contient le dataset cible, puis cliquez sur le fichier CSV du dataset.

Datasets CSV de Data.gov

Sur la page web des résultats de recherche, cliquez sur le résultat de recherche cible et, à côté de l'icône CSV , cliquez sur Download .

Diamonds (Nécessite un compte Kaggle)

Sur la page web du dataset, sur l'onglet Données , sur l'onglet Données , à côté de diamonds.csv , cliquez sur l'icône download .

Durée du trajet en taxi à NYC (Nécessite un compte Kaggle)

Sur la page web du dataset, sur l'onglet Données , à côté de sample_submission.zip , cliquez sur le download icon. Pour trouver les fichiers CSV du dataset, extrayez le contenu du fichier ZIP download.

Exemple de dataset

Pour download le dataset d'exemple au format CSV…

Le Squirrel Census

Sur la page web **Données**, cliquez sur **Données de parc**, **Données Squirrel**, ou **Histoires**.

Collection de Datasets OWID

Dans le repository GitHub, cliquez sur le dossier **datasets**. Cliquez sur le sous-dossier qui contient le dataset cible, puis cliquez sur le fichier CSV du dataset.

Datasets CSV de Data.gov

Sur la page web des résultats de recherche, cliquez sur le résultat de recherche cible et, à côté de l'icône CSV , cliquez sur Download .

Diamonds (Nécessite un compte Kaggle)

Sur la page web du dataset, sur l'onglet Données , sur l'onglet Données , à côté de diamonds.csv , cliquez sur l'icône download .

Durée du trajet en taxi à NYC (Nécessite un compte Kaggle)

Sur la page web du dataset, sur l'onglet Données , à côté de sample_submission.zip , cliquez sur le download icon. Pour trouver les fichiers CSV du dataset, extrayez le contenu du fichier ZIP download.

Pour utiliser des jeux de données d'échantillons tiers dans votre workspace Databricks, faites ce qui suit :

  1. Suivez les instructions du tiers pour download le dataset sous forme de fichier CSV vers votre machine locale.
  2. Upload the CSV file depuis votre machine locale dans votre Workspace Databricks.
  3. Pour travailler avec les données importées, utilisez Databricks SQL pour query les données. Ou vous pouvez utiliser un notebook pour charger les données sous forme de DataFrame.

Datasets d'exemple tiers dans les bibliothèques

Certains tiers incluent des datasets d'échantillons dans des bibliothèques, telles que des packages Python Package Index (PyPI) ou des packages Comprehensive R Archive Network (CRAN). Pour plus d'informations, consultez la documentation du fournisseur de la bibliothèque.

Datasets Databricks (databricks-datasets) montés sur DBFS

Databricks déconseille l'utilisation de DBFS et du stockage d'objets cloud monté pour la plupart des cas d'utilisation dans les workspaces Databricks compatibles Unity Catalog. Certains exemples de datasets montés sur DBFS sont disponibles dans Databricks

remarque

La disponibilité et l’emplacement des datasets Databricks peuvent être modifiés sans préavis.

Parcourir les datasets Databricks montés sur DBFS

Pour parcourir ces fichiers à partir d'un Notebook Python, Scala ou R, vous pouvez utiliser la référence des infrastructures publiques Databricks (dbutils). Le code suivant répertorie tous les datasets Databricks disponibles.

Python
display(dbutils.fs.ls('/databricks-datasets'))