Aller au contenu principal

Utilisez l'exemple de dataset TPC-DS pour évaluer les performances du système

Databricks fournit l'accès au dataset de benchmark TPC-DS, un benchmark largement utilisé pour tester les performances des systèmes conçus pour l'entreposage des données et l'analytique. Le dataset est disponible en deux tailles par default dans chaque workspace compatible Unity Catalog. Ces datasets sont idéaux pour tester les performances de Databricks sur un benchmark standardisé qui simule des scénarios commerciaux réalistes de vente au détail et de commerce électronique. Pour en savoir plus sur ce dataset, consultez la documentation du benchmark TPC-DS.

Ce qui est inclus

Les datasets TPC-DS sont disponibles dans le catalogue samples avec les schémas suivants :

  • tpcds_sf1 – dataset à petite échelle (environ 1 Go)
  • tpcds_sf1000 — Dataset de grande taille (environ 1 To)

Les deux datasets partagent les qualités suivantes :

  • Sont en lecture seule et interrogeables par tous les utilisateurs du Workspace.
  • Sont compatibles avec les SQL warehouses et les clusters universels
  • Suivez la spécification TPC-DS pour l'étalonnage standardisé.

Prérequis

Vous devez avoir accès à un SQL Warehouse ou à un cluster universel.

Aperçu des données

Pour explorer les données dans l'interface utilisateur de l'Explorateur de catalogues :

  1. Cliquez sur Icône de données. Catalogue dans la barre latérale.
  2. Saisissez tpcds dans la barre de recherche. Les deux schémas se trouvent dans le catalogue samples. Cliquez sur le nom du schéma que vous souhaitez afficher.
  3. Le tab Overview liste toutes les tables dans le schéma. Cliquez sur un nom de table pour ouvrir un aperçu des colonnes et des types de données de cette table.
  4. Utilisez la navigation supérieure pour consulter les échantillons de données ou les détails de la table.

Query les données

Les requêtes suivantes utilisent le dataset à plus petite échelle, tpcds_sf1. Pour utiliser le dataset à plus grande échelle, remplacez le nom du schéma par tpcds_sf1000. Cliquez sur Icône de l'éditeur SQL Éditeur SQL dans la barre latérale pour ouvrir l'éditeur SQL. Ensuite, utilisez les requêtes suivantes pour start à explorer les données.

Prévisualiser les tables

SQL
SHOW TABLES IN samples.tpcds_sf1;

Explorer une table

SQL
DESCRIBE TABLE samples.tpcds_sf1.customer;
SELECT * FROM samples.tpcds_sf1.customer LIMIT 10;

Exemple de jointure et d'agrégation

SQL
SELECT
i_category,
d_year,
SUM(ss_net_paid) AS total_revenue
FROM samples.tpcds_sf1.store_sales ss
JOIN samples.tpcds_sf1.item i ON ss.ss_item_sk = i.i_item_sk
JOIN samples.tpcds_sf1.date_dim d ON ss.ss_sold_date_sk = d.d_date_sk
WHERE d.d_year = 2001
GROUP BY i_category, d_year
ORDER BY total_revenue DESC
LIMIT 10;

Bonnes pratiques

  • Utilisez l'historique des query et le profil des query pour comprendre les caractéristiques de performance et identifier les opportunités d'optimisation.
  • Start avec le plus petit dataset tpcds_sf1 pour le test initial, puis monter en charge jusqu'à tpcds_sf1000 pour une évaluation complète des performances.
  • Comparez les performances des query entre différentes tailles de SQL Warehouse afin de déterminer les configurations optimales pour vos charges de travail.
  • Utilisez ces datasets standardisés pour établir des bases de référence de performance et suivre les améliorations au fil du temps.