Utilisez l'exemple de dataset TPC-DS pour évaluer les performances du système
Databricks fournit l'accès au dataset de benchmark TPC-DS, un benchmark largement utilisé pour tester les performances des systèmes conçus pour l'entreposage des données et l'analytique. Le dataset est disponible en deux tailles par default dans chaque workspace compatible Unity Catalog. Ces datasets sont idéaux pour tester les performances de Databricks sur un benchmark standardisé qui simule des scénarios commerciaux réalistes de vente au détail et de commerce électronique. Pour en savoir plus sur ce dataset, consultez la documentation du benchmark TPC-DS.
Ce qui est inclus
Les datasets TPC-DS sont disponibles dans le catalogue samples avec les schémas suivants :
tpcds_sf1– dataset à petite échelle (environ 1 Go)tpcds_sf1000— Dataset de grande taille (environ 1 To)
Les deux datasets partagent les qualités suivantes :
- Sont en lecture seule et interrogeables par tous les utilisateurs du Workspace.
- Sont compatibles avec les SQL warehouses et les clusters universels
- Suivez la spécification TPC-DS pour l'étalonnage standardisé.
Prérequis
Vous devez avoir accès à un SQL Warehouse ou à un cluster universel.
Aperçu des données
Pour explorer les données dans l'interface utilisateur de l'Explorateur de catalogues :
- Cliquez sur
Catalogue dans la barre latérale.
- Saisissez tpcds dans la barre de recherche. Les deux schémas se trouvent dans le catalogue
samples. Cliquez sur le nom du schéma que vous souhaitez afficher. - Le tab Overview liste toutes les tables dans le schéma. Cliquez sur un nom de table pour ouvrir un aperçu des colonnes et des types de données de cette table.
- Utilisez la navigation supérieure pour consulter les échantillons de données ou les détails de la table.
Query les données
Les requêtes suivantes utilisent le dataset à plus petite échelle, tpcds_sf1. Pour utiliser le dataset à plus grande échelle, remplacez le nom du schéma par tpcds_sf1000. Cliquez sur Éditeur SQL dans la barre latérale pour ouvrir l'éditeur SQL. Ensuite, utilisez les requêtes suivantes pour start à explorer les données.
Prévisualiser les tables
SHOW TABLES IN samples.tpcds_sf1;
Explorer une table
DESCRIBE TABLE samples.tpcds_sf1.customer;
SELECT * FROM samples.tpcds_sf1.customer LIMIT 10;
Exemple de jointure et d'agrégation
SELECT
i_category,
d_year,
SUM(ss_net_paid) AS total_revenue
FROM samples.tpcds_sf1.store_sales ss
JOIN samples.tpcds_sf1.item i ON ss.ss_item_sk = i.i_item_sk
JOIN samples.tpcds_sf1.date_dim d ON ss.ss_sold_date_sk = d.d_date_sk
WHERE d.d_year = 2001
GROUP BY i_category, d_year
ORDER BY total_revenue DESC
LIMIT 10;
Bonnes pratiques
- Utilisez l'historique des query et le profil des query pour comprendre les caractéristiques de performance et identifier les opportunités d'optimisation.
- Start avec le plus petit dataset
tpcds_sf1pour le test initial, puis monter en charge jusqu'àtpcds_sf1000pour une évaluation complète des performances. - Comparez les performances des query entre différentes tailles de SQL Warehouse afin de déterminer les configurations optimales pour vos charges de travail.
- Utilisez ces datasets standardisés pour établir des bases de référence de performance et suivre les améliorations au fil du temps.