Aide-mémoire sur la préparation des données
Les performances BI haut de gamme dépendent de l'efficacité avec laquelle les données sont préparées et livrées à partir du Lakehouse. En adoptant des schémas architecturaux, en appliquant une structure sémantique et en utilisant des optimisations ciblées, vous pouvez réduire la complexité des queries, améliorer la réactivité des tableaux de bord et réduire les coûts de compute.
Le tableau suivant résume les pratiques recommandées, leur impact attendu, la documentation associée et les éléments d'action correspondants. Ce contenu est destiné aux data engineers, aux développeurs BI et aux auteurs de tableaux de bord qui conçoivent, optimisent et maintiennent des charges de travail analytique dans le Lakehouse.
Préparation des données
Bonne pratique | Impact | Documents | Éléments d'action |
|---|---|---|---|
Adopter une architecture en médaillon | Accélère la transformation des données brutes en produits de données fiables et prêts à l'emploi pour une consommation facile. | Examiner et implémenter les couches médaillon | |
Utiliser le clustering fluide | Améliore les performances des query grâce au saut de fichiers et de données. | Appliquer aux grandes tables avec des modèles de filtre | |
Utiliser des tables gérées | Databricks gère et optimise automatiquement la couche de stockage et les performances des query. | Créez des tables gérées pour vos données | |
Utilisez l'optimisation prédictive ou optimisez les tables manuellement | Permet d'obtenir de meilleures performances de query en optimisant la taille et le Layout des fichiers, en supprimant les anciens fichiers et en mettant à jour les statistiques. | Activez-le pour les tables de production ou programmez une optimisation régulière et analysez les tables après les modifications de données. | |
Modéliser les données selon un schéma en étoile | Facilite l'interrogation et la consommation des données. | Concevoir des tables de faits et de dimension | |
Évitez les types de données larges et les colonnes à cardinalité élevée. | Optimise la taille du modèle de données et la consommation de mémoire, et améliore l'efficacité des requêtes. | Examiner les types de données et la cardinalité | |
Déclarer les clés primaires et étrangères (avec RELY) | Optimise les requêtes en éliminant les jointures et les agrégations inutiles. | Définir les clés sur les tables de faits et de dimensions | |
Utiliser les colonnes générées automatiquement | Réduit le besoin de calculer des valeurs lors de la query. | Identifiez les champs fréquemment calculés | |
Utilisez les vues matérialisées et les tables persistantes | Améliore les performances en pré-agrégeant les données pour les query les plus courantes et les plus gourmandes en Ressources. | Créez des vues agrégées pour les query courantes |