Fiabilité
Les principes architecturaux du pilier fiabilité traitent de la capacité d'un système à se remettre des défaillances et à continuer à fonctionner.

Principes de fiabilité
-
Concevoir pour la défaillance
Dans un environnement hautement distribué, des pannes peuvent survenir. Pour la plateforme et les différentes charges de travail – telles que les jobs de streaming, les jobs batch, l'entraînement de modèles et les queries BI – les défaillances doivent être anticipées et des solutions résilientes doivent être développées pour accroître la fiabilité. L'accent est mis sur la conception d'applications qui récupèrent rapidement et, dans le meilleur des cas, automatiquement.
-
Gérer la qualité des données
La qualité des données est fondamentale pour tirer des insights précis et significatifs des données. La qualité des données a de nombreuses dimensions, notamment l'exhaustivité, la précision, la validité et la cohérence. Elle doit être activement gérée pour améliorer la qualité des ensembles de données finaux afin que les données constituent une information fiable et digne de confiance pour les utilisateurs professionnels.
-
Conception pour l’autoscaling
Les processus ETL standards, les rapports commerciaux et les tableaux de bord ont souvent des besoins en Ressources prévisibles en termes de mémoire et de compute. Cependant, les nouveaux projets, les tâches saisonnières ou les approches avancées telles que l'entraînement de modèles (pour l'attrition, les prévisions et la maintenance) créent des pics dans les besoins en ressources. Pour qu'une organisation puisse gérer toutes ces charges de travail, elle a besoin d'une plateforme de stockage et de compute évolutive. L'ajout de nouvelles Ressources au besoin doit être facile, et seule la consommation réelle doit être facturée. Une fois le pic passé, les Ressources peuvent être libérées et les coûts réduits en conséquence. Ceci est souvent appelé mise à l’échelle horizontale (nombre de nœuds) et mise à l’échelle verticale (taille des nœuds).
-
Tester les procédures de récupération
Une stratégie de reprise après sinistre à l'échelle de l'entreprise pour la plupart des applications et systèmes nécessite une évaluation des priorités, des capacités, des limitations et des coûts. Une approche fiable de reprise après sinistre teste régulièrement la façon dont les charges de travail échouent et valide les procédures de récupération. L'automatisation peut être utilisée pour simuler différentes défaillances ou recréer des scénarios qui ont causé des défaillances par le passé.
-
Automatiser les déploiements et les charges de travail
L'automatisation des déploiements et des charges de travail pour Databricks contribue à standardiser ces processus, à éliminer les erreurs humaines, à améliorer la productivité et à offrir une plus grande reproductibilité. Cela inclut l'utilisation de la « configuration en tant que code » pour éviter le drift de configuration, et de l'« infrastructure en tant que code » pour automatiser le provisionnement de tous les services Databricks et cloud requis.
-
Surveiller les systèmes et les charges de travail
Les charges de travail dans Databricks intègrent généralement les services de la plateforme Databricks et les services cloud externes, par exemple en tant que sources de données ou cibles. L'exécution réussie ne peut avoir lieu que si chaque service de la chaîne d'exécution fonctionne correctement. Lorsque ce n'est pas le cas, le monitoring, les alertes et la journalisation sont importants pour détecter et suivre les problèmes et comprendre le comportement du système.
Suivant : Bonnes pratiques en matière de fiabilité
Consultez les bonnes pratiques en matière de fiabilité.