Aller au contenu principal

Excellence opérationnelle pour Databricks

Les principes architecturaux du pilier d'excellence opérationnelle couvrent tous les processus opérationnels qui permettent à Databricks de fonctionner. L'excellence opérationnelle aborde la capacité à faire fonctionner Databricks efficacement et traite de la manière d'exploiter, de gérer et de surveiller Databricks pour apporter de la valeur commerciale.

Diagramme d'architecture d'excellence opérationnelle pour Databricks.

Principes de l'excellence opérationnelle

  1. Optimiser les processus de build et de release

    Appliquez les meilleures pratiques d'ingénierie logicielle à l'ensemble de votre environnement Databricks. Créez et déployez à l'aide de pipelines de fonctionnalités d’intégration et de livraison continues (CI/CD) pour DevOps et MLOps.

  2. Automatiser les déploiements et les charges de travail

    L'automatisation des déploiements et des charges de travail pour Databricks contribue à standardiser ces processus, à éliminer les erreurs humaines, à améliorer la productivité et à offrir une plus grande reproductibilité. Cela inclut l'utilisation de la « configuration en tant que code » pour éviter le drift de configuration, et de l'« infrastructure en tant que code » pour automatiser le provisionnement de tous les services Databricks et cloud requis.

    Pour le ML spécifiquement, les processus doivent piloter l'automatisation : toutes les étapes d'un processus ne peuvent pas ou ne devraient pas être automatisées. Les humains déterminent toujours les questions commerciales, et certains modèles auront toujours besoin d'une supervision humaine avant le déploiement. Par conséquent, le processus de développement est primordial et chaque module du processus doit être automatisé selon les besoins. Cela permet un développement incrémental de l'automatisation et de la personnalisation.

  3. Mettez en place le monitoring, l'alerte et la journalisation.

    Les charges de travail dans Databricks intègrent généralement les services de la plateforme Databricks et les services cloud externes, par exemple en tant que sources de données ou cibles. L'exécution réussie ne peut avoir lieu que si chaque service de la chaîne d'exécution fonctionne correctement. Lorsque ce n'est pas le cas, le monitoring, les alertes et la journalisation sont importants pour détecter et suivre les problèmes et comprendre le comportement du système.

  4. Gérer la capacité et les quotas

    Pour tout service lancé dans un cloud, prenez les limites en compte, par exemple, les limites de taux d'accès, le nombre d'instances, le nombre d'utilisateurs et les exigences de mémoire. Avant de concevoir une solution, ces limites doivent être comprises.

Suivant : Bonnes pratiques pour l’excellence opérationnelle

Consultez Bonnes pratiques d'excellence opérationnelle.