Aller au contenu principal

Efficacité des performances pour Databricks

Le pilier de l'**efficacité des performances** couvre la capacité d'un système Databricks à s'adapter aux changements de charge, en augmentant et en réduisant les ressources en fonction de la demande.

Diagramme d’architecture d’efficacité des performances pour Databricks.

Principes d'efficacité des performances

  1. Utiliser des architectures serverless

    Les architectures Serverless ne nécessitent pas que les clients exploitent et maintiennent une infrastructure de calcul dans le cloud. Cela élimine les frais généraux d'exploitation liés à la gestion de l'infrastructure cloud et réduit les coûts de transaction, car les services gérés fonctionnent à l'échelle du cloud. Ils offrent également une disponibilité immédiate, une sécurité prête à l'emploi et nécessitent une configuration ou une administration minimale.

  2. Concevoir des charges de travail pour la performance

    Pour les charges de travail répétées, telles que les pipelines de Data Engineering, la performance ne devrait jamais être secondaire. Les données doivent être :

    • Lire efficacement dans la mémoire d’objet.
    • Transformé efficacement.
    • Publié efficacement pour la consommation.

    De plus, la plupart des pipelines ou des modèles de consommation utilisent une chaîne de systèmes. Pour obtenir les meilleures performances possibles, l'ensemble de la chaîne doit être pris en compte et sélectionné pour les meilleures performances.

  3. Exécuter des tests de performance dans le cadre du développement

    Chaque charge de travail de développement doit faire l'objet de tests de performance continus. Les tests garantissent que toute modification de la base de code n'affecte pas négativement les performances de la charge de travail. Établissez un calendrier régulier pour l'exécution des tests. Exécutez le test dans le cadre d'un événement planifié ou dans le cadre d'un pipeline de build d'intégration continue.

    Établissez des références de performance et déterminez l'efficacité actuelle des charges de travail et de l'infrastructure sous-jacente. La mesure des performances par rapport aux références peut fournir des stratégies d'amélioration et déterminer si l'application atteint les objectifs commerciaux.

    Identifiez les goulots d'étranglement qui peuvent affecter les performances. Ces goulots d'étranglement peuvent être causés par des erreurs de code ou une mauvaise configuration d'un service. Généralement, les goulots d'étranglement s'aggravent à mesure que la charge augmente.

  4. Surveiller les performances

    Assurez-vous que les Ressources et les services restent accessibles et que les performances répondent aux attentes des utilisateurs ou aux exigences de la charge de travail. Le monitoring peut vous aider à identifier les goulots d'étranglement ou les ressources insuffisantes, à optimiser les configurations et à détecter les erreurs de pipeline/charge de travail.

Suivant : Bonnes pratiques pour l'efficacité des performances

Consultez les bonnes pratiques pour l’efficacité des performances.