Aller au contenu principal

Interopérabilité et convivialité pour Databricks

Le pilier Interopérabilité et convivialité décrit comment Databricks interagit avec les utilisateurs et d'autres systèmes. Une idée fondamentale de Databricks est de fournir une excellente expérience à chaque persona qui l'utilise, tout en s'intégrant à un vaste écosystème de systèmes externes.

  • L' interopérabilité est la capacité d'un système à fonctionner avec d'autres systèmes et à s'y intégrer. Cela implique une interaction entre différents composants et produits, provenant potentiellement de plusieurs fournisseurs, et entre les versions passées et futures du même produit.
  • L' ergonomie mesure la capacité d'un système à permettre aux utilisateurs d'effectuer des tâches en toute sécurité, efficacement et de manière efficiente.

Diagramme d’architecture d’interopérabilité et de convivialité pour Databricks.

Suivre les principes de ce pilier permet de :

  • Obtenez une expérience utilisateur cohérente et collaborative.
  • Tirer parti des synergies entre les clouds.
  • Simplifiez l'intégration depuis et vers Databricks.
  • Réduire les coûts de formation et d'activation.

Et, à terme, permettre un délai de rentabilisation plus rapide.

Principes d'interopérabilité et d'ergonomie

  1. Définissez des standards pour l'intégration

    L'intégration a différents aspects et peut être réalisée de nombreuses manières. Afin d'éviter la prolifération d'outils et d'approches, les meilleures pratiques doivent être définies et une liste d'outils et de connecteurs bien pris en charge et préférés doit être fournie.

    La modularité et le couplage lâche sont des principes architecturaux clés plutôt qu'une intégration étroite. Cela réduit les dépendances entre les composants et les charges de travail, aide à éliminer les effets secondaires et permet un développement indépendant à différentes échelles de temps. Utilisez les datasets et leur schéma comme contrat. Séparez les charges de travail telles que les jobs de manipulation de données (par exemple le chargement et la transformation des données dans un data lake) des jobs à valeur ajoutée (par exemple les rapports, les tableaux de bord et l’ingénierie des fonctionnalités de Data Science). Définissez un data catalog central avec des directives pour les formats de données, la qualité des données et le cycle de vie des données.

  2. Utiliser des interfaces ouvertes et des formats de données ouverts

    Souvent, des Solutions sont développées où les données ne peuvent être consultées que par le biais d'un système spécifique. Cela peut entraîner une dépendance vis-à-vis des fournisseurs, mais cela peut aussi devenir un énorme coût Driver si l'accès aux données via ce système est soumis à des frais de licence. L'utilisation de formats de données et d'interfaces ouverts permet d'éviter cela. Ils simplifient également l'intégration avec les systèmes existants et ouvrent un écosystème de Partenaires qui ont déjà intégré leurs outils à Databricks.

    Si vous utilisez des écosystèmes open source tels que Python ou R pour la Data Science, ou Spark ou ANSI SQL pour l’accès aux données et le contrôle des droits d’accès, vous trouverez plus facilement du personnel pour les projets. Cela simplifiera également les migrations potentielles vers et depuis une plateforme.

  3. Simplifiez l’implémentation de nouveaux cas d’utilisation

    Pour tirer le meilleur parti des données du data lake, les utilisateurs doivent pouvoir déployer facilement leurs cas d'usage sur la plateforme. Cela commence par des processus allégés autour de l'accès à la plateforme et de la gestion de données. Par exemple, l'accès en libre-service à la plateforme aide à éviter qu'une équipe centrale ne devienne un goulot d'étranglement. Des environnements partagés et des modèles prédéfinis pour le déploiement de nouveaux environnements garantissent que la plateforme est rapidement accessible à tout utilisateur métier.

  4. Assurer la cohérence et l'utilisabilité des données

    Deux activités importantes sur une plateforme de données sont la *publication de données* et la *consommation de données*. Du point de vue de la publication, les données devraient être proposées en tant que produit. Les éditeurs doivent suivre un cycle de vie défini en tenant compte des consommateurs, et les données doivent être clairement définies avec des schémas gérés, des descriptions, etc.

    Il est également important de fournir des données sémantiquement cohérentes afin que les consommateurs puissent facilement comprendre et combiner correctement différents ensembles de données. De plus, toutes les données doivent être facilement découvrables et accessibles aux consommateurs via un catalogue central avec des métadonnées et une data lineage correctement organisées.

Suite : Meilleures pratiques pour l'interopérabilité et l'utilisabilité

Voir les bonnes pratiques pour l'interopérabilité et la convivialité.