Aller au contenu principal

Bonnes pratiques pour l'interopérabilité et la convivialité

Ces bonnes pratiques vous aident à intégrer Databricks à des systèmes externes et à offrir une expérience utilisateur cohérente, organisée selon les principes architecturaux des sections suivantes.

1. Définir des normes pour l'intégration

Utilisez des modèles d'intégration standard et réutilisables pour l'intégration externe

Les normes d’intégration sont importantes, car elles fournissent des directives sur la manière dont les données doivent être représentées, échangées et traitées entre différents systèmes et applications. Ces normes permettent de s’assurer que les données sont compatibles, de haute qualité et interopérables entre diverses sources et destinations.

Databricks est livré avec une REST API complète qui vous permet de gérer par programmation presque tous les aspects de la plateforme. Le serveur REST API s'exécute dans le plan de contrôle et fournit un Endpoint unifié pour gérer la plateforme Databricks.

L'API REST offre le niveau d'intégration le plus bas qui peut toujours être utilisé. Cependant, la méthode préférée pour s'intégrer à Databricks consiste à utiliser des abstractions de niveau supérieur telles que les SDK Databricks ou les outils CLI. Les outils CLI sont basés sur le Shell et permettent une intégration facile de la plateforme Databricks dans les workflows CI/CD et MLOps.

Utilisez des connecteurs optimisés pour ingérer des sources de données dans Databricks

Databricks offre une variété de moyens pour vous aider à ingérer des données dans Delta Lake.

  • Databricks propose des connecteurs optimisés pour les services de messagerie en continu tels qu'Apache Kafka pour l'ingestion de données en temps réel.

  • Databricks fournit des intégrations intégrées à de nombreux systèmes de données cloud natifs et une prise en charge JDBC extensible pour se connecter à d'autres systèmes de données.

  • Une option pour intégrer des sources de données sans ETL est la Lakehouse Federation. Lakehouse Federation est la plateforme de fédération de query pour Databricks. Le terme de fédération de requêtes décrit un ensemble de fonctionnalités qui permettent aux utilisateurs et aux systèmes d'exécuter des requêtes sur plusieurs sources de données sans avoir à migrer toutes les données vers un système unifié. Databricks utilise Unity Catalog pour gérer la fédération de requêtes. Les outils de gouvernance des données et de data lineage de Unity Catalog garantissent que l'accès aux données est géré et audité pour toutes les requêtes fédérées exécutées par les utilisateurs dans vos workspaces Databricks.

remarque

Toute query de la plateforme Databricks qui utilise une source Lakehouse Federation est envoyée à cette source. Assurez-vous que le système source peut supporter la charge. Sachez également que si le système source est déployé dans une région de cloud différente ou un cloud différent, il y a un coût de sortie pour chaque query.

Envisagez de décharger l'accès aux bases de données sous-jacentes via les vues matérialisées afin d'éviter les charges élevées/concurrentes sur les bases de données opérationnelles et de réduire les coûts de sortie.

Utiliser les outils de partenaires certifiés

Les organisations ont des besoins différents, et aucun outil unique ne peut y répondre. Partner Connect vous permet d’explorer et de vous intégrer facilement à nos partenaires, qui couvrent tous les aspects de Databricks : ingestion de données, préparation et Transformations, BI et visualisation, Machine Learning, qualité des données, et plus encore. Partner Connect vous permet de créer des comptes d'essai avec des partenaires technologiques Databricks sélectionnés et de connecter votre Workspace Databricks à des Solutions partenaires depuis l'interface utilisateur de Databricks. Essayez les solutions partenaires en utilisant vos données sur la plateforme Databricks, puis adoptez les solutions qui répondent le mieux à vos besoins métier.

Réduire la complexité des pipelines de Data Engineering

Investir dans la réduction de la complexité des pipelines de data engineering permet l'évolutivité, l'agilité et la flexibilité pour pouvoir se développer et innover plus rapidement. Les pipelines simplifiés facilitent la gestion et l'adaptation de tous les besoins opérationnels d'un pipeline de data engineering : orchestration des tâches, gestion des clusters, monitoring, qualité des données et gestion des erreurs.

Lakeflow Pipelines étendent les pipelines déclaratifs Apache Spark™ (SDP), un cadre pour la création de pipelines de traitement de données fiables, maintenables et testables. Vous définissez les transformations que vous souhaitez effectuer sur vos données, et LakeFlow Pipelines gèrent l'orchestration des tâches, la gestion des clusters, le monitoring, la qualité des données et la gestion des erreurs. See Spark Declarative Pipelines.

Auto Loader traite de manière incrémentielle et efficace les nouveaux fichiers de données à mesure qu'ils arrivent dans le stockage cloud. Il peut lire de manière fiable les fichiers de données à partir du stockage cloud. Un aspect important des LakeFlow Pipelines et d'Auto Loader est leur nature déclarative : sans eux, il faudrait créer des pipelines complexes qui intègrent différents services cloud, tels qu'un service de notification et un service de mise en file d'attente, pour lire de manière fiable les fichiers cloud basés sur des événements et pour combiner de manière fiable les sources par lots et en streaming.

Auto Loader et les LakeFlow Pipelines réduisent les dépendances et la complexité du système et améliorent considérablement l'interopérabilité avec le stockage cloud et entre différents paradigmes tels que le batch et le streaming. Par conséquent, la simplicité des pipelines améliore la convivialité de la plateforme.

Utiliser l'infrastructure en tant que code (IaC) pour les déploiements et la maintenance

HashiCorp Terraform est un outil open source populaire permettant de créer une infrastructure cloud sûre et prévisible sur plusieurs fournisseurs de cloud. Voir Excellence opérationnelle : utiliser l’infrastructure en tant que code pour les déploiements et la maintenance

2. Utiliser des interfaces ouvertes et des formats de données ouverts

Utiliser des formats de données ouverts

L'utilisation d'un format de données ouvert signifie qu'il n'y a aucune restriction quant à son utilisation. Ceci est important car cela supprime les obstacles à l’accès et à l’utilisation des données pour l’analyse et la génération d’insights commerciaux. Les formats ouverts, tels que ceux basés sur Apache Spark, ajoutent également des fonctionnalités qui améliorent les performances grâce à la prise en charge des transactions ACID, du streaming unifié et du traitement par lots. De plus, l'open source est axé sur la communauté, ce qui signifie que la communauté travaille constamment à l'amélioration des fonctionnalités existantes et à l'ajout de nouvelles, facilitant ainsi l'optimisation des projets pour les utilisateurs.

Le format de données principal utilisé dans la plateforme Data Intelligence est Delta Lake, un format de données entièrement ouvert qui offre de nombreux avantages, des fonctionnalités de fiabilité aux améliorations de performance. Voir Utiliser un format de données qui prend en charge les Transactions ACID et Bonnes pratiques pour l'efficacité des performances.

Puisqu'il est open source, Delta Lake dispose d'un vaste écosystème. Des dizaines d'outils et d'applications tiers prennent en charge Delta Lake. Pour améliorer davantage l’interopérabilité, les tables Delta peuvent être lues avec des clients lecteurs Apache Iceberg. Une seule copie des fichiers de données prend en charge les deux formats, garantissant les métadonnées appropriées pour les différents lecteurs.

Activer le partage sécurisé des données et de l'IA pour tous les assets de données

Le partage des données et des assets d'IA peut favoriser une meilleure collaboration et prise de décision. Cependant, lors du Data Sharing, il est important de maintenir le contrôle, de protéger vos données et d'assurer la conformité avec les lois et réglementations pertinentes en matière de Data Sharing.

OpenSharing est un protocole ouvert développé par Databricks pour partager des données en toute sécurité avec d'autres organisations, quelles que soient les plateformes informatiques qu'elles utilisent. Si vous souhaitez partager des données avec des utilisateurs en dehors de votre Workspace Databricks, qu'ils utilisent ou non Databricks, vous pouvez utiliser le partage Databricks-vers-OpenSharing pour partager vos données en toute sécurité. Si vous souhaitez partager des données avec des utilisateurs disposant d'un Workspace Databricks activé pour Unity Catalog, vous pouvez utiliser OpenSharing Databricks-to-Databricks.

Dans les deux cas, vous pouvez partager des tables, des vues, des volumes, des modèles et des notebooks.

  • Utilisez le protocole ouvert OpenSharing pour le partage de données avec des Partenaires.

    OpenSharing offre une solution ouverte pour partager des données en direct en toute sécurité, de votre lakehouse vers n'importe quelle plateforme de calcul. Les destinataires n’ont pas besoin d’utiliser la plateforme Databricks, le même cloud, ni même un cloud du tout. OpenSharing s’intègre en mode natif à Unity Catalog, ce qui permet aux organisations de gérer et d’auditer de manière centralisée les données partagées et les assets d’IA au sein de l’entreprise, et de partager en toute confiance des données et des assets d’IA qui répondent aux exigences de sécurité et de conformité.

    Les fournisseurs de données peuvent partager des données en direct et des modèles d'IA à partir de l'endroit où ils sont stockés dans la plateforme de données sans les répliquer ni les déplacer vers un autre système. Cette approche réduit les coûts opérationnels du partage de données et d'IA car les fournisseurs de données n'ont pas à répliquer les données plusieurs fois entre les clouds, les zones géographiques ou les plateformes de données pour chacun de leurs consommateurs de données.

  • Utilisez OpenSharing Databricks-to-Databricks entre utilisateurs Databricks.

    Si vous souhaitez partager des données avec des utilisateurs qui n’ont pas accès à votre metastore Unity Catalog, vous pouvez utiliser Databricks-to-Databricks OpenSharing, à condition que les destinataires aient accès à un Workspace Databricks activé pour Unity Catalog. Le partage Databricks-to-Databricks vous permet de partager des données avec des utilisateurs d'autres comptes Databricks, entre les régions cloud et entre les fournisseurs cloud. C'est un excellent moyen de partager des données en toute sécurité entre différents métastores Unity Catalog au sein de votre propre compte Databricks.

Utilisez des standards ouverts pour le développement d’agents, de LLM et de modèles ML

Comme l'utilisation d'un format de données open source, l'utilisation de standards ouverts pour vos workflows d'IA présente des avantages similaires en termes de flexibilité, d'agilité, de coût et de sécurité.

MLflow est la plus grande plateforme d'ingénierie d'IA open source pour les agents, les LLM et les modèles de ML. Databricks propose une version entièrement managée et hébergée de MLflow, intégrée aux fonctionnalités de sécurité d'entreprise, à la haute disponibilité et aux autres fonctionnalités de Databricks Workspace telles que la gestion des expérimentations et des exécutions, et le suivi des révisions de notebook.

L'ensemble complet de fonctionnalités de MLflow pour les agents et les applications LLM comprend l'observabilité de niveau production, l' évaluation, la gestion des invites, une passerelle IA pour la gestion des coûts et l'accès aux modèles, et plus encore. Pour le développement de modèle de machine learning, MLflow fournit un suivi d'expérimentation, des capacités d'évaluation de modèle, un registre de modèles de production intégré à Unity Catalog et des outils de déploiement de modèle.

3. Simplifier la mise en œuvre de nouveaux cas d'utilisation

Offrir une expérience en libre-service sur l'ensemble de la plateforme

Il existe plusieurs avantages d'une plateforme où les utilisateurs ont l'autonomie d'utiliser les outils et les fonctionnalités en fonction de leurs besoins. Investir dans la création d'une plateforme en libre-service facilite de monter en charge pour servir davantage d'utilisateurs et améliore l'efficacité en minimisant le besoin d'intervention humaine pour le provisionnement des utilisateurs, la résolution des problèmes et le traitement des demandes d'accès.

La Databricks Data Intelligence Platform dispose de toutes les fonctionnalités nécessaires pour offrir une expérience en libre-service. Bien qu'une étape d'approbation obligatoire puisse exister, la meilleure pratique consiste à automatiser entièrement la configuration lorsqu'une unité commerciale demande l'accès à Databricks. Provisionner automatiquement leur nouvel environnement, synchroniser les utilisateurs et utiliser la SSO pour l'authentification, fournir un contrôle d'accès aux données partagées et des stockages d'objets séparés pour leurs propres données, et ainsi de suite. En collaboration avec un data catalog centralisé d'ensembles de données sémantiquement cohérents et prêts à l'emploi, les nouvelles unités commerciales peuvent accéder rapidement et en toute sécurité aux fonctionnalités de Databricks et aux données dont elles ont besoin.

Utiliser le compute serverless

Pour le compute Serverless sur la plateforme Databricks, la couche de compute s'exécute dans le compte Databricks de votre client. Les administrateurs cloud n'ont plus besoin de gérer des environnements cloud complexes qui nécessitent l'ajustement des quotas, la création et la maintenance de ressources réseau, et la connexion aux sources de facturation. Les utilisateurs bénéficient d'une latence de Startup de cluster quasi nulle et d'une concurrence de query améliorée.

Utilisez des Template de compute prédéfinis

Les Templates prédéfinis aident à contrôler la manière dont les ressources de compute peuvent être utilisées ou créées par les utilisateurs : Limitez la création de clusters par les utilisateurs à des paramètres prédéfinis ou à un certain nombre, simplifiez l'interface utilisateur ou maîtrisez les coûts en limitant le coût maximal par cluster.

La Data Intelligence Platform y parvient de deux manières :

  • Fournissez des clusters partagés comme environnements immédiats pour les utilisateurs. Sur ces clusters, utilisez la mise à l'échelle automatique vers un nombre très minimal de nœuds afin d'éviter les coûts d'inactivité élevés.
  • Pour un environnement standardisé, utilisez les stratégies de compute pour restreindre la taille ou les fonctionnalités des clusters, ou pour définir des clusters de différentes tailles (S, M, L).

Utilisez les capacités d'IA pour augmenter la productivité

En plus d'augmenter la productivité, les outils d'IA peuvent également aider à identifier les modèles d'erreurs et à fournir des insights supplémentaires basés sur l'entrée. Globalement, l'intégration de ces outils dans le processus de développement peut réduire considérablement les erreurs et faciliter la prise de décision — ce qui accélère la mise en production.

Databricks IQ, le moteur de connaissances alimenté par l'IA, est au cœur de la Data Intelligence Platform. Il s'appuie sur les métadonnées de Unity Catalog pour comprendre vos tables, colonnes, descriptions et assets de données populaires au sein de votre organisation afin de fournir des réponses personnalisées. Il active plusieurs fonctionnalités qui améliorent la productivité lors de l'utilisation de la plateforme, telles que :

  • Genie Code vous permet d'interroger les données via une interface conversationnelle, vous rendant plus productif dans Databricks. Décrivez votre tâche en anglais et laissez l'assistant générer des requêtes SQL, expliquer le code complexe et corriger automatiquement les erreurs.
  • Les commentaires générés par l'IA pour toute table ou colonne de table gérée par Unity Catalog accélèrent le processus de gestion des métadonnées. Cependant, les modèles d'IA ne sont pas toujours précis et les commentaires doivent être examinés avant d'enregistrer. Databricks recommande vivement un examen humain des commentaires générés par l'IA afin de vérifier les inexactitudes.

4. Assurer la cohérence et la convivialité des données

Offrez des données réutilisables en tant que produits auxquels l'entreprise peut faire confiance

Les organisations cherchant à devenir axées sur l'IA et data-driven doivent souvent fournir à leurs équipes internes des données fiables et de haute qualité. Une approche pour prioriser la qualité et la convivialité consiste à appliquer une approche produit à vos assets de données publiés en créant des « produits de données » bien définis. La création de tels produits de données garantit que les organisations établissent des standards et une base fiable de vérité métier pour leurs objectifs en matière de données et d'IA. Les produits de données apportent finalement de la valeur lorsque les utilisateurs et les applications disposent des bonnes données, au bon moment, avec la bonne qualité et dans le bon format. Alors que cette valeur a traditionnellement été concrétisée sous la forme d'Opérations plus efficaces grâce à des coûts réduits, des processus plus rapides et un risque atténué, les produits de données modernes peuvent également ouvrir la voie à de nouvelles offres à valeur ajoutée et à des opportunités de Data Sharing au sein du secteur d'activité ou de l'écosystème de partenaires d'une organisation.

Consultez le billet de blog Créer des produits de données de haute qualité et fiables avec Databricks.

Publier des produits de données sémantiquement cohérents dans toute l'entreprise

Un data lake contient généralement des données provenant de plusieurs systèmes source. Ces systèmes peuvent avoir des noms différents pour le même concept (par exemple, client ou compte ) ou utiliser le même identifiant pour faire référence à des concepts différents. Pour que les utilisateurs métier puissent facilement combiner ces jeux de données de manière significative, les données doivent être rendues homogènes entre toutes les sources pour être sémantiquement cohérentes. De plus, pour que certaines données soient pertinentes pour l'analyse, les règles métier internes, telles que la reconnaissance des revenus, doivent être appliquées correctement. Pour garantir que tous les utilisateurs utilisent les données correctement interprétées, les datasets avec ces règles doivent être mis à disposition et publiés dans Unity Catalog. L'accès aux données source doit être restreint aux équipes qui comprennent l'utilisation correcte.

Fournir un catalogue central pour la découverte et la traçabilité

Un catalogue centralisé pour la découverte et la traçabilité aide les consommateurs de données à accéder aux données provenant de multiples sources au sein de l'entreprise, réduisant ainsi la charge opérationnelle pour l'équipe de gouvernance centrale.

Dans Unity Catalog, les administrateurs et les data stewards gèrent les utilisateurs et leur accès aux données de manière centralisée dans tous les workspaces d’un compte Databricks. Les utilisateurs de différents Workspace peuvent partager les mêmes données et, selon les privilèges accordés de manière centralisée dans Unity Catalog, peuvent accéder ensemble aux données.

Pour la découverte des données, Unity Catalog prend en charge les utilisateurs avec des fonctionnalités telles que :

  • Catalog Explorer est l'interface utilisateur principale pour de nombreuses fonctionnalités de Unity Catalog. Vous pouvez utiliser Catalog Explorer pour afficher les détails du schéma, prévisualiser des exemples de données et afficher les détails et les propriétés de la table. Les administrateurs peuvent afficher et modifier les propriétaires, et les administrateurs ainsi que les propriétaires d'objets de données peuvent accorder et révoquer des autorisations. Vous pouvez également utiliser la recherche Databricks, qui permet aux utilisateurs de trouver facilement et sans interruption les actifs de données (tels que les tables, les colonnes, les vues, les tableaux de bord, les modèles, etc.). Les utilisateurs voient des résultats pertinents à leurs demandes de recherche et auxquels ils ont accès.
  • Data lineage sur toutes les queries exécutées sur un cluster Databricks ou un SQL Warehouse. La traçabilité est prise en charge pour toutes les langues et est capturée jusqu'au niveau des colonnes. Les données de traçabilité incluent des notebooks, des jobs et des tableaux de bord liés à la query. La traçabilité peut être visualisée dans Catalog Explorer en temps quasi réel et récupérée avec l'API REST de Databricks.

Pour permettre aux entreprises de fournir à leurs utilisateurs une vue d'ensemble de toutes les données sur toutes les plateformes de données, Unity Catalog s'intègre aux data catalogs d'entreprise (parfois appelés « catalogue des catalogues »).