Connecter aux sources de données et aux services externes
Cette page fournit des recommandations à l'intention des administrateurs et des utilisateurs experts qui configurent des connexions entre Databricks et des sources de données et services externes.
Vous pouvez connecter votre compte Databricks à des sources de données telles que le stockage d’objets cloud, les systèmes de gestion de bases de données relationnelles, les services de données en streaming et les plateformes d’entreprise telles que les CRM. Vous pouvez également connecter votre compte Databricks à des services externes, tels qu’AWS Glue ou AWS Secrets Manager.
Configurez les connexions au stockage d'objets cloud.
La plupart des données utilisées par les charges de travail Databricks sont stockées dans un stockage d'objets cloud, tel que AWS S3 ou Cloudflare R2. Vous pouvez gérer l'accès au stockage d'objets cloud en utilisant l'une des options suivantes :
-
Unity Catalog (recommandé), qui assure la gouvernance des données structurées et non structurées dans le stockage d'objets cloud. Voir Se connecter au stockage d'objets cloud à l'aide de Unity Catalog.
-
Connecteurs et modèles de connexion hérités. Voir Configurer l'accès au stockage d'objets cloud pour Databricks à l'aide des anciens modèles.
Connexions au Unity Catalog
Une connexion Unity Catalog est un objet sécurisable qui stocke l'endpoint et les identifiants nécessaires pour accéder à un système externe. Les connexions offrent un moyen géré de gérer l'authentification et la configuration des systèmes de données externes, y compris la fédération, l'ingestion gérée, JDBC et HTTP. Pour un aperçu de tous les types de connexion et comment choisir entre eux, consultez les connexions Unity Catalog.
Configurez les connexions aux systèmes de données externes
Databricks propose plusieurs options pour configurer les connexions aux systèmes de données externes. Le tableau suivant fournit un aperçu général de ces options :
Option | Description |
|---|---|
Connecteurs de query federation | La fédération de requêtes offre un accès en lecture seule aux bases de données relationnelles externes en poussant les requêtes Unity Catalog via JDBC. Les sources prises en charge incluent PostgreSQL, MySQL, SQL Server, Snowflake, et bien plus encore. |
Connecteurs de fédération de catalogues | La fédération de catalogues connecte des plateformes de catalogue externes, telles qu'un Hive metastore, AWS Glue ou Snowflake Horizon Catalog, afin que vous puissiez interroger leurs données directement dans le stockage de fichiers sans mouvement de données. |
Connecteurs d'ingestion gérés | Lakeflow Connect permet aux utilisateurs administrateurs de créer simultanément une connexion et un pipeline d'ingestion géré dans l'interface utilisateur d'ingestion de données. Consultez les connecteurs gérés dans Lakeflow Connect. Si les utilisateurs qui créeront des pipelines ne sont pas des utilisateurs non administrateurs ou prévoient d'utiliser les APIs Databricks, les SDK Databricks, le CLI Databricks ou les Declarative Automation Bundles, un administrateur doit d'abord créer la connexion dans Catalog Explorer. Ces interfaces exigent que les utilisateurs spécifient une connexion existante lorsqu'ils créent un pipeline. Voir Connexion aux sources d'ingestion gérées. |
Connecteurs de streaming | Databricks fournit des connecteurs optimisés pour de nombreux systèmes de données de streaming. Pour toutes les sources de données en streaming, vous devez générer des informations d’identification qui donnent accès et charger ces informations d’identification dans Databricks. Databricks vous recommande de stocker les identifiants à l'aide de secrets, car vous pouvez utiliser des secrets pour toutes les options de configuration et dans tous les modes d'accès. Tous les connecteurs de données pour les sources de streaming prennent en charge le passage des informations d'identification à l'aide d'options lorsque vous définissez des requêtes de streaming. Consultez les connecteurs standard de LakeFlow Connect. |
Intégrations tierces | Utilisez des outils tiers pour vous connecter à des sources de données externes et automatiser l'ingestion de données dans le lakehouse. Certaines Solutions incluent également l'ETL inverse et l'accès direct aux données du lakehouse depuis des systèmes externes. Consultez Qu'est-ce que Databricks Partner Connect ?. |
API de source de données Spark | Utilisez l'API Spark Data Source pour lire et écrire dans des bases de données externes. Databricks Runtime inclut des connecteurs fournis pour les sources courantes. Vous pouvez également utiliser une connexion Unity Catalog avec votre propre JAR de Driver JDBC, installer des connecteurs tiers sur des clusters dédiés, ou créer des connecteurs personnalisés avec l'API PySpark DataSource. Voir les sources de données Spark. Pour un accès en lecture seule, Databricks recommande Lakehouse Federation. |
JDBC | Connectez-vous à des bases de données externes en utilisant JDBC avec une connexion Unity Catalog pour un accès réglementé, l'isolation des identifiants et la prise en charge inter-compute. Voir la connexion JDBC. Pour les configurations JDBC héritées sans gouvernance Unity Catalog, consultez Query databases using JDBC. Pour la fédération de query en lecture seule, Lakehouse Federation est toujours préférée. |
Configurer les connexions aux services cloud non liés au stockage
Unity Catalog régit l'accès aux services cloud non-stockage à l'aide d'un objet sécurisable appelé un identifiant de service . Une identification de service encapsule une identification cloud à long terme qui fournit un accès à un service cloud non-stockage auquel les utilisateurs doivent se connecter depuis Databricks. Voir Se connecter aux services cloud externes à l'aide de Unity Catalog.
Gérer et demander l'accès aux sources de données et aux services externes
La plupart des méthodes de connexion exigent des privilèges élevés sur la source de données externe ou le service, ainsi que sur le workspace Databricks. Dans les organisations typiques, peu d'utilisateurs disposent de privilèges suffisants, que ce soit dans Databricks ou chez les fournisseurs externes de données et de stockage, pour configurer eux-mêmes les connexions de données.
Votre organisation a peut-être déjà configuré l'accès à une source de données ou à un service en utilisant l'un des modèles décrits dans les articles liés à cette page. Si votre organisation dispose d'un processus bien défini pour demander l'accès aux données et aux services tiers, Databricks recommande de suivre ce processus. Si vous n'êtes pas certain d'obtenir l'accès à une source de données, cette procédure pourrait vous aider :
- Utilisez l'Explorateur de catalogue pour afficher les tables et les volumes auxquels vous pouvez accéder. Consultez Qu'est-ce que l'Explorateur de catalogue ?.
- Demandez à vos coéquipiers ou à vos responsables quelles sont les sources de données auxquelles ils peuvent accéder.
- La plupart des organisations utilisent des groupes synchronisés à partir de leur fournisseur d'identité (par exemple : Okta ou Microsoft Entra ID) pour gérer les autorisations des utilisateurs du workspace. Si d'autres membres de votre équipe peuvent accéder aux sources de données auxquelles vous avez besoin d'accéder, demandez à un administrateur de Workspace de vous ajouter au bon groupe pour accorder l'accès.
- Si une table, un volume ou une source de données particulier a été configuré par un collègue, cette personne devrait pouvoir vous accorder l'accès aux données.
Certaines organisations associent des autorisations d'accès aux données à des clusters de compute et des SQL Warehouse spécifiques. Il s'agit d'un modèle de gouvernance hérité, mais si votre organisation l'utilise et que vous souhaitez savoir quelles sources de données sont disponibles sur une ressource de compute spécifique, contactez le créateur du compute indiqué dans l' tab Compute.