Utiliser un connecteur de communauté enregistré
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Cette page montre comment utiliser un connecteur de communauté enregistré pour ingérer des données d’une source prise en charge dans Databricks. Pour créer un connecteur personnalisé pour une source qui n'est pas encore prise en charge, consultez Créer un connecteur personnalisé.
Exigences
- Un workspace Databricks avec Unity Catalog activé
- Une connexion pour la source que vous souhaitez ingérer, ou des autorisations pour créer une connexion
- Accès en écriture à un catalogue et un schéma pour les tables ingérées
Créer un pipeline d’ingestion
Pour utiliser un connecteur de Communauté enregistré :
-
Dans la barre latérale de votre Workspace Databricks, cliquez sur +Nouveau > Ajouter ou Upload des données , puis sélectionnez la source sous Connecteurs de communauté .
-
Cliquez sur + Créer une connexion ou sélectionnez une connexion existante, puis cliquez sur Suivant .
-
Pour Nom de la pipeline , saisissez un nom pour la pipeline.
-
Pour l'emplacement du log des événements , saisissez un nom de catalogue et un nom de schéma. Databricks stocke le Log des événements du pipeline ici. Les tables ingérées sont également écrites ici par default.
-
Pour le chemin racine , saisissez votre chemin de Workspace (par exemple,
/Workspace/Users/<your-email>/connectors). Databricks clone et stocke le code source du connecteur ici. -
Cliquez sur **Créer un pipeline**.
-
Dans l'éditeur de pipeline, ouvrez
ingest.pyet mettez à jour le champ **objets** pour inclure les tables que vous souhaitez ingérer. Par exemple :Pythonfrom databricks.labs.community_connector.pipeline import ingest
pipeline_spec = {
"connection_name": "my_stripe_connection", # Required: UC connection name
"objects": [
{"table": {"source_table": "charges"}},
{"table": {"source_table": "customers",
"destination_table": "stripe_customers"}},
],
}
ingest(spark, pipeline_spec) -
Exécutez le pipeline manuellement ou planifiez-le.
Options de configuration du pipeline
Vous pouvez configurer les options suivantes dans ingest.py:
Option | Description |
|---|---|
| Obligatoire. Le nom de la connexion qui stocke les informations d'identification d'authentification pour la source. |
| Obligatoire. Une liste de tables à ingérer. Chaque entrée a le format |
| Le catalogue où les tables ingérées sont écrites. Par défaut, il s’agit du catalogue défini lors de la création du pipeline. |
| Le schéma où les tables ingérées sont écrites. Default to the schema set during pipeline creation. |
| La stratégie de dimension à évolution lente : |
| Remplacer les clés principales par default d'une table. Fournissez une liste de noms de colonnes. |