Aller au contenu principal

Utiliser un connecteur de communauté enregistré

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

Cette page montre comment utiliser un connecteur de communauté enregistré pour ingérer des données d’une source prise en charge dans Databricks. Pour créer un connecteur personnalisé pour une source qui n'est pas encore prise en charge, consultez Créer un connecteur personnalisé.

Exigences

  • Un workspace Databricks avec Unity Catalog activé
  • Une connexion pour la source que vous souhaitez ingérer, ou des autorisations pour créer une connexion
  • Accès en écriture à un catalogue et un schéma pour les tables ingérées

Créer un pipeline d’ingestion

Pour utiliser un connecteur de Communauté enregistré :

  1. Dans la barre latérale de votre Workspace Databricks, cliquez sur +Nouveau > Ajouter ou Upload des données , puis sélectionnez la source sous Connecteurs de communauté .

  2. Cliquez sur + Créer une connexion ou sélectionnez une connexion existante, puis cliquez sur Suivant .

  3. Pour Nom de la pipeline , saisissez un nom pour la pipeline.

  4. Pour l'emplacement du log des événements , saisissez un nom de catalogue et un nom de schéma. Databricks stocke le Log des événements du pipeline ici. Les tables ingérées sont également écrites ici par default.

  5. Pour le chemin racine , saisissez votre chemin de Workspace (par exemple, /Workspace/Users/<your-email>/connectors). Databricks clone et stocke le code source du connecteur ici.

  6. Cliquez sur **Créer un pipeline**.

  7. Dans l'éditeur de pipeline, ouvrez ingest.py et mettez à jour le champ **objets** pour inclure les tables que vous souhaitez ingérer. Par exemple :

    Python
    from databricks.labs.community_connector.pipeline import ingest

    pipeline_spec = {
    "connection_name": "my_stripe_connection", # Required: UC connection name
    "objects": [
    {"table": {"source_table": "charges"}},
    {"table": {"source_table": "customers",
    "destination_table": "stripe_customers"}},
    ],
    }

    ingest(spark, pipeline_spec)
  8. Exécutez le pipeline manuellement ou planifiez-le.

Options de configuration du pipeline

Vous pouvez configurer les options suivantes dans ingest.py:

Option

Description

connection_name

Obligatoire. Le nom de la connexion qui stocke les informations d'identification d'authentification pour la source.

objects

Obligatoire. Une liste de tables à ingérer. Chaque entrée a le format {"table": {"source_table": "..."}}. Vous pouvez également spécifier un destination_table facultatif à l'intérieur de l'objet table.

destination_catalog

Le catalogue où les tables ingérées sont écrites. Par défaut, il s’agit du catalogue défini lors de la création du pipeline.

destination_schema

Le schéma où les tables ingérées sont écrites. Default to the schema set during pipeline creation.

scd_type

La stratégie de dimension à évolution lente : SCD_TYPE_1, SCD_TYPE_2 ou APPEND_ONLY. Default to SCD_TYPE_1.

primary_keys

Remplacer les clés principales par default d'une table. Fournissez une liste de noms de colonnes.

Option

Description

connection_name

Obligatoire. Le nom de la connexion qui stocke les informations d'identification d'authentification pour la source.

objects

Obligatoire. Une liste de tables à ingérer. Chaque entrée a le format {"table": {"source_table": "..."}}. Vous pouvez également spécifier un destination_table facultatif à l'intérieur de l'objet table.

destination_catalog

Le catalogue où les tables ingérées sont écrites. Par défaut, il s’agit du catalogue défini lors de la création du pipeline.

destination_schema

Le schéma où les tables ingérées sont écrites. Default to the schema set during pipeline creation.

scd_type

La stratégie de dimension à évolution lente : SCD_TYPE_1, SCD_TYPE_2 ou APPEND_ONLY. Default to SCD_TYPE_1.

primary_keys

Remplacer les clés principales par default d'une table. Fournissez une liste de noms de colonnes.