Aller au contenu principal

Connecteurs de source de données de fichiers gérés

Databricks Lakeflow Connect fournit des connecteurs entièrement managés pour l'ingestion de fichiers non structurés à partir de services de stockage de fichiers d'entreprise. Chaque connecteur gère l'authentification spécifique à la source, les lectures incrémentielles et les tentatives automatiques.

Connecteurs pris en charge

    • Google Drive (géré)
    • Ingérez des fichiers de Google Drive dans le Lakehouse à l'aide de l'ingestion de fichiers source gérée.
    • Microsoft SharePoint (géré)
    • Ingérez des fichiers à partir de sites Microsoft SharePoint à l'aide de l'ingestion de sources de fichiers gérées.

Pour les connecteurs standard utilisant les API Spark et SQL, consultez Ingérer des fichiers depuis Google Drive et Ingérer des fichiers depuis SharePoint.

Composants de connecteur

Un connecteur de source de fichiers comprend les composants suivants :

Composant

Description

Connexion

Un objet sécurisable de Unity Catalog qui stocke les détails d'authentification pour le service de stockage de fichiers.

pipeline d'ingestion

Un pipeline qui copie les fichiers de la source vers les tables de destination. Le pipeline d'ingestion s'exécute sur un compute serverless.

Tables de destination

Les tables où le pipeline d'ingestion écrit les données. Ce sont des tables de streaming, qui sont des tables Delta avec un support supplémentaire pour le traitement incémentiel des données.

Composant

Description

Connexion

Un objet sécurisable de Unity Catalog qui stocke les détails d'authentification pour le service de stockage de fichiers.

pipeline d'ingestion

Un pipeline qui copie les fichiers de la source vers les tables de destination. Le pipeline d'ingestion s'exécute sur un compute serverless.

Tables de destination

Les tables où le pipeline d'ingestion écrit les données. Ce sont des tables de streaming, qui sont des tables Delta avec un support supplémentaire pour le traitement incémentiel des données.