Connecteur Google Drive
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Le connecteur Google Drive géré dans Lakeflow Connect vous permet d'ingérer des fichiers de Google Drive vers Databricks. Ingérez des fichiers non structurés en tant que données binaires, analysez les formats structurés (CSV, JSON, XML, EXCEL, et plus encore) dans des tables Delta, ou capturez les métadonnées des fichiers sans charger leur contenu.
Pour le connecteur Google Drive standard qui utilise les API de lecteur Spark (read_files, spark.read, Auto Loader), consultez Ingérer des fichiers depuis Google Drive.
Ce qu'il faut savoir avant de start
Sujet | Pourquoi c'est important |
|---|---|
Le workflow dépend de votre persona utilisateur Databricks :
| |
Les étapes pour créer une connexion dépendent de la méthode d'authentification que vous sélectionnez. | |
Les étapes de création d'un pipeline dépendent de l'interface. | |
La planification du pipeline dépend de vos exigences en matière de latence et de coût. | |
Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations comme le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités. |
Start l'ingestion à partir de Google Drive
Le tableau suivant présente un aperçu du flux d'ingestion de bout en bout de Google Drive, basé sur le type d'utilisateur :
Utilisateur | Étapes |
|---|---|
Administrateur |
|
Non-administrateur | Utilisez toute interface prise en charge pour créer un pipeline à partir d'une connexion existante. Voir Ingérer des données depuis Google Drive. |
Disponibilité des fonctionnalités
Fonctionnalité | Disponibilité |
|---|---|
Conception de pipelines via l'interface utilisateur |
|
Création de pipeline par API |
|
Declarative Automation Bundles |
|
Ingestion incrémentielle |
|
Gouvernance Unity Catalog |
|
Orchestration à l'aide de Databricks Workflows |
|
SCD de type 2 |
|
évolution des schémas |
Configurable via |
Sélection et désélection de colonnes via API |
|
Filtrage des lignes basé sur l'API |
|
Méthodes d'authentification
Méthode d'authentification | Disponibilité |
|---|---|
OAuth U2M |
|
OAuth M2M |
|
OAuth (jeton de refresh manuel) |
|
Authentification de base (nom d’utilisateur/mot de passe) |
|
Authentification de base (clé API) |
|
Authentification de base (clé JSON du compte de service) |
|