FAQ du connecteur Google Drive
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Cette page répond aux questions fréquemment posées sur le connecteur Google Drive dans Databricks Lakeflow Connect.
FAQ générales sur les connecteurs gérés
Les réponses dans les FAQ sur les connecteurs gérés s'appliquent à tous les connecteurs gérés dans Lakeflow Connect. Continuez à lire pour les FAQ spécifiques au connecteur.
Quels formats de fichier sont pris en charge ?
Le connecteur prend en charge l'ingestion de fichiers non structurés et structurés :
-
Non structuré :
BINARYFILE- Les fichiers sont ingérés sous forme de lignes avec une colonne
contentet des colonnes de métadonnées. À utiliser pour les fichiers PDF, les images, les fichiers Office et les autres fichiers que vous souhaitez traiter en aval.
- Les fichiers sont ingérés sous forme de lignes avec une colonne
-
Structuré :
CSV,JSON,XML,EXCEL,PARQUET,AVRO,ORC- Les fichiers sont analysés et chaque ligne du fichier devient une ligne dans la table de destination.
Le connecteur ignore les formats Google non pris en charge (par exemple, Google Forms, Google Sites, Google Jams et Google Vids) lors de l’ingestion.
Quels modes de stockage sont pris en charge ?
L'ingestion non structurée (BINARYFILE) prend en charge le mode de stockage SCD_TYPE_1. L'ingestion structurée (CSV, JSON, XML, EXCEL et d'autres formats) prend en charge le mode de stockage APPEND_ONLY. Le SCD de type 2 n'est pas pris en charge actuellement.
Étant donné que SCD_TYPE_1 et APPEND_ONLY sont les options default pour leurs types de format respectifs et également les seules options actuellement prises en charge, la définition explicite de storage_mode dans table_configuration est facultative.
Comment fonctionne l'ingestion incrémentielle ?
Lors des exécutions ultérieures du pipeline, le connecteur réingère uniquement les fichiers qui ont été ajoutés ou mis à jour depuis la dernière exécution. Il ne se met pas à jour de manière incrémentielle dans ces fichiers (par exemple, uniquement les lignes d'un CSV qui ont changé).
Puis-je ingérer un seul fichier ?
Pas directement. Le connecteur ingère tous les fichiers dans un dossier ou un lecteur. Cependant, vous pouvez approximer la sélection d'un seul fichier en pointant le url vers le dossier contenant le fichier et en utilisant file_filters avec un modèle global path_filter qui correspond uniquement au nom de ce fichier. Consultez la référence du connecteur Google Drive.
Y a-t-il une limite de taille de fichier ?
Pour l'ingestion non structurée à l'aide de fichiers binaires, les fichiers volumineux peuvent provoquer l'échec de la mise à jour (par exemple, avec une erreur de mémoire insuffisante ou en dépassant la limite de 2 Go sur les colonnes binaires dans Delta), car le contenu de chaque fichier est chargé en mémoire en tant qu'enregistrement unique. Pour exclure les fichiers volumineux, utilisez un row_filter sur la colonne length dans table_configuration. Voir limites du connecteur Google Drive.
Comment les formats Google intégrés sont-ils gérés ?
Lorsque vous utilisez le connecteur Google Drive géré, les formats Google intégrés (Google Docs, Google Sheets, Google Slides) sont automatiquement exportés vers un format ouvert pendant l'ingestion. Définissez le format dans file_ingestion_options sur BINARYFILE pour les ingérer en binaire, ou utilisez EXCEL pour Google Sheets. Pour plus de détails sur la gestion des formats Google avec le connecteur géré, consultez Comment les formats Google intégrés sont gérés.
Quelle est la différence entre le connecteur Google Drive géré et le connecteur Google Drive standard ?
Le connecteur Google Drive géré (gdrive_options dans l'API de pipeline) est un pipeline d'ingestion entièrement managé qui synchronise de manière incrémentielle les fichiers de Google Drive vers des tables Delta, avec inférence de schéma, évolution des schémas, filtrage des fichiers et orchestration via des Workflows. Il est configuré via l’API de pipeline Lakeflow Connect.
Le connecteur Google Drive standard utilise les fonctions Spark et SQL (read_files, spark.read, Auto Loader) pour créer des pipelines personnalisés. Utilisez-le lorsque vous avez besoin d'un contrôle précis sur la manière dont les fichiers sont lus et transformés, ou lorsque vous souhaitez utiliser directement les APIs de lecture Spark.