Aller au contenu principal

Limitations du connecteur Gmail

Cette page répertorie les limitations et les points à prendre en compte pour l'ingestion de données depuis Gmail à l'aide de Databricks Lakeflow Connect.

info

Bêta

Cette fonctionnalité est en version bêta. Les administrateurs de Workspace peuvent contrôler l’accès à cette fonctionnalité depuis la page Aperçus . Consultez Gérer les aperçus Databricks.

Limitations générales des connecteurs SaaS

Les limitations de cette section s’appliquent à tous les connecteurs SaaS dans Lakeflow Connect.

  • Lorsque vous exécutez un pipeline planifié, les alertes ne se trigger pas immédiatement. Au lieu de cela, ils s'activent lorsque le prochain Trigger s'exécute.
  • Lorsqu’une table source est supprimée, la table de destination n’est pas automatiquement supprimée. Vous devez supprimer manuellement la table de destination. Ce comportement n’est pas cohérent avec le comportement des Spark Declarative Pipelines sur Lakeflow.
  • Pendant les périodes de maintenance de la source, Databricks pourrait ne pas être en mesure d’accéder à vos données.
  • Si un nom de table source est en conflit avec un nom de table de destination existant, la mise à jour du pipeline échoue.
  • La prise en charge des pipelines multi-destinations est disponible uniquement via API.
  • Vous pouvez éventuellement renommer une table que vous ingérez. Si vous renommez une table dans votre pipeline, celui-ci devient un pipeline accessible uniquement via l'API et vous ne pouvez plus le modifier dans l'interface utilisateur.
  • Si vous sélectionnez une colonne après le start d'un pipeline, le connecteur ne remplit pas automatiquement les données pour la nouvelle colonne. Pour ingérer des données historiques, exécutez manuellement un refresh complet sur la table.
  • Databricks ne peut pas ingérer deux tables ou plus portant le même nom dans le même pipeline, même si elles proviennent de schémas sources différents.
  • Le système source suppose que les colonnes de curseur augmentent de façon monotone.
  • Le connecteur ingère des données brutes sans transformations. Utilisez des Spark Declarative Pipelines en aval sur les LakeFlow Pipelines pour les Transformations.

Spécifique au connecteur

Les limitations de cette section sont spécifiques au connecteur Gmail.

  • Les tables profile, labels, labels_details, drafts et filters ne prennent en charge que le refresh complet. Ils sont réingérés intégralement à chaque exécution du pipeline et ne se synchronisent pas de manière incrémentielle.
  • Seules les tables messages et message_labels se synchronisent de manière incrémentielle, en utilisant l’API Gmail History basée sur un curseur historyId.
  • Les tables messages et message_labels ne prennent pas en charge le suivi de l'historique SCD de type 2 ; la configuration du SCD de type 2 pour ces tables entraîne l'échec de la validation du pipeline.
  • Si Gmail expire le historyId stocké (l'API History renvoie une erreur 404 car le curseur est plus ancien que la fenêtre de rétention de Gmail), le connecteur revient automatiquement à un full refresh de la table concernée.
  • Gmail conserve l’historique pendant une fenêtre limitée, généralement d’environ sept jours. Databricks recommande de planifier l’exécution du pipeline au moins une fois tous les sept jours. Si le pipeline s’exécute moins fréquemment, les historyId stockés peuvent expirer et forcer un full refresh de messages et message_labels.
  • Chaque connexion ingère une seule boîte aux lettres. Pour ingérer plusieurs boîtes aux lettres, créez une connexion et un pipeline distincts par boîte aux lettres. La valeur de la boîte aux lettres est marquée comme une colonne mailbox sur chaque ligne.
  • La structure MIME messages payload est matérialisée jusqu’à 8 niveaux d’imbrication. Les parties imbriquées plus profondément ne sont pas développées en colonnes struct.
  • Le connecteur est en lecture seule et nécessite le champ d’application gmail.readonly. Il ne modifie pas la boîte aux lettres source.