Aller au contenu principal

Connecteur Gmail

info

Bêta

Cette fonctionnalité est en version bêta. Les administrateurs de Workspace peuvent contrôler l’accès à cette fonctionnalité depuis la page Aperçus . Consultez Gérer les aperçus Databricks.

Le connecteur Gmail géré dans Lakeflow Connect ingère les messages, les libellés, les brouillons et les filtres d'une boîte aux lettres Gmail vers Databricks.

Le connecteur lit à partir d’une seule boîte aux lettres par connexion à l’aide d’un compte de service Google, et il est en lecture seule. Il ne modifie jamais la boîte aux lettres source. Les tables messages et message_labels se synchronisent de manière incrémentielle à l’aide de l’API Gmail History. Les autres tables sont ré-ingérées en intégralité à chaque exécution du pipeline.

Disponibilité des fonctionnalités

Gmail est indépendant du cloud. La disponibilité des fonctionnalités suivante s'applique sur AWS et GCP.

Fonctionnalité

Disponibilité

Création de pipeline basée sur l’interface utilisateur

Icône de coche verte Pris en charge

Création de pipeline basée sur une API

Icône de coche verte Pris en charge

Declarative Automation Bundles

Icône de coche verte Pris en charge

Ingestion incrémentielle

Icône de coche verte Pris en charge

Seulement pour les tables messages et message_labels . Les autres tables ne sont qu’en refresh complet.

Gouvernance Unity Catalog

Icône de coche verte Pris en charge

Orchestration avec Databricks Workflows

Icône de coche verte Pris en charge

SCD de type 2

Icône X rouge Non pris en charge

La configuration du SCD de type 2 pour la table messages ou message_labels entraîne l'échec de la validation du pipeline.

Fonctionnalité

Disponibilité

Création de pipeline basée sur l’interface utilisateur

Icône de coche verte Pris en charge

Création de pipeline basée sur une API

Icône de coche verte Pris en charge

Declarative Automation Bundles

Icône de coche verte Pris en charge

Ingestion incrémentielle

Icône de coche verte Pris en charge

Seulement pour les tables messages et message_labels . Les autres tables ne sont qu’en refresh complet.

Gouvernance Unity Catalog

Icône de coche verte Pris en charge

Orchestration avec Databricks Workflows

Icône de coche verte Pris en charge

SCD de type 2

Icône X rouge Non pris en charge

La configuration du SCD de type 2 pour la table messages ou message_labels entraîne l'échec de la validation du pipeline.

Méthodes d’authentification

Méthode d’authentification

Disponibilité

Compte de service Google (compte de service OAuth avec délégation à l'échelle du domaine)

Icône de coche verte Pris en charge

OAuth U2M

Icône X rouge Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

Icône X rouge Non pris en charge

Méthode d’authentification

Disponibilité

Compte de service Google (compte de service OAuth avec délégation à l'échelle du domaine)

Icône de coche verte Pris en charge

OAuth U2M

Icône X rouge Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

Icône X rouge Non pris en charge

Le connecteur s'authentifie auprès de Gmail avec un compte de service Google. Vous accordez au compte de service une délégation à l'échelle du domaine pour la portée https://www.googleapis.com/auth/gmail.readonly et choisissez la boîte aux lettres que le compte de service usurpe. Pour les étapes de configuration, voir Configurer Gmail pour l'ingestion Databricks.

Ce qu'il faut savoir avant de start

Sujet

Pourquoi c'est important

Profil utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Mono-utilisateur : un utilisateur administrateur crée une connexion Unity Catalog et un pipeline d’ingestion.
  • Multi-utilisateur : un administrateur crée une connexion que les utilisateurs non administrateurs peuvent utiliser pour créer des pipelines.

Méthode d’authentification

Le connecteur s'authentifie avec un compte de service Google qui usurpe l'identité d'une seule boîte aux lettres.

Une seule boîte aux lettres par connexion

Chaque connexion ingère une boîte aux lettres. Pour ingérer plus d'une boîte aux lettres, créez une connexion et un pipeline distincts par boîte aux lettres. La valeur de la boîte aux lettres est marquée comme une colonne mailbox sur chaque ligne.

Interface

Les étapes de création d'un pipeline dépendent de l'interface.

Fréquence d’ingestion

La programmation du pipeline dépend de vos critères de latence et de coût.

Sujet

Pourquoi c'est important

Profil utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Mono-utilisateur : un utilisateur administrateur crée une connexion Unity Catalog et un pipeline d’ingestion.
  • Multi-utilisateur : un administrateur crée une connexion que les utilisateurs non administrateurs peuvent utiliser pour créer des pipelines.

Méthode d’authentification

Le connecteur s'authentifie avec un compte de service Google qui usurpe l'identité d'une seule boîte aux lettres.

Une seule boîte aux lettres par connexion

Chaque connexion ingère une boîte aux lettres. Pour ingérer plus d'une boîte aux lettres, créez une connexion et un pipeline distincts par boîte aux lettres. La valeur de la boîte aux lettres est marquée comme une colonne mailbox sur chaque ligne.

Interface

Les étapes de création d'un pipeline dépendent de l'interface.

Fréquence d’ingestion

La programmation du pipeline dépend de vos critères de latence et de coût.

Start ingesting from Gmail

Le tableau suivant donne un aperçu du flux d'ingestion Gmail de bout en bout, en fonction du type d'utilisateur :

Utilisateur

Étapes

Admin

  1. Configurez un compte de service Google Cloud pour activer l’authentification depuis Databricks. Voir Configure Gmail for Databricks ingestion.
  2. Soit :
    • Utilisez l’explorateur de catalogue pour créer une connexion à Gmail afin que les non-administrateurs puissent créer des pipelines. Voir Créer une connexion Gmail.
    • Utilisez l'interface utilisateur d'ingestion de données pour créer une connexion et un pipeline en même temps. Voir Ingérer des données depuis Gmail.

Non administrateur

Utilisez n'importe quelle interface prise en charge pour créer un pipeline à partir d'une connexion existante. Voir Ingérer des données depuis Gmail.

Utilisateur

Étapes

Admin

  1. Configurez un compte de service Google Cloud pour activer l’authentification depuis Databricks. Voir Configure Gmail for Databricks ingestion.
  2. Soit :
    • Utilisez l’explorateur de catalogue pour créer une connexion à Gmail afin que les non-administrateurs puissent créer des pipelines. Voir Créer une connexion Gmail.
    • Utilisez l'interface utilisateur d'ingestion de données pour créer une connexion et un pipeline en même temps. Voir Ingérer des données depuis Gmail.

Non administrateur

Utilisez n'importe quelle interface prise en charge pour créer un pipeline à partir d'une connexion existante. Voir Ingérer des données depuis Gmail.

Ressources supplémentaires