Aller au contenu principal

Lakehouse Federation pour le partage de fichiers Salesforce Data 360

Cette page décrit comment lire les données dans Salesforce Data 360 (anciennement Data Cloud) à l’aide du connecteur de partage de fichiers.

Quel connecteur Salesforce devrais-je utiliser ?

Databricks propose plusieurs connecteurs pour Salesforce. Il existe deux connecteurs sans copie : le connecteur de partage de fichiers Salesforce Data 360 et le connecteur de fédération de query Salesforce Data 360. Ceux-ci vous permettent de query les données dans Salesforce Data 360 sans les déplacer. Il existe également un connecteur d'ingestion Salesforce qui copie les données à partir de divers produits Salesforce.

Le tableau suivant résume les différences entre les connecteurs Salesforce dans Databricks :

Connecteur

Cas d'usage

Produits Salesforce pris en charge

Partage de fichiers Salesforce Data 360

Lorsque vous utilisez le connecteur de partage de fichiers Salesforce Data 360 dans Lakehouse Federation, Databricks appelle directement les APIs Salesforce Data-as-a-Service (DaaS) pour lire les données dans l'emplacement de stockage d'objets cloud sous-jacent. Les requêtes sont exécutées sur le compute Databricks sans utiliser le protocole JDBC.

Comparé à la fédération de query, le partage de fichiers est idéal pour fédérer une grande quantité de données. Il offre des performances améliorées pour la lecture des fichiers à partir de plusieurs sources de données et de meilleures capacités de pushdown. Voir Lakehouse Federation pour le partage de fichiers Salesforce Data 360.

Salesforce Data 360

Fédération de query Salesforce Data 360

Lorsque vous utilisez le connecteur de fédération de query Salesforce Data 360 dans Lakehouse Federation, Databricks utilise JDBC pour se connecter aux données sources et transmet les queries à Salesforce. Voir Exécuter des queries fédérées sur Salesforce Data 360.

Salesforce Data 360

Ingestion Salesforce

Le connecteur d'ingestion Salesforce dans Lakeflow Connect vous permet de créer des pipelines d'ingestion entièrement managées à partir des données de la plateforme Salesforce. Ce connecteur maximise la valeur en exploitant non seulement les données CDP, mais aussi les données CRM dans la Data Intelligence Platform. Consultez Ingérer des données depuis Salesforce.

Consultez Quels produits Salesforce le connecteur d'ingestion Salesforce prend-il en charge ?

Connecteur

Cas d'usage

Produits Salesforce pris en charge

Partage de fichiers Salesforce Data 360

Lorsque vous utilisez le connecteur de partage de fichiers Salesforce Data 360 dans Lakehouse Federation, Databricks appelle directement les APIs Salesforce Data-as-a-Service (DaaS) pour lire les données dans l'emplacement de stockage d'objets cloud sous-jacent. Les requêtes sont exécutées sur le compute Databricks sans utiliser le protocole JDBC.

Comparé à la fédération de query, le partage de fichiers est idéal pour fédérer une grande quantité de données. Il offre des performances améliorées pour la lecture des fichiers à partir de plusieurs sources de données et de meilleures capacités de pushdown. Voir Lakehouse Federation pour le partage de fichiers Salesforce Data 360.

Salesforce Data 360

Fédération de query Salesforce Data 360

Lorsque vous utilisez le connecteur de fédération de query Salesforce Data 360 dans Lakehouse Federation, Databricks utilise JDBC pour se connecter aux données sources et transmet les queries à Salesforce. Voir Exécuter des queries fédérées sur Salesforce Data 360.

Salesforce Data 360

Ingestion Salesforce

Le connecteur d'ingestion Salesforce dans Lakeflow Connect vous permet de créer des pipelines d'ingestion entièrement managées à partir des données de la plateforme Salesforce. Ce connecteur maximise la valeur en exploitant non seulement les données CDP, mais aussi les données CRM dans la Data Intelligence Platform. Consultez Ingérer des données depuis Salesforce.

Consultez Quels produits Salesforce le connecteur d'ingestion Salesforce prend-il en charge ?

Avant de commencer

Exigences du Workspace :

  • Workspace activé pour Unity Catalog.

Compute requis :

  • Connectivité réseau de votre ressource de compute Databricks vers l'API Salesforce Data 360 et les compartiments S3 publics de Salesforce Data 360 où résident les données. Consultez les recommandations de mise en réseau pour Lakehouse Federation.
  • Les clusters Databricks doivent utiliser Databricks Runtime 16.3 ou supérieur et le mode d'accès standard.
  • Les SQL Warehouse doivent être Pro ou Serverless.

Autorisations requises :

  • Pour créer une connexion, vous devez disposer du privilège CREATE CONNECTION sur le métastore Unity Catalog rattaché au workspace.
  • Pour créer un catalogue externe, vous devez disposer de l'autorisation CREATE CATALOG sur le metastore et être le propriétaire de la connexion ou disposer du privilège CREATE FOREIGN CATALOG sur la connexion.

Des exigences d'autorisation supplémentaires sont spécifiées dans chaque section basée sur les tâches qui suit.

Créer une connexion et un catalogue étranger

Une connexion spécifie un chemin d'accès et des identifiants pour accéder à un système de base de données externe. Pour créer une connexion, vous pouvez utiliser Catalog Explorer ou la commande SQL CREATE CONNECTION dans un Notebook Databricks ou l'éditeur de query Databricks SQL.

remarque

Vous pouvez également utiliser l'API REST Databricks ou la CLI Databricks pour créer une connexion. Voir POST /api/2.1/unity-catalog/connections et les commandes Unity Catalog.

Autorisations requises : administrateur du Metastore ou utilisateur disposant du privilège CREATE CONNECTION.

  1. Dans votre workspace Databricks, cliquez sur Icône de données. Catalogue .

  2. En haut du volet **Catalogue**, cliquez sur Icône Ajouter ou plus l'icône **Ajouter** et sélectionnez **Créer une connexion** dans le menu.

  3. Sur la page **Principes de base de la connexion** de l’assistant **Configurer la connexion**, saisissez un **Nom de connexion** convivial.

  4. Sélectionnez un type de connexion de Partage de fichiers Salesforce Data 360 .

  5. Ajouter un commentaire (facultatif).

  6. Cliquez sur Créer une connexion .

  7. Sur la page Authentification , entrez les propriétés suivantes pour votre instance Salesforce Data 360 File Sharing :

    • Endpoint spécifique au tenant : Par exemple, https://mvsw0mbrmqzdcyj-m02t0mrsh1.pc-rnd.c360a.salesforce.com
    • ID de tenant principal : Par exemple, core/falcontest8-core4sdb26/00DVF000001E16v2AC
  8. Sur la page **Bases du catalogue**, veuillez saisir un nom pour le catalogue étranger. Un catalogue étranger reflète une base de données dans un système de données externe afin que vous puissiez query et gérer l'accès aux données de cette base de données à l'aide de Databricks et de Unity Catalog.

  9. (Facultatif) Cliquez sur **Tester la connexion** pour confirmer que cela fonctionne.

  10. Cliquez sur **Créer un catalogue**.

  11. Sur la page Accès , sélectionnez les workspaces dans lesquels les utilisateurs peuvent accéder au catalogue que vous avez créé. Vous pouvez sélectionner Tous les workspaces ont accès , ou cliquer sur Attribuer aux workspaces , sélectionner les workspaces, puis cliquer sur Attribuer .

  12. Modifiez le propriétaire qui pourra gérer l'accès à tous les objets du catalogue. start à taper un principal dans la zone de texte, puis cliquez sur le principal dans les résultats renvoyés.

  13. Accordez les **Privilèges** sur le catalogue. Cliquez sur Accorder :

    a. Spécifiez les principaux qui auront accès aux objets du catalogue. Start à saisir un principal dans la zone de texte, puis cliquez sur le principal dans les résultats renvoyés. a. Sélectionnez les préréglages de privilèges à accorder à chaque principal. Tous les utilisateurs du compte se voient accorder BROWSE par default.

    • Sélectionnez Data Reader dans le menu déroulant pour accorder read privilèges sur les objets du catalogue.
    • Sélectionnez **Data Editor** dans le menu déroulant pour accorder read les modify privilèges et sur les objets du catalogue.
    • Sélectionnez manuellement les privilèges à accorder.

    a. Cliquez sur Accorder .

  14. Cliquez sur Suivant .

  15. Sur la page Métadonnées , spécifiez les paires clé-valeur de balises. Pour plus d'informations, consultez Appliquer des balises aux objets sécurisables d'Unity Catalog.

  16. Ajouter un commentaire (facultatif).

  17. Cliquez sur Enregistrer .

  18. Prenez note de Account URL et de Connection URL. Vous aurez besoin de ces valeurs pour créer une cible de partage de données dans Salesforce.

Créez une cible de partage de données dans Salesforce

Créez une cible de partage de données dans Salesforce en utilisant Account URL et Connection URL que vous avez récupérés à l'étape précédente.

Consultez Créer une cible de partage de données (Databricks) dans la documentation Salesforce.

Mappages des types de données

Lorsque vous lisez des données de Salesforce Data 360 File Sharing vers Spark, les types de données correspondent comme suit :

Type de partage de fichiers Salesforce Data 360

Type Spark

Number

DecimalType(38, 18)

Boolean

BooleanType

Text

StringType

Date

DateType

Datetime

TimestampType

Email (Text)

StringType

Percent (Number)

DecimalType(38, 18)

Phone (Text)

StringType

URL (Text)

StringType

Type de partage de fichiers Salesforce Data 360

Type Spark

Number

DecimalType(38, 18)

Boolean

BooleanType

Text

StringType

Date

DateType

Datetime

TimestampType

Email (Text)

StringType

Percent (Number)

DecimalType(38, 18)

Phone (Text)

StringType

URL (Text)

StringType

Limitations

  • Le connecteur ne peut pas être utilisé avec des clusters mono-utilisateur.