Aller au contenu principal

Lire les données partagées avec des jetons porteurs

Cette page décrit comment lire les données partagées avec vous en utilisant le protocole OpenSharing de partage ouvert avec des jetons du porteur. Il comprend des instructions pour la lecture des données partagées à l'aide des outils suivants :

Dans ce modèle de partage, vous utilisez un fichier d’identifiants, partagé avec un membre de votre équipe par le fournisseur de données, pour obtenir un accès en lecture sécurisé aux données partagées. L’accès persiste tant que l’identifiant est valide et que le fournisseur continue de partager les données. Les fournisseurs gèrent l’expiration et la rotation des identifiants. Les mises à jour des données sont disponibles en quasi temps réel. Vous pouvez lire et copier les données partagées, mais vous ne pouvez pas modifier les données sources.

remarque

Si des données ont été partagées avec vous à l'aide de Databricks-to-Databricks OpenSharing, vous n'avez pas besoin d'un fichier d'identification pour accéder aux données, et cette page ne vous concerne pas. Consultez plutôt Lire les données partagées à l'aide de Databricks-to-Databricks OpenSharing (pour les destinataires).

Les sections suivantes décrivent comment utiliser Apache Spark, pandas, Power BI et les clients Iceberg pour accéder et lire les données partagées à l'aide du fichier d'informations d'identification. Pour une liste complète des connecteurs OpenSharing et des informations sur leur utilisation, consultez la documentation open source d'OpenSharing. Si vous rencontrez des difficultés pour accéder aux données partagées, contactez le fournisseur de données.

Avant de commencer

Un membre de votre équipe doit download le fichier d'identifiants partagé par le fournisseur de données et utiliser un canal de distribution sécurisé pour partager ce fichier ou son emplacement avec vous. Voir Accéder au modèle de partage Databricks-to-Open.

Pour la documentation spécifique au connecteur, consultez la page de download des identifiants.

Clients Iceberg : lecture des données partagées

Utilisez des clients Iceberg externes, tels que Snowflake, Trino, Flink et Spark, pour lire les assets de données partagés avec un accès zéro-copie à l'aide de l'API REST Catalog d'Apache Iceberg.

Obtention des identifiants de connexion

Avant d'accéder aux assets de données partagées avec des clients Iceberg externes, rassemblez les identifiants suivants :

  • L'endpoint Iceberg REST Catalog
  • Un Jeton Bearer valide
  • Le nom du partage
  • (Facultatif) Le nom d'espace de noms ou de schéma
  • (Facultatif) Le nom de la table

L'Endpoint du catalogue Iceberg REST (icebergEndpoint) et le jeton Bearer se trouvent dans le fichier d'identifiants partagé avec vous par votre fournisseur de données. Pour plus d'information, consultez Avant de commencer. Le nom de partage, l'espace de noms et le nom de table peuvent être découverts par programme à l'aide des API OpenSharing.

important

Le icebergEndpoint se trouve dans le fichier d'informations d'identification et a le format <workspace-url>/api/2.0/delta-sharing/metastores/<metastore-id>/iceberg.

Les exemples suivants montrent comment obtenir les informations d'identification supplémentaires. Entrez l'Endpoint, l'Endpoint Iceberg et le jeton Bearer du fichier d'informations d'identification si nécessaire :

Shell
// List shares
curl -X GET "<endpoint>/shares" \
-H "Authorization: Bearer <bearerToken>"

// List namespaces
curl -X GET "<icebergEndpoint>/v1/shares/<share>/namespaces" \
-H "Authorization: Bearer <bearerToken>"

// List tables
curl -X GET "<icebergEndpoint>/v1/shares/<share>/namespaces/<namespace>/tables" \
-H "Authorization: Bearer <bearerToken>"
remarque

Cette méthode récupère toujours la liste la plus récente des assets. Cependant, elle nécessite un accès Internet et peut être plus difficile à intégrer dans les environnements sans code.

Configurer le catalogue Iceberg

Après avoir obtenu les identifiants de connexion nécessaires, configurez votre client pour utiliser les endpoints Iceberg REST Catalog afin de créer et de query des tables.

  1. Pour chaque partage, créez une intégration de catalogue.

    SQL
    USE ROLE ACCOUNTADMIN;

    CREATE OR REPLACE CATALOG INTEGRATION <CATALOG_PLACEHOLDER>
    CATALOG_SOURCE = ICEBERG_REST
    TABLE_FORMAT = ICEBERG
    REST_CONFIG = (
    CATALOG_URI = '<icebergEndpoint>',
    WAREHOUSE = '<share_name>',
    ACCESS_DELEGATION_MODE = VENDED_CREDENTIALS
    )
    REST_AUTHENTICATION = (
    TYPE = BEARER,
    BEARER_TOKEN = '<bearerToken>'
    )
    ENABLED = TRUE;
  2. Vous pouvez éventuellement ajouter REFRESH_INTERVAL_SECONDS pour maintenir les métadonnées à jour. Définissez la valeur en fonction de la fréquence de mise à jour de votre catalogue.

    SQL
    REFRESH_INTERVAL_SECONDS = 30
  3. Une fois le catalogue configuré, créez une base de données à partir de ce catalogue. Ceci crée automatiquement tous les schémas et tables dans ce catalogue.

    SQL
    CREATE DATABASE <DATABASE_PLACEHOLDER>
    LINKED_CATALOG = (
    CATALOG = <CATALOG_PLACEHOLDER>
    );
  4. Pour confirmer que le partage est réussi, exécutez une query à partir d’une table dans la base de données. Vous devriez voir les données partagées de Databricks.

Si le résultat est vide ou si une erreur se produit, suivez ces étapes de dépannage courantes :

  • Vérifiez à nouveau les privilèges, l'état de génération des snapshots et les informations d'identification REST.
  • Contactez votre fournisseur de données.
  • Consultez la documentation spécifique à votre client Iceberg.

Exemple : Accéder aux tables partagées à l’aide de différents clients Iceberg

Les exemples suivants montrent comment accéder aux tables partagées à l'aide de clients Iceberg externes, tels que Snowflake, Apache Spark, PyIceberg et l'API REST, après avoir obtenu vos identifiants de connexion. Pour plus d'informations sur l'obtention des identifiants de connexion, consultez Avant de commencer.

Pour lire les assets de données partagés dans Snowflake, upload le fichier d'identifiants que vous avez download et générez la commande SQL nécessaire :

  1. Depuis votre Link d'activation OpenSharing, cliquez sur l'icône Snowflake.

  2. Sur la page d'intégration Snowflake, upload le fichier d'informations d'identification que vous avez reçu du fournisseur de données.

    Le fichier upload d&#39;informations d&#39;identification dans Snowflake

  3. Après avoir chargé l'identifiant, choisissez le partage auquel vous souhaitez accéder dans Snowflake.

  4. Cliquez sur Générer du SQL après avoir sélectionné les assets souhaités.

    Générer une commande SQL pour Snowflake

  5. Copiez et collez le SQL généré dans votre feuille de calcul Snowflake. Remplacez CATALOG_PLACEHOLDER par le nom du catalogue que vous souhaitez utiliser et DATABASE_PLACEHOLDER par le nom de la base de données que vous souhaitez utiliser.

Limitations

La connexion au catalogue REST Iceberg dans Snowflake présente les limitations suivantes :

  • Le fichier de métadonnées ne se met pas à jour automatiquement avec la dernière capture instantanée. Vous devez vous fier à l’auto-refresh ou aux refreshes manuelles.
  • R2 n'est pas pris en charge.
  • Toutes les limitations du client Iceberg s'appliquent.

Limitations du client Iceberg

Les limitations suivantes s'appliquent lors de l'interrogation des données OpenSharing à partir des clients Iceberg :

  • Lorsque vous listez des tables dans un espace de noms, si l'espace de noms contient plus de 100 vues partagées, la réponse est limitée aux 100 premières vues.

Apache Spark : Lire les données partagées

Suivez ces étapes pour accéder aux données partagées à l'aide de Spark 3.x ou version supérieure.

Ces instructions supposent que vous avez accès au fichier d’identifiants qui a été partagé par le fournisseur de données. Voir Accéder au modèle de partage Databricks-to-Open.

important

Assurez-vous que votre fichier d'informations d'identification est accessible par Apache Spark en utilisant un chemin absolu. Le chemin peut faire référence à un objet cloud ou à un volume Unity Catalog.

remarque

Si vous utilisez Spark sur un Workspace Databricks qui est activé pour Unity Catalog, et que vous avez utilisé l'interface utilisateur d'importation de fournisseur pour importer le fournisseur et le partage, les instructions de cette section ne s'appliquent pas à vous. Vous pouvez accéder aux tables partagées tout comme à n'importe quelle autre table enregistrée dans Unity Catalog. Vous n’avez pas besoin d’installer le connecteur Python delta-sharing ni de fournir le chemin d’accès au fichier d’informations d’identification. Voir Importer un fournisseur et lire les données partagées dans Databricks.

Installer les connecteurs OpenSharing Python et Spark

Pour accéder aux métadonnées relatives aux données partagées, telles que la liste des tables partagées avec vous, procédez comme suit. Cet exemple utilise Python.

  1. Installez le connecteur Python delta-sharing. Pour des informations concernant les limitations du connecteur Python, consultez les limitations du connecteur Python OpenSharing.

    Bash
    pip install delta-sharing
  2. Installez le connecteur Apache Spark.

Lister les tables partagées à l'aide de Spark

Répertoriez les tables du partage. Dans l'exemple suivant, remplacez <profile-path> par l'emplacement du fichier d'identifiants.

Python
import delta_sharing

client = delta_sharing.SharingClient(f"<profile-path>/config.share")

client.list_all_tables()

Le résultat est un tableau de tables, ainsi que les métadonnées pour chaque table. La sortie suivante montre deux tables :

Console
Out[10]: [Table(name='example_table', share='example_share_0', schema='default'), Table(name='other_example_table', share='example_share_0', schema='default')]

Si la sortie est vide ou ne contient pas les tables que vous attendez, contactez le fournisseur de données.

Accéder aux données partagées avec Spark

Exécutez ce qui suit, en remplaçant ces variables :

  • <profile-path>: l'emplacement du fichier d'identifiants.
  • <share-name>: la valeur de share= pour la table.
  • <schema-name>: la valeur de schema= pour la table.
  • <table-name>: la valeur de name= pour la table.
  • <version-as-of>: facultatif. La version de la table pour charger les données. Ne fonctionne que si le fournisseur de données partage l'historique de la table. Nécessite delta-sharing-spark 0.5.0 ou une version ultérieure.
  • <timestamp-as-of>: facultatif. Chargez les données à la version antérieure ou au Timestamp donné. Ne fonctionne que si le fournisseur de données partage l'historique de la table. Nécessite delta-sharing-spark 0,6,0 ou une version ultérieure.
Python
delta_sharing.load_as_spark(f"<profile-path>#<share-name>.<schema-name>.<table-name>", version=<version-as-of>)

spark.read.format("deltaSharing")\
.option("versionAsOf", <version-as-of>)\
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")\
.limit(10)

delta_sharing.load_as_spark(f"<profile-path>#<share-name>.<schema-name>.<table-name>", timestamp=<timestamp-as-of>)

spark.read.format("deltaSharing")\
.option("timestampAsOf", <timestamp-as-of>)\
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")\
.limit(10)

Accéder au Change Data Feed partagé à l'aide de Spark.

Si l'historique de la table vous a été partagé et que le flux de données de modification (CDF) est activé sur la table source, accédez au flux de données de modification en exécutant ce qui suit, en remplaçant ces variables. Nécessite delta-sharing-spark 0.5.0 ou une version ultérieure.

Un paramètre start doit être fourni.

  • <profile-path>: l'emplacement du fichier d'identifiants.
  • <share-name>: la valeur de share= pour la table.
  • <schema-name>: la valeur de schema= pour la table.
  • <table-name>: la valeur de name= pour la table.
  • <starting-version>: facultatif. La version de départ de la query, incluse. Spécifier en tant que Long.
  • <ending-version>: facultatif. La version finale de la query, inclusivement. Si la version finale n'est pas fournie, l'API utilise la dernière version de la table.
  • <starting-timestamp>: facultatif. Le Timestamp de début de la query, celui-ci est converti en une version créée supérieure ou égale à cet Timestamp. Spécifiez en tant que chaîne au format yyyy-mm-dd hh:mm:ss[.fffffffff].
  • <ending-timestamp>: facultatif. Le Timestamp de fin de la requête est converti en une version créée antérieurement ou égale à ce Timestamp. Spécifiez en tant que chaîne au format yyyy-mm-dd hh:mm:ss[.fffffffff]
Python
delta_sharing.load_table_changes_as_spark(f"<profile-path>#<share-name>.<schema-name>.<table-name>",
starting_version=<starting-version>,
ending_version=<ending-version>)

delta_sharing.load_table_changes_as_spark(f"<profile-path>#<share-name>.<schema-name>.<table-name>",
starting_timestamp=<starting-timestamp>,
ending_timestamp=<ending-timestamp>)

spark.read.format("deltaSharing").option("readChangeFeed", "true")\
.option("startingVersion", <starting-version>)\
.option("endingVersion", <ending-version>)\
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")

spark.read.format("deltaSharing").option("readChangeFeed", "true")\
.option("startingTimestamp", <starting-timestamp>)\
.option("endingTimestamp", <ending-timestamp>)\
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")

Si la sortie est vide ou ne contient pas les données que vous attendez, contactez le fournisseur de données.

Accéder à une table partagée à l'aide de Spark Structured Streaming

Si l'historique de la table est partagé avec vous, vous pouvez lire les données partagées en Stream. Nécessite delta-sharing-spark 0.6.0 ou une version ultérieure.

Options prises en charge :

  • ignoreDeletes: Ignorer les transactions qui suppriment des données.
  • ignoreChanges: Retraiter les mises à jour si les fichiers ont été réécrits dans la table source à la suite d'une opération de modification des données telle que UPDATE, MERGE INTO, DELETE (dans les partitions) ou OVERWRITE. Les lignes inchangées peuvent toujours être émises. Par conséquent, vos consommateurs en aval devraient être en mesure de gérer les doublons. Les suppressions ne sont pas propagées en aval. ignoreChanges inclut ignoreDeletes. Par conséquent, si vous utilisez ignoreChanges, votre Stream n'est pas interrompu par les suppressions ou les mises à jour de la table source.
  • startingVersion: la version de la table partagée à partir de laquelle start. Tous les changements de table à partir de cette version (inclusivement) sont lus par la source de streaming.
  • startingTimestamp: The Timestamp to start from. Toutes les modifications de la table validées à ou après le Timestamp (inclus) sont lues par la source de streaming. Exemple : "2023-01-01 00:00:00.0".
  • maxFilesPerTrigger: Le nombre de nouveaux fichiers à prendre en compte dans chaque micro-batch.
  • maxBytesPerTrigger: La quantité de données traitées dans chaque micro-batch. Cette option définit un « soft max », ce qui signifie qu'un batch traite environ cette quantité de données et peut traiter plus que la limite afin de faire avancer la requête de streaming dans les cas où la plus petite unité d'entrée est supérieure à cette limite.
  • readChangeFeed: Stream lit le flux de données de modification de la table partagée.

Trigger pris en charge :

  • Trigger.ProcessingTime: Le Trigger par default, utilisé lorsqu'aucun Trigger explicite n'est spécifié. Les données sont traitées par micro-batches continus.
  • Trigger.AvailableNow: La query capture la version côté serveur de la table partagée au start, traite l'arriéré sous forme de plusieurs micro-batchs qui respectent maxFilesPerTrigger et maxVersionsPerRpc, et se termine lorsque la version capturée est épuisée. Nécessite delta-sharing-spark 1,4,0 ou une version supérieure. Les versions antérieures se replient sur un wrapper Trigger.AvailableNow qui ne respecte pas maxVersionsPerRpc.
  • Trigger.Once: Obsolète ; utilisez Trigger.AvailableNow à la place. Avec les versions delta-sharing-spark inférieures à 1.4.0, Trigger.AvailableNow se rabat sur un wrapper qui ne respecte pas maxVersionsPerRpc.

Exemples de requêtes de Structured Streaming

Python
spark.readStream.format("deltaSharing")\
.option("startingVersion", 0)\
.option("ignoreDeletes", true)\
.option("maxBytesPerTrigger", 10000)\
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")

Voir aussi les concepts de Structured Streaming.

Lisez les tables avec les vecteurs de suppression ou le mappage de colonnes activé

info

Aperçu

Cette fonctionnalité est en aperçu public.

Les vecteurs de suppression sont une fonctionnalité d'optimisation du stockage que votre fournisseur peut activer sur les tables Delta partagées. Découvrir les vecteurs de suppression dans Databricks.

Databricks prend également en charge le mappage de colonnes pour les tables Delta. Consultez Renommer et supprimer des colonnes avec le mappage de colonnes Delta Lake.

Si votre fournisseur a partagé une table avec des vecteurs de suppression ou un mappage de colonnes activé, vous pouvez lire la table en utilisant un compute fonctionnant sous delta-sharing-spark 3.1 ou version ultérieure. Si vous utilisez des clusters Databricks, vous pouvez effectuer des lectures par batch en utilisant un cluster fonctionnant sous Databricks Runtime 14.1 ou version ultérieure. Les queries CDF et de streaming nécessitent Databricks Runtime 14.2 ou une version ultérieure.

Vous pouvez effectuer des queries par batch telles quelles, car elles peuvent résoudre automatiquement responseFormat en fonction des caractéristiques de la table partagée.

Pour lire un flux de données de modification (CDF) ou pour effectuer des queries en streaming sur des tables partagées avec des vecteurs de suppression ou un mappage de colonnes activé, vous devez définir l'option supplémentaire responseFormat=delta.

Les exemples suivants montrent les query batch, CDF et streaming :

Scala
import org.apache.spark.sql.SparkSession

val spark = SparkSession
.builder()
.appName("...")
.master("...")
.config("spark.sql.extensions", "io.delta.sql.DeltaSparkSessionExtension")
.config("spark.sql.catalog.spark_catalog", "org.apache.spark.sql.delta.catalog.DeltaCatalog")
.getOrCreate()

val tablePath = "<profile-file-path>#<share-name>.<schema-name>.<table-name>"

// Batch query
spark.read.format("deltaSharing").load(tablePath)

// CDF query
spark.read.format("deltaSharing")
.option("readChangeFeed", "true")
.option("responseFormat", "delta")
.option("startingVersion", 1)
.load(tablePath)

// Streaming query
spark.readStream.format("deltaSharing").option("responseFormat", "delta").load(tablePath)

Lisez les colonnes de suivi des lignes dans les tables partagées

Si le fournisseur de données a activé le suivi des lignes sur une table partagée, vous pouvez query les colonnes de métadonnées de suivi des lignes à l’aide de Scala Spark. Consultez le suivi des lignes dans Databricks pour obtenir la liste des colonnes disponibles.

Vous devez définir l'option responseFormat sur delta.

Scala
spark.read.format("deltaSharing")
.option("responseFormat", "delta")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
.select("_metadata.row_id")
.show()
remarque

Seul le format de réponse Delta est pris en charge pour les queries de colonnes de suivi de ligne dans le client Spark. Les connecteurs de dump ne sont pas pris en charge.

Pandas : Lire les données partagées

Suivez ces étapes pour accéder aux données partagées dans pandas 0.25.3 ou version ultérieure.

Ces instructions supposent que vous avez accès au fichier d’identifiants qui a été partagé par le fournisseur de données. Voir Accéder au modèle de partage Databricks-to-Open.

remarque

Si vous utilisez pandas sur un Workspace Databricks activé pour Unity Catalog, et que vous avez utilisé l’interface utilisateur d’importation de fournisseur pour importer le fournisseur et le partage, les instructions de cette section ne s’appliquent pas à vous. Vous pouvez accéder aux tables partagées tout comme à n'importe quelle autre table enregistrée dans Unity Catalog. Vous n’avez pas besoin d’installer le connecteur Python delta-sharing ni de fournir le chemin d’accès au fichier d’identifiants. Consultez Importer un fournisseur et lire les données partagées dans Databricks.

Installer le connecteur OpenSharing Python

Pour accéder aux métadonnées relatives aux données partagées, telles que la liste des tables partagées avec vous, vous devez installer le connecteur Python delta-sharing. Pour des informations concernant les limitations du connecteur Python, consultez les limitations du connecteur Python OpenSharing.

Bash
pip install delta-sharing

Lister les tables partagées en utilisant pandas

Pour répertorier les tables dans le partage, exécutez la commande suivante, en remplaçant <profile-path>/config.share par l'emplacement du fichier d'identifiants.

Python
import delta_sharing

client = delta_sharing.SharingClient(f"<profile-path>/config.share")

client.list_all_tables()

Si la sortie est vide ou ne contient pas les tables que vous attendez, contactez le fournisseur de données.

Accéder aux données partagées à l'aide de pandas

Pour accéder aux données partagées dans pandas à l'aide de Python, exécutez ce qui suit en remplaçant les variables comme suit :

  • <profile-path>: l'emplacement du fichier d'identifiants.
  • <share-name>: la valeur de share= pour la table.
  • <schema-name>: la valeur de schema= pour la table.
  • <table-name>: la valeur de name= pour la table.
Python
import delta_sharing
delta_sharing.load_as_pandas(f"<profile-path>#<share-name>.<schema-name>.<table-name>")

Accéder à un flux de données de modification partagé à l'aide de pandas

Pour accéder au flux de données modifié pour une table partagée dans pandas à l'aide de Python, exécutez la commande suivante en remplaçant les variables comme suit. Un flux de données de modification peut ne pas être disponible, selon que le fournisseur de données a partagé ou non le flux de données de modification pour la table.

  • <starting-version>: facultatif. La version de départ de la query, incluse.
  • <ending-version>: facultatif. La version finale de la query, incluse.
  • <starting-timestamp>: facultatif. Le timestamp de début de la query. Ceci est converti en une version créée supérieure ou égale à ce timestamp.
  • <ending-timestamp>: facultatif. Le Timestamp de fin de la query. Ceci est converti en une version créée avant ou à la même heure que ce Timestamp.
Python
import delta_sharing
delta_sharing.load_table_changes_as_pandas(
f"<profile-path>#<share-name>.<schema-name>.<table-name>",
starting_version=<starting-version>,
ending_version=<ending-version>)

delta_sharing.load_table_changes_as_pandas(
f"<profile-path>#<share-name>.<schema-name>.<table-name>",
starting_timestamp=<starting-timestamp>,
ending_timestamp=<ending-timestamp>)

Si la sortie est vide ou ne contient pas les données que vous attendez, contactez le fournisseur de données.

Power BI : Lire les données partagées

Le connecteur Power BI OpenSharing vous permet de découvrir, d’analyser et de visualiser les datasets partagés avec vous via le protocole ouvert OpenSharing.

Exigences

Se connecter à Databricks

Pour vous connecter à Databricks à l'aide du connecteur OpenSharing, procédez comme suit :

  1. Ouvrez le fichier d'identifiants partagé avec un éditeur de texte pour récupérer l'URL de l'endpoint et le jeton.
  2. Ouvrir Power BI Desktop.
  3. Dans le menu **Obtenir les données**, recherchez **OpenSharing**.
  4. Sélectionnez le connecteur et cliquez sur Connecter .
  5. Saisissez l'URL de l'endpoint que vous avez copiée du fichier d'informations d'identification dans le champ **URL du serveur OpenSharing**.
  6. Facultativement, dans l'onglet **Options avancées**, définissez une **Limite de lignes** pour le nombre maximal de lignes que vous pouvez download. Ceci est défini sur 1 million de lignes par default.
  7. Cliquez sur **OK**.
  8. Pour l' Authentification , copiez le jeton que vous avez récupéré du fichier d'identifiants dans Jeton d'accès .
  9. Cliquez sur Connecter .

Limitations du connecteur Power BI OpenSharing

Le connecteur Power BI OpenSharing présente les limitations suivantes :

  • Les données que le connecteur charge doivent tenir dans la mémoire de votre machine. Pour gérer cette exigence, le connecteur limite le nombre de lignes importées à la Limite de lignes que vous définissez sous la tab Options avancées dans Power BI Desktop.

Tableau : Lecture des données partagées

Le connecteur Tableau OpenSharing vous permet de découvrir, d'analyser et de visualiser les datasets qui vous sont partagés via le protocole ouvert OpenSharing.

Exigences

Se connecter à Databricks

Pour vous connecter à Databricks à l'aide du connecteur OpenSharing, procédez comme suit :

  1. Allez à Tableau Exchange, suivez les instructions pour download le connecteur OpenSharing, et placez-le dans un dossier de bureau approprié.
  2. Ouvrir Tableau Desktop.
  3. Sur la page Connecteurs , recherchez « OpenSharing by Databricks ».
  4. Sélectionnez Upload Share file et choisissez le fichier d'identification qui a été partagé par le fournisseur.
  5. Cliquer sur Obtenir des données .
  6. Dans le Data Explorer, sélectionnez la table.
  7. Vous pouvez ajouter des filtres SQL ou des limites de lignes.
  8. Cliquez sur Obtenir les données de la table .

Limitations

Le connecteur Tableau OpenSharing présente les limitations suivantes :

  • Les données que le connecteur charge doivent tenir dans la mémoire de votre machine. Pour gérer cette exigence, le connecteur limite le nombre de lignes importées à la limite de lignes que vous définissez dans Tableau.
  • Toutes les colonnes sont renvoyées comme type String.
  • Le filtre SQL ne fonctionne que si votre serveur OpenSharing prend en charge predicateHint.
  • Les vecteurs de suppression ne sont pas pris en charge.
  • Le mappage de colonnes n'est pas pris en charge.

Limitations du connecteur Python OpenSharing

Ces limitations sont spécifiques au connecteur Python OpenSharing :

  • Le connecteur OpenSharing Python 1.1.0+ prend en charge les requêtes instantanées sur les tables avec mappage de colonnes, mais les requêtes CDF sur les tables avec mappage de colonnes ne sont pas prises en charge.
  • Le connecteur OpenSharing Python échoue les queries CDF avec use_delta_format=True si le schéma a changé pendant la plage de versions interrogée.

Limitations des tables de streaming

Vous pouvez seulement lire l'instantané actuel d'une table de streaming partagée. Les fonctionnalités suivantes ne sont pas prises en charge pour les tables de streaming dans le partage Databricks-vers-Open :

  • Interroger les données d'historique de la table
  • Interrogation du flux de données de modification (CDF) de la table
  • Utilisation de la table comme source pour Spark Structured Streaming

Limites des vues matérialisées

Vous pouvez seulement lire l'instantané actuel d'une vue matérialisée partagée. L'utilisation d'une vue matérialisée comme source pour le Spark Structured Streaming n'est pas prise en charge dans le partage Databricks-à-Open.

Demander un nouvel identifiant

Si votre URL d'activation d'identifiant ou votre identifiant téléchargé est perdu, corrompu ou compromis, ou si votre identifiant expire sans que votre fournisseur ne vous en envoie un nouveau, contactez votre fournisseur pour demander un nouvel identifiant.

Si vous êtes un destinataire Databricks qui a importé les informations d'identification en tant qu'objet fournisseur dans Unity Catalog, appliquez les nouvelles informations d'identification en utilisant l'API REST de Databricks. Voir changer les identifiants pour les destinataires ouverts.