Options d'écriture Serverless pour les connecteurs groupés
Lors de l'écriture vers une source de données externe à l'aide d'un connecteur groupé sur compute serverless, seule une partie des options de connecteur sont prises en charge. Les tableaux suivants répertorient les options prises en charge par connecteur.
Pour les instructions de configuration et les exemples, consultez sources de données Spark.
PostgreSQL
Les options suivantes sont prises en charge lors de l'écriture vers PostgreSQL sur le compute serverless.
Option | Description |
|---|---|
| Hostname du serveur PostgreSQL. |
| Numéro de port. Default : |
| Nom de la base de données à laquelle se connecter. |
| Durée maximale en secondes pour l'attente d'une connexion. |
| Nom d'utilisateur de la base de données. |
| Mot de passe de la base de données. |
| Nom de la table cible. Prend en charge les noms qualifiés par schéma (par exemple, |
| Nombre de lignes à insérer par batch. Default : |
| Nombre de partitions Spark pour les opérations d'écriture parallèles. |
| Temps maximal en secondes à attendre pour qu'une query se termine. |
| Niveau d'isolation des transactions : |
| Si |
| Si |
SQL Server
Les options suivantes sont prises en charge lors de l'écriture vers SQL Server sur compute serverless.
Option | Description |
|---|---|
| Hostname de l'instance SQL Server. |
| Numéro de port. Default : |
| Nom de la base de données à laquelle se connecter. |
| Durée maximale en secondes pour l'attente d'une connexion. |
| Si |
| Si |
| Si |
| Nom d'utilisateur de la base de données. |
| Mot de passe de la base de données. |
| Type d'authentification. Valeurs prises en charge : |
| Nom de la table cible. Prend en charge les noms qualifiés par schéma (par exemple, |
| Nombre de lignes à insérer par batch. Default : |
| Nombre de partitions Spark pour les opérations d'écriture parallèles. |
| Temps maximal en secondes à attendre pour qu'une query se termine. |
| Niveau d'isolation des transactions : |
| Si |
MySQL
Les options suivantes sont prises en charge lors de l'écriture sur MySQL sur compute serverless.
Option | Description |
|---|---|
| Hostname du serveur MySQL. |
| Numéro de port. Default : |
| Nom de la base de données à laquelle se connecter. |
| Durée maximale en secondes pour l'attente d'une connexion. |
| Si |
| Si |
| Nom d'utilisateur de la base de données. |
| Mot de passe de la base de données. |
| Nom de la table cible. Prend en charge les noms qualifiés par schéma (par exemple, |
| Nombre de lignes à insérer par batch. Default : |
| Nombre de partitions Spark pour les opérations d'écriture parallèles. |
| Temps maximal en secondes à attendre pour qu'une query se termine. |
| Niveau d'isolation des transactions : |
| Si |
| Si |
Snowflake
Les sections suivantes énumèrent les options prises en charge pour le connecteur Snowflake, organisées par fonction.
Connexion
Les options suivantes configurent la connexion à Snowflake et contrôlent le comportement de la session.
Option | Description |
|---|---|
| Hostname du compte Snowflake (par exemple, |
| Numéro de port. Default : |
| Identifiant de compte Snowflake. |
| Méthode d'authentification : |
| Délai d’expiration en secondes pour les opérations réseau. |
| Fuseau horaire pour les opérations de timestamp (par exemple, |
| Si |
| Si |
Authentification
Les options suivantes fournissent des identifiants pour la méthode d'authentification configurée dans sfauthenticator. Les identifiants de staging (temporary_aws_*, awsaccesskey, temporary_azure_sas_token) sont requis lorsque les étapes de Snowflake écrivent des données via le stockage cloud.
Option | Description |
|---|---|
| Nom d'utilisateur Snowflake. |
| Mot de passe Snowflake. Utilisé lorsque |
| Jeton d'accès OAuth. Utilisé lorsque |
| Clé privée au format PEM pour l'authentification par paire de clés. Utilisé lorsque |
| ID de clé d'accès AWS temporaire pour la préparation S3. Préféré à |
| Clé d'accès secrète AWS temporaire pour la mise en zone de transit S3. |
| Jeton de session AWS temporaire pour la mise en scène S3. |
| Jeton SAS Azure temporaire pour la préparation de Azure Blob Storage. |
| Clé d'accès AWS pour le staging S3. |
| Clé secrète AWS pour la préparation S3. |
Cible
Les options suivantes spécifient la base de données Snowflake, le schéma, le warehouse et la table dans laquelle écrire.
Option | Description |
|---|---|
| Nom de la base de données Snowflake. |
| Nom du schéma Snowflake. |
| Snowflake virtual warehouse utilisé pour l'exécution des query. |
| Rôle Snowflake pour la session. |
| Nom de la table cible. |
Comportement d'écriture
Les options suivantes contrôlent la manière dont les données sont écrites dans la table Snowflake cible.
Option | Description |
|---|---|
| Comment les colonnes DataFrame sont mises en correspondance avec les colonnes de table Snowflake : |
| Comportement lorsque les colonnes de DataFrame et de table ne s'alignent pas : |
| Si |
| Si |
| Si |
| Si |
Redshift
Les sections suivantes répertorient les options prises en charge pour le connecteur Redshift, organisées par fonction.
Connexion
Les options suivantes configurent la connexion au cluster Redshift.
Option | Description |
|---|---|
| Redshift cluster Endpoint Hostname. |
| Numéro de port. Default : |
| Nom de la base de données Redshift. |
| Délai maximal en secondes pour attendre une connexion. |
Authentification
Les options suivantes configurent les identifiants pour Redshift et pour l'emplacement de staging S3 que Redshift utilise pendant les opérations d'écriture.
Option | Description |
|---|---|
| Nom d'utilisateur Redshift. |
| Mot de passe Redshift. |
| ARN du rôle IAM que Redshift utilise pour accéder à S3 pour les données de staging. |
| ID de clé d'accès AWS temporaire pour la préparation S3. Préféré aux identifiants de longue durée. |
| Clé d'accès secrète AWS temporaire pour la mise en zone de transit S3. |
| Jeton de session AWS temporaire pour la mise en scène S3. |
| Si |
Comportement d'écriture
Les options suivantes contrôlent la manière dont les données sont écrites dans la table Redshift cible, y compris la distribution, les clés de tri et le format de staging.
Option | Description |
|---|---|
| Nom de la table cible. Prend en charge les noms qualifiés par schéma (par exemple, |
| Nombre de lignes par insertion de batch. Default : |
| Nombre de partitions Spark pour les opérations d'écriture parallèles. |
| Temps maximum en secondes pour attendre qu'une query se termine. |
| Niveau d'isolation des transactions : |
| Style de distribution Redshift : |
| Colonne à utiliser comme clé de distribution. Obligatoire lorsque |
| Spécification de la clé de tri pour la table Redshift (par exemple, |
| Chaîne écrite dans des fichiers CSV de staging pour représenter les valeurs |
| Format de fichier de staging : |
| Si |
Écrire sur PostgreSQL avec le compute serverless
Cet exemple utilise le mode append et récupère les identifiants d'un Secret Scope Databricks.
df.write \
.format("postgresql") \
.option("host", dbutils.secrets.get(scope="<scope>", key="<host>")) \
.option("port", "<port>") \
.option("database", "<database-name>") \
.option("dbtable", "<table-name>") \
.option("user", dbutils.secrets.get(scope="<scope>", key="<user>")) \
.option("password", dbutils.secrets.get(scope="<scope>", key="<password>")) \
.mode("append") \
.save()
Étapes suivantes
- Sources de données Spark: Instructions de configuration, exemples de code et comparaison des stratégies d'intégration Spark.
- Connexion JDBC: utilisez une connexion Unity Catalog avec un Driver JDBC pour les options non prises en charge par les connecteurs groupés sur Serverless, ou pour les sources de données sans connecteur groupé.
- Référence des options de l'API Spark: référence pour DataFrameReader, DataFrameWriter et les options de streaming pour les formats de fichier et les sources de streaming.