Aller au contenu principal

FAQ sur les connecteurs gérés

Trouvez des réponses aux questions fréquemment posées concernant les connecteurs gérés dans Databricks Lakeflow Connect. Pour les FAQ spécifiques aux connecteurs, consultez la documentation de votre connecteur.

Quels connecteurs gérés Databricks prend-il en charge ?

Lakeflow Connect propose des connecteurs gérés pour Salesforce, SQL Server, ServiceNow et Google Analytics. Pour être informé de la feuille de route ou obtenir un accès anticipé aux connecteurs de l'aperçu privé, contactez votre équipe de compte.

Quelles interfaces les connecteurs gérés prennent-ils en charge ?

Tous les connecteurs gérés prennent en charge la création de pipeline à l'aide des APIs Databricks et des Declarative Automation Bundles. Certains connecteurs prennent également en charge la création de pipeline dans l'interface utilisateur à partir des points d'entrée suivants :

  • La page **Ajouter des données** (**Ingestion des données**)
  • La page Jobs et pipelines ( Créer nouveau > Pipeline d'ingestion )
  • Le volet Tâches pour un nouveau job ( Ajouter une tâche > + Nouveau pipeline d'ingestion ou Type > Pipeline )

Pour les interfaces prises en charge, consultez la section Disponibilité des fonctionnalités sur la page de présentation de votre connecteur.

Comment les connecteurs gérés gèrent-ils l'évolution des schémas ?

Tous les connecteurs gérés gèrent automatiquement les colonnes nouvelles et supprimées, sauf si vous choisissez de ne pas le faire en spécifiant explicitement les colonnes que vous souhaitez ingérer.

  • Lorsqu'une nouvelle colonne apparaît dans la source, Databricks l'ingère automatiquement lors de la prochaine exécution de votre pipeline. Pour toute ligne dans la colonne qui est apparue avant la modification du schéma, Databricks laisse la valeur vide. Cependant, vous pouvez refuser l'ingestion automatisée de colonnes en listant les colonnes spécifiques à ingérer via l'API ou en désactivant toute colonne future dans l'interface utilisateur.
  • Quand une colonne est supprimée de la source, Databricks ne la supprime pas automatiquement. Au lieu de cela, le connecteur utilise une propriété de table pour définir la colonne supprimée comme « inactive » dans la destination. Si une autre colonne apparaît plus tard avec le même nom, le pipeline échoue. Dans ce cas, vous pouvez Trigger un refresh complet de la table ou supprimer manuellement la colonne inactive.

De même, les connecteurs peuvent gérer les tables nouvelles et supprimées. Si vous ingérez un schéma entier, Databricks ingère automatiquement les nouvelles tables, sauf si vous vous désabonnez. Et si une table est supprimée dans la source, le connecteur la définit comme inactive dans la destination. Si vous choisissez d'ingérer un schéma entier, examinez les limitations concernant le nombre de tables par pipeline pour votre connecteur.

Les modifications supplémentaires du schéma dépendent de la source. Par exemple, le connecteur Salesforce considère les renommages de colonnes comme des suppressions et des ajouts de colonnes et apporte automatiquement la modification, avec le comportement décrit ci-dessus. Cependant, le connecteur SQL Server nécessite une refresh complète des tables affectées pour continuer l'ingestion.

Pour plus d'information sur le comportement d'évolution des schémas, consultez la section **Disponibilité des fonctionnalités** sur la page de présentation de votre connecteur.

Puis-je personnaliser les connecteurs gérés ?

Vous pouvez choisir les objets ingérés, la destination, le planning, les autorisations, les notifications et plus encore. Vous ne pouvez pas personnaliser le processus d'ingestion lui-même, car ces connecteurs sont entièrement managés. Pour une personnalisation supplémentaire, vous pouvez utiliser Lakeflow Pipelines ou Structured Streaming.

Quelle est la différence entre les connecteurs gérés, Lakehouse Federation et OpenSharing?

Lakehouse Federation vous permet de query des sources de données externes sans déplacer vos données. OpenSharing vous permet de partager en toute sécurité des données en direct sur toutes les plateformes, clouds et régions.

Lorsque vous avez le choix entre des connecteurs gérés, Lakehouse Federation et OpenSharing, choisissez OpenSharing pour les scénarios suivants :

  • Limiter la duplication des données.
  • Interrogation des données les plus récentes possible.

Choisissez Lakehouse Federation pour les scénarios suivants :

  • Rapports ad hoc ou travaux de preuve de concept sur vos pipelines ETL.

Quelle est la différence entre les connecteurs gérés et Auto Loader ?

Les connecteurs gérés vous permettent d'ingérer les données de manière incrémentielle à partir d'applications SaaS comme Salesforce et de bases de données comme SQL Server. Auto Loader est un connecteur de stockage d'objets cloud qui vous permet d'ingérer les fichiers de manière incrémentielle à mesure qu'ils arrivent dans S3, ADLS et GCS. Il est compatible avec Structured Streaming et les LakeFlow pipelines, mais n'offre pas de pipelines d'ingestion entièrement managés.

Les connecteurs gérés peuvent-ils réécrire dans la source de données ?

Non. Si cette fonctionnalité vous intéresse, veuillez contacter votre équipe de compte.

Les connecteurs gérés sont-ils disponibles dans toutes les régions ?

Non. Voir disponibilité de l'ingestion.

Un pipeline peut-il écrire dans plusieurs schémas de destination ?

Cette fonctionnalité est prise en charge dans l'API Lakeflow Connect pour tous les connecteurs SaaS gérés, tels que Salesforce, Workday et ServiceNow.

Si vous choisissez d'utiliser cette fonctionnalité, votre pipeline ne sera accessible que par API. Vous ne pouvez pas le modifier dans l'interface utilisateur.

Puis-je modifier un pipeline créé à l'aide de Declarative Automation Bundles ou de la CLI dans l'interface utilisateur ?

Oui. Utilisez le mode YAML ou JSON pour modifier le pipeline. Pour changer de mode, utilisez les boutons en haut de l'éditeur de pipeline ( Assistant , YAML , JSON ).

L'éditeur de l' Assistant peut être indisponible si la configuration du pipeline contient des champs que l'assistant ne prend pas en charge. Cela peut se produire lorsqu'un pipeline est créé ou mis à jour à l'aide de Declarative Automation Bundles ou de la CLI Databricks. Pour les étapes de dépannage, consultez Résoudre les problèmes des pipelines d'ingestion gérés.

Puis-je changer le nom d'une table que j'ingère ?

Oui, vous pouvez définir un nom pour la table de destination dans l'interface utilisateur de Databricks ou en utilisant les APIs Databricks. Consultez Nommer une table de destination. Si vous ne définissez pas de nom, le nom de la table source est utilisé par default.

Que se passe-t-il si un pipeline est toujours en cours d’exécution (mise à jour N) lorsque la prochaine mise à jour est planifiée (mise à jour N+1) ?

Databricks ignore la mise à jour N+1 et reprend avec la mise à jour N+2, en supposant que la mise à jour N ait été terminée à temps.

Que deviennent les tables de destination lorsqu’un pipeline d’ingestion est supprimé ?

Les tables de destination sont supprimées lorsque le pipeline d'ingestion est supprimé.

Puis-je utiliser ALTER pour modifier les tables de streaming ou les vues matérialisées créées par des pipelines d'ingestion gérés ?

Oui, vous pouvez modifier les tables de streaming et les vues matérialisées créées par des pipelines d'ingestion gérés à l'aide des ALTER instructions SQL suivantes :

SQL
ALTER MATERIALIZED VIEW view_name | ALTER STREAMING TABLE table_name
{
ALTER COLUMN column_clause |
SET ROW FILTER clause |
DROP ROW FILTER |
SET TAGS clause |
UNSET TAGS clause
}

column_clause
{
column_identifier
COMMENT clause |
SET MASK clause |
DROP MASK |
SET TAGS clause |
UNSET TAGS clause
}

Pour la syntaxe complète et des exemples, veuillez consulter ALTER STREAMING TABLE et ALTER MATERIALIZED VIEW.

remarque

Vous ne pouvez pas modifier la planification ou le Trigger d'un pipeline d'ingestion géré à l'aide d'une instruction ALTER. Consultez Mettre à jour le calendrier du pipeline.

Comment la tarification des connecteurs gérés fonctionne-t-elle ?

Les connecteurs gérés ont un modèle de Tarifs basé sur le compute.

Les sources SaaS comme Salesforce et Workday, qui fonctionnent exclusivement sur une infrastructure serverless, entraînent des frais de DBU pour les pipelines LakeFlow serverless.

Pour les sources de base de données comme SQL Server, les passerelles d'ingestion peuvent s'exécuter en mode classique ou en mode serverless selon la source, et les pipelines d'ingestion s'exécutent sur serverless. En conséquence, vous pouvez recevoir des frais DBU pour les Lakeflow pipelines classiques et Serverless.

Pour les détails des tarifs, consultez la page des Tarifs des LakeFlow Pipelines.

Une passerelle d'ingestion peut-elle s'exécuter dans un workspace uniquement Serverless ?

Non. Les passerelles nécessitent un compute classique et ne peuvent pas être déployées dans un Workspace qui ne prend pas en charge le compute classique. Ceci s'applique uniquement aux connecteurs de base de données (CDC).

Puis-je activer le flux de données de modification de Delta Lake sur une table cible ?

Ceci est activé pour toutes les tables cibles.

Comment le filtrage des lignes gère-t-il les lignes ou les query qui changent après le chargement initial ?

Le comportement de filtrage des lignes varie selon qu'une ligne ou la query de filtre est mise à jour après le chargement initial. Pour un résumé des scénarios de cas limites, consultez Comportement de filtrage des lignes dans les cas limites.

FAQ spécifiques au connecteur

Pour les FAQ spécifiques au connecteur, veuillez consulter la documentation de votre connecteur :

Sur cette page