Aller au contenu principal

Limitations du connecteur Confluence

Cette page répertorie les limites et les considérations relatives à l'ingestion de données depuis Confluence à l'aide de Databricks LakeFlow Connect.

Limitations générales des connecteurs SaaS

Les limitations de cette section s'appliquent à tous les connecteurs SaaS de Lakeflow Connect.

  • Lorsque vous exécutez un pipeline planifié, les alertes ne se Trigger pas immédiatement. Au lieu de cela, ils Trigger lors de l’exécution de la prochaine mise à jour.
  • Lorsqu’une table source est supprimée, la table de destination n’est pas automatiquement supprimée. Vous devez supprimer la table de destination manuellement. Ce comportement n'est pas cohérent avec le comportement de Spark Declarative Pipelines sur Lakeflow.
  • Pendant les périodes de maintenance de la source, Databricks pourrait ne pas être en mesure d'accéder à vos données.
  • Si un nom de table source entre en conflit avec un nom de table de destination existant, la mise à jour du pipeline échoue.
  • La prise en charge des pipelines multi-destination est uniquement via l'API.
  • Vous pouvez éventuellement renommer une table que vous ingérez. Si vous renommez une table dans votre pipeline, il devient un pipeline API uniquement, et vous ne pouvez plus modifier le pipeline dans l'interface utilisateur.
  • Si vous sélectionnez une colonne après qu'un pipeline a déjà start, le connecteur ne renseigne pas automatiquement les données historiques pour la nouvelle colonne. Pour ingérer des données historiques, exécutez manuellement un refresh complet sur la table.
  • Databricks ne peut pas ingérer deux tables ou plus portant le même nom dans le même pipeline, même si elles proviennent de schémas sources différents.
  • Le système source suppose que les colonnes du curseur augmentent de façon monotone.
  • Le connecteur ingère des données brutes sans transformations. Utilisez les Spark Declarative Pipelines en aval sur les Lakeflow Pipelines pour les transformations.

Limitations spécifiques au connecteur

Les limites de cette section sont spécifiques au connecteur Confluence.

Données prises en charge

Le connecteur n'ingère que les tables suivantes de Confluence :

  • pages
  • spaces
  • labels
  • classification_levels
  • blogposts
  • attachments

Mode de déploiement

Le connecteur ne prend en charge que Confluence Cloud.

Ingestion ACL

Le connecteur ne prend pas actuellement en charge l'ingestion des ACL Confluence. De même, le connecteur ne déclenche pas de Trigger lorsque les ACL d'une source de données changent.

Ingestion de contenu

  • Les fichiers joints ne sont pas ingérés. Seules les métadonnées des pièces jointes (nom de fichier, taille, type de contenu, date d'upload) sont incluses dans les données ingérées.
  • Les commentaires de page ne sont pas ingérés. Seuls le contenu de la page et les métadonnées sont inclus.
  • Les espaces archivés ne sont pas ingérés. Seuls les espaces actifs sont inclus dans le pipeline d'ingestion.

Limites de débit de l'API

  • Le connecteur est soumis aux limites de débit de l'API Confluence. Si vous dépassez les limites de débit, le pipeline pourrait ralentir ou échouer temporairement. Le connecteur réessaye automatiquement avec un temps d’attente exponentiel.
  • Databricks recommande de planifier les exécutions de pipeline pendant les heures creuses afin de minimiser l'impact des limites de débit.

Authentification

Considérations sur les performances

  • Les exécutions initiales de pipeline (instantanés complets) peuvent prendre plus de temps pour les grandes instances Confluence avec de nombreuses pages.
  • La performance de l'ingestion incrémentielle dépend du nombre de pages modifiées depuis la dernière exécution.
  • Les pages volumineuses avec un contenu étendu ou de nombreuses pièces jointes pourraient prendre plus de temps à ingérer.

Les limitations suivantes concernent les modifications qui ne sont pas reflétées dans le curseur :

  • Pour les tables ingérées de manière incrémentale, le connecteur prend en charge les suppressions logiques (par exemple, les enregistrements qui sont déplacés vers la corbeille dans Confluence). Cependant, il ne prend pas en charge les suppressions définitives (par exemple, les enregistrements qui sont « purgés » dans Confluence). Pour refléter les suppressions définitives, vous devez exécuter un refresh complet du pipeline.

    Lorsqu’un espace est supprimé, toutes ses pages et pièces jointes sont définitivement supprimées. Par conséquent, ces suppressions ne sont pas répercutées dans les tables de destination. Cependant, lorsqu’une page parente est supprimée de manière logicielle, toutes ses pages enfants et pièces jointes sont supprimées dans les tables de destination.

  • Le contenu archivé pour les tables incrémentales n'est pas pris en charge.

  • Lorsqu'une page ou un billet de blog est déplacé d'un espace à un autre ou d'un parent à un autre, le spaceId correspondant n'est pas mis à jour.

  • Enregistrements restaurés : si vous restaurez une page ou un article de blog après l'avoir supprimé dans la source, le connecteur ne le réingère pas.