FAQ du connecteur Confluence
Cette page répond aux questions fréquemment posées concernant le connecteur Confluence dans Databricks Lakeflow Connect.
FAQ générales sur les connecteurs gérés
Consultez la FAQ sur les connecteurs gérés pour obtenir les questions fréquemment posées qui s'appliquent à tous les connecteurs gérés Lakeflow Connect. Les éléments suivants sont spécifiques à Confluence.
FAQ spécifiques au connecteur
Les réponses de cette section sont spécifiques au connecteur Confluence.
Comment le connecteur récupère-t-il les données de Confluence ?
Le connecteur Confluence utilise l'API REST de Confluence pour récupérer le contenu des pages, les métadonnées et les pièces jointes de vos espaces Confluence.
Puis-je ingérer des pages spécifiques ou des espaces entiers ?
Non.
Comment le connecteur gère-t-il la hiérarchie des pages ?
Le connecteur maintient la structure hiérarchique des pages dans un espace. Les relations parent-enfant entre les pages sont préservées dans les données ingérées.
Le connecteur prend-il en charge l'ingestion incrémentielle ?
Le connecteur prend actuellement en charge les tables suivantes.
- Il ingère les pages, les articles de blog et les pièces jointes de manière incrémentielle.
- Cependant, il ingère les espaces, les étiquettes et les niveaux de classification à l’aide d’instantanés. Cela signifie qu’il écrase les données à chaque exécution de pipeline.
Pour plus d'informations sur les schémas résultants, consultez les schémas.
Comment les pièces jointes Confluence sont-elles gérées ?
Les métadonnées de la pièce jointe (nom du fichier, taille, type de contenu, date d'upload) sont ingérées. Les fichiers de pièce jointe réels ne sont pas ingérés par default. Si vous devez ingérer le contenu des pièces jointes, contactez l'assistance Databricks.
Que se passe-t-il si une page est supprimée dans Confluence ?
Lorsque vous utilisez le SCD de type 2, les pages supprimées sont suivies et marquées d'un Timestamp de suppression dans la table de destination. Avec le SCD de type 1, la page est supprimée de la table de destination.
Puis-je ingérer des espaces archivés ?
Le connecteur n'ingère que les espaces actifs. Les espaces archivés ne sont pas inclus dans le pipeline d'ingestion.
Quelles autorisations le connecteur requiert-il ?
Le compte utilisateur Confluence doit avoir un accès en lecture aux espaces et aux pages que vous souhaitez ingérer. Databricks recommande d'utiliser un compte de service dédié avec les autorisations appropriées. Pour plus d'informations, consultez Configurer OAuth U2M pour l'ingestion Confluence.
Comment le connecteur gère-t-il le formatage des pages ?
Le contenu de la page est ingéré au format de stockage Confluence, qui est un format basé sur XHTML. Vous pouvez analyser ce contenu dans le traitement en aval pour extraire du texte brut ou le convertir à d'autres formats. Consultez Format de stockage Confluence dans la documentation Confluence.
Les commentaires de page sont-ils ingérés ?
Le connecteur n'ingère pas les commentaires de page.
Puis-je filtrer les pages par étiquette ou par tag ?
Non, le connecteur ingère toutes les pages.