Aller au contenu principal

Limitations du connecteur Microsoft SharePoint

Cette page répertorie les limitations et les considérations relatives à l'ingestion à partir de Microsoft SharePoint à l'aide de Databricks Lakeflow Connect.

Limitations spécifiques au connecteur

  • L'ingestion non structurée (BINARYFILE) ne prend en charge que le mode de stockage SCD_TYPE_1. L'ingestion structurée (CSV, JSON, XML, EXCEL et d'autres formats) ne prend en charge que le mode de stockage APPEND_ONLY. Le type 2 de SCD n'est pas pris en charge. Lors de la configuration du mode de stockage, définissez storage_mode dans table_configuration. La configuration du champ scd_type génère une erreur.

  • Lors d'une ingestion non structurée à l'aide d'un fichier binaire, le contenu de chaque fichier est chargé en mémoire comme un enregistrement unique, de sorte que les fichiers de plus de 100 Mo peuvent entraîner l'échec de la mise à jour (par exemple, avec une erreur de mémoire insuffisante ou en dépassant la limite de 2 Go pour les colonnes binaires dans Delta). Pour éviter cela, excluez les fichiers volumineux à l'aide d'un row_filter sur la colonne length dans table_configuration. Par exemple, "row_filter": "length <= 104857600" ignore les fichiers de plus de 100 Mo.

  • Le connecteur ne prend pas en charge la sélection de fichiers individuels. Il ingère tous les fichiers d'un dossier, d'un lecteur, d'un sous-site ou d'un site configuré.

  • Le connecteur ne prend pas en charge l'ingestion des listes de contrôle d'accès (ACL) au niveau des fichiers à partir de SharePoint.

  • Le connecteur ne prend pas en charge l'ingestion de fichiers liés à une autre bibliothèque de documents SharePoint.

  • Les utilitaires fournis pour une utilisation en aval sont limités aux clusters mono-utilisateur. Cependant, les clusters mono-utilisateur ne peuvent pas accéder aux tables de streaming créées par d'autres utilisateurs. Chaque utilisateur en aval doit créer son propre pipeline d’ingestion. Vous pouvez modifier les utilitaires pour les faire fonctionner sur des clusters serverless et partagés, mais cela peut affecter les performances. Voir les exemples d'accès aux fichiers.

  • Certains champs (par exemple, quick_xor_hash, mime_type) ne sont pas pris en charge pour tous les formats de fichiers. Le download de fichiers et d'autres ingestions de métadonnées continuent de fonctionner dans ces cas.