Référence du connecteur Microsoft SharePoint
Cette page contient des documents de référence pour le connecteur Microsoft SharePoint dans Databricks Lakeflow Connect.
sharepoint_options paramètres
Définissez ces options à l'intérieur du bloc connector_options.sharepoint_options de chaque table dans votre définition de pipeline.
parameter | Type | Obligatoire | Description |
|---|---|---|---|
| Chaîne | Oui | Le type d’entité à ingérer. Valeurs prises en charge : |
| Chaîne | Oui | L'URL du site SharePoint, du sous-site, du lecteur ou du dossier à ingérer. Exemples :
Reportez-vous à Lecture de fichiers depuis SharePoint pour plus de détails sur le format d’URL. |
| Objet | Oui | Contrôle le format des fichiers et le comportement d’ingestion. Voir les |
file_ingestion_options paramètres
Définissez ces options à l'intérieur de sharepoint_options.file_ingestion_options.
parameter | Type | Obligatoire | Description |
|---|---|---|---|
| Chaîne | Oui | Le format de fichier à ingérer. Valeurs prises en charge : |
| Tableau d’objets | Non | Filtres qui limitent les fichiers ingérés. Chaque objet de filtre peut contenir l'une des clés suivantes :
|
| Chaîne | Non | Contrôle la façon dont les nouvelles colonnes dans les fichiers entrants sont gérées. Les modes correspondent aux modes d'évolution des schémas d'Auto Loader. Valeurs prises en charge : |
| Chaîne | Non | Remplace les types de colonnes inférés. Spécifiez sous forme de liste de paires |
| Objet | Non | Options d'analyse spécifiques au format. Les clés sont des noms d'option de format standard Auto Loader. Voir les options de format. |
table_configuration paramètres
Définissez ces options dans le bloc table_configuration de chaque table de votre définition de pipeline. table_configuration est un frère de connector_options, et non imbriqué à l'intérieur.
parameter | Type | Obligatoire | Description |
|---|---|---|---|
| Chaîne | Non | Le mode de stockage pour la table de destination. Valeurs prises en charge :
Puisqu'il s'agit des valeurs default et des seules valeurs prises en charge, la définition explicite de |
Options de format
Le bloc format_options accepte les clés d'option de format standard d'Auto Loader, organisées ci-dessous par format de fichier. Pour plus de détails sur toute option, consultez Auto Loader.
JSON
Clé | Description |
|---|---|
| Permet aux barres obliques inverses d'échapper à n'importe quel caractère. |
| Permet les commentaires de style Java et C++ dans le contenu JSON. |
| Autorise |
| Permet les zéros non significatifs dans les valeurs entières. |
| Autorise les guillemets simples comme délimiteurs de chaîne en plus des guillemets doubles. |
| Autorise les caractères de contrôle non cités dans les chaînes JSON. |
| Autorise les noms de champ non cités. |
| Chemin d’accès pour stocker les enregistrements corrompus ou non analysables au lieu de faire échouer le pipeline. |
| Encodage des caractères du fichier (par exemple, |
| Modèle pour l'analyse des chaînes de date (par exemple, |
| Ignore les colonnes où toutes les valeurs sont nulles ou vides lors de l'inférence de schéma. |
| Déduit |
| Caractère ou chaîne de séparateur de ligne. |
| Paramètres régionaux pour l'analyse des dates et des nombres (par exemple, |
| Comportement pour les enregistrements mal formés : |
| Analyse les enregistrements qui s'étendent sur plusieurs lignes. |
| Déduit |
| Déduit toutes les valeurs primitives comme |
| Permet la correspondance des noms de colonne sensible à la casse par rapport au schéma. |
| Modèle pour l'analyse des chaînes de Timestamp (par exemple, |
| Fuseau horaire pour l'analyse des Timestamp (par exemple, |
CSV
Prend en charge toutes les options JSON ci-dessus, plus les options spécifiques aux fichiers CSV suivantes :
Clé | Description |
|---|---|
| Caractère d'échappement utilisé avant un caractère de guillemet à l'intérieur d'un champ entre guillemets. |
| Caractère qui marque une ligne comme un commentaire ; les lignes commençant par ce caractère sont ignorées. |
| Caractère délimiteur de colonne (default : |
| Chaîne à utiliser pour les valeurs vides lors de l'écriture. |
| Applique le schéma déclaré aux données CSV, en ignorant les noms d'en-tête. |
| Caractère d'échappement (default : |
| Indique si la première ligne contient des noms de colonne (default : |
| Supprime les espaces blancs en début de ligne des valeurs. |
| Supprime les espaces de fin des valeurs. |
| Nombre maximum de caractères autorisé par valeur de colonne. |
| Nombre maximal de colonnes autorisées dans un enregistrement. |
| Merge le schéma de plusieurs fichiers CSV. |
| Représentation sous forme de chaîne de |
| Représentation sous forme de chaîne de l'infini négatif. |
| Chaîne qui représente une valeur nulle. |
| Permet la mise en correspondance sensible à la casse entre les noms d'en-têtes et les noms de champs de schéma. |
| Représentation sous forme de chaîne de l'infini positif. |
| Déduit |
| Caractère de citation utilisé pour encadrer les valeurs de champ qui contiennent le délimiteur (default : |
| Nombre de lignes à ignorer au début du fichier avant l'en-tête ou les données. |
| Comment gérer les caractères de guillemets non échappés dans les champs entre guillemets. |
XML
Clé | Description |
|---|---|
| Nom de l’élément XML qui enveloppe chaque élément de tableau lors de l’écriture. |
| Préfixe ajouté aux noms d'attributs XML pour les distinguer des noms d'éléments (default : |
| Codec de compression pour la lecture (par exemple, |
| Chaîne de déclaration XML à ajouter au début lors de l'écriture. |
| Encodage des caractères du fichier XML. |
| Exclure les attributs d'éléments XML de l'analyse. |
| Ignore les espaces blancs autour des valeurs d'éléments. |
| Ignore les préfixes d'espace de noms XML lors de l'analyse. |
| Paramètres régionaux pour l'analyse des dates et des nombres. |
| Comportement pour les enregistrements mal formés : |
| Chaîne qui représente une valeur nulle. |
| Nom du tag de l'élément racine. |
| Balise d'élément XML qui identifie chaque ligne (obligatoire). |
| Chemin d’accès à un fichier de schéma XSD pour valider chaque élément de ligne. |
| Fraction des lignes utilisées pour l'inférence de schéma (default : |
| Modèle pour l'analyse des chaînes de timestamp. |
| Modèle pour l'analyse des chaînes Timestamp sans fuseau horaire. |
| Fuseau horaire pour l'analyse des Timestamp. |
| Valide que les noms d’éléments XML sont conformes à la spécification XML. |
| Nom de la balise utilisé pour les valeurs de texte dans les éléments qui ont également des attributs (default : |
Parquet
Clé | Description |
|---|---|
| Gestion des dates et des Timestamp rédigés au format de calendrier julien : |
| Gestion des Timestamp INT96 écrits au format de calendrier julien : |
| Merge le schéma de plusieurs fichiers Parquet. |
Avro
Clé | Description |
|---|---|
| Schéma Avro au format de chaîne JSON. Permet d'appliquer un schéma spécifique lors des lectures. |
| Gestion des dates et des Timestamp rédigés au format de calendrier julien : |
| Fusionne le schéma sur plusieurs fichiers Avro. |
Format des données ingérées
Le schéma de la table de destination dépend de entity_type et format que vous configurez.
Type d’entité BINARYFILE (FILE)
Lorsque entity_type est FILE et format est BINARYFILE, chaque fichier ingéré devient une ligne avec les colonnes suivantes :
Champ | Type | Description |
|---|---|---|
|
| Le chemin d'accès du fichier. |
|
| L'heure de la dernière modification du fichier. |
|
| La taille du fichier en octets. |
|
| Le contenu du fichier. Databricks ne recommande pas d'accéder directement à cette colonne. Accédez-y plutôt à l'aide des UDF dans le cas d'usage RAG en aval. |
|
| L'identifiant SharePoint unique du fichier. |
|
| Contient les métadonnées spécifiques à SharePoint pour le fichier :
|
|
| Métadonnées de fichier standard ajoutées par Databricks lors de l'ingestion :
|
Type d'entité structurée (FICHIER avec format structuré)
Lorsque entity_type est FILE et que format est un format structuré (CSV, JSON, XML, EXCEL, PARQUET, AVRO, ou ORC), le schéma de la table de destination correspond au schéma des fichiers source. Les colonnes sont déduites du contenu du fichier, sous réserve des paramètres schema_evolution_mode et schema_hints.
type d'entité FILE_METADATA
Lorsque entity_type est FILE_METADATA, le contenu du fichier n'est pas download. La table de destination contient uniquement les colonnes de métadonnées des structs _sharepoint_metadata et _file_metadata décrits ci-dessus, plus _file_id.