Aller au contenu principal

Charger des données à l'aide d'un emplacement externe Unity Catalog

info

Aperçu

Cette fonctionnalité est en aperçu public.

Cet article décrit comment utiliser l'interface utilisateur d'ajout de données pour créer une table gérée à partir de données de Google Cloud Storage en utilisant un emplacement externe Unity Catalog. Un emplacement externe est un objet qui combine un chemin de stockage cloud avec un identifiant de stockage qui autorise l'accès à ce chemin de stockage cloud.

Avant de commencer

Avant de commencer, vous devez disposer des éléments suivants :

Types de fichiers

Les types de fichiers suivants sont pris en charge :

  • CSV
  • TSV
  • JSON
  • XML
  • AVRO
  • Parquet

Étape 1 : Confirmer l'accès à l'emplacement externe

Pour confirmer l’accès à l’emplacement externe, veuillez procéder comme suit :

  1. Dans la barre latérale de votre workspace Databricks, cliquez sur **Catalogue**.
  2. Dans l'Explorateur de catalogues, cliquez sur Icône de prise. Se connecter , puis cliquez sur Emplacements externes .

Étape 2 : Créer la table gérée

Pour créer la table gérée, procédez comme suit :

  1. Dans la barre latérale de votre Workspace, cliquez sur + Nouveau > Ajouter des données .

  2. Dans l'interface utilisateur d'ajout de données, cliquez sur **Google Cloud Storage**.

  3. Sélectionnez un emplacement externe dans la liste déroulante.

  4. Sélectionnez les dossiers et les fichiers que vous souhaitez charger dans Databricks, puis cliquez sur Aperçu de la table .

  5. Sélectionnez un catalogue et un schéma dans les listes déroulantes.

  6. (Facultatif) Modifier le nom de la table.

  7. (Facultatif) Pour définir des options de format avancées par type de fichier, cliquez sur Attributs avancés , désactivez Détecter automatiquement le type de fichier , puis sélectionnez un type de fichier.

    Pour une liste d'options de formatage, consultez la section suivante.

  8. (Facultatif) Pour modifier le nom de la colonne, cliquez sur la zone de saisie en haut de la colonne.

    Les noms de colonne ne prennent pas en charge les virgules, les barres obliques inverses ou les caractères Unicode (tels que les emojis).

  9. (Facultatif) Pour modifier les types de colonnes, cliquez sur l'icône avec le type.

  10. Cliquez sur Créer une table .

Options de format de type de fichier

Les options de format suivantes sont disponibles, selon le type de fichier :

Option de format

Description

Types de fichiers pris en charge

Column delimiter

Le caractère séparateur entre les colonnes. Un seul caractère est autorisé, et la barre oblique inversée n'est pas prise en charge. Le default est une virgule.

CSV

Escape character

Le caractère d'échappement à utiliser lors de l'analyse des données. La default est un guillemet.

CSV

First row contains the header

Cette option spécifie si le fichier contient un en-tête. Activé par default.

CSV

Automatically detect file type

Détecter automatiquement le type de fichier. default est true.

XML

Automatically detect column types

Détecter automatiquement les types de colonnes à partir du contenu du fichier. Vous pouvez modifier les types dans la table d'aperçu. Si cette valeur est définie sur faux, tous les types de colonnes sont inférés comme STRING. Activé par default.

  • CSV - JSON - XML

Rows span multiple lines

Si la valeur d'une colonne peut s'étendre sur plusieurs lignes dans le fichier. Désactivé par default.

  • CSV - JSON

Merge the schema across multiple files

S’il faut ou non inférer le schéma de plusieurs fichiers et Merge le schéma de chaque fichier. Activé par default.

CSV

Allow comments

Si les commentaires sont autorisés dans le fichier. Activé par default.

JSON

Allow single quotes

Indique si les guillemets simples sont autorisés dans le fichier. Activé par default.

JSON

Infer timestamp

Indique s'il faut tenter d'inférer les chaînes de Timestamp comme TimestampType. Activé par default.

JSON

Rescued data column

S'il faut enregistrer les colonnes qui ne correspondent pas au schéma. Pour plus d'information, consulter Qu'est-ce que la colonne de données sauvées ? Activé par default.

  • CSV - JSON - Avro - Parquet

Exclude attribute

Exclure ou non les attributs dans les éléments. default est false.

XML

Attribute prefix

Le préfixe des attributs pour différencier les attributs et les éléments. default est _.

XML

Option de format

Description

Types de fichiers pris en charge

Column delimiter

Le caractère séparateur entre les colonnes. Un seul caractère est autorisé, et la barre oblique inversée n'est pas prise en charge. Le default est une virgule.

CSV

Escape character

Le caractère d'échappement à utiliser lors de l'analyse des données. La default est un guillemet.

CSV

First row contains the header

Cette option spécifie si le fichier contient un en-tête. Activé par default.

CSV

Automatically detect file type

Détecter automatiquement le type de fichier. default est true.

XML

Automatically detect column types

Détecter automatiquement les types de colonnes à partir du contenu du fichier. Vous pouvez modifier les types dans la table d'aperçu. Si cette valeur est définie sur faux, tous les types de colonnes sont inférés comme STRING. Activé par default.

  • CSV - JSON - XML

Rows span multiple lines

Si la valeur d'une colonne peut s'étendre sur plusieurs lignes dans le fichier. Désactivé par default.

  • CSV - JSON

Merge the schema across multiple files

S’il faut ou non inférer le schéma de plusieurs fichiers et Merge le schéma de chaque fichier. Activé par default.

CSV

Allow comments

Si les commentaires sont autorisés dans le fichier. Activé par default.

JSON

Allow single quotes

Indique si les guillemets simples sont autorisés dans le fichier. Activé par default.

JSON

Infer timestamp

Indique s'il faut tenter d'inférer les chaînes de Timestamp comme TimestampType. Activé par default.

JSON

Rescued data column

S'il faut enregistrer les colonnes qui ne correspondent pas au schéma. Pour plus d'information, consulter Qu'est-ce que la colonne de données sauvées ? Activé par default.

  • CSV - JSON - Avro - Parquet

Exclude attribute

Exclure ou non les attributs dans les éléments. default est false.

XML

Attribute prefix

Le préfixe des attributs pour différencier les attributs et les éléments. default est _.

XML

Types de données de colonne

Les types de données de colonne suivants sont pris en charge. Pour plus d'information sur les types de données individuels, consultez les types de données SQL.

Type de données

Description

BIGINT

Nombres entiers signés de 8 octets.

BOOLEAN

Valeurs booléennes (true, false).

DATE

et le jour, sans fuseau horaire.

DECIMAL (P,S)

Nombres avec une précision maximale de P et une échelle fixe de S.

DOUBLE

Nombres à virgule flottante double précision de 8 octets.

STRING

Valeurs de chaîne de caractères.

TIMESTAMP

Valeurs comprenant les valeurs des champs année, mois, jour, heure, minute et seconde, avec le fuseau horaire local de la session.

Type de données

Description

BIGINT

Nombres entiers signés de 8 octets.

BOOLEAN

Valeurs booléennes (true, false).

DATE

et le jour, sans fuseau horaire.

DECIMAL (P,S)

Nombres avec une précision maximale de P et une échelle fixe de S.

DOUBLE

Nombres à virgule flottante double précision de 8 octets.

STRING

Valeurs de chaîne de caractères.

TIMESTAMP

Valeurs comprenant les valeurs des champs année, mois, jour, heure, minute et seconde, avec le fuseau horaire local de la session.

Problèmes connus

  • Vous pourriez rencontrer des problèmes avec les caractères spéciaux dans les types de données complexes, tels qu'un objet JSON avec une clé contenant une apostrophe inversée ou un deux-points.
  • Certains fichiers JSON pourraient exiger que vous sélectionniez manuellement JSON comme type de fichier. Pour sélectionner manuellement un type de fichier après avoir sélectionné des fichiers, cliquez sur Attributs avancés , désactivez Détecter automatiquement le type de fichier , puis sélectionnez JSON .
  • Les horodatages et les décimales imbriqués dans des types complexes pourraient rencontrer des problèmes.