Charger des données à l'aide d'un emplacement externe Unity Catalog
Aperçu
Cette fonctionnalité est en aperçu public.
Cet article décrit comment utiliser l'interface utilisateur d'ajout de données pour créer une table gérée à partir de données de Google Cloud Storage en utilisant un emplacement externe Unity Catalog. Un emplacement externe est un objet qui combine un chemin de stockage cloud avec un identifiant de stockage qui autorise l'accès à ce chemin de stockage cloud.
Avant de commencer
Avant de commencer, vous devez disposer des éléments suivants :
- Un Workspace avec Unity Catalog activé. Pour plus d'informations, consultez Se familiariser avec Unity Catalog.
- Le privilège
READ FILESsur l’emplacement externe. Pour plus d’informations, consultez Accorder des autorisations sur un emplacement externe - Le privilège
CREATE TABLEsur le schéma dans lequel vous souhaitez créer la table gérée, le privilègeUSE SCHEMAsur le schéma et le privilègeUSE CATALOGsur le catalogue parent. Pour plus d'informations, consultez la référence des privilèges Unity Catalog.
Types de fichiers
Les types de fichiers suivants sont pris en charge :
- CSV
- TSV
- JSON
- XML
- AVRO
- Parquet
Étape 1 : Confirmer l'accès à l'emplacement externe
Pour confirmer l’accès à l’emplacement externe, veuillez procéder comme suit :
- Dans la barre latérale de votre workspace Databricks, cliquez sur **Catalogue**.
- Dans l'Explorateur de catalogues, cliquez sur
Se connecter , puis cliquez sur Emplacements externes .
Étape 2 : Créer la table gérée
Pour créer la table gérée, procédez comme suit :
-
Dans la barre latérale de votre Workspace, cliquez sur + Nouveau > Ajouter des données .
-
Dans l'interface utilisateur d'ajout de données, cliquez sur **Google Cloud Storage**.
-
Sélectionnez un emplacement externe dans la liste déroulante.
-
Sélectionnez les dossiers et les fichiers que vous souhaitez charger dans Databricks, puis cliquez sur Aperçu de la table .
-
Sélectionnez un catalogue et un schéma dans les listes déroulantes.
-
(Facultatif) Modifier le nom de la table.
-
(Facultatif) Pour définir des options de format avancées par type de fichier, cliquez sur Attributs avancés , désactivez Détecter automatiquement le type de fichier , puis sélectionnez un type de fichier.
Pour une liste d'options de formatage, consultez la section suivante.
-
(Facultatif) Pour modifier le nom de la colonne, cliquez sur la zone de saisie en haut de la colonne.
Les noms de colonne ne prennent pas en charge les virgules, les barres obliques inverses ou les caractères Unicode (tels que les emojis).
-
(Facultatif) Pour modifier les types de colonnes, cliquez sur l'icône avec le type.
-
Cliquez sur Créer une table .
Options de format de type de fichier
Les options de format suivantes sont disponibles, selon le type de fichier :
Option de format | Description | Types de fichiers pris en charge |
|---|---|---|
| Le caractère séparateur entre les colonnes. Un seul caractère est autorisé, et la barre oblique inversée n'est pas prise en charge. Le default est une virgule. | CSV |
| Le caractère d'échappement à utiliser lors de l'analyse des données. La default est un guillemet. | CSV |
| Cette option spécifie si le fichier contient un en-tête. Activé par default. | CSV |
| Détecter automatiquement le type de fichier. default est | XML |
| Détecter automatiquement les types de colonnes à partir du contenu du fichier. Vous pouvez modifier les types dans la table d'aperçu. Si cette valeur est définie sur faux, tous les types de colonnes sont inférés comme STRING. Activé par default. |
|
| Si la valeur d'une colonne peut s'étendre sur plusieurs lignes dans le fichier. Désactivé par default. |
|
| S’il faut ou non inférer le schéma de plusieurs fichiers et Merge le schéma de chaque fichier. Activé par default. | CSV |
| Si les commentaires sont autorisés dans le fichier. Activé par default. | JSON |
| Indique si les guillemets simples sont autorisés dans le fichier. Activé par default. | JSON |
| Indique s'il faut tenter d'inférer les chaînes de Timestamp comme | JSON |
| S'il faut enregistrer les colonnes qui ne correspondent pas au schéma. Pour plus d'information, consulter Qu'est-ce que la colonne de données sauvées ? Activé par default. |
|
| Exclure ou non les attributs dans les éléments. default est | XML |
| Le préfixe des attributs pour différencier les attributs et les éléments. default est | XML |
Types de données de colonne
Les types de données de colonne suivants sont pris en charge. Pour plus d'information sur les types de données individuels, consultez les types de données SQL.
Type de données | Description |
|---|---|
| Nombres entiers signés de 8 octets. |
| Valeurs booléennes ( |
| et le jour, sans fuseau horaire. |
| Nombres avec une précision maximale de |
| Nombres à virgule flottante double précision de 8 octets. |
| Valeurs de chaîne de caractères. |
| Valeurs comprenant les valeurs des champs année, mois, jour, heure, minute et seconde, avec le fuseau horaire local de la session. |
Problèmes connus
- Vous pourriez rencontrer des problèmes avec les caractères spéciaux dans les types de données complexes, tels qu'un objet JSON avec une clé contenant une apostrophe inversée ou un deux-points.
- Certains fichiers JSON pourraient exiger que vous sélectionniez manuellement JSON comme type de fichier. Pour sélectionner manuellement un type de fichier après avoir sélectionné des fichiers, cliquez sur Attributs avancés , désactivez Détecter automatiquement le type de fichier , puis sélectionnez JSON .
- Les horodatages et les décimales imbriqués dans des types complexes pourraient rencontrer des problèmes.