Que sont les tables dans Databricks ?
Dans Databricks, une table est une collection structurée de données stockées au sein d'un schéma. Les tables sont utilisées pour stocker, interroger et gérer les données à l'aide de SQL ou de Spark. Le type de table default est une table gérée par Unity Catalog, qui utilise Delta Lake pour un stockage de données fiable.
Databricks prend en charge trois principaux types de tables, chacun avec des caractéristiques de propriété et de gestion de données différentes :
Type de table | Description | Géré par | Prise en charge de l'écriture |
|---|---|---|---|
Databricks gère les métadonnées et les fichiers de données. | Unity Catalog | Oui | |
Les métadonnées sont dans Databricks, les données sont stockées en externe. | Aucun ou Unity Catalog | Oui | |
Fait référence aux données en lecture seule dans des systèmes externes via la fédération. | Système externe | Non | |
Tables à portée de session pour le stockage intermédiaire des données. | Aucun (lié à la session) | Oui |
Pour la plupart des cas d'usage, Databricks recommande d'utiliser des tables gérées.