Aller au contenu principal

Que sont les tables dans Databricks ?

Dans Databricks, une table est une collection structurée de données stockées au sein d'un schéma. Les tables sont utilisées pour stocker, interroger et gérer les données à l'aide de SQL ou de Spark. Le type de table default est une table gérée par Unity Catalog, qui utilise Delta Lake pour un stockage de données fiable.

Databricks prend en charge trois principaux types de tables, chacun avec des caractéristiques de propriété et de gestion de données différentes :

Type de table

Description

Géré par

Prise en charge de l'écriture

Géré

Databricks gère les métadonnées et les fichiers de données.

Unity Catalog

Oui

Externe

Les métadonnées sont dans Databricks, les données sont stockées en externe.

Aucun ou Unity Catalog

Oui

Étranger

Fait référence aux données en lecture seule dans des systèmes externes via la fédération.

Système externe

Non

Temporaire

Tables à portée de session pour le stockage intermédiaire des données.

Aucun (lié à la session)

Oui

Type de table

Description

Géré par

Prise en charge de l'écriture

Géré

Databricks gère les métadonnées et les fichiers de données.

Unity Catalog

Oui

Externe

Les métadonnées sont dans Databricks, les données sont stockées en externe.

Aucun ou Unity Catalog

Oui

Étranger

Fait référence aux données en lecture seule dans des systèmes externes via la fédération.

Système externe

Non

Temporaire

Tables à portée de session pour le stockage intermédiaire des données.

Aucun (lié à la session)

Oui

Pour la plupart des cas d'usage, Databricks recommande d'utiliser des tables gérées.