Aller au contenu principal

Architecture de stockage

Lakebase sépare le stockage du compute. Les données de votre base de données se trouvent dans une couche de stockage distribuée gérée par Databricks, indépendamment des instances de compute qui exécutent vos queries. Le stockage persiste et reste hautement disponible, que votre compute soit en cours d’exécution, en pause ou en cours de mise à l’échelle.

Architecture de stockage montrant le compute se connectant à un stockage distribué redondant inter-zone, qui persiste vers un stockage d'objets cloud géré par Databricks.

Couche de stockage

Lakebase utilise une architecture de stockage distribuée. Aucune machine unique ne détient l'état faisant autorité de votre base de données. Les données sont également persistées vers le stockage d'objets cloud géré par Databricks, la base de durabilité pour toute la couche de stockage. Le stockage d'objets cloud est conçu pour une durabilité extrêmement élevée et ne repose pas sur la réplication asynchrone, la durabilité n'est donc pas affectée par le décalage de réplication. Databricks gère la configuration de redondance du stockage.

Sur AWS, Lakebase persiste les données vers Amazon S3 en tant que couche de stockage d’objets cloud.

La redondance du stockage est indépendante du compute HA

La redondance et la disponibilité du stockage Lakebase sont gérées par Databricks et sont indépendantes du paramètre de compute de haute disponibilité (HA). L'activation ou la désactivation de la HA n'affecte pas la redondance du stockage.

La haute disponibilité est une fonctionnalité de la couche compute. Il pré-provisionne une instance de compute secondaire dans une zone de disponibilité distincte pour un basculement automatique. La redondance du stockage et la HA du compute sont des couches indépendantes.

Caractéristique

Redondance du stockage

Haute disponibilité (HA) du compute

Obligatoire

Oui

Non

Configurable par le client

Non

Oui

Ce qu’il protège

Durabilité et disponibilité des données

Possibilité d'exécuter des requêtes

Caractéristique

Redondance du stockage

Haute disponibilité (HA) du compute

Obligatoire

Oui

Non

Configurable par le client

Non

Oui

Ce qu’il protège

Durabilité et disponibilité des données

Possibilité d'exécuter des requêtes

La comparaison côte à côte montre que la redondance du stockage reste inchangée, que le compute HA soit désactivé ou activé.

Comment la séparation du stockage permet d'activer d'autres fonctionnalités

La séparation du stockage et du compute permet plusieurs fonctionnalités de Lakebase :

  • Zéro perte de données (RPO = 0) : Chaque transaction validée étant persistée durablement dans le stockage d’objets cloud avant d’être confirmée, aucune donnée validée n’est perdue lorsque le compute échoue, redémarre, monte en charge à zéro ou bascule.
  • Branches instantanées : Lakebase crée des branches en utilisant la copie sur écriture sur un stockage partagé. Le processus ne crée pas de doublons de données.
  • Répliques en lecture : plusieurs instances de compute lisent à partir de la même couche de stockage partagée. Cette approche ne nécessite aucune réplication de données.
  • Mise à l'échelle à zéro : le calcul est mis en pause, mais le stockage persiste. Les données sont immédiatement disponibles lorsque le compute reprend.
  • **Basculement rapide :** Étant donné que le stockage est séparé du compute, le basculement n'implique pas de déplacer des données. Lakebase promeut une instance de compute secondaire, qui se connecte au stockage existant.

Informations associées

  • Haute disponibilité : Configurez la redondance au niveau du compute pour un basculement automatique entre les zones de disponibilité. Consultez Haute disponibilité.
  • Gérer la haute disponibilité : Activez et configurez le paramètre de compute HA sur votre endpoint. Consultez Gérer la haute disponibilité.
  • Branches de base de données : Découvrez comment les branches utilisent le stockage en copie sur écriture pour créer des environnements isolés instantanés. See Branch.
  • Réplicas en lecture : Ajoutez des instances de compute en lecture seule qui lisent à partir de la même couche de stockage sans réplication de données. Voir les réplicas en lecture.