Aller au contenu principal

Architecture de stockage

Lakebase sépare le stockage du compute. Les données de votre base de données se trouvent dans une couche de stockage distribuée gérée par Databricks, indépendamment des instances de compute qui exécutent vos queries. Le stockage persiste et reste hautement disponible, que votre compute soit en cours d’exécution, en pause ou en cours de mise à l’échelle.

Pour un aperçu du fonctionnement conjoint des couches compute et de stockage, y compris les safekeepers et les pageservers, consultez l'architecture Lakebase.

Architecture de stockage montrant le compute se connectant à un stockage distribué redondant inter-zone, qui persiste vers un stockage d'objets cloud géré par Databricks.

Couche de stockage

Lakebase utilise une architecture de stockage distribuée. Aucune machine unique ne détient l'état faisant autorité de votre base de données. Lakebase persiste également les données dans le stockage d'objets cloud géré par Databricks, qui constitue la base de durabilité de toute la couche de stockage. Le stockage d'objets cloud est conçu pour une durabilité extrêmement élevée et ne repose pas sur une réplication asynchrone ; le délai de réplication n'affecte donc pas la durabilité. Databricks gère la configuration de la redondance du stockage.

Sur AWS, Lakebase persiste les données vers Amazon S3 en tant que couche de stockage d’objets cloud.

La redondance du stockage est indépendante du compute HA

Databricks gère la redondance et la disponibilité du stockage Lakebase indépendamment du paramètre de compute de haute disponibilité (HA). L'activation ou la désactivation de la haute disponibilité (HA) n'affecte pas la redondance du stockage.

La haute disponibilité est une fonctionnalité de la couche compute. Il pré-provisionne une instance de compute secondaire dans une zone de disponibilité distincte pour un basculement automatique. La redondance du stockage et la HA du compute sont des couches indépendantes.

Caractéristique

Redondance du stockage

Haute disponibilité (HA) du compute

Obligatoire

Oui

Non

Configurable par le client

Non

Oui

Ce qu’il protège

Durabilité et disponibilité des données

Possibilité d'exécuter des requêtes

Caractéristique

Redondance du stockage

Haute disponibilité (HA) du compute

Obligatoire

Oui

Non

Configurable par le client

Non

Oui

Ce qu’il protège

Durabilité et disponibilité des données

Possibilité d'exécuter des requêtes

La comparaison côte à côte montre que la redondance du stockage reste inchangée, que le compute HA soit désactivé ou activé.

Comment la séparation du stockage permet d'activer d'autres fonctionnalités

La séparation du stockage et du compute permet plusieurs fonctionnalités de Lakebase :

  • Zéro perte de données (RPO = 0) : étant donné que Lakebase enregistre durablement chaque transaction validée dans la couche de stockage avant de l’accuser réception, vous ne perdez aucune donnée validée lorsque le compute échoue, redémarre, est mis à zéro ou bascule.
  • Branches instantanées : Lakebase crée des branches en utilisant la copie sur écriture sur un stockage partagé. Le processus ne crée pas de doublons de données.
  • Répliques en lecture : plusieurs instances de compute lisent à partir de la même couche de stockage partagée. Cette approche ne nécessite aucune réplication de données.
  • Mise à l'échelle à zéro : le calcul est mis en pause, mais le stockage persiste. Les données sont immédiatement disponibles lorsque le compute reprend.
  • **Basculement rapide :** Étant donné que le stockage est séparé du compute, le basculement n'implique pas de déplacer des données. Lakebase promeut une instance de compute secondaire, qui se connecte au stockage existant.

Informations associées

  • Haute disponibilité : Configurez la redondance au niveau du compute pour un basculement automatique entre les zones de disponibilité. Consultez Haute disponibilité.
  • Gérer la haute disponibilité : Activez et configurez le paramètre de compute HA sur votre endpoint. Consultez Gérer la haute disponibilité.
  • Branches de base de données : Découvrez comment les branches utilisent le stockage en copie sur écriture pour créer des environnements isolés instantanés. See Branch.
  • Réplicas en lecture : Ajoutez des instances de compute en lecture seule qui lisent à partir de la même couche de stockage sans réplication de données. Voir les réplicas en lecture.