Architecture de stockage
Lakebase sépare le stockage du compute. Les données de votre base de données se trouvent dans une couche de stockage distribuée gérée par Databricks, indépendamment des instances de compute qui exécutent vos queries. Le stockage persiste et reste hautement disponible, que votre compute soit en cours d’exécution, en pause ou en cours de mise à l’échelle.

Couche de stockage
Lakebase utilise une architecture de stockage distribuée. Aucune machine unique ne détient l'état faisant autorité de votre base de données. Les données sont également persistées vers le stockage d'objets cloud géré par Databricks, la base de durabilité pour toute la couche de stockage. Le stockage d'objets cloud est conçu pour une durabilité extrêmement élevée et ne repose pas sur la réplication asynchrone, la durabilité n'est donc pas affectée par le décalage de réplication. Databricks gère la configuration de redondance du stockage.
Sur AWS, Lakebase persiste les données vers Amazon S3 en tant que couche de stockage d’objets cloud.
La redondance du stockage est indépendante du compute HA
La redondance et la disponibilité du stockage Lakebase sont gérées par Databricks et sont indépendantes du paramètre de compute de haute disponibilité (HA). L'activation ou la désactivation de la HA n'affecte pas la redondance du stockage.
La haute disponibilité est une fonctionnalité de la couche compute. Il pré-provisionne une instance de compute secondaire dans une zone de disponibilité distincte pour un basculement automatique. La redondance du stockage et la HA du compute sont des couches indépendantes.
Caractéristique | Redondance du stockage | Haute disponibilité (HA) du compute |
|---|---|---|
Obligatoire | Oui | Non |
Configurable par le client | Non | Oui |
Ce qu’il protège | Durabilité et disponibilité des données | Possibilité d'exécuter des requêtes |

Comment la séparation du stockage permet d'activer d'autres fonctionnalités
La séparation du stockage et du compute permet plusieurs fonctionnalités de Lakebase :
- Zéro perte de données (RPO = 0) : Chaque transaction validée étant persistée durablement dans le stockage d’objets cloud avant d’être confirmée, aucune donnée validée n’est perdue lorsque le compute échoue, redémarre, monte en charge à zéro ou bascule.
- Branches instantanées : Lakebase crée des branches en utilisant la copie sur écriture sur un stockage partagé. Le processus ne crée pas de doublons de données.
- Répliques en lecture : plusieurs instances de compute lisent à partir de la même couche de stockage partagée. Cette approche ne nécessite aucune réplication de données.
- Mise à l'échelle à zéro : le calcul est mis en pause, mais le stockage persiste. Les données sont immédiatement disponibles lorsque le compute reprend.
- **Basculement rapide :** Étant donné que le stockage est séparé du compute, le basculement n'implique pas de déplacer des données. Lakebase promeut une instance de compute secondaire, qui se connecte au stockage existant.
Informations associées
- Haute disponibilité : Configurez la redondance au niveau du compute pour un basculement automatique entre les zones de disponibilité. Consultez Haute disponibilité.
- Gérer la haute disponibilité : Activez et configurez le paramètre de compute HA sur votre endpoint. Consultez Gérer la haute disponibilité.
- Branches de base de données : Découvrez comment les branches utilisent le stockage en copie sur écriture pour créer des environnements isolés instantanés. See Branch.
- Réplicas en lecture : Ajoutez des instances de compute en lecture seule qui lisent à partir de la même couche de stockage sans réplication de données. Voir les réplicas en lecture.