Concepts clés
Lakebase est conçu sur un ensemble de fonctionnalités qui vous permettent de développer, de tester et de monter en charge vos applications de base de données de manière efficace. Cette section présente les concepts fondamentaux qui différencient Lakebase des systèmes de base de données traditionnels.
Projets
Un projet Lakebase est le conteneur de niveau supérieur pour toutes vos Ressources de base de données. Chaque projet appartient à un Workspace Databricks et contient une ou plusieurs Branch, chacune avec son propre compute et ses propres bases de données.
Project
└── Branch (e.g., production)
├── Compute (read-write)
└── Database (e.g., databricks_postgres)
En savoir plus : Projets | Gérer les projets
Dimensionnement automatique
Lakebase ajuste automatiquement les ressources de compute en fonction des exigences de votre charge de travail. À mesure que le trafic de votre application augmente ou diminue, les ressources de compute augmentent ou diminuent dans la plage configurée, sans intervention manuelle ni temps d'arrêt.
Avantages clés :
- Ajustement automatique : Les Ressources montent en charge en fonction de la demande réelle.
- Aucune interruption de service : La mise à l'échelle dans votre plage configurée se produit sans interrompre les connexions. Cependant, la modification de la configuration CU minimale ou maximale pourrait entraîner une brève interruption.
- Optimisation des coûts : ne payez que pour les ressources que vous utilisez réellement.
- Cohérence des performances : maintenir des performances réactives lors des pics de trafic.
En savoir plus : Mise à l'échelle automatique | Configurer la mise à l'échelle automatique
Monter en charge jusqu’à zéro
Lorsque votre base de données est inactive, Lakebase peut automatiquement réduire les ressources de compute à zéro, éliminant ainsi les coûts liés à la capacité inutilisée. Lorsque l'activité reprend, votre compute remonte automatiquement en charge en quelques secondes.
Avantages clés :
- Zéro coût d'inactivité : Aucuns frais de compute lorsque votre base de données est inactive.
- Reprise instantanée : les bases de données se réveillent automatiquement lorsqu'elles sont consultées.
- Convivial pour le développement : Idéal pour les environnements de développement et de préproduction avec une utilisation intermittente.
- **Gestion automatique** : Aucune intervention manuelle n'est requise.
En savoir plus : Monter en charge à zéro | Configurer la mise à l'échelle jusqu'à zéro
Branches de base de données
Les branches de base de données dans Lakebase fonctionnent de manière similaire aux branches Git pour votre code. Vous pouvez créer des branches instantanées et isolées pour le développement, les tests ou l'expérimentation sans dupliquer les données ni impacter votre environnement de production.
Avantages clés :
- Création instantanée : les Branches sont créées en quelques secondes grâce à la technologie de copie lors de l’écriture.
- Rentable : Seules les données modifiées sont stockées séparément, ce qui minimise les coûts de stockage.
- Environnements isolés : Testez les changements en toute sécurité sans affecter votre base de données principale.
- Collaboration : Les membres de l'équipe peuvent travailler simultanément sur des Branches distinctes.
En savoir plus : Branch de base de données | Gérer les Branch
compute et Endpoint
Un Endpoint Lakebase est le point de connexion stable que votre application utilise pour atteindre une base de données. Derrière chaque Endpoint, une ou plusieurs instances de compute gèrent le traitement des queries. Votre chaîne de connexion reste la même même lorsque vous montez en charge les ressources de compute ou ajoutez une haute disponibilité.
Une Branch dispose généralement d'un seul Endpoint en lecture-écriture (votre compute principal) et, en option, d'un ou plusieurs Endpoints en lecture seule (réplicas en lecture).
En savoir plus : compute et Endpoint | Gérer les compute
Architecture de stockage
Lakebase stocke les données dans une couche de stockage distribuée qui est séparée du compute. Le stockage est redondant interzone et persiste indépendamment du statut du compute, qu'il soit en cours d'exécution, en pause ou en basculement. Cette séparation du stockage permet des Branch instantanées, des réplicas en lecture et une mise à l'échelle jusqu'à zéro sans duplication des données.
Avantages clés :
- Stockage hautement disponible : Databricks maintient un stockage hautement disponible indépendamment de votre paramètre de compute HA.
- Persiste malgré les changements de compute : Le stockage reste disponible en cas de pannes, de pauses ou de changements de configuration du compute.
- Fondation pour les branches et les répliques : la création instantanée de branches et les répliques en lecture reposent toutes deux sur plusieurs instances de compute partageant la même couche de stockage.
En savoir plus : Architecture de stockage
Haute disponibilité
La haute disponibilité associe un compute principal en lecture/écriture à une ou plusieurs instances de compute secondaires réparties sur des zones de disponibilité. Lorsque le principal devient indisponible, Lakebase promeut automatiquement un secondaire et votre application continue à partir de la dernière transaction validée. Votre chaîne de connexion reste inchangée tout au long. Le stockage est déjà hautement disponible. L’activation de la haute disponibilité (HA) ajoute une redondance au niveau du compute pour un basculement automatique.
Avantages clés :
- Basculement automatique : Lakebase promeut une instance de compute secondaire sans intervention manuelle.
- **Aucune perte de données :** le basculement préserve toutes les transactions validées.
- **Chaînes de connexion stables :** Votre application n'a pas besoin de modifier sa configuration de connexion après un basculement.
En savoir plus : Haute disponibilité | Gérer la haute disponibilité
Reprise après sinistre (DR)
Lakebase Reprise après sinistre (DR) réplique les données de votre projet vers un Workspace secondaire dans une région différente, protégeant contre les défaillances complètes de région, y compris les pannes, plutôt qu'une seule défaillance de compute ou de zone de disponibilité (AZ). Lakebase propose actuellement une réplication périodique, qui synchronise vos données vers une autre région sans avoir à exécuter de compute supplémentaire. Le mode périodique est destiné aux cas d'usage où vous devez vous protéger contre les pannes régionales, mais où votre cas d'usage n'est pas aussi sensible à l'indisponibilité régionale (par exemple, des fenêtres RPO de l'ordre de quelques minutes). Vous devez manuellement Trigger un basculement si vous souhaitez promouvoir un projet secondaire pour qu'il devienne un principal, bien que vous puissiez choisir de créer des scripts pour ce comportement.
Avantages clés :
- Protection interrégionale : rétablissez-vous après une interruption qui touche une région entière, y compris les interruptions contre lesquelles la haute disponibilité ne peut pas vous protéger.
- Évitez la perte de données silencieuse : Les Recovery Branches conservent les transactions qui n'ont pas été répliquées avant une panne sous forme de Branch que vous pouvez inspecter et rapprocher, non perdues.
- **Basculement contrôlé par l'administrateur :** Un administrateur de projet Lakebase décide quand basculer, de sorte qu'un secondaire obsolète ne soit jamais promu automatiquement.
En savoir plus : Reprise après sinistre | Gérer la reprise après sinistre
Réplicas en lecture
Les réplicas de lecture sont des compute en lecture seule indépendants qui effectuent des Opérations de lecture sur les mêmes données que votre compute principal en lecture-écriture. Contrairement aux réplicas traditionnels, les réplicas en lecture Lakebase ne dupliquent pas les données — ils lisent à partir de la même couche de stockage, permettant une création instantanée et éliminant les coûts de stockage supplémentaires.
Avantages clés :
- Mise à l'échelle horizontale : Distribuez les requêtes de lecture sur plusieurs réplicas.
- Aucune duplication de données : toutes les réplicas lisent à partir du même stockage.
- Création instantanée : Disponible en quelques secondes sans copie de données.
- Rentable : aucun coût de stockage supplémentaire, avec prise en charge de la mise à l’échelle automatique et de la mise à l’échelle à zéro.
En savoir plus : Réplicas en lecture | Gérer les réplicas en lecture
Comment ils fonctionnent ensemble
Ces concepts fondamentaux collaborent pour créer une plateforme de base de données puissante et flexible :
- Les projets organisent toutes vos Ressources de base de données et appartiennent à un Workspace Databricks.
- L' autoscaling garantit que chaque branch dispose de la bonne quantité de compute en fonction de la demande.
- Le Scale-to-zero réduit les coûts sur les Branch inactives en suspendant le compute lorsqu'il n'est pas utilisé.
- Les Branches de base de données vous permettent de créer des environnements isolés pour le développement et les tests sans dupliquer les données.
- Les compute et endpoints fournissent des points de connexion stables à mesure que vous montez en charge ou reconfigurez votre infrastructure.
- L' architecture de stockage maintient vos données redondantes au niveau de la zone et hautement disponibles, indépendamment de l'état de compute.
- La haute disponibilité ajoute une redondance au niveau du compute et un basculement automatique entre les zones de disponibilité pour les workloads de production.
- **Les réplicas en lecture** répartissent le trafic de lecture sur des instances de compute supplémentaires.
Cette architecture vous permet de créer et de monter en charge des applications de base de données avec une plus grande flexibilité, des coûts réduits et moins de frais généraux d'exploitation que les systèmes de base de données traditionnels.