Arquitetura de armazenamento
Lakebase separa o armazenamento do compute. Os dados do seu banco de dados residem em uma camada de armazenamento distribuída gerenciada pelo Databricks, independente das instâncias de compute que executam suas consultas. O armazenamento persiste e permanece altamente disponível, quer o seu compute esteja em execução, em pausa ou em escalonamento.
Para obter uma visão geral de como as camadas de compute e armazenamento funcionam juntas, incluindo safekeepers e pageservers, consulte Arquitetura do Lakebase.

Camada de armazenamento
O Lakebase usa uma arquitetura de armazenamento distribuído. Nenhuma máquina única mantém o estado autoritativo do seu banco de dados. O Lakebase também persiste dados no armazenamento de objetos na nuvem gerenciado pelo Databricks, a base de durabilidade para toda a camada de armazenamento. O armazenamento de objetos na nuvem foi projetado para uma durabilidade extremamente alta e não depende de replicação assíncrona, portanto, o atraso na replicação não afeta a durabilidade. O Databricks gerencia a configuração de redundância de armazenamento.
A redundância de armazenamento é independente de compute HA
A Databricks gerencia a redundância e a disponibilidade do armazenamento do Lakebase independentemente da configuração de compute de alta disponibilidade (HA). Habilitar ou desabilitar a HA não afeta a redundância de armazenamento.
Alta disponibilidade é um recurso da camada de compute. Pré-provisiona uma instância compute secundária em uma zona de disponibilidade separada para failover automático. Redundância de armazenamento e alta disponibilidade de compute são camadas independentes.
Característica | Redundância de armazenamento | Compute de alta disponibilidade (HA) |
|---|---|---|
Obrigatório | Sim | Não |
Configurável pelo cliente | Não | Sim |
O que ele protege | Durabilidade e disponibilidade dos dados | Capacidade de executar consultas |

Como a separação de armazenamento permite outros recursos
A separação do armazenamento do compute possibilita vários recursos do Lakebase.
- Zero perda de dados (RPO = 0): Como o Lakebase registra de forma durável cada transação confirmada na camada de armazenamento antes de reconhecê-la, não há perda de dados confirmados quando o compute falha, reinicia, é reduzido a zero ou sofre failover.
- Ramificações instantâneas: O Lakebase cria ramificações usando copy-on-write em armazenamento compartilhado. O processo não duplica dados.
- Réplicas de leitura: várias instâncias de compute lêem da mesma camada de armazenamento compartilhada. Esta abordagem não requer replicação de dados.
- Dimensionamento para zero: O compute pausa, mas o armazenamento persiste. Os dados estão imediatamente disponíveis quando o compute é retomado.
- Failover rápido: Como o armazenamento é separado do compute, o failover não envolve a movimentação de dados. Lakebase promove uma instância de compute secundária que se conecta ao armazenamento existente.
Informações relacionadas
- Alta disponibilidade: Configure redundância em nível de compute para failover automático entre zonas de disponibilidade. Consulte Alta disponibilidade.
- Gerenciar alta disponibilidade: Ative e configure a configuração de compute de HA no seu endpoint. Consulte Gerenciar alta disponibilidade.
- Branches de banco de dados: Aprenda como branches usam armazenamento copy-on-write para criar ambientes isolados instantâneos. Consulte Branches.
- Réplicas de leitura: Adicione instâncias de compute só de leitura que leem da mesma camada de armazenamento, sem replicação de dados. Consulte Réplicas de leitura.