Pular para o conteúdo principal

Arquitetura de armazenamento

Lakebase separa o armazenamento do compute. Os dados do seu banco de dados residem em uma camada de armazenamento distribuída gerenciada pelo Databricks, independente das instâncias de compute que executam suas consultas. O armazenamento persiste e permanece altamente disponível, quer o seu compute esteja em execução, em pausa ou em escalonamento.

Para obter uma visão geral de como as camadas de compute e armazenamento funcionam juntas, incluindo safekeepers e pageservers, consulte Arquitetura do Lakebase.

Arquitetura de armazenamento mostrando o compute conectando-se a um armazenamento distribuído com redundância de zona, que persiste em armazenamento de objetos em cloud gerenciado pelo Databricks.

Camada de armazenamento

O Lakebase usa uma arquitetura de armazenamento distribuído. Nenhuma máquina única mantém o estado autoritativo do seu banco de dados. O Lakebase também persiste dados no armazenamento de objetos na nuvem gerenciado pelo Databricks, a base de durabilidade para toda a camada de armazenamento. O armazenamento de objetos na nuvem foi projetado para uma durabilidade extremamente alta e não depende de replicação assíncrona, portanto, o atraso na replicação não afeta a durabilidade. O Databricks gerencia a configuração de redundância de armazenamento.

A redundância de armazenamento é independente de compute HA

A Databricks gerencia a redundância e a disponibilidade do armazenamento do Lakebase independentemente da configuração de compute de alta disponibilidade (HA). Habilitar ou desabilitar a HA não afeta a redundância de armazenamento.

Alta disponibilidade é um recurso da camada de compute. Pré-provisiona uma instância compute secundária em uma zona de disponibilidade separada para failover automático. Redundância de armazenamento e alta disponibilidade de compute são camadas independentes.

Característica

Redundância de armazenamento

Compute de alta disponibilidade (HA)

Obrigatório

Sim

Não

Configurável pelo cliente

Não

Sim

O que ele protege

Durabilidade e disponibilidade dos dados

Capacidade de executar consultas

Característica

Redundância de armazenamento

Compute de alta disponibilidade (HA)

Obrigatório

Sim

Não

Configurável pelo cliente

Não

Sim

O que ele protege

Durabilidade e disponibilidade dos dados

Capacidade de executar consultas

Comparação lado a lado mostrando que a redundância de armazenamento permanece inalterada, seja o compute HA desabilitado ou habilitado.

Como a separação de armazenamento permite outros recursos

A separação do armazenamento do compute possibilita vários recursos do Lakebase.

  • Zero perda de dados (RPO = 0): Como o Lakebase registra de forma durável cada transação confirmada na camada de armazenamento antes de reconhecê-la, não há perda de dados confirmados quando o compute falha, reinicia, é reduzido a zero ou sofre failover.
  • Ramificações instantâneas: O Lakebase cria ramificações usando copy-on-write em armazenamento compartilhado. O processo não duplica dados.
  • Réplicas de leitura: várias instâncias de compute lêem da mesma camada de armazenamento compartilhada. Esta abordagem não requer replicação de dados.
  • Dimensionamento para zero: O compute pausa, mas o armazenamento persiste. Os dados estão imediatamente disponíveis quando o compute é retomado.
  • Failover rápido: Como o armazenamento é separado do compute, o failover não envolve a movimentação de dados. Lakebase promove uma instância de compute secundária que se conecta ao armazenamento existente.

Informações relacionadas

  • Alta disponibilidade: Configure redundância em nível de compute para failover automático entre zonas de disponibilidade. Consulte Alta disponibilidade.
  • Gerenciar alta disponibilidade: Ative e configure a configuração de compute de HA no seu endpoint. Consulte Gerenciar alta disponibilidade.
  • Branches de banco de dados: Aprenda como branches usam armazenamento copy-on-write para criar ambientes isolados instantâneos. Consulte Branches.
  • Réplicas de leitura: Adicione instâncias de compute só de leitura que leem da mesma camada de armazenamento, sem replicação de dados. Consulte Réplicas de leitura.