Pular para o conteúdo principal

Gerenciar dependências usando ambientes

info

Beta

Esse recurso está em Beta. Os administradores da conta podem controlar o acesso a este recurso na página Previews do console da conta usando a alternância Environments for Standard Compute . Consulte Gerenciar prévias do Databricks.

No compute clássico, o modo de dependência Ambientes permite que você gerencie dependências no nível da carga de trabalho usando ambientes base em vez de instalar bibliotecas com escopo de compute. Este é o mesmo modelo usado pelo compute serverless.

As configurações de ambiente permanecem isoladas de alterações no nível do compute, para que as cargas de trabalho não sejam interrompidas quando o compute for alterado abaixo delas. E como o Databricks armazena em cache os ambientes base, as dependências não são resolvidas e instaladas na startup, portanto, o compute inicia mais rapidamente e evita falhas decorrentes da resolução de pacotes, disponibilidade do repositório ou confiabilidade da rede.

Após conectar-se a um compute que usa o modo de dependência Environments , você pode selecionar um ambiente base e adicionar dependências a partir do painel lateral Ambiente do notebook. Consulte Usar ambientes em um notebook.

Requisitos

A configuração do modo de dependência só está disponível em compute que atenda aos seguintes requisitos:

  • Databricks Runtime 19 (Beta) ou acima
  • Modo de acesso Standard
  • compute multifuncional em execução em Notebooks interativos

Para obter detalhes de suporte, consulte Limitações.

Definir o modo de dependência

Para criar um compute que usa o modo de dependência Ambientes :

  1. Na barra lateral do workspace, clique em ícone de computação Compute e abra a tab All-purpose compute.

  2. Clique em Criar compute .

  3. Em Desempenho , selecione 19 Beta ou acima no menu suspenso da versão do Databricks Runtime.

  4. Expanda a seção Avançado e clique em Dependências .

  5. Para Modo de dependência , mantenha Auto selecionado para permitir que o Databricks resolva o modo, ou clique em Manual e selecione Ambientes para defini-lo você mesmo. Consulte Opções do modo de dependência.

    A tab Dependências na seção Avançado do formulário de criação de compute, com o modo de dependência definido como Auto e resolvendo para Ambientes.

  6. Configure o restante do compute e clique em Criar .

Depois que o compute estiver em execução, anexe um notebook e configure seu ambiente conforme descrito em Usar ambientes em um notebook.

Opções do modo de dependência

O controle Modo de dependência tem duas configurações que determinam como o modo é escolhido:

  • Automático : a Databricks resolve o modo com base na configuração do compute. O modo automático é resolvido para Ambientes , a menos que o compute especifique Docker, variáveis de ambiente Spark ou init scripts, caso em que é resolvido para Bibliotecas de cluster .
  • Manual : Você seleciona Ambientes ou Bibliotecas de cluster por conta própria.

Ao selecionar Manual , escolha o modo que atende às suas necessidades:

  • Ambientes : gerencie dependências no nível da carga de trabalho usando ambientes base. Bibliotecas de cluster, Docker, variáveis de ambiente do Spark e init scripts estão desabilitados. Use este modo para uma experiência de dependência consistente e portátil que corresponda ao compute serverless.
  • Bibliotecas de cluster : o comportamento clássico. Instale dependências no compute usando bibliotecas de cluster, init scripts ou Docker. Use este modo se sua carga de trabalho exigir qualquer uma dessas configurações.

Atualizar um compute existente

Se você estiver editando as configurações de um compute existente, a alternância para o modo Ambientes será bloqueada se o compute tiver configurações incompatíveis, como init scripts, bibliotecas de cluster ou Docker. Se você remover as configurações incompatíveis primeiro, poderá editar o modo de dependência.

Se você alternar para o modo Cluster bibliotecas a partir do modo Environments , os notebooks anexados manterão suas seleções de ambiente, mas essas seleções se tornarão inativas. Se você alternar o compute de volta para o modo Environments , essas seleções se tornarão ativas novamente.

Usar ambientes em um notebook

Para usar ambientes em um notebook, anexe o notebook a um recurso de compute clássico que usa o modo de dependência Ambientes . Após anexar o notebook, você pode configurar as dependências do notebook no painel lateral Ambiente ambiente, da mesma forma que faz no compute serverless.

Configurando o ambiente de um notebook a partir do painel lateral Environment no compute clássico que utiliza o modo de dependência Environments.

Selecione um ambiente base

Um ambiente base determina as bibliotecas pré-instaladas e a versão do ambiente disponíveis para o seu notebook. O seletor Ambiente base no painel lateral Ambiente é onde você escolhe seu ambiente. A Databricks recomenda usar a versão mais recente para obter os recursos de notebook mais atualizados. Para ver detalhes sobre cada versão de ambiente, consulte Versões de ambiente.

O seletor Ambiente básico inclui as seguintes opções:

  • Standard : o ambiente base default com bibliotecas fornecidas pelo Databricks.

  • ML : um ambiente base com os pacotes do sistema e do Python do Databricks Runtime for Machine Learning pré-instalados.

  • Mais : Expande para mostrar opções adicionais:

    • Versões anteriores de ambientes Standard e ML.
    • Personalizado : Especifique um ambiente personalizado usando um arquivo YAML.
  • Ambientes do Workspace : Lista todos os ambientes base compatíveis configurados para o seu workspace pelos administradores do workspace.

Adicionar dependências ao notebook

O Databricks armazena em cache o ambiente virtual do seu notebook, para que as dependências não sejam reinstaladas toda vez que você reabre um notebook ou retoma após a inatividade.

Para instalar uma dependência individualmente:

  1. Na seção Dependências , insira o caminho da dependência no campo e clique em +Adicionar dependência . Você pode especificar uma dependência em qualquer formato que seja válido em um arquivo requirements.txt. Arquivos Python wheel ou projetos Python (por exemplo, o diretório que contém um pyproject.toml ou um setup.py) podem ser localizados em arquivos de workspace ou volumes do Unity Catalog.

    • Se estiver usando um arquivo de workspace, o caminho deve ser absoluto e começar com /Workspace/.
    • Se estiver usando um arquivo em um volume do Unity Catalog, o caminho deve estar no seguinte formato: /Volumes/<catalog>/<schema>/<volume>/<path>.whl.
  2. Clique em Aplicar para instalar as dependências e reiniciar o processo do Python.

importante

Não instale o PySpark ou qualquer biblioteca que instale o PySpark como uma dependência em seus notebooks. Fazer isso interromperá sua sessão e resultará em um erro. Se isso ocorrer, remova a biblioteca e faça o reset do seu ambiente.

Para visualizar as dependências instaladas, clique na tab Instalado no painel lateral Ambiente . Abra os logs de instalação do pip para o ambiente do notebook clicando em Logs do pip na parte inferior do painel.

Limitações

O modo de dependência Ambientes oferece suporte a cargas de trabalho Python e dependências em notebooks interativos. Aplicam-se as seguintes limitações:

  • Os jobs clássicos não usam o modo de dependência Environments . Quando um job é executado em compute de uso geral clássico que especifica o modo Environments , a configuração é ignorada e o job é executado no modo Cluster libraries .
  • %scala o código não é suportado e falhará.
  • Todas as limitações do modo de acesso padrão se aplicam, incluindo a falta de suporte para R. Consulte Requisitos e limitações de compute padrão.
  • Atualmente, não é possível aplicar configurações de modo de dependência usando políticas de compute.

Configurações incompatíveis

Quando o modo de dependência Ambientes está ativado, as seguintes configurações de compute são desativadas:

  • Docker (Databricks Container Services)
  • Variáveis de ambiente do Spark
  • Init scripts
  • Bibliotecas de cluster