Pular para o conteúdo principal

Pesquisa de conteúdo para volumes do Unity Catalog

A pesquisa de conteúdo prepara e indexa os documentos em um volume do Unity Catalog. As pesquisas e as perguntas dos agentes são então executadas no índice, para que os usuários e agentes recuperem as informações mais relevantes de forma mais rápida e precisa. Como o índice cobre o conteúdo dentro de cada arquivo, um agente pode utilizar passagens específicas em muitos arquivos em vez de recuperar um punhado de arquivos inteiros.

A pesquisa de conteúdo é especialmente útil para volumes anexados a um Genie Agent. Consulte Analisar arquivos em volumes com um Genie Agent.

info

Beta

Esse recurso está em Beta. Para usá-lo, um administrador do workspace deve ativar Analisar arquivos em volumes com Genie Agents na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.

Requisitos

Antes de habilitar a pesquisa de conteúdo para um volume do Unity Catalog, confirme se você atende aos seguintes requisitos:

Disponibilidade regional

A pesquisa de conteúdo está disponível nas regiões listadas nesta seção. Ele não está disponível em regiões que não estão listadas. Em algumas regiões, ele é executado apenas se um account admin habilitar o processamento cross-Geo, o que permite que o Databricks processe seus arquivos fora do Geo do seu workspace. Consulte Habilitar processamento cross-Geo.

Regiões que não exigem processamento cross-Geo

A pesquisa de conteúdo é executada na região do seu workspace para as seguintes regiões:

  • us-central1 (Iowa)
  • us-east1 (Carolina do Sul)
  • us-east4 (Virgínia)
  • us-west1 (Oregon)

Regiões que exigem processamento cross-Geo

Para as regiões a seguir, um administrador de conta deve ativar o processamento cross-Geo antes que você possa ativar a pesquisa de conteúdo:

  • asia-northeast1 (Tóquio)
  • asia-south1 (Mumbai)
  • asia-southeast1 (Singapura)
  • australia-southeast1 (Sydney)
  • europe-west1 (Bélgica)
  • europe-west2 (Londres)
  • europe-west3 (Frankfurt)
  • northamerica-northeast1 (Montreal)
  • southamerica-east1 (São Paulo)
  • us-west4 (Nevada)

Ativar pesquisa de conteúdo

Você ativa e desativa a pesquisa de conteúdo na página do volume no Explorador de Catálogos.

Para habilitar a pesquisa de conteúdo:

  1. No seu workspace do Databricks, clique em Ícone de dados. Catálogo .
  2. Pesquise ou navegue pelo volume que contém os arquivos que você deseja indexar e selecione-o.
  3. Na tab Visão geral, encontre a seção Pesquisa de conteúdo na barra lateral direita.
  4. Clique em Ativar .

Após ativar a pesquisa de conteúdo, o Databricks realiza uma sincronização inicial para analisar e indexar os arquivos compatíveis no volume. A seção Content search na tab Overview mostra o status de ingestão, o resultado da sincronização mais recente e o período até o qual o volume está indexado.

A pesquisa de conteúdo não analisa e indexa automaticamente as alterações no seu volume, como arquivos recém-adicionados ou edições em arquivos existentes. Para refresh a pesquisa de conteúdo para que ela reflita suas alterações, clique em Sync now na seção Content search . Você precisa de CAN MANAGE no volume para Trigger uma sincronização.

Para desativar a pesquisa de conteúdo, clique em Disable na seção Content search . Desativar a pesquisa de conteúdo exclui o índice gerado e o conteúdo processado. Se você habilitá-lo novamente, o Databricks reindexará o volume do zero e você incorrerá no custo de ingestão novamente.

O Databricks recomenda habilitar a pesquisa de conteúdo para os volumes que você anexar a um Genie Agent. Consulte Analisar arquivos em volumes com um Genie Agent.

Como a pesquisa de conteúdo é cobrada

A pesquisa de conteúdo tem dois componentes de custo:

  • Ingestão : Quando você ativa a pesquisa de conteúdo ou executa uma sincronização, o Databricks usa a função de AI ai_parse_document para analisar os arquivos no volume antes de criar o índice. O Databricks fatura esse processamento sob preços de AI Functions.
  • Query serving : o Lakebase armazena e serve os índices resultantes. O Databricks cobra pelo compute e armazenamento com base nas unidades de compute (CUs) que o Lakebase provisiona. O query serving escala de 2 a 12 CUs com base no tamanho do índice e na concorrência de queries. Após três dias sem tráfego, o endpoint escala para zero e para de incorrer em custos de compute de query-serving. Para taxas atuais, consulte a página de preços do Lakebase.

Quando um Genie Agent faz query a um volume indexado, a query também pode incorrer em custos do Genie Agent. Consulte Como este recurso é cobrado?.

Limitações

As seguintes limitações se aplicam à pesquisa de conteúdo durante a versão Beta:

  • Somente volumes gerenciados pelo Unity Catalog suportam a pesquisa de conteúdo. Volumes externos, volumes de Meus Arquivos e volumes em catálogos com vinculações de workspace não são suportados. Consulte Armazenar arquivos em Meus Arquivos.
  • Você habilita a pesquisa de conteúdo para um volume inteiro. Você não pode indexar um subconjunto das pastas ou arquivos em um volume.
  • Cada workspace pode ter até 100 volumes com a pesquisa de conteúdo habilitada.
  • Cada volume indexado pode conter até 10.000 arquivos.
  • A pesquisa de conteúdo ignora arquivos maiores que 50 MB.
  • A pesquisa de conteúdo é compatível com arquivos PDF, JPG, JPEG, PNG, TIFF, TIF, DOC, DOCX, PPT ou PPTX. Ele ignora todos os outros tipos de arquivo.
  • A pesquisa de conteúdo não está disponível na AWS GovCloud, em regiões do Azure Government ou em workspaces com compliance FedRAMP.

Outros recursos

Consulte os seguintes recursos para obter informações relacionadas: