Pesquisa de conteúdo para volumes do Unity Catalog
A pesquisa de conteúdo prepara e indexa os documentos em um volume do Unity Catalog. As pesquisas e as perguntas dos agentes são então executadas no índice, para que os usuários e agentes recuperem as informações mais relevantes de forma mais rápida e precisa. Como o índice cobre o conteúdo dentro de cada arquivo, um agente pode utilizar passagens específicas em muitos arquivos em vez de recuperar um punhado de arquivos inteiros.
A pesquisa de conteúdo é especialmente útil para volumes anexados a um Genie Agent. Consulte Analisar arquivos em volumes com um Genie Agent.
Beta
Esse recurso está em Beta. Para usá-lo, um administrador do workspace deve ativar Analisar arquivos em volumes com Genie Agents na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.
Requisitos
Antes de habilitar a pesquisa de conteúdo para um volume do Unity Catalog, confirme se você atende aos seguintes requisitos:
- Lakebase,
ai_parse_documente APIs do Foundation Model estão disponíveis em sua região. - Um administrador do workspace ativou Analisar arquivos em volumes com Genie Agents na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.
- Você tem
CAN MANAGEno volume. Os usuários que fazem query no volume precisam deREAD VOLUME. Consulte Privilégios para volumes do Unity Catalog.
Disponibilidade regional
A pesquisa de conteúdo está disponível nas regiões listadas nesta seção. Ele não está disponível em regiões que não estão listadas. Em algumas regiões, ele é executado apenas se um account admin habilitar o processamento cross-Geo, o que permite que o Databricks processe seus arquivos fora do Geo do seu workspace. Consulte Habilitar processamento cross-Geo.
Regiões que não exigem processamento cross-Geo
A pesquisa de conteúdo é executada na região do seu workspace para as seguintes regiões:
- Ásia-Pacífico (Sydney)
- América do Sul (São Paulo)
- Leste dos EUA (Virgínia do Norte)
- Leste dos EUA (Ohio)
- Oeste dos EUA (Oregon)
Regiões que exigem processamento cross-Geo
Para as regiões a seguir, um administrador de conta deve ativar o processamento cross-Geo antes que você possa ativar a pesquisa de conteúdo:
- Ásia-Pacífico (Jacarta)
- Ásia-Pacífico (Mumbai)
- Ásia-Pacífico (Seul)
- Ásia-Pacífico (Singapura)
- Ásia-Pacífico (Tóquio)
- Canadá (Central)
- UE (Frankfurt)
- UE (Irlanda)
- UE (Londres)
- UE (Paris)
Ativar pesquisa de conteúdo
Você ativa e desativa a pesquisa de conteúdo na página do volume no Explorador de Catálogos.
Para habilitar a pesquisa de conteúdo:
- No seu workspace do Databricks, clique em
Catálogo .
- Pesquise ou navegue pelo volume que contém os arquivos que você deseja indexar e selecione-o.
- Na tab Visão geral, encontre a seção Pesquisa de conteúdo na barra lateral direita.
- Clique em Ativar .
Após ativar a pesquisa de conteúdo, o Databricks realiza uma sincronização inicial para analisar e indexar os arquivos compatíveis no volume. A seção Content search na tab Overview mostra o status de ingestão, o resultado da sincronização mais recente e o período até o qual o volume está indexado.
A pesquisa de conteúdo não analisa e indexa automaticamente as alterações no seu volume, como arquivos recém-adicionados ou edições em arquivos existentes. Para refresh a pesquisa de conteúdo para que ela reflita suas alterações, clique em Sync now na seção Content search . Você precisa de CAN MANAGE no volume para Trigger uma sincronização.
Para desativar a pesquisa de conteúdo, clique em Disable na seção Content search . Desativar a pesquisa de conteúdo exclui o índice gerado e o conteúdo processado. Se você habilitá-lo novamente, o Databricks reindexará o volume do zero e você incorrerá no custo de ingestão novamente.
O Databricks recomenda habilitar a pesquisa de conteúdo para os volumes que você anexar a um Genie Agent. Consulte Analisar arquivos em volumes com um Genie Agent.
Como a pesquisa de conteúdo é cobrada
A pesquisa de conteúdo tem dois componentes de custo:
- Ingestão : Quando você ativa a pesquisa de conteúdo ou executa uma sincronização, o Databricks usa a função de AI
ai_parse_documentpara analisar os arquivos no volume antes de criar o índice. O Databricks fatura esse processamento sob preços de AI Functions. - Query serving : o Lakebase armazena e serve os índices resultantes. O Databricks cobra pelo compute e armazenamento com base nas unidades de compute (CUs) que o Lakebase provisiona. O query serving escala de 2 a 12 CUs com base no tamanho do índice e na concorrência de queries. Após três dias sem tráfego, o endpoint escala para zero e para de incorrer em custos de compute de query-serving. Para taxas atuais, consulte a página de preços do Lakebase.
Quando um Genie Agent faz query a um volume indexado, a query também pode incorrer em custos do Genie Agent. Consulte Como este recurso é cobrado?.
Limitações
As seguintes limitações se aplicam à pesquisa de conteúdo durante a versão Beta:
- Somente volumes gerenciados pelo Unity Catalog suportam a pesquisa de conteúdo. Volumes externos, volumes de Meus Arquivos e volumes em catálogos com vinculações de workspace não são suportados. Consulte Armazenar arquivos em Meus Arquivos.
- Você habilita a pesquisa de conteúdo para um volume inteiro. Você não pode indexar um subconjunto das pastas ou arquivos em um volume.
- Cada workspace pode ter até 100 volumes com a pesquisa de conteúdo habilitada.
- Cada volume indexado pode conter até 10.000 arquivos.
- A pesquisa de conteúdo ignora arquivos maiores que 50 MB.
- A pesquisa de conteúdo é compatível com arquivos PDF, JPG, JPEG, PNG, TIFF, TIF, DOC, DOCX, PPT ou PPTX. Ele ignora todos os outros tipos de arquivo.
- A pesquisa de conteúdo não está disponível na AWS GovCloud, em regiões do Azure Government ou em workspaces com compliance FedRAMP.
Outros recursos
Consulte os seguintes recursos para obter informações relacionadas: