Extração de Informações
Esta página aborda a nova versão da Extração de Informações. Para obter informação sobre a versão anterior, consulte Use a Extração de Informações (legado)
A Extração de Informação transforma documentos e textos não estruturados em informações-key e percepções estruturadas, usando um esquema definido. Isso permite o uso de informações incorporadas em textos não estruturados, PDFs, imagens ou tabelas, diretamente para análise, relatórios ou agentes e aplicativos subsequentes.
Exemplos de Extração de Informações incluem:
- Extraindo partes legais e termos de contratos.
- Extraindo itens de linha e termos de pagamento de faturas.
- Extraindo detalhes chave de prontuários e anotações médicas.
A Extração de informações é construída sobre a função de AI ai_extract. A Extração de informações tem uma interface de usuário visual para personalizar e otimizar a função com um esquema definido para extração.
Extração de Informação usa armazenamento default para armazenar transformações de dados temporários, pontos de verificação de modelo e metadados internos que alimentam cada agente. Quando um agente é excluído, o Databricks remove todos os dados associados ao agente do armazenamento default.
Requisitos
-
Um workspace que inclui o seguinte:
- Compute serverless ativado. Consulte requisitos do compute serverless.
- Unity Catalog ativado. Consulte Ativar um workspace para o Unity Catalog.
- Acesso a uma política de uso serverless com um orçamento diferente de zero.
-
Essa função está disponível apenas em algumas regiões, consulte disponibilidade da função de AI.
-
Para workspaces com o complemento Segurança e Compliance Aprimoradas,
- Consulte o suporte regional para
ai_extractpara o padrão de compliance apropriado. - Consulte Gerenciar prévias do Databricks para saber como habilitá-lo em seu workspace.
- Consulte o suporte regional para
-
Capacidade de usar a função SQL
ai_extract. -
Dados não estruturados dos quais você deseja extrair informações. Os dados devem estar em um volume ou tabela do Unity Catalog.
- Para criar seu agente, você deve ter pelo menos 1 arquivo em seu volume do Unity Catalog ou 1 linha em sua tabela.
Criar um agente de Extração de Informações
Vá para Agentes no painel de navegação esquerdo do seu workspace. Clique em Criar agente > Extração de informações .
O passo 1. Selecione os dados para extrair informações
-
Na página Comece com seus dados , selecione os arquivos ou dados dos quais você deseja extrair informações. Você pode fazer qualquer um dos seguintes:
- Arraste e solte um ou mais arquivos na área de upload ou clique para procurar arquivos para fazer upload.
- Clique em Selecionar volume para selecionar um volume do Unity Catalog com tipos de arquivo compatíveis.
- Clique em Selecionar tabela para selecionar uma tabela do Unity Catalog que contém dados de texto.
-
Se você selecionar uma tabela, selecione a coluna que contém os dados a serem extraídos. É necessário selecionar uma coluna com um tipo compatível, como STRING ou VARIANT, antes de prosseguir. Se a tabela não tiver colunas suportadas, selecione uma tabela diferente.
-
Clique em Criar Agente . Este botão é ativado somente depois de selecionar uma fonte de dados válida e, para uma tabela, uma coluna suportada.
O passo 2. Configure e refine seu esquema de extração
Depois que a Extração de Informação processar seus dados, configure e refine quais dados deseja extrair de seus documentos.

-
Em Configuração, defina seu esquema de extração. Existem várias maneiras de fazer isso:
-
Insira linguagem natural que descreva as informações que você deseja extrair e clique em Gerar Esquema . A Extração de Informações gera automaticamente um esquema JSON com nomes de campos e definições para você. Edite essas descrições conforme necessário.
-
Alternativamente, clique em Ou, defina manualmente para definir o seu esquema manualmente:
- Clique em Adicionar campo .
- Insira o nome, o tipo e a descrição do campo.
- Clique em Confirmar .
- Repita para cada campo que deseja extrair.
- Clique em Salvar e Executar extração .
-
Você também pode clicar em JSON para editar o esquema JSON diretamente. Clique em Aplicar alterações quando concluir.
Cada vez que você atualiza seu esquema e clica em Salvar e execução de extração , a Extração de informação atualiza o agente de extração, executa a extração e mostra os resultados para cada entrada.
-
-
À esquerda, examine o documento analisado e a extração do agente. Itere os resultados da extração de duas maneiras. Primeiro, forneça feedback em linguagem natural sobre uma ou mais entradas, o que ajusta automaticamente suas descrições ao pressionar Salvar e execução de extração . Segundo, revise manualmente as descrições do esquema, que entram em vigor ao pressionar Salvar e execução de extração .
-
Utilize as versões para comparar ou reverter para uma configuração anterior. Clique em Versões e, em seguida, clique em Comparar para comparar a definição de esquema de uma versão anterior com a versão atual. Clique em Restaurar para restaurar uma versão anterior.
O passo 3. Avaliar e melhorar a qualidade da extração
Para medir o desempenho do seu agente e aprimorá-lo sistematicamente, avalie o agente em relação a um dataset rotulado. Uma avaliação pontua cada extração em relação a uma resposta correta conhecida (ground truth), para que seja possível rastrear a precisão no nível do campo em diferentes versões e direcionar os campos que precisam de atenção.
Adicionar um dataset de avaliação
Antes de executar uma avaliação, é necessário ter um dataset de avaliação no Unity Catalog. O dataset deve ser uma tabela do Unity Catalog com duas colunas:
- Uma coluna de entrada com o texto ou documento para extrair. Isso pode ser
STRINGtexto ou a saídaVARIANTdeai_parse_document. - Uma **coluna da verdade fundamental** com o resultado de extração esperado como uma string JSON. Cada valor deve estar em conformidade com o esquema de extração do seu agente, correspondendo ao
ai_extractesquema avançado.
Executar uma avaliação
Para executar uma avaliação para seu agente de extração:
- No workbench, abra o dropdown de avaliação e clique em Execução da avaliação . Isso abre a caixa de diálogo Criar execução de avaliação .
- Na **tabela de dataset de avaliação**, selecione a tabela do Unity Catalog que contém seus exemplos rotulados.
- Em Mapeamento de colunas , selecione a coluna de Entrada que contém a entrada do agente e a coluna de verdade comprovada que contém a resposta esperada.
- Clique em **Executar avaliação**. A Extração de Informações salva a configuração atual como uma nova versão e pontua cada linha em relação à sua verdade fundamental.
Revisar os resultados da avaliação
Conforme a execução avança, os documentos são transmitidos para a tab **Documentos** e quaisquer campos incompatíveis são exibidos por documento. Quando a execução termina, a Extração de Informações exibe a tab **Visão Geral**, que inclui:
- Um scorecard com Precisão geral do campo e Documentos totalmente corretos . Se existir uma execução de avaliação anterior, o scorecard mostrará a alteração dessa execução.
- Uma tabela de **Pontuações por campo**. Clique em qualquer campo para abrir sua análise detalhada, que mostra precisão, exatidão, revocação e F1. Clique em **Mostrar documentos com falha** para ver cada documento que falhou ao extrair esse campo e sua saída extraída.

Mude para a **tab Documentos** para inspecionar documentos individuais. Cada linha exibe a proporção de campos correspondentes e os campos incompatíveis. Use o **dropdown Campos** para filtrar documentos que continham um campo incompatível específico. Clique em um documento para comparar a resposta do agente com a verdade fundamental lado a lado.
Itere refinando seu esquema, em seguida, clique em **Executar avaliação** novamente para ver como suas alterações afetaram as pontuações.
O passo 4. Use seu agente de extração.
Depois de estar satisfeito com o desempenho do agente, use-o para extrair informações.
Clique em Usar Agente no canto superior direito. Você pode selecionar uma das opções a seguir:
- Execução em SQL para usar o agente para extrair informação de todos os seus dados. Isso abre uma consulta SQL que usa
ai_extractpara extrair informações do seu volume ou tabela usando o esquema definido. Para obter mais informações sobre como usarai_extractem consultas SQL, consulte a funçãoai_extract. - Crie um Lakeflow pipeline que é executado em intervalos programados para invocar seu agente com novos dados. Isso cria um Lakeflow pipeline que atualiza uma tabela de transmissão com seus dados de extração. É possível configurar o programar do pipeline para execução quando novos dados chegarem. Para obter mais informações sobre LakeFlow Pipelines, consulte Spark Declarative Pipelines.
Limitações
-
Consulte Limitações
-
Agentes de extração de informações têm um comprimento máximo de contexto de 128 mil tokens.
-
Tipos de esquema de união não são suportados.