Extração de Informações
Esta página aborda a nova versão da Extração de Informações. Para obter informação sobre a versão anterior, consulte Use a Extração de Informações (legado)
A Extração de Informação transforma documentos e textos não estruturados em informações-key e percepções estruturadas, usando um esquema definido. Isso permite o uso de informações incorporadas em textos não estruturados, PDFs, imagens ou tabelas, diretamente para análise, relatórios ou agentes e aplicativos subsequentes.
Exemplos de Extração de Informações incluem:
- Extraindo partes legais e termos de contratos.
- Extraindo itens de linha e termos de pagamento de faturas.
- Extraindo detalhes chave de prontuários e anotações médicas.
A Extração de informações é construída sobre a função de AI ai_extract. A Extração de informações tem uma interface de usuário visual para personalizar e otimizar a função com um esquema definido para extração.
Extração de Informação usa armazenamento default para armazenar transformações de dados temporários, pontos de verificação de modelo e metadados internos que alimentam cada agente. Quando um agente é excluído, o Databricks remove todos os dados associados ao agente do armazenamento default.
Requisitos
Criar um agente de Extração de Informações
Vá para Agentes no painel de navegação esquerdo do seu workspace. Clique em Criar agente > Extração de informações .
O passo 1. Selecione os dados para extrair informações
-
Na página Comece com seus dados , selecione os arquivos ou dados dos quais você deseja extrair informações. Você pode fazer qualquer um dos seguintes:
- Arraste e solte um ou mais arquivos na área de upload ou clique para procurar arquivos para fazer upload.
- Clique em Selecionar volume para selecionar um volume do Unity Catalog com tipos de arquivo compatíveis.
- Clique em Selecionar tabela para selecionar uma tabela do Unity Catalog que contém dados de texto.
-
Se você selecionar uma tabela, selecione a coluna que contém os dados a serem extraídos. É necessário selecionar uma coluna com um tipo compatível, como STRING ou VARIANT, antes de prosseguir. Se a tabela não tiver colunas suportadas, selecione uma tabela diferente.
-
Clique em Criar Agente . Este botão é ativado somente depois de selecionar uma fonte de dados válida e, para uma tabela, uma coluna suportada.
O passo 2. Configure e refine seu esquema de extração
Depois que a Extração de Informação processar seus dados, configure e refine quais dados deseja extrair de seus documentos.

-
Em Configuração, defina seu esquema de extração. Existem várias maneiras de fazer isso:
-
Insira linguagem natural que descreva as informações que você deseja extrair e clique em Gerar Esquema . A Extração de Informações gera automaticamente um esquema JSON com nomes de campos e definições para você. Edite essas descrições conforme necessário.
-
Alternativamente, clique em Ou, defina manualmente para definir o seu esquema manualmente:
- Clique em Adicionar campo .
- Insira o nome, o tipo e a descrição do campo.
- Clique em Confirmar .
- Repita para cada campo que deseja extrair.
- Clique em Salvar e Executar extração .
-
Você também pode clicar em JSON para editar o esquema JSON diretamente. Clique em Aplicar alterações quando concluir.
Cada vez que você atualiza seu esquema e clica em Salvar e execução de extração , a Extração de informação atualiza o agente de extração, executa a extração e mostra os resultados para cada entrada.
-
-
À esquerda, examine o documento analisado e a extração do agente. Itere os resultados da extração de duas maneiras. Primeiro, forneça feedback em linguagem natural sobre uma ou mais entradas, o que ajusta automaticamente suas descrições ao pressionar Salvar e execução de extração . Segundo, revise manualmente as descrições do esquema, que entram em vigor ao pressionar Salvar e execução de extração .
-
Utilize as versões para comparar ou reverter para uma configuração anterior. Clique em Versões e, em seguida, clique em Comparar para comparar a definição de esquema de uma versão anterior com a versão atual. Clique em Restaurar para restaurar uma versão anterior.
O passo 3. Avaliar e melhorar a qualidade da extração
Para medir o desempenho do seu agente e aprimorá-lo sistematicamente, avalie o agente em relação a um dataset rotulado. Uma avaliação pontua cada extração em relação a uma resposta correta conhecida (ground truth), para que seja possível rastrear a precisão no nível do campo em diferentes versões e direcionar os campos que precisam de atenção.
Adicionar um dataset de avaliação
Antes de executar uma avaliação, é necessário ter um dataset de avaliação no Unity Catalog. O dataset deve ser uma tabela do Unity Catalog com duas colunas:
- Uma coluna de entrada com o texto ou documento para extrair. Isso pode ser
STRINGtexto ou a saídaVARIANTdeai_parse_document. - Uma **coluna da verdade fundamental** com o resultado de extração esperado como uma string JSON. Cada valor deve estar em conformidade com o esquema de extração do seu agente, correspondendo ao
ai_extractesquema avançado.
Executar uma avaliação
Para executar uma avaliação para seu agente de extração:
- No workbench, abra o dropdown de avaliação e clique em Execução da avaliação . Isso abre a caixa de diálogo Criar execução de avaliação .
- Na **tabela de dataset de avaliação**, selecione a tabela do Unity Catalog que contém seus exemplos rotulados.
- Em Mapeamento de colunas , selecione a coluna de Entrada que contém a entrada do agente e a coluna de verdade comprovada que contém a resposta esperada.
- Clique em **Executar avaliação**. A Extração de Informações salva a configuração atual como uma nova versão e pontua cada linha em relação à sua verdade fundamental.
Revisar os resultados da avaliação
Conforme a execução avança, os documentos são transmitidos para a tab **Documentos** e quaisquer campos incompatíveis são exibidos por documento. Quando a execução termina, a Extração de Informações exibe a tab **Visão Geral**, que inclui:
- Um scorecard com Precisão geral do campo e Documentos totalmente corretos . Se existir uma execução de avaliação anterior, o scorecard mostrará a alteração dessa execução.
- Uma tabela de **Pontuações por campo**. Clique em qualquer campo para abrir sua análise detalhada, que mostra precisão, exatidão, revocação e F1. Clique em **Mostrar documentos com falha** para ver cada documento que falhou ao extrair esse campo e sua saída extraída.

Mude para a **tab Documentos** para inspecionar documentos individuais. Cada linha exibe a proporção de campos correspondentes e os campos incompatíveis. Use o **dropdown Campos** para filtrar documentos que continham um campo incompatível específico. Clique em um documento para comparar a resposta do agente com a verdade fundamental lado a lado.
Itere refinando seu esquema, em seguida, clique em **Executar avaliação** novamente para ver como suas alterações afetaram as pontuações.
O passo 4. Use seu agente de extração.
Depois de estar satisfeito com o desempenho do agente, use-o para extrair informações.
Clique em Usar Agente no canto superior direito. Você pode selecionar uma das opções a seguir:
- Execução em SQL para usar o agente para extrair informação de todos os seus dados. Isso abre uma consulta SQL que usa
ai_extractpara extrair informações do seu volume ou tabela usando o esquema definido. Para obter mais informações sobre como usarai_extractem consultas SQL, consulte a funçãoai_extract. - Crie um Lakeflow pipeline que é executado em intervalos programados para invocar seu agente com novos dados. Isso cria um Lakeflow pipeline que atualiza uma tabela de transmissão com seus dados de extração. É possível configurar o programar do pipeline para execução quando novos dados chegarem. Para obter mais informações sobre LakeFlow Pipelines, consulte Spark Declarative Pipelines.
Limitações
- Consulte Limitações