Aller au contenu principal

Extraction d'informations

remarque

Cette page présente la nouvelle version de l'extraction d’informations. Pour plus d'informations sur la version précédente, consultez Utiliser l’extraction d’informations (hérité)

L'extraction d'informations transforme les documents et textes non structurés en insights structurés clés à l'aide d'un schéma défini. Cela vous permet d'utiliser les informations intégrées dans des textes non structurés, des PDF, des images ou des tableaux directement pour l'analyse, le reporting ou les agents et applications en aval.

Exemples d'extraction d'informations :

  • Extraction des parties contractantes et des termes des contrats.
  • Extraction des postes et conditions de paiement des factures.
  • Extraction des détails clés des dossiers médicaux et des notes.

L’extraction d’informations est basée sur la fonction d’IA ai_extract. L’extraction d’informations dispose d’une interface visuelle pour personnaliser et optimiser la fonction avec un schéma défini pour l’extraction.

L'extraction d'informations utilise le default storage pour stocker les transformations de données temporaires, les points de contrôle de modèle et les métadonnées internes qui alimentent chaque agent. Lorsque vous supprimez un agent, Databricks supprime toutes les données associées à l'agent du stockage default.

Exigences

Créer un agent d'extraction d'informations

Accédez à Icône des agents. **Agents** dans le volet de navigation de gauche de votre workspace. Cliquez sur Créer un agent > Extraction d'informations .

Étape 1. Sélectionnez les données dont vous souhaitez extraire les informations.

  1. Sur la page Start avec vos données , sélectionnez les fichiers ou les données dont vous souhaitez extraire des informations. Vous pouvez effectuer l'une des actions suivantes :

    • Faites glisser et déposez un ou plusieurs fichiers dans la zone d'upload, ou cliquez pour parcourir les fichiers à upload.
    • Cliquez sur Sélectionner un volume pour sélectionner un volume Unity Catalog avec les types de fichiers pris en charge.
    • Cliquez sur Sélectionner la table pour sélectionner une table Unity Catalog qui contient des données textuelles.
  2. Si vous sélectionnez une table, sélectionnez la colonne qui contient les données à extraire. Vous devez sélectionner une colonne avec un type pris en charge, tel que STRING ou VARIANT, avant de pouvoir continuer. Si la table n'a pas de colonnes prises en charge, sélectionnez une autre table.

  3. Cliquez sur Créer l’agent . Ce bouton n'est activé qu'après que vous avez sélectionné une source de données valide et, pour une table, une colonne prise en charge.

Étape 2. Configurez et affinez votre schéma d'extraction

Une fois que l'Extraction d'information a traité vos données, configurez et affinez les données que vous souhaitez extraire de vos documents.

La vue de compilation AI Extract avec le panneau de configuration du schéma d'extraction, le document analysé et la sortie JSON extraite.

  1. Sous Configuration, définissez votre schéma d'extraction. Il existe plusieurs façons de procéder :

    • Saisissez un langage naturel qui décrit les informations que vous souhaitez extraire et cliquez sur **Générer le schéma**. L'extraction d'informations génère automatiquement un schéma JSON avec des noms et des définitions de champs pour vous. Modifiez ces descriptions selon les besoins.

    • Sinon, cliquez sur Or, Define manually pour définir manuellement votre schéma :

      1. Cliquez sur **Ajouter un champ**.
      2. Saisissez le nom, le type et la description de votre champ.
      3. Cliquez sur Confirmer .
      4. Répétez pour chaque champ que vous souhaitez extraire.
      5. Cliquez sur **Enregistrer et exécuter l’extraction**.
    • Vous pouvez également cliquer sur JSON pour modifier directement le schéma JSON. Cliquez sur **Appliquer les modifications** une fois terminé.

    Chaque fois que vous mettez à jour votre schéma et cliquez sur Enregistrer et exécuter l'extraction , l'extraction d'informations met à jour l'agent d'extraction, exécute l'extraction et affiche les résultats pour chaque entrée.

  2. À gauche, examinez le document analysé et l'extraction de l'agent. Itérez les résultats d'extraction de deux manières. Premièrement, fournissez des commentaires en langage naturel sur une ou plusieurs entrées, ce qui ajuste automatiquement vos descriptions lorsque vous appuyez sur Enregistrer et exécuter l’extraction . Deuxièmement, révisez manuellement les descriptions de schémas, qui prennent effet lorsque vous appuyez sur Enregistrer et exécuter l’extraction .

  3. Utilisez les versions pour comparer ou revenir à une configuration précédente. Cliquez sur Versions , puis sur Comparer pour comparer la définition du schéma d'une version précédente avec la version actuelle. Cliquez sur Restaurer pour restaurer une version précédente.

Étape 3. Évaluer et améliorer la qualité d'extraction

Pour mesurer les performances de votre agent et l'améliorer systématiquement, évaluez l'agent à l'aide d'un dataset étiqueté. Une évaluation note chaque extraction par rapport à une réponse correcte connue (vérité terrain), afin que vous puissiez suivre la précision au niveau des champs à travers les versions et cibler les champs qui nécessitent un travail.

Ajouter un dataset d'évaluation

Avant d'exécuter une évaluation, vous devez disposer d'un dataset d'évaluation dans Unity Catalog. Le dataset doit être une table Unity Catalog avec deux colonnes :

  • Une colonne d'entrée avec le texte ou le document à extraire. Il peut s'agir de texte STRING ou de la sortie VARIANT de ai_parse_document.
  • Une **colonne de vérité terrain** avec le résultat d'extraction attendu sous forme de chaîne JSON. Chaque valeur doit être conforme au schéma d'extraction de votre agent, correspondant au ai_extract schéma avancé.

Exécuter une évaluation

Pour exécuter une évaluation pour votre agent d’extraction :

  1. Dans l'environnement de travail, ouvrez le menu déroulant d'évaluation et cliquez sur Run evaluation . Cela ouvre la boîte de dialogue Create evaluation run .
  2. Dans Tableau de jeux de données d’évaluation , sélectionnez la table Unity Catalog qui contient vos exemples étiquetés.
  3. Sous **Mappage des colonnes**, sélectionnez la **colonne d'entrée** qui contient l'entrée de l'agent et la **colonne de vérité terrain** qui contient la réponse attendue.
  4. Cliquez sur Exécuter l'évaluation . L'extraction d'informations enregistre la configuration actuelle comme une nouvelle version et évalue chaque ligne par rapport à sa vérité terrain.

Examinez les résultats de l'évaluation

À mesure que l'exécution progresse, les documents stream dans la Documents tab et tous les champs non concordants sont affichés par document. Lorsque l'exécution est terminée, l'extraction d'informations affiche la tab Vue d'ensemble, qui comprend :

  • Un tableau de bord avec la **précision globale du champ** et les **documents entièrement corrects**. Si une exécution d'évaluation précédente existe, le tableau de bord affiche le changement par rapport à cette exécution.
  • Une table de Scores par champ . Cliquez sur n'importe quel champ pour ouvrir son exploration, qui affiche l'exactitude, la précision, le rappel et le F1. Cliquez sur Afficher les documents ayant échoué pour voir chaque document qui n'a pas pu extraire ce champ, ainsi que leur sortie extraite.

Tab Vue d'ensemble de l'évaluation affichant le tableau de bord de précision global des champs et la table des scores par champ.

Passez à l'onglet **tab** pour inspecter les documents individuels. Chaque ligne indique le rapport des champs correspondants et les champs non correspondants. Utilisez le menu déroulant **Champs** pour filtrer les documents qui comportaient un champ mal assorti spécifique. Cliquez sur un document pour comparer côte à côte la réponse de l'agent et la vérité terrain.

Raffinez votre schéma, puis cliquez à nouveau sur Exécuter l'évaluation pour voir comment vos modifications ont affecté les scores.

Étape 4. Utilisez votre agent d'extraction

Une fois satisfait des performances de l'agent, utilisez l'agent pour extraire des informations.

Cliquez sur Utiliser l'Agent en haut à droite. Vous pouvez sélectionner l'une des options suivantes :

  • Exécuter dans SQL pour utiliser l'agent afin d'extraire des informations de toutes vos données. Cela ouvre une query SQL qui utilise ai_extract pour extraire des informations de votre volume ou de votre table en utilisant le schéma défini. Pour plus d'informations sur l'utilisation de ai_extract dans les queries SQL, consultez la fonctionai_extract.
  • Create a LakeFlow pipeline qui s’exécute à intervalles planifiés pour appeler votre agent sur de nouvelles données. Ceci crée un Lakeflow pipeline qui met à jour une table de streaming avec vos données extraites. Vous pouvez configurer le calendrier du pipeline pour s'exécuter à l'arrivée de nouvelles données. Pour plus d'information sur les LakeFlow Pipelines, consultez Spark Declarative Pipelines.

Limitations

  • Voir les limitations

  • Les agents d'extraction d'informations ont une longueur de contexte maximale de 128 k tokens.

  • Les types de schéma Union ne sont pas pris en charge.