Utiliser l'extraction d'informations (hérité)
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Cette page couvre l'ancienne version de l'Extraction d’informations. Databricks recommande d'utiliser la dernière version. Voir Extraction d'informations.
Cette page décrit comment créer un agent d'IA générative pour l'extraction d'informations en utilisant l'extraction d'informations.
Qu'est-ce que l'Extraction d’informations ?
L'extraction d'informations prend en charge l'extraction d'informations et simplifie le processus de transformation d'un grand volume de documents textuels non étiquetés en un tableau structuré avec des informations extraites pour chaque document.
Voici des exemples d’extraction d’informations :
- Extraction des prix et des informations de location des contrats.
- Organisation des données à partir des notes des clients.
- Obtenir des détails importants à partir d'articles de presse.
L'extraction d'informations s'appuie sur des capacités d'évaluation automatisées, y compris MLflow et Agent Evaluation, pour permettre une évaluation rapide du compromis coût-qualité pour votre tâche d'extraction spécifique. Cette évaluation vous permet de prendre des décisions éclairées concernant l'équilibre entre la précision et l'investissement en ressources.
L'extraction d'informations utilise le default storage pour stocker les transformations de données temporaires, les points de contrôle de modèle et les métadonnées internes qui alimentent chaque agent. Lors de la suppression de l'agent, toutes les données associées à l'agent sont supprimées du stockage default.
Exigences
-
Un Workspace qui inclut les éléments suivants :
- Compute Serverless disponible (activé par défaut dans les Workspaces avec Unity Catalog).
- Unity Catalog activé. Consultez Activer un workspace pour Unity Catalog.
- Accédez aux modèles de fondation dans Unity Catalog via le schéma
system.ai. - Accès à une politique d'utilisation Serverless avec un budget non nul.
-
Un workspace dans l'une des régions prises en charge.
-
Possibilité d'utiliser la fonction SQL
ai_query. -
Fichiers à partir desquels vous souhaitez extraire des données. Les fichiers doivent se trouver dans un volume ou une table Unity Catalog.
- Si vous souhaitez utiliser des PDF, convertissez-les d'abord en table Unity Catalog. Consultez Utiliser les PDF dans l'extraction d'informations.
- Pour créer votre agent, vous avez besoin d'au moins un document non étiqueté dans votre volume Unity Catalog ou d'une ligne dans votre table.
Créer un agent d'extraction d'informations
Accédez à **Agents** dans le volet de navigation de gauche de votre workspace. À partir de la vignette Extraction d'informations , cliquez sur Construire .
Étape 1 : configurer votre agent
Configurez votre agent :
-
Dans le champ Nom , saisissez un nom pour votre agent.
-
Sélectionnez le type de données que vous souhaitez fournir. Vous pouvez choisir soit dataset non étiqueté soit dataset étiqueté .
-
Sélectionnez le dataset à fournir.
- Unlabeled dataset
- Labeled dataset
Si vous sélectionnez **dataset non étiqueté** :
-
Dans le champ **Emplacement du dataset**, sélectionnez le dossier ou la table que vous souhaitez utiliser à partir de votre volume Unity Catalog. Si vous sélectionnez un dossier, celui-ci doit contenir des documents dans un format de document pris en charge.
Voici un exemple de volume :
/Volumes/main/info-extraction/bbc_articles/ -
Si vous fournissez une table, sélectionnez la colonne contenant vos données textuelles dans la liste déroulante. La colonne de la table doit contenir des données dans un format de données pris en charge.
Si vous souhaitez utiliser des PDF, convertissez-les d'abord en table Unity Catalog. Consultez Utiliser les PDF dans l'extraction d'informations.
-
L'extraction d'informations déduit et génère automatiquement une sortie JSON d'exemple contenant les données extraites de votre dataset dans le champ Sortie JSON d'exemple . Vous pouvez accepter la sortie d'exemple, la modifier ou la remplacer par un exemple de votre sortie JSON souhaitée. L'agent renvoie les informations extraites en utilisant ce format.
Si vous sélectionnez Jeu de données étiqueté :
- Dans le champ Ground truths dataset , sélectionnez la table Unity Catalog contenant vos données de vérité terrain.
- Dans le champ Colonne d'entrée , sélectionnez la colonne contenant le texte que vous souhaitez que l'agent traite. Les données de cette colonne doivent être au format
str. - Dans le champ **Colonne de réponse de vérité terrain**, sélectionnez la colonne contenant les réponses idéales attendues. Les données de cette colonne doivent être une chaîne JSON. Chaque ligne de cette colonne doit respecter le même format JSON. Les lignes contenant des clés supplémentaires ou manquantes ne sont pas acceptables.
- Dans le champ Sortie JSON d'exemple , l'extraction d'informations génère automatiquement une sortie JSON d'exemple en utilisant la première ligne de données de la colonne de réponse de vérité terrain. Vérifiez que cette sortie JSON correspond au format attendu.
-
Vérifiez que le champ Exemple de sortie JSON correspond au format de réponse souhaité. Modifiez au besoin.
Par exemple, la sortie JSON d'exemple suivante pourrait être utilisée pour extraire des informations d'un ensemble d'articles de presse :
JSON{
"title": "Economy Slides to Recession",
"category": "Politics",
"paragraphs": [
{
"summary": "GDP fell by 0.1% in the last three months of 2004.",
"word_count": 38
},
{
"summary": "Consumer spending had been depressed by one-off factors such as the unseasonably mild winter.",
"word_count": 42
}
],
"tags": ["Recession", "Economy", "Consumer Spending"],
"estimate_time_to_read_min": 1,
"published_date": "2005-01-15",
"needs_review": false
} -
Sous Choix du modèle , sélectionnez le meilleur modèle pour votre agent d'extraction d'information :
- Optimiser la montée en charge (default) : choisissez cette option si vous traitez de grands volumes de données ou préférez un agent rentable. Ce modèle est conçu pour un throughput élevé et un délai d'exécution plus rapide, et convient à la plupart des tâches d'extraction d'informations.
- Optimiser la complexité : Choisissez cette option si vous avez besoin d'un raisonnement complexe et que vous privilégiez la précision à la vitesse et au coût. Ce modèle offre des capacités de raisonnement supérieures pour des documents plus longs (tels que les dépôts financiers) et peut gérer des extractions plus complexes (telles que l'extraction de plus de 40 champs de schéma).
-
Cliquez sur Créer un agent .
Formats de document pris en charge
Le tableau suivant présente les types de fichiers de document pris en charge pour vos documents source si vous fournissez un volume Unity Catalog.
Fichiers de code | Fichiers de documents | Fichiers de log |
|---|---|---|
|
|
|
Formats de données pris en charge
L'Extraction d'informations prend en charge les types de données et les schémas suivants pour vos documents source si vous fournissez une table Unity Catalog. L’extraction d’informations peut également extraire ces types de données de chaque document.
strintfloatbooleanenum(utilisé pour les tâches de classification où l'agent ne doit sélectionner que parmi des catégories prédéfinies)- Objet
- Tableaux
enum (adapté aux tâches de classification où nous voulons que l'agent ne produise que des catégories prédéfinies) object (à la place de "champs imbriqués personnalisés") array
Étape 2 : Améliorez votre agent
Dans l'onglet tab , examinez les exemples de sorties pour vous aider à affiner votre définition de schéma et à ajouter des instructions pour de meilleurs résultats.
-
Sur la gauche, examinez les exemples de réponses et fournissez des commentaires pour affiner votre agent. Ces échantillons sont basés sur votre configuration actuelle de l'agent.
- Cliquez sur une ligne pour consulter l’entrée et la réponse complètes.
- En bas, à côté de Cette réponse est-elle correcte ? , donnez votre avis en sélectionnant
Oui ou
Corriger . Pour les retours Corriger , fournissez des détails supplémentaires sur la manière dont l'agent devrait modifier sa réponse, puis cliquez sur
Enregistrer .
- Une fois que vous avez fini d'examiner toutes les réponses, cliquez sur
Oui, mettre à jour l'agent . Ou, vous pouvez cliquer sur Enregistrer les commentaires et mettre à jour après avoir examiné au moins trois réponses.
-
À droite, sous Champs de sortie , affinez les descriptions de vos champs de schéma d'extraction. Ces descriptions sont ce sur quoi l'agent s'appuie pour comprendre ce que vous voulez extraire. Utilisez les exemples de réponses à gauche pour vous aider à affiner la définition du schéma.
- Pour chaque champ, examinez et modifiez la définition du schéma selon les besoins. Utilisez les exemples de réponses sur la gauche pour vous aider à affiner ces descriptions.
- Pour modifier le nom et le type du champ, cliquez sur
Modifier le champ .
- Pour ajouter un nouveau champ, cliquez sur
Ajouter un nouveau champ . Saisissez le nom, le type et la description, et cliquez sur Confirmer .
- Pour supprimer un champ, cliquez sur
Supprimer le champ .
- Cliquez sur Enregistrer et mettre à jour pour mettre à jour la configuration de votre agent.
-
(Facultatif) À droite, sous Instructions , saisissez toutes les instructions globales pour votre agent. Ces instructions s'appliquent à tous les éléments extraits. Cliquez sur Enregistrer et mettre à jour pour appliquer les instructions.
-
De nouvelles réponses d'échantillons sont générées sur le côté gauche. Examinez ces réponses mises à jour et continuez à affiner votre configuration d’agent jusqu’à ce que les réponses soient satisfaisantes.
Étape 3 : Utilisez votre agent
Vous pouvez utiliser votre agent dans des flux de travail au sein de Databricks.
Pour start à utiliser votre agent, cliquez sur **Utiliser**. Vous pouvez choisir d'utiliser votre agent de plusieurs manières :
- Extraire les données de tous les documents : Cliquez sur start extraction pour ouvrir l'éditeur SQL et utilisez
ai_querypour envoyer des requêtes à votre nouvel agent d'extraction d'informations. - Créer un pipeline ETL : Cliquez sur Créer un pipeline pour déployer un pipeline qui s’exécute à intervalles planifiés afin d’utiliser votre agent sur de nouvelles données. Consultez Spark Declarative Pipelines pour plus d'information sur les pipelines.
- Testez votre agent : cliquez sur Ouvrir dans l'AI Playground pour tester votre agent dans un environnement de test afin de voir comment il fonctionne. Consultez Discuter avec des LLM et prototyper des applications d'IA générative à l'aide de l'AI Playground pour en savoir plus sur l'AI Playground.
(Facultatif) Étape 4 : Évaluez votre agent
Pour vous assurer que vous avez créé un agent de haute qualité, exécutez une évaluation et examinez le rapport de qualité qui en résulte.
-
Passer à l'**tab Qualité**.
-
Cliquez sur
Exécuter l'évaluation .
-
Dans le volet Nouvelle évaluation qui s'affiche, configurez l'évaluation :
- Sélectionnez le nom de l'exécution d'évaluation. Vous pouvez choisir d'utiliser un nom généré ou de fournir un nom personnalisé.
- Sélectionnez le dataset d'évaluation. Vous pouvez choisir d’utiliser le même dataset source utilisé pour créer votre agent ou de fournir un dataset d’évaluation personnalisé à l’aide de données étiquetées ou non étiquetées.
-
Cliquez sur start evaluation .
-
Une fois votre exécution d'évaluation terminée, examinez le rapport de qualité :
-
Une vue Synthèse est affichée par default. Passez en revue la qualité globale, le coût, le throughput et le rapport récapitulatif des métriques d'évaluation. Cliquez sur
à côté du champ de schéma pour voir comment ce champ est évalué.

-
Passez à l'affichage Détaillé pour plus de détails. Cet affichage montre chaque requête et le score d'évaluation pour chaque métrique. Cliquez sur une requête pour afficher des détails supplémentaires, tels que l'entrée, la sortie, les évaluations, les traces et les invites liées. Vous pouvez également modifier les évaluations de la requête et fournir des commentaires supplémentaires.

-
Interroger l'endpoint de l'agent
Sur la page de l'agent, cliquez sur Voir l'état de l'agent en haut à droite pour obtenir votre endpoint d'agent déployé et afficher les détails de l'endpoint.
Il existe plusieurs façons d'interroger l'endpoint d'agent créé. Utilisez les exemples de code fournis dans l'AI Playground comme point de départ :
- Sur la page de l'agent, cliquez sur Utiliser .
- Cliquez sur Ouvrir dans Playground .
- Depuis le Terrain de jeux, cliquez sur Obtenir le code .
- Choisissez la façon dont vous souhaitez utiliser l'Endpoint :
- Sélectionnez **Apply on data** pour créer une query SQL qui applique l'agent à une colonne de table spécifique.
- Sélectionnez Curl API pour un exemple de code permettant d'interroger l'Endpoint à l'aide de curl.
- Sélectionnez API Python pour un exemple de code permettant d'interagir avec l'endpoint à l'aide de Python.
Gérer les autorisations
Par default, seuls les auteurs d'agents et les administrateurs de Workspace disposent des autorisations pour l'agent. Pour permettre à d'autres utilisateurs de modifier ou de query votre agent, vous devez leur accorder explicitement l'autorisation.
Pour gérer les autorisations de votre agent :
-
Ouvrez votre agent sur la page Agents .
-
En haut, cliquez sur le
menu kebab.
-
Cliquez sur Gérer les autorisations .
-
Dans la fenêtre Permission Settings , sélectionnez l’utilisateur, le groupe ou le Service Principal.
-
Sélectionnez l'autorisation à accorder :
- Peut gérer : permet de gérer l’agent, y compris la définition des autorisations, la modification de la configuration de l’agent et l’amélioration de sa qualité.
- Peut query : Permet d'interroger l'Endpoint de l'agent dans AI Playground et via l'API. Les utilisateurs disposant uniquement de cette autorisation ne peuvent ni afficher ni modifier l'agent sur la page Agents.
-
Cliquez sur **Ajouter**.
-
Cliquez sur Enregistrer .
Pour les endpoints d’agent créés **avant le 16 septembre 2025**, vous pouvez accorder les autorisations **Peut interroger** à l’endpoint depuis la page **Endpoints de service**.
Utiliser des PDF dans l’extraction d’informations
Les PDF ne sont pas encore pris en charge en mode natif dans l'extraction d'informations et les LLM personnalisés. Cependant, vous pouvez utiliser le workflow de l'interface utilisateur pour convertir un dossier de fichiers PDF en markdown, puis utiliser la table Unity Catalog résultante comme entrée lors de la création de votre agent. Ce workflow utilise ai_parse_document pour la conversion. Suivez ces étapes :
-
Cliquez sur Agents dans le volet de navigation de gauche.
-
Dans les cas d'utilisation d'extraction d'informations ou de LLM personnalisés, cliquez sur Utiliser les PDF .
-
Dans le panneau latéral qui s'ouvre, entrez les champs suivants pour créer un nouveau workflow afin de convertir vos PDF :
- Sélectionner un dossier avec des PDF ou des images : sélectionnez le dossier Unity Catalog contenant les PDF que vous souhaitez utiliser.
- Sélectionner la table de destination : Sélectionnez le schéma de destination pour la table markdown convertie et, en option, ajustez le nom de la table dans le champ ci-dessous.
- Sélectionner un SQL Warehouse actif : sélectionnez le SQL Warehouse pour exécuter le workflow.

-
Cliquez sur Start import .
-
Vous serez redirigé vers le tab Tous les workflows , qui répertorie tous vos workflows PDF. Utilisez ce tab pour surveiller l'état de vos jobs.

Si votre workflow échoue, cliquez sur le nom du Job pour l'ouvrir et consulter les messages d'erreur afin de vous aider à déboguer.
-
Lorsque votre workflow est terminé, cliquez sur le nom du Job pour ouvrir la table dans Catalog Explorer afin d'explorer et de comprendre les colonnes.
-
Utilisez la table Unity Catalog comme données d'entrée lors de la configuration de votre agent.
Limitations
- Les agents d'extraction d'informations ont une longueur de contexte maximale de 128 k tokens.
- Les Workspaces pour lesquels la sécurité et la conformité améliorées sont activées ne sont pas pris en charge.
- Les types de schéma Union ne sont pas pris en charge.