Aller au contenu principal

Traitement intelligent des documents

Le Traitement Intelligent de Documents (IDP) convertit le contenu non structuré — tel que les fichiers PDF, DOCX, images et présentations — en données structurées et enrichies qui alimentent les agents en aval, les applications et l'analytique.

Databricks vous propose deux manières d'exécuter l'IDP, toutes deux basées sur les mêmes AI Functions développées par la recherche :

  • Interface utilisateur Agent Bricks : une expérience visuelle sans code pour analyser, extraire et classer des documents. Utilisez-le pour tester des exemples de documents, affiner un schéma ou des étiquettes, et valider visuellement les résultats avant de monter en charge.
  • AI Functions SQL : exécutez des fonctions de traitement intelligent de documents directement sur le Lakehouse. Utilisez-les pour traiter des documents à grande échelle, composer des étapes ensemble et créer des pipelines gouvernés de qualité production dans les Lakeflow pipelines.

Capacités de traitement intelligent des documents

Compétence

Interface utilisateur Agent Bricks

Fonction SQL

Convertir les fichiers PDF, DOCX, images et PPT en texte structuré, tableaux et descriptions de figures.

Analyse des documents

ai_parse_document

Extrayez des champs structurés de documents ou de texte brut à l'aide d'un schéma que vous définissez.

Extraction d’informations

ai_extract

Attribuer des catégories prédéfinies à des documents ou à du texte, prenant en charge plus de 500 étiquettes.

Classification

ai_classify

Transformez les documents analysés en segments sémantiques prêts pour la génération augmentée de récupération (RAG) et l'indexation AI Search.

ai_prep_search (bêta)

Compétence

Interface utilisateur Agent Bricks

Fonction SQL

Convertir les fichiers PDF, DOCX, images et PPT en texte structuré, tableaux et descriptions de figures.

Analyse des documents

ai_parse_document

Extrayez des champs structurés de documents ou de texte brut à l'aide d'un schéma que vous définissez.

Extraction d’informations

ai_extract

Attribuer des catégories prédéfinies à des documents ou à du texte, prenant en charge plus de 500 étiquettes.

Classification

ai_classify

Transformez les documents analysés en segments sémantiques prêts pour la génération augmentée de récupération (RAG) et l'indexation AI Search.

ai_prep_search (bêta)

Cas d'utilisation courants

IDP sur Databricks gère un large éventail d'applications en aval :

  • Génération augmentée de récupération (RAG) : analysez et structurez les documents pour améliorer le découpage, la qualité de la récupération et l'ancrage pour les applications LLM.
  • Extraction des connaissances et analytique : Extrayez les champs clés et les métadonnées pour permettre la recherche, le reporting et la Business Intelligence sur les données de documents.
  • Flux de travail pilotés par des agents : acheminer, classer et enrichir les documents pour prendre en charge la prise de décision automatisée et l'exécution des tâches.
  • Compréhension et classification de documents : Organisez de vastes corpus de documents par type, sujet ou contenu pour un traitement en aval.

Comment cela fonctionne

Databricks permet le traitement intelligent des documents en tant que workflow unifié de bout en bout sur le Lakehouse. L'ingestion, l'analyse syntaxique, l'enrichissement et l'analyse en aval sont construits sur une plateforme unique, de sorte que chaque étape fonctionne en toute transparence sans nécessiter d'intégration complexe ou de mouvement de données.

  1. Ingérer et orchestrer

    Utilisez les LakeFlow pipelines pour ingérer des documents bruts (tels que des fichiers PDF, des images et des fichiers DOCX) et orchestrer vos pipelines. Étant donné que l'ingestion et l'orchestration sont intégrées en mode natif au Lakehouse, les documents circulent directement vers le traitement en aval sans infrastructure supplémentaire.

  2. Analyser les documents (Couche Bronze)

    Appliquez ai_parse_document pour convertir les fichiers bruts en représentations structurées. Ceci crée une couche bronze standardisée qui capture le texte, les descriptions de tables/images et la structure des documents, formant une base cohérente pour tous les cas d'utilisation en aval.

  3. Extraire et classifier

    Utilisez ai_extract et ai_classify pour enrichir les documents analysés avec des champs structurés et des métadonnées. Ces fonctions opèrent directement sur les sorties analysées, vous permettant d'extraire des informations clés, de classer des documents et de les acheminer via des flux de travail sans étapes de transformation supplémentaires.

  4. Préparer la récupération (RAG)

    Appliquez ai_prep_search (Beta) pour transformer les documents analysés en fragments sémantiques enrichis de contexte au niveau du document, tels que les titres, les en-têtes de section et les références de page. Le résultat est formaté pour l'indexation AI Search, fournissant une base cohérente pour les charges de travail RAG et de récupération.

  5. Analyser et mettre en service

    Tirez parti d'AI Functions supplémentaires ou d'autres outils (tableaux de bord AI/BI, applications, recherche IA) pour l'analytique en aval, la récupération (RAG) et les workflows pilotés par agent. Puisque toutes les données restent sur le Lakehouse, les données de documents structurés peuvent être immédiatement utilisées pour la recherche, les tableaux de bord et les applications.