Traitement intelligent des documents
Le Traitement Intelligent de Documents (IDP) convertit le contenu non structuré — tel que les fichiers PDF, DOCX, images et présentations — en données structurées et enrichies qui alimentent les agents en aval, les applications et l'analytique.
Avec Databricks, vous pouvez créer des pipelines IDP de bout en bout directement sur le Lakehouse en utilisant des AI Functions composables en mode natif, y compris ai_parse_document, ai_extract, ai_classify et ai_prep_search (Bêta). Ces fonctions développées par la recherche sont spécialement conçues pour le traitement de documents haute performance. Etant donné que tout le traitement s'exécute au sein du Unity Catalog, vos pipelines IDP de qualité production restent sécurisés, gouvernés et entièrement managés en place.
-
- Analyse de documents
- Convertir les fichiers PDF, DOCX, images et PPT en texte structuré, tableaux et descriptions de figures.
-
- Extraction d'informations
- Extrayez des champs structurés de documents ou de texte brut à l'aide d'un schéma que vous définissez.
-
- Classez le contenu
- Attribuer des catégories prédéfinies à des documents ou à du texte, prenant en charge plus de 500 étiquettes.
-
- Préparer la récupération (Bêta)
- Transformez les documents analysés en fragments sémantiques prêts pour l’indexation RAG et AI Search.
Cas d'utilisation courants
IDP sur Databricks gère un large éventail d'applications en aval :
- Génération augmentée de récupération (RAG) : analysez et structurez les documents pour améliorer le découpage, la qualité de la récupération et l'ancrage pour les applications LLM.
- Extraction des connaissances et analytique : Extrayez les champs clés et les métadonnées pour permettre la recherche, le reporting et la Business Intelligence sur les données de documents.
- Flux de travail pilotés par des agents : acheminer, classer et enrichir les documents pour prendre en charge la prise de décision automatisée et l'exécution des tâches.
- Compréhension et classification de documents : Organisez de vastes corpus de documents par type, sujet ou contenu pour un traitement en aval.
Comment cela fonctionne
Databricks permet le traitement intelligent des documents en tant que workflow unifié de bout en bout sur le Lakehouse. L'ingestion, l'analyse syntaxique, l'enrichissement et l'analyse en aval sont construits sur une plateforme unique, de sorte que chaque étape fonctionne en toute transparence sans nécessiter d'intégration complexe ou de mouvement de données.
-
Ingérer et orchestrer
Utilisez les LakeFlow pipelines pour ingérer des documents bruts (tels que des fichiers PDF, des images et des fichiers DOCX) et orchestrer vos pipelines. Étant donné que l'ingestion et l'orchestration sont intégrées en mode natif au Lakehouse, les documents circulent directement vers le traitement en aval sans infrastructure supplémentaire.
-
Analyser les documents (Couche Bronze)
Appliquez
ai_parse_documentpour convertir les fichiers bruts en représentations structurées. Ceci crée une couche bronze standardisée qui capture le texte, les descriptions de tables/images et la structure des documents, formant une base cohérente pour tous les cas d'utilisation en aval. -
Extraire et classifier
Utilisez
ai_extractetai_classifypour enrichir les documents analysés avec des champs structurés et des métadonnées. Ces fonctions opèrent directement sur les sorties analysées, vous permettant d'extraire des informations clés, de classer des documents et de les acheminer via des flux de travail sans étapes de transformation supplémentaires. -
Préparer la récupération (RAG)
Appliquez
ai_prep_search(Beta) pour transformer les documents analysés en fragments sémantiques enrichis de contexte au niveau du document, tels que les titres, les en-têtes de section et les références de page. Le résultat est formaté pour l'indexation AI Search, fournissant une base cohérente pour les charges de travail RAG et de récupération. -
Analyser et mettre en service
Tirez parti d'AI Functions supplémentaires ou d'autres outils (tableaux de bord AI/BI, applications, recherche IA) pour l'analytique en aval, la récupération (RAG) et les workflows pilotés par agent. Puisque toutes les données restent sur le Lakehouse, les données de documents structurés peuvent être immédiatement utilisées pour la recherche, les tableaux de bord et les applications.