Recherche de contenu pour les volumes Unity Catalog
La recherche de contenu prépare et indexe les documents dans un volume Unity Catalog. Les recherches et les questions des agents sont ensuite exécutées sur l’index, afin que les utilisateurs et les agents récupèrent les informations les plus pertinentes plus rapidement et avec plus de précision. Comme l’index couvre le contenu de chaque fichier, un agent peut s’appuyer sur des passages spécifiques dans de nombreux fichiers au lieu de récupérer une poignée de fichiers entiers.
La recherche de contenu est particulièrement utile pour les volumes attachés à un Genie Agent. Voir Analyser des fichiers dans des volumes avec un Genie Agent.
Bêta
Cette fonctionnalité est en version bêta. Pour l’utiliser, un administrateur de workspace doit activer Analyser les fichiers dans les volumes avec les agents Genie depuis la page Aperçus . Consultez Gérer les aperçus Databricks.
Exigences
Avant d'activer la recherche de contenu pour un volume Unity Catalog, confirmez que vous remplissez les conditions suivantes :
- Lakebase,
ai_parse_documentet Foundation Model APIs sont disponibles dans votre région. - Un administrateur du Workspace a activé Analyser les fichiers dans les volumes avec les Genie Agents depuis la page Aperçus . Consultez Gérer les aperçus Databricks.
- Vous avez
CAN MANAGEsur le volume. Les utilisateurs qui interrogent le volume ont besoin deREAD VOLUME. Voir Privilèges pour les volumes Unity Catalog.
Disponibilité régionale
La recherche de contenu est disponible dans les régions listées dans cette section. Elle n’est pas disponible dans les régions qui ne sont pas répertoriées. Dans certaines régions, elle ne s’exécute que si un administrateur de compte active le traitement inter-Geo, ce qui permet à Databricks de traiter vos fichiers en dehors de la zone géographique de votre workspace. Voir Activer le traitement inter-Geo.
Régions qui ne nécessitent pas de traitement inter-Geo
La recherche de contenu s’exécute dans la région de votre workspace pour les régions suivantes :
- Asie-Pacifique (Sydney)
- Amérique du Sud (São Paulo)
- États-Unis – Est (Virginie du Nord)
- États-Unis – Est (Ohio)
- États-Unis – Ouest (Oregon)
Régions nécessitant un traitement inter-zones géographiques
Pour les régions suivantes, un administrateur de compte doit activer le traitement inter-zones géographiques avant que vous ne puissiez activer la recherche de contenu :
- Asie-Pacifique (Jakarta)
- Asie-Pacifique (Mumbai)
- Asie-Pacifique (Séoul)
- Asie-Pacifique (Singapour)
- Asie-Pacifique (Tokyo)
- Canada (Centre)
- UE (Francfort)
- UE (Irlande)
- UE (Londres)
- UE (Paris)
Activer la recherche de contenu
Vous activez et désactivez la recherche de contenu depuis la page du volume dans l’explorateur de catalogue.
Pour activer la recherche de contenu :
- Dans votre workspace Databricks, cliquez sur
Catalog .
- Recherchez ou parcourez le volume contenant les fichiers que vous souhaitez indexer et sélectionnez-le.
- Dans l’onglet Overview tab , recherchez la section Recherche de contenu dans la barre latérale droite.
- Cliquez sur Activer .
Une fois la recherche de contenu activée, Databricks exécute une synchronisation initiale pour analyser et indexer les fichiers pris en charge dans le volume. La section Recherche de contenu sous le tab Vue d'ensemble affiche le statut d'ingestion, le résultat de la dernière synchronisation et l'heure jusqu'à laquelle le volume est indexé.
La recherche de contenu n'analyse et n'indexe pas automatiquement les modifications apportées à votre volume, telles que les nouveaux fichiers ajoutés ou les modifications apportées aux fichiers existants. Pour refresh la recherche de contenu afin qu'elle reflète vos modifications, cliquez sur Synchroniser maintenant dans la section Recherche de contenu . Vous avez besoin de CAN MANAGE sur le volume pour Trigger une synchronisation.
Pour désactiver la recherche de contenu, cliquez sur Désactiver dans la section Recherche de contenu . La désactivation de la recherche de contenu supprime l’index généré et le contenu traité. Si vous l’activez à nouveau, Databricks réindexe le volume à partir de zéro et vous encourez à nouveau les coûts d’ingestion.
Databricks recommande d'activer la recherche de contenu pour les volumes que vous attachez à un Genie Agent. Voir Analyser des fichiers dans des volumes avec un Genie Agent.
Comment la recherche de contenu est facturée
La recherche de contenu comporte deux composantes de coût :
- Ingestion : lorsque vous activez la recherche de contenu ou exécutez une synchronisation, Databricks utilise la fonction d'IA
ai_parse_documentpour analyser les fichiers dans le volume avant de construire l'index. Databricks facture ce traitement dans le cadre de la Tarifs des AI Functions. - Query serving : Lakebase stocke et sert les index résultants. Databricks facture le compute et le stockage en fonction des unités de calcul (CU) que Lakebase provisionne. Le Query serving monte en charge de 2 à 12 CU en fonction de la taille de l'index et de la concurrence des queries. Après trois jours sans trafic, l'endpoint monte en charge à zéro et cesse d'engendrer des coûts de compute pour le Query serving. Pour connaître les tarifs actuels, consultez la page des tarifs de Lakebase.
Lorsqu’un Genie Agent interroge un volume indexé, la query peut également entraîner des coûts liés au Genie Agent. Consultez Comment cette fonctionnalité est-elle facturée ?.
Limitations
Les limitations suivantes s'appliquent à la recherche de contenu pendant la version bêta :
- Seuls les volumes gérés par Unity Catalog prennent en charge la recherche de contenu. Les volumes externes, les volumes Mes fichiers et les volumes dans des catalogues avec des liaisons de workspace ne sont pas pris en charge. Voir Stocker des fichiers dans Mes fichiers.
- Vous activez la recherche de contenu pour un volume entier. Vous ne pouvez pas indexer un sous-ensemble de dossiers ou de fichiers dans un volume.
- Chaque workspace peut avoir jusqu'à 100 volumes avec la recherche de contenu activée.
- Chaque volume indexé peut contenir jusqu’à 10 000 fichiers.
- La recherche de contenu ignore les fichiers de plus de 50 Mo.
- La recherche de contenu prend en charge les fichiers PDF, JPG, JPEG, PNG, TIFF, TIF, DOC, DOCX, PPT ou PPTX. Il ignore tous les autres types de fichiers.
- La recherche de contenu n’est pas disponible sur AWS GovCloud, dans les régions Azure Government ou dans les workspaces avec une conformité FedRAMP.
Ressources supplémentaires
Consultez les ressources suivantes pour obtenir des informations connexes :