Aller au contenu principal

Guide de gestion des coûts de Recherche IA

AI Search facture deux Ressources : les index qui stockent vos vecteurs pour la récupération, et les Endpoint qui servent les query. Cette page couvre les sujets suivants :

  • Index de recherche IA et bases de l’Endpoint.
  • Monitoring de la facturation et de l’utilisation.
  • Modes de synchronisation.
  • Bonnes pratiques pour optimiser les coûts.

Pour trouver les endpoints avec des index qui ne reçoivent pas de trafic de requêtes, consultez Identifier les endpoints de recherche IA inutilisés.

Databricks AI Search comprend les éléments suivants :

  • Index de recherche IA : Les index stockent vos vecteurs pour la recherche et la récupération.
  • Endpoints de Recherche IA : Chaque Endpoint héberge un ou plusieurs index pour la diffusion des queries. Vous pouvez avoir plusieurs index servis sous un seul Endpoint, et un Endpoint peut servir jusqu'à 50 index. Dans de nombreux cas, vous pouvez combiner des workloads plus petits sur un seul Endpoint afin de réduire les coûts totaux.

Databricks propose deux options d'Endpoint :

  • Endpoint standard. Une unité de recherche vectorielle couvre jusqu'à 2 millions de vecteurs de dimension 768 (ou l'équivalent). Par exemple, si vous avez 1 million de vecteurs de dimension 1536, cela compte également comme une unité.

  • Endpoint optimisés pour le stockage. Une unité de recherche de vecteurs couvre jusqu'à 64 millions de vecteurs de dimension 768 (ou l'équivalent).

Pour les deux options, chaque endpoint a un prix de base et monte en charge automatiquement pour correspondre à la taille totale des index qu'il dessert. Les Endpoint se réduisent automatiquement lorsqu'un index est supprimé. La taille minimale pour un endpoint est une unité de recherche vectorielle.

Les Endpoint AI Search ne sont facturés qu'après la création d'un index, et 24 heures après la suppression du dernier index de l'Endpoint, l'Endpoint n'entraîne plus de frais.

Comment surveiller l’utilisation et les coûts

Databricks fournit un tableau d'utilisation facturable, des tableaux de bord d'utilisation et des politiques d'utilisation pour vous aider à surveiller l'utilisation et les coûts de la Recherche IA.

Table d'utilisation facturable

Voici un exemple de query du tableau d'utilisation facturable :

SQL
WITH all_vector_search_usage AS (
SELECT *,
CASE WHEN usage_metadata.endpoint_name IS NULL THEN 'ingest'
WHEN usage_type = "STORAGE_SPACE" THEN 'storage'
ELSE 'serving'
END as workload_type
FROM system.billing.usage
WHERE billing_origin_product = 'VECTOR_SEARCH'
),

daily_dbus AS (
SELECT
workspace_id,
cloud,
usage_date,
workload_type,
usage_metadata.endpoint_name as vector_search_endpoint,
CASE WHEN workload_type = 'serving' THEN SUM(usage_quantity)
WHEN workload_type = 'ingest' THEN SUM(usage_quantity)
ELSE null
END as dbus,
CASE WHEN workload_type = 'storage' THEN SUM(usage_quantity)
ELSE null
END as dsus
FROM all_vector_search_usage
GROUP BY 1,2,3,4,5
ORDER BY 1,2,3,4,5 DESC
)
SELECT * FROM daily_dbus;

Pour plus de détails sur la table d'utilisation facturable, consultez la référence de la table système d'utilisation facturable.

Des queries supplémentaires se trouvent dans le notebook d'exemple suivant.

Notebook de requêtes des tables système AI Search

Tableaux de bord d'utilisation

Pour plus d'informations sur les tableaux de bord d'utilisation que vous pouvez importer afin d'obtenir des insights sur les Driver de coût, y compris l'utilisation de la recherche IA, consultez Tableaux de bord d'utilisation.

Politiques d’utilisation

Les politiques d'utilisation permettent aux administrateurs de regrouper et de filtrer les enregistrements de facturation sur tous les produits Databricks serverless, et de fournir une interface utilisateur dédiée pour le suivi des dépenses. Pour savoir comment appliquer une politique d'utilisation à un Endpoint AI Search, consultez les politiques d'utilisation d'AI Search. Pour des informations générales et des détails sur la façon de créer et de gérer les politiques d'utilisation, consultez Attribuer l'utilisation avec des politiques d'utilisation serverless.

Comment gérer les coûts de synchronisation d'index

Vous pouvez configurer votre index pour le mettre à jour de deux manières :

  • Synchronisation déclenchée : vous appelez l’API ou le SDK Python pour déclencher une mise à jour d’index. C’est l’option la plus rentable.
  • **Synchronisation continue** : L'index est automatiquement mis à jour avec les modifications de la table Delta source avec une latence proche du temps réel. Cela coûte plus cher car un cluster de streaming est provisionné pour gérer la synchronisation. Si des mises à jour quasi en temps réel avec des secondes de latence ne sont pas critiques, envisagez d'utiliser Triggered Sync pour réduire les coûts.

Bonnes pratiques pour la gestion des coûts

  • Combinez les charges de travail sur un seul Endpoint : si vous anticipez un faible QPS pour tous les index, vous pouvez combiner vos index sous un seul Endpoint pour éviter les coûts de plusieurs Endpoints de base. Consultez le guide des performances de recherche IA pour plus de détails.
  • Surveiller l'utilisation : Utilisez les tables de facturation du système et les tableaux de bord d'utilisation intégrés pour suivre la capacité, l'utilisation et les coûts. Notez que l'utilisation d'un QPS élevé augmente le coût de l'Endpoint.
  • Choisissez le bon mode de synchronisation : utilisez la Trigger Sync au lieu de la synchronisation continue lorsque cela est possible, afin de réduire les coûts de streaming.
  • Identifier les endpoints inutilisés : les endpoints dotés d'index qui ne reçoivent aucun trafic de query continuent d'engendrer des coûts de service. Utilisez les Logs d'audit pour les trouver. Consultez Identifier les Endpoint de recherche IA inutilisés.

Ressources supplémentaires