Aller au contenu principal

Confiance et sécurité des fonctionnalités d'assistance Databricks AI

Databricks comprend l'importance de vos données et la confiance que vous nous accordez lorsque vous utilisez notre plateforme et les fonctionnalités d'assistance de Databricks AI. Databricks s'engage à respecter les normes les plus élevées en matière de protection des données et a mis en œuvre des mesures rigoureuses pour garantir que les informations que vous soumettez aux fonctionnalités d'assistance Databricks AI sont protégées.

  • Vos données restent confidentielles.

    • Databricks n'utilise pas les données, les invites ou les réponses soumises ou générées par ces fonctionnalités pour entraîner des modèles de fondation génératifs que Databricks met à la disposition de tiers.
    • Nos Partenaires de modèles ne conservent pas les données que vous soumettez par le biais de ces fonctionnalités, même pour le monitoring des abus. Nos fonctionnalités d'assistance par IA pilotées par des partenaires utilisent des endpoints de rétention de données nulle de nos partenaires de modèle.
  • Protection contre les résultats indésirables. Lorsque vous utilisez Azure OpenAI, Databricks utilise également le filtrage de contenu Azure OpenAI pour protéger les utilisateurs des contenus nuisibles. Lors de l’utilisation des modèles Anthropic, Databricks s’appuie sur les mécanismes de sécurité intégrés d’Anthropic et un renforcement supplémentaire contre les sorties nuisibles, comme décrit dans la documentation de sécurité d’Anthropic. De plus, Databricks a effectué une évaluation approfondie avec des milliers d'interactions utilisateur simulées afin de garantir l'efficacité des protections mises en place contre les contenus nuisibles, les « jailbreaks », la génération de code non sécurisé et l'utilisation de contenus protégés par des droits d'auteur tiers.

  • Databricks utilise uniquement les données nécessaires pour fournir le service. Les données sont envoyées uniquement lorsque vous interagissez avec les fonctionnalités d'assistance Databricks AI, ou si nécessaire pour fournir les fonctionnalités. Databricks envoie votre requête, les métadonnées et valeurs de table pertinentes, les erreurs, ainsi que le code d'entrée ou les requêtes pour aider à retourner des résultats plus pertinents.

  • Les données sont protégées en transit et au repos. Tout le trafic entre Databricks et les partenaires de modèles est chiffré en transit avec le chiffrement TLS standard de l'industrie. Toutes les données stockées dans un Workspace Databricks sont chiffrées AES-256 bits.

  • Databricks offre des contrôles de résidence des données. Les fonctionnalités d'assistance Databricks AI sont des Services désignés et sont conformes aux limites de résidence des données. Pour plus de détails, consultez Databricks Geos : résidence des données et Services désignés de Databricks.

Pour plus de détails sur la façon dont les fonctionnalités spécifiques gèrent vos données, consultez la FAQ sur la confidentialité et la sécurité.

Données envoyées aux modèles

Quels services et modèles utilisent les fonctionnalités d'assistance IA optimisées par des partenaires ?

Si le paramètre Fonctionnalités d'IA optimisées par les partenaires est activé, les fonctionnalités d'assistance Databricks AI utilisent des modèles hébergés par le service Azure OpenAI, OpenAI sur Databricks ou Anthropic sur Databricks.

Certaines fonctionnalités, comme la Complétion automatique de Genie Code, utilisent un modèle hébergé par Databricks, même lorsque le paramètre est activé. Si vous désactivez le paramètre Fonctionnalités AI d’assistance partenaires , certaines fonctionnalités AI d’assistance peuvent utiliser un modèle hébergé par Databricks. Pour plus d'informations, consultez les fonctionnalités d'IA optimisées par des partenaires.

Quelles données sont envoyées aux modèles ?

Databricks envoie uniquement les données nécessaires pour fournir le service. En général, cela inclut votre prompt (par exemple, votre question, votre code ou votre query) et les métadonnées pertinentes telles que les noms et descriptions de tables et de colonnes, les exemples de valeurs, les erreurs et les questions précédentes. Les données exactes diffèrent selon la fonctionnalité :

  • **Genie Code** envoie du code et des requêtes dans la cellule de notebook actuelle ou l'onglet de l'éditeur SQL, les noms et descriptions de tables et de colonnes, les questions précédentes et les tables favorites. En **mode Agent**, Genie Code peut également analyser les sorties de cellule et lire des échantillons de données à partir de tables, similaire à d'autres agents de codage dans les secteurs d'activité.
  • Les agents Genie utilisent l’invite en langage naturel, les noms et descriptions de table, les valeurs pertinentes, les instructions générales, les exemples de requêtes SQL et les fonctions SQL.
  • L'** Ontologie Genie ** est une carte de vos données et de votre activité que Genie construit et gère automatiquement en extrayant les connaissances de sources telles que les tables, les requêtes, les tableaux de bord, les notebooks, les documents et les applications connectées. Les extraits d'ontologie extraits respectent les autorisations des assets et des documents sources.
  • Les commentaires générés par l'IA envoient des métadonnées pour l'objet documenté et ses objets parents, y compris les noms du catalogue, du schéma, de la table, de la fonction, du modèle et du volume, leurs commentaires actuels et les détails des colonnes (nom, type, si c'est une clé primaire et le commentaire actuel de la colonne).

Les données envoyées aux modèles respectent-elles les autorisations de l'utilisateur de Unity Catalog ?

Oui, toutes les données envoyées aux modèles de fonctionnalités d'assistance basées sur l'IA respectent les autorisations du Unity Catalog, de sorte qu'aucune donnée à laquelle les utilisateurs n'ont pas accès n'est envoyée à ces modèles.

Les fournisseurs de modèles partenaires stockent-ils mes données ?

Non. Lorsque vous utilisez des modèles partenaires via Databricks, les fournisseurs de modèles partenaires ne stockent pas les invites ou les réponses.

Stockage et accès

Où sont stockées les réponses des fonctionnalités d'assistance par IA ?

Les réponses de Genie Agent et les commentaires générés par l'IA approuvés sont stockés dans la base de données du plan de contrôle Databricks. La base de données du plan de contrôle est chiffrée en AES-256 bits.

L'historique de chat de Genie Code est stocké au même emplacement que les autres contenus du notebook.

Qui peut voir mon historique de discussion avec Genie Code ou les agents Genie ?

Vous pouvez voir vos propres chats Genie Code. Les administrateurs peuvent consulter le fil de discussion s'ils disposent d'un Link direct. Lorsque vous partagez un fil de discussion de chat, les destinataires peuvent le consulter. Voir Partager un fil de discussion de chat.

Les gestionnaires de Genie Agent peuvent voir les messages des autres utilisateurs, mais pas leurs résultats de query. Les conversations avec les agents Genie suivent les paramètres de partage de conversation.

Exécution et précision du code

Les agents Genie ou Genie Code exécutent-ils du code ?

Les agents Genie sont conçus avec un accès en lecture seule aux données client, afin qu'ils ne puissent générer et exécuter que des requêtes SQL en lecture seule.

Avec le mode Agent, Genie Code peut exécuter du code dans le Notebook et l'éditeur SQL. Au début, Genie Code vous demandera confirmation pour procéder à l'exécution. Vous pouvez choisir de confirmer, d'autoriser toujours l'exécution dans le thread Genie Code actuel, ou d'autoriser toujours l'exécution. Les autres modes Genie Code n’exécutent pas automatiquement le code en votre nom.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Examinez et testez le code généré par l'IA avant de l'exécuter.

Databricks a-t-il réalisé une évaluation pour juger de la précision et de la pertinence des réponses des fonctionnalités d'assistance par IA ?

Oui, Databricks a effectué des tests approfondis de toutes nos fonctionnalités d'assistance par IA, en se basant sur leurs cas d'utilisation prévus et en utilisant des entrées utilisateur simulées afin d'accroître la précision et la pertinence des réponses. Cela dit, l'IA générative est une technologie émergente, et les fonctionnalités d'assistance par l'IA peuvent fournir des réponses inexactes ou inappropriées.

Résidence des données et conformité

Comment mon trafic est-il acheminé via Geos ?

Les fonctionnalités d'assistance Databricks AI sont des services désignés qui utilisent Databricks Geos pour gérer la résidence des données lors du traitement du contenu des clients. Le routage du trafic dépend de votre région et si le traitement cross-Geo est activé (l'option **Appliquer le traitement des données dans la géographie du Workspace pour les services désignés** est désactivée).

Puis-je utiliser les fonctionnalités d’assistance basées sur l’IA avec des tables qui traitent des données réglementées (PHI, PCI, IRAP, FedRAMP) ?

Oui. Pour ce faire, vous devez vous conformer aux exigences, telles que l'activation du profil de sécurité de la conformité, et ajouter la norme de conformité pertinente dans le cadre de la configuration du profil de sécurité de la conformité.

Modèles hébergés par Databricks

Comment les fonctionnalités d'assistance basées sur l'IA fonctionnent-elles avec les modèles hébergés par Databricks ?

Lorsque les fonctionnalités d'IA alimentées par des partenaires sont désactivées, les fonctionnalités d'assistance d'IA utilisent les modèles hébergés par Databricks, qui sont entièrement sélectionnés et gérés par Databricks. Databricks utilise des modèles open source disponibles pour un usage commercial, tels que OpenAI GPT OSS.

Le schéma suivant donne un aperçu de la façon dont un modèle hébergé par Databricks alimente les fonctionnalités d’IA de Databricks telles que Quick Fix.

Diagramme du workflow pour Genie Code alimenté par un modèle hébergé par Databricks.

  1. Un utilisateur exécute une cellule de Notebook, ce qui entraîne une erreur.
  2. Databricks joint des métadonnées à une requête et l'envoie à un grand modèle de langage (LLM) hébergé par Databricks. Toutes les données sont chiffrées au repos. Les clients peuvent utiliser une clé gérée par le client (CMK).
  3. Le modèle hébergé par Databricks répond avec les modifications de code suggérées pour corriger l'erreur, qui sont affichées à l'utilisateur.