Référence des tables système
Databricks vous déconseille fortement de déplacer ces données en dehors de la plateforme, car cela peut exposer des données sensibles et mettre votre déploiement en danger. En raison de la nature des informations des tables système, il vous est rappelé que vous êtes responsable de maintenir la sécurité et de prévenir l'utilisation abusive de toute information exportée des tables système.
Les tables système fournissent un stockage analytique hébergé par Databricks des données opérationnelles de votre compte. Utilisez-les pour surveiller les coûts, auditer les événements de sécurité, suivre les performances de compute et de Job, et observer les charges de travail de données et d'IA.
Que sont les tables système ?
Les tables système sont un magasin d'analyse hébergé par Databricks des données opérationnelles de votre compte, que l'on trouve dans le catalogue system. Les tables système peuvent être utilisées pour l'observabilité historique sur l'ensemble de votre compte.
Les tables du schéma d'informations (system.information_schema) fonctionnent différemment des autres tables système. Consultez Schéma d'informations.
Exigences
-
Pour accéder aux tables système, votre Workspace doit être activé pour Unity Catalog. Pour plus d'informations, consultez Activer les tables système.
-
Seul un sous-ensemble des tables système est disponible dans Databricks sur AWS GovCloud. Veuillez consulter Tables système prises en charge.
Quelles tables système sont disponibles ?
Actuellement, Databricks héberge les tables système suivantes :
Table | Description | Prend en charge le streaming | Période de conservation gratuite | Comprend des données mondiales ou régionales |
|---|---|---|---|---|
Logs d'audit (aperçu public) | Inclut les enregistrements de tous les événements d'audit des Workspace de votre région. Pour obtenir la liste des événements d'audit disponibles, consultez la référence du journal d'audit. Chemin de la table : | Oui | 365 jours | Régional pour les événements au niveau du Workspace. Global pour les événements au niveau du compte. |
Inclut les enregistrements pour toute l'utilisation facturable de votre compte. Chemin de la table : | Oui | 365 jours | Monde | |
Événements de salle blanche (préversion publique) | Capture les événements liés aux salles blanches. Chemin de la table : | Oui | 365 jours | Régional |
Une table de dimension à évolution lente qui contient l'historique complet des configurations de compute au fil du temps pour n'importe quel cluster. | Oui | 365 jours | Régional | |
Inclut un enregistrement pour chaque événement de lecture ou d'écriture sur une colonne Unity Catalog (mais n'inclut pas les événements qui n'ont pas de source). Chemin de la table : | Oui | 365 jours | Régional | |
Résultats de la classification des données (Aperçu public) | Stocke les détections au niveau des colonnes des classes de données sensibles dans les catalogues activés de votre metastore. Chemin de la table : | Non | 13 mois | Régional |
Résultats du monitoring de la qualité des données (Préversion publique) | Stocke les résultats des vérifications de monitoring de la qualité des données (fraîcheur, exhaustivité) et les informations d’incident, y compris l’impact en aval, sur les tables activées de votre metastore. Chemin de la table : | Non | Indéfini | Régional |
Événements Genie Code (aperçu public) | Permet de suivre les messages utilisateur envoyés à Genie Code. Chemin de la table : | Non | 365 jours | Régional |
Utilisation d'AI Gateway (Bêta) | Capture les détails des requêtes et des réponses pour les endpoints AI Gateway, y compris l'utilisation des jetons, la latence, les métriques de performance et les informations de routage. Chemin de la table : | Oui | 365 jours | Régional |
Enregistre les dépenses estimées en USD pour les requêtes acheminées vers des modèles externes via des services de fournisseur de modèle. Chemin de la table : | Non | 365 jours | Régional | |
Capture les événements de matérialisation des données créés à partir du partage de vues, de vues matérialisées et de tables de streaming. Chemin de la table : | Oui | 365 jours | Régional pour les événements de Workspace. | |
Événements d'instance (Préversion publique) | Capture les transitions d'état des instances de compute classiques. Chemin de la table : | Oui | 365 jours | Régional |
Pools d'instances (Aperçu public) | Une table de dimension à évolution lente qui contient l'historique complet des configurations de pool d'instances au fil du temps. Chemin de la table : | Oui | 365 jours | Régional |
Suit les heures de start et de fin des exécutions de job. Chemin de la table : | Oui | 365 jours | Régional | |
Suivi des heures de start et de fin, et des ressources de compute utilisées pour les exécutions des tâches Job. Chemin de la table : | Oui | 365 jours | Régional | |
Suit toutes les tâches de Job exécutées dans le compte. Chemin de la table : | Oui | 365 jours | Régional | |
Suit tous les jobs créés dans le compte. Chemin de la table : | Oui | 365 jours | Régional | |
Événements de funnel Marketplace (Public Preview) | Inclut les données d'impression client et de funnel pour vos listings. Chemin de la table : | Oui | 365 jours | Régional |
Accès au listing de la marketplace (Aperçu public) | Inclut les informations des consommateurs pour les événements de demande de données ou d’obtention de données terminés sur vos listes. Chemin de la table : | Oui | 365 jours | Régional |
Métadonnées d'expérimentation de suivi MLflow (Aperçu public) | Chaque ligne représente une expérimentation créée dans le système MLflow géré par Databricks. Chemin de la table : | Oui | 180 jours | Régional |
métadonnées d'exécution de suivi MLflow (Aperçu public) | Chaque ligne représente une exécution créée dans le système MLflow géré par Databricks. Chemin de la table : | Oui | 180 jours | Régional |
métriques d'exécution de suivi MLflow (Aperçu public) | Contient les métriques de série chronologique enregistrées dans MLflow associées à un entraînement de modèle, une évaluation ou un développement d'agent donné. Chemin de la table : | Oui | 180 jours | Régional |
Données d'Endpoint de déploiement de modèles (préversion publique) | Une table de dimension à évolution lente qui stocke les métadonnées pour chaque modèle de fondation servi dans un endpoint de déploiement de modèle. Chemin de la table : | Oui | 365 jours | Régional |
Utilisation de l'endpoint de déploiement de modèles (aperçu public) | Enregistre le nombre de jetons pour chaque requête vers un endpoint de service de modèle et ses réponses. Pour capturer l'utilisation des Endpoint dans ce tableau, vous devez activer le suivi de l'utilisation sur votre Endpoint de diffusion. Chemin de la table : | Oui | 90 jours | Régional |
Événements d'accès réseau (entrants) (Aperçu public) | Une table qui enregistre un événement chaque fois que l'accès entrant à un workspace est refusé par une politique d'entrée. Chemin de la table : | Oui | 30 jours | Régional |
Événements d'accès réseau (sortants) (Aperçu public) | Table qui enregistre un événement chaque fois que l'accès sortant à Internet est refusé depuis votre compte. Chemin de la table : | Oui | 365 jours | Régional |
Capture les métriques d'utilisation de vos ressources de compute de calcul multifonction et de jobs. Chemin de la table : | Oui | 90 jours | Régional | |
Capture les types de nœuds actuellement disponibles avec leurs informations matérielles de base. Chemin de la table : | Non | Indéfini | Régional | |
Chronologie de la mise à jour du pipeline (Aperçu public) | Suit les heures de start et de fin ainsi que les ressources de compute utilisées pour les mises à jour du pipeline. Chemin de la table : | Oui | 365 jours | Régional |
Pipelines (Aperçu public) | Suit tous les pipelines créés dans le compte. Chemin de la table : | Oui | 365 jours | Régional |
Mises à niveau automatiques (Préversion publique) | Suit l'historique des Opérations d'activation de fonctionnalités effectuées par les mises à niveau automatiques sur les tables gérées de Unity Catalog. Chemin de la table : | Non | 180 jours | Régional |
Optimisation prédictive (Aperçu public) | Suit l'historique des opérations de la fonctionnalité d'optimisation prédictive. Chemin de la table : | Non | 180 jours | Régional |
Un historique des Logs de Tarifs des SKU. Un enregistrement est ajouté à chaque modification du prix d'une SKU. Chemin de la table : | Non | Indéfini | Monde | |
Historique des requêtes (Aperçu public) | Capture les enregistrements de toutes les queries exécutées sur les SQL Warehouses et le compute Serverless pour les notebooks et les jobs. Chemin de la table : | Non | 365 jours | Régional |
Réplication (Aperçu privé) | Suit l'état de la réplication pour la reprise après sinistre (DR) gérée par Databricks. Chemin de la table : | Oui | 365 jours | Monde |
Capture les événements liés aux SQL warehouses. Par exemple, le démarrage, l'arrêt, l'exécution, la montée et la descente en charge. Chemin de la table : | Oui | 365 jours | Régional | |
Contient l'historique complet des configurations au fil du temps pour tout SQL Warehouse. Chemin de la table : | Oui | 365 jours | Régional | |
Comprend un enregistrement pour chaque événement de lecture ou d'écriture sur une table ou un chemin Unity Catalog. Chemin de la table : | Oui | 365 jours | Régional | |
Workspaces (Aperçu public) | La table workspaces_latest est une table de dimension à évolution lente des métadonnées pour tous les workspaces du compte. Chemin de la table : | Non | Indéfini | Monde |
Zerobus Ingest (Streams) (bêta) | Une table qui stocke toutes les données relatives aux événements de Stream occasionnés par l'utilisation de Zerobus Ingest. Chemin de la table : | Oui | 365 jours | Régional |
Zerobus Ingest (Ingestion) (Bêta) | Une table qui stocke toutes les données relatives aux enregistrements ingérés à l'aide de Zerobus Ingest. Chemin de la table : | Oui | 365 jours | Régional |
Les tables d'utilisation facturable et de Tarifs sont gratuites. Les tables en aperçu public sont également gratuites pendant l'aperçu, mais pourraient être facturées à l'avenir.
Vous pouvez voir d'autres tables système dans votre compte, en plus de celles listées ci-dessus. Ces tables sont actuellement en aperçu privé et sont vides par default. Si vous êtes intéressé(e) par l'utilisation de l'une de ces tables, veuillez contacter votre équipe de compte Databricks.
Relations entre les tables système
Le diagramme entité-relation suivant décrit comment les tables système actuellement disponibles sont liées les unes aux autres. Ce diagramme met en évidence les clés primaires et étrangères de chaque table.
Activer les tables système
Étant donné que les tables système sont régies par Unity Catalog, vous devez disposer d'au moins un workspace compatible Unity Catalog dans votre compte pour activer les tables système de votre compte. Les tables système incluent les données de tous les Workspace de votre compte, mais elles ne sont accessibles qu'à partir d'un Workspace compatible avec Unity Catalog.
Le métastore doit être sur Unity Catalog Privilege Model Version 1,0 pour accéder aux tables système. Consultez Mise à niveau vers l'héritage des privilèges.
Accorder l'accès aux tables système
L'accès aux tables système est régi par Unity Catalog. Les utilisateurs ayant les rôles d'administrateur de compte et d'administrateur du metastore ont accès aux tables système by default. Pour permettre aux autres utilisateurs d'interroger les tables système, l'administrateur doit accorder aux utilisateurs les autorisations suivantes : USE CATALOG sur le catalogue système, USE SCHEMA sur les schémas système et SELECT sur les schémas système. Voir Gérer les privilèges dans Unity Catalog.
Les tables système sont en lecture seule et ne peuvent pas être modifiées.
Si votre compte a été créé après le 8 novembre 2023, vous pourriez ne pas avoir d'administrateur de metastore par default. Pour plus d'informations, consultez Se familiariser avec Unity Catalog.
Les tables système contiennent-elles des données pour tous les Workspaces de votre compte ?
Les tables système contiennent des données opérationnelles pour tous les Workspaces de votre compte déployés dans la même région cloud. Certaines tables incluent des données globales. Pour plus de détails, consultez la liste des tables disponibles.
Bien que les tables système ne puissent être consultées que via un workspace Unity Catalog, elles incluent des données opérationnelles provenant de workspaces non-Unity Catalog de votre compte.
Où les données des tables système sont-elles stockées ?
Les données de la table système de votre compte sont stockées dans un compte de stockage hébergé par Databricks, situé dans la même région que votre metastore. Les données sont partagées en toute sécurité avec vous via OpenSharing.
Chaque table dispose d'une période de rétention des données gratuite. Pour plus de détails, consultez la colonne Période de rétention gratuite dans Quelles tables système sont disponibles ?.
Où se trouvent les tables système dans l'Explorateur de catalogues ?
Les tables système de votre compte se trouvent dans un catalogue appelé system, qui est inclus dans chaque métastore Unity Catalog. Dans le catalogue system, vous verrez des schémas tels que access et billing qui contiennent les tables système.
Considérations relatives aux tables système de streaming
Databricks utilise OpenSharing pour partager les données des tables système avec les clients. Tenez compte des considérations suivantes lors du streaming avec OpenSharing :
- Si vous utilisez le streaming avec les tables système, définissez l'option
skipChangeCommitssurtrue. Cela garantit que le Job de streaming n'est pas interrompu par les suppressions dans les tables système. Consultez Gérer les modifications apportées aux tables source Delta Lake. Trigger.AvailableNowest pris en charge sur Databricks Runtime 18.0 et versions ultérieures. La query capture la version actuelle de la table système quand elle start, traite toutes les données disponibles en un ou plusieurs micro-batchs, puis s'arrête. Sur Databricks Runtime 17.3 et versions inférieures,Trigger.AvailableNowest converti enTrigger.Once, qui traite un seul micro-batch par exécution.- Les tables système utilisent la rétention par default de 7 jours pour
VACUUM(voir Configurer la rétention des données pour les queries « time travel »), ce qui signifie que votre query de streaming pourrait s'interrompre si elle est en retard de plus de 7 jours. Surveillez vos flux pour vous assurer qu'ils sont à jour avec la dernière version de la table système.
Si votre Job de streaming ne rattrape pas son retard par rapport à la dernière version de la table système, utilisez Trigger.AvailableNow (pris en charge sur Databricks Runtime 18.0 et versions ultérieures) afin que chaque exécution traite l'intégralité du backlog disponible, ou augmentez la fréquence planifiée du Job.
Lire les modifications incrémentielles à partir des tables système de streaming
spark.readStream.option("skipChangeCommits", "true").table("system.billing.usage")
Problèmes connus
-
De nouvelles colonnes peuvent être ajoutées aux tables système existantes à tout moment. Les query qui reposent sur un schéma fixe peuvent échouer si de nouvelles colonnes sont introduites. Les colonnes existantes ne seront pas modifiées ni supprimées. Si vous écrivez des données de table système dans une autre table cible, envisagez d'activer l'évolution des schémas.
-
De nouveaux champs peuvent être ajoutés aux colonnes de type struct à tout moment. Si vous écrivez des données de table système dans une autre table cible, envisagez d'activer l'évolution des schémas.
-
Aucun support pour le monitoring en temps réel. Les données sont mises à jour tout au long de la journée. Si vous ne voyez pas de Log pour un événement récent, vérifiez à nouveau ultérieurement.
-
Le schéma de table système
__internal_loggingprend en charge la journalisation de la charge utile à l'aide de tables d'inférence activées par AI Gateway pour les modèles externes et les charges de travail à throughput provisionné. Ce schéma est visible par les administrateurs de compte, mais il ne peut pas être activé et ne doit pas être utilisé pour les workflows des clients. -
Pour éviter les problèmes de performances, les queries de table système qui ne sont pas suffisamment sélectives renvoient l'erreur suivante :
System Table query returned too much data. Please repeat query with more selective predicates. -
Si votre Workspace utilise un Virtual Private Cloud (VPC) géré par le client, l'accès au compartiment S3 où les Logs sont stockés pourrait vous être refusé. Si tel est le cas, vous devez mettre à jour votre politique d'Endpoint Virtual Private Cloud (VPC) pour autoriser l'accès au compartiment S3 où sont stockées les données des tables système de votre région. Pour une liste des noms de compartiments régionaux, consultez la colonne Compartiment des tables système dans la table des adresses de compartiments de stockage.
-
Les schémas système
system.operational_dataetsystem.lineagesont dépréciés et contiendront des tables vides.