Afficher les métriques de compute
Cet article explique comment utiliser l'outil de métriques de compute natif dans l'interface utilisateur de Databricks pour recueillir les métriques clés du matériel et de Spark. L'interface utilisateur des métriques est disponible pour le calcul multifonction et les compute de Jobs.

Les métriques sont disponibles en quasi temps réel avec un délai normal de moins d'une minute. Les métriques sont stockées dans le stockage géré par Databricks et non dans le stockage du client.
Le compute Serverless pour les Notebooks et les Jobs utilise des insights de query au lieu de l'interface utilisateur de métriques. Pour plus d'information sur les métriques du compute Serverless, voir Afficher les insight de query.
Accéder à l'interface utilisateur des métriques de compute
Pour afficher l'interface utilisateur des métriques de compute :
- Cliquez sur Compute dans la barre latérale.
- Cliquez sur la ressource de compute pour laquelle vous souhaitez afficher les métriques.
- Cliquez sur le tab Metrics .
Les métriques matérielles pour tous les nœuds sont affichées par default. Pour afficher les mesures Spark, cliquez sur le menu déroulant intitulé **Matériel** et sélectionnez **Spark**. Vous pouvez également sélectionner **GPU** si l'instance est compatible GPU.
Filtrer les métriques par période
Vous pouvez consulter les métriques historiques en sélectionnant une plage horaire à l'aide du filtre de sélecteur de date. Les métriques sont collectées chaque minute, vous pouvez donc filtrer par n'importe quelle plage de jour, d'heure ou de minute des 30 derniers jours. Cliquez sur l'icône du calendrier pour sélectionner des plages de données prédéfinies, ou cliquez à l'intérieur de la zone de texte pour définir des valeurs personnalisées.
Les intervalles de temps affichés dans les graphiques s'ajustent en fonction de la durée que vous visualisez. La plupart des métriques sont des moyennes basées sur l'intervalle de temps que vous visualisez actuellement.
Vous pouvez également obtenir les dernières métriques en cliquant sur le bouton Refresh .
Afficher les métriques au niveau du nœud
Par default, la page des mesures vous montre les mesures pour tous les nœuds d'un cluster (y compris le driver) moyennées sur la période.
Vous pouvez afficher les mesures pour les nœuds individuels en cliquant sur le menu déroulant Tous les nœuds et en sélectionnant le nœud pour lequel vous souhaitez afficher les mesures. Les mesures du GPU sont uniquement disponibles au niveau de chaque nœud. Les mesures Spark ne sont pas disponibles pour les nœuds individuels.
Pour aider à identifier les nœuds aberrants au sein du cluster, vous pouvez également afficher les métriques de tous les nœuds individuels sur une seule page. Pour accéder à cette vue, cliquez sur le menu déroulant Tous les nœuds et sélectionnez Par nœud , puis sélectionnez la sous-catégorie de métrique que vous souhaitez afficher.

Graphiques des métriques matérielles
Les graphiques de mesures matérielles suivants sont disponibles dans l’interface utilisateur des mesures de compute :
-
**Utilisation du processeur et nœuds actifs** : le Graphe linéaire affiche le nombre de nœuds actifs à chaque Timestamp pour le compute donné. Le Graphe à barres affiche le pourcentage de temps CPU passé dans chaque mode, basé sur le coût total en secondes CPU. Voici les modes suivis :
guest: Si vous exécutez des VMs, le CPU que ces VMs utilisentiowait: Temps passé à attendre les E/Sidle: Temps pendant lequel le CPU n'avait rien à faireirq: Temps passé sur les requêtes d'interruptionnice: temps utilisé par les processus ayant une priorité positive, ce qui signifie une priorité inférieure à celle des autres tâchessoftirq: Temps passé sur les requêtes d'interruption logiciellesteal: Si vous êtes une VM, le temps que d'autres VM ont « volé » à vos CPUsystem: le temps passé dans le noyauuser: Le temps passé en espace utilisateur
-
Utilisation de la mémoire du conteneur : La mémoire consommée par le conteneur Spark, moyennée sur tous les nœuds applicables. Comprend les moyennes de la mémoire non récupérable (
Container memory used), du cache de pages de fichiers du système d'exploitation (Container memory file cache) et de la limite de mémoire configurée (Container memory limit). -
Utilisation du tas JVM : L'utilisation de la mémoire du tas JVM, moyennée sur tous les nœuds applicables. Inclut les moyennes de l’utilisation réelle du tas, la capacité du tas et la limite maximale du tas configurée.
-
Réseau reçu et transmis : Le nombre d'octets reçus et transmis via le réseau par chaque appareil.
-
Espace libre sur le système de fichiers : L'utilisation totale du système de fichiers par chaque point de montage, mesurée en octets.
Cliquez sur Utilisation de la mémoire du nœud en bas du tab Matériel pour développer le graphique supplémentaire suivant :
- Utilisation de la mémoire et du swap : Le graphique linéaire affiche l'utilisation totale du swap de mémoire par mode, mesurée en octets. Le graphique à barres indique l'utilisation totale de la mémoire par mode, également mesurée en octets. Les types d'utilisation suivants sont suivis :
used: Mémoire totale au niveau du système d'exploitation utilisée, y compris la mémoire utilisée par les processus d'arrière-plan s'exécutant sur un compute. Étant donné que le Driver et les processus en arrière-plan utilisent de la mémoire, l’utilisation peut toujours apparaître même lorsque aucun Job Spark n’est en cours d’exécution.other: Mémoire utilisée à des fins autres queused,buffer, oucachedbuffer: Mémoire utilisée par les tampons du noyaucached: Mémoire utilisée par le cache du système de fichiers au niveau de l'OSfree: Mémoire inutilisée. Tout ce qui n'est pas attribué à l'une des catégories ci-dessus dans le graphique est libre.
Graphiques des métriques Spark
Les graphiques de métriques Spark suivants sont disponibles dans l'interface utilisateur des métriques de compute :
- Répartition de la charge du serveur : Ces vignettes affichent l'utilisation du CPU au cours de la dernière minute pour chaque nœud de la ressource de compute. Chaque tuile est un Link cliquable vers la page de métriques du nœud individuel.
- Tâches actives : Le nombre total de tâches en cours d'exécution à un moment donné.
- Nombre total de tâches échouées : Nombre total de tâches ayant échoué dans les exécuteurs.
- Nombre total de tâches terminées : Le nombre total de tâches terminées dans les exécuteurs.
- Nombre total de tâches : Le nombre total de toutes les tâches (en cours, échouées et terminées) dans les exécuteurs.
- Total lecture aléatoire : La taille totale des données de lecture aléatoire, mesurée en octets.
Shuffle readdésigne la somme des données lues sérialisées sur tous les exécuteurs au début d'une étape. - Total des écritures aléatoires : la taille totale des données d’écriture aléatoires, mesurée en octets.
Shuffle Writeest la somme de toutes les données sérialisées écrites sur tous les exécuteurs avant la transmission (normalement à la fin d'une étape). - Durée totale de la tâche : Le temps total écoulé que la JVM a passé à exécuter des tâches sur des exécuteurs, mesuré en secondes.
Graphiques des métriques GPU
Les métriques GPU sont uniquement disponibles sur Databricks Runtime ML 13.3 et versions supérieures.
Les graphiques des métriques GPU suivants sont disponibles dans l'interface utilisateur des métriques de compute :
- Répartition de la charge du serveur : ce graphique montre l'utilisation du processeur au cours de la dernière minute pour chaque nœud.
- Utilisation du décodeur par GPU : Le pourcentage d'utilisation du décodeur GPU.
- Utilisation de l'encodeur par GPU : le pourcentage d'utilisation de l'encodeur GPU.
- **Utilisation de la mémoire tampon de trame par GPU (octets)** : L'utilisation de la mémoire tampon de trame, mesurée en octets.
- **Utilisation de la mémoire par GPU** : Le pourcentage d'utilisation de la mémoire GPU.
- Utilisation par GPU : Le pourcentage d'utilisation du GPU.
Dépannage
Si vous voyez des métriques incomplètes ou manquantes pour une période, il peut s'agir de l'un des problèmes suivants :
- Une panne dans le service Databricks responsable de l'interrogation et du stockage des métriques.
- Problèmes de réseau du côté des clients.
- Le compute est ou était dans un état défaillant.