Redémarrer le processus Python sur Databricks
Vous pouvez redémarrer par programmation le processus Python sur Databricks pour vous assurer que les bibliothèques installées localement ou mises à niveau fonctionnent correctement dans le noyau Python pour votre SparkSession actuelle.
Lorsque vous redémarrez le processus Python, vous perdez les informations d'état de Python. Databricks recommande d'installer toutes les bibliothèques limitées à la session au début d'un Notebook et d'exécuter dbutils.library.restartPython() pour nettoyer le processus Python avant de poursuivre.
Vous pouvez utiliser ce processus dans des notebooks interactifs ou pour des tâches Python planifiées avec des jobs.
Qu'est-ce que dbutils.library.restartPython?
La fonction d'aide dbutils.library.restartPython() est la méthode recommandée pour redémarrer le processus Python dans un Notebook Databricks.
La plupart des fonctions du sous-module dbutils.library sont obsolètes. Databricks recommande fortement d'utiliser %pip pour gérer toutes les installations de bibliothèques délimitées aux Notebook. Consultez la section Bibliothèques Python limitées au Notebook.
Quand devez-vous redémarrer votre processus Python ?
Il est recommandé de redémarrer votre processus Python chaque fois que vous effectuez une installation locale qui inclut l'un des éléments suivants :
- Spécifier une version d’un package inclus dans Databricks Runtime.
- Installation d'une version personnalisée d'un package inclus dans Databricks Runtime.
- Mettre à jour explicitement une bibliothèque vers la dernière version en utilisant
%pip install <library-name> --upgrade. - Configuration d'un environnement personnalisé à partir d'un fichier
requirements.txtlocal. - Installation d'une bibliothèque nécessitant de modifier les versions des bibliothèques dépendantes incluses dans Databricks Runtime.