Tâche de script Python pour les Jobs
Utilisez la tâche **script Python** pour exécuter un fichier Python.
Exigences
- Vous devez upload votre script Python vers un emplacement accessible à l’utilisateur qui configure le job. Databricks vous recommande d'utiliser les fichiers du Workspace pour les scripts Python. Consultez Que sont les fichiers Workspace ?.
Configurer une tâche de script Python
L'interface utilisateur des Jobs affiche les options de manière dynamique en fonction d'autres paramètres configurés.
Databricks déconseille de stocker du code ou des données en utilisant la racine ou les montages DBFS. Au lieu de cela, vous pouvez migrer des scripts Python vers les fichiers Workspace ou les volumes, ou utiliser des URI pour accéder au stockage d'objets cloud.
Pour commencer le flux de configuration d'une tâche Python script :
- Accédez à l'onglet tab dans l'interface utilisateur des Jobs.
- Cliquez sur
Ajouter une tâche .
- Saisissez un nom dans le champ Nom de la tâche .
- Dans le menu déroulant Type , sélectionnez
Python script.
Configurez la source
Dans le menu déroulant Source , sélectionnez un emplacement pour le script Python en utilisant l'une des options suivantes.
Workspace
Utilisez Workspace pour configurer un script Python stocké à l'aide des fichiers de l'espace de travail.
- Cliquez sur le champ Chemin . La boîte de dialogue Sélectionner un fichier Python apparaît.
- Naviguez jusqu'au script Python, cliquez pour sélectionner le fichier, puis cliquez sur Confirmer .
Vous pouvez utiliser cette option pour configurer une tâche sur un script Python stocké dans un dossier Databricks Git. Databricks recommande d'utiliser l'option fournisseur Git et un repository Git distant pour définir la version des assets planifiés avec des jobs.
DBFS/S3
Utilisez DBFS/S3 pour configurer un script Python stocké dans un volume, un emplacement de stockage d'objets cloud ou la racine DBFS.
Databricks recommande de stocker les scripts Python dans les volumes Unity Catalog ou le stockage d'objets cloud.
Dans le champ Chemin , saisissez l'URI de votre script Python. Par exemple, dbfs:/path/to/script.py ou s3://bucket-name/path/to/script.py.
Fournisseur Git
Utilisez le fournisseur Git pour configurer un script Python stocké dans un repository Git distant.
Les options affichées par l’interface utilisateur dépendent du fait que vous ayez déjà configuré ou non un fournisseur Git ailleurs. Un seul repository Git distant peut être utilisé pour toutes les tâches d’un job. Consultez Utiliser Git avec Lakeflow Jobs.
Le champ Chemin apparaît après que vous avez configuré une référence Git.
Saisissez le chemin relatif de votre script Python, tel que etl/bronze/ingest.py.
Lorsque vous entrez le chemin relatif, ne commencez pas par / ou ./. Par exemple, si le chemin absolu du code Python auquel vous souhaitez accéder est /etl/bronze/ingest.py, saisissez etl/bronze/ingest.py dans le champ Chemin .
Configurez le compute et les bibliothèques dépendantes
- Utilisez Compute pour sélectionner ou configurer un cluster qui prend en charge la logique de votre script.
- Si vous utilisez le compute
Serverless, utilisez le champ Environnement et bibliothèques pour sélectionner, modifier ou ajouter un nouvel environnement. Voir Configurer l'environnement Serverless. - Pour toutes les autres configurations de compute, cliquez sur
Ajouter sous Bibliothèques dépendantes . La boîte de dialogue Ajouter une bibliothèque dépendante s'affiche.
- Vous pouvez sélectionner une bibliothèque existante ou upload une nouvelle bibliothèque.
- Vous pouvez uniquement utiliser les bibliothèques stockées dans un emplacement pris en charge par vos configurations de compute. Consultez la prise en charge des bibliothèques Python.
- Chaque source de bibliothèque a un flux différent pour sélectionner ou upload une bibliothèque. Consultez Installer des bibliothèques.
Finaliser la configuration du job
- (Facultatif) Configurez les **parameter** sous forme de liste de chaînes transmises en tant qu'arguments CLI au script Python. Consultez Configurer les paramètres de tâche.
- (Facultatif) Pour configurer les nouvelles tentatives, les threshold de durée d'exécution ou de backlog de streaming, ou les notifications, consultez Paramètres de tâches avancés.
- Cliquez sur Enregistrer la tâche .
Pour modifier, cloner, désactiver ou supprimer cette tâche, consultez Configurer et modifier les tâches dans Lakeflow Jobs.