groupe de commandespipelines
L'utilisation de Databricks CLI est soumise à la licence Databricks et à la politique de confidentialité Databricks, y compris toutes les dispositions relatives aux données d'utilisation.
Le groupe de commandes pipelines au sein de la CLI Databricks contient deux ensembles de fonctionnalités. Le premier ensemble vous permet de gérer un projet de pipeline et son workflow. Le deuxième ensemble vous permet de créer, modifier, supprimer, start et afficher les détails des objets de pipeline dans Databricks.
Pour obtenir des informations sur les pipelines, consultez Spark Declarative Pipelines.
Gérer les projets de pipeline
Les commandes suivantes vous permettent de gérer des pipelines dans les projets. Un projet de pipelines est le bundle qui peut contenir un ou plusieurs objets pipeline.
déployer des pipelines Databricks
Déployez les pipelines en uploadant tous les fichiers définis dans le projet vers le Workspace cible, et en créant ou en mettant à jour les pipelines définis dans le Workspace.
Pour exécuter cette commande, un fichier databricks.yml Declarative Automation Bundles doit se trouver à la racine du répertoire du projet. Pour un tutoriel qui crée un projet de pipeline, puis déploie et exécute le pipeline, consultez Développer des pipelines avec des Declarative Automation Bundles.
databricks pipelines deploy [flags]
Arguments
Aucun
Options
--auto-approve
Ignorez les approbations interactives qui pourraient être requises pour le déploiement
--fail-on-active-runs
Échec si des pipelines sont en cours d'exécution dans le déploiement.
--force-lock
Forcer l'acquisition du verrouillage de déploiement. Cette option désactive le mécanisme qui empêche les déploiements concurrents d'interagir les uns avec les autres. Il ne doit être utilisé que si le déploiement précédent a échoué ou a été interrompu et a laissé un fichier de verrouillage obsolète.
databricks pipelines destroy
Détruire un projet de pipelines.
databricks pipelines destroy [flags]
Arguments
Aucun
Options
--auto-approve
Ignorer les approbations interactives pour la suppression des pipelines
--force-lock
Forcer l'acquisition du verrouillage de déploiement. Cette option désactive le mécanisme qui empêche les déploiements concurrents d'interagir les uns avec les autres. Il ne doit être utilisé que si le déploiement précédent a échoué ou a été interrompu et a laissé un fichier de verrouillage obsolète.
simulation de pipeline Databricks
Valide l'exactitude du Graphe du pipeline, identifié par KEY. Ne matérialise ni ne publie aucun dataset.
databricks pipelines dry-run [flags] [KEY]
Arguments
KEY
Le nom unique du pipeline à simuler, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.
Options
--no-wait
N'attendez pas la fin de l'exécution
--restart
Redémarrez l'exécution si elle est déjà en cours d'exécution.
Générer des pipelines Databricks
Générer la configuration d'un pipeline Spark existant.
Cette commande recherche un fichier spark-pipeline.yml ou *.spark-pipeline.yml dans le répertoire spécifié et génère un nouveau fichier de configuration *.pipeline.yml dans le dossier resources du projet qui définit le pipeline. Si plusieurs fichiers spark-pipeline.yml existent, spécifiez le chemin complet d’un fichier *.spark-pipeline.yml spécifique.
databricks pipelines generate [flags]
Pour générer la configuration d'un pipeline existant dans le Databricks Workspace, consultez databricks bundle generate pipeline et Générer la configuration d'un Job ou pipeline existant à l'aide de la Databricks CLI.
Options
--existing-pipeline-dir
Chemin d'accès au répertoire du pipeline existant dans src (par ex., src/my_pipeline).
--force
Remplacer le fichier de configuration du pipeline existant.
Exemples
L'exemple suivant recherche dans le répertoire actuel et lit src/my_pipeline/spark-pipeline.yml, puis crée un fichier de configuration resources/my_pipeline.pipeline.yml qui définit le pipeline :
databricks pipelines generate --existing-pipeline-dir src/my_pipeline
historique des pipelines Databricks
Récupérez les exécutions précédentes d'un pipeline identifié par KEY.
databricks pipelines history [flags] [KEY]
Arguments
KEY
Le nom unique du pipeline, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.
Options
--end-time string
Filtrez les mises à jour avant cette heure (format : 2025-01-15T10:30:00Z).
--start-time string
Filtrer les mises à jour après cette heure (format : 2025-01-15T10:30:00Z)
Initialisation des pipelines Databricks
Initialisez un nouveau projet de pipelines.
Pour un tutoriel qui vous guide à travers la création, le déploiement et l'exécution d'un projet de pipeline à l'aide de l'interface de ligne de commande Databricks, consultez Développer des pipelines avec des offres groupées d'automatisation déclaratives.
databricks pipelines init [flags]
Arguments
Aucun
Options
--config-file string
Fichier JSON contenant les paires clé-valeur des paramètres d'entrée requis pour l'initialisation du Template
--output-dir string
Répertoire dans lequel écrire le template initialisé
logs des pipelines Databricks
Récupérez les événements du pipeline identifié par KEY. Par défaut, cette commande affiche les événements de la mise à jour la plus récente du pipeline.
databricks pipelines logs [flags] [KEY]
Arguments
KEY
Le nom unique du pipeline, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.
Options
--end-time string
Filtrer les événements qui sont avant cette heure de fin (format : 2025-01-15T10:30:00Z)
--event-type strings
Filtrer les événements par liste de types d'événements
--level strings
Filtrer les événements par liste de niveaux de Logs (INFO, WARN, ERROR, METRICS)
-n, --number int
Nombre d’événements à renvoyer
--start-time string
Filtrer les événements postérieurs à cette heure de start (format : 2025-01-15T10:30:00Z)
--update-id string
Filtrer les événements par ID de mise à jour. S'il n'est pas fourni, utilise l'ID de mise à jour la plus récente.
Exemples
databricks pipelines logs pipeline-name --update-id update-1 -n 10
databricks pipelines logs pipeline-name --level ERROR,METRICS --event-type update_progress --start-time 2025-01-15T10:30:00Z
Ouvrir les pipelines Databricks
Ouvrez un pipeline dans le navigateur, identifié par KEY.
databricks pipelines open [flags] [KEY]
Arguments
KEY
Le nom unique du pipeline à ouvrir, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.
Options
--force-pull
Ignorer le cache local et charger l'état à partir du workspace distant
Exécuter les pipelines Databricks
Exécutez le pipeline identifié par KEY. refresh toutes les tables du pipeline, sauf indication contraire.
Pour exécuter cette commande, un fichier databricks.yml Declarative Automation Bundles doit se trouver à la racine du répertoire du projet et le pipeline doit avoir déjà été déployé. Pour un tutoriel qui crée un projet de pipeline, puis déploie et exécute le pipeline, consultez Développer des pipelines avec des Declarative Automation Bundles.
databricks pipelines run [flags] [KEY]
Arguments
KEY
Le nom unique du pipeline à exécuter, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.
Options
--full-refresh strings
Liste des tables à Reset et à recalculer
--full-refresh-all
Effectuer un reset complet du graphe et recalculer
--no-wait
N'attendez pas la fin de l'exécution
--refresh strings
Liste des tables à exécuter
--restart
Redémarrez l'exécution si elle est déjà en cours d'exécution.
databricks pipeline arrêter
Arrêtez le pipeline s'il est en cours d'exécution, identifié par KEY ou PIPELINE_ID. S'il n'y a pas de mise à jour active pour le pipeline, cette requête est sans effet.
databricks pipelines stop [KEY|PIPELINE_ID] [flags]
Arguments
KEY
Nom unique du pipeline à arrêter, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.
PIPELINE_ID
L'UUID du pipeline à arrêter.
Options
--no-wait
Ne pas attendre d'atteindre l'état d'inactivité.
--timeout duration
Durée maximale pour atteindre l'état INACTIF (default 20m0s)
Gérer les objets du pipeline
Les commandes suivantes vous permettent de gérer des objets de pipeline dans Databricks. Un objet de pipeline est un pipeline unique au sein d'un projet.
databricks pipelines create
Créez un nouveau pipeline de traitement de données basé sur la configuration demandée. En cas de succès, cette commande renvoie l'ID du nouveau pipeline.
databricks pipelines create [flags]
Arguments
Aucun
Options
--json JSON
La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.
Supprimer les pipelines Databricks
Supprimer un pipeline.
databricks pipelines delete PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline à supprimer.
Options
Récupérer les pipelines Databricks
Obtenir un pipeline.
databricks pipelines get PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline à obtenir.
Options
databricks pipelines get-update
Obtenez une mise à jour à partir d'un pipeline actif.
databricks pipelines get-update PIPELINE_ID UPDATE_ID [flags]
Arguments
PIPELINE_ID
ID du pipeline.
UPDATE_ID
L'ID de la mise à jour.
Options
databricks pipelines list-pipeline-events
Récupérez les événements pour un pipeline.
databricks pipelines list-pipeline-events PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline pour récupérer les événements.
Options
--filter string
Critères pour sélectionner un sous-ensemble de résultats, exprimés à l'aide d'une syntaxe de type SQL.
--max-results int
Nombre maximal d'entrées à renvoyer sur une seule page.
--page-token string
Jeton de page renvoyé par l'appel précédent.
Pipelines Databricks - listes
Listez les pipelines définis dans le système Delta Live Tables.
databricks pipelines list-pipelines [flags]
Arguments
Aucun
Options
--filter string
Sélectionnez un sous-ensemble de résultats basé sur les critères spécifiés.
--max-results int
Le nombre maximal d'entrées à renvoyer sur une seule page.
--page-token string
Jeton de page renvoyé par l'appel précédent.
Liste des mises à jour des pipelines Databricks
Lister les mises à jour d'un pipeline actif.
databricks pipelines list-updates PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline pour lequel renvoyer les mises à jour.
Options
--max-results int
Nombre maximal d'entrées à renvoyer sur une seule page.
--page-token string
Jeton de page renvoyé par l'appel précédent.
--until-update-id string
Le cas échéant, renvoie les mises à jour jusqu'à et y compris cet update_id.
databricks pipelines start-update
start une nouvelle mise à jour pour le pipeline. S’il y a déjà une mise à jour active pour le pipeline, la requête échouera et la mise à jour active restera en cours d’exécution.
databricks pipelines start-update PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline pour lequel start une mise à jour.
Options
--cause StartUpdateCause
Valeurs prises en charge : [API_CALL, JOB_TASK, RETRY_ON_FAILURE, SCHEMA_CHANGE, SERVICE_UPGRADE, USER_ACTION]
--full-refresh
Si cette option est activée, cette mise à jour réinitialisera Reset toutes les tables avant l'exécution.
--json JSON
La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.
--validate-only
Si la valeur est vraie, cette mise à jour ne fait que valider la conformité du code source du pipeline, mais ne matérialise ni ne publie aucun dataset.
Mise à jour des pipelines Databricks
Mettre à jour un pipeline avec la configuration fournie
databricks pipelines update PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Identifiant unique pour ce pipeline.
Options
--allow-duplicate-names
Si la valeur est fausse, le déploiement échouera si le nom a changé et qu’il entre en conflit avec le nom d’un autre pipeline.
--budget-policy-id string
Politique budgétaire de ce pipeline.
--catalog string
Un catalogue dans Unity Catalog pour y publier les données de ce pipeline.
--channel string
Lakeflow pipelines Canal de distribution qui spécifie la version à utiliser.
--continuous
Que le pipeline soit continu ou déclenché.
--edition string
Édition de produit du pipeline.
--expected-last-modified int
Le cas échéant, l'heure de dernière modification des paramètres du pipeline avant la modification.
--id string
Identifiant unique pour ce pipeline.
--json JSON
La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.
--name string
Identifiant convivial pour ce pipeline.
--photon
Détermine si Photon est activé pour ce pipeline.
--pipeline-id string
Identifiant unique pour ce pipeline.
--schema string
Le schema default (base de données) à partir duquel les tables sont lues ou vers lequel elles sont publiées.
--serverless
Si le compute serverless est activé pour ce pipeline.
--storage string
Répertoire racine DBFS pour le stockage des points de contrôle et des tables.
--target string
Schéma cible (base de données) pour ajouter des tables dans ce pipeline.
databricks pipelines obtenir-niveaux-d'autorisation
Obtenir les niveaux d'autorisation du pipeline.
databricks pipelines get-permission-levels PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline pour lequel obtenir ou gérer les autorisations.
Options
databricks pipelines get-permissions
Obtenir les autorisations d'un pipeline. Les pipelines peuvent hériter des autorisations de leur objet racine.
databricks pipelines get-permissions PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline pour lequel obtenir ou gérer les autorisations.
Options
databricks pipelines set-permissions
Définir les autorisations du pipeline.
Définit les autorisations sur un objet, en remplaçant les autorisations existantes si elles existent. Supprime toutes les autorisations directes si aucune n'est spécifiée. Les objets peuvent hériter des autorisations de leur objet racine.
databricks pipelines set-permissions PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline pour lequel obtenir ou gérer les autorisations.
Options
--json JSON
La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.
databricks pipelines update-permissions
Mettez à jour les autorisations sur un pipeline. Les pipelines peuvent hériter des autorisations de leur objet racine.
databricks pipelines update-permissions PIPELINE_ID [flags]
Arguments
PIPELINE_ID
Le pipeline pour lequel obtenir ou gérer les autorisations.
Options
--json JSON
La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.
Drapeaux globaux
--debug
Activer ou non la journalisation de débogage.
-h OU --help
Afficher l'aide de Databricks CLI ou du groupe de commandes associé ou de la commande associée.
--log-file chaîne
Une chaîne représentant le fichier dans lequel écrire les logs de sortie. Si cet indicateur n'est pas spécifié, la default est d'écrire les logs de sortie dans stderr.
--log-format Format
Le type de format de log, text ou json. La valeur par default est text.
--log-level chaîne
Une chaîne représentant le niveau de format du log. S'il n'est pas spécifié, le niveau de format du log est désactivé.
-o, --output Type
Le type de sortie de commande, text ou json. La valeur par default est text.
-p, --profile chaîne
Nom du profil dans le fichier ~/.databrickscfg à utiliser pour exécuter la commande. Si cet indicateur n'est pas spécifié, alors s'il existe, le profil nommé DEFAULT est utilisé.
--progress-format Format
Le format pour afficher les logs de progression : default, append, inplace ou json
-t, --target chaîne
Le cas échéant, la cible de bundle à utiliser