Aller au contenu principal

groupe de commandespipelines

remarque

L'utilisation de Databricks CLI est soumise à la licence Databricks et à la politique de confidentialité Databricks, y compris toutes les dispositions relatives aux données d'utilisation.

Le groupe de commandes pipelines au sein de la CLI Databricks contient deux ensembles de fonctionnalités. Le premier ensemble vous permet de gérer un projet de pipeline et son workflow. Le deuxième ensemble vous permet de créer, modifier, supprimer, start et afficher les détails des objets de pipeline dans Databricks.

Pour obtenir des informations sur les pipelines, consultez Spark Declarative Pipelines.

Gérer les projets de pipeline

Les commandes suivantes vous permettent de gérer des pipelines dans les projets. Un projet de pipelines est le bundle qui peut contenir un ou plusieurs objets pipeline.

déployer des pipelines Databricks

Déployez les pipelines en uploadant tous les fichiers définis dans le projet vers le Workspace cible, et en créant ou en mettant à jour les pipelines définis dans le Workspace.

important

Pour exécuter cette commande, un fichier databricks.yml Declarative Automation Bundles doit se trouver à la racine du répertoire du projet. Pour un tutoriel qui crée un projet de pipeline, puis déploie et exécute le pipeline, consultez Développer des pipelines avec des Declarative Automation Bundles.

databricks pipelines deploy [flags]

Arguments

Aucun

Options

--auto-approve

Ignorez les approbations interactives qui pourraient être requises pour le déploiement

--fail-on-active-runs

Échec si des pipelines sont en cours d'exécution dans le déploiement.

--force-lock

Forcer l'acquisition du verrouillage de déploiement. Cette option désactive le mécanisme qui empêche les déploiements concurrents d'interagir les uns avec les autres. Il ne doit être utilisé que si le déploiement précédent a échoué ou a été interrompu et a laissé un fichier de verrouillage obsolète.

Indicateurs globaux

databricks pipelines destroy

Détruire un projet de pipelines.

databricks pipelines destroy [flags]

Arguments

Aucun

Options

--auto-approve

Ignorer les approbations interactives pour la suppression des pipelines

--force-lock

Forcer l'acquisition du verrouillage de déploiement. Cette option désactive le mécanisme qui empêche les déploiements concurrents d'interagir les uns avec les autres. Il ne doit être utilisé que si le déploiement précédent a échoué ou a été interrompu et a laissé un fichier de verrouillage obsolète.

Indicateurs globaux

simulation de pipeline Databricks

Valide l'exactitude du Graphe du pipeline, identifié par KEY. Ne matérialise ni ne publie aucun dataset.

databricks pipelines dry-run [flags] [KEY]

Arguments

KEY

Le nom unique du pipeline à simuler, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.

Options

--no-wait

N'attendez pas la fin de l'exécution

--restart

Redémarrez l'exécution si elle est déjà en cours d'exécution.

Indicateurs globaux

Générer des pipelines Databricks

Générer la configuration d'un pipeline Spark existant.

Cette commande recherche un fichier spark-pipeline.yml ou *.spark-pipeline.yml dans le répertoire spécifié et génère un nouveau fichier de configuration *.pipeline.yml dans le dossier resources du projet qui définit le pipeline. Si plusieurs fichiers spark-pipeline.yml existent, spécifiez le chemin complet d’un fichier *.spark-pipeline.yml spécifique.

databricks pipelines generate [flags]
remarque

Pour générer la configuration d'un pipeline existant dans le Databricks Workspace, consultez databricks bundle generate pipeline et Générer la configuration d'un Job ou pipeline existant à l'aide de la Databricks CLI.

Options

--existing-pipeline-dir

Chemin d'accès au répertoire du pipeline existant dans src (par ex., src/my_pipeline).

--force

Remplacer le fichier de configuration du pipeline existant.

Indicateurs globaux

Exemples

L'exemple suivant recherche dans le répertoire actuel et lit src/my_pipeline/spark-pipeline.yml, puis crée un fichier de configuration resources/my_pipeline.pipeline.yml qui définit le pipeline :

Bash
databricks pipelines generate --existing-pipeline-dir src/my_pipeline

historique des pipelines Databricks

Récupérez les exécutions précédentes d'un pipeline identifié par KEY.

databricks pipelines history [flags] [KEY]

Arguments

KEY

Le nom unique du pipeline, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.

Options

--end-time string

Filtrez les mises à jour avant cette heure (format : 2025-01-15T10:30:00Z).

--start-time string

Filtrer les mises à jour après cette heure (format : 2025-01-15T10:30:00Z)

Indicateurs globaux

Initialisation des pipelines Databricks

Initialisez un nouveau projet de pipelines.

Pour un tutoriel qui vous guide à travers la création, le déploiement et l'exécution d'un projet de pipeline à l'aide de l'interface de ligne de commande Databricks, consultez Développer des pipelines avec des offres groupées d'automatisation déclaratives.

databricks pipelines init [flags]

Arguments

Aucun

Options

--config-file string

Fichier JSON contenant les paires clé-valeur des paramètres d'entrée requis pour l'initialisation du Template

--output-dir string

Répertoire dans lequel écrire le template initialisé

Indicateurs globaux

logs des pipelines Databricks

Récupérez les événements du pipeline identifié par KEY. Par défaut, cette commande affiche les événements de la mise à jour la plus récente du pipeline.

databricks pipelines logs [flags] [KEY]

Arguments

KEY

Le nom unique du pipeline, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.

Options

--end-time string

Filtrer les événements qui sont avant cette heure de fin (format : 2025-01-15T10:30:00Z)

--event-type strings

Filtrer les événements par liste de types d'événements

--level strings

Filtrer les événements par liste de niveaux de Logs (INFO, WARN, ERROR, METRICS)

-n, --number int

Nombre d’événements à renvoyer

--start-time string

Filtrer les événements postérieurs à cette heure de start (format : 2025-01-15T10:30:00Z)

--update-id string

Filtrer les événements par ID de mise à jour. S'il n'est pas fourni, utilise l'ID de mise à jour la plus récente.

Indicateurs globaux

Exemples

Bash
databricks pipelines logs pipeline-name --update-id update-1 -n 10
Bash
databricks pipelines logs pipeline-name --level ERROR,METRICS --event-type update_progress --start-time 2025-01-15T10:30:00Z

Ouvrir les pipelines Databricks

Ouvrez un pipeline dans le navigateur, identifié par KEY.

databricks pipelines open [flags] [KEY]

Arguments

KEY

Le nom unique du pipeline à ouvrir, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.

Options

--force-pull

Ignorer le cache local et charger l'état à partir du workspace distant

Indicateurs globaux

Exécuter les pipelines Databricks

Exécutez le pipeline identifié par KEY. refresh toutes les tables du pipeline, sauf indication contraire.

important

Pour exécuter cette commande, un fichier databricks.yml Declarative Automation Bundles doit se trouver à la racine du répertoire du projet et le pipeline doit avoir déjà été déployé. Pour un tutoriel qui crée un projet de pipeline, puis déploie et exécute le pipeline, consultez Développer des pipelines avec des Declarative Automation Bundles.

databricks pipelines run [flags] [KEY]

Arguments

KEY

Le nom unique du pipeline à exécuter, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.

Options

--full-refresh strings

Liste des tables à Reset et à recalculer

--full-refresh-all

Effectuer un reset complet du graphe et recalculer

--no-wait

N'attendez pas la fin de l'exécution

--refresh strings

Liste des tables à exécuter

--restart

Redémarrez l'exécution si elle est déjà en cours d'exécution.

Indicateurs globaux

databricks pipeline arrêter

Arrêtez le pipeline s'il est en cours d'exécution, identifié par KEY ou PIPELINE_ID. S'il n'y a pas de mise à jour active pour le pipeline, cette requête est sans effet.

databricks pipelines stop [KEY|PIPELINE_ID] [flags]

Arguments

KEY

Nom unique du pipeline à arrêter, tel que défini dans son fichier YAML. S'il n'y a qu'un seul pipeline dans le projet, KEY est facultatif et le pipeline est sélectionné automatiquement.

PIPELINE_ID

L'UUID du pipeline à arrêter.

Options

--no-wait

Ne pas attendre d'atteindre l'état d'inactivité.

--timeout duration

Durée maximale pour atteindre l'état INACTIF (default 20m0s)

Indicateurs globaux

Gérer les objets du pipeline

Les commandes suivantes vous permettent de gérer des objets de pipeline dans Databricks. Un objet de pipeline est un pipeline unique au sein d'un projet.

databricks pipelines create

Créez un nouveau pipeline de traitement de données basé sur la configuration demandée. En cas de succès, cette commande renvoie l'ID du nouveau pipeline.

databricks pipelines create [flags]

Arguments

Aucun

Options

--json JSON

La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.

Indicateurs globaux

Supprimer les pipelines Databricks

Supprimer un pipeline.

databricks pipelines delete PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline à supprimer.

Options

Indicateurs globaux

Récupérer les pipelines Databricks

Obtenir un pipeline.

databricks pipelines get PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline à obtenir.

Options

Indicateurs globaux

databricks pipelines get-update

Obtenez une mise à jour à partir d'un pipeline actif.

databricks pipelines get-update PIPELINE_ID UPDATE_ID [flags]

Arguments

PIPELINE_ID

ID du pipeline.

UPDATE_ID

L'ID de la mise à jour.

Options

Indicateurs globaux

databricks pipelines list-pipeline-events

Récupérez les événements pour un pipeline.

databricks pipelines list-pipeline-events PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline pour récupérer les événements.

Options

--filter string

Critères pour sélectionner un sous-ensemble de résultats, exprimés à l'aide d'une syntaxe de type SQL.

--max-results int

Nombre maximal d'entrées à renvoyer sur une seule page.

--page-token string

Jeton de page renvoyé par l'appel précédent.

Indicateurs globaux

Pipelines Databricks - listes

Listez les pipelines définis dans le système Delta Live Tables.

databricks pipelines list-pipelines [flags]

Arguments

Aucun

Options

--filter string

Sélectionnez un sous-ensemble de résultats basé sur les critères spécifiés.

--max-results int

Le nombre maximal d'entrées à renvoyer sur une seule page.

--page-token string

Jeton de page renvoyé par l'appel précédent.

Indicateurs globaux

Liste des mises à jour des pipelines Databricks

Lister les mises à jour d'un pipeline actif.

databricks pipelines list-updates PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline pour lequel renvoyer les mises à jour.

Options

--max-results int

Nombre maximal d'entrées à renvoyer sur une seule page.

--page-token string

Jeton de page renvoyé par l'appel précédent.

--until-update-id string

Le cas échéant, renvoie les mises à jour jusqu'à et y compris cet update_id.

Indicateurs globaux

databricks pipelines start-update

start une nouvelle mise à jour pour le pipeline. S’il y a déjà une mise à jour active pour le pipeline, la requête échouera et la mise à jour active restera en cours d’exécution.

databricks pipelines start-update PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline pour lequel start une mise à jour.

Options

--cause StartUpdateCause

Valeurs prises en charge : [API_CALL, JOB_TASK, RETRY_ON_FAILURE, SCHEMA_CHANGE, SERVICE_UPGRADE, USER_ACTION]

--full-refresh

Si cette option est activée, cette mise à jour réinitialisera Reset toutes les tables avant l'exécution.

--json JSON

La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.

--validate-only

Si la valeur est vraie, cette mise à jour ne fait que valider la conformité du code source du pipeline, mais ne matérialise ni ne publie aucun dataset.

Indicateurs globaux

Mise à jour des pipelines Databricks

Mettre à jour un pipeline avec la configuration fournie

databricks pipelines update PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Identifiant unique pour ce pipeline.

Options

--allow-duplicate-names

Si la valeur est fausse, le déploiement échouera si le nom a changé et qu’il entre en conflit avec le nom d’un autre pipeline.

--budget-policy-id string

Politique budgétaire de ce pipeline.

--catalog string

Un catalogue dans Unity Catalog pour y publier les données de ce pipeline.

--channel string

Lakeflow pipelines Canal de distribution qui spécifie la version à utiliser.

--continuous

Que le pipeline soit continu ou déclenché.

--edition string

Édition de produit du pipeline.

--expected-last-modified int

Le cas échéant, l'heure de dernière modification des paramètres du pipeline avant la modification.

--id string

Identifiant unique pour ce pipeline.

--json JSON

La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.

--name string

Identifiant convivial pour ce pipeline.

--photon

Détermine si Photon est activé pour ce pipeline.

--pipeline-id string

Identifiant unique pour ce pipeline.

--schema string

Le schema default (base de données) à partir duquel les tables sont lues ou vers lequel elles sont publiées.

--serverless

Si le compute serverless est activé pour ce pipeline.

--storage string

Répertoire racine DBFS pour le stockage des points de contrôle et des tables.

--target string

Schéma cible (base de données) pour ajouter des tables dans ce pipeline.

Indicateurs globaux

databricks pipelines obtenir-niveaux-d'autorisation

Obtenir les niveaux d'autorisation du pipeline.

databricks pipelines get-permission-levels PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline pour lequel obtenir ou gérer les autorisations.

Options

Indicateurs globaux

databricks pipelines get-permissions

Obtenir les autorisations d'un pipeline. Les pipelines peuvent hériter des autorisations de leur objet racine.

databricks pipelines get-permissions PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline pour lequel obtenir ou gérer les autorisations.

Options

Indicateurs globaux

databricks pipelines set-permissions

Définir les autorisations du pipeline.

Définit les autorisations sur un objet, en remplaçant les autorisations existantes si elles existent. Supprime toutes les autorisations directes si aucune n'est spécifiée. Les objets peuvent hériter des autorisations de leur objet racine.

databricks pipelines set-permissions PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline pour lequel obtenir ou gérer les autorisations.

Options

--json JSON

La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.

Indicateurs globaux

databricks pipelines update-permissions

Mettez à jour les autorisations sur un pipeline. Les pipelines peuvent hériter des autorisations de leur objet racine.

databricks pipelines update-permissions PIPELINE_ID [flags]

Arguments

PIPELINE_ID

Le pipeline pour lequel obtenir ou gérer les autorisations.

Options

--json JSON

La chaîne JSON en ligne ou le @chemin vers le fichier JSON avec le corps de la requête.

Indicateurs globaux

Drapeaux globaux

--debug

Activer ou non la journalisation de débogage.

-h OU --help

Afficher l'aide de Databricks CLI ou du groupe de commandes associé ou de la commande associée.

--log-file chaîne

Une chaîne représentant le fichier dans lequel écrire les logs de sortie. Si cet indicateur n'est pas spécifié, la default est d'écrire les logs de sortie dans stderr.

--log-format Format

Le type de format de log, text ou json. La valeur par default est text.

--log-level chaîne

Une chaîne représentant le niveau de format du log. S'il n'est pas spécifié, le niveau de format du log est désactivé.

-o, --output Type

Le type de sortie de commande, text ou json. La valeur par default est text.

-p, --profile chaîne

Nom du profil dans le fichier ~/.databrickscfg à utiliser pour exécuter la commande. Si cet indicateur n'est pas spécifié, alors s'il existe, le profil nommé DEFAULT est utilisé.

--progress-format Format

Le format pour afficher les logs de progression : default, append, inplace ou json

-t, --target chaîne

Le cas échéant, la cible de bundle à utiliser