Aller au contenu principal

Ressources Declarative Automation Bundles

Les Bundles d’automatisation déclarative (anciennement appelés Databricks Asset Bundles) vous permettent de spécifier des informations sur les Ressources Databricks utilisées par le bundle dans le mappage resources de la configuration du bundle. Voir la référence des ressources.

Cette page fournit une référence de configuration pour tous les types de ressources pris en charge pour les bundles et fournit des détails et un exemple pour chaque type pris en charge. Pour des exemples supplémentaires, consultez Exemples de configuration de bundle.

Le schéma JSON des bundles utilisé pour valider la configuration YAML se trouve dans le repository GitHub du Databricks CLI.

astuce

Pour générer du YAML pour toute Ressource existante, utilisez la commande databricks bundle generate. Consultez databricks bundle generate.

Ressources prises en charge

Le tableau suivant répertorie les types de Ressources pris en charge pour les bundles (YAML et Python, le cas échéant). Certaines ressources peuvent être créées en les définissant dans un bundle et en déployant ce bundle, et certaines ressources ne peuvent être créées qu’en référençant un asset existant à inclure dans le bundle.

La configuration de la ressource définit un objet Databricks qui correspond à un objet Databricks REST API. Les champs de requête de création pris en charge de l'objet REST API, exprimés en YAML, sont les clés prises en charge de la ressource. Les liens vers la documentation de l'objet correspondant à chaque ressource se trouvent dans le tableau ci-dessous.

astuce

La commande databricks bundle validate retourne des avertissements si des propriétés de ressource inconnues sont trouvées dans les fichiers de configuration de bundle.

alerte

Type: Map

La ressource d'alerte définit une alerte SQL (v2).

Ajouté dans la version 0,279.0 de Databricks CLI

YAML
alerts:
<alert-name>:
<alert-field-name>: <alert-field-value>

Clé

Type

Description

custom_description

Chaîne

Facultatif. Description personnalisée de l'alerte. Prend en charge le Template Mustache.

Ajouté dans la version 0,279.0 de Databricks CLI

custom_summary

Chaîne

Facultatif. Résumé personnalisé de l'alerte. Prend en charge le Template Mustache.

Ajouté dans la version 0,279.0 de Databricks CLI

display_name

Chaîne

Obligatoire. Le nom d'affichage de l'alerte, par exemple, Example alert.

Ajouté dans la version 0,279.0 de Databricks CLI

evaluation

Carte

Obligatoire. La configuration d'évaluation pour l'alerte. Consultez alert.evaluation.

Ajouté dans la version 0,279.0 de Databricks CLI

file_path

Chaîne

Le chemin d'accès au fichier local de l'asset d'alerte.

Ajouté dans la version 0.282.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0,279.0 de Databricks CLI

parent_path

Chaîne

Facultatif. Le chemin du workspace du dossier contenant l’alerte. Ne peut être défini qu’à la création et ne peut pas être mis à jour. Exemple : /Users/someone@example.com.

Ajouté dans la version 0,279.0 de Databricks CLI

permissions

Séquence

Les autorisations d'alerte. Afficher les autorisations.

Ajouté dans la version 0,279.0 de Databricks CLI

query_text

Chaîne

Obligatoire. Texte de la query à exécuter, par exemple, SELECT 1.

Ajouté dans la version 0,279.0 de Databricks CLI

run_as

Carte

Facultatif. Spécifie l'identité qui sera utilisée pour exécuter l'alerte. Ce champ vous permet de configurer des alertes à exécuter en tant qu'utilisateur spécifique ou Service Principal. Voir run_as.

  • Pour l'identité de l'utilisateur : définissez user_name sur l'e-mail d'un utilisateur de workspace actif. Les utilisateurs peuvent uniquement définir cela sur leur propre e-mail.
  • Pour le Service Principal : définissez service_principal_name comme ID de l'application. Nécessite le rôle servicePrincipal/utilisateur. Si elle n’est pas spécifiée, l’alerte sera exécutée en tant qu’utilisateur de la demande.

Ajouté dans la version 0,279.0 de Databricks CLI

schedule

Carte

Obligatoire. La configuration de la planification de l'alerte. Voir alert.schedule.

Ajouté dans la version 0,279.0 de Databricks CLI

warehouse_id

Chaîne

Obligatoire. ID du SQL Warehouse attaché à l'alerte, par exemple, a7066a8ef796be84.

Ajouté dans la version 0,279.0 de Databricks CLI

Clé

Type

Description

custom_description

Chaîne

Facultatif. Description personnalisée de l'alerte. Prend en charge le Template Mustache.

Ajouté dans la version 0,279.0 de Databricks CLI

custom_summary

Chaîne

Facultatif. Résumé personnalisé de l'alerte. Prend en charge le Template Mustache.

Ajouté dans la version 0,279.0 de Databricks CLI

display_name

Chaîne

Obligatoire. Le nom d'affichage de l'alerte, par exemple, Example alert.

Ajouté dans la version 0,279.0 de Databricks CLI

evaluation

Carte

Obligatoire. La configuration d'évaluation pour l'alerte. Consultez alert.evaluation.

Ajouté dans la version 0,279.0 de Databricks CLI

file_path

Chaîne

Le chemin d'accès au fichier local de l'asset d'alerte.

Ajouté dans la version 0.282.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0,279.0 de Databricks CLI

parent_path

Chaîne

Facultatif. Le chemin du workspace du dossier contenant l’alerte. Ne peut être défini qu’à la création et ne peut pas être mis à jour. Exemple : /Users/someone@example.com.

Ajouté dans la version 0,279.0 de Databricks CLI

permissions

Séquence

Les autorisations d'alerte. Afficher les autorisations.

Ajouté dans la version 0,279.0 de Databricks CLI

query_text

Chaîne

Obligatoire. Texte de la query à exécuter, par exemple, SELECT 1.

Ajouté dans la version 0,279.0 de Databricks CLI

run_as

Carte

Facultatif. Spécifie l'identité qui sera utilisée pour exécuter l'alerte. Ce champ vous permet de configurer des alertes à exécuter en tant qu'utilisateur spécifique ou Service Principal. Voir run_as.

  • Pour l'identité de l'utilisateur : définissez user_name sur l'e-mail d'un utilisateur de workspace actif. Les utilisateurs peuvent uniquement définir cela sur leur propre e-mail.
  • Pour le Service Principal : définissez service_principal_name comme ID de l'application. Nécessite le rôle servicePrincipal/utilisateur. Si elle n’est pas spécifiée, l’alerte sera exécutée en tant qu’utilisateur de la demande.

Ajouté dans la version 0,279.0 de Databricks CLI

schedule

Carte

Obligatoire. La configuration de la planification de l'alerte. Voir alert.schedule.

Ajouté dans la version 0,279.0 de Databricks CLI

warehouse_id

Chaîne

Obligatoire. ID du SQL Warehouse attaché à l'alerte, par exemple, a7066a8ef796be84.

Ajouté dans la version 0,279.0 de Databricks CLI

alerte.évaluation

Type: Map

La configuration d'évaluation pour l'alerte.

Clé

Type

Description

comparison_operator

Chaîne

L'opérateur utilisé pour la comparaison dans l'évaluation de l'alerte.

empty_result_state

Chaîne

L'état de l'alerte si le résultat est vide. Évitez de définir ce champ sur UNKNOWN car l'état UNKNOWN devrait être déprécié.

notification

Carte

L'utilisateur ou toute autre destination à notifier lorsque l'alerte est déclenchée. Consultez alert.evaluation.notification.

source

Carte

La colonne source du résultat à utiliser pour évaluer l'alerte. Voir alert.evaluation.source.

threshold

Carte

Le threshold à utiliser pour l'évaluation des alertes. Il peut s'agir d'une colonne ou d'une valeur. Voir alert.evaluation.threshold.

Clé

Type

Description

comparison_operator

Chaîne

L'opérateur utilisé pour la comparaison dans l'évaluation de l'alerte.

empty_result_state

Chaîne

L'état de l'alerte si le résultat est vide. Évitez de définir ce champ sur UNKNOWN car l'état UNKNOWN devrait être déprécié.

notification

Carte

L'utilisateur ou toute autre destination à notifier lorsque l'alerte est déclenchée. Consultez alert.evaluation.notification.

source

Carte

La colonne source du résultat à utiliser pour évaluer l'alerte. Voir alert.evaluation.source.

threshold

Carte

Le threshold à utiliser pour l'évaluation des alertes. Il peut s'agir d'une colonne ou d'une valeur. Voir alert.evaluation.threshold.

alert.evaluation.notification

Type: Map

L'utilisateur ou toute autre destination à notifier lorsque l'alerte est Trigger.

Clé

Type

Description

notify_on_ok

Booléen

Facultatif. Faut-il notifier les abonnés à l'alerte lorsque l'alerte redevient normale.

retrigger_seconds

Entier

Facultatif. Nombre de secondes qu'une alerte attend après avoir été déclenchée avant d'être autorisée à envoyer une autre notification. Si la valeur est 0 ou si elle est omise, l'alerte n'enverra aucune autre notification après le premier trigger. Définir cette valeur sur 1 permet à l'alerte d'envoyer une notification à chaque évaluation où la condition est remplie, la faisant ainsi se redéclencher en permanence à des fins de notification.

subscriptions

Séquence

Facultatif. Liste non ordonnée des abonnements aux notifications. Voir alert.evaluation.notification.subscriptions.

Clé

Type

Description

notify_on_ok

Booléen

Facultatif. Faut-il notifier les abonnés à l'alerte lorsque l'alerte redevient normale.

retrigger_seconds

Entier

Facultatif. Nombre de secondes qu'une alerte attend après avoir été déclenchée avant d'être autorisée à envoyer une autre notification. Si la valeur est 0 ou si elle est omise, l'alerte n'enverra aucune autre notification après le premier trigger. Définir cette valeur sur 1 permet à l'alerte d'envoyer une notification à chaque évaluation où la condition est remplie, la faisant ainsi se redéclencher en permanence à des fins de notification.

subscriptions

Séquence

Facultatif. Liste non ordonnée des abonnements aux notifications. Voir alert.evaluation.notification.subscriptions.

alert.evaluation.notification.subscriptions

Type: Sequence

Une liste non ordonnée d'abonnements aux notifications.

Chaque élément de la liste est un AlertSubscription:

Clé

Type

Description

destination_id

Chaîne

L'ID de la destination de la notification.

user_email

Chaîne

L'adresse e-mail de l'utilisateur à notifier.

Clé

Type

Description

destination_id

Chaîne

L'ID de la destination de la notification.

user_email

Chaîne

L'adresse e-mail de l'utilisateur à notifier.

alert.evaluation.source

Type: Map

Colonne source du résultat à utiliser pour évaluer l'alerte.

Clé

Type

Description

aggregation

Chaîne

La méthode d'agrégation à appliquer à la colonne source. Les valeurs valides sont SUM, COUNT, COUNT_DISTINCT, AVG, MEDIAN, MIN, MAX, STDDEV

display

Chaîne

Le nom d'affichage de la colonne source.

name

Chaîne

Le nom de la colonne source du résultat de la query.

Clé

Type

Description

aggregation

Chaîne

La méthode d'agrégation à appliquer à la colonne source. Les valeurs valides sont SUM, COUNT, COUNT_DISTINCT, AVG, MEDIAN, MIN, MAX, STDDEV

display

Chaîne

Le nom d'affichage de la colonne source.

name

Chaîne

Le nom de la colonne source du résultat de la query.

alert.evaluation.threshold

Type: Map

Threshold à utiliser pour l'évaluation d'alerte, peut être une colonne ou une valeur.

Clé

Type

Description

column

Carte

Référence de colonne à utiliser comme threshold. Voir alert.evaluation.source.

value

Carte

Valeur littérale à utiliser comme threshold. Voir alert.evaluation.threshold.value.

Clé

Type

Description

column

Carte

Référence de colonne à utiliser comme threshold. Voir alert.evaluation.source.

value

Carte

Valeur littérale à utiliser comme threshold. Voir alert.evaluation.threshold.value.

alert.evaluation.threshold.value

Type: Map

Valeur littérale à utiliser comme threshold. Spécifiez l’un des types de valeurs suivants.

Clé

Type

Description

bool_value

Booléen

Facultatif. Valeur booléenne pour le threshold, par exemple, true.

double_value

Double

Facultatif. Valeur numérique pour le threshold, par exemple 1.25.

string_value

Chaîne

Facultatif. Valeur de type string pour le threshold, par exemple, test.

Clé

Type

Description

bool_value

Booléen

Facultatif. Valeur booléenne pour le threshold, par exemple, true.

double_value

Double

Facultatif. Valeur numérique pour le threshold, par exemple 1.25.

string_value

Chaîne

Facultatif. Valeur de type string pour le threshold, par exemple, test.

alert.schedule

Type: Map

La configuration du calendrier pour l'alerte.

Clé

Type

Description

pause_status

Chaîne

Facultatif. Si ce planning est suspendu ou non. Valeurs valides : UNPAUSED, PAUSED. Default: UNPAUSED.

quartz_cron_schedule

Chaîne

Obligatoire. Une expression cron utilisant la syntaxe Quartz qui spécifie le planning de ce pipeline. Le format Quartz est décrit dans le format du planificateur Quartz.

timezone_id

Chaîne

Obligatoire. Un ID de fuseau horaire Java. La planification sera résolue en utilisant ce fuseau horaire. Ceci sera combiné avec le quartz_cron_schedule pour déterminer le calendrier. Voir SET TIME ZONE pour les détails.

Clé

Type

Description

pause_status

Chaîne

Facultatif. Si ce planning est suspendu ou non. Valeurs valides : UNPAUSED, PAUSED. Default: UNPAUSED.

quartz_cron_schedule

Chaîne

Obligatoire. Une expression cron utilisant la syntaxe Quartz qui spécifie le planning de ce pipeline. Le format Quartz est décrit dans le format du planificateur Quartz.

timezone_id

Chaîne

Obligatoire. Un ID de fuseau horaire Java. La planification sera résolue en utilisant ce fuseau horaire. Ceci sera combiné avec le quartz_cron_schedule pour déterminer le calendrier. Voir SET TIME ZONE pour les détails.

Exemples

La configuration d'exemple suivante définit une alerte avec une évaluation simple :

YAML
resources:
alerts:
my_alert:
display_name: my_alert
evaluation:
comparison_operator: EQUAL
source:
name: '1'
threshold:
value:
double_value: 2
query_text: select 2
schedule:
quartz_cron_schedule: '44 19 */1 * * ?'
timezone_id: Europe/Amsterdam
warehouse_id: 799f096837fzzzz4

La configuration d'exemple suivante définit une alerte avec des autorisations qui évalue à l'aide de l'agrégation et envoie des notifications :

YAML
resources:
alerts:
my_alert:
permissions:
- level: CAN_MANAGE
user_name: someone@example.com
custom_summary: 'My alert'
display_name: 'My alert'
evaluation:
comparison_operator: 'EQUAL'
notification:
notify_on_ok: false
retrigger_seconds: 1
source:
aggregation: 'MAX'
display: '1'
name: '1'
threshold:
value:
double_value: 2
query_text: 'select 2'
schedule:
pause_status: 'UNPAUSED'
quartz_cron_schedule: '44 19 */1 * * ?'
timezone_id: 'Europe/Amsterdam'
warehouse_id: 799f096837fzzzz4

application

Type: Map

La Ressource d'application définit une application Databricks. Pour des informations sur Databricks Apps, consultez Databricks Apps.

Pour ajouter une application, spécifiez les paramètres pour définir l'application, y compris le source_code_path requis.

astuce

Vous pouvez initialiser un paquet avec une application Streamlit Databricks à l'aide de la commande suivante :

Bash
databricks bundle init https://github.com/databricks/bundle-examples --template-dir contrib/templates/streamlit-app

Ajouté dans la version 0.239.0 de Databricks CLI

YAML
apps:
<app-name>:
<app-field-name>: <app-field-value>

Clé

Type

Description

budget_policy_id

Chaîne

L'identifiant de politique budgétaire pour l'application.

Ajouté dans la version 0.243.0 de Databricks CLI

compute_size

Chaîne

La taille du compute pour l'application. Les valeurs valides sont MEDIUM ou LARGE, mais dépendent de la configuration du Workspace.

Ajouté dans la version 0.273.0 de Databricks CLI

config

Carte

Commandes de configuration d’application et variables d’environnement. Voir app.config.

Ajouté dans la version 0.283.0 de Databricks CLI.

description

Chaîne

La description de l’application.

Ajouté dans la version 0.239.0 de Databricks CLI

git_repository

Carte

La configuration du repository Git pour les déploiements d'applications. Lorsqu'ils sont spécifiés, les déploiements peuvent référencer du code à partir de ce repository en fournissant uniquement la référence Git (branch, tag ou commit). Consultez app.git_repository.

Ajouté dans la version 0.283.0 de Databricks CLI.

git_source

Carte

La configuration de la source Git pour les déploiements d'applications. Spécifie quelle référence Git (Branch, balise ou commit) utiliser lors du déploiement de l'application. Utilisé en conjonction avec git_repository pour déployer du code directement depuis Git. Le source_code_path dans le git_source spécifie le chemin relatif vers le code de l'application au sein du repository. Voir app.git_source.

Ajouté à la version 0,290.0 de Databricks CLI

lifecycle

Carte

Le comportement de la ressource lorsqu'elle est déployée ou détruite. Consultez le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom de l'application. Le nom ne doit contenir que des caractères alphanumériques minuscules et des tirets. Il doit être unique au sein du workspace.

Ajouté dans la version 0.239.0 de Databricks CLI

permissions

Séquence

Les autorisations de l’application. Afficher les autorisations.

Ajouté dans la version 0.239.0 de Databricks CLI

resources

Séquence

Les ressources de compute de l'application. Consultez app.resources.

Ajouté dans la version 0.239.0 de Databricks CLI

source_code_path

Chaîne

Le chemin local ./app du code source de l'application Databricks.

Ajouté dans la version 0.239.0 de Databricks CLI

telemetry_export_destinations

Séquence

Les destinations d'exportation de télémétrie pour l'application. Consultez app.telemetry_export_destinations.

Ajouté dans la version 0.294.0 du CLI Databricks.

usage_policy_id

Chaîne

L'ID de la politique d'utilisation Serverless à utiliser pour cette application.

Ajouté dans la version 0.283.0 de Databricks CLI.

user_api_scopes

Séquence

Les périmètres d'API utilisateur.

Ajouté dans la version 0.246.0 de la CLI Databricks

Clé

Type

Description

budget_policy_id

Chaîne

L'identifiant de politique budgétaire pour l'application.

Ajouté dans la version 0.243.0 de Databricks CLI

compute_size

Chaîne

La taille du compute pour l'application. Les valeurs valides sont MEDIUM ou LARGE, mais dépendent de la configuration du Workspace.

Ajouté dans la version 0.273.0 de Databricks CLI

config

Carte

Commandes de configuration d’application et variables d’environnement. Voir app.config.

Ajouté dans la version 0.283.0 de Databricks CLI.

description

Chaîne

La description de l’application.

Ajouté dans la version 0.239.0 de Databricks CLI

git_repository

Carte

La configuration du repository Git pour les déploiements d'applications. Lorsqu'ils sont spécifiés, les déploiements peuvent référencer du code à partir de ce repository en fournissant uniquement la référence Git (branch, tag ou commit). Consultez app.git_repository.

Ajouté dans la version 0.283.0 de Databricks CLI.

git_source

Carte

La configuration de la source Git pour les déploiements d'applications. Spécifie quelle référence Git (Branch, balise ou commit) utiliser lors du déploiement de l'application. Utilisé en conjonction avec git_repository pour déployer du code directement depuis Git. Le source_code_path dans le git_source spécifie le chemin relatif vers le code de l'application au sein du repository. Voir app.git_source.

Ajouté à la version 0,290.0 de Databricks CLI

lifecycle

Carte

Le comportement de la ressource lorsqu'elle est déployée ou détruite. Consultez le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom de l'application. Le nom ne doit contenir que des caractères alphanumériques minuscules et des tirets. Il doit être unique au sein du workspace.

Ajouté dans la version 0.239.0 de Databricks CLI

permissions

Séquence

Les autorisations de l’application. Afficher les autorisations.

Ajouté dans la version 0.239.0 de Databricks CLI

resources

Séquence

Les ressources de compute de l'application. Consultez app.resources.

Ajouté dans la version 0.239.0 de Databricks CLI

source_code_path

Chaîne

Le chemin local ./app du code source de l'application Databricks.

Ajouté dans la version 0.239.0 de Databricks CLI

telemetry_export_destinations

Séquence

Les destinations d'exportation de télémétrie pour l'application. Consultez app.telemetry_export_destinations.

Ajouté dans la version 0.294.0 du CLI Databricks.

usage_policy_id

Chaîne

L'ID de la politique d'utilisation Serverless à utiliser pour cette application.

Ajouté dans la version 0.283.0 de Databricks CLI.

user_api_scopes

Séquence

Les périmètres d'API utilisateur.

Ajouté dans la version 0.246.0 de la CLI Databricks

app.config

Commandes de configuration d’application et variables d’environnement. Voir Configurer l'exécution de l'application Databricks avec app.yaml.

Clé

Type

Description

command

Séquence

Les commandes pour exécuter l'application, par exemple ["streamlit", "run", "app.py"]

env

Séquence

Une liste de paires name et value qui spécifient des variables d'environnement d'application à définir dans l'environnement d'exécution de l'application. Cela remplacera les variables d'environnement spécifiées dans le fichier app.yaml. Pour obtenir des informations sur les variables d'environnement d'application default, consultez l'environnement Databricks Apps.

Les variables d'environnement ne sont pas définies tant que l'application n'est pas start.

Clé

Type

Description

command

Séquence

Les commandes pour exécuter l'application, par exemple ["streamlit", "run", "app.py"]

env

Séquence

Une liste de paires name et value qui spécifient des variables d'environnement d'application à définir dans l'environnement d'exécution de l'application. Cela remplacera les variables d'environnement spécifiées dans le fichier app.yaml. Pour obtenir des informations sur les variables d'environnement d'application default, consultez l'environnement Databricks Apps.

Les variables d'environnement ne sont pas définies tant que l'application n'est pas start.

app.git_repository

Type: Map

La configuration du repository Git spécifiant l'emplacement du repository.

Clé

Type

Description

provider

Chaîne

Obligatoire. Fournisseur Git. Non sensible à la casse. Valeurs prises en charge : gitHub, gitHubEnterprise, bitbucketCloud, bitbucketServer, azureDevOpsServices, gitLab, gitLabEnterpriseEdition, awsCodeCommit.

Ajouté dans la version 0.283.0 de Databricks CLI.

url

Chaîne

Obligatoire. URL du repository Git.

Ajouté dans la version 0.283.0 de Databricks CLI.

Clé

Type

Description

provider

Chaîne

Obligatoire. Fournisseur Git. Non sensible à la casse. Valeurs prises en charge : gitHub, gitHubEnterprise, bitbucketCloud, bitbucketServer, azureDevOpsServices, gitLab, gitLabEnterpriseEdition, awsCodeCommit.

Ajouté dans la version 0.283.0 de Databricks CLI.

url

Chaîne

Obligatoire. URL du repository Git.

Ajouté dans la version 0.283.0 de Databricks CLI.

app.git_source

Type: Map

La configuration de la source Git pour les déploiements d'applications.

Clé

Type

Description

branch

Chaîne

La Branch Git à extraire.

commit

Chaîne

Le SHA du commit Git à extraire.

source_code_path

Chaîne

Chemin relatif du code source de l'application dans le repository Git. Si non spécifié, la racine du repository est utilisée.

tag

Chaîne

Le tag Git à extraire.

Clé

Type

Description

branch

Chaîne

La Branch Git à extraire.

commit

Chaîne

Le SHA du commit Git à extraire.

source_code_path

Chaîne

Chemin relatif du code source de l'application dans le repository Git. Si non spécifié, la racine du repository est utilisée.

tag

Chaîne

Le tag Git à extraire.

app.Ressources

Type: Sequence

Liste des ressources de compute pour l’application.

Chaque élément de la liste est un AppResource:

Clé

Type

Description

app

Carte

Nom et autorisations de l'application

description

Chaîne

La description de la ressource de l'application.

database

Carte

Les paramètres qui identifient la base de données de provisionnement Lakebase à utiliser. Voir app.Ressources.database.

experiment

Carte

Les paramètres qui identifient l’expérimentation MLflow à utiliser. Consultez app.resources.experiment.

genie_space

Carte

Les paramètres qui identifient le Genie Agent à utiliser. Consultez app.resources.genie_space.

job

Carte

Les paramètres qui identifient la ressource de Job à utiliser. Voir app.Ressources.Job.

name

Chaîne

Le nom de la Ressource d'application.

postgres

Carte

Les paramètres qui identifient la base de données Lakebase Autoscaling à utiliser. Voir app.Ressources.postgres.

secret

Carte

Les paramètres qui identifient la Ressource secrète Databricks à utiliser. Voir app.Ressources.secret.

serving_endpoint

Carte

Les paramètres qui identifient la ressource d'Endpoint de mise en service de modèle à utiliser. Voir app.Ressources.serving_endpoint.

sql_warehouse

Carte

Les paramètres qui identifient la Ressource SQL Warehouse à utiliser. Consultez app.Ressources.SQL Warehouse.

uc_securable

Carte

Les paramètres qui identifient l'élément sécurisable d'Unity Catalog à utiliser. Voir app.Ressources.uc_securable.

Clé

Type

Description

app

Carte

Nom et autorisations de l'application

description

Chaîne

La description de la ressource de l'application.

database

Carte

Les paramètres qui identifient la base de données de provisionnement Lakebase à utiliser. Voir app.Ressources.database.

experiment

Carte

Les paramètres qui identifient l’expérimentation MLflow à utiliser. Consultez app.resources.experiment.

genie_space

Carte

Les paramètres qui identifient le Genie Agent à utiliser. Consultez app.resources.genie_space.

job

Carte

Les paramètres qui identifient la ressource de Job à utiliser. Voir app.Ressources.Job.

name

Chaîne

Le nom de la Ressource d'application.

postgres

Carte

Les paramètres qui identifient la base de données Lakebase Autoscaling à utiliser. Voir app.Ressources.postgres.

secret

Carte

Les paramètres qui identifient la Ressource secrète Databricks à utiliser. Voir app.Ressources.secret.

serving_endpoint

Carte

Les paramètres qui identifient la ressource d'Endpoint de mise en service de modèle à utiliser. Voir app.Ressources.serving_endpoint.

sql_warehouse

Carte

Les paramètres qui identifient la Ressource SQL Warehouse à utiliser. Consultez app.Ressources.SQL Warehouse.

uc_securable

Carte

Les paramètres qui identifient l'élément sécurisable d'Unity Catalog à utiliser. Voir app.Ressources.uc_securable.

app.Ressources.database

Type: Map

Les paramètres qui identifient la base de données Lakebase à utiliser.

Clé

Type

Description

database_name

Chaîne

Le nom de la base de données.

instance_name

Chaîne

Le nom de l'instance de base de données.

permission

Chaîne

Le niveau d'autorisation pour la base de données. Les valeurs valides sont CAN_CONNECT_AND_CREATE.

Clé

Type

Description

database_name

Chaîne

Le nom de la base de données.

instance_name

Chaîne

Le nom de l'instance de base de données.

permission

Chaîne

Le niveau d'autorisation pour la base de données. Les valeurs valides sont CAN_CONNECT_AND_CREATE.

app.Ressources.Experimentation

Type: Map

Les paramètres qui identifient l'Experimentation MLflow à utiliser.

Clé

Type

Description

experiment_id

Chaîne

L'ID de l'expérimentation MLflow.

permission

Chaîne

Le niveau d'autorisation pour l'Experimentation. Les valeurs valides incluent CAN_READ, CAN_EDIT, CAN_MANAGE.

Clé

Type

Description

experiment_id

Chaîne

L'ID de l'expérimentation MLflow.

permission

Chaîne

Le niveau d'autorisation pour l'Experimentation. Les valeurs valides incluent CAN_READ, CAN_EDIT, CAN_MANAGE.

app.Ressources.genie_space

Type: Map

Les paramètres qui identifient le Genie Agent à utiliser.

Clé

Type

Description

name

Chaîne

Le nom du Genie Agent.

permission

Chaîne

Le niveau d'autorisation pour l'espace. Les valeurs valides incluent CAN_VIEW, CAN_EDIT, CAN_MANAGE, CAN_RUN.

space_id

Chaîne

L'ID du Genie Agent, par exemple 550e8400-e29b-41d4-a716-999955440000.

Clé

Type

Description

name

Chaîne

Le nom du Genie Agent.

permission

Chaîne

Le niveau d'autorisation pour l'espace. Les valeurs valides incluent CAN_VIEW, CAN_EDIT, CAN_MANAGE, CAN_RUN.

space_id

Chaîne

L'ID du Genie Agent, par exemple 550e8400-e29b-41d4-a716-999955440000.

app.Ressources.Job

Type: Map

Les paramètres qui identifient la ressource de job à utiliser.

Clé

Type

Description

id

Chaîne

L'ID du Job.

permission

Chaîne

Le niveau d'autorisation pour le Job. Les valeurs valides incluent CAN_VIEW, CAN_MANAGE_RUN, CAN_MANAGE, IS_OWNER.

Clé

Type

Description

id

Chaîne

L'ID du Job.

permission

Chaîne

Le niveau d'autorisation pour le Job. Les valeurs valides incluent CAN_VIEW, CAN_MANAGE_RUN, CAN_MANAGE, IS_OWNER.

app.Ressources.postgres

Type: Map

Les paramètres qui identifient la base de données Lakebase Autoscaling à utiliser.

Clé

Type

Description

branch

Chaîne

Le nom de la Branch, par exemple, projects/proj-abc123/branches/branch-xyz789.

database

Chaîne

Le nom de l'instance de la base de données, par exemple, projects/proj-abc123/branches/branch-xyz789/databases/db-456.

permission

Chaîne

Le niveau d'autorisation pour la base de données. Les valeurs valides sont CAN_CONNECT_AND_CREATE.

Clé

Type

Description

branch

Chaîne

Le nom de la Branch, par exemple, projects/proj-abc123/branches/branch-xyz789.

database

Chaîne

Le nom de l'instance de la base de données, par exemple, projects/proj-abc123/branches/branch-xyz789/databases/db-456.

permission

Chaîne

Le niveau d'autorisation pour la base de données. Les valeurs valides sont CAN_CONNECT_AND_CREATE.

app.Ressources.secret

Type: Map

Les paramètres qui identifient la ressource de secret Databricks à utiliser.

Clé

Type

Description

key

Chaîne

La clé du secret pour accorder l'autorisation.

permission

Chaîne

Le niveau d'autorisation pour le secret. Les valeurs valides incluent READ, WRITE, MANAGE.

scope

Chaîne

Le nom du Secret Scope.

Clé

Type

Description

key

Chaîne

La clé du secret pour accorder l'autorisation.

permission

Chaîne

Le niveau d'autorisation pour le secret. Les valeurs valides incluent READ, WRITE, MANAGE.

scope

Chaîne

Le nom du Secret Scope.

app.Ressources.serving_endpoint

Type: Map

Les paramètres qui identifient la Ressource Endpoint de mise en service du modèle à utiliser.

Clé

Type

Description

name

Chaîne

Le nom de l'endpoint de service.

permission

Chaîne

Le niveau d'autorisation pour l'endpoint de service. Les valeurs valides incluent CAN_QUERY, CAN_MANAGE, CAN_VIEW.

Clé

Type

Description

name

Chaîne

Le nom de l'endpoint de service.

permission

Chaîne

Le niveau d'autorisation pour l'endpoint de service. Les valeurs valides incluent CAN_QUERY, CAN_MANAGE, CAN_VIEW.

app.resources.sql_warehouse

Type: Map

Les paramètres qui identifient le SQL Warehouse à utiliser.

Clé

Type

Description

id

Chaîne

L’ID du SQL Warehouse.

permission

Chaîne

Le niveau d'autorisation pour le SQL Warehouse. Les valeurs valides incluent CAN_USE, CAN_MANAGE, IS_OWNER.

Clé

Type

Description

id

Chaîne

L’ID du SQL Warehouse.

permission

Chaîne

Le niveau d'autorisation pour le SQL Warehouse. Les valeurs valides incluent CAN_USE, CAN_MANAGE, IS_OWNER.

app.Ressources.uc_securable

Type: Map

Les paramètres qui identifient l'élément sécurisable d'Unity Catalog à utiliser. Les applications prennent en charge les volumes, les tables, les fonctions et les connexions en tant que ressources sécurisables.

Clé

Type

Description

permission

Chaîne

Le niveau d'autorisation pour l'élément sécurisable d'Unity Catalog. Les valeurs valides dépendent du securable_type:

  • VOLUME: READ_VOLUME, WRITE_VOLUME
  • TABLE: SELECT, MODIFY
  • FUNCTION: EXECUTE
  • CONNECTION: USE_CONNECTION

securable_full_name

Chaîne

Le nom complet de l'élément sécurisable Unity Catalog, au format catalog.schema.name. Pour une connexion, utilisez le nom de la connexion.

securable_type

Chaîne

Le type de l'élément sécurisable Unity Catalog. Les valeurs valides sont VOLUME, TABLE, FUNCTION et CONNECTION.

Clé

Type

Description

permission

Chaîne

Le niveau d'autorisation pour l'élément sécurisable d'Unity Catalog. Les valeurs valides dépendent du securable_type:

  • VOLUME: READ_VOLUME, WRITE_VOLUME
  • TABLE: SELECT, MODIFY
  • FUNCTION: EXECUTE
  • CONNECTION: USE_CONNECTION

securable_full_name

Chaîne

Le nom complet de l'élément sécurisable Unity Catalog, au format catalog.schema.name. Pour une connexion, utilisez le nom de la connexion.

securable_type

Chaîne

Le type de l'élément sécurisable Unity Catalog. Les valeurs valides sont VOLUME, TABLE, FUNCTION et CONNECTION.

remarque

Pour les volumes, les tables et les fonctions, le Service Principal de l'application a également besoin des privilèges USE CATALOG et USE SCHEMA sur le catalogue et le schéma parents. Databricks accorde automatiquement ces privilèges lorsque vous ajoutez l'élément sécurisable comme ressource d'application.

app.telemetry_export_destinations

Type: Sequence

Une liste des destinations d'exportation de télémétrie pour l'application.

Ajouté dans la version 0.294.0 du CLI Databricks.

Chaque élément de la liste est un AppTelemetryExportDestination:

Clé

Type

Description

unity_catalog

Carte

Destinations Unity Catalog pour l’exportation de télémétrie OTEL.

Ajouté dans la version 0.294.0 du CLI Databricks.

Clé

Type

Description

unity_catalog

Carte

Destinations Unity Catalog pour l’exportation de télémétrie OTEL.

Ajouté dans la version 0.294.0 du CLI Databricks.

Exemples

Pour un didacticiel qui explique la création d'un bundle définissant une application, consultez Gérer les applications Databricks à l'aide de Declarative Automation Bundles.

L'exemple suivant définit une application de base :

YAML
resources:
apps:
hello_world_app:
name: 'hello-world-app'
source_code_path: . # This assumes the app source code is at the root of the project.
description: 'A Databricks app'

L'exemple suivant crée une application nommée my_app qui gère un Job créé par le bundle. Pour l'exemple complet, consultez le repository GitHub bundle-examples.

YAML
resources:
jobs:
# Define a job in the bundle
hello_world:
name: hello_world
tasks:
- task_key: task
spark_python_task:
python_file: ../src/main.py
environment_key: default

environments:
- environment_key: default
spec:
environment_version: '2'

# Define an app that manages the job in the bundle
apps:
job_manager:
name: 'job_manager_app'
description: 'An app which manages a job created by this bundle'

# The location of the source code for the app
source_code_path: ../src/app

# The resources in the bundle which this app has access to. This binds the resource in the app with the bundle resource.
resources:
- name: 'app-job'
job:
id: ${resources.jobs.hello_world.id}
permission: 'CAN_MANAGE_RUN'

Le app.yaml correspondant définit la configuration pour l’exécution de l’application :

YAML
command:
- flask
- --app
- app
- run
- --debug
env:
- name: JOB_ID
valueFrom: 'app-job'

L'exemple suivant crée une application qui a accès à une expérimentation MLflow créée par le bundle :

YAML
resources:
experiments:
# Define an MLflow experiment in the bundle
my_experiment:
name: /Users/${workspace.current_user.userName}/my-app-experiment

apps:
my_ml_app:
name: 'my-ml-app'
description: 'An app with access to an MLflow experiment'
source_code_path: ./app

# Grant the app access to the MLflow experiment
resources:
- name: 'app-experiment'
experiment:
experiment_id: ${resources.experiments.my_experiment.id}
permission: 'CAN_MANAGE'

En variante, l'exemple suivant définit une application avec une configuration personnalisée définie dans la configuration du bundle :

YAML
resources:
apps:
my_app:
name: my_app
description: my_app_description
source_code_path: ./app
config:
command: ['flask', '--app', 'app', 'run']
env:
- name: MY_ENV_VAR
value: test_value
- name: ANOTHER_VAR
value: another_value

L'exemple suivant définit une application avec une Ressource de mise à l'échelle automatique Lakebase :

YAML
resources:
apps:
my_app:
name: my-app
source_code_path: .
resources:
- name: lakebase-db
postgres:
branch: projects/my-app/branches/production
database: projects/my-app/branches/production/databases/db-xxxx-yyyyyyyy
permission: CAN_CONNECT_AND_CREATE

catalogues

Type: Map

La ressource de catalogue vous permet de définir des catalogues (Unity Catalog) dans un bundle.

remarque

L'utilisation de bundles d'automatisation déclaratifs pour définir des catalogues n'est prise en charge que si vous utilisez le moteur de déploiement direct.

Ajouté dans la version 0.287.0 de la CLI Databricks

YAML
catalogs:
<catalog-name>:
<catalog-field-name>: <catalog-field-value>

Clé

Type

Description

comment

Chaîne

Une description textuelle libre fournie par l'utilisateur pour le catalogue.

Ajouté dans la version 0.287.0 de la CLI Databricks

connection_name

Chaîne

Le nom de la connexion à une source de données externe.

Ajouté dans la version 0.287.0 de la CLI Databricks

grants

Séquence

Les octrois associés au catalogue. Voir l'octroi.

Ajouté dans la version 0.287.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

managed_encryption_settings

Carte

Contrôler le chiffrement CMK pour les données de catalogue gérées. Consulter catalog.managed_encryption_settings.

Ajouté dans Databricks CLI version 0.298.0

name

Chaîne

Obligatoire. Le nom du catalogue.

Ajouté dans la version 0.287.0 de la CLI Databricks

options

Objet

Une carte de propriétés clé-valeur attachée à l'élément sécurisable.

Ajouté dans la version 0.287.0 de la CLI Databricks

properties

Objet

Une carte de propriétés clé-valeur attachée à l'élément sécurisable.

Ajouté dans la version 0.287.0 de la CLI Databricks

provider_name

Chaîne

Le nom du fournisseur OpenSharing. Un catalogue OpenSharing est un catalogue basé sur un partage OpenSharing sur un serveur de partage distant. Consultez Qu'est-ce qu'OpenSharing ?.

Ajouté dans la version 0.287.0 de la CLI Databricks

share_name

Chaîne

Le nom du partage sous le fournisseur de partage.

Ajouté dans la version 0.287.0 de la CLI Databricks

storage_root

Chaîne

L'URL racine du stockage pour les tables gérées au sein du catalogue.

Ajouté dans la version 0.287.0 de la CLI Databricks

Clé

Type

Description

comment

Chaîne

Une description textuelle libre fournie par l'utilisateur pour le catalogue.

Ajouté dans la version 0.287.0 de la CLI Databricks

connection_name

Chaîne

Le nom de la connexion à une source de données externe.

Ajouté dans la version 0.287.0 de la CLI Databricks

grants

Séquence

Les octrois associés au catalogue. Voir l'octroi.

Ajouté dans la version 0.287.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

managed_encryption_settings

Carte

Contrôler le chiffrement CMK pour les données de catalogue gérées. Consulter catalog.managed_encryption_settings.

Ajouté dans Databricks CLI version 0.298.0

name

Chaîne

Obligatoire. Le nom du catalogue.

Ajouté dans la version 0.287.0 de la CLI Databricks

options

Objet

Une carte de propriétés clé-valeur attachée à l'élément sécurisable.

Ajouté dans la version 0.287.0 de la CLI Databricks

properties

Objet

Une carte de propriétés clé-valeur attachée à l'élément sécurisable.

Ajouté dans la version 0.287.0 de la CLI Databricks

provider_name

Chaîne

Le nom du fournisseur OpenSharing. Un catalogue OpenSharing est un catalogue basé sur un partage OpenSharing sur un serveur de partage distant. Consultez Qu'est-ce qu'OpenSharing ?.

Ajouté dans la version 0.287.0 de la CLI Databricks

share_name

Chaîne

Le nom du partage sous le fournisseur de partage.

Ajouté dans la version 0.287.0 de la CLI Databricks

storage_root

Chaîne

L'URL racine du stockage pour les tables gérées au sein du catalogue.

Ajouté dans la version 0.287.0 de la CLI Databricks

Exemple

YAML
# databricks.yml
bundle:
name: catalogs-example
engine: direct # catalogs require the direct deployment engine

resources:
catalogs:
my_catalog:
name: my_catalog
comment: 'Catalog created by Declarative Automation Bundles'
properties:
purpose: 'Testing'
grants:
- principal: someone@example.com
privileges:
- USE_CATALOG
- CREATE_SCHEMA

schemas:
my_schema:
name: my_schema
catalog_name: ${resources.catalogs.my_catalog.name}
comment: 'Schema in custom catalog'

catalog.managed_encryption_settings

Type: Map

Paramètres de chiffrement pour les données de catalogue gérées. Utilisé pour configurer une clé gérée par le client (CMK).

Ajouté dans Databricks CLI version 0.298.0

Clé

Type

Description

azure_encryption_settings

Carte

Paramètres Azure facultatifs — requis uniquement si une CMK Azure est utilisée.

Ajouté dans Databricks CLI version 0.298.0

azure_key_vault_key_id

Chaîne

L’URL AKV dans Azure, ou null sinon.

Ajouté dans Databricks CLI version 0.298.0

customer_managed_key_id

Chaîne

L'UUID CMK dans AWS et GCP, null sinon.

Ajouté dans Databricks CLI version 0.298.0

Clé

Type

Description

azure_encryption_settings

Carte

Paramètres Azure facultatifs — requis uniquement si une CMK Azure est utilisée.

Ajouté dans Databricks CLI version 0.298.0

azure_key_vault_key_id

Chaîne

L’URL AKV dans Azure, ou null sinon.

Ajouté dans Databricks CLI version 0.298.0

customer_managed_key_id

Chaîne

L'UUID CMK dans AWS et GCP, null sinon.

Ajouté dans Databricks CLI version 0.298.0

clusters

Type: Map

La ressource de cluster définit un cluster.

YAML
clusters:
<cluster-name>:
<cluster-field-name>: <cluster-field-value>

Clé

Type

Description

apply_policy_default_values

Booléen

Lorsque défini sur vrai, les valeurs fixes et default de la politique seront utilisées pour les champs qui sont omis. Lorsqu'il est défini sur false, seules les valeurs fixes de la politique seront appliquées.

autoscale

Carte

Paramètres nécessaires pour Monter en charge les clusters à la hausse et à la baisse en fonction de la charge. Voir autoscale.

autotermination_minutes

Entier

Arrête automatiquement le cluster après qu'il est inactif pendant ce temps en minutes. Si non défini, ce cluster ne sera pas automatiquement arrêté. S'il est spécifié, le threshold doit être compris entre 10 et 10 000 minutes. Les utilisateurs peuvent également définir cette valeur sur 0 pour désactiver explicitement l'arrêt automatique.

aws_attributes

Carte

Attributs liés aux clusters fonctionnant sur Amazon Web Services. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir aws_attributes.

azure_attributes

Carte

Attributs liés aux clusters s’exécutant sur Microsoft Azure. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir azure_attributes.

cluster_log_conf

Carte

La configuration pour la livraison des Logs Spark vers une destination de stockage à long terme. Voir cluster_log_conf.

cluster_name

Chaîne

Nom du cluster demandé par l’utilisateur. Cela n'a pas à être unique. S'il n'est pas spécifié lors de la création, le nom du cluster sera une chaîne vide.

custom_tags

Carte

Tags supplémentaires pour les ressources de cluster. Databricks taguera toutes les ressources de cluster (par exemple, les instances AWS et les volumes EBS) avec ces tags en plus de default_tags.

data_security_mode

Chaîne

Le modèle de gouvernance des données à utiliser lors de l'accès aux données depuis un cluster. Les valeurs valides incluent DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_STANDARD, DATA_SECURITY_MODE_DEDICATED et NONE. USER_ISOLATION et SINGLE_USER sont des alias hérités pour DATA_SECURITY_MODE_STANDARD et DATA_SECURITY_MODE_DEDICATED, respectivement. Les modes LEGACY_* sont obsolètes à partir de Databricks Runtime 15.0.

docker_image

Carte

L'image Docker personnalisée. Voir docker_image.

driver_instance_pool_id

Chaîne

L'ID facultatif du pool d'instances auquel appartient le Driver du cluster. Le cluster de pool utilise le pool d'instances avec l'ID (instance*pool_id) si le pool de Driver n'est pas attribué.

driver_node_type_flexibility

Carte

Configuration de type de nœud flexible pour le nœud du driver. Voir cluster.driver_node_type_flexibility.

Ajouté dans la version 0.285.0 de Databricks CLI

driver_node_type_id

Chaîne

Le type de nœud du driver Spark. Ce champ est facultatif. S'il n'est pas défini, le type de nœud Driver est défini sur la valeur de node_type_id. Ce champ, ainsi que node_type_id, ne doit pas être défini si virtual_cluster_size est défini. Si driver_node_type_id, node_type_id et virtual_cluster_size sont spécifiés, driver_node_type_id et node_type_id ont la priorité.

enable_elastic_disk

Booléen

Mise à l’échelle automatique du stockage local : lorsqu’elle est activée, ce cluster acquiert dynamiquement de l’espace disque supplémentaire lorsque ses workers Spark manquent d’espace disque. Cette fonctionnalité nécessite des autorisations AWS spécifiques pour fonctionner correctement. Reportez-vous au Guide d'utilisation pour plus de détails.

enable_local_disk_encryption

Booléen

Détermine s’il faut activer LUKS sur les disques locaux des VMs du cluster.

gcp_attributes

Carte

Attributs liés aux clusters exécutés sur Google Cloud Platform. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir gcp_attributes.

init_scripts

Séquence

La configuration pour le stockage des scripts d'initialisation. N'importe quel nombre de destinations peut être spécifié. Les scripts sont exécutés séquentiellement dans l'ordre fourni. Consultez init_scripts.

instance_pool_id

Chaîne

L'ID facultatif du pool d'instances auquel le cluster appartient.

is_single_node

Booléen

Ce champ peut être utilisé uniquement lorsque kind = CLASSIC_PREVIEW. Lorsque ce paramètre est défini sur true, Databricks configure automatiquement les custom_tags, spark_conf et num_workers liés au nœud unique.

Ajouté dans la version 0.237.0 de Databricks CLI.

kind

Chaîne

Le type de compute décrit par cette spécification de compute.

Ajouté dans la version 0.237.0 de Databricks CLI.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

node_type_id

Chaîne

Ce champ encode, par le biais d'une seule valeur, les Ressources disponibles pour chacun des nœuds Spark de ce cluster. Par exemple, les nœuds Spark peuvent être provisionnés et optimisés pour les charges de travail gourmandes en mémoire ou en compute. Une liste des types de nœuds disponibles peut être récupérée en utilisant l'API List node types.

num_workers

Entier

Nombre de nœuds Worker que ce cluster devrait avoir. Un cluster a un Driver Spark et num_workers Exécuteurs pour un total de num_workers + 1 nœuds Spark.

permissions

Séquence

Les autorisations de cluster. Afficher les autorisations.

policy_id

Chaîne

L'ID de la règle de cluster utilisée pour créer le cluster, le cas échéant.

remote_disk_throughput

Entier

Throughput de disque distant en octets par seconde.

Ajouté dans la version 0.257.0 de la Databricks CLI

runtime_engine

Chaîne

Détermine le moteur d'exécution du cluster, soit STANDARD, soit PHOTON.

single_user_name

Chaîne

Nom de l'utilisateur unique si data*security_mode est SINGLE_USER.

spark_conf

Carte

Un objet contenant un ensemble de paires clé-valeur de configuration Spark optionnelles et spécifiées par l'utilisateur. Les utilisateurs peuvent également transmettre une chaîne d'options JVM supplémentaires au Driver et aux exécuteurs via spark.driver.extraJavaOptions et spark.executor.extraJavaOptions respectivement.

spark_env_vars

Carte

Un objet contenant un ensemble de paires clé-valeur de variables d'environnement facultatives et spécifiées par l'utilisateur.

spark_version

Chaîne

La version Spark du cluster, par exemple : 3.3.x-scala2.11. Une liste des versions de Spark disponibles peut être récupérée en utilisant l'API de liste des versions de Spark disponibles.

ssh_public_keys

Séquence

Contenu de la clé publique SSH qui sera ajouté à chaque nœud Spark dans ce cluster. Les clés privées correspondantes peuvent être utilisées pour se connecter avec le nom d'utilisateur ubuntu sur le port 2200. Jusqu'à 10 clés peuvent être spécifiées.

total_initial_remote_disk_size

Entier

Taille totale initiale du disque distant en octets.

Ajouté dans la version 0.257.0 de la Databricks CLI

use_ml_runtime

Booléen

Ce champ ne peut être utilisé que lorsque kind = CLASSIC_PREVIEW. effective_spark_version est déterminé par spark_version (version de Databricks Runtime), ce champ use_ml_runtime, et si node_type_id est un nœud GPU ou non.

Ajouté dans la version 0.237.0 de Databricks CLI.

worker_node_type_flexibility

Carte

Configuration de type de nœud flexible pour les nœuds worker. Voir cluster.worker_node_type_flexibility.

Ajouté dans la version 0.285.0 de Databricks CLI

workload_type

Carte

Attributs des clusters affichés pour les types de charge de travail des clusters. Voir workload_type.

Clé

Type

Description

apply_policy_default_values

Booléen

Lorsque défini sur vrai, les valeurs fixes et default de la politique seront utilisées pour les champs qui sont omis. Lorsqu'il est défini sur false, seules les valeurs fixes de la politique seront appliquées.

autoscale

Carte

Paramètres nécessaires pour Monter en charge les clusters à la hausse et à la baisse en fonction de la charge. Voir autoscale.

autotermination_minutes

Entier

Arrête automatiquement le cluster après qu'il est inactif pendant ce temps en minutes. Si non défini, ce cluster ne sera pas automatiquement arrêté. S'il est spécifié, le threshold doit être compris entre 10 et 10 000 minutes. Les utilisateurs peuvent également définir cette valeur sur 0 pour désactiver explicitement l'arrêt automatique.

aws_attributes

Carte

Attributs liés aux clusters fonctionnant sur Amazon Web Services. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir aws_attributes.

azure_attributes

Carte

Attributs liés aux clusters s’exécutant sur Microsoft Azure. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir azure_attributes.

cluster_log_conf

Carte

La configuration pour la livraison des Logs Spark vers une destination de stockage à long terme. Voir cluster_log_conf.

cluster_name

Chaîne

Nom du cluster demandé par l’utilisateur. Cela n'a pas à être unique. S'il n'est pas spécifié lors de la création, le nom du cluster sera une chaîne vide.

custom_tags

Carte

Tags supplémentaires pour les ressources de cluster. Databricks taguera toutes les ressources de cluster (par exemple, les instances AWS et les volumes EBS) avec ces tags en plus de default_tags.

data_security_mode

Chaîne

Le modèle de gouvernance des données à utiliser lors de l'accès aux données depuis un cluster. Les valeurs valides incluent DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_STANDARD, DATA_SECURITY_MODE_DEDICATED et NONE. USER_ISOLATION et SINGLE_USER sont des alias hérités pour DATA_SECURITY_MODE_STANDARD et DATA_SECURITY_MODE_DEDICATED, respectivement. Les modes LEGACY_* sont obsolètes à partir de Databricks Runtime 15.0.

docker_image

Carte

L'image Docker personnalisée. Voir docker_image.

driver_instance_pool_id

Chaîne

L'ID facultatif du pool d'instances auquel appartient le Driver du cluster. Le cluster de pool utilise le pool d'instances avec l'ID (instance*pool_id) si le pool de Driver n'est pas attribué.

driver_node_type_flexibility

Carte

Configuration de type de nœud flexible pour le nœud du driver. Voir cluster.driver_node_type_flexibility.

Ajouté dans la version 0.285.0 de Databricks CLI

driver_node_type_id

Chaîne

Le type de nœud du driver Spark. Ce champ est facultatif. S'il n'est pas défini, le type de nœud Driver est défini sur la valeur de node_type_id. Ce champ, ainsi que node_type_id, ne doit pas être défini si virtual_cluster_size est défini. Si driver_node_type_id, node_type_id et virtual_cluster_size sont spécifiés, driver_node_type_id et node_type_id ont la priorité.

enable_elastic_disk

Booléen

Mise à l’échelle automatique du stockage local : lorsqu’elle est activée, ce cluster acquiert dynamiquement de l’espace disque supplémentaire lorsque ses workers Spark manquent d’espace disque. Cette fonctionnalité nécessite des autorisations AWS spécifiques pour fonctionner correctement. Reportez-vous au Guide d'utilisation pour plus de détails.

enable_local_disk_encryption

Booléen

Détermine s’il faut activer LUKS sur les disques locaux des VMs du cluster.

gcp_attributes

Carte

Attributs liés aux clusters exécutés sur Google Cloud Platform. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir gcp_attributes.

init_scripts

Séquence

La configuration pour le stockage des scripts d'initialisation. N'importe quel nombre de destinations peut être spécifié. Les scripts sont exécutés séquentiellement dans l'ordre fourni. Consultez init_scripts.

instance_pool_id

Chaîne

L'ID facultatif du pool d'instances auquel le cluster appartient.

is_single_node

Booléen

Ce champ peut être utilisé uniquement lorsque kind = CLASSIC_PREVIEW. Lorsque ce paramètre est défini sur true, Databricks configure automatiquement les custom_tags, spark_conf et num_workers liés au nœud unique.

Ajouté dans la version 0.237.0 de Databricks CLI.

kind

Chaîne

Le type de compute décrit par cette spécification de compute.

Ajouté dans la version 0.237.0 de Databricks CLI.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

node_type_id

Chaîne

Ce champ encode, par le biais d'une seule valeur, les Ressources disponibles pour chacun des nœuds Spark de ce cluster. Par exemple, les nœuds Spark peuvent être provisionnés et optimisés pour les charges de travail gourmandes en mémoire ou en compute. Une liste des types de nœuds disponibles peut être récupérée en utilisant l'API List node types.

num_workers

Entier

Nombre de nœuds Worker que ce cluster devrait avoir. Un cluster a un Driver Spark et num_workers Exécuteurs pour un total de num_workers + 1 nœuds Spark.

permissions

Séquence

Les autorisations de cluster. Afficher les autorisations.

policy_id

Chaîne

L'ID de la règle de cluster utilisée pour créer le cluster, le cas échéant.

remote_disk_throughput

Entier

Throughput de disque distant en octets par seconde.

Ajouté dans la version 0.257.0 de la Databricks CLI

runtime_engine

Chaîne

Détermine le moteur d'exécution du cluster, soit STANDARD, soit PHOTON.

single_user_name

Chaîne

Nom de l'utilisateur unique si data*security_mode est SINGLE_USER.

spark_conf

Carte

Un objet contenant un ensemble de paires clé-valeur de configuration Spark optionnelles et spécifiées par l'utilisateur. Les utilisateurs peuvent également transmettre une chaîne d'options JVM supplémentaires au Driver et aux exécuteurs via spark.driver.extraJavaOptions et spark.executor.extraJavaOptions respectivement.

spark_env_vars

Carte

Un objet contenant un ensemble de paires clé-valeur de variables d'environnement facultatives et spécifiées par l'utilisateur.

spark_version

Chaîne

La version Spark du cluster, par exemple : 3.3.x-scala2.11. Une liste des versions de Spark disponibles peut être récupérée en utilisant l'API de liste des versions de Spark disponibles.

ssh_public_keys

Séquence

Contenu de la clé publique SSH qui sera ajouté à chaque nœud Spark dans ce cluster. Les clés privées correspondantes peuvent être utilisées pour se connecter avec le nom d'utilisateur ubuntu sur le port 2200. Jusqu'à 10 clés peuvent être spécifiées.

total_initial_remote_disk_size

Entier

Taille totale initiale du disque distant en octets.

Ajouté dans la version 0.257.0 de la Databricks CLI

use_ml_runtime

Booléen

Ce champ ne peut être utilisé que lorsque kind = CLASSIC_PREVIEW. effective_spark_version est déterminé par spark_version (version de Databricks Runtime), ce champ use_ml_runtime, et si node_type_id est un nœud GPU ou non.

Ajouté dans la version 0.237.0 de Databricks CLI.

worker_node_type_flexibility

Carte

Configuration de type de nœud flexible pour les nœuds worker. Voir cluster.worker_node_type_flexibility.

Ajouté dans la version 0.285.0 de Databricks CLI

workload_type

Carte

Attributs des clusters affichés pour les types de charge de travail des clusters. Voir workload_type.

cluster.autoscale

Type: Map

Paramètres pour la mise à l'échelle automatique des clusters en fonction de la charge.

Clé

Type

Description

min_workers

Entier

Le nombre minimal de Workers auquel le cluster peut réduire sa taille lorsqu’il est sous-utilisé. C’est également le nombre initial de Workers que le cluster aura après sa création.

max_workers

Entier

Le nombre maximal de Worker auquel le cluster peut monter en charge en cas de surcharge. max_workers doit être strictement supérieur à min_workers.

Clé

Type

Description

min_workers

Entier

Le nombre minimal de Workers auquel le cluster peut réduire sa taille lorsqu’il est sous-utilisé. C’est également le nombre initial de Workers que le cluster aura après sa création.

max_workers

Entier

Le nombre maximal de Worker auquel le cluster peut monter en charge en cas de surcharge. max_workers doit être strictement supérieur à min_workers.

cluster.aws_attributes

Type: Map

Attributs relatifs aux clusters s'exécutant sur Amazon Web Services.

Clé

Type

Description

zone_id

Chaîne

Identifiant de la zone de disponibilité/du centre de données dans laquelle le cluster réside. Cette chaîne de caractères aura une forme telle que us-west-2a.

availability

Chaîne

Type de disponibilité utilisé pour tous les nœuds suivants après les first_on_demand. Les valeurs valides sont SPOT, ON_DEMAND, SPOT_WITH_FALLBACK.

spot_bid_price_percent

Entier

Le prix maximum des instances ponctuelles AWS, en pourcentage du prix à la demande du type d'instance correspondant.

instance_profile_arn

Chaîne

Les nœuds de ce cluster seront uniquement placés sur des instances AWS avec ce profil d'instance.

first_on_demand

Entier

Les first_on_demand premiers nœuds du cluster seront placés sur des instances à la demande. Cette valeur doit être supérieure à 0 pour s'assurer que le nœud driver du cluster est placé sur une instance à la demande.

ebs_volume_type

Chaîne

Le type de volumes EBS qui seront lancés avec ce cluster. Les valeurs valides sont GENERAL_PURPOSE_SSD ou THROUGHPUT_OPTIMIZED_HDD.

ebs_volume_count

Entier

Le nombre de volumes lancés pour chaque instance.

ebs_volume_size

Entier

Taille de chaque volume EBS (en GiB) lancé pour chaque instance.

ebs_volume_iops

Entier

Le nombre d'IOPS par volume EBS gp3.

ebs_volume_throughput

Entier

Le throughput par volume EBS gp3, en Mio par seconde.

Clé

Type

Description

zone_id

Chaîne

Identifiant de la zone de disponibilité/du centre de données dans laquelle le cluster réside. Cette chaîne de caractères aura une forme telle que us-west-2a.

availability

Chaîne

Type de disponibilité utilisé pour tous les nœuds suivants après les first_on_demand. Les valeurs valides sont SPOT, ON_DEMAND, SPOT_WITH_FALLBACK.

spot_bid_price_percent

Entier

Le prix maximum des instances ponctuelles AWS, en pourcentage du prix à la demande du type d'instance correspondant.

instance_profile_arn

Chaîne

Les nœuds de ce cluster seront uniquement placés sur des instances AWS avec ce profil d'instance.

first_on_demand

Entier

Les first_on_demand premiers nœuds du cluster seront placés sur des instances à la demande. Cette valeur doit être supérieure à 0 pour s'assurer que le nœud driver du cluster est placé sur une instance à la demande.

ebs_volume_type

Chaîne

Le type de volumes EBS qui seront lancés avec ce cluster. Les valeurs valides sont GENERAL_PURPOSE_SSD ou THROUGHPUT_OPTIMIZED_HDD.

ebs_volume_count

Entier

Le nombre de volumes lancés pour chaque instance.

ebs_volume_size

Entier

Taille de chaque volume EBS (en GiB) lancé pour chaque instance.

ebs_volume_iops

Entier

Le nombre d'IOPS par volume EBS gp3.

ebs_volume_throughput

Entier

Le throughput par volume EBS gp3, en Mio par seconde.

cluster.azure_attributes

Type: Map

Attributs liés aux clusters s’exécutant sur Microsoft Azure.

Clé

Type

Description

first_on_demand

Entier

Les first_on_demand premiers nœuds du cluster seront placés sur des instances à la demande.

availability

Chaîne

Type de disponibilité utilisé pour tous les nœuds suivants après les first_on_demand. Les valeurs valides sont SPOT_AZURE, ON_DEMAND_AZURE, SPOT_WITH_FALLBACK_AZURE.

spot_bid_max_price

Nombre

Le prix maximal pour les instances spot Azure. Utilisez -1 pour spécifier le prix le plus bas.

log_analytics_info

Carte

La configuration de l'agent Azure Log Analytique. Consultez log_analytics_info.

Clé

Type

Description

first_on_demand

Entier

Les first_on_demand premiers nœuds du cluster seront placés sur des instances à la demande.

availability

Chaîne

Type de disponibilité utilisé pour tous les nœuds suivants après les first_on_demand. Les valeurs valides sont SPOT_AZURE, ON_DEMAND_AZURE, SPOT_WITH_FALLBACK_AZURE.

spot_bid_max_price

Nombre

Le prix maximal pour les instances spot Azure. Utilisez -1 pour spécifier le prix le plus bas.

log_analytics_info

Carte

La configuration de l'agent Azure Log Analytique. Consultez log_analytics_info.

cluster.azure_attributes.log_analytics_info

Type: Map

La configuration de l'agent Azure Log analytique.

Clé

Type

Description

log_analytics_workspace_id

Chaîne

L'ID du Workspace Azure Log analytique.

log_analytics_primary_key

Chaîne

La clé primaire pour le Workspace Azure Log Analytics.

Clé

Type

Description

log_analytics_workspace_id

Chaîne

L'ID du Workspace Azure Log analytique.

log_analytics_primary_key

Chaîne

La clé primaire pour le Workspace Azure Log Analytics.

cluster.gcp_attributes

Type: Map

Attributs liés aux clusters s'exécutant sur Google Cloud Platform.

Clé

Type

Description

use_preemptible_executors

Booléen

Faut-il utiliser des exécuteurs préemptables. Les exécuteurs préemptables sont des instances GCE préemptables qui peuvent être récupérées par GCE à tout moment.

google_service_account

Chaîne

Le compte de service Google à utiliser par les instances de VM de cluster Databricks.

local_ssd_count

Entier

Le nombre de SSD locaux à attacher à chaque nœud du cluster. La valeur par default est 0.

zone_id

Chaîne

Identifiant de la zone de disponibilité/centre de données dans lequel le cluster réside.

availability

Chaîne

Type de disponibilité utilisé pour tous les nœuds. Les valeurs valides sont PREEMPTIBLE_GCP, ON_DEMAND_GCP, PREEMPTIBLE_WITH_FALLBACK_GCP.

boot_disk_size

Entier

La taille du disque de démarrage en Go. Les valeurs varient généralement de 100 à 1000.

Clé

Type

Description

use_preemptible_executors

Booléen

Faut-il utiliser des exécuteurs préemptables. Les exécuteurs préemptables sont des instances GCE préemptables qui peuvent être récupérées par GCE à tout moment.

google_service_account

Chaîne

Le compte de service Google à utiliser par les instances de VM de cluster Databricks.

local_ssd_count

Entier

Le nombre de SSD locaux à attacher à chaque nœud du cluster. La valeur par default est 0.

zone_id

Chaîne

Identifiant de la zone de disponibilité/centre de données dans lequel le cluster réside.

availability

Chaîne

Type de disponibilité utilisé pour tous les nœuds. Les valeurs valides sont PREEMPTIBLE_GCP, ON_DEMAND_GCP, PREEMPTIBLE_WITH_FALLBACK_GCP.

boot_disk_size

Entier

La taille du disque de démarrage en Go. Les valeurs varient généralement de 100 à 1000.

cluster.cluster_log_conf

La configuration pour la livraison des Logs Spark vers une destination de stockage à long terme.

Clé

Type

Description

dbfs

Carte

Emplacement DBFS pour la livraison des logs de cluster. Consultez DBFS.

s3

Carte

Emplacement S3 pour la livraison des logs de clusters. Voir s3.

volumes

Carte

Emplacement des volumes pour la livraison des logs du cluster. Voir volumes.

Clé

Type

Description

dbfs

Carte

Emplacement DBFS pour la livraison des logs de cluster. Consultez DBFS.

s3

Carte

Emplacement S3 pour la livraison des logs de clusters. Voir s3.

volumes

Carte

Emplacement des volumes pour la livraison des logs du cluster. Voir volumes.

cluster.cluster_log_conf.dbfs

Type: Map

Emplacement DBFS pour la livraison des logs de cluster.

Clé

Type

Description

destination

Chaîne

Le chemin DBFS pour la livraison des Logs de cluster (par exemple, dbfs:/cluster-logs).

Clé

Type

Description

destination

Chaîne

Le chemin DBFS pour la livraison des Logs de cluster (par exemple, dbfs:/cluster-logs).

cluster.cluster_log_conf.s3

Type: Map

Emplacement S3 pour la livraison des Logs de clusters.

Clé

Type

Description

destination

Chaîne

L'URI S3 pour la livraison des logs du cluster (par exemple, s3://my-bucket/cluster-logs).

region

Chaîne

La région AWS du compartiment S3.

endpoint

Chaîne

L'URL de l'Endpoint S3 (facultatif).

enable_encryption

Booléen

Faut-il activer le chiffrement pour les Logs de clusters ?

encryption_type

Chaîne

Le type de chiffrement. Les valeurs valides incluent SSE_S3, SSE_KMS.

kms_key

Chaîne

L'ARN de la clé KMS pour le chiffrement (lors de l'utilisation de SSE_KMS).

canned_acl

Chaîne

L'ACL prédéfinie à appliquer aux Logs de clusters.

Clé

Type

Description

destination

Chaîne

L'URI S3 pour la livraison des logs du cluster (par exemple, s3://my-bucket/cluster-logs).

region

Chaîne

La région AWS du compartiment S3.

endpoint

Chaîne

L'URL de l'Endpoint S3 (facultatif).

enable_encryption

Booléen

Faut-il activer le chiffrement pour les Logs de clusters ?

encryption_type

Chaîne

Le type de chiffrement. Les valeurs valides incluent SSE_S3, SSE_KMS.

kms_key

Chaîne

L'ARN de la clé KMS pour le chiffrement (lors de l'utilisation de SSE_KMS).

canned_acl

Chaîne

L'ACL prédéfinie à appliquer aux Logs de clusters.

cluster.cluster_log_conf.volumes

Type: Map

Emplacement des volumes pour la livraison des logs de cluster.

Clé

Type

Description

destination

Chaîne

Le chemin de volume pour la livraison de Logs de cluster (par exemple, /Volumes/catalog/schema/volume/cluster_log).

Clé

Type

Description

destination

Chaîne

Le chemin de volume pour la livraison de Logs de cluster (par exemple, /Volumes/catalog/schema/volume/cluster_log).

cluster.docker_image

Type: Map

La configuration de l'image Docker personnalisée.

Clé

Type

Description

url

Chaîne

URL de l'image Docker.

basic_auth

Carte

Authentification de base pour le repository Docker. Voir basic_auth.

Clé

Type

Description

url

Chaîne

URL de l'image Docker.

basic_auth

Carte

Authentification de base pour le repository Docker. Voir basic_auth.

cluster.docker_image.basic_auth

Type: Map

Authentification de base pour le repository Docker.

Clé

Type

Description

username

Chaîne

Nom d'utilisateur pour l'authentification au registre Docker.

password

Chaîne

Le mot de passe pour l'authentification du registre Docker.

Clé

Type

Description

username

Chaîne

Nom d'utilisateur pour l'authentification au registre Docker.

password

Chaîne

Le mot de passe pour l'authentification du registre Docker.

cluster.init_scripts

Type: Map

La configuration pour le stockage des scripts d'initialisation. Au moins un type d'emplacement doit être spécifié.

Clé

Type

Description

dbfs

Carte

Emplacement DBFS du script d'initialisation. Consultez DBFS.

workspace

Carte

Emplacement du workspace du script d'initialisation. See Workspace.

s3

Carte

Emplacement S3 du script d'initialisation. Voir s3.

abfss

Carte

Emplacement ABFSS du script d'initialisation. Consultez abfss.

gcs

Carte

Emplacement GCS de script d'initialisation. See GCS.

volumes

Carte

Emplacement des volumes Unity Catalog du script d'initialisation. Voir volumes.

Clé

Type

Description

dbfs

Carte

Emplacement DBFS du script d'initialisation. Consultez DBFS.

workspace

Carte

Emplacement du workspace du script d'initialisation. See Workspace.

s3

Carte

Emplacement S3 du script d'initialisation. Voir s3.

abfss

Carte

Emplacement ABFSS du script d'initialisation. Consultez abfss.

gcs

Carte

Emplacement GCS de script d'initialisation. See GCS.

volumes

Carte

Emplacement des volumes Unity Catalog du script d'initialisation. Voir volumes.

cluster.init_scripts.dbfs

Type: Map

Emplacement DBFS du script d’initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin DBFS du script d'initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin DBFS du script d'initialisation.

cluster.init_scripts.workspace

Type: Map

Emplacement du script d'initialisation du Workspace.

Clé

Type

Description

destination

Chaîne

Le chemin d'accès du Workspace du script d'initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin d'accès du Workspace du script d'initialisation.

cluster.init_scripts.s3

Type: Map

Emplacement S3 du script d'initialisation.

Clé

Type

Description

destination

Chaîne

L'URI S3 du script d'initialisation.

region

Chaîne

La région AWS du compartiment S3.

endpoint

Chaîne

L'URL de l'Endpoint S3 (facultatif).

Clé

Type

Description

destination

Chaîne

L'URI S3 du script d'initialisation.

region

Chaîne

La région AWS du compartiment S3.

endpoint

Chaîne

L'URL de l'Endpoint S3 (facultatif).

cluster.init_scripts.abfss

Type: Map

Emplacement ABFSS du script d'initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin ABFSS du script d'initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin ABFSS du script d'initialisation.

cluster.init_scripts.gcs

Type: Map

Emplacement GCS du script d'initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin GCS du script d'initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin GCS du script d'initialisation.

cluster.init_scripts.volumes

Type: Map

Emplacement du script d'initialisation des volumes.

Clé

Type

Description

destination

Chaîne

Le chemin d'accès des volumes Unity Catalog du script d'initialisation.

Clé

Type

Description

destination

Chaîne

Le chemin d'accès des volumes Unity Catalog du script d'initialisation.

cluster.driver_node_type_flexibility

Type: Map

Configuration du type de nœud flexible pour le nœud du driver.

Ajouté dans la version 0.285.0 de Databricks CLI

Clé

Type

Description

alternate_node_type_ids

Séquence

Une liste d'ID de type de nœud à utiliser comme fallbacks lorsque le type de nœud primaire n'est pas disponible.

Ajouté dans la version 0.285.0 de Databricks CLI

Clé

Type

Description

alternate_node_type_ids

Séquence

Une liste d'ID de type de nœud à utiliser comme fallbacks lorsque le type de nœud primaire n'est pas disponible.

Ajouté dans la version 0.285.0 de Databricks CLI

cluster.worker_node_type_flexibility

Type: Map

Configuration de type de nœud flexible pour les nœuds Worker.

Ajouté dans la version 0.285.0 de Databricks CLI

Clé

Type

Description

alternate_node_type_ids

Séquence

Une liste d'ID de type de nœud à utiliser comme fallbacks lorsque le type de nœud primaire n'est pas disponible.

Ajouté dans la version 0.285.0 de Databricks CLI

Clé

Type

Description

alternate_node_type_ids

Séquence

Une liste d'ID de type de nœud à utiliser comme fallbacks lorsque le type de nœud primaire n'est pas disponible.

Ajouté dans la version 0.285.0 de Databricks CLI

clusters.type_de_charge_de_travail

Type: Map

Attributs de cluster affichant les types de charges de travail de cluster.

Clé

Type

Description

clients

Carte

Définit le type de clients qui peuvent utiliser le cluster. Voir clients.

Clé

Type

Description

clients

Carte

Définit le type de clients qui peuvent utiliser le cluster. Voir clients.

cluster.workload_type.clients

Type: Map

Le type de clients pour cette charge de travail compute.

Clé

Type

Description

jobs

Booléen

Si le cluster peut exécuter des jobs.

notebooks

Booléen

Si le cluster peut exécuter des notebooks.

Clé

Type

Description

jobs

Booléen

Si le cluster peut exécuter des jobs.

notebooks

Booléen

Si le cluster peut exécuter des notebooks.

Exemples

L'exemple suivant crée un cluster dédié (mono-utilisateur) pour l'utilisateur actuel avec Databricks Runtime 15.4 LTS et une politique de cluster :

YAML
resources:
clusters:
my_cluster:
num_workers: 0
node_type_id: 'i3.xlarge'
driver_node_type_id: 'i3.xlarge'
spark_version: '15.4.x-scala2.12'
spark_conf:
'spark.executor.memory': '2g'
autotermination_minutes: 60
enable_elastic_disk: true
single_user_name: ${workspace.current_user.userName}
policy_id: '000128DB309672CA'
enable_local_disk_encryption: false
data_security_mode: SINGLE_USER
runtime_engine: STANDARD

Cet exemple crée un cluster simple my_cluster et le définit comme le cluster à utiliser pour exécuter le Notebook dans my_job:

YAML
bundle:
name: clusters

resources:
clusters:
my_cluster:
num_workers: 2
node_type_id: 'i3.xlarge'
autoscale:
min_workers: 2
max_workers: 7
spark_version: '13.3.x-scala2.12'
spark_conf:
'spark.executor.memory': '2g'

jobs:
my_job:
tasks:
- task_key: test_task
notebook_task:
notebook_path: './src/my_notebook.py'
existing_cluster_id: ${resources.clusters.my_cluster.id}

tableau de bord

Type: Map

La ressource de tableau de bord vous permet de gérer les tableaux de bord AI/BI dans un bundle. Pour plus d'information sur les tableaux de bord AI/BI, consultez Tableaux de bord.

Si vous avez déployé un bundle contenant un tableau de bord à partir de votre environnement local et que vous utilisez ensuite l'interface utilisateur pour modifier ce tableau de bord, les modifications apportées via l'interface utilisateur ne sont pas appliquées au fichier JSON du tableau de bord dans le bundle local, sauf si vous le mettez à jour explicitement à l'aide de bundle generate. Vous pouvez utiliser l'option --watch pour interroger et récupérer en continu les modifications apportées au tableau de bord. Voir databricks bundle generate.

De plus, si vous tentez de déployer un bundle depuis votre environnement local contenant un fichier JSON de tableau de bord différent de celui du workspace distant, une erreur se produira. Pour forcer le déploiement et écraser le tableau de bord du workspace distant avec le tableau de bord local, utilisez l'option --force. Voir databricks bundle deploy.

Ajouté dans la version 0.232.0 de la CLI Databricks

remarque

Lors de l'utilisation de bundles d'automatisation déclaratifs avec le support Git des tableaux de bord, empêchez la génération de tableaux de bord en double en ajoutant le mappage de synchronisation pour exclure les tableaux de bord de la synchronisation en tant que fichiers :

YAML
sync:
exclude:
- src/*.lvdash.json
YAML
dashboards:
<dashboard-name>:
<dashboard-field-name>: <dashboard-field-value>

Clé

Type

Description

dataset_catalog

Chaîne

La valeur de catalogue par default utilisée par tous les dataset du tableau de bord si elle n’est pas autrement spécifiée dans la query. Pour un exemple de configuration qui définit ce champ, consultez Paramétrage du catalogue et du schéma du tableau de bord.

Ajouté dans la version 0.283.0 de Databricks CLI.

dataset_schema

Chaîne

La valeur de schéma default utilisée par tous les datasets du tableau de bord s’il n’est pas spécifié autrement dans la query. Pour un exemple de configuration qui définit ce champ, consultez Paramétrage du catalogue et du schéma du tableau de bord.

Ajouté dans la version 0.283.0 de Databricks CLI.

display_name

Chaîne

Le nom d'affichage du tableau de bord.

Ajouté dans la version 0.232.0 de la CLI Databricks

embed_credentials

Booléen

Si les identifiants de l’identité de déploiement du bundle sont utilisés pour exécuter des requêtes pour tous les visualiseurs de tableau de bord. Si elle est définie sur false, les identifiants d’un invité sont utilisés. La valeur par default est false.

Ajouté dans la version 0.232.0 de la CLI Databricks

etag

Chaîne

L'etag du tableau de bord. Peut être fourni en option lors des mises à jour pour s'assurer que le tableau de bord n'a pas été modifié depuis la dernière lecture.

Ajouté dans la version 0,234,0 de la CLI Databricks.

file_path

Chaîne

Le chemin local de l'asset du tableau de bord, y compris le nom du fichier. Les tableaux de bord exportés ont toujours l'extension de fichier .lvdash.json.

Ajouté dans la version 0.232.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

parent_path

Chaîne

Le chemin du workspace du dossier contenant le tableau de bord. Inclut une barre oblique de début et aucune barre oblique de fin.

Ajouté dans la version 0.232.0 de la CLI Databricks

path

Chaîne

Le chemin workspace de l'asset du tableau de bord, y compris le nom de l'asset.

Ajouté dans la version 0,234,0 de la CLI Databricks.

permissions

Séquence

Les autorisations du tableau de bord. Afficher les autorisations.

Ajouté dans la version 0.232.0 de la CLI Databricks

serialized_dashboard

Tout

Le contenu du tableau de bord sous forme de chaîne sérialisée.

Ajouté dans la version 0.232.0 de la CLI Databricks

warehouse_id

Chaîne

L'ID du warehouse utilisé pour exécuter le tableau de bord.

Ajouté dans la version 0.232.0 de la CLI Databricks

Clé

Type

Description

dataset_catalog

Chaîne

La valeur de catalogue par default utilisée par tous les dataset du tableau de bord si elle n’est pas autrement spécifiée dans la query. Pour un exemple de configuration qui définit ce champ, consultez Paramétrage du catalogue et du schéma du tableau de bord.

Ajouté dans la version 0.283.0 de Databricks CLI.

dataset_schema

Chaîne

La valeur de schéma default utilisée par tous les datasets du tableau de bord s’il n’est pas spécifié autrement dans la query. Pour un exemple de configuration qui définit ce champ, consultez Paramétrage du catalogue et du schéma du tableau de bord.

Ajouté dans la version 0.283.0 de Databricks CLI.

display_name

Chaîne

Le nom d'affichage du tableau de bord.

Ajouté dans la version 0.232.0 de la CLI Databricks

embed_credentials

Booléen

Si les identifiants de l’identité de déploiement du bundle sont utilisés pour exécuter des requêtes pour tous les visualiseurs de tableau de bord. Si elle est définie sur false, les identifiants d’un invité sont utilisés. La valeur par default est false.

Ajouté dans la version 0.232.0 de la CLI Databricks

etag

Chaîne

L'etag du tableau de bord. Peut être fourni en option lors des mises à jour pour s'assurer que le tableau de bord n'a pas été modifié depuis la dernière lecture.

Ajouté dans la version 0,234,0 de la CLI Databricks.

file_path

Chaîne

Le chemin local de l'asset du tableau de bord, y compris le nom du fichier. Les tableaux de bord exportés ont toujours l'extension de fichier .lvdash.json.

Ajouté dans la version 0.232.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

parent_path

Chaîne

Le chemin du workspace du dossier contenant le tableau de bord. Inclut une barre oblique de début et aucune barre oblique de fin.

Ajouté dans la version 0.232.0 de la CLI Databricks

path

Chaîne

Le chemin workspace de l'asset du tableau de bord, y compris le nom de l'asset.

Ajouté dans la version 0,234,0 de la CLI Databricks.

permissions

Séquence

Les autorisations du tableau de bord. Afficher les autorisations.

Ajouté dans la version 0.232.0 de la CLI Databricks

serialized_dashboard

Tout

Le contenu du tableau de bord sous forme de chaîne sérialisée.

Ajouté dans la version 0.232.0 de la CLI Databricks

warehouse_id

Chaîne

L'ID du warehouse utilisé pour exécuter le tableau de bord.

Ajouté dans la version 0.232.0 de la CLI Databricks

Exemple

L'exemple suivant inclut et déploie l'exemple de tableau de bord NYC Taxi Trip analyse vers l'espace de travail Databricks.

YAML
resources:
dashboards:
nyc_taxi_trip_analysis:
display_name: 'NYC Taxi Trip Analysis'
file_path: ../src/nyc_taxi_trip_analysis.lvdash.json
warehouse_id: ${var.warehouse_id}

database_catalog

Type: Map

La ressource de catalogue de base de données vous permet de définir des catalogues de base de données qui correspondent à des instances de base de données dans un bundle. Un catalogue de base de données est une base de données Lakebase qui est enregistrée en tant que catalogue Unity Catalog.

Pour obtenir des informations sur les catalogues de bases de données, consultez Créer un catalogue.

Ajouté dans la version 0.265.0 de Databricks CLI

YAML
database_catalogs:
<database_catalog-name>:
<database_catalog-field-name>: <database_catalog-field-value>

Clé

Type

Description

create_database_if_not_exists

Booléen

S'il faut créer la base de données si elle n'existe pas.

Ajouté dans la version 0.265.0 de Databricks CLI

database_instance_name

Chaîne

Le nom de l'instance hébergeant la base de données.

Ajouté dans la version 0.265.0 de Databricks CLI

database_name

Chaîne

Le nom de la base de données (dans une instance) associée au catalogue.

Ajouté dans la version 0.265.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource, y compris le comportement de la ressource lorsqu'elle est déployée ou détruite. Consultez le cycle de vie.

Ajouté dans la version 0.265.0 de Databricks CLI

name

Chaîne

Le nom du catalogue dans Unity Catalog.

Ajouté dans la version 0.265.0 de Databricks CLI

Clé

Type

Description

create_database_if_not_exists

Booléen

S'il faut créer la base de données si elle n'existe pas.

Ajouté dans la version 0.265.0 de Databricks CLI

database_instance_name

Chaîne

Le nom de l'instance hébergeant la base de données.

Ajouté dans la version 0.265.0 de Databricks CLI

database_name

Chaîne

Le nom de la base de données (dans une instance) associée au catalogue.

Ajouté dans la version 0.265.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource, y compris le comportement de la ressource lorsqu'elle est déployée ou détruite. Consultez le cycle de vie.

Ajouté dans la version 0.265.0 de Databricks CLI

name

Chaîne

Le nom du catalogue dans Unity Catalog.

Ajouté dans la version 0.265.0 de Databricks CLI

Exemple

L'exemple suivant définit une instance de base de données avec un catalogue de bases de données correspondant :

YAML
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: ${resources.database_instances.my_instance.name}
name: example_catalog
database_name: my_database
create_database_if_not_exists: true

database_instance

Type: Map

La ressource d'instance de base de données vous permet de définir des instances de base de données dans un bundle. Une instance de base de données Lakebase gère les ressources de stockage et de compute et fournit les Endpoints auxquels les utilisateurs se connectent.

remarque

De nouvelles instances de base de données créées par la ressource database_instances sont désormais créées en tant que projets Lakebase Autoscaling. Consulter Autoscaling default pour plus de détails. Pour les nouveaux travaux Lakebase, nous recommandons d'utiliser la ressource postgres_projects à la place.

important

Lorsque vous déployez un bundle avec une instance de base de données, l'instance commence immédiatement à s'exécuter et est soumise aux Tarifs. Voir Tarifs Lakebase.

Pour plus d'informations sur les instances de base de données, consultez Lakebase provisionnée.

Ajouté dans la version 0.265.0 de Databricks CLI

YAML
database_instances:
<database_instance-name>:
<database_instance-field-name>: <database_instance-field-value>

Clé

Type

Description

capacity

Chaîne

La SKU de l'instance. Les valeurs valides sont CU_1, CU_2, CU_4, CU_8.

Ajouté dans la version 0.265.0 de Databricks CLI

custom_tags

Séquence

Une liste de paires clé-valeur qui spécifient des balises personnalisées associées à l'instance.

Ajouté dans la version 0.273.0 de Databricks CLI

enable_pg_native_login

Booléen

Si la connexion par mot de passe native PG est activée pour l'instance. La valeur default est true.

Ajouté dans Databricks CLI version 0.267.0

enable_readable_secondaries

Booléen

Permet d'activer les secondaires pour gérer le trafic en lecture seule. La valeur default est false.

Ajouté dans la version 0.265.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom de l’instance. Il s'agit de l'identifiant unique de l'instance.

Ajouté dans la version 0.265.0 de Databricks CLI

node_count

Entier

Le nombre de nœuds dans l'instance, composé d'1 nœud primaire et de 0 ou plusieurs nœuds secondaires. default to 1 primary and 0 secondaries.

Ajouté dans la version 0.265.0 de Databricks CLI

parent_instance_ref

Carte

La référence de l'instance parente. Ceci est disponible uniquement si l’instance est une instance enfant. Voir instance parente.

Ajouté dans la version 0.265.0 de Databricks CLI

permissions

Séquence

Les autorisations de l'instance de base de données. Afficher les autorisations.

Ajouté dans la version 0.265.0 de Databricks CLI

retention_window_in_days

Entier

La fenêtre de rétention pour l'instance. Il s'agit de la fenêtre de temps en jours pendant laquelle les données historiques sont conservées. La valeur par default est de 7 jours. Les valeurs valides sont de 2 à 35 jours.

Ajouté dans la version 0.265.0 de Databricks CLI

stopped

Booléen

Si l'instance est arrêtée.

Ajouté dans la version 0.265.0 de Databricks CLI

usage_policy_id

Chaîne

La politique d’utilisation serverless souhaitée à associer à l’instance.

Ajouté dans la version 0.273.0 de Databricks CLI

Clé

Type

Description

capacity

Chaîne

La SKU de l'instance. Les valeurs valides sont CU_1, CU_2, CU_4, CU_8.

Ajouté dans la version 0.265.0 de Databricks CLI

custom_tags

Séquence

Une liste de paires clé-valeur qui spécifient des balises personnalisées associées à l'instance.

Ajouté dans la version 0.273.0 de Databricks CLI

enable_pg_native_login

Booléen

Si la connexion par mot de passe native PG est activée pour l'instance. La valeur default est true.

Ajouté dans Databricks CLI version 0.267.0

enable_readable_secondaries

Booléen

Permet d'activer les secondaires pour gérer le trafic en lecture seule. La valeur default est false.

Ajouté dans la version 0.265.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom de l’instance. Il s'agit de l'identifiant unique de l'instance.

Ajouté dans la version 0.265.0 de Databricks CLI

node_count

Entier

Le nombre de nœuds dans l'instance, composé d'1 nœud primaire et de 0 ou plusieurs nœuds secondaires. default to 1 primary and 0 secondaries.

Ajouté dans la version 0.265.0 de Databricks CLI

parent_instance_ref

Carte

La référence de l'instance parente. Ceci est disponible uniquement si l’instance est une instance enfant. Voir instance parente.

Ajouté dans la version 0.265.0 de Databricks CLI

permissions

Séquence

Les autorisations de l'instance de base de données. Afficher les autorisations.

Ajouté dans la version 0.265.0 de Databricks CLI

retention_window_in_days

Entier

La fenêtre de rétention pour l'instance. Il s'agit de la fenêtre de temps en jours pendant laquelle les données historiques sont conservées. La valeur par default est de 7 jours. Les valeurs valides sont de 2 à 35 jours.

Ajouté dans la version 0.265.0 de Databricks CLI

stopped

Booléen

Si l'instance est arrêtée.

Ajouté dans la version 0.265.0 de Databricks CLI

usage_policy_id

Chaîne

La politique d’utilisation serverless souhaitée à associer à l’instance.

Ajouté dans la version 0.273.0 de Databricks CLI

database_instance.parent_instance_ref

Type: Map

La référence de l'instance parente. Ceci n'est disponible que si l'instance est une instance enfant.

Clé

Type

Description

branch_time

Chaîne

Heure de Branch de l'instance de base de données ref. Pour une instance de référence parente, il s'agit du moment sur l'instance parente à partir duquel l'instance a été créée. Pour une instance de référence enfant, il s'agit du point dans le temps sur l'instance à partir duquel l'instance enfant a été créée.

lsn

Chaîne

WAL LSN spécifié par l'utilisateur de l'instance de base de données de référence.

name

Chaîne

Nom de l'instance de la base de données de référence.

Clé

Type

Description

branch_time

Chaîne

Heure de Branch de l'instance de base de données ref. Pour une instance de référence parente, il s'agit du moment sur l'instance parente à partir duquel l'instance a été créée. Pour une instance de référence enfant, il s'agit du point dans le temps sur l'instance à partir duquel l'instance enfant a été créée.

lsn

Chaîne

WAL LSN spécifié par l'utilisateur de l'instance de base de données de référence.

name

Chaîne

Nom de l'instance de la base de données de référence.

Exemple

L'exemple suivant définit une instance de base de données avec un catalogue de base de données correspondant :

YAML
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: ${resources.database_instances.my_instance.name}
name: example_catalog
database_name: my_database
create_database_if_not_exists: true

Pour un exemple de bundle qui montre comment définir une instance de base de données et le catalogue de base de données correspondant, consultez le repository GitHub bundle-examples.

Experimentation

Type: Map

La ressource d'expérimentation vous permet de définir des expérimentations MLflow dans un bundle. Pour plus d'informations sur les expérimentations MLflow, consultez Organiser les exécutions d'entraînement avec les expérimentations MLflow.

YAML
experiments:
<experiment-name>:
<experiment-field-name>: <experiment-field-value>

Clé

Type

Description

artifact_location

Chaîne

L'emplacement où les artefacts pour l'expérimentation sont stockés. L'emplacement doit inclure un schéma URI tel que dbfs: ou s3:. Pour stocker des artefacts dans un volume Unity Catalog (recommandé, nécessite MLflow 2.15.0 ou supérieur), utilisez un chemin de la forme dbfs:/Volumes/<catalog>/<schema>/<volume>/<path>. Consultez Créer une Experimentation depuis le Workspace.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom convivial qui identifie l'expérimentation. Un nom d'Experimentation doit être un chemin absolu dans le workspace Databricks, par exemple /Workspace/Users/someone@example.com/my_experiment.

permissions

Séquence

Les autorisations de l'expérience. Afficher les autorisations.

tags

Séquence

Paires clé-valeur de métadonnées supplémentaires. Voir les tags. Pour définir une description pour l’expérimentation, utilisez le tag mlflow.note.content. Pour attacher une politique budgétaire serverless, utilisez le tag mlflow.workload_creation_policy_id. Voir l'attribution de l'utilisation avec les politiques d'utilisation serverless.

Clé

Type

Description

artifact_location

Chaîne

L'emplacement où les artefacts pour l'expérimentation sont stockés. L'emplacement doit inclure un schéma URI tel que dbfs: ou s3:. Pour stocker des artefacts dans un volume Unity Catalog (recommandé, nécessite MLflow 2.15.0 ou supérieur), utilisez un chemin de la forme dbfs:/Volumes/<catalog>/<schema>/<volume>/<path>. Consultez Créer une Experimentation depuis le Workspace.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom convivial qui identifie l'expérimentation. Un nom d'Experimentation doit être un chemin absolu dans le workspace Databricks, par exemple /Workspace/Users/someone@example.com/my_experiment.

permissions

Séquence

Les autorisations de l'expérience. Afficher les autorisations.

tags

Séquence

Paires clé-valeur de métadonnées supplémentaires. Voir les tags. Pour définir une description pour l’expérimentation, utilisez le tag mlflow.note.content. Pour attacher une politique budgétaire serverless, utilisez le tag mlflow.workload_creation_policy_id. Voir l'attribution de l'utilisation avec les politiques d'utilisation serverless.

Exemple

L'exemple suivant définit une experimentation que tous les utilisateurs peuvent consulter :

YAML
resources:
experiments:
experiment:
name: /Workspace/Users/someone@example.com/my_experiment
permissions:
- level: CAN_READ
group_name: users
tags:
- key: mlflow.note.content
value: MLflow experiment used to track runs

external_location (Unity Catalog)

Type: Map

La ressource d'emplacement externe vous permet de définir des emplacements externes (Unity Catalog) dans un bundle.

remarque

L’utilisation de Declarative Automation Bundles pour définir des emplacements externes n’est prise en charge que si vous utilisez le moteur de déploiement direct.

Ajouté dans la CLI Databricks version 0.289.0

YAML
external_locations:
<external-location-name>:
<external-location-field-name>: <external-location-field-value>

Clé

Type

Description

comment

Chaîne

Description textuelle de forme libre fournie par l'utilisateur de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

credential_name

Chaîne

Obligatoire. Le nom de l'identifiant de stockage utilisé avec cet emplacement.

Ajouté dans la CLI Databricks version 0.289.0

enable_file_events

Booléen

Faut-il activer les événements de fichiers sur cet emplacement externe. La valeur par défaut est true. La valeur appliquée réelle peut différer en raison des valeurs default côté serveur. Vérifiez effective_enable_file_events pour connaître l'état effectif.

Ajouté dans la CLI Databricks version 0.289.0

encryption_details

Carte

Options de chiffrement qui s'appliquent aux clients se connectant au stockage cloud. Voir détails de cryptage de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

fallback

Booléen

Indique si le mode fallback est activé pour cet emplacement externe. Lorsque le mode fallback est activé, l'accès à l'emplacement est rétabli via les identifiants du cluster si les identifiants Unity Catalog ne sont pas suffisants.

Ajouté dans la CLI Databricks version 0.289.0

file_event_queue

Carte

Paramètres de la file d'attente d'événements de fichier pour cet emplacement externe. Si enable_file_events n'est pas false, cette clé doit être définie et posséder exactement l'une des propriétés documentées. Voir external_location.file_event_queue.

Ajouté dans la CLI Databricks version 0.289.0

grants

Séquence

Les autorisations associées à l'emplacement externe. Voir l'octroi.

Ajouté dans la CLI Databricks version 0.289.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la CLI Databricks version 0.289.0

name

Chaîne

Obligatoire. Le nom de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

read_only

Booléen

Indique si l'emplacement externe est en lecture seule.

Ajouté dans la CLI Databricks version 0.289.0

skip_validation

Booléen

Ignore la validation de l'identifiant de stockage associé à l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

url

Chaîne

Obligatoire. URL du chemin de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

Clé

Type

Description

comment

Chaîne

Description textuelle de forme libre fournie par l'utilisateur de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

credential_name

Chaîne

Obligatoire. Le nom de l'identifiant de stockage utilisé avec cet emplacement.

Ajouté dans la CLI Databricks version 0.289.0

enable_file_events

Booléen

Faut-il activer les événements de fichiers sur cet emplacement externe. La valeur par défaut est true. La valeur appliquée réelle peut différer en raison des valeurs default côté serveur. Vérifiez effective_enable_file_events pour connaître l'état effectif.

Ajouté dans la CLI Databricks version 0.289.0

encryption_details

Carte

Options de chiffrement qui s'appliquent aux clients se connectant au stockage cloud. Voir détails de cryptage de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

fallback

Booléen

Indique si le mode fallback est activé pour cet emplacement externe. Lorsque le mode fallback est activé, l'accès à l'emplacement est rétabli via les identifiants du cluster si les identifiants Unity Catalog ne sont pas suffisants.

Ajouté dans la CLI Databricks version 0.289.0

file_event_queue

Carte

Paramètres de la file d'attente d'événements de fichier pour cet emplacement externe. Si enable_file_events n'est pas false, cette clé doit être définie et posséder exactement l'une des propriétés documentées. Voir external_location.file_event_queue.

Ajouté dans la CLI Databricks version 0.289.0

grants

Séquence

Les autorisations associées à l'emplacement externe. Voir l'octroi.

Ajouté dans la CLI Databricks version 0.289.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la CLI Databricks version 0.289.0

name

Chaîne

Obligatoire. Le nom de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

read_only

Booléen

Indique si l'emplacement externe est en lecture seule.

Ajouté dans la CLI Databricks version 0.289.0

skip_validation

Booléen

Ignore la validation de l'identifiant de stockage associé à l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

url

Chaîne

Obligatoire. URL du chemin de l'emplacement externe.

Ajouté dans la CLI Databricks version 0.289.0

external_location.encryption_details

Type: Map

Options de chiffrement qui s'appliquent aux clients se connectant au stockage cloud.

Clé

Type

Description

sse_encryption_details

Carte

Propriétés de chiffrement côté serveur pour les clients communiquant avec Amazon S3.

Clé

Type

Description

sse_encryption_details

Carte

Propriétés de chiffrement côté serveur pour les clients communiquant avec Amazon S3.

external_location.file_event_queue

Type: Map

Paramètres de la file d'attente d'événements de fichier pour cet emplacement externe.

Clé

Type

Description

managed_aqs

Carte

Paramètres de stockage de file d'attente Azure gérés.

managed_pubsub

Carte

Paramètres gérés de Google Cloud Pub/Sub.

managed_sqs

Carte

Paramètres Amazon SQS gérés.

provided_aqs

Carte

Paramètres de stockage de file d'attente Azure fournis par l'utilisateur.

provided_pubsub

Carte

Paramètres Google Cloud Pub/Sub fournis par l'utilisateur.

provided_sqs

Carte

Paramètres Amazon SQS fournis par l'utilisateur.

Clé

Type

Description

managed_aqs

Carte

Paramètres de stockage de file d'attente Azure gérés.

managed_pubsub

Carte

Paramètres gérés de Google Cloud Pub/Sub.

managed_sqs

Carte

Paramètres Amazon SQS gérés.

provided_aqs

Carte

Paramètres de stockage de file d'attente Azure fournis par l'utilisateur.

provided_pubsub

Carte

Paramètres Google Cloud Pub/Sub fournis par l'utilisateur.

provided_sqs

Carte

Paramètres Amazon SQS fournis par l'utilisateur.

Exemple

YAML
# databricks.yml
bundle:
name: external-locations-example
engine: direct # External locations require the direct deployment engine

resources:
external_locations:
my_external_location:
name: my_external_location
url: 's3://my-bucket/my-path'
credential_name: my_storage_credential
comment: 'External location created by Databricks Asset Bundles'
grants:
- principal: someone@example.com
privileges:
- CREATE_EXTERNAL_TABLE
- READ_FILES

genie_space

Type: Map

La ressource d'agent Genie vous permet de définir des agents Genie dans un pack. Pour plus d’informations sur les agents Genie, consultez Agents Genie.

remarque

L'utilisation des paquets d'automatisation déclaratifs pour définir les agents Genie n'est prise en charge que si vous utilisez le moteur de déploiement direct.

Ajouté à la version 1,3,0 de Databricks CLI

YAML
genie_spaces:
<genie_space-name>:
<genie_space-field-name>: <genie_space-field-value>

Clé

Type

Description

description

Chaîne

La description de l'agent Genie.

Ajouté à la version 1,3,0 de Databricks CLI

file_path

Chaîne

Le chemin d'accès à un fichier local (par exemple, sales_analytics.geniespace.json) qui sera utilisé à la place de l'entrée serialized_space.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté à la version 1,3,0 de Databricks CLI

parent_path

Chaîne

Le chemin du dossier parent où l'agent Genie sera enregistré.

Ajouté à la version 1,3,0 de Databricks CLI

permissions

Séquence

Les autorisations de l'agent Genie. Afficher les autorisations.

Ajouté à la version 1,3,0 de Databricks CLI

serialized_space

Chaîne

Obligatoire. Le contenu du Genie Agent sous forme de chaîne sérialisée. Ce champ fournit la structure de la chaîne JSON qui représente le Layout et les composants de l'espace. Si file_path est spécifié, il a la priorité sur serialized_space.

Ajouté à la version 1,3,0 de Databricks CLI

title

Chaîne

Une substitution de titre facultative pour l’agent Genie.

Ajouté à la version 1,3,0 de Databricks CLI

warehouse_id

Chaîne

Obligatoire. L'ID du SQL Warehouse à associer au nouvel espace.

Ajouté à la version 1,3,0 de Databricks CLI

Clé

Type

Description

description

Chaîne

La description de l'agent Genie.

Ajouté à la version 1,3,0 de Databricks CLI

file_path

Chaîne

Le chemin d'accès à un fichier local (par exemple, sales_analytics.geniespace.json) qui sera utilisé à la place de l'entrée serialized_space.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté à la version 1,3,0 de Databricks CLI

parent_path

Chaîne

Le chemin du dossier parent où l'agent Genie sera enregistré.

Ajouté à la version 1,3,0 de Databricks CLI

permissions

Séquence

Les autorisations de l'agent Genie. Afficher les autorisations.

Ajouté à la version 1,3,0 de Databricks CLI

serialized_space

Chaîne

Obligatoire. Le contenu du Genie Agent sous forme de chaîne sérialisée. Ce champ fournit la structure de la chaîne JSON qui représente le Layout et les composants de l'espace. Si file_path est spécifié, il a la priorité sur serialized_space.

Ajouté à la version 1,3,0 de Databricks CLI

title

Chaîne

Une substitution de titre facultative pour l’agent Genie.

Ajouté à la version 1,3,0 de Databricks CLI

warehouse_id

Chaîne

Obligatoire. L'ID du SQL Warehouse à associer au nouvel espace.

Ajouté à la version 1,3,0 de Databricks CLI

Exemples

L'exemple suivant définit une ressource d'agent Genie :

YAML
# databricks.yml
bundle:
name: nyc-taxi-genie
engine: direct # genie_spaces require the direct deployment engine

resources:
genie_spaces:
nyc_taxi_genie:
title: 'NYC Taxi Trip Analysis'
description: 'Ask questions about NYC taxi trip data in natural language'
warehouse_id: <warehouse-id>
file_path: ./nyc_taxi_genie.geniespace.json
permissions:
- level: CAN_RUN
group_name: users

Le fichier nyc_taxi_genie.geniespace.json correspondant contient la définition sérialisée de l'espace, y compris ses sources de données, instructions et exemples de questions. Il peut également être spécifié en YAML dans la clé serialized_space à la place.

JSON
// nyc_taxi_genie.geniespace.json
{
"version": 2,
"config": {
"sample_questions": [
{
"id": "11111111111111111111111111111111",
"question": ["What is the average fare per trip?"]
}
]
},
"data_sources": {
"tables": [
{
"identifier": "samples.nyctaxi.trips",
"column_configs": [
{ "column_name": "fare_amount" },
{ "column_name": "pickup_zip" },
{ "column_name": "tpep_pickup_datetime" },
{ "column_name": "trip_distance" }
]
}
]
},
"instructions": {
"text_instructions": [
{
"id": "22222222222222222222222222222222",
"content": ["Fare amounts are in USD. When asked about revenue, use SUM(fare_amount)."]
}
]
}
}

Job

Type: Map

Les tâches sont prises en charge en Python pour les Declarative Automation Bundles. Consultez databricks.bundles.jobs.

La ressource Job vous permet de définir des Jobs et leurs tâches correspondantes dans votre bundle.

Pour des informations sur les tâches, consultez Lakeflow Jobs. Pour un tutoriel qui utilise un template de Declarative Automation Bundles pour créer un job, voir Développer un job avec Declarative Automation Bundles.

YAML
jobs:
<job-name>:
<job-field-name>: <job-field-value>

Clé

Type

Description

budget_policy_id

Chaîne

L'identifiant de la politique budgétaire spécifiée par l'utilisateur à utiliser pour ce Job. Si elle n'est pas spécifiée, une politique budgétaire default peut être appliquée lors de la création ou de la modification du Job. Consultez effective_budget_policy_id pour la politique budgétaire utilisée par cette charge de travail.

Ajouté dans la version 0,231,0 de la CLI Databricks.

continuous

Carte

Une propriété continue facultative pour ce Job. La propriété continue garantira qu’il y a toujours une exécution en cours. Un seul de schedule et continuous peut être utilisé. Voir continu.

deployment

Carte

Informations de déploiement pour les Jobs gérés par des sources externes. Voir déploiement.

description

Chaîne

Une description facultative pour le job. La longueur maximale est de 27 700 caractères en encodage UTF-8.

email_notifications

Carte

Un ensemble facultatif d'adresses e-mail qui est averti lorsque des exécutions de ce Job commencent ou se terminent, ainsi que lorsque ce Job est supprimé. Consultez email_notifications.

environments

Séquence

Une liste de spécifications d'environnement d'exécution de tâche qui peuvent être référencées par les tâches serverless de ce job. Un environnement est requis pour les tâches serverless. Pour les tâches Notebook serverless, l'environnement est accessible dans le panneau d'environnement du Notebook. Pour les autres tâches serverless, l'environnement de la tâche doit être spécifié à l'aide de environment_key dans les paramètres de la tâche. Consultez les environnements.

format

Chaîne

Obsolète. Le format du Job.

git_source

Carte

Une spécification facultative pour un repository Git distant contenant le code source utilisé par les tâches. Voir Job.git_source.

Important : Le champ git_source et le champ de tâche source défini sur GIT ne sont pas recommandés pour les bundles, car les chemins relatifs locaux peuvent ne pas pointer vers le même contenu dans le repository Git, et les bundles s'attendent à ce qu'un job déployé ait le même contenu que la copie locale à partir de laquelle il a été déployé.

Au lieu de cela, clonez le repository localement et configurez votre projet de bundle dans ce repository, de sorte que la source des tâches soit le workspace.

health

Carte

Un ensemble facultatif de règles d'intégrité pouvant être définies pour ce Job. Voir l'intégrité.

job_clusters

Séquence

Liste des spécifications de clusters Job pouvant être partagées et réutilisées par les tâches de ce Job. Voir les job_clusters.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

max_concurrent_runs

Entier

Un nombre maximal facultatif autorisé d'exécutions simultanées du job. Définissez cette valeur si vous souhaitez pouvoir exécuter plusieurs exécutions du même job simultanément.

name

Chaîne

Un nom facultatif pour le Job. La longueur maximale est de 4096 octets en encodage UTF-8.

notification_settings

Carte

Paramètres de notification facultatifs qui sont utilisés lors de l'envoi de notifications à chacun des email_notifications et webhook_notifications pour ce Job. Voir paramètres de notification.

parameters

Séquence

Définitions des paramètres au niveau du job. Voir les paramètres de job.

performance_target

Chaîne

Définit le niveau de performance ou de rentabilité de l'exécution sur serverless.

Ajouté dans la version 0.241.0 de Databricks CLI

permissions

Séquence

Les autorisations du Job. Afficher les autorisations.

queue

Carte

Les paramètres de la file d'attente du job. Voir la file d'attente.

run_as

Carte

Paramètre en écriture seule. Spécifie l'utilisateur ou le Service Principal sous lequel le Job s'exécute. S'il n'est pas spécifié, le job est exécuté par l'utilisateur qui l'a créé. Soit user_name, soit service_principal_name doit être spécifié. Sinon, une erreur est générée. Voir run_as.

schedule

Carte

Un planning périodique facultatif pour ce job. Le comportement default est que le Job ne s'exécute que lorsqu'il est Trigger en cliquant sur « Run Now » dans l'interface utilisateur des Jobs ou en envoyant une requête API à runNow. Voir la planification.

tags

Carte

Une carte des tags associés au job. Celles-ci sont transmises au cluster en tant que Cluster Tags pour les clusters de jobs, et sont soumises aux mêmes limitations que les Cluster Tags. Un maximum de 25 tags peut être ajouté au job.

tasks

Séquence

Une liste de spécifications de tâches à exécuter par ce Job. Consultez Ajouter des tâches aux jobs dans les Declarative Automation Bundles.

Ajouté dans la version 0.237.0 de Databricks CLI.

timeout_seconds

Entier

Un délai d'expiration facultatif appliqué à chaque exécution de ce Job. Une valeur de 0 signifie aucun délai d'expiration.

trigger

Carte

Une configuration pour Trigger une exécution lorsque certaines conditions sont remplies. See Trigger.

usage_policy_id

Chaîne

L'ID de la politique d'utilisation serverless à utiliser pour ce job.

Ajouté dans la version 0.273.0 de Databricks CLI

webhook_notifications

Carte

Une collection d'ID de notification système à notifier lorsque les exécutions de ce Job commencent ou se terminent. Voir webhook_notifications.

Clé

Type

Description

budget_policy_id

Chaîne

L'identifiant de la politique budgétaire spécifiée par l'utilisateur à utiliser pour ce Job. Si elle n'est pas spécifiée, une politique budgétaire default peut être appliquée lors de la création ou de la modification du Job. Consultez effective_budget_policy_id pour la politique budgétaire utilisée par cette charge de travail.

Ajouté dans la version 0,231,0 de la CLI Databricks.

continuous

Carte

Une propriété continue facultative pour ce Job. La propriété continue garantira qu’il y a toujours une exécution en cours. Un seul de schedule et continuous peut être utilisé. Voir continu.

deployment

Carte

Informations de déploiement pour les Jobs gérés par des sources externes. Voir déploiement.

description

Chaîne

Une description facultative pour le job. La longueur maximale est de 27 700 caractères en encodage UTF-8.

email_notifications

Carte

Un ensemble facultatif d'adresses e-mail qui est averti lorsque des exécutions de ce Job commencent ou se terminent, ainsi que lorsque ce Job est supprimé. Consultez email_notifications.

environments

Séquence

Une liste de spécifications d'environnement d'exécution de tâche qui peuvent être référencées par les tâches serverless de ce job. Un environnement est requis pour les tâches serverless. Pour les tâches Notebook serverless, l'environnement est accessible dans le panneau d'environnement du Notebook. Pour les autres tâches serverless, l'environnement de la tâche doit être spécifié à l'aide de environment_key dans les paramètres de la tâche. Consultez les environnements.

format

Chaîne

Obsolète. Le format du Job.

git_source

Carte

Une spécification facultative pour un repository Git distant contenant le code source utilisé par les tâches. Voir Job.git_source.

Important : Le champ git_source et le champ de tâche source défini sur GIT ne sont pas recommandés pour les bundles, car les chemins relatifs locaux peuvent ne pas pointer vers le même contenu dans le repository Git, et les bundles s'attendent à ce qu'un job déployé ait le même contenu que la copie locale à partir de laquelle il a été déployé.

Au lieu de cela, clonez le repository localement et configurez votre projet de bundle dans ce repository, de sorte que la source des tâches soit le workspace.

health

Carte

Un ensemble facultatif de règles d'intégrité pouvant être définies pour ce Job. Voir l'intégrité.

job_clusters

Séquence

Liste des spécifications de clusters Job pouvant être partagées et réutilisées par les tâches de ce Job. Voir les job_clusters.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

max_concurrent_runs

Entier

Un nombre maximal facultatif autorisé d'exécutions simultanées du job. Définissez cette valeur si vous souhaitez pouvoir exécuter plusieurs exécutions du même job simultanément.

name

Chaîne

Un nom facultatif pour le Job. La longueur maximale est de 4096 octets en encodage UTF-8.

notification_settings

Carte

Paramètres de notification facultatifs qui sont utilisés lors de l'envoi de notifications à chacun des email_notifications et webhook_notifications pour ce Job. Voir paramètres de notification.

parameters

Séquence

Définitions des paramètres au niveau du job. Voir les paramètres de job.

performance_target

Chaîne

Définit le niveau de performance ou de rentabilité de l'exécution sur serverless.

Ajouté dans la version 0.241.0 de Databricks CLI

permissions

Séquence

Les autorisations du Job. Afficher les autorisations.

queue

Carte

Les paramètres de la file d'attente du job. Voir la file d'attente.

run_as

Carte

Paramètre en écriture seule. Spécifie l'utilisateur ou le Service Principal sous lequel le Job s'exécute. S'il n'est pas spécifié, le job est exécuté par l'utilisateur qui l'a créé. Soit user_name, soit service_principal_name doit être spécifié. Sinon, une erreur est générée. Voir run_as.

schedule

Carte

Un planning périodique facultatif pour ce job. Le comportement default est que le Job ne s'exécute que lorsqu'il est Trigger en cliquant sur « Run Now » dans l'interface utilisateur des Jobs ou en envoyant une requête API à runNow. Voir la planification.

tags

Carte

Une carte des tags associés au job. Celles-ci sont transmises au cluster en tant que Cluster Tags pour les clusters de jobs, et sont soumises aux mêmes limitations que les Cluster Tags. Un maximum de 25 tags peut être ajouté au job.

tasks

Séquence

Une liste de spécifications de tâches à exécuter par ce Job. Consultez Ajouter des tâches aux jobs dans les Declarative Automation Bundles.

Ajouté dans la version 0.237.0 de Databricks CLI.

timeout_seconds

Entier

Un délai d'expiration facultatif appliqué à chaque exécution de ce Job. Une valeur de 0 signifie aucun délai d'expiration.

trigger

Carte

Une configuration pour Trigger une exécution lorsque certaines conditions sont remplies. See Trigger.

usage_policy_id

Chaîne

L'ID de la politique d'utilisation serverless à utiliser pour ce job.

Ajouté dans la version 0.273.0 de Databricks CLI

webhook_notifications

Carte

Une collection d'ID de notification système à notifier lorsque les exécutions de ce Job commencent ou se terminent. Voir webhook_notifications.

Job.continuous

Type: Map

Configuration pour l'exécution continue des jobs.

Clé

Type

Description

pause_status

Chaîne

Que le Job continu soit en pause ou non. Valeurs valides : PAUSED, UNPAUSED.

task_retry_mode

Chaîne

Indiquez comment le job continu applique les nouvelles tentatives au niveau de la tâche. Les valeurs valides sont NEVER et ON_FAILURE. Par défaut : NEVER.

Clé

Type

Description

pause_status

Chaîne

Que le Job continu soit en pause ou non. Valeurs valides : PAUSED, UNPAUSED.

task_retry_mode

Chaîne

Indiquez comment le job continu applique les nouvelles tentatives au niveau de la tâche. Les valeurs valides sont NEVER et ON_FAILURE. Par défaut : NEVER.

déploiement du job

Type: Map

Informations de déploiement pour les Jobs gérés par des sources externes.

Clé

Type

Description

kind

Chaîne

Le type de déploiement. Par exemple, BUNDLE.

metadata_file_path

Chaîne

Le chemin d'accès au fichier de métadonnées pour le déploiement.

Clé

Type

Description

kind

Chaîne

Le type de déploiement. Par exemple, BUNDLE.

metadata_file_path

Chaîne

Le chemin d'accès au fichier de métadonnées pour le déploiement.

notifications_par_e-mail.Job

Type: Map

Paramètres de notification par e-mail pour les exécutions de jobs.

Clé

Type

Description

on_start

Séquence

Une liste d'adresses e-mail à notifier lorsqu'une exécution start.

on_success

Séquence

Liste d'adresses e-mail à notifier lorsqu'une exécution aboutit.

on_failure

Séquence

Une liste d'adresses e-mail à notifier lorsqu'une exécution échoue.

on_duration_warning_threshold_exceeded

Séquence

Liste d'adresses e-mail à notifier lorsqu'une durée d'exécution dépasse le threshold d'avertissement.

no_alert_for_skipped_runs

Booléen

Faut-il ignorer l'envoi d'alertes pour les exécutions ignorées.

on_streaming_backlog_exceeded

Séquence

Une liste d'adresses e-mail à notifier lorsque les seuils de backlog de streaming sont dépassés pour tout Stream. Les thresholds de backlog de streaming peuvent être définis dans le champ health à l'aide des métriques suivantes : STREAMING_BACKLOG_BYTES, STREAMING_BACKLOG_RECORDS, STREAMING_BACKLOG_SECONDS ou STREAMING_BACKLOG_FILES. Les alertes sont basées sur la moyenne sur 10 minutes de ces métriques. Si le problème persiste, les notifications sont renvoyées toutes les 30 minutes.

Clé

Type

Description

on_start

Séquence

Une liste d'adresses e-mail à notifier lorsqu'une exécution start.

on_success

Séquence

Liste d'adresses e-mail à notifier lorsqu'une exécution aboutit.

on_failure

Séquence

Une liste d'adresses e-mail à notifier lorsqu'une exécution échoue.

on_duration_warning_threshold_exceeded

Séquence

Liste d'adresses e-mail à notifier lorsqu'une durée d'exécution dépasse le threshold d'avertissement.

no_alert_for_skipped_runs

Booléen

Faut-il ignorer l'envoi d'alertes pour les exécutions ignorées.

on_streaming_backlog_exceeded

Séquence

Une liste d'adresses e-mail à notifier lorsque les seuils de backlog de streaming sont dépassés pour tout Stream. Les thresholds de backlog de streaming peuvent être définis dans le champ health à l'aide des métriques suivantes : STREAMING_BACKLOG_BYTES, STREAMING_BACKLOG_RECORDS, STREAMING_BACKLOG_SECONDS ou STREAMING_BACKLOG_FILES. Les alertes sont basées sur la moyenne sur 10 minutes de ces métriques. Si le problème persiste, les notifications sont renvoyées toutes les 30 minutes.

Job.environnements

Type: Sequence

Liste des spécifications d'environnement d'exécution de tâche qui peuvent être référencées par des tâches serverless d'un job.

Chaque élément de la liste est un JobEnvironment:

Clé

Type

Description

environment_key

Chaîne

La clé d'un environnement. Il doit être unique au sein d'un job.

spec

Carte

L’entité qui représente un environnement serverless. Voir job.environments.spec.

Clé

Type

Description

environment_key

Chaîne

La clé d'un environnement. Il doit être unique au sein d'un job.

spec

Carte

L’entité qui représente un environnement serverless. Voir job.environments.spec.

job.environments.spec

Type: Map

L'entité qui représente un environnement serverless.

Clé

Type

Description

client

Chaîne

Obsolète. La version client.

dependencies

Séquence

Liste des dépendances pip, telles que prises en charge par la version de pip dans cet environnement.

environment_version

Chaîne

Obligatoire. Version de l’environnement utilisée par l’environnement. Chaque version est livrée avec une version spécifique de Python et un ensemble de packages Python. La version est une chaîne, composée d'un entier.

Clé

Type

Description

client

Chaîne

Obsolète. La version client.

dependencies

Séquence

Liste des dépendances pip, telles que prises en charge par la version de pip dans cet environnement.

environment_version

Chaîne

Obligatoire. Version de l’environnement utilisée par l’environnement. Chaque version est livrée avec une version spécifique de Python et un ensemble de packages Python. La version est une chaîne, composée d'un entier.

job.git_source

Type: Map

Configuration du repository Git pour le code source des jobs.

Clé

Type

Description

git_branch

Chaîne

Le nom de la Branch à extraire et à utiliser par ce Job. Ce champ ne peut pas être spécifié en conjonction avec git_tag ou git_commit.

git_commit

Chaîne

commit à extraire et à utiliser pour cette job. Ce champ ne peut pas être spécifié en conjonction avec git_branch ou git_tag.

git_provider

Chaîne

Identifiant unique du service utilisé pour héberger le repository Git. La valeur est insensible à la casse. Les valeurs valides sont gitHub, bitbucketCloud, gitLab, azureDevOpsServices, gitHubEnterprise, bitbucketServer, gitLabEnterpriseEdition.

git_snapshot

Carte

État en lecture seule du repository distant au moment de l'exécution du job. Ce champ n'est inclus que dans les exécutions de job. Voir git_snapshot.

git_tag

Chaîne

Nom du tag à extraire et à utiliser par ce job. Ce champ ne peut pas être spécifié en conjonction avec git_branch ou git_commit.

git_url

Chaîne

URL du repository à cloner par ce Job.

sparse_checkout

Carte

Configuration de l'extraction éparse pour le repository Git. Consultez job.git_source.sparse_checkout.

Ajouté à la version 0,290.0 de Databricks CLI

Clé

Type

Description

git_branch

Chaîne

Le nom de la Branch à extraire et à utiliser par ce Job. Ce champ ne peut pas être spécifié en conjonction avec git_tag ou git_commit.

git_commit

Chaîne

commit à extraire et à utiliser pour cette job. Ce champ ne peut pas être spécifié en conjonction avec git_branch ou git_tag.

git_provider

Chaîne

Identifiant unique du service utilisé pour héberger le repository Git. La valeur est insensible à la casse. Les valeurs valides sont gitHub, bitbucketCloud, gitLab, azureDevOpsServices, gitHubEnterprise, bitbucketServer, gitLabEnterpriseEdition.

git_snapshot

Carte

État en lecture seule du repository distant au moment de l'exécution du job. Ce champ n'est inclus que dans les exécutions de job. Voir git_snapshot.

git_tag

Chaîne

Nom du tag à extraire et à utiliser par ce job. Ce champ ne peut pas être spécifié en conjonction avec git_branch ou git_commit.

git_url

Chaîne

URL du repository à cloner par ce Job.

sparse_checkout

Carte

Configuration de l'extraction éparse pour le repository Git. Consultez job.git_source.sparse_checkout.

Ajouté à la version 0,290.0 de Databricks CLI

job.git_source.sparse_checkout

Type: Map

Configuration de récupération fragmentée pour le repository Git.

Ajouté à la version 0,290.0 de Databricks CLI

Clé

Type

Description

patterns

Séquence

Liste des modèles à inclure pour la récupération fragmentée.

Ajouté à la version 0,290.0 de Databricks CLI

Clé

Type

Description

patterns

Séquence

Liste des modèles à inclure pour la récupération fragmentée.

Ajouté à la version 0,290.0 de Databricks CLI

job.git_source.git_snapshot

Type: Map

Instantané des informations de commit en lecture seule.

Clé

Type

Description

used_commit

Chaîne

Commit qui a été utilisé pour l'exécution. Si git_branch a été spécifié, cela pointe vers le HEAD de la Branch au moment de l'exécution ; si git_tag a été spécifié, cela pointe vers le commit que le tag pointe.

Clé

Type

Description

used_commit

Chaîne

Commit qui a été utilisé pour l'exécution. Si git_branch a été spécifié, cela pointe vers le HEAD de la Branch au moment de l'exécution ; si git_tag a été spécifié, cela pointe vers le commit que le tag pointe.

job.health

Type: Map

Configuration de monitoring de l'état pour le Job.

Clé

Type

Description

rules

Séquence

Une liste de règles de santé du Job. Chaque règle contient un metric et op (opérateur) et value. Voir job.health.rules.

Clé

Type

Description

rules

Séquence

Une liste de règles de santé du Job. Chaque règle contient un metric et op (opérateur) et value. Voir job.health.rules.

job.health.rules

Type: Sequence

Une liste de règles de santé du Job.

Chaque élément de la liste est un JobHealthRule:

Clé

Type

Description

metric

Chaîne

Spécifie la métrique de santé qui est évaluée pour une règle de santé particulière.

  • RUN_DURATION_SECONDS: Durée totale prévue pour une exécution en secondes.
  • STREAMING_BACKLOG_BYTES: une estimation du nombre maximal d'octets de données en attente d'être consommés sur tous les Stream. Cette métrique est en Aperçu public.
  • STREAMING_BACKLOG_RECORDS: Une estimation du décalage maximal des offsets sur tous les Streams. Cette métrique est en Aperçu public.
  • STREAMING_BACKLOG_SECONDS: Une estimation du délai maximal du consommateur sur l'ensemble des Streams. Cette métrique est en Aperçu public.
  • STREAMING_BACKLOG_FILES: Une estimation du nombre maximal de fichiers en attente sur tous les streams. Cette métrique est en Aperçu public.

op

Chaîne

Spécifie l'opérateur utilisé pour comparer la valeur de la métrique de santé avec le threshold spécifié.

value

Entier

Spécifie la valeur threshold que l'indicateur de santé doit respecter pour satisfaire la règle de santé.

Clé

Type

Description

metric

Chaîne

Spécifie la métrique de santé qui est évaluée pour une règle de santé particulière.

  • RUN_DURATION_SECONDS: Durée totale prévue pour une exécution en secondes.
  • STREAMING_BACKLOG_BYTES: une estimation du nombre maximal d'octets de données en attente d'être consommés sur tous les Stream. Cette métrique est en Aperçu public.
  • STREAMING_BACKLOG_RECORDS: Une estimation du décalage maximal des offsets sur tous les Streams. Cette métrique est en Aperçu public.
  • STREAMING_BACKLOG_SECONDS: Une estimation du délai maximal du consommateur sur l'ensemble des Streams. Cette métrique est en Aperçu public.
  • STREAMING_BACKLOG_FILES: Une estimation du nombre maximal de fichiers en attente sur tous les streams. Cette métrique est en Aperçu public.

op

Chaîne

Spécifie l'opérateur utilisé pour comparer la valeur de la métrique de santé avec le threshold spécifié.

value

Entier

Spécifie la valeur threshold que l'indicateur de santé doit respecter pour satisfaire la règle de santé.

Job.clusters de Jobs

Type: Sequence

Liste des spécifications de clusters Job pouvant être partagées et réutilisées par les tâches de ce Job. Les bibliothèques ne peuvent pas être déclarées dans un cluster Job partagé. Vous devez déclarer les bibliothèques dépendantes dans les paramètres de tâche.

Chaque élément de la liste est un JobCluster:

Clé

Type

Description

job_cluster_key

Chaîne

Un nom unique pour le cluster de jobs. Ce champ est obligatoire et doit être unique dans le job. JobTaskSettings peut se référer à ce champ pour déterminer quel cluster lancer pour l'exécution de la tâche.

new_cluster

Carte

Si new_cluster, une description d'un cluster qui est créé pour chaque tâche. See clusters.

Clé

Type

Description

job_cluster_key

Chaîne

Un nom unique pour le cluster de jobs. Ce champ est obligatoire et doit être unique dans le job. JobTaskSettings peut se référer à ce champ pour déterminer quel cluster lancer pour l'exécution de la tâche.

new_cluster

Carte

Si new_cluster, une description d'un cluster qui est créé pour chaque tâche. See clusters.

Job.notification_settings

Type: Map

Paramètres de notification qui s'appliquent à toutes les notifications pour le job.

Clé

Type

Description

no_alert_for_skipped_runs

Booléen

Faut-il ignorer l'envoi d'alertes pour les exécutions ignorées.

no_alert_for_canceled_runs

Booléen

Ne pas envoyer d'alertes pour les exécutions annulées.

Clé

Type

Description

no_alert_for_skipped_runs

Booléen

Faut-il ignorer l'envoi d'alertes pour les exécutions ignorées.

no_alert_for_canceled_runs

Booléen

Ne pas envoyer d'alertes pour les exécutions annulées.

job.parameters

Type: Sequence

Une liste de définitions de parameter de Job.

Chaque élément de la liste est un JobParameter:

Clé

Type

Description

default

Chaîne

Obligatoire. Valeur default du paramètre, par exemple, « users ».

name

Chaîne

Obligatoire. Le nom du parameter défini, par exemple, « table ». Les valeurs valides ne contiennent que des caractères alphanumériques, _, - et ..

Clé

Type

Description

default

Chaîne

Obligatoire. Valeur default du paramètre, par exemple, « users ».

name

Chaîne

Obligatoire. Le nom du parameter défini, par exemple, « table ». Les valeurs valides ne contiennent que des caractères alphanumériques, _, - et ..

job.queue

Type: Map

Paramètres de file d'attente pour le Job.

Clé

Type

Description

enabled

Booléen

Faut-il activer la mise en file d'attente pour le Job.

Clé

Type

Description

enabled

Booléen

Faut-il activer la mise en file d'attente pour le Job.

job.schedule

Type: Map

Configuration de la planification pour l'exécution périodique des jobs.

Clé

Type

Description

quartz_cron_expression

Chaîne

Une expression Cron utilisant la syntaxe Quartz qui spécifie l'exécution du Job. Par exemple, 0 0 9 * * ? exécute le Job tous les jours à 9 h 00 UTC.

timezone_id

Chaîne

Le fuseau horaire pour la planification. Par exemple, America/Los_Angeles ou UTC.

pause_status

Chaîne

Si la planification est suspendue ou non. Valeurs valides : PAUSED, UNPAUSED.

Clé

Type

Description

quartz_cron_expression

Chaîne

Une expression Cron utilisant la syntaxe Quartz qui spécifie l'exécution du Job. Par exemple, 0 0 9 * * ? exécute le Job tous les jours à 9 h 00 UTC.

timezone_id

Chaîne

Le fuseau horaire pour la planification. Par exemple, America/Los_Angeles ou UTC.

pause_status

Chaîne

Si la planification est suspendue ou non. Valeurs valides : PAUSED, UNPAUSED.

job.trigger

Type: Map

Configuration du Trigger pour l'exécution de Job basée sur les événements.

Clé

Type

Description

file_arrival

Carte

Trigger basé sur l'arrivée de fichiers. Voir file_arrival.

table

Carte

Trigger basé sur une table. Consultez le tableau.

table_update

Carte

Trigger basé sur les mises à jour de table. Voir table_update.

periodic

Carte

Trigger périodique. Voir périodique.

Clé

Type

Description

file_arrival

Carte

Trigger basé sur l'arrivée de fichiers. Voir file_arrival.

table

Carte

Trigger basé sur une table. Consultez le tableau.

table_update

Carte

Trigger basé sur les mises à jour de table. Voir table_update.

periodic

Carte

Trigger périodique. Voir périodique.

job.Trigger.file_arrival

Type: Map

Configuration du Trigger basée sur l'arrivée de fichiers.

Clé

Type

Description

url

Chaîne

Le chemin d'accès au fichier à surveiller pour les nouveaux fichiers.

min_time_between_triggers_seconds

Entier

Délai minimal en secondes entre les événements de Trigger.

wait_after_last_change_seconds

Entier

Temps d'attente en secondes après la dernière modification du fichier avant le Trigger.

Clé

Type

Description

url

Chaîne

Le chemin d'accès au fichier à surveiller pour les nouveaux fichiers.

min_time_between_triggers_seconds

Entier

Délai minimal en secondes entre les événements de Trigger.

wait_after_last_change_seconds

Entier

Temps d'attente en secondes après la dernière modification du fichier avant le Trigger.

job.trigger.table

Type: Map

Configuration du Trigger basée sur une table.

Clé

Type

Description

table_names

Séquence

Une liste de noms de tables à surveiller.

condition

Chaîne

La condition SQL qui doit être remplie pour Trigger le Job.

Clé

Type

Description

table_names

Séquence

Une liste de noms de tables à surveiller.

condition

Chaîne

La condition SQL qui doit être remplie pour Trigger le Job.

job.trigger.table_update

Type: Map

Configuration du Trigger basée sur les mises à jour de table.

Clé

Type

Description

table_names

Séquence

Une liste de noms de table à surveiller pour les mises à jour.

condition

Chaîne

La condition SQL qui doit être remplie pour Trigger le Job.

wait_after_last_change_seconds

Entier

Temps d’attente en secondes après la dernière mise à jour de la table avant le Trigger.

Clé

Type

Description

table_names

Séquence

Une liste de noms de table à surveiller pour les mises à jour.

condition

Chaîne

La condition SQL qui doit être remplie pour Trigger le Job.

wait_after_last_change_seconds

Entier

Temps d’attente en secondes après la dernière mise à jour de la table avant le Trigger.

job.trigger.periodic

Type: Map

Configuration du Trigger périodique.

Clé

Type

Description

interval

Entier

La valeur d'intervalle pour le Trigger périodique.

unit

Chaîne

L'unité de temps pour l'intervalle. Valeurs valides : HOURS, DAYS, WEEKS.

Clé

Type

Description

interval

Entier

La valeur d'intervalle pour le Trigger périodique.

unit

Chaîne

L'unité de temps pour l'intervalle. Valeurs valides : HOURS, DAYS, WEEKS.

Job.webhook_notifications

Type: Map

Paramètres de notification de Webhook pour les exécutions de job.

Clé

Type

Description

on_start

Séquence

Une liste d'ID de notifications de webhook à envoyer lorsqu'une exécution start.

on_success

Séquence

Une liste d'ID de notification webhook à notifier lorsqu'une exécution réussit.

on_failure

Séquence

Une liste des ID de notification de webhook à notifier lorsqu'une exécution échoue.

on_duration_warning_threshold_exceeded

Séquence

Une liste d'ID de notifications de webhook à notifier lorsqu'une durée d'exécution dépasse le threshold d'avertissement.

on_streaming_backlog_exceeded

Séquence

Liste des ID de notification système à appeler lorsqu'un backlog threshold de streaming est dépassé pour un Stream. Les thresholds de backlog de streaming peuvent être définis dans le champ health à l'aide des métriques suivantes : STREAMING_BACKLOG_BYTES, STREAMING_BACKLOG_RECORDS, STREAMING_BACKLOG_SECONDS ou STREAMING_BACKLOG_FILES. Les alertes sont basées sur la moyenne sur 10 minutes de ces métriques. Si le problème persiste, les notifications sont renvoyées toutes les 30 minutes. Un maximum de 3 destinations peut être spécifié.

Clé

Type

Description

on_start

Séquence

Une liste d'ID de notifications de webhook à envoyer lorsqu'une exécution start.

on_success

Séquence

Une liste d'ID de notification webhook à notifier lorsqu'une exécution réussit.

on_failure

Séquence

Une liste des ID de notification de webhook à notifier lorsqu'une exécution échoue.

on_duration_warning_threshold_exceeded

Séquence

Une liste d'ID de notifications de webhook à notifier lorsqu'une durée d'exécution dépasse le threshold d'avertissement.

on_streaming_backlog_exceeded

Séquence

Liste des ID de notification système à appeler lorsqu'un backlog threshold de streaming est dépassé pour un Stream. Les thresholds de backlog de streaming peuvent être définis dans le champ health à l'aide des métriques suivantes : STREAMING_BACKLOG_BYTES, STREAMING_BACKLOG_RECORDS, STREAMING_BACKLOG_SECONDS ou STREAMING_BACKLOG_FILES. Les alertes sont basées sur la moyenne sur 10 minutes de ces métriques. Si le problème persiste, les notifications sont renvoyées toutes les 30 minutes. Un maximum de 3 destinations peut être spécifié.

Exemples

L'exemple suivant définit un Job avec la clé de ressource hello-job et une tâche de Notebook :

YAML
resources:
jobs:
hello-job:
name: hello-job
tasks:
- task_key: hello-task
notebook_task:
notebook_path: ./hello.py

L’exemple suivant définit un job avec un notebook SQL :

YAML
resources:
jobs:
job_with_sql_notebook:
name: 'Job to demonstrate using a SQL notebook with a SQL warehouse'
tasks:
- task_key: notebook
notebook_task:
notebook_path: ./select.sql
warehouse_id: 799f096837fzzzz4

Pour d'autres exemples de configuration de Job, consultez Configuration de Job.

Pour des informations sur la définition des tâches de job et la substitution des paramètres de job, consultez :

modèle (hérité)

Type: Map

La ressource de modèle vous permet de définir des modèles hérités dans des bundles. Databricks vous recommande d'utiliser les modèles enregistrés du Unity Catalog à la place.

point de terminaison de service de modèle

Type: Map

La ressource `model_serving_endpoint` vous permet de définir des Endpoint de service de modèle. Consultez Gérer les Endpoint de Model Serving.

YAML
model_serving_endpoints:
<model_serving_endpoint-name>:
<model_serving_endpoint-field-name>: <model_serving_endpoint-field-value>

Clé

Type

Description

ai_gateway

Carte

La configuration de la passerelle IA pour l’Endpoint de diffusion. REMARQUE : Seuls les Endpoint de modèle externe et de throughput provisionné sont actuellement pris en charge. Voir ai_gateway.

Ajouté dans la version 0.230.0 de Databricks CLI

budget_policy_id

Chaîne

L'identifiant de la politique budgétaire à utiliser pour cet Endpoint.

Ajouté dans la version 0.244.0 de Databricks CLI

config

Carte

La configuration principale de l'Endpoint de service. Voir configuration.

description

Chaîne

Une description pour l'endpoint de service.

Ajouté dans la CLI Databricks version 0.260.0

email_notifications

Carte

Configuration des notifications par e-mail pour l'Endpoint de service. Consultez email_notifications.

Ajouté dans la version 0.264.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom de l'Endpoint de service. Ce champ est obligatoire et doit être unique dans l'ensemble d'un Workspace Databricks. Un nom d'Endpoint peut être composé de caractères alphanumériques, de tirets et de traits de soulignement.

permissions

Séquence

Les autorisations de l'endpoint de mise en service du modèle. Afficher les autorisations.

rate_limits

Séquence

Obsolète. Limites de débit à appliquer à l'Endpoint de service. Utilisez la Passerelle IA pour gérer les limites de débit.

route_optimized

Booléen

Activez l'optimisation des itinéraires pour l'Endpoint de service.

tags

Séquence

Tags à associer à l'Endpoint de service et automatiquement propagés aux Logs de facturation.

Clé

Type

Description

ai_gateway

Carte

La configuration de la passerelle IA pour l’Endpoint de diffusion. REMARQUE : Seuls les Endpoint de modèle externe et de throughput provisionné sont actuellement pris en charge. Voir ai_gateway.

Ajouté dans la version 0.230.0 de Databricks CLI

budget_policy_id

Chaîne

L'identifiant de la politique budgétaire à utiliser pour cet Endpoint.

Ajouté dans la version 0.244.0 de Databricks CLI

config

Carte

La configuration principale de l'Endpoint de service. Voir configuration.

description

Chaîne

Une description pour l'endpoint de service.

Ajouté dans la CLI Databricks version 0.260.0

email_notifications

Carte

Configuration des notifications par e-mail pour l'Endpoint de service. Consultez email_notifications.

Ajouté dans la version 0.264.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom de l'Endpoint de service. Ce champ est obligatoire et doit être unique dans l'ensemble d'un Workspace Databricks. Un nom d'Endpoint peut être composé de caractères alphanumériques, de tirets et de traits de soulignement.

permissions

Séquence

Les autorisations de l'endpoint de mise en service du modèle. Afficher les autorisations.

rate_limits

Séquence

Obsolète. Limites de débit à appliquer à l'Endpoint de service. Utilisez la Passerelle IA pour gérer les limites de débit.

route_optimized

Booléen

Activez l'optimisation des itinéraires pour l'Endpoint de service.

tags

Séquence

Tags à associer à l'Endpoint de service et automatiquement propagés aux Logs de facturation.

model_serving_endpoint.email_notifications

Type: Map

Configuration des notifications e-mail pour l'endpoint de service.

Clé

Type

Description

on_update_failure

Séquence

Une liste d’adresses e-mail à notifier lorsqu’un endpoint ne parvient pas à mettre à jour sa configuration ou son état.

on_update_success

Séquence

Une liste d'adresses e-mail à notifier lorsqu'un Endpoint met à jour avec succès sa configuration ou son état.

Clé

Type

Description

on_update_failure

Séquence

Une liste d’adresses e-mail à notifier lorsqu’un endpoint ne parvient pas à mettre à jour sa configuration ou son état.

on_update_success

Séquence

Une liste d'adresses e-mail à notifier lorsqu'un Endpoint met à jour avec succès sa configuration ou son état.

model_serving_endpoint.ai_gateway

Type: Map

Configuration de la passerelle IA pour l'Endpoint de service.

Clé

Type

Description

fallback_config

Carte

Configuration pour le fallback du trafic qui bascule automatiquement vers d'autres entités servies si la requête vers une entité servie échoue avec certains codes d'erreur, afin d'augmenter la disponibilité. Consultez fallback_config.

guardrails

Carte

Configuration des garde-fous. Voir garde-fous.

inference_table_config

Carte

Configuration pour la journalisation de l'inférence vers les tables Unity Catalog. Consultez inference_table_config.

rate_limits

Séquence

Configurations des limites de débit.

usage_tracking_config

Carte

Configuration du suivi de l’utilisation. Voir usage_tracking_config.

Clé

Type

Description

fallback_config

Carte

Configuration pour le fallback du trafic qui bascule automatiquement vers d'autres entités servies si la requête vers une entité servie échoue avec certains codes d'erreur, afin d'augmenter la disponibilité. Consultez fallback_config.

guardrails

Carte

Configuration des garde-fous. Voir garde-fous.

inference_table_config

Carte

Configuration pour la journalisation de l'inférence vers les tables Unity Catalog. Consultez inference_table_config.

rate_limits

Séquence

Configurations des limites de débit.

usage_tracking_config

Carte

Configuration du suivi de l’utilisation. Voir usage_tracking_config.

model_serving_endpoint.ai_gateway.fallback_config

Type: Map

Configuration du fallback de trafic qui bascule automatiquement vers d'autres entités servies si une demande échoue avec certains codes d'erreur.

Clé

Type

Description

enabled

Booléen

Si le fallback est activé pour cet Endpoint.

Clé

Type

Description

enabled

Booléen

Si le fallback est activé pour cet Endpoint.

model_serving_endpoint.ai_gateway.guardrails

Type: Map

La configuration des garde-fous de la passerelle IA.

Clé

Type

Description

input

Carte

Configuration des garde-fous d’entrée avec des champs tels que safety, pii.

output

Carte

Configuration des garde-fous de sortie avec des champs tels que safety, pii.

invalid_keywords

Séquence

Une liste de mots-clés à bloquer.

Clé

Type

Description

input

Carte

Configuration des garde-fous d’entrée avec des champs tels que safety, pii.

output

Carte

Configuration des garde-fous de sortie avec des champs tels que safety, pii.

invalid_keywords

Séquence

Une liste de mots-clés à bloquer.

model_serving_endpoint.ai_gateway.inference_table_config

Type: Map

Configuration pour la journalisation de l'inférence dans les tables Unity Catalog.

Clé

Type

Description

catalog_name

Chaîne

Le nom du catalogue dans Unity Catalog.

schema_name

Chaîne

Le nom du schéma dans Unity Catalog.

table_name_prefix

Chaîne

Le préfixe pour les noms de tables d'inférence.

enabled

Booléen

Indique si la journalisation de la table d'inférence est activée.

Clé

Type

Description

catalog_name

Chaîne

Le nom du catalogue dans Unity Catalog.

schema_name

Chaîne

Le nom du schéma dans Unity Catalog.

table_name_prefix

Chaîne

Le préfixe pour les noms de tables d'inférence.

enabled

Booléen

Indique si la journalisation de la table d'inférence est activée.

model_serving_endpoint.ai_gateway.usage_tracking_config

Type: Map

La configuration de la passerelle AI pour le suivi de l'utilisation.

Clé

Type

Description

enabled

Booléen

Si le suivi de l'utilisation est activé.

Clé

Type

Description

enabled

Booléen

Si le suivi de l'utilisation est activé.

model_serving_endpoint.config

Type: Map

La configuration principale de l'endpoint de service.

Clé

Type

Description

served_entities

Séquence

Une liste d'entités servies pour l'endpoint à desservir. Chaque entité servie contient des champs tels que entity_name, entity_version, workload_size, scale_to_zero_enabled, workload_type, environment_vars.

served_models

Séquence

(Obsolète : utilisez served_entities à la place) Une liste de modèles servis par l'endpoint.

traffic_config

Carte

La configuration du trafic définissant la manière dont les invocations vers l'endpoint de service doivent être acheminées. Voir traffic_config.

Clé

Type

Description

served_entities

Séquence

Une liste d'entités servies pour l'endpoint à desservir. Chaque entité servie contient des champs tels que entity_name, entity_version, workload_size, scale_to_zero_enabled, workload_type, environment_vars.

served_models

Séquence

(Obsolète : utilisez served_entities à la place) Une liste de modèles servis par l'endpoint.

traffic_config

Carte

La configuration du trafic définissant la manière dont les invocations vers l'endpoint de service doivent être acheminées. Voir traffic_config.

model_serving_endpoint.config.traffic_config

Type: Map

La configuration du trafic définissant comment les invocations vers l'endpoint de service doivent être acheminées.

Clé

Type

Description

routes

Séquence

Une liste d'itinéraires pour la distribution du trafic. Chaque itinéraire contient served_model_name et traffic_percentage.

Clé

Type

Description

routes

Séquence

Une liste d'itinéraires pour la distribution du trafic. Chaque itinéraire contient served_model_name et traffic_percentage.

Exemple

L'exemple suivant définit un endpoint de service de modèle Unity Catalog :

YAML
resources:
model_serving_endpoints:
uc_model_serving_endpoint:
name: 'uc-model-endpoint'
config:
served_entities:
- entity_name: 'myCatalog.mySchema.my-ads-model'
entity_version: '10'
workload_size: 'Small'
scale_to_zero_enabled: 'true'
traffic_config:
routes:
- served_model_name: 'my-ads-model-10'
traffic_percentage: '100'
tags:
- key: 'team'
value: 'data science'

pipeline

Type: Map

Les pipelines sont pris en charge en Python pour les Declarative Automation Bundles. Consultez databricks.bundles.pipelines.

La ressource de pipeline vous permet de créer des pipelines. Pour en savoir plus sur les pipelines, consultez Spark Declarative Pipelines. Pour un didacticiel qui utilise le Template Declarative Automation Bundles pour créer un pipeline, consultez Développer des pipelines avec Declarative Automation Bundles.

YAML
pipelines:
<pipeline-name>:
<pipeline-field-name>: <pipeline-field-value>

Clé

Type

Description

allow_duplicate_names

Booléen

Si faux, le déploiement échouera si le nom est en conflit avec celui d'un autre pipeline.

Ajouté dans la version 0.261.0 de Databricks CLI

budget_policy_id

Chaîne

Politique budgétaire de ce pipeline.

Ajouté dans la version 0.230.0 de Databricks CLI

catalog

Chaîne

Un catalogue dans Unity Catalog vers lequel publier des données à partir de ce pipeline. Si target est spécifié, les tables de ce pipeline sont publiées dans un schéma target à l'intérieur de catalog (par exemple, catalog.target.table). Si target n'est pas spécifié, aucune donnée n'est publiée dans Unity Catalog.

channel

Chaîne

Le Canal de distribution LakeFlow Pipelines qui spécifie la version de LakeFlow Pipelines à utiliser.

clusters

Séquence

Les paramètres du cluster pour ce déploiement de pipeline. See clusters.

configuration

Carte

La configuration pour cette exécution de pipeline.

continuous

Booléen

Que le pipeline soit continu ou Trigger. Ceci remplace trigger.

deployment

Carte

Type de déploiement de ce pipeline. Voir déploiement.

development

Booléen

Si le pipeline est en mode développement. default to false.

dry_run

Booléen

Indique si le pipeline est un pipeline de simulation.

edition

Chaîne

L'édition du produit pipeline.

environment

Carte

La spécification d'environnement de ce pipeline servait à installer des dépendances sur le compute serverless. Consultez l'environnement. Cette clé est uniquement prise en charge dans Databricks CLI version 0,258 et les versions ultérieures.

Ajouté dans la version 0.257.0 de la Databricks CLI

event_log

Carte

La configuration du log des événements pour ce pipeline. Voir event_log.

Ajouté dans la version 0.246.0 de la CLI Databricks

filters

Carte

Les filtres qui déterminent les packages de pipelines à inclure dans le Graphe déployé. Voir les filtres.

gateway_definition

Carte

La configuration d'un pipeline de passerelle. Ces paramètres ne peuvent pas être utilisés avec les paramètres ingestion_definition.

id

Chaîne

Identifiant unique pour ce pipeline.

ingestion_definition

Carte

La configuration d'un pipeline d'ingestion géré. Ces paramètres ne peuvent pas être utilisés avec les paramètres libraries, schema, target ou catalog. Voir la définition d'ingestion.

libraries

Séquence

Une liste de bibliothèques ou de code nécessaire à ce déploiement. Consultez pipeline.libraries.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Un nom convivial pour ce pipeline.

notifications

Séquence

Les paramètres de notification pour ce pipeline. Voir les notifications.

parameters

Carte

Les paramètres de ce pipeline, où chaque clé est le nom du paramètre et la valeur est la valeur du paramètre.

permissions

Séquence

Les autorisations du pipeline. Afficher les autorisations.

photon

Booléen

Indique si Photon est activé pour ce pipeline. Cette clé est ignorée si serverless est défini sur true.

restart_window

Carte

Définit une fenêtre de redémarrage pour ce pipeline. Les pipelines peuvent être redémarrés dans cette fenêtre sans prendre de retard.

root_path

Chaîne

Le chemin racine de ce pipeline. Ceci est utilisé comme répertoire racine lors de la modification du pipeline dans l'interface utilisateur Databricks et il est ajouté à sys.path lors de l'exécution des sources Python pendant l'exécution du pipeline.

Ajouté à la version 0.253.0 de la CLI Databricks

run_as

Carte

L'identité sous laquelle le pipeline s'exécute. S'il n'est pas spécifié, le pipeline s'exécute en tant qu'utilisateur qui l'a créé. Seuls user_name ou service_principal_name peuvent être spécifiés. Si les deux sont spécifiés, une erreur est générée. Reportez-vous à run_as.

Ajouté dans la version 0.241.0 de Databricks CLI

schema

Chaîne

Le schéma default (base de données) à partir duquel les tables sont lues ou vers lequel elles sont publiées.

Ajouté dans la version 0.230.0 de Databricks CLI

serverless

Booléen

Si le compute Serverless est activé pour ce pipeline.

storage

Chaîne

Le répertoire racine DBFS pour le stockage des points de contrôle et des tables.

tags

Carte

Une carte des tags associés au pipeline. Ceux-ci sont transmis au cluster en tant que cluster tags, et sont donc soumis aux mêmes limitations. Un maximum de 25 tags peut être ajouté au pipeline.

Ajouté dans la version 0.256.0 de Databricks CLI

target

Chaîne

Schéma cible (base de données) auquel ajouter les tables de ce pipeline. Exactement l'un de schema ou target doit être spécifié. Pour publier dans Unity Catalog, spécifiez également catalog. Ce champ hérité est obsolète pour la création de pipeline au profit du champ schema.

usage_policy_id

Chaîne

L'ID de la politique d'utilisation serverless à utiliser pour ce pipeline.

Ajouté dans la version 0.273.0 de Databricks CLI

Clé

Type

Description

allow_duplicate_names

Booléen

Si faux, le déploiement échouera si le nom est en conflit avec celui d'un autre pipeline.

Ajouté dans la version 0.261.0 de Databricks CLI

budget_policy_id

Chaîne

Politique budgétaire de ce pipeline.

Ajouté dans la version 0.230.0 de Databricks CLI

catalog

Chaîne

Un catalogue dans Unity Catalog vers lequel publier des données à partir de ce pipeline. Si target est spécifié, les tables de ce pipeline sont publiées dans un schéma target à l'intérieur de catalog (par exemple, catalog.target.table). Si target n'est pas spécifié, aucune donnée n'est publiée dans Unity Catalog.

channel

Chaîne

Le Canal de distribution LakeFlow Pipelines qui spécifie la version de LakeFlow Pipelines à utiliser.

clusters

Séquence

Les paramètres du cluster pour ce déploiement de pipeline. See clusters.

configuration

Carte

La configuration pour cette exécution de pipeline.

continuous

Booléen

Que le pipeline soit continu ou Trigger. Ceci remplace trigger.

deployment

Carte

Type de déploiement de ce pipeline. Voir déploiement.

development

Booléen

Si le pipeline est en mode développement. default to false.

dry_run

Booléen

Indique si le pipeline est un pipeline de simulation.

edition

Chaîne

L'édition du produit pipeline.

environment

Carte

La spécification d'environnement de ce pipeline servait à installer des dépendances sur le compute serverless. Consultez l'environnement. Cette clé est uniquement prise en charge dans Databricks CLI version 0,258 et les versions ultérieures.

Ajouté dans la version 0.257.0 de la Databricks CLI

event_log

Carte

La configuration du log des événements pour ce pipeline. Voir event_log.

Ajouté dans la version 0.246.0 de la CLI Databricks

filters

Carte

Les filtres qui déterminent les packages de pipelines à inclure dans le Graphe déployé. Voir les filtres.

gateway_definition

Carte

La configuration d'un pipeline de passerelle. Ces paramètres ne peuvent pas être utilisés avec les paramètres ingestion_definition.

id

Chaîne

Identifiant unique pour ce pipeline.

ingestion_definition

Carte

La configuration d'un pipeline d'ingestion géré. Ces paramètres ne peuvent pas être utilisés avec les paramètres libraries, schema, target ou catalog. Voir la définition d'ingestion.

libraries

Séquence

Une liste de bibliothèques ou de code nécessaire à ce déploiement. Consultez pipeline.libraries.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Un nom convivial pour ce pipeline.

notifications

Séquence

Les paramètres de notification pour ce pipeline. Voir les notifications.

parameters

Carte

Les paramètres de ce pipeline, où chaque clé est le nom du paramètre et la valeur est la valeur du paramètre.

permissions

Séquence

Les autorisations du pipeline. Afficher les autorisations.

photon

Booléen

Indique si Photon est activé pour ce pipeline. Cette clé est ignorée si serverless est défini sur true.

restart_window

Carte

Définit une fenêtre de redémarrage pour ce pipeline. Les pipelines peuvent être redémarrés dans cette fenêtre sans prendre de retard.

root_path

Chaîne

Le chemin racine de ce pipeline. Ceci est utilisé comme répertoire racine lors de la modification du pipeline dans l'interface utilisateur Databricks et il est ajouté à sys.path lors de l'exécution des sources Python pendant l'exécution du pipeline.

Ajouté à la version 0.253.0 de la CLI Databricks

run_as

Carte

L'identité sous laquelle le pipeline s'exécute. S'il n'est pas spécifié, le pipeline s'exécute en tant qu'utilisateur qui l'a créé. Seuls user_name ou service_principal_name peuvent être spécifiés. Si les deux sont spécifiés, une erreur est générée. Reportez-vous à run_as.

Ajouté dans la version 0.241.0 de Databricks CLI

schema

Chaîne

Le schéma default (base de données) à partir duquel les tables sont lues ou vers lequel elles sont publiées.

Ajouté dans la version 0.230.0 de Databricks CLI

serverless

Booléen

Si le compute Serverless est activé pour ce pipeline.

storage

Chaîne

Le répertoire racine DBFS pour le stockage des points de contrôle et des tables.

tags

Carte

Une carte des tags associés au pipeline. Ceux-ci sont transmis au cluster en tant que cluster tags, et sont donc soumis aux mêmes limitations. Un maximum de 25 tags peut être ajouté au pipeline.

Ajouté dans la version 0.256.0 de Databricks CLI

target

Chaîne

Schéma cible (base de données) auquel ajouter les tables de ce pipeline. Exactement l'un de schema ou target doit être spécifié. Pour publier dans Unity Catalog, spécifiez également catalog. Ce champ hérité est obsolète pour la création de pipeline au profit du champ schema.

usage_policy_id

Chaîne

L'ID de la politique d'utilisation serverless à utiliser pour ce pipeline.

Ajouté dans la version 0.273.0 de Databricks CLI

pipeline.déploiement

Type: Map

Configuration du type de déploiement pour le pipeline.

Clé

Type

Description

kind

Chaîne

Le type de déploiement. Par exemple, BUNDLE.

metadata_file_path

Chaîne

Le chemin d'accès au fichier de métadonnées pour le déploiement.

Clé

Type

Description

kind

Chaîne

Le type de déploiement. Par exemple, BUNDLE.

metadata_file_path

Chaîne

Le chemin d'accès au fichier de métadonnées pour le déploiement.

pipeline.environment

Type: Map

Spécification d'environnement pour l'installation des dépendances sur le compute serverless.

Clé

Type

Description

dependencies

Séquence

Liste des dépendances pip, telles que prises en charge par la version de pip dans cet environnement. Chaque dépendance est une ligne de fichier d'exigences pip.

Clé

Type

Description

dependencies

Séquence

Liste des dépendances pip, telles que prises en charge par la version de pip dans cet environnement. Chaque dépendance est une ligne de fichier d'exigences pip.

pipeline.event_log

Type: Map

Configuration du Logs des événements pour le pipeline.

Clé

Type

Description

catalog

Chaîne

Le catalogue Unity Catalog sous lequel le log d'événements est publié.

name

Chaîne

Le nom sous lequel le journal des événements est publié dans Unity Catalog.

schema

Chaîne

Le schéma Unity Catalog sous lequel le journal des événements est publié.

Clé

Type

Description

catalog

Chaîne

Le catalogue Unity Catalog sous lequel le log d'événements est publié.

name

Chaîne

Le nom sous lequel le journal des événements est publié dans Unity Catalog.

schema

Chaîne

Le schéma Unity Catalog sous lequel le journal des événements est publié.

pipeline.filters

Type: Map

Filtres qui déterminent les packages de pipeline à inclure dans le Graphe déployé.

Clé

Type

Description

include

Séquence

Une liste de noms de package à inclure.

exclude

Séquence

Une liste de noms de packages à exclure.

Clé

Type

Description

include

Séquence

Une liste de noms de package à inclure.

exclude

Séquence

Une liste de noms de packages à exclure.

pipeline.définition_d'ingestion

Type: Map

Configuration d'un pipeline d'ingestion géré. Ces paramètres ne peuvent pas être utilisés avec les paramètres libraries, schema, target ou catalog.

Clé

Type

Description

connection_name

Chaîne

Le nom de la connexion à utiliser pour l'ingestion.

connector_type

Chaîne

Facultatif. Type de connecteur pour les sources. Les valeurs valides sont CDC et QUERY_BASED.

Ajouté à la version 0,296.0 de Databricks CLI

data_staging_options

Carte

Facultatif. Emplacement de stockage des données intermédiaires. Ceci est requis pour la migration d'un pipeline d'ingestion géré CDC avec un pipeline de passerelle vers un pipeline d'ingestion géré CDC combiné. Si non spécifié, le volume pour les données intermédiaires est créé dans le catalogue et le schéma/la cible spécifiés dans la définition du pipeline de haut niveau.

Ajouté à la version 0,296.0 de Databricks CLI

full_refresh_window

Carte

Facultatif. Une fenêtre qui spécifie un ensemble d'intervalles de temps pour les requêtes instantanées dans la CDC.

ingest_from_uc_foreign_catalog

Booléen

Immuable. Si activé, le pipeline ingérera les tables des catalogues externes Unity Catalog directement sans avoir à spécifier une connexion Unity Catalog ou une passerelle d'ingestion. Les champs source_catalog dans les objets d'IngestionConfig sont interprétés comme les catalogues externes Unity Catalog à partir desquels ingérer les données.

Ajouté dans la version 0,279.0 de Databricks CLI

ingestion_gateway_id

Chaîne

L’ID de la passerelle d’ingestion.

objects

Séquence

Obligatoire. Paramètres spécifiant les tables à répliquer et la destination des tables répliquées. Chaque objet peut être un SchemaSpec, un TableSpec ou un ReportSpec.

source_type

Chaîne

Requis lors de l'utilisation de source_configurations. Spécifie le type de connecteur (par exemple, POSTGRESQL, MYSQL).

source_configurations

Séquence

paramètres de configuration de la source au niveau du catalogue. Lorsque vous utilisez ce champ, vous devez également spécifier source_type. Voir source_configurations.

table_configuration

Carte

Configuration des tables d'ingestion. Voir table_configuration.

Clé

Type

Description

connection_name

Chaîne

Le nom de la connexion à utiliser pour l'ingestion.

connector_type

Chaîne

Facultatif. Type de connecteur pour les sources. Les valeurs valides sont CDC et QUERY_BASED.

Ajouté à la version 0,296.0 de Databricks CLI

data_staging_options

Carte

Facultatif. Emplacement de stockage des données intermédiaires. Ceci est requis pour la migration d'un pipeline d'ingestion géré CDC avec un pipeline de passerelle vers un pipeline d'ingestion géré CDC combiné. Si non spécifié, le volume pour les données intermédiaires est créé dans le catalogue et le schéma/la cible spécifiés dans la définition du pipeline de haut niveau.

Ajouté à la version 0,296.0 de Databricks CLI

full_refresh_window

Carte

Facultatif. Une fenêtre qui spécifie un ensemble d'intervalles de temps pour les requêtes instantanées dans la CDC.

ingest_from_uc_foreign_catalog

Booléen

Immuable. Si activé, le pipeline ingérera les tables des catalogues externes Unity Catalog directement sans avoir à spécifier une connexion Unity Catalog ou une passerelle d'ingestion. Les champs source_catalog dans les objets d'IngestionConfig sont interprétés comme les catalogues externes Unity Catalog à partir desquels ingérer les données.

Ajouté dans la version 0,279.0 de Databricks CLI

ingestion_gateway_id

Chaîne

L’ID de la passerelle d’ingestion.

objects

Séquence

Obligatoire. Paramètres spécifiant les tables à répliquer et la destination des tables répliquées. Chaque objet peut être un SchemaSpec, un TableSpec ou un ReportSpec.

source_type

Chaîne

Requis lors de l'utilisation de source_configurations. Spécifie le type de connecteur (par exemple, POSTGRESQL, MYSQL).

source_configurations

Séquence

paramètres de configuration de la source au niveau du catalogue. Lorsque vous utilisez ce champ, vous devez également spécifier source_type. Voir source_configurations.

table_configuration

Carte

Configuration des tables d'ingestion. Voir table_configuration.

SchemaSpec

Type: Map

Spécification d'objet de schéma pour l'ingestion de toutes les tables d'un schéma.

Clé

Type

Description

source_schema

Chaîne

Le nom du schéma source à ingérer.

destination_catalog

Chaîne

Le nom du catalogue de destination dans Unity Catalog.

destination_schema

Chaîne

Le nom du schéma de destination dans Unity Catalog.

table_configuration

Carte

Configuration à appliquer à toutes les tables de ce schéma. Consultez pipeline.ingestion_definition.table_configuration.

Clé

Type

Description

source_schema

Chaîne

Le nom du schéma source à ingérer.

destination_catalog

Chaîne

Le nom du catalogue de destination dans Unity Catalog.

destination_schema

Chaîne

Le nom du schéma de destination dans Unity Catalog.

table_configuration

Carte

Configuration à appliquer à toutes les tables de ce schéma. Consultez pipeline.ingestion_definition.table_configuration.

TableSpec

Type: Map

Spécification de l'objet table pour l'ingestion d'une table spécifique.

Clé

Type

Description

source_schema

Chaîne

Le nom du schéma source contenant la table.

source_table

Chaîne

Le nom de la table source à ingérer.

destination_catalog

Chaîne

Le nom du catalogue de destination dans Unity Catalog.

destination_schema

Chaîne

Le nom du schéma de destination dans Unity Catalog.

destination_table

Chaîne

Le nom de la table de destination dans Unity Catalog.

table_configuration

Carte

Configuration pour cette table spécifique. Consultez pipeline.ingestion_definition.table_configuration.

Clé

Type

Description

source_schema

Chaîne

Le nom du schéma source contenant la table.

source_table

Chaîne

Le nom de la table source à ingérer.

destination_catalog

Chaîne

Le nom du catalogue de destination dans Unity Catalog.

destination_schema

Chaîne

Le nom du schéma de destination dans Unity Catalog.

destination_table

Chaîne

Le nom de la table de destination dans Unity Catalog.

table_configuration

Carte

Configuration pour cette table spécifique. Consultez pipeline.ingestion_definition.table_configuration.

ReportSpec

Type: Map

Spécification d'objet de rapport pour l'ingestion de rapports analytiques.

Clé

Type

Description

source_url

Chaîne

L'URL du rapport source.

source_report

Chaîne

Le nom ou l'identifiant du rapport source.

destination_catalog

Chaîne

Le nom du catalogue de destination dans Unity Catalog.

destination_schema

Chaîne

Le nom du schéma de destination dans Unity Catalog.

destination_table

Chaîne

Le nom de la table de destination pour les données du rapport.

table_configuration

Carte

Configuration de la table de rapport. Consultez pipeline.ingestion_definition.table_configuration.

Clé

Type

Description

source_url

Chaîne

L'URL du rapport source.

source_report

Chaîne

Le nom ou l'identifiant du rapport source.

destination_catalog

Chaîne

Le nom du catalogue de destination dans Unity Catalog.

destination_schema

Chaîne

Le nom du schéma de destination dans Unity Catalog.

destination_table

Chaîne

Le nom de la table de destination pour les données du rapport.

table_configuration

Carte

Configuration de la table de rapport. Consultez pipeline.ingestion_definition.table_configuration.

pipeline.ingestion_definition.source_configurations

Type: Sequence

Configuration de la source. Chaque élément de la séquence est une carte contenant la configuration au niveau du catalogue.

Clé

Type

Description

catalog

Carte

paramètres de configuration de la source au niveau du catalogue. Consultez le catalogue.

Clé

Type

Description

catalog

Carte

paramètres de configuration de la source au niveau du catalogue. Consultez le catalogue.

pipeline.ingestion_definition.source_configurations.catalog

Type: Map

Paramètres de configuration source au niveau du catalogue

Clé

Type

Description

postgres

Carte

Paramètres de configuration au niveau du catalogue spécifiques à Postgres. Contient une clé slot_config qui est un Map représentant la configuration d'emplacement Postgres à utiliser pour la réplication logique.

source_catalog

Chaîne

Le nom du catalogue source.

Clé

Type

Description

postgres

Carte

Paramètres de configuration au niveau du catalogue spécifiques à Postgres. Contient une clé slot_config qui est un Map représentant la configuration d'emplacement Postgres à utiliser pour la réplication logique.

source_catalog

Chaîne

Le nom du catalogue source.

pipeline.ingestion_definition.table_configuration

Type: Map

Options de configuration pour les tables d'ingestion.

Clé

Type

Description

exclude_columns

Séquence

Une liste de noms de colonnes à exclure pour l'ingestion. Lorsque ce n'est pas spécifié, include_columns contrôle entièrement les colonnes à ingérer. Lorsque cette option est spécifiée, toutes les autres colonnes, y compris les futures, seront automatiquement incluses dans l'ingestion. Ce champ est mutuellement exclusif avec include_columns.

include_columns

Séquence

Liste des noms de colonnes à inclure pour l’ingestion. Lorsqu'elles ne sont pas spécifiées, toutes les colonnes, à l'exception de celles de exclude_columns, seront incluses. Les futures colonnes seront automatiquement incluses. Lorsqu'elles sont spécifiées, toutes les autres colonnes futures seront automatiquement exclues de l'ingestion. Ce champ est mutuellement exclusif avec exclude_columns.

primary_keys

Séquence

Une liste de noms de colonnes à utiliser comme clés primaires pour la table.

sequence_by

Séquence

Les noms de colonne spécifiant l'ordre logique des événements dans les données source. Spark Declarative Pipelines utilise ce séquençage pour gérer les événements de modification qui arrivent dans le désordre.

Clé

Type

Description

exclude_columns

Séquence

Une liste de noms de colonnes à exclure pour l'ingestion. Lorsque ce n'est pas spécifié, include_columns contrôle entièrement les colonnes à ingérer. Lorsque cette option est spécifiée, toutes les autres colonnes, y compris les futures, seront automatiquement incluses dans l'ingestion. Ce champ est mutuellement exclusif avec include_columns.

include_columns

Séquence

Liste des noms de colonnes à inclure pour l’ingestion. Lorsqu'elles ne sont pas spécifiées, toutes les colonnes, à l'exception de celles de exclude_columns, seront incluses. Les futures colonnes seront automatiquement incluses. Lorsqu'elles sont spécifiées, toutes les autres colonnes futures seront automatiquement exclues de l'ingestion. Ce champ est mutuellement exclusif avec exclude_columns.

primary_keys

Séquence

Une liste de noms de colonnes à utiliser comme clés primaires pour la table.

sequence_by

Séquence

Les noms de colonne spécifiant l'ordre logique des événements dans les données source. Spark Declarative Pipelines utilise ce séquençage pour gérer les événements de modification qui arrivent dans le désordre.

pipeline.libraries

Type: Sequence

Définit la liste des bibliothèques ou du code nécessaires à ce pipeline.

Chaque élément de la liste est une définition :

Clé

Type

Description

file

Carte

Le chemin d'accès à un fichier qui définit un pipeline et qui est stocké dans Databricks Repos. Voir pipeline.libraries.file.

glob

Carte

Le champ unifié pour inclure le code source. Chaque entrée peut être un chemin de Notebook, un chemin de fichier ou un chemin de dossier qui se termine par /**. Ce champ ne peut pas être utilisé avec notebook ou file. Voir pipeline.libraries.glob.

notebook

Carte

Le chemin d'accès à un Notebook qui définit un pipeline et est stocké dans le Workspace Databricks. Voir pipeline.libraries.Notebook.

whl

Chaîne

Ce champ est obsolète.

Clé

Type

Description

file

Carte

Le chemin d'accès à un fichier qui définit un pipeline et qui est stocké dans Databricks Repos. Voir pipeline.libraries.file.

glob

Carte

Le champ unifié pour inclure le code source. Chaque entrée peut être un chemin de Notebook, un chemin de fichier ou un chemin de dossier qui se termine par /**. Ce champ ne peut pas être utilisé avec notebook ou file. Voir pipeline.libraries.glob.

notebook

Carte

Le chemin d'accès à un Notebook qui définit un pipeline et est stocké dans le Workspace Databricks. Voir pipeline.libraries.Notebook.

whl

Chaîne

Ce champ est obsolète.

pipeline.libraries.file

Type: Map

Le chemin d'accès à un fichier qui définit un pipeline et est stocké dans les Repos Databricks.

Clé

Type

Description

path

Chaîne

Le chemin absolu du code source.

Clé

Type

Description

path

Chaîne

Le chemin absolu du code source.

pipeline.libraries.glob

Type: Map

Le champ unifié pour inclure le code source. Chaque entrée peut être un chemin de Notebook, un chemin de fichier ou un chemin de dossier qui se termine par /**. Ce champ ne peut pas être utilisé avec notebook ou file.

Clé

Type

Description

include

Chaîne

Le code source à inclure pour les pipelines.

Clé

Type

Description

include

Chaîne

Le code source à inclure pour les pipelines.

pipeline.libraries.notebook

Type: Map

Le chemin d'accès à un Notebook qui définit un pipeline et est stocké dans le Workspace Databricks.

Clé

Type

Description

path

Chaîne

Le chemin absolu du code source.

Clé

Type

Description

path

Chaîne

Le chemin absolu du code source.

pipeline.notifications

Type: Sequence

Les paramètres de notification pour ce pipeline. Chaque élément de la séquence est une configuration de notification.

Clé

Type

Description

alerts

Séquence

Une liste d'alertes de notifications Trigger. Les valeurs valides incluent on-update-success, on-update-failure, on-update-fatal-failure, on-flow-failure.

email_recipients

Séquence

Liste d'adresses e-mail à notifier lorsqu'une alerte configurée est Trigger.

Clé

Type

Description

alerts

Séquence

Une liste d'alertes de notifications Trigger. Les valeurs valides incluent on-update-success, on-update-failure, on-update-fatal-failure, on-flow-failure.

email_recipients

Séquence

Liste d'adresses e-mail à notifier lorsqu'une alerte configurée est Trigger.

Exemple

L'exemple suivant définit un pipeline avec la clé de ressource hello-pipeline:

YAML
resources:
pipelines:
hello-pipeline:
name: hello-pipeline
clusters:
- label: default
num_workers: 1
development: true
continuous: false
channel: CURRENT
edition: CORE
photon: false
libraries:
- notebook:
path: ./pipeline.py

Pour d'autres exemples de configuration de pipeline, consultez Configuration de pipeline.

postgres_branch

Type:Map

La ressource de Branch Postgres vous permet de définir des Branches Lakebase dans un lot. Vous devez également définir les projets Postgres et les points de terminaison compute correspondants.

Ajouté dans la version 0.287.0 de la CLI Databricks

YAML
postgres_branches:
<postgres_branch-name>:
<postgres_branch-field-name>: <postgres_branches-field-value>

Clé

Type

Description

branch_id

Chaîne

L'ID à utiliser pour la Branch. Cela devient le composant final du nom de ressource de la Branch. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, development devient projects/my-app/branches/development.

Ajouté dans la version 0.287.0 de la CLI Databricks

expire_time

Chaîne

Timestamp d'expiration absolu. Lorsqu'elle est définie, la Branch expirera à ce moment-là.

Ajouté dans la version 0.287.0 de la CLI Databricks

is_protected

Booléen

Lorsque défini sur vrai, protège la Branch de la suppression et du Reset. Les endpoints de compute associés et le projet ne peuvent pas être supprimés tant que la Branch est protégée.

Ajouté dans la version 0.287.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

no_expiry

Booléen

Désactivez explicitement l'expiration. Lorsque défini sur vrai, la Branch n'expirera pas. S'il est défini sur faux, la requête n'est pas valide ; fournissez plutôt ttl ou expire_time.

Ajouté dans la version 0.287.0 de la CLI Databricks

parent

Chaîne

Le projet où cette Branch sera créée. Format : projects/{project_id}

Ajouté dans la version 0.287.0 de la CLI Databricks

replace_existing

Booléen

Faut-il remplacer une branch existante ayant le même ID lors du déploiement ?

Ajouté dans la version 1.0.0 de Databricks CLI

source_branch

Chaîne

Le nom de la Branch source à partir de laquelle cette Branch a été créée (data lineage pour la récupération à un point dans le temps). Si non spécifié, la valeur par default est la Branch par default du projet. Format : projects/{project_id}/branches/{branch_id}

Ajouté dans la version 0.287.0 de la CLI Databricks

source_branch_lsn

Chaîne

Le numéro de séquence de logs (LSN) sur la Branch source à partir de laquelle cette Branch a été créée.

Ajouté dans la version 0.287.0 de la CLI Databricks

source_branch_time

Chaîne

Le moment précis sur la Branch source à partir duquel cette Branch a été créée.

Ajouté dans la version 0.287.0 de la CLI Databricks

ttl

Chaîne

Durée de vie relative. Lorsqu'elle est définie, la branch expirera à creation_time + ttl.

Ajouté dans la version 0.287.0 de la CLI Databricks

Clé

Type

Description

branch_id

Chaîne

L'ID à utiliser pour la Branch. Cela devient le composant final du nom de ressource de la Branch. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, development devient projects/my-app/branches/development.

Ajouté dans la version 0.287.0 de la CLI Databricks

expire_time

Chaîne

Timestamp d'expiration absolu. Lorsqu'elle est définie, la Branch expirera à ce moment-là.

Ajouté dans la version 0.287.0 de la CLI Databricks

is_protected

Booléen

Lorsque défini sur vrai, protège la Branch de la suppression et du Reset. Les endpoints de compute associés et le projet ne peuvent pas être supprimés tant que la Branch est protégée.

Ajouté dans la version 0.287.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

no_expiry

Booléen

Désactivez explicitement l'expiration. Lorsque défini sur vrai, la Branch n'expirera pas. S'il est défini sur faux, la requête n'est pas valide ; fournissez plutôt ttl ou expire_time.

Ajouté dans la version 0.287.0 de la CLI Databricks

parent

Chaîne

Le projet où cette Branch sera créée. Format : projects/{project_id}

Ajouté dans la version 0.287.0 de la CLI Databricks

replace_existing

Booléen

Faut-il remplacer une branch existante ayant le même ID lors du déploiement ?

Ajouté dans la version 1.0.0 de Databricks CLI

source_branch

Chaîne

Le nom de la Branch source à partir de laquelle cette Branch a été créée (data lineage pour la récupération à un point dans le temps). Si non spécifié, la valeur par default est la Branch par default du projet. Format : projects/{project_id}/branches/{branch_id}

Ajouté dans la version 0.287.0 de la CLI Databricks

source_branch_lsn

Chaîne

Le numéro de séquence de logs (LSN) sur la Branch source à partir de laquelle cette Branch a été créée.

Ajouté dans la version 0.287.0 de la CLI Databricks

source_branch_time

Chaîne

Le moment précis sur la Branch source à partir duquel cette Branch a été créée.

Ajouté dans la version 0.287.0 de la CLI Databricks

ttl

Chaîne

Durée de vie relative. Lorsqu'elle est définie, la branch expirera à creation_time + ttl.

Ajouté dans la version 0.287.0 de la CLI Databricks

Exemple

Voir l'exemple postgres_projects.

postgres_catalog

Type: Map

La ressource de catalogue Postgres vous permet de définir des catalogues Lakebase Postgres dans un bundle. Chaque catalogue lie un catalogue Unity Catalog à une base de données Postgres sur une branch de mise à l'échelle automatique Lakebase.

Ajouté dans la version 1.0.0 de Databricks CLI

YAML
postgres_catalogs:
<postgres_catalog-name>:
<postgres_catalog-field-name>: <postgres_catalog-field-value>

Clé

Type

Description

branch

Chaîne

La branch Lakebase Autoscaling qui prend en charge le catalogue.

Ajouté dans la version 1.0.0 de Databricks CLI

catalog_id

Chaîne

Obligatoire. L'ID du catalogue Unity Catalog à lier à la base de données Postgres.

Ajouté dans la version 1.0.0 de Databricks CLI

create_database_if_missing

Booléen

Indique si la base de données Postgres doit être créée si elle n'existe pas déjà.

Ajouté dans la version 1.0.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.0.0 de Databricks CLI

postgres_database

Chaîne

Obligatoire. Le nom de la base de données Postgres à lier au catalogue.

Ajouté dans la version 1.0.0 de Databricks CLI

Clé

Type

Description

branch

Chaîne

La branch Lakebase Autoscaling qui prend en charge le catalogue.

Ajouté dans la version 1.0.0 de Databricks CLI

catalog_id

Chaîne

Obligatoire. L'ID du catalogue Unity Catalog à lier à la base de données Postgres.

Ajouté dans la version 1.0.0 de Databricks CLI

create_database_if_missing

Booléen

Indique si la base de données Postgres doit être créée si elle n'existe pas déjà.

Ajouté dans la version 1.0.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.0.0 de Databricks CLI

postgres_database

Chaîne

Obligatoire. Le nom de la base de données Postgres à lier au catalogue.

Ajouté dans la version 1.0.0 de Databricks CLI

Exemple

YAML
resources:
postgres_projects:
project:
project_id: test-pg-project
display_name: Test Postgres Project

postgres_catalogs:
catalog:
catalog_id: test_catalog
branch: ${resources.postgres_projects.project.name}/branches/production
postgres_database: appdb
create_database_if_missing: true

postgres_database

Type: Map

La ressource de base de données Postgres vous permet de définir des bases de données Lakebase Postgres dans un bundle. Chaque base de données est créée sur une branch Lakebase Autoscaling.

Ajouté dans la version 1.4.0 de Databricks CLI

YAML
postgres_databases:
<postgres_database-name>:
<postgres_database-field-name>: <postgres_database-field-value>

Clé

Type

Description

database_id

Chaîne

Obligatoire. L'ID à utiliser pour la base de données. Il devient le composant final du nom de la ressource de la base de données.

Ajouté dans la version 1.4.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.4.0 de Databricks CLI

parent

Chaîne

Obligatoire. La Branch où cette base de données est créée. Format : projects/{project_id}/branches/{branch_id}.

Ajouté dans la version 1.4.0 de Databricks CLI

postgres_database

Chaîne

Le nom de la base de données Postgres.

Ajouté dans la version 1.4.0 de Databricks CLI

replace_existing

Booléen

S'il faut remplacer une base de données existante qui a le même ID lors du déploiement.

Ajouté dans la version 1.7.0 de Databricks CLI

role

Chaîne

Requis à la création. Le nom de la ressource du rôle Postgres qui possède la base de données. Format : projects/{project_id}/branches/{branch_id}/roles/{role_id}.

Ajouté dans la version 1.4.0 de Databricks CLI

Clé

Type

Description

database_id

Chaîne

Obligatoire. L'ID à utiliser pour la base de données. Il devient le composant final du nom de la ressource de la base de données.

Ajouté dans la version 1.4.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.4.0 de Databricks CLI

parent

Chaîne

Obligatoire. La Branch où cette base de données est créée. Format : projects/{project_id}/branches/{branch_id}.

Ajouté dans la version 1.4.0 de Databricks CLI

postgres_database

Chaîne

Le nom de la base de données Postgres.

Ajouté dans la version 1.4.0 de Databricks CLI

replace_existing

Booléen

S'il faut remplacer une base de données existante qui a le même ID lors du déploiement.

Ajouté dans la version 1.7.0 de Databricks CLI

role

Chaîne

Requis à la création. Le nom de la ressource du rôle Postgres qui possède la base de données. Format : projects/{project_id}/branches/{branch_id}/roles/{role_id}.

Ajouté dans la version 1.4.0 de Databricks CLI

Exemples

YAML
resources:
postgres_projects:
my_project:
project_id: test-pg-proj
display_name: 'Test Project for Database'
pg_version: 16
history_retention_duration: '604800s'

postgres_branches:
main:
parent: ${resources.postgres_projects.my_project.id}
branch_id: main
no_expiry: true

postgres_roles:
owner:
parent: ${resources.postgres_branches.main.id}
role_id: app-owner
postgres_role: app_owner

postgres_databases:
my_database:
parent: ${resources.postgres_branches.main.id}
database_id: my-database
postgres_database: app_db
# The live API requires `role`. Declare an explicit role so the bundle is
# portable across users (the auto-created project-owner role's id is
# derived from the creator's identity).
role: ${resources.postgres_roles.owner.id}

postgres_endpoint

Type: Map

La ressource postgres_endpoints vous permet de définir des Endpoint de compute Lakebase dans un bundle. Vous devez également définir les projets Lakebase et les branches Lakebase correspondants.

Ajouté dans la version 0.287.0 de la CLI Databricks

YAML
postgres_endpoints:
<postgres_endpoint-name>:
<postgres_endpoint-field-name>: <postgres_endpoint-field-value>

Clé

Type

Description

autoscaling_limit_max_cu

Nombre

Le nombre maximal d'unités de calcul. La valeur minimale est de 0,5.

Ajouté dans la version 0.287.0 de la CLI Databricks

autoscaling_limit_min_cu

Nombre

Le nombre minimum d'unités de compute. La valeur minimale est de 0,5.

Ajouté dans la version 0.287.0 de la CLI Databricks

disabled

Booléen

Restreindre les connexions au Endpoint de compute. L'activation de cette option planifie une opération de suspension du compute. Un Endpoint compute désactivé ne peut pas être activé par une connexion ou une action de console.

Ajouté dans la version 0.287.0 de la CLI Databricks

endpoint_id

Chaîne

L’ID à utiliser pour l’Endpoint. Cela devient le composant final du nom de ressource de l’endpoint. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, primary devient projects/my-app/branches/development/endpoints/primary.

Ajouté dans la version 0.287.0 de la CLI Databricks

endpoint_type

Chaîne

Le type d'endpoint. Une branch ne peut avoir qu'un seul endpoint READ_WRITE. Valeurs possibles : ENDPOINT_TYPE_READ_WRITE, ENDPOINT_TYPE_READ_ONLY.

Ajouté dans la version 0.287.0 de la CLI Databricks

group

Carte

La configuration du groupe d'Endpoint. Voir postgres_endpoint.group.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

no_suspension

Booléen

Lorsque défini sur true, désactive explicitement la suspension automatique (ne jamais suspendre). Doit être défini sur true lorsqu'il est fourni.

Ajouté dans la version 0.287.0 de la CLI Databricks

parent

Chaîne

La Branch où cet Endpoint sera créé. Format : projects/{project_id}/branches/{branch_id}

Ajouté dans la version 0.287.0 de la CLI Databricks

replace_existing

Booléen

Faut-il remplacer un endpoint de compute existant ayant le même ID lors du déploiement ?

Ajouté dans la version 1.0.0 de Databricks CLI

settings

Carte

Un ensemble de paramètres pour un Endpoint de compute.

Ajouté dans la version 0.287.0 de la CLI Databricks

suspend_timeout_duration

Chaîne

Durée d'inactivité après laquelle l'endpoint de compute est automatiquement suspendu. Si spécifié, doit être compris entre 60 secondes et 604 800 secondes (1 minute à 1 semaine).

Ajouté dans la version 0.287.0 de la CLI Databricks

Clé

Type

Description

autoscaling_limit_max_cu

Nombre

Le nombre maximal d'unités de calcul. La valeur minimale est de 0,5.

Ajouté dans la version 0.287.0 de la CLI Databricks

autoscaling_limit_min_cu

Nombre

Le nombre minimum d'unités de compute. La valeur minimale est de 0,5.

Ajouté dans la version 0.287.0 de la CLI Databricks

disabled

Booléen

Restreindre les connexions au Endpoint de compute. L'activation de cette option planifie une opération de suspension du compute. Un Endpoint compute désactivé ne peut pas être activé par une connexion ou une action de console.

Ajouté dans la version 0.287.0 de la CLI Databricks

endpoint_id

Chaîne

L’ID à utiliser pour l’Endpoint. Cela devient le composant final du nom de ressource de l’endpoint. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, primary devient projects/my-app/branches/development/endpoints/primary.

Ajouté dans la version 0.287.0 de la CLI Databricks

endpoint_type

Chaîne

Le type d'endpoint. Une branch ne peut avoir qu'un seul endpoint READ_WRITE. Valeurs possibles : ENDPOINT_TYPE_READ_WRITE, ENDPOINT_TYPE_READ_ONLY.

Ajouté dans la version 0.287.0 de la CLI Databricks

group

Carte

La configuration du groupe d'Endpoint. Voir postgres_endpoint.group.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

no_suspension

Booléen

Lorsque défini sur true, désactive explicitement la suspension automatique (ne jamais suspendre). Doit être défini sur true lorsqu'il est fourni.

Ajouté dans la version 0.287.0 de la CLI Databricks

parent

Chaîne

La Branch où cet Endpoint sera créé. Format : projects/{project_id}/branches/{branch_id}

Ajouté dans la version 0.287.0 de la CLI Databricks

replace_existing

Booléen

Faut-il remplacer un endpoint de compute existant ayant le même ID lors du déploiement ?

Ajouté dans la version 1.0.0 de Databricks CLI

settings

Carte

Un ensemble de paramètres pour un Endpoint de compute.

Ajouté dans la version 0.287.0 de la CLI Databricks

suspend_timeout_duration

Chaîne

Durée d'inactivité après laquelle l'endpoint de compute est automatiquement suspendu. Si spécifié, doit être compris entre 60 secondes et 604 800 secondes (1 minute à 1 semaine).

Ajouté dans la version 0.287.0 de la CLI Databricks

postgres_endpoint.group

Type: Map

La configuration du groupe d'Endpoint.

Clé

Type

Description

enable_readable_secondaries

Booléen

Autoriser ou non les connexions en lecture seule aux Endpoint en lecture-écriture. Applicable uniquement aux Endpoint en lecture-écriture où group.max > 1.

max

Entier

Obligatoire. Le nombre maximum de computes dans le groupe d'Endpoint. Actuellement, ceci doit être égal à min. Définissez sur 1 pour les Endpoint à compute unique, afin de désactiver la haute disponibilité (HA). Pour suspendre manuellement tous les computes dans un groupe d'endpoints, définissez disabled sur true sur l'endpoint.

min

Entier

Obligatoire. Le nombre minimal de computes dans le groupe d'endpoint. Actuellement, ceci doit être égal à max. Ceci doit être supérieur ou égal à 1.

Clé

Type

Description

enable_readable_secondaries

Booléen

Autoriser ou non les connexions en lecture seule aux Endpoint en lecture-écriture. Applicable uniquement aux Endpoint en lecture-écriture où group.max > 1.

max

Entier

Obligatoire. Le nombre maximum de computes dans le groupe d'Endpoint. Actuellement, ceci doit être égal à min. Définissez sur 1 pour les Endpoint à compute unique, afin de désactiver la haute disponibilité (HA). Pour suspendre manuellement tous les computes dans un groupe d'endpoints, définissez disabled sur true sur l'endpoint.

min

Entier

Obligatoire. Le nombre minimal de computes dans le groupe d'endpoint. Actuellement, ceci doit être égal à max. Ceci doit être supérieur ou égal à 1.

Exemple

Voir l'exemple postgres_projects.

postgres_project

Type: Map

La ressource de projet Postgres vous permet de définir des projets de base de données Lakebase Autoscaling Postgres dans un bundle. Vous devez également définir les branches Postgres et les endpoints de compute correspondants.

Ajouté dans la version 0.287.0 de la CLI Databricks

YAML
postgres_projects:
<postgres_project-name>:
<postgres_project-field-name>: <postgres_project-field-value>

Clé

Type

Description

budget_policy_id

Chaîne

L'ID de politique budgétaire pour ce projet.

custom_tags

Séquence

Tags personnalisés pour ce projet. Voir postgres_project.custom_tags.

default_branch

Chaîne

La Branch default du projet, au format projects/{project_id}/branches/{branch_id}.

default_endpoint_settings

Carte

Un ensemble de paramètres pour un endpoint de compute. Consulter postgres_project.default_endpoint_settings.

Ajouté dans la version 0.287.0 de la CLI Databricks

display_name

Chaîne

Nom de projet lisible par l'humain. Doit comporter entre 1 et 256 caractères

Ajouté dans la version 0.287.0 de la CLI Databricks

enable_pg_native_login

Booléen

Activer la connexion Postgres native pour le projet.

Ajouté dans la version 0.294.0 du CLI Databricks.

history_retention_duration

Chaîne

Le nombre de secondes pour conserver l'historique partagé pour la récupération à un instant T pour toutes les branches de ce projet. La valeur doit être comprise entre 0s et 2592000s (jusqu'à 30 jours).

Ajouté dans la version 0.287.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

permissions

Séquence

Les autorisations pour le projet Postgres. Afficher les autorisations.

Ajouté dans la version Databricks CLI 0.292.0

pg_version

Entier

Le numéro de version majeure de Postgres. Les versions prises en charge sont les 16 et 17.

Ajouté dans la version 0.287.0 de la CLI Databricks

project_id

Chaîne

L'ID de projet à utiliser. Cela devient le composant final du nom de la ressource du projet. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, my-app devient projects/my-app.

Ajouté dans la version 0.287.0 de la CLI Databricks

purge_on_delete

Booléen

S'il faut purger les données du projet lorsqu'il est supprimé.

Ajoutée dans la version 1.2.0 de la CLI Databricks.

Clé

Type

Description

budget_policy_id

Chaîne

L'ID de politique budgétaire pour ce projet.

custom_tags

Séquence

Tags personnalisés pour ce projet. Voir postgres_project.custom_tags.

default_branch

Chaîne

La Branch default du projet, au format projects/{project_id}/branches/{branch_id}.

default_endpoint_settings

Carte

Un ensemble de paramètres pour un endpoint de compute. Consulter postgres_project.default_endpoint_settings.

Ajouté dans la version 0.287.0 de la CLI Databricks

display_name

Chaîne

Nom de projet lisible par l'humain. Doit comporter entre 1 et 256 caractères

Ajouté dans la version 0.287.0 de la CLI Databricks

enable_pg_native_login

Booléen

Activer la connexion Postgres native pour le projet.

Ajouté dans la version 0.294.0 du CLI Databricks.

history_retention_duration

Chaîne

Le nombre de secondes pour conserver l'historique partagé pour la récupération à un instant T pour toutes les branches de ce projet. La valeur doit être comprise entre 0s et 2592000s (jusqu'à 30 jours).

Ajouté dans la version 0.287.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.287.0 de la CLI Databricks

permissions

Séquence

Les autorisations pour le projet Postgres. Afficher les autorisations.

Ajouté dans la version Databricks CLI 0.292.0

pg_version

Entier

Le numéro de version majeure de Postgres. Les versions prises en charge sont les 16 et 17.

Ajouté dans la version 0.287.0 de la CLI Databricks

project_id

Chaîne

L'ID de projet à utiliser. Cela devient le composant final du nom de la ressource du projet. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, my-app devient projects/my-app.

Ajouté dans la version 0.287.0 de la CLI Databricks

purge_on_delete

Booléen

S'il faut purger les données du projet lorsqu'il est supprimé.

Ajoutée dans la version 1.2.0 de la CLI Databricks.

Exemple

YAML
resources:
postgres_projects:
my_db:
project_id: test-prod-app
display_name: 'Production Database'
pg_version: 17

postgres_branches:
main:
parent: ${resources.postgres_projects.my_db.id}
branch_id: main
is_protected: false
no_expiry: true

postgres_endpoints:
primary:
parent: ${resources.postgres_branches.main.id}
endpoint_id: primary
endpoint_type: ENDPOINT_TYPE_READ_WRITE
autoscaling_limit_min_cu: 0.5
autoscaling_limit_max_cu: 4

postgres_project.custom_tags

Type: Sequence

Une liste d'étiquettes personnalisées pour le projet.

Clé

Type

Description

key

Chaîne

La clé du tag personnalisé.

value

Chaîne

La valeur du tag personnalisé.

Clé

Type

Description

key

Chaîne

La clé du tag personnalisé.

value

Chaîne

La valeur du tag personnalisé.

postgres_project.default_endpoint_settings

Type: Map

Clé

Type

Description

autoscaling_limit_max_cu

Nombre

Le nombre maximal d'unités de calcul. La valeur minimale est de 0,5.

autoscaling_limit_min_cu

Nombre

Le nombre minimum d'unités de compute. La valeur minimale est de 0,5.

no_suspension

Booléen

Lorsque défini sur true, désactive explicitement la suspension automatique (ne jamais suspendre). Devrait être défini sur vrai lorsqu'il est fourni. Mutuellement exclusif avec suspend_timeout_duration. Lors de la mise à jour, utilisez spec.project_default_settings.suspension dans le masque de mise à jour.

pg_settings

Carte

Une représentation brute des paramètres Postgres.

suspend_timeout_duration

Chaîne

Durée d'inactivité après laquelle l'endpoint de compute est automatiquement suspendu. S’il est spécifié, il doit être compris entre 60 s et 604800 s (1 minute et 1 semaine). Mutuellement exclusif avec no_suspension. Lors de la mise à jour, utilisez spec.project_default_settings.suspension dans le masque de mise à jour.

Clé

Type

Description

autoscaling_limit_max_cu

Nombre

Le nombre maximal d'unités de calcul. La valeur minimale est de 0,5.

autoscaling_limit_min_cu

Nombre

Le nombre minimum d'unités de compute. La valeur minimale est de 0,5.

no_suspension

Booléen

Lorsque défini sur true, désactive explicitement la suspension automatique (ne jamais suspendre). Devrait être défini sur vrai lorsqu'il est fourni. Mutuellement exclusif avec suspend_timeout_duration. Lors de la mise à jour, utilisez spec.project_default_settings.suspension dans le masque de mise à jour.

pg_settings

Carte

Une représentation brute des paramètres Postgres.

suspend_timeout_duration

Chaîne

Durée d'inactivité après laquelle l'endpoint de compute est automatiquement suspendu. S’il est spécifié, il doit être compris entre 60 s et 604800 s (1 minute et 1 semaine). Mutuellement exclusif avec no_suspension. Lors de la mise à jour, utilisez spec.project_default_settings.suspension dans le masque de mise à jour.

rôle_postgres

Type: Map

La ressource de rôle Postgres vous permet de définir des rôles Lakebase Postgres dans un bundle. Chaque rôle est créé sur une Lakebase Autoscaling Branch.

Ajouté dans la version 1.4.0 de Databricks CLI

YAML
postgres_roles:
<postgres_role-name>:
<postgres_role-field-name>: <postgres_role-field-value>

Clé

Type

Description

attributes

Carte

Les attributs de rôle Postgres exposés par l'API souhaités à associer au rôle. Consultez postgres_role.attributes.

Ajouté dans la version 1.4.0 de Databricks CLI

auth_method

Chaîne

Comment le rôle est-il authentifié lors de la connexion à Postgres. Si non spécifiée, une méthode d'authentification pertinente est dérivée de identity_type. Les valeurs valides sont NO_LOGIN, PG_PASSWORD_SCRAM_SHA_256, LAKEBASE_OAUTH_V1.

Ajouté dans la version 1.4.0 de Databricks CLI

identity_type

Chaîne

Le type d'identité gérée Databricks que ce rôle représente. Laissez vide pour créer un rôle Postgres standard non associé à une identité Databricks. Les valeurs valides sont USER, SERVICE_PRINCIPAL, GROUP.

Ajouté dans la version 1.4.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.4.0 de Databricks CLI

membership_roles

Séquence

Rôles standard dont ce rôle est membre.

Ajouté dans la version 1.4.0 de Databricks CLI

parent

Chaîne

Obligatoire. La Branch où ce rôle est créé. Format : projects/{project_id}/branches/{branch_id}.

Ajouté dans la version 1.4.0 de Databricks CLI

postgres_role

Chaîne

Le nom du rôle Postgres. Obligatoire lors de la création du rôle. Pour créer un rôle Postgres basé sur une identité Databricks gérée, postgres_role doit être l'un des suivants :

  • E-mail de l'utilisateur, pour un identity_type de USER.
  • ID de l'application, pour un identity_type de SERVICE_PRINCIPAL.
  • Nom du groupe, pour un identity_type de GROUP.

Ajouté dans la version 1.4.0 de Databricks CLI

replace_existing

Booléen

Remplacer un rôle existant qui a le même ID lors du déploiement.

Ajouté dans la version 1.7.0 de Databricks CLI

role_id

Chaîne

Obligatoire. L'ID de rôle spécifié par l'utilisateur ; il devient le composant final du nom de ressource du rôle. Doit comporter 4 à 63 caractères, des lettres minuscules, des chiffres et des tirets (RFC 1123).

Ajouté dans la version 1.4.0 de Databricks CLI

Clé

Type

Description

attributes

Carte

Les attributs de rôle Postgres exposés par l'API souhaités à associer au rôle. Consultez postgres_role.attributes.

Ajouté dans la version 1.4.0 de Databricks CLI

auth_method

Chaîne

Comment le rôle est-il authentifié lors de la connexion à Postgres. Si non spécifiée, une méthode d'authentification pertinente est dérivée de identity_type. Les valeurs valides sont NO_LOGIN, PG_PASSWORD_SCRAM_SHA_256, LAKEBASE_OAUTH_V1.

Ajouté dans la version 1.4.0 de Databricks CLI

identity_type

Chaîne

Le type d'identité gérée Databricks que ce rôle représente. Laissez vide pour créer un rôle Postgres standard non associé à une identité Databricks. Les valeurs valides sont USER, SERVICE_PRINCIPAL, GROUP.

Ajouté dans la version 1.4.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.4.0 de Databricks CLI

membership_roles

Séquence

Rôles standard dont ce rôle est membre.

Ajouté dans la version 1.4.0 de Databricks CLI

parent

Chaîne

Obligatoire. La Branch où ce rôle est créé. Format : projects/{project_id}/branches/{branch_id}.

Ajouté dans la version 1.4.0 de Databricks CLI

postgres_role

Chaîne

Le nom du rôle Postgres. Obligatoire lors de la création du rôle. Pour créer un rôle Postgres basé sur une identité Databricks gérée, postgres_role doit être l'un des suivants :

  • E-mail de l'utilisateur, pour un identity_type de USER.
  • ID de l'application, pour un identity_type de SERVICE_PRINCIPAL.
  • Nom du groupe, pour un identity_type de GROUP.

Ajouté dans la version 1.4.0 de Databricks CLI

replace_existing

Booléen

Remplacer un rôle existant qui a le même ID lors du déploiement.

Ajouté dans la version 1.7.0 de Databricks CLI

role_id

Chaîne

Obligatoire. L'ID de rôle spécifié par l'utilisateur ; il devient le composant final du nom de ressource du rôle. Doit comporter 4 à 63 caractères, des lettres minuscules, des chiffres et des tirets (RFC 1123).

Ajouté dans la version 1.4.0 de Databricks CLI

postgres_role.attributes

Type: Map

Les attributs de rôle Postgres exposés par l'API à associer au rôle.

Ajouté dans la version 1.4.0 de Databricks CLI

Clé

Type

Description

bypassrls

Booléen

Si le rôle ignore la sécurité au niveau des lignes.

createdb

Booléen

La capacité du rôle à créer des bases de données.

createrole

Booléen

Permet au rôle de créer, modifier, supprimer, commenter et modifier l'étiquette de sécurité des autres rôles.

Clé

Type

Description

bypassrls

Booléen

Si le rôle ignore la sécurité au niveau des lignes.

createdb

Booléen

La capacité du rôle à créer des bases de données.

createrole

Booléen

Permet au rôle de créer, modifier, supprimer, commenter et modifier l'étiquette de sécurité des autres rôles.

Exemples

YAML
resources:
postgres_projects:
my_project:
project_id: my-pg-proj
display_name: 'Test Project for Role'
pg_version: 16
history_retention_duration: '604800s'

postgres_branches:
main:
parent: ${resources.postgres_projects.my_project.id}
branch_id: main
no_expiry: true

postgres_roles:
my_role:
parent: ${resources.postgres_branches.main.id}
role_id: my-role
postgres_role: app_role
attributes:
createdb: true

postgres_synced_table

Type: Map

La ressource de table synchronisée Postgres vous permet de définir des tables synchronisées Lakebase Postgres dans un bundle. Chaque table synchronisée réplique en continu une table source Delta Unity Catalog dans une table Postgres sur une instance Lakebase Autoscaling.

Ajouté dans la version 1.0.0 de Databricks CLI

YAML
postgres_synced_tables:
<postgres_synced_table-name>:
<postgres_synced_table-field-name>: <postgres_synced_table-field-value>

Clé

Type

Description

branch

Chaîne

La branch Autoscaling Lakebase où la table synchronisée est créée.

Ajouté dans la version 1.0.0 de Databricks CLI

create_database_objects_if_missing

Booléen

S'il faut créer la base de données logique et les ressources de schéma de la table synchronisée si elles n'existent pas déjà.

Ajouté dans la version 1.0.0 de Databricks CLI

existing_pipeline_id

Chaîne

L'ID d'un pipeline existant. Si cette option est définie, la table synchronisée sera regroupée dans le pipeline existant référencé. Cela évite de créer un nouveau pipeline et permet de partager le compute existant. Dans ce cas, le scheduling_policy de cette table synchronisée doit correspondre à la politique de planification du pipeline existant. Au maximum l'un de existing_pipeline_id et new_pipeline_spec doit être défini.

Ajouté dans la version 1.0.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.0.0 de Databricks CLI

new_pipeline_spec

Carte

La spécification d'un nouveau pipeline. Voir postgres_synced_table.new_pipeline_spec. Au maximum un seul de existing_pipeline_id et new_pipeline_spec doit être défini.

Ajouté dans la version 1.0.0 de Databricks CLI

postgres_database

Chaîne

Le nom de la base de données Postgres cible pour la table synchronisée.

Ajouté dans la version 1.0.0 de Databricks CLI

primary_key_columns

Séquence

La liste des noms de colonnes qui forment la clé primaire.

Ajouté dans la version 1.0.0 de Databricks CLI

scheduling_policy

Chaîne

Stratégie de planification du pipeline sous-jacent de la table synchronisée. Les valeurs valides sont CONTINUOUS, TRIGGERED, SNAPSHOT.

Ajouté dans la version 1.0.0 de Databricks CLI

source_table_full_name

Chaîne

Le nom complet de la table source au format catalog.schema.table.

Ajouté dans la version 1.0.0 de Databricks CLI

synced_table_id

Chaîne

Obligatoire. L'ID à utiliser pour la table synchronisée.

Ajouté dans la version 1.0.0 de Databricks CLI

timeseries_key

Chaîne

Clé de série temporelle pour dédupliquer les lignes avec la même clé primaire.

Ajouté dans la version 1.0.0 de Databricks CLI

Clé

Type

Description

branch

Chaîne

La branch Autoscaling Lakebase où la table synchronisée est créée.

Ajouté dans la version 1.0.0 de Databricks CLI

create_database_objects_if_missing

Booléen

S'il faut créer la base de données logique et les ressources de schéma de la table synchronisée si elles n'existent pas déjà.

Ajouté dans la version 1.0.0 de Databricks CLI

existing_pipeline_id

Chaîne

L'ID d'un pipeline existant. Si cette option est définie, la table synchronisée sera regroupée dans le pipeline existant référencé. Cela évite de créer un nouveau pipeline et permet de partager le compute existant. Dans ce cas, le scheduling_policy de cette table synchronisée doit correspondre à la politique de planification du pipeline existant. Au maximum l'un de existing_pipeline_id et new_pipeline_spec doit être défini.

Ajouté dans la version 1.0.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.0.0 de Databricks CLI

new_pipeline_spec

Carte

La spécification d'un nouveau pipeline. Voir postgres_synced_table.new_pipeline_spec. Au maximum un seul de existing_pipeline_id et new_pipeline_spec doit être défini.

Ajouté dans la version 1.0.0 de Databricks CLI

postgres_database

Chaîne

Le nom de la base de données Postgres cible pour la table synchronisée.

Ajouté dans la version 1.0.0 de Databricks CLI

primary_key_columns

Séquence

La liste des noms de colonnes qui forment la clé primaire.

Ajouté dans la version 1.0.0 de Databricks CLI

scheduling_policy

Chaîne

Stratégie de planification du pipeline sous-jacent de la table synchronisée. Les valeurs valides sont CONTINUOUS, TRIGGERED, SNAPSHOT.

Ajouté dans la version 1.0.0 de Databricks CLI

source_table_full_name

Chaîne

Le nom complet de la table source au format catalog.schema.table.

Ajouté dans la version 1.0.0 de Databricks CLI

synced_table_id

Chaîne

Obligatoire. L'ID à utiliser pour la table synchronisée.

Ajouté dans la version 1.0.0 de Databricks CLI

timeseries_key

Chaîne

Clé de série temporelle pour dédupliquer les lignes avec la même clé primaire.

Ajouté dans la version 1.0.0 de Databricks CLI

postgres_synced_table.new_pipeline_spec

Type: Map

La spécification pour un nouveau pipeline utilisé par la table synchronisée.

Ajouté dans la version 1.0.0 de Databricks CLI

Clé

Type

Description

budget_policy_id

Chaîne

La politique budgétaire à définir sur le pipeline nouvellement créé.

storage_catalog

Chaîne

Le catalogue pour le pipeline afin de stocker les fichiers intermédiaires, tels que les points de contrôle et les Logs d'événements. Il doit s’agir d’un catalogue standard où l’utilisateur dispose des autorisations pour créer des tables Delta.

storage_schema

Chaîne

Le schéma du pipeline pour stocker les fichiers intermédiaires, tels que les points de contrôle et les logs d'événements. Cela doit être dans le catalogue standard où l'utilisateur a les autorisations pour créer des tables Delta.

Clé

Type

Description

budget_policy_id

Chaîne

La politique budgétaire à définir sur le pipeline nouvellement créé.

storage_catalog

Chaîne

Le catalogue pour le pipeline afin de stocker les fichiers intermédiaires, tels que les points de contrôle et les Logs d'événements. Il doit s’agir d’un catalogue standard où l’utilisateur dispose des autorisations pour créer des tables Delta.

storage_schema

Chaîne

Le schéma du pipeline pour stocker les fichiers intermédiaires, tels que les points de contrôle et les logs d'événements. Cela doit être dans le catalogue standard où l'utilisateur a les autorisations pour créer des tables Delta.

Exemple

YAML
resources:
schemas:
pipeline_storage:
name: test_pipeline_storage
catalog_name: main
comment: 'Pipeline storage for the synced-table test'

postgres_projects:
my_project:
project_id: test-pg-proj
display_name: 'Test Project for Synced Table'
pg_version: 17

postgres_catalogs:
my_catalog:
catalog_id: lakebase_test
branch: ${resources.postgres_projects.my_project.id}/branches/production
postgres_database: appdb
create_database_if_missing: true

postgres_synced_tables:
my_table:
synced_table_id: ${resources.postgres_catalogs.my_catalog.catalog_id}.public.trips_synced
source_table_full_name: main.source_test.trips_source
primary_key_columns: ['tpep_pickup_datetime']
scheduling_policy: SNAPSHOT
postgres_database: appdb
branch: ${resources.postgres_projects.my_project.id}/branches/production
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: ${resources.schemas.pipeline_storage.catalog_name}
storage_schema: ${resources.schemas.pipeline_storage.name}

quality_monitor (Unity Catalog)

Type: Map

La ressource quality_monitor vous permet de définir un moniteur de table Unity Catalog. Pour plus d'information sur les moniteurs, consultez le profilage des données.

YAML
quality_monitors:
<quality_monitor-name>:
<quality_monitor-field-name>: <quality_monitor-field-value>

Clé

Type

Description

assets_dir

Chaîne

Le répertoire pour stocker les assets de monitoring (p. ex. tableau de bord, tables de métriques).

baseline_table_name

Chaîne

Nom de la table de référence à partir de laquelle les métriques de drift sont computées. Les colonnes de la table surveillée doivent également être présentes dans la table de base.

custom_metrics

Séquence

Mesures personnalisées à compute sur la table surveillée. Il peut s'agir de métriques agrégées, de métriques dérivées (à partir de métriques agrégées déjà calculées) ou de métriques de drift (comparant les métriques sur des fenêtres temporelles). Voir custom_metrics.

inference_log

Carte

Configuration pour le monitoring des Logs d'inférence. Voir inference_log.

latest_monitor_failure_msg

Chaîne

Le dernier message d’erreur pour une défaillance de moniteur. Il s'agit d'un champ en lecture seule qui est renseigné lorsqu'un moniteur échoue.

Ajouté dans la version 0.264.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

notifications

Carte

Les réglages de notification pour la surveillance. Voir les notifications.

output_schema_name

Chaîne

Schéma où les tables de métriques de sortie sont créées.

schedule

Carte

Le calendrier de mise à jour et d'actualisation automatique des tables de métriques. Consultez le programme.

skip_builtin_dashboard

Booléen

S'il faut ignorer la création d'un tableau de bord default résumant les métriques de qualité des données.

slicing_exprs

Séquence

Liste des expressions de colonne pour découper les données en vue d'une analyse ciblée. Les données sont regroupées par chaque expression indépendamment, ce qui donne une tranche séparée pour chaque prédicat et ses compléments. Pour les colonnes à cardinalité élevée, seules les 100 premières valeurs uniques par fréquence généreront des tranches.

snapshot

Carte

Configuration pour le monitoring des tables d'instantanés. Voir l'aperçu instantané.

table_name

Chaîne

Le nom complet de la table.

Ajouté dans la version 0,235.0 de la CLI Databricks.

time_series

Carte

Configuration pour le monitoring des tables de séries chronologiques. Voir time_series.

warehouse_id

Chaîne

Argument facultatif pour spécifier le warehouse pour la création de tableaux de bord. Si non spécifié, le premier warehouse en cours d'exécution sera utilisé.

Clé

Type

Description

assets_dir

Chaîne

Le répertoire pour stocker les assets de monitoring (p. ex. tableau de bord, tables de métriques).

baseline_table_name

Chaîne

Nom de la table de référence à partir de laquelle les métriques de drift sont computées. Les colonnes de la table surveillée doivent également être présentes dans la table de base.

custom_metrics

Séquence

Mesures personnalisées à compute sur la table surveillée. Il peut s'agir de métriques agrégées, de métriques dérivées (à partir de métriques agrégées déjà calculées) ou de métriques de drift (comparant les métriques sur des fenêtres temporelles). Voir custom_metrics.

inference_log

Carte

Configuration pour le monitoring des Logs d'inférence. Voir inference_log.

latest_monitor_failure_msg

Chaîne

Le dernier message d’erreur pour une défaillance de moniteur. Il s'agit d'un champ en lecture seule qui est renseigné lorsqu'un moniteur échoue.

Ajouté dans la version 0.264.0 de Databricks CLI

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

notifications

Carte

Les réglages de notification pour la surveillance. Voir les notifications.

output_schema_name

Chaîne

Schéma où les tables de métriques de sortie sont créées.

schedule

Carte

Le calendrier de mise à jour et d'actualisation automatique des tables de métriques. Consultez le programme.

skip_builtin_dashboard

Booléen

S'il faut ignorer la création d'un tableau de bord default résumant les métriques de qualité des données.

slicing_exprs

Séquence

Liste des expressions de colonne pour découper les données en vue d'une analyse ciblée. Les données sont regroupées par chaque expression indépendamment, ce qui donne une tranche séparée pour chaque prédicat et ses compléments. Pour les colonnes à cardinalité élevée, seules les 100 premières valeurs uniques par fréquence généreront des tranches.

snapshot

Carte

Configuration pour le monitoring des tables d'instantanés. Voir l'aperçu instantané.

table_name

Chaîne

Le nom complet de la table.

Ajouté dans la version 0,235.0 de la CLI Databricks.

time_series

Carte

Configuration pour le monitoring des tables de séries chronologiques. Voir time_series.

warehouse_id

Chaîne

Argument facultatif pour spécifier le warehouse pour la création de tableaux de bord. Si non spécifié, le premier warehouse en cours d'exécution sera utilisé.

quality_monitor.custom_metrics

Type: Sequence

Une liste de définitions de métriques personnalisées.

Chaque élément de la liste est un CustomMetric:

Clé

Type

Description

definition

Chaîne

Template Jinja pour une expression SQL qui spécifie comment calculer la métrique. Consultez créer une définition d'indicateur.

input_columns

Séquence

Une liste de noms de colonnes dans la table d'entrée pour lesquelles la métrique doit être calculée. Peut utiliser :table pour indiquer que la métrique a besoin d'informations provenant de plusieurs colonnes.

name

Chaîne

Nom de la métrique dans les tables de sortie.

output_data_type

Chaîne

Le type de sortie de la métrique personnalisée.

type

Chaîne

Ne peut être que l'une des valeurs suivantes : CUSTOM_METRIC_TYPE_AGGREGATE, CUSTOM_METRIC_TYPE_DERIVED ou CUSTOM_METRIC_TYPE_DRIFT. Les métriques CUSTOM_METRIC_TYPE_AGGREGATE et CUSTOM_METRIC_TYPE_DERIVED sont calculées sur une seule table, tandis que les CUSTOM_METRIC_TYPE_DRIFT comparent les métriques entre la table de référence et la table d'entrée, ou entre les deux fenêtres temporelles consécutives.

  • CUSTOM_METRIC_TYPE_AGGREGATE : ne dépendent que des colonnes existantes dans votre table
  • CUSTOM_METRIC_TYPE_DERIVED : dépendent des métriques agrégées précédemment calculées.
  • CUSTOM_METRIC_TYPE_DRIFT : dépend des métriques agrégées ou dérivées calculées précédemment

Clé

Type

Description

definition

Chaîne

Template Jinja pour une expression SQL qui spécifie comment calculer la métrique. Consultez créer une définition d'indicateur.

input_columns

Séquence

Une liste de noms de colonnes dans la table d'entrée pour lesquelles la métrique doit être calculée. Peut utiliser :table pour indiquer que la métrique a besoin d'informations provenant de plusieurs colonnes.

name

Chaîne

Nom de la métrique dans les tables de sortie.

output_data_type

Chaîne

Le type de sortie de la métrique personnalisée.

type

Chaîne

Ne peut être que l'une des valeurs suivantes : CUSTOM_METRIC_TYPE_AGGREGATE, CUSTOM_METRIC_TYPE_DERIVED ou CUSTOM_METRIC_TYPE_DRIFT. Les métriques CUSTOM_METRIC_TYPE_AGGREGATE et CUSTOM_METRIC_TYPE_DERIVED sont calculées sur une seule table, tandis que les CUSTOM_METRIC_TYPE_DRIFT comparent les métriques entre la table de référence et la table d'entrée, ou entre les deux fenêtres temporelles consécutives.

  • CUSTOM_METRIC_TYPE_AGGREGATE : ne dépendent que des colonnes existantes dans votre table
  • CUSTOM_METRIC_TYPE_DERIVED : dépendent des métriques agrégées précédemment calculées.
  • CUSTOM_METRIC_TYPE_DRIFT : dépend des métriques agrégées ou dérivées calculées précédemment

quality_monitor.inference_log

Type: Map

Configuration pour le monitoring des Logs d'inférence.

Clé

Type

Description

granularities

Séquence

Les granularités temporelles pour l'agrégation des logs d'inférence (par exemple, ["1 day"]).

model_id_col

Chaîne

Le nom de la colonne contenant l'ID du modèle.

prediction_col

Chaîne

Le nom de la colonne contenant la prédiction.

timestamp_col

Chaîne

Le nom de la colonne contenant le timestamp.

problem_type

Chaîne

Le type de problème ML. Les valeurs valides incluent PROBLEM_TYPE_CLASSIFICATION, PROBLEM_TYPE_REGRESSION.

label_col

Chaîne

Le nom de la colonne contenant l’étiquette (vérité de terrain).

prediction_proba_col

Chaîne

Le nom de la colonne contenant les probabilités de prédiction.

Clé

Type

Description

granularities

Séquence

Les granularités temporelles pour l'agrégation des logs d'inférence (par exemple, ["1 day"]).

model_id_col

Chaîne

Le nom de la colonne contenant l'ID du modèle.

prediction_col

Chaîne

Le nom de la colonne contenant la prédiction.

timestamp_col

Chaîne

Le nom de la colonne contenant le timestamp.

problem_type

Chaîne

Le type de problème ML. Les valeurs valides incluent PROBLEM_TYPE_CLASSIFICATION, PROBLEM_TYPE_REGRESSION.

label_col

Chaîne

Le nom de la colonne contenant l’étiquette (vérité de terrain).

prediction_proba_col

Chaîne

Le nom de la colonne contenant les probabilités de prédiction.

quality_monitor.notifications

Type: Map

Paramètres de notification pour le moniteur.

Clé

Type

Description

on_failure

Carte

Paramètres de notification en cas d’échec du moniteur. Voir on_failure.

on_new_classification_tag_detected

Carte

Paramètres de notification lorsque de nouvelles étiquettes de classification sont détectées. Voir on_new_classification_tag_detected.

Clé

Type

Description

on_failure

Carte

Paramètres de notification en cas d’échec du moniteur. Voir on_failure.

on_new_classification_tag_detected

Carte

Paramètres de notification lorsque de nouvelles étiquettes de classification sont détectées. Voir on_new_classification_tag_detected.

quality_monitor.notifications.on_failure

Type: Map

Paramètres de notification lorsque le moniteur échoue.

Clé

Type

Description

email_addresses

Séquence

Une liste d’adresses e-mail à notifier en cas d’échec du moniteur.

Clé

Type

Description

email_addresses

Séquence

Une liste d’adresses e-mail à notifier en cas d’échec du moniteur.

quality_monitor.notifications.on_new_classification_tag_detected

Type: Map

Paramètres de notification lorsque de nouvelles étiquettes de classification sont détectées.

Clé

Type

Description

email_addresses

Séquence

Une liste d'adresses e-mail à notifier lorsque de nouvelles étiquettes de classification sont détectées.

Clé

Type

Description

email_addresses

Séquence

Une liste d'adresses e-mail à notifier lorsque de nouvelles étiquettes de classification sont détectées.

quality_monitor.schedule

Type: Map

Planification pour la mise à jour et l'actualisation automatiques des tables de métriques.

Clé

Type

Description

quartz_cron_expression

Chaîne

Une expression Cron utilisant la syntaxe Quartz. Par exemple, 0 0 8 * * ? s'exécute chaque jour à 8 h 00.

timezone_id

Chaîne

Le fuseau horaire du planning (par exemple, UTC, America/Los_Angeles).

pause_status

Chaîne

Indique si la planification est suspendue. Valeurs valides : PAUSED, UNPAUSED.

Clé

Type

Description

quartz_cron_expression

Chaîne

Une expression Cron utilisant la syntaxe Quartz. Par exemple, 0 0 8 * * ? s'exécute chaque jour à 8 h 00.

timezone_id

Chaîne

Le fuseau horaire du planning (par exemple, UTC, America/Los_Angeles).

pause_status

Chaîne

Indique si la planification est suspendue. Valeurs valides : PAUSED, UNPAUSED.

quality_monitor.snapshot

Type: Map

Configuration pour le monitoring des tables d'instantanés.

quality_monitor.time_series

Configuration pour le monitoring des tables de séries chronologiques.

Clé

Type

Description

granularities

Séquence

Les granularités temporelles pour l'agrégation de données de séries chronologiques (par exemple, ["30 minutes"]).

timestamp_col

Chaîne

Le nom de la colonne contenant le timestamp.

Clé

Type

Description

granularities

Séquence

Les granularités temporelles pour l'agrégation de données de séries chronologiques (par exemple, ["30 minutes"]).

timestamp_col

Chaîne

Le nom de la colonne contenant le timestamp.

Exemples

Les exemples suivants définissent des moniteurs de qualité pour les types de profil InferenceLog, TimeSeries et Snapshot.

YAML
# InferenceLog profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
inference_log:
granularities: [1 day]
model_id_col: model_id
prediction_col: prediction
label_col: price
problem_type: PROBLEM_TYPE_REGRESSION
timestamp_col: timestamp
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
YAML
# TimeSeries profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
time_series:
granularities: [30 minutes]
timestamp_col: timestamp
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
YAML
# Snapshot profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
snapshot: {}
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC

L'exemple suivant configure un moniteur de qualité et un Job de réentraînement de modèle correspondant basés sur le monitoring :

YAML
# Quality monitoring workflow
resources:
quality_monitors:
mlops_quality_monitor:
table_name: ${bundle.target}.mlops_demo.predictions
output_schema_name: ${bundle.target}.mlops_demo
assets_dir: /Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
inference_log:
granularities: [1 hour]
model_id_col: model_version
prediction_col: prediction
label_col: fare_amount
problem_type: PROBLEM_TYPE_REGRESSION
timestamp_col: inference_timestamp
schedule:
quartz_cron_expression: 57 0 14 * * ? # refresh monitoring metrics every day at 7 am PT
timezone_id: UTC
jobs:
retraining_job:
name: ${bundle.target}-mlops_demo-monitoring-retraining-job
tasks:
- task_key: monitored_metric_violation_check
notebook_task:
notebook_path: ../monitoring/notebooks/MonitoredMetricViolationCheck.py
base_parameters:
env: ${bundle.target}
table_name_under_monitor: ${bundle.target}.mlops_demo.predictions
metric_to_monitor: r2_score
metric_violation_threshold: 0.7
num_evaluation_windows: 24
num_violation_windows: 5 # 5 out of the past 24 windows have metrics lower than threshold

- task_key: is_metric_violated
depends_on:
- task_key: monitored_metric_violation_check
condition_task:
op: EQUAL_TO
left: '{{tasks.monitored_metric_violation_check.values.is_metric_violated}}'
right: 'true'

- task_key: trigger_retraining
depends_on:
- task_key: is_metric_violated
outcome: 'true'
run_job_task:
job_id: ${resources.jobs.model_training_job.id}

schedule:
quartz_cron_expression: '0 0 15 * * ?' # daily at 8 am PDT
timezone_id: UTC

# To get notifications, provide a list of emails to the on_failure argument.
#
# email_notifications:
# on_failure:
# - someone@example.com

modèle enregistré (Unity Catalog)

Type: Map

La ressource de modèle enregistré vous permet de définir des modèles dans Unity Catalog. Pour plus d'informations sur les modèles enregistrés dans Unity Catalog, consultez Gérer le cycle de vie des modèles dans Unity Catalog.

YAML
registered_models:
<registered_model-name>:
<registered_model-field-name>: <registered_model-field-value>

Clé

Type

Description

aliases

Séquence

Liste d'alias associés au modèle enregistré. Consultez registered_model.aliases.

Ajouté dans la version 0.273.0 de Databricks CLI

browse_only

Booléen

Indique si le principal est limité à la récupération des métadonnées pour l'objet associé via le privilège BROWSE lorsque include_browse est activé dans la requête.

Ajouté dans la version 0.273.0 de Databricks CLI

catalog_name

Chaîne

Le nom du catalogue où résident le schéma et le modèle enregistré.

comment

Chaîne

Le commentaire joint au modèle enregistré.

created_at

Entier

Timestamp de création du modèle enregistré en millisecondes depuis l'époque Unix.

Ajouté dans la version 0.273.0 de Databricks CLI

created_by

Chaîne

L'identifiant de l'utilisateur qui a créé le modèle enregistré.

Ajouté dans la version 0.273.0 de Databricks CLI

full_name

Chaîne

Nom à trois niveaux (entièrement qualifié) du modèle enregistré.

Ajouté dans la version 0.273.0 de Databricks CLI

grants

Séquence

Les subventions associées au modèle ajouté au registre. Voir l'octroi.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

metastore_id

Chaîne

L'identifiant unique du métastore.

Ajouté dans la version 0.273.0 de Databricks CLI

name

Chaîne

Le nom du modèle enregistré.

owner

Chaîne

L'identifiant de l'utilisateur qui possède le modèle enregistré.

Ajouté dans la version 0.273.0 de Databricks CLI

schema_name

Chaîne

Le nom du schéma où réside le modèle enregistré.

storage_location

Chaîne

L'emplacement de stockage dans le cloud sous lequel les fichiers de données de version de modèle sont stockés.

updated_at

Chaîne

Timestamp de dernière mise à jour du modèle enregistré en millisecondes depuis l'époque Unix.

Ajouté dans la version 0.273.0 de Databricks CLI

updated_by

Chaîne

L'identifiant de l'utilisateur qui a mis à jour le Modèle enregistré pour la dernière fois.

Ajouté dans la version 0.273.0 de Databricks CLI

Clé

Type

Description

aliases

Séquence

Liste d'alias associés au modèle enregistré. Consultez registered_model.aliases.

Ajouté dans la version 0.273.0 de Databricks CLI

browse_only

Booléen

Indique si le principal est limité à la récupération des métadonnées pour l'objet associé via le privilège BROWSE lorsque include_browse est activé dans la requête.

Ajouté dans la version 0.273.0 de Databricks CLI

catalog_name

Chaîne

Le nom du catalogue où résident le schéma et le modèle enregistré.

comment

Chaîne

Le commentaire joint au modèle enregistré.

created_at

Entier

Timestamp de création du modèle enregistré en millisecondes depuis l'époque Unix.

Ajouté dans la version 0.273.0 de Databricks CLI

created_by

Chaîne

L'identifiant de l'utilisateur qui a créé le modèle enregistré.

Ajouté dans la version 0.273.0 de Databricks CLI

full_name

Chaîne

Nom à trois niveaux (entièrement qualifié) du modèle enregistré.

Ajouté dans la version 0.273.0 de Databricks CLI

grants

Séquence

Les subventions associées au modèle ajouté au registre. Voir l'octroi.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

metastore_id

Chaîne

L'identifiant unique du métastore.

Ajouté dans la version 0.273.0 de Databricks CLI

name

Chaîne

Le nom du modèle enregistré.

owner

Chaîne

L'identifiant de l'utilisateur qui possède le modèle enregistré.

Ajouté dans la version 0.273.0 de Databricks CLI

schema_name

Chaîne

Le nom du schéma où réside le modèle enregistré.

storage_location

Chaîne

L'emplacement de stockage dans le cloud sous lequel les fichiers de données de version de modèle sont stockés.

updated_at

Chaîne

Timestamp de dernière mise à jour du modèle enregistré en millisecondes depuis l'époque Unix.

Ajouté dans la version 0.273.0 de Databricks CLI

updated_by

Chaîne

L'identifiant de l'utilisateur qui a mis à jour le Modèle enregistré pour la dernière fois.

Ajouté dans la version 0.273.0 de Databricks CLI

registered_model.aliases

Type: Sequence

Une liste d’alias associés au modèle enregistré.

Chaque élément de la liste est un Alias:

Clé

Type

Description

alias_name

Chaîne

Nom de l'alias, par exemple : « champion » ou « latest_stable »

catalog_name

Chaîne

Le nom du catalogue contenant la version du modèle

id

Chaîne

L’identifiant unique de l’alias

model_name

Chaîne

Nom du modèle parent enregistré de la version du modèle, relatif au schéma parent

schema_name

Chaîne

Le nom du schéma contenant la version du modèle, par rapport au catalogue parent.

version_num

Entier

Numéro de version entier de la version du modèle vers lequel cet alias pointe.

Clé

Type

Description

alias_name

Chaîne

Nom de l'alias, par exemple : « champion » ou « latest_stable »

catalog_name

Chaîne

Le nom du catalogue contenant la version du modèle

id

Chaîne

L’identifiant unique de l’alias

model_name

Chaîne

Nom du modèle parent enregistré de la version du modèle, relatif au schéma parent

schema_name

Chaîne

Le nom du schéma contenant la version du modèle, par rapport au catalogue parent.

version_num

Entier

Numéro de version entier de la version du modèle vers lequel cet alias pointe.

Exemple

L’exemple suivant définit un modèle enregistré dans Unity Catalog :

YAML
resources:
registered_models:
model:
name: my_model
catalog_name: ${bundle.target}
schema_name: mlops_schema
comment: Registered model in Unity Catalog for ${bundle.target} deployment target
grants:
- privileges:
- EXECUTE
principal: account users

schéma (Unity Catalog)

Type: Map

Les schémas sont pris en charge en Python pour les Declarative Automation Bundles. Voir databricks.bundles.schemas.

Le type de ressource de schéma vous permet de définir les schémas Unity Catalog pour les tables et autres asset dans vos workflows et pipeline créés dans le cadre d'un bundle. Un schéma, différent des autres types de Ressources, présente les limitations suivantes :

  • Le propriétaire d'une ressource de schéma est toujours l'utilisateur du déploiement et ne peut pas être modifié. Si run_as est spécifié dans le bundle, il sera ignoré par les opérations sur le schéma.
  • Seuls les champs pris en charge par l’ API de création d’objet Schemas correspondante sont disponibles pour la ressource de schéma. Par exemple, enable_predictive_optimization n'est pas pris en charge, car il n'est disponible que sur l'API de mise à jour.
YAML
schemas:
<schema-name>:
<schema-field-name>: <schema-field-value>

Clé

Type

Description

catalog_name

Chaîne

Le nom du catalogue parent.

comment

Chaîne

Une description textuelle libre fournie par l'utilisateur.

grants

Séquence

Les octrois associés au schéma. Voir l'octroi.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom du schéma, par rapport au catalogue parent.

properties

Carte

Un mappage de propriétés clé-valeur attachées au schéma.

storage_root

Chaîne

L'URL racine de stockage pour les tables gérées au sein du schéma.

Clé

Type

Description

catalog_name

Chaîne

Le nom du catalogue parent.

comment

Chaîne

Une description textuelle libre fournie par l'utilisateur.

grants

Séquence

Les octrois associés au schéma. Voir l'octroi.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom du schéma, par rapport au catalogue parent.

properties

Carte

Un mappage de propriétés clé-valeur attachées au schéma.

storage_root

Chaîne

L'URL racine de stockage pour les tables gérées au sein du schéma.

Exemples

L'exemple suivant définit un pipeline avec la clé de ressource my_pipeline qui crée un schéma Unity Catalog avec la clé my_schema comme cible. Cet exemple utilise des substitutions.

YAML
resources:
pipelines:
my_pipeline:
name: test-pipeline
libraries:
- notebook:
path: ../src/nb.ipynb
- file:
path: ../src/range.sql
development: true
catalog: ${resources.schemas.my_schema.catalog_name}
target: ${resources.schemas.my_schema.id}

schemas:
my_schema:
name: test-schema
catalog_name: main
comment: This schema was created by Declarative Automation Bundles.

Un mappage des autorisations de niveau supérieur n'est pas pris en charge par les Bundles d'automatisation déclaratifs. Par conséquent, si vous souhaitez définir des autorisations pour un schéma, définissez les autorisations pour le schéma dans le mappage schemas. Pour plus d'information sur les autorisations, consultez Afficher, accorder et révoquer des privilèges.

L'exemple suivant définit un schéma Unity Catalog avec des autorisations :

YAML
resources:
schemas:
my_schema:
name: test-schema
grants:
- principal: users
privileges:
- SELECT
- principal: my_team
privileges:
- MANAGE
catalog_name: main

secret_scope

Type: Map

La ressource `secret_scope` vous permet de définir des périmètres secrets dans un bundle. Pour des informations sur les Secret Scopes, consultez Gestion des secrets.

Ajouté dans la version 0.252.0 de la CLI Databricks

YAML
secret_scopes:
<secret_scope-name>:
<secret_scope-field-name>: <secret_scope-field-value>

Clé

Type

Description

backend_type

Chaîne

Le type de backend avec lequel la portée sera créée. Si non spécifié, cela est défini par default sur DATABRICKS.

Ajouté dans la version 0.252.0 de la CLI Databricks

keyvault_metadata

Carte

Les métadonnées pour le Secret Scope si backend_type est AZURE_KEYVAULT. Voir keyvault_metadata.

Ajouté dans la version 0.252.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Nom du périmètre demandé par l'utilisateur. Les noms de portée sont uniques.

Ajouté dans la version 0.252.0 de la CLI Databricks

permissions

Séquence

Les autorisations à appliquer au Secret Scope. Les autorisations sont gérées via les ACLs du Secret Scope. Voir les autorisations.

Ajouté dans la version 0.252.0 de la CLI Databricks

Clé

Type

Description

backend_type

Chaîne

Le type de backend avec lequel la portée sera créée. Si non spécifié, cela est défini par default sur DATABRICKS.

Ajouté dans la version 0.252.0 de la CLI Databricks

keyvault_metadata

Carte

Les métadonnées pour le Secret Scope si backend_type est AZURE_KEYVAULT. Voir keyvault_metadata.

Ajouté dans la version 0.252.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Nom du périmètre demandé par l'utilisateur. Les noms de portée sont uniques.

Ajouté dans la version 0.252.0 de la CLI Databricks

permissions

Séquence

Les autorisations à appliquer au Secret Scope. Les autorisations sont gérées via les ACLs du Secret Scope. Voir les autorisations.

Ajouté dans la version 0.252.0 de la CLI Databricks

secret_scope.keyvault_metadata

Type: Map

Les métadonnées pour les Secret Scope sécurisés par Azure Key Vault.

Clé

Type

Description

resource_id

Chaîne

L'ID de ressource Azure du Key Vault.

dns_name

Chaîne

Le nom DNS d'Azure Key Vault.

Clé

Type

Description

resource_id

Chaîne

L'ID de ressource Azure du Key Vault.

dns_name

Chaîne

Le nom DNS d'Azure Key Vault.

Exemples

L'exemple suivant définit un Secret Scope qui utilise un backend de coffre de clés :

YAML
resources:
secret_scopes:
secret_scope_azure:
name: test-secrets-azure-backend
backend_type: 'AZURE_KEYVAULT'
keyvault_metadata:
resource_id: my_azure_keyvault_id
dns_name: my_azure_keyvault_dns_name

L’exemple suivant définit un ACL personnalisé à l’aide de Secret Scope et d’autorisations :

YAML
resources:
secret_scopes:
my_secret_scope:
name: my_secret_scope
permissions:
- user_name: admins
level: WRITE
- user_name: users
level: READ

Pour obtenir un exemple de bundle qui montre comment définir un Secret Scope et un Job avec une tâche qui en lit les données dans un bundle, consultez le repository GitHub bundle-examples.

sql_warehouse

Type: Map

La ressource SQL Warehouse vous permet de définir un SQL Warehouse dans un bundle. Pour plus d'informations sur les SQL Warehouse, consultez l'entreposage des données sur Databricks.

Ajouté dans la CLI Databricks version 0.260.0

YAML
sql_warehouses:
<sql-warehouse-name>:
<sql-warehouse-field-name>: <sql-warehouse-field-value>

Clé

Type

Description

auto_stop_mins

Entier

La durée en minutes pendant laquelle un SQL Warehouse doit être inactif (par exemple, aucune requête en cours d'exécution) avant d'être automatiquement arrêté. Les valeurs valides sont 0, ce qui indique l'absence d'arrêt automatique, ou supérieur ou égal à 10. La default est 120.

Ajouté dans la CLI Databricks version 0.260.0

channel

Carte

Les détails du Canal de distribution. See Canal de distribution.

Ajouté dans la CLI Databricks version 0.260.0

cluster_size

Chaîne

La taille des clusters alloués pour ce warehouse. L'augmentation de la taille d'un cluster Spark vous permet d'y exécuter des requêtes plus volumineuses. Si vous souhaitez augmenter le nombre de requêtes simultanées, ajustez max_num_clusters. Pour les valeurs prises en charge, consultez cluster_size.

Ajouté dans la CLI Databricks version 0.260.0

creator_name

Chaîne

Le nom de l'utilisateur qui a créé le warehouse.

Ajouté dans la CLI Databricks version 0.260.0

enable_photon

Booléen

Si le warehouse doit utiliser des clusters optimisés par Photon. default to false.

Ajouté dans la CLI Databricks version 0.260.0

enable_serverless_compute

Booléen

Si le warehouse doit utiliser le compute serverless.

Ajouté dans la CLI Databricks version 0.260.0

instance_profile_arn

Chaîne

Obsolète. Profil d'instance utilisé pour transmettre le rôle IAM au cluster.

Ajouté dans la CLI Databricks version 0.260.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

max_num_clusters

Entier

Le nombre maximal de clusters que l'autoscaler créera pour gérer les requêtes simultanées. Les valeurs doivent être inférieures ou égales à 30 et supérieures ou égales à min_num_clusters. default to min_clusters si non défini.

Ajouté dans la CLI Databricks version 0.260.0

min_num_clusters

Entier

Le nombre minimum de clusters disponibles qui seront maintenus pour ce SQL Warehouse. Augmenter cela garantira qu'un plus grand nombre de clusters sont toujours en cours d'exécution et, par conséquent, peut réduire le temps de cold start pour les nouvelles queries. Ceci est similaire aux cœurs réservés ou révocables dans un gestionnaire de ressources. Les valeurs doivent être supérieures à 0 et inférieures ou égales à min(max_num_clusters, 30). La valeur par défaut est 1.

Ajouté dans la CLI Databricks version 0.260.0

name

Chaîne

Le nom logique du cluster. Le nom doit être unique au sein d'une organisation et comporter moins de 100 caractères.

Ajouté dans la CLI Databricks version 0.260.0

permissions

Séquence

Les autorisations à appliquer au warehouse. Afficher les autorisations.

Ajouté dans la CLI Databricks version 0.260.0

spot_instance_policy

Chaîne

Indique s'il faut utiliser des instances spot. Les valeurs valides sont : POLICY_UNSPECIFIED, COST_OPTIMIZED, RELIABILITY_OPTIMIZED. La valeur default est COST_OPTIMIZED.

Ajouté dans la CLI Databricks version 0.260.0

tags

Carte

Un ensemble de balises personnalisées pour le warehouse. Voir sql_warehouse.tags.

Ajouté dans la CLI Databricks version 0.260.0

warehouse_type

Chaîne

Le type de warehouse. Les valeurs valides sont PRO et CLASSIC. Si vous souhaitez utiliser le compute Serverless, définissez ce champ sur PRO et définissez également le champ enable_serverless_compute sur true.

Ajouté dans la CLI Databricks version 0.260.0

Clé

Type

Description

auto_stop_mins

Entier

La durée en minutes pendant laquelle un SQL Warehouse doit être inactif (par exemple, aucune requête en cours d'exécution) avant d'être automatiquement arrêté. Les valeurs valides sont 0, ce qui indique l'absence d'arrêt automatique, ou supérieur ou égal à 10. La default est 120.

Ajouté dans la CLI Databricks version 0.260.0

channel

Carte

Les détails du Canal de distribution. See Canal de distribution.

Ajouté dans la CLI Databricks version 0.260.0

cluster_size

Chaîne

La taille des clusters alloués pour ce warehouse. L'augmentation de la taille d'un cluster Spark vous permet d'y exécuter des requêtes plus volumineuses. Si vous souhaitez augmenter le nombre de requêtes simultanées, ajustez max_num_clusters. Pour les valeurs prises en charge, consultez cluster_size.

Ajouté dans la CLI Databricks version 0.260.0

creator_name

Chaîne

Le nom de l'utilisateur qui a créé le warehouse.

Ajouté dans la CLI Databricks version 0.260.0

enable_photon

Booléen

Si le warehouse doit utiliser des clusters optimisés par Photon. default to false.

Ajouté dans la CLI Databricks version 0.260.0

enable_serverless_compute

Booléen

Si le warehouse doit utiliser le compute serverless.

Ajouté dans la CLI Databricks version 0.260.0

instance_profile_arn

Chaîne

Obsolète. Profil d'instance utilisé pour transmettre le rôle IAM au cluster.

Ajouté dans la CLI Databricks version 0.260.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

max_num_clusters

Entier

Le nombre maximal de clusters que l'autoscaler créera pour gérer les requêtes simultanées. Les valeurs doivent être inférieures ou égales à 30 et supérieures ou égales à min_num_clusters. default to min_clusters si non défini.

Ajouté dans la CLI Databricks version 0.260.0

min_num_clusters

Entier

Le nombre minimum de clusters disponibles qui seront maintenus pour ce SQL Warehouse. Augmenter cela garantira qu'un plus grand nombre de clusters sont toujours en cours d'exécution et, par conséquent, peut réduire le temps de cold start pour les nouvelles queries. Ceci est similaire aux cœurs réservés ou révocables dans un gestionnaire de ressources. Les valeurs doivent être supérieures à 0 et inférieures ou égales à min(max_num_clusters, 30). La valeur par défaut est 1.

Ajouté dans la CLI Databricks version 0.260.0

name

Chaîne

Le nom logique du cluster. Le nom doit être unique au sein d'une organisation et comporter moins de 100 caractères.

Ajouté dans la CLI Databricks version 0.260.0

permissions

Séquence

Les autorisations à appliquer au warehouse. Afficher les autorisations.

Ajouté dans la CLI Databricks version 0.260.0

spot_instance_policy

Chaîne

Indique s'il faut utiliser des instances spot. Les valeurs valides sont : POLICY_UNSPECIFIED, COST_OPTIMIZED, RELIABILITY_OPTIMIZED. La valeur default est COST_OPTIMIZED.

Ajouté dans la CLI Databricks version 0.260.0

tags

Carte

Un ensemble de balises personnalisées pour le warehouse. Voir sql_warehouse.tags.

Ajouté dans la CLI Databricks version 0.260.0

warehouse_type

Chaîne

Le type de warehouse. Les valeurs valides sont PRO et CLASSIC. Si vous souhaitez utiliser le compute Serverless, définissez ce champ sur PRO et définissez également le champ enable_serverless_compute sur true.

Ajouté dans la CLI Databricks version 0.260.0

sql_warehouse.channel

Type: Map

La configuration du canal de distribution pour le SQL Warehouse.

Clé

Type

Description

name

Chaîne

Le nom du canal de distribution. Les valeurs valides incluent CHANNEL_NAME_CURRENT, CHANNEL_NAME_PREVIEW, CHANNEL_NAME_CUSTOM.

dbsql_version

Chaîne

La version DBSQL pour les canaux de distribution personnalisés.

Clé

Type

Description

name

Chaîne

Le nom du canal de distribution. Les valeurs valides incluent CHANNEL_NAME_CURRENT, CHANNEL_NAME_PREVIEW, CHANNEL_NAME_CUSTOM.

dbsql_version

Chaîne

La version DBSQL pour les canaux de distribution personnalisés.

sql_warehouse.tags

Type: Map

Les balises personnalisées pour le SQL Warehouse.

Clé

Type

Description

custom_tags

Séquence

Un ensemble de paires clé-valeur qui identifient les balises sur toutes les Ressources (par exemple, les instances AWS et les volumes EBS) associées à ce SQL Warehouse. Le nombre de balises doit être inférieur à 45.

Clé

Type

Description

custom_tags

Séquence

Un ensemble de paires clé-valeur qui identifient les balises sur toutes les Ressources (par exemple, les instances AWS et les volumes EBS) associées à ce SQL Warehouse. Le nombre de balises doit être inférieur à 45.

Exemple

L'exemple suivant définit un SQL Warehouse :

YAML
resources:
sql_warehouses:
my_sql_warehouse:
name: my_sql_warehouse
cluster_size: X-Large
enable_serverless_compute: true
max_num_clusters: 3
min_num_clusters: 1
auto_stop_mins: 60
warehouse_type: PRO
tags:
custom_tags:
- key: 'bizunit'
value: 'commercial'
- key: 'area'
value: 'marketing'

table de base de données synchronisée

Type: Map

La ressource de table de base de données synchronisée vous permet de définir les tables de base de données Lakebase dans un bundle.

Pour des informations sur les tables de base de données synchronisées, veuillez consulter Lakebase provisionnée.

Ajouté dans Databricks CLI version 0,266.0

YAML
synced_database_tables:
<synced_database_table-name>:
<synced_database_table-field-name>: <synced_database_table-field-value>

Clé

Type

Description

database_instance_name

Chaîne

Le nom de l’instance de base de données cible. Ceci est requis lors de la création de tables de base de données synchronisées dans des catalogues standard. Ceci est facultatif lors de la création de tables de base de données synchronisées dans les catalogues enregistrés.

Ajouté dans Databricks CLI version 0,266.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

logical_database_name

Chaîne

Le nom de l'objet de la base de données Postgres cible (base de données logique) pour cette table.

Ajouté dans Databricks CLI version 0,266.0

name

Chaîne

Le nom complet de la table, au format catalog.schema.table.

Ajouté dans Databricks CLI version 0,266.0

spec

Carte

La spécification de la table de base de données. Voir la spécification des tables de base de données synchronisées.

Ajouté dans Databricks CLI version 0,266.0

Clé

Type

Description

database_instance_name

Chaîne

Le nom de l’instance de base de données cible. Ceci est requis lors de la création de tables de base de données synchronisées dans des catalogues standard. Ceci est facultatif lors de la création de tables de base de données synchronisées dans les catalogues enregistrés.

Ajouté dans Databricks CLI version 0,266.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

logical_database_name

Chaîne

Le nom de l'objet de la base de données Postgres cible (base de données logique) pour cette table.

Ajouté dans Databricks CLI version 0,266.0

name

Chaîne

Le nom complet de la table, au format catalog.schema.table.

Ajouté dans Databricks CLI version 0,266.0

spec

Carte

La spécification de la table de base de données. Voir la spécification des tables de base de données synchronisées.

Ajouté dans Databricks CLI version 0,266.0

synced_database_table.spec

Type: Map

La spécification de la table de la base de données.

Ajouté dans Databricks CLI version 0,266.0

Clé

Type

Description

create_database_objects_if_missing

Booléen

S'il faut créer la base de données logique et les ressources de schéma de la table synchronisée si elles n'existent pas déjà.

existing_pipeline_id

Chaîne

L'ID d'un pipeline existant. Si cette option est définie, la table synchronisée sera regroupée dans le pipeline existant référencé. Cela évite de créer un nouveau pipeline et permet de partager le compute existant. Dans ce cas, le scheduling_policy de cette table synchronisée doit correspondre à la politique de planification du pipeline existant. Au maximum l'un de existing_pipeline_id et new_pipeline_spec doit être défini.

new_pipeline_spec

Carte

La spécification d'un nouveau pipeline. Voir new_pipeline_spec. Au maximum un seul de existing_pipeline_id et new_pipeline_spec doit être défini.

primary_key_columns

Séquence

La liste des noms de colonnes qui forment la clé primaire.

scheduling_policy

Chaîne

La politique de planification de la synchronisation. Les valeurs valides incluent SNAPSHOT, CONTINUOUS, TRIGGERED.

source_table_full_name

Chaîne

Le nom complet de la table source au format catalog.schema.table.

timeseries_key

Chaîne

Clé de série temporelle pour dédupliquer les lignes avec la même clé primaire.

Clé

Type

Description

create_database_objects_if_missing

Booléen

S'il faut créer la base de données logique et les ressources de schéma de la table synchronisée si elles n'existent pas déjà.

existing_pipeline_id

Chaîne

L'ID d'un pipeline existant. Si cette option est définie, la table synchronisée sera regroupée dans le pipeline existant référencé. Cela évite de créer un nouveau pipeline et permet de partager le compute existant. Dans ce cas, le scheduling_policy de cette table synchronisée doit correspondre à la politique de planification du pipeline existant. Au maximum l'un de existing_pipeline_id et new_pipeline_spec doit être défini.

new_pipeline_spec

Carte

La spécification d'un nouveau pipeline. Voir new_pipeline_spec. Au maximum un seul de existing_pipeline_id et new_pipeline_spec doit être défini.

primary_key_columns

Séquence

La liste des noms de colonnes qui forment la clé primaire.

scheduling_policy

Chaîne

La politique de planification de la synchronisation. Les valeurs valides incluent SNAPSHOT, CONTINUOUS, TRIGGERED.

source_table_full_name

Chaîne

Le nom complet de la table source au format catalog.schema.table.

timeseries_key

Chaîne

Clé de série temporelle pour dédupliquer les lignes avec la même clé primaire.

synced_database_table.spec.new_pipeline_spec

Type: Map

La spécification d'un nouveau pipeline utilisé par la table de base de données synchronisée.

Clé

Type

Description

budget_policy_id

Chaîne

L'ID de la politique budgétaire à définir sur le pipeline nouvellement créé.

storage_catalog

Chaîne

Le catalogue pour le pipeline afin de stocker les fichiers intermédiaires, tels que les points de contrôle et les Logs d'événements. Il doit s’agir d’un catalogue standard où l’utilisateur dispose des autorisations pour créer des tables Delta.

storage_schema

Chaîne

Le schéma du pipeline pour stocker les fichiers intermédiaires, tels que les points de contrôle et les logs d'événements. Cela doit être dans le catalogue standard où l'utilisateur a les autorisations pour créer des tables Delta.

Clé

Type

Description

budget_policy_id

Chaîne

L'ID de la politique budgétaire à définir sur le pipeline nouvellement créé.

storage_catalog

Chaîne

Le catalogue pour le pipeline afin de stocker les fichiers intermédiaires, tels que les points de contrôle et les Logs d'événements. Il doit s’agir d’un catalogue standard où l’utilisateur dispose des autorisations pour créer des tables Delta.

storage_schema

Chaîne

Le schéma du pipeline pour stocker les fichiers intermédiaires, tels que les points de contrôle et les logs d'événements. Cela doit être dans le catalogue standard où l'utilisateur a les autorisations pour créer des tables Delta.

Exemples

L'exemple suivant définit une table de base de données synchronisée au sein d'un catalogue de bases de données correspondant :

YAML
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: my-instance
database_name: 'my_database'
name: my_catalog
create_database_if_not_exists: true
synced_database_tables:
my_synced_table:
name: ${resources.database_catalogs.my_catalog.name}.${resources.database_catalogs.my_catalog.database_name}.my_destination_table
database_instance_name: ${resources.database_catalogs.my_catalog.database_instance_name}
logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
spec:
source_table_full_name: 'my_source_table'
scheduling_policy: SNAPSHOT
primary_key_columns:
- my_pk_column
new_pipeline_spec:
storage_catalog: 'my_delta_catalog'
storage_schema: 'my_delta_schema'

Voici un exemple qui définit une table de base de données synchronisée au sein d'un catalogue standard :

YAML
resources:
synced_database_tables:
my_synced_table:
name: 'my_standard_catalog.public.synced_table'
# database_instance_name is required for synced tables created in standard catalogs.
database_instance_name: 'my-database-instance'
# logical_database_name is required for synced tables created in standard catalogs:
logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
spec:
source_table_full_name: 'source_catalog.schema.table'
scheduling_policy: SNAPSHOT
primary_key_columns:
- my_pk_column
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: 'my_delta_catalog'
storage_schema: 'my_delta_schema'

Cet exemple crée une table de base de données synchronisée et personnalise la planification du pipeline correspondant. Cela suppose que vous disposez déjà de :

  • Une instance de base de données nommée my-database-instance
  • Un catalogue standard nommé my_standard_catalog
  • Un schéma dans le catalogue standard nommé default
  • Une table Delta source nommée source_delta.schema.customer avec la clé primaire c_custkey
YAML
resources:
synced_database_tables:
my_synced_table:
name: 'my_standard_catalog.default.my_synced_table'
database_instance_name: 'my-database-instance'
logical_database_name: 'test_db'
spec:
source_table_full_name: 'source_delta.schema.customer'
scheduling_policy: SNAPSHOT
primary_key_columns:
- c_custkey
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: 'source_delta'
storage_schema: 'schema'

jobs:
sync_pipeline_schedule_job:
name: sync_pipeline_schedule_job
description: 'Job to schedule synced database table pipeline.'
tasks:
- task_key: synced-table-pipeline
pipeline_task:
pipeline_id: ${resources.synced_database_tables.my_synced_table.data_synchronization_status.pipeline_id}
schedule:
quartz_cron_expression: '0 0 0 * * ?'

vector_search_endpoint

Type: Map

La ressource vector_search_endpoint vous permet de définir des AI Search Endpoint dans un bundle. Pour plus d'informations sur la recherche IA, consultez Databricks AI Search.

remarque

L'utilisation des bundles d'automatisation déclaratifs pour définir les Endpoint de recherche vectorielle est prise en charge uniquement si vous utilisez le moteur de déploiement direct.

Ajouté dans Databricks CLI version 0.298.0

YAML
vector_search_endpoints:
<vector_search_endpoint-name>:
<vector_search_endpoint-field-name>: <vector_search_endpoint-field-value>

Clé

Type

Description

budget_policy_id

Chaîne

L'identifiant de la politique budgétaire à utiliser pour cet Endpoint.

Ajouté dans Databricks CLI version 0.298.0

endpoint_type

Chaîne

Type de l'endpoint. Les valeurs valides sont STORAGE_OPTIMIZED et STANDARD.

Ajouté dans Databricks CLI version 0.298.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans Databricks CLI version 0.298.0

target_qps

Entier

Les requêtes cibles par seconde pour l'Endpoint de recherche IA.

Ajouté dans Databricks CLI version 0.298.0

Ajouté dans la version 1.1.0 de la CLI Databricks.

name

Chaîne

Le nom de l'Endpoint de recherche IA.

Ajouté dans Databricks CLI version 0.298.0

permissions

Séquence

Les autorisations à appliquer à l'Endpoint de recherche IA. Afficher les autorisations.

Ajouté dans Databricks CLI version 0.298.0

Clé

Type

Description

budget_policy_id

Chaîne

L'identifiant de la politique budgétaire à utiliser pour cet Endpoint.

Ajouté dans Databricks CLI version 0.298.0

endpoint_type

Chaîne

Type de l'endpoint. Les valeurs valides sont STORAGE_OPTIMIZED et STANDARD.

Ajouté dans Databricks CLI version 0.298.0

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans Databricks CLI version 0.298.0

target_qps

Entier

Les requêtes cibles par seconde pour l'Endpoint de recherche IA.

Ajouté dans Databricks CLI version 0.298.0

Ajouté dans la version 1.1.0 de la CLI Databricks.

name

Chaîne

Le nom de l'Endpoint de recherche IA.

Ajouté dans Databricks CLI version 0.298.0

permissions

Séquence

Les autorisations à appliquer à l'Endpoint de recherche IA. Afficher les autorisations.

Ajouté dans Databricks CLI version 0.298.0

Exemple

L'exemple suivant définit un Endpoint de recherche IA :

YAML
# databricks.yml
bundle:
name: vector-search-example
engine: direct # Vector Search requires the direct deployment engine

resources:
vector_search_endpoints:
my_vector_search_endpoint:
name: my_vector_search_endpoint
endpoint_type: STANDARD

vector_search_index

Type: Map

La ressource `vector_search_index` vous permet de définir des index de recherche vectorielle dans un bundle. Pour des informations sur la recherche vectorielle, consultez la Recherche Databricks AI.

Ajouté dans la version 1.1.0 de la CLI Databricks.

YAML
vector_search_indexes:
<vector_search_index-name>:
<vector_search_index-field-name>: <vector_search_index-field-value>

Clé

Type

Description

delta_sync_index_spec

Carte

Spécification pour l'Index Delta Sync. Obligatoire si index_type est DELTA_SYNC. Voir vector_search_index.delta_sync_index_spec.

Ajouté dans la version 1.1.0 de la CLI Databricks.

direct_access_index_spec

Carte

Spécification pour l'index d'accès direct vectoriel. Obligatoire si index_type est DIRECT_ACCESS. Voir vector_search_index.direct_access_index_spec.

Ajouté dans la version 1.1.0 de la CLI Databricks.

endpoint_name

Chaîne

Obligatoire. Nom de l'endpoint à utiliser pour servir l'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

grants

Séquence

Les autorisations associées à l'index de recherche vectorielle. Voir l'octroi.

Ajouté dans la version 1.1.0 de la CLI Databricks.

index_subtype

Chaîne

(Bêta) Le sous-type de l'index. Les valeurs valides sont HYBRID et FULL_TEXT. VECTOR n'est pas pris en charge.

Ajouté dans la version 1.1.0 de la CLI Databricks.

index_type

Chaîne

Obligatoire. Le type d'index. Les valeurs valides sont :

  • DELTA_SYNC: Un index qui se synchronise automatiquement avec une table Delta source, mettant à jour l'index automatiquement et de manière incrémentielle à mesure que les données sous-jacentes changent.

  • DIRECT_ACCESS: Un index qui prend en charge la lecture et l'écriture directes de vecteurs et de métadonnées par l'intermédiaire des API REST et SDK. Avec ce modèle, l'utilisateur gère les mises à jour d'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.1.0 de la CLI Databricks.

name

Chaîne

Obligatoire. Nom de l'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

primary_key

Chaîne

Obligatoire. Clé primaire de l'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

Clé

Type

Description

delta_sync_index_spec

Carte

Spécification pour l'Index Delta Sync. Obligatoire si index_type est DELTA_SYNC. Voir vector_search_index.delta_sync_index_spec.

Ajouté dans la version 1.1.0 de la CLI Databricks.

direct_access_index_spec

Carte

Spécification pour l'index d'accès direct vectoriel. Obligatoire si index_type est DIRECT_ACCESS. Voir vector_search_index.direct_access_index_spec.

Ajouté dans la version 1.1.0 de la CLI Databricks.

endpoint_name

Chaîne

Obligatoire. Nom de l'endpoint à utiliser pour servir l'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

grants

Séquence

Les autorisations associées à l'index de recherche vectorielle. Voir l'octroi.

Ajouté dans la version 1.1.0 de la CLI Databricks.

index_subtype

Chaîne

(Bêta) Le sous-type de l'index. Les valeurs valides sont HYBRID et FULL_TEXT. VECTOR n'est pas pris en charge.

Ajouté dans la version 1.1.0 de la CLI Databricks.

index_type

Chaîne

Obligatoire. Le type d'index. Les valeurs valides sont :

  • DELTA_SYNC: Un index qui se synchronise automatiquement avec une table Delta source, mettant à jour l'index automatiquement et de manière incrémentielle à mesure que les données sous-jacentes changent.

  • DIRECT_ACCESS: Un index qui prend en charge la lecture et l'écriture directes de vecteurs et de métadonnées par l'intermédiaire des API REST et SDK. Avec ce modèle, l'utilisateur gère les mises à jour d'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 1.1.0 de la CLI Databricks.

name

Chaîne

Obligatoire. Nom de l'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

primary_key

Chaîne

Obligatoire. Clé primaire de l'index.

Ajouté dans la version 1.1.0 de la CLI Databricks.

vector_search_index.delta_sync_index_spec

Type: Map

Spécification pour un index Delta Sync.

Ajouté dans la version 1.1.0 de la CLI Databricks.

Clé

Type

Description

columns_to_index

Séquence

Facultatif. Alias pour columns_to_sync. Sélectionnez les colonnes à inclure dans l’index vectoriel. Si ce champ est vide, toutes les colonnes de la table source sont incluses. La colonne de clé primaire et la colonne source d'intégration ou la colonne de vecteur d'intégration sont toujours incluses. Seul un élément parmi columns_to_sync ou columns_to_index peut être spécifié.

columns_to_sync

Séquence

Facultatif. Sélectionnez les colonnes à synchroniser avec l'index vectoriel. Si ce champ est vide, toutes les colonnes de la table source sont synchronisées avec l'index. La colonne de clé primaire et la colonne source d'intégration ou la colonne de vecteur d'intégration sont toujours synchronisées.

embedding_source_columns

Séquence

Les colonnes qui contiennent la source d'intégration.

embedding_vector_columns

Séquence

Les colonnes qui contiennent les vecteurs d'intégration.

embedding_writeback_table

Chaîne

Facultatif. Nom de la table Delta pour synchroniser le contenu de l’index vectoriel et les intégrations calculées.

pipeline_type

Chaîne

Mode d'exécution du pipeline. Les valeurs valides sont :

  • TRIGGERED: Le système arrête le traitement après avoir actualisé avec succès la table source dans le pipeline une fois, garantissant que la table est mise à jour en fonction des données disponibles au moment où l'actualisation a start.
  • CONTINUOUS: Le pipeline traite les nouvelles données au fur et à mesure qu'elles arrivent dans la table source pour maintenir l'index vectoriel à jour.

source_table

Chaîne

Le nom de la table source.

Clé

Type

Description

columns_to_index

Séquence

Facultatif. Alias pour columns_to_sync. Sélectionnez les colonnes à inclure dans l’index vectoriel. Si ce champ est vide, toutes les colonnes de la table source sont incluses. La colonne de clé primaire et la colonne source d'intégration ou la colonne de vecteur d'intégration sont toujours incluses. Seul un élément parmi columns_to_sync ou columns_to_index peut être spécifié.

columns_to_sync

Séquence

Facultatif. Sélectionnez les colonnes à synchroniser avec l'index vectoriel. Si ce champ est vide, toutes les colonnes de la table source sont synchronisées avec l'index. La colonne de clé primaire et la colonne source d'intégration ou la colonne de vecteur d'intégration sont toujours synchronisées.

embedding_source_columns

Séquence

Les colonnes qui contiennent la source d'intégration.

embedding_vector_columns

Séquence

Les colonnes qui contiennent les vecteurs d'intégration.

embedding_writeback_table

Chaîne

Facultatif. Nom de la table Delta pour synchroniser le contenu de l’index vectoriel et les intégrations calculées.

pipeline_type

Chaîne

Mode d'exécution du pipeline. Les valeurs valides sont :

  • TRIGGERED: Le système arrête le traitement après avoir actualisé avec succès la table source dans le pipeline une fois, garantissant que la table est mise à jour en fonction des données disponibles au moment où l'actualisation a start.
  • CONTINUOUS: Le pipeline traite les nouvelles données au fur et à mesure qu'elles arrivent dans la table source pour maintenir l'index vectoriel à jour.

source_table

Chaîne

Le nom de la table source.

vector_search_index.direct_access_index_spec

Type: Map

Spécification d'un index d'accès direct aux vecteurs.

Ajouté dans la version 1.1.0 de la CLI Databricks.

Clé

Type

Description

embedding_source_columns

Séquence

Les colonnes qui contiennent la source d'intégration. Le format doit être array[double].

embedding_vector_columns

Séquence

Les colonnes qui contiennent les vecteurs d'intégration. Le format doit être array[double].

schema_json

Chaîne

Le schéma de l'index au format JSON. Les types pris en charge sont integer, long, float, double, boolean, string, date et timestamp. Types pris en charge pour les colonnes vectorielles : array<float>, array<double>.

Clé

Type

Description

embedding_source_columns

Séquence

Les colonnes qui contiennent la source d'intégration. Le format doit être array[double].

embedding_vector_columns

Séquence

Les colonnes qui contiennent les vecteurs d'intégration. Le format doit être array[double].

schema_json

Chaîne

Le schéma de l'index au format JSON. Les types pris en charge sont integer, long, float, double, boolean, string, date et timestamp. Types pris en charge pour les colonnes vectorielles : array<float>, array<double>.

Exemple

L'exemple suivant définit un index de recherche vectorielle Delta Sync :

YAML
resources:
vector_search_endpoints:
my_endpoint:
name: my-endpoint
endpoint_type: STANDARD
vector_search_indexes:
my_index:
name: main.default.my_index
endpoint_name: ${resources.vector_search_endpoints.my_endpoint.name}
primary_key: id
index_type: DELTA_SYNC
delta_sync_index_spec:
source_table: main.default.source
pipeline_type: TRIGGERED
grants:
- principal: data-engineers
privileges: [SELECT]

volume (Unity Catalog)

Type: Map

Les volumes sont pris en charge dans Python pour les Declarative Automation Bundles. Voir databricks.bundles.volumes.

Le type de Ressources de volume vous permet de définir et de créer des volumes Unity Catalog dans le cadre d'un bundle. Lorsque vous déployez un bundle avec un volume défini, veuillez noter que :

  • Un volume ne peut pas être référencé dans le artifact_path pour le bundle tant qu'il n'existe pas dans le Workspace. Par conséquent, si vous souhaitez utiliser des Bundles d’automatisation déclarative pour créer le volume, vous devez d’abord définir le volume dans le bundle, le déployer pour créer le volume, puis y faire référence dans le artifact_path lors des déploiements ultérieurs.
  • Les volumes du bundle ne sont pas précédés du préfixe dev_${workspace.current_user.short_name} lorsque la cible de déploiement a configuré mode: development. Cependant, vous pouvez configurer manuellement ce préfixe. Voir les préréglages personnalisés.

Ajouté dans la version 0.236.0 de la CLI Databricks

YAML
volumes:
<volume-name>:
<volume-field-name>: <volume-field-value>

Clé

Type

Description

catalog_name

Chaîne

Le nom du catalogue du schéma et du volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

comment

Chaîne

Le commentaire joint au volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

grants

Séquence

Les autorisations associées au volume. Voir l'octroi.

Ajouté dans la version 0.236.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom du volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

schema_name

Chaîne

Le nom du schéma où se trouve le volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

storage_location

Chaîne

L'emplacement de stockage sur le cloud.

Ajouté dans la version 0.236.0 de la CLI Databricks

volume_type

Chaîne

Le type de volume, soit EXTERNAL ou MANAGED. Un volume externe est situé dans l'emplacement externe spécifié. Un volume géré est situé à l'emplacement par default spécifié par le schéma parent, le catalogue parent ou le métastore. Consultez Volumes gérés par rapport aux volumes externes.

Clé

Type

Description

catalog_name

Chaîne

Le nom du catalogue du schéma et du volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

comment

Chaîne

Le commentaire joint au volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

grants

Séquence

Les autorisations associées au volume. Voir l'octroi.

Ajouté dans la version 0.236.0 de la CLI Databricks

lifecycle

Carte

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie.

Ajouté dans la version 0.268.0 de Databricks CLI.

name

Chaîne

Le nom du volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

schema_name

Chaîne

Le nom du schéma où se trouve le volume.

Ajouté dans la version 0.236.0 de la CLI Databricks

storage_location

Chaîne

L'emplacement de stockage sur le cloud.

Ajouté dans la version 0.236.0 de la CLI Databricks

volume_type

Chaîne

Le type de volume, soit EXTERNAL ou MANAGED. Un volume externe est situé dans l'emplacement externe spécifié. Un volume géré est situé à l'emplacement par default spécifié par le schéma parent, le catalogue parent ou le métastore. Consultez Volumes gérés par rapport aux volumes externes.

Exemple

L'exemple suivant crée un volume Unity Catalog avec la clé my_volume_id:

YAML
resources:
volumes:
my_volume_id:
catalog_name: main
name: my_volume
schema_name: my_schema

Pour un exemple de bundle qui exécute un job qui écrit dans un fichier dans un volume Unity Catalog, consultez le repository GitHub bundle-examples.

Objets courants

accorder

Type: Map

Définit le principal et les privilèges à accorder à ce principal. Pour plus d'informations sur les octrois, consultez Afficher, octroyer et révoquer les privilèges.

Clé

Type

Description

principal

Chaîne

Le nom du principal auquel des privilèges seront accordés. Il peut s'agir d'un utilisateur, d'un groupe ou d'un Service Principal.

privileges

Séquence

Les privilèges à accorder à l'entité spécifiée. Les valeurs valides dépendent du type de ressource (par exemple, SELECT, MODIFY, CREATE, USAGE, READ_FILES, WRITE_FILES, EXECUTE, ALL_PRIVILEGES).

Clé

Type

Description

principal

Chaîne

Le nom du principal auquel des privilèges seront accordés. Il peut s'agir d'un utilisateur, d'un groupe ou d'un Service Principal.

privileges

Séquence

Les privilèges à accorder à l'entité spécifiée. Les valeurs valides dépendent du type de ressource (par exemple, SELECT, MODIFY, CREATE, USAGE, READ_FILES, WRITE_FILES, EXECUTE, ALL_PRIVILEGES).

Exemple

L'exemple suivant définit un schéma Unity Catalog avec des autorisations :

YAML
resources:
schemas:
my_schema:
name: test-schema
grants:
- principal: users
privileges:
- SELECT
- principal: my_team
privileges:
- MANAGE
catalog_name: main

cycle de vie

Type: Map

Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite.

Ajouté dans la version 0.268.0 de Databricks CLI.

Clé

Type

Description

prevent_destroy

Booléen

Paramètre de cycle de vie pour empêcher la destruction de la ressource.

Ajouté dans la version 0.268.0 de Databricks CLI.

started

Booléen

Paramètre de cycle de vie pour déployer la ressource en mode start. Pris en charge uniquement pour les applications, les clusters et les entrepôts SQL en mode de déploiement direct.

Ajouté dans Databricks CLI version 0.297.0 (applications)

Ajouté dans la version 1.1.0 de Databricks CLI (clusters)

Ajouté dans la version 1.2.0 de Databricks CLI (sql_warehouses)

Clé

Type

Description

prevent_destroy

Booléen

Paramètre de cycle de vie pour empêcher la destruction de la ressource.

Ajouté dans la version 0.268.0 de Databricks CLI.

started

Booléen

Paramètre de cycle de vie pour déployer la ressource en mode start. Pris en charge uniquement pour les applications, les clusters et les entrepôts SQL en mode de déploiement direct.

Ajouté dans Databricks CLI version 0.297.0 (applications)

Ajouté dans la version 1.1.0 de Databricks CLI (clusters)

Ajouté dans la version 1.2.0 de Databricks CLI (sql_warehouses)

Sur cette page