Ressources Declarative Automation Bundles
Les Bundles d’automatisation déclarative (anciennement appelés Databricks Asset Bundles) vous permettent de spécifier des informations sur les Ressources Databricks utilisées par le bundle dans le mappage resources de la configuration du bundle. Voir la référence des ressources.
Cette page fournit une référence de configuration pour tous les types de ressources pris en charge pour les bundles et fournit des détails et un exemple pour chaque type pris en charge. Pour des exemples supplémentaires, consultez Exemples de configuration de bundle.
Le schéma JSON des bundles utilisé pour valider la configuration YAML se trouve dans le repository GitHub du Databricks CLI.
Pour générer du YAML pour toute Ressource existante, utilisez la commande databricks bundle generate. Consultez databricks bundle generate.
Ressources prises en charge
Le tableau suivant répertorie les types de Ressources pris en charge pour les bundles (YAML et Python, le cas échéant). Certaines ressources peuvent être créées en les définissant dans un bundle et en déployant ce bundle, et certaines ressources ne peuvent être créées qu’en référençant un asset existant à inclure dans le bundle.
La configuration de la ressource définit un objet Databricks qui correspond à un objet Databricks REST API. Les champs de requête de création pris en charge de l'objet REST API, exprimés en YAML, sont les clés prises en charge de la ressource. Les liens vers la documentation de l'objet correspondant à chaque ressource se trouvent dans le tableau ci-dessous.
La commande databricks bundle validate retourne des avertissements si des propriétés de ressource inconnues sont trouvées dans les fichiers de configuration de bundle.
Ressource | Objet API REST correspondant | |
|---|---|---|
catalogue (Unity Catalog) | ||
emplacement externe (Unity Catalog) | ||
modèle_enregistré (Unity Catalog) | ||
schéma (Unity Catalog) | ||
volume (Unity Catalog) |
alerte
Type: Map
La ressource d'alerte définit une alerte SQL (v2).
Ajouté dans la version 0,279.0 de Databricks CLI
alerts:
<alert-name>:
<alert-field-name>: <alert-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Facultatif. Description personnalisée de l'alerte. Prend en charge le Template Mustache. Ajouté dans la version 0,279.0 de Databricks CLI |
| Chaîne | Facultatif. Résumé personnalisé de l'alerte. Prend en charge le Template Mustache. Ajouté dans la version 0,279.0 de Databricks CLI |
| Chaîne | Obligatoire. Le nom d'affichage de l'alerte, par exemple, Ajouté dans la version 0,279.0 de Databricks CLI |
| Carte | Obligatoire. La configuration d'évaluation pour l'alerte. Consultez alert.evaluation. Ajouté dans la version 0,279.0 de Databricks CLI |
| Chaîne | Le chemin d'accès au fichier local de l'asset d'alerte. Ajouté dans la version 0.282.0 de la CLI Databricks |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0,279.0 de Databricks CLI |
| Chaîne | Facultatif. Le chemin du workspace du dossier contenant l’alerte. Ne peut être défini qu’à la création et ne peut pas être mis à jour. Exemple : Ajouté dans la version 0,279.0 de Databricks CLI |
| Séquence | Les autorisations d'alerte. Afficher les autorisations. Ajouté dans la version 0,279.0 de Databricks CLI |
| Chaîne | Obligatoire. Texte de la query à exécuter, par exemple, Ajouté dans la version 0,279.0 de Databricks CLI |
| Carte | Facultatif. Spécifie l'identité qui sera utilisée pour exécuter l'alerte. Ce champ vous permet de configurer des alertes à exécuter en tant qu'utilisateur spécifique ou Service Principal. Voir run_as.
Ajouté dans la version 0,279.0 de Databricks CLI |
| Carte | Obligatoire. La configuration de la planification de l'alerte. Voir alert.schedule. Ajouté dans la version 0,279.0 de Databricks CLI |
| Chaîne | Obligatoire. ID du SQL Warehouse attaché à l'alerte, par exemple, Ajouté dans la version 0,279.0 de Databricks CLI |
alerte.évaluation
Type: Map
La configuration d'évaluation pour l'alerte.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'opérateur utilisé pour la comparaison dans l'évaluation de l'alerte. |
| Chaîne | L'état de l'alerte si le résultat est vide. Évitez de définir ce champ sur |
| Carte | L'utilisateur ou toute autre destination à notifier lorsque l'alerte est déclenchée. Consultez alert.evaluation.notification. |
| Carte | La colonne source du résultat à utiliser pour évaluer l'alerte. Voir alert.evaluation.source. |
| Carte | Le threshold à utiliser pour l'évaluation des alertes. Il peut s'agir d'une colonne ou d'une valeur. Voir alert.evaluation.threshold. |
alert.evaluation.notification
Type: Map
L'utilisateur ou toute autre destination à notifier lorsque l'alerte est Trigger.
Clé | Type | Description |
|---|---|---|
| Booléen | Facultatif. Faut-il notifier les abonnés à l'alerte lorsque l'alerte redevient normale. |
| Entier | Facultatif. Nombre de secondes qu'une alerte attend après avoir été déclenchée avant d'être autorisée à envoyer une autre notification. Si la valeur est |
| Séquence | Facultatif. Liste non ordonnée des abonnements aux notifications. Voir alert.evaluation.notification.subscriptions. |
alert.evaluation.notification.subscriptions
Type: Sequence
Une liste non ordonnée d'abonnements aux notifications.
Chaque élément de la liste est un AlertSubscription:
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID de la destination de la notification. |
| Chaîne | L'adresse e-mail de l'utilisateur à notifier. |
alert.evaluation.source
Type: Map
Colonne source du résultat à utiliser pour évaluer l'alerte.
Clé | Type | Description |
|---|---|---|
| Chaîne | La méthode d'agrégation à appliquer à la colonne source. Les valeurs valides sont |
| Chaîne | Le nom d'affichage de la colonne source. |
| Chaîne | Le nom de la colonne source du résultat de la query. |
alert.evaluation.threshold
Type: Map
Threshold à utiliser pour l'évaluation d'alerte, peut être une colonne ou une valeur.
Clé | Type | Description |
|---|---|---|
| Carte | Référence de colonne à utiliser comme threshold. Voir alert.evaluation.source. |
| Carte | Valeur littérale à utiliser comme threshold. Voir alert.evaluation.threshold.value. |
alert.evaluation.threshold.value
Type: Map
Valeur littérale à utiliser comme threshold. Spécifiez l’un des types de valeurs suivants.
Clé | Type | Description |
|---|---|---|
| Booléen | Facultatif. Valeur booléenne pour le threshold, par exemple, |
| Double | Facultatif. Valeur numérique pour le threshold, par exemple |
| Chaîne | Facultatif. Valeur de type string pour le threshold, par exemple, |
alert.schedule
Type: Map
La configuration du calendrier pour l'alerte.
Clé | Type | Description |
|---|---|---|
| Chaîne | Facultatif. Si ce planning est suspendu ou non. Valeurs valides : |
| Chaîne | Obligatoire. Une expression cron utilisant la syntaxe Quartz qui spécifie le planning de ce pipeline. Le format Quartz est décrit dans le format du planificateur Quartz. |
| Chaîne | Obligatoire. Un ID de fuseau horaire Java. La planification sera résolue en utilisant ce fuseau horaire. Ceci sera combiné avec le |
Exemples
La configuration d'exemple suivante définit une alerte avec une évaluation simple :
resources:
alerts:
my_alert:
display_name: my_alert
evaluation:
comparison_operator: EQUAL
source:
name: '1'
threshold:
value:
double_value: 2
query_text: select 2
schedule:
quartz_cron_schedule: '44 19 */1 * * ?'
timezone_id: Europe/Amsterdam
warehouse_id: 799f096837fzzzz4
La configuration d'exemple suivante définit une alerte avec des autorisations qui évalue à l'aide de l'agrégation et envoie des notifications :
resources:
alerts:
my_alert:
permissions:
- level: CAN_MANAGE
user_name: someone@example.com
custom_summary: 'My alert'
display_name: 'My alert'
evaluation:
comparison_operator: 'EQUAL'
notification:
notify_on_ok: false
retrigger_seconds: 1
source:
aggregation: 'MAX'
display: '1'
name: '1'
threshold:
value:
double_value: 2
query_text: 'select 2'
schedule:
pause_status: 'UNPAUSED'
quartz_cron_schedule: '44 19 */1 * * ?'
timezone_id: 'Europe/Amsterdam'
warehouse_id: 799f096837fzzzz4
application
Type: Map
La Ressource d'application définit une application Databricks. Pour des informations sur Databricks Apps, consultez Databricks Apps.
Pour ajouter une application, spécifiez les paramètres pour définir l'application, y compris le source_code_path requis.
Vous pouvez initialiser un paquet avec une application Streamlit Databricks à l'aide de la commande suivante :
databricks bundle init https://github.com/databricks/bundle-examples --template-dir contrib/templates/streamlit-app
Ajouté dans la version 0.239.0 de Databricks CLI
apps:
<app-name>:
<app-field-name>: <app-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | L'identifiant de politique budgétaire pour l'application. Ajouté dans la version 0.243.0 de Databricks CLI |
| Chaîne | La taille du compute pour l'application. Les valeurs valides sont Ajouté dans la version 0.273.0 de Databricks CLI |
| Carte | Commandes de configuration d’application et variables d’environnement. Voir app.config. Ajouté dans la version 0.283.0 de Databricks CLI. |
| Chaîne | La description de l’application. Ajouté dans la version 0.239.0 de Databricks CLI |
| Carte | La configuration du repository Git pour les déploiements d'applications. Lorsqu'ils sont spécifiés, les déploiements peuvent référencer du code à partir de ce repository en fournissant uniquement la référence Git (branch, tag ou commit). Consultez app.git_repository. Ajouté dans la version 0.283.0 de Databricks CLI. |
| Carte | La configuration de la source Git pour les déploiements d'applications. Spécifie quelle référence Git (Branch, balise ou commit) utiliser lors du déploiement de l'application. Utilisé en conjonction avec Ajouté à la version 0,290.0 de Databricks CLI |
| Carte | Le comportement de la ressource lorsqu'elle est déployée ou détruite. Consultez le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Le nom de l'application. Le nom ne doit contenir que des caractères alphanumériques minuscules et des tirets. Il doit être unique au sein du workspace. Ajouté dans la version 0.239.0 de Databricks CLI |
| Séquence | Les autorisations de l’application. Afficher les autorisations. Ajouté dans la version 0.239.0 de Databricks CLI |
| Séquence | Les ressources de compute de l'application. Consultez app.resources. Ajouté dans la version 0.239.0 de Databricks CLI |
| Chaîne | Le chemin local Ajouté dans la version 0.239.0 de Databricks CLI |
| Séquence | Les destinations d'exportation de télémétrie pour l'application. Consultez app.telemetry_export_destinations. Ajouté dans la version 0.294.0 du CLI Databricks. |
| Chaîne | L'ID de la politique d'utilisation Serverless à utiliser pour cette application. Ajouté dans la version 0.283.0 de Databricks CLI. |
| Séquence | Les périmètres d'API utilisateur. Ajouté dans la version 0.246.0 de la CLI Databricks |
app.config
Commandes de configuration d’application et variables d’environnement. Voir Configurer l'exécution de l'application Databricks avec app.yaml.
Clé | Type | Description |
|---|---|---|
| Séquence | Les commandes pour exécuter l'application, par exemple |
| Séquence | Une liste de paires Les variables d'environnement ne sont pas définies tant que l'application n'est pas start. |
app.git_repository
Type: Map
La configuration du repository Git spécifiant l'emplacement du repository.
Clé | Type | Description |
|---|---|---|
| Chaîne | Obligatoire. Fournisseur Git. Non sensible à la casse. Valeurs prises en charge : Ajouté dans la version 0.283.0 de Databricks CLI. |
| Chaîne | Obligatoire. URL du repository Git. Ajouté dans la version 0.283.0 de Databricks CLI. |
app.git_source
Type: Map
La configuration de la source Git pour les déploiements d'applications.
Clé | Type | Description |
|---|---|---|
| Chaîne | La Branch Git à extraire. |
| Chaîne | Le SHA du commit Git à extraire. |
| Chaîne | Chemin relatif du code source de l'application dans le repository Git. Si non spécifié, la racine du repository est utilisée. |
| Chaîne | Le tag Git à extraire. |
app.Ressources
Type: Sequence
Liste des ressources de compute pour l’application.
Chaque élément de la liste est un AppResource:
Clé | Type | Description |
|---|---|---|
| Carte | Nom et autorisations de l'application |
| Chaîne | La description de la ressource de l'application. |
| Carte | Les paramètres qui identifient la base de données de provisionnement Lakebase à utiliser. Voir app.Ressources.database. |
| Carte | Les paramètres qui identifient l’expérimentation MLflow à utiliser. Consultez app.resources.experiment. |
| Carte | Les paramètres qui identifient le Genie Agent à utiliser. Consultez app.resources.genie_space. |
| Carte | Les paramètres qui identifient la ressource de Job à utiliser. Voir app.Ressources.Job. |
| Chaîne | Le nom de la Ressource d'application. |
| Carte | Les paramètres qui identifient la base de données Lakebase Autoscaling à utiliser. Voir app.Ressources.postgres. |
| Carte | Les paramètres qui identifient la Ressource secrète Databricks à utiliser. Voir app.Ressources.secret. |
| Carte | Les paramètres qui identifient la ressource d'Endpoint de mise en service de modèle à utiliser. Voir app.Ressources.serving_endpoint. |
| Carte | Les paramètres qui identifient la Ressource SQL Warehouse à utiliser. Consultez app.Ressources.SQL Warehouse. |
| Carte | Les paramètres qui identifient l'élément sécurisable d'Unity Catalog à utiliser. Voir app.Ressources.uc_securable. |
app.Ressources.database
Type: Map
Les paramètres qui identifient la base de données Lakebase à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom de la base de données. |
| Chaîne | Le nom de l'instance de base de données. |
| Chaîne | Le niveau d'autorisation pour la base de données. Les valeurs valides sont |
app.Ressources.Experimentation
Type: Map
Les paramètres qui identifient l'Experimentation MLflow à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID de l'expérimentation MLflow. |
| Chaîne | Le niveau d'autorisation pour l'Experimentation. Les valeurs valides incluent |
app.Ressources.genie_space
Type: Map
Les paramètres qui identifient le Genie Agent à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du Genie Agent. |
| Chaîne | Le niveau d'autorisation pour l'espace. Les valeurs valides incluent |
| Chaîne | L'ID du Genie Agent, par exemple |
app.Ressources.Job
Type: Map
Les paramètres qui identifient la ressource de job à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID du Job. |
| Chaîne | Le niveau d'autorisation pour le Job. Les valeurs valides incluent |
app.Ressources.postgres
Type: Map
Les paramètres qui identifient la base de données Lakebase Autoscaling à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom de la Branch, par exemple, |
| Chaîne | Le nom de l'instance de la base de données, par exemple, |
| Chaîne | Le niveau d'autorisation pour la base de données. Les valeurs valides sont |
app.Ressources.secret
Type: Map
Les paramètres qui identifient la ressource de secret Databricks à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | La clé du secret pour accorder l'autorisation. |
| Chaîne | Le niveau d'autorisation pour le secret. Les valeurs valides incluent |
| Chaîne | Le nom du Secret Scope. |
app.Ressources.serving_endpoint
Type: Map
Les paramètres qui identifient la Ressource Endpoint de mise en service du modèle à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom de l'endpoint de service. |
| Chaîne | Le niveau d'autorisation pour l'endpoint de service. Les valeurs valides incluent |
app.resources.sql_warehouse
Type: Map
Les paramètres qui identifient le SQL Warehouse à utiliser.
Clé | Type | Description |
|---|---|---|
| Chaîne | L’ID du SQL Warehouse. |
| Chaîne | Le niveau d'autorisation pour le SQL Warehouse. Les valeurs valides incluent |
app.Ressources.uc_securable
Type: Map
Les paramètres qui identifient l'élément sécurisable d'Unity Catalog à utiliser. Les applications prennent en charge les volumes, les tables, les fonctions et les connexions en tant que ressources sécurisables.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le niveau d'autorisation pour l'élément sécurisable d'Unity Catalog. Les valeurs valides dépendent du
|
| Chaîne | Le nom complet de l'élément sécurisable Unity Catalog, au format |
| Chaîne | Le type de l'élément sécurisable Unity Catalog. Les valeurs valides sont |
Pour les volumes, les tables et les fonctions, le Service Principal de l'application a également besoin des privilèges USE CATALOG et USE SCHEMA sur le catalogue et le schéma parents. Databricks accorde automatiquement ces privilèges lorsque vous ajoutez l'élément sécurisable comme ressource d'application.
app.telemetry_export_destinations
Type: Sequence
Une liste des destinations d'exportation de télémétrie pour l'application.
Ajouté dans la version 0.294.0 du CLI Databricks.
Chaque élément de la liste est un AppTelemetryExportDestination:
Clé | Type | Description |
|---|---|---|
| Carte | Destinations Unity Catalog pour l’exportation de télémétrie OTEL. Ajouté dans la version 0.294.0 du CLI Databricks. |
Exemples
Pour un didacticiel qui explique la création d'un bundle définissant une application, consultez Gérer les applications Databricks à l'aide de Declarative Automation Bundles.
L'exemple suivant définit une application de base :
resources:
apps:
hello_world_app:
name: 'hello-world-app'
source_code_path: . # This assumes the app source code is at the root of the project.
description: 'A Databricks app'
L'exemple suivant crée une application nommée my_app qui gère un Job créé par le bundle. Pour l'exemple complet, consultez le repository GitHub bundle-examples.
resources:
jobs:
# Define a job in the bundle
hello_world:
name: hello_world
tasks:
- task_key: task
spark_python_task:
python_file: ../src/main.py
environment_key: default
environments:
- environment_key: default
spec:
environment_version: '2'
# Define an app that manages the job in the bundle
apps:
job_manager:
name: 'job_manager_app'
description: 'An app which manages a job created by this bundle'
# The location of the source code for the app
source_code_path: ../src/app
# The resources in the bundle which this app has access to. This binds the resource in the app with the bundle resource.
resources:
- name: 'app-job'
job:
id: ${resources.jobs.hello_world.id}
permission: 'CAN_MANAGE_RUN'
Le app.yaml correspondant définit la configuration pour l’exécution de l’application :
command:
- flask
- --app
- app
- run
- --debug
env:
- name: JOB_ID
valueFrom: 'app-job'
L'exemple suivant crée une application qui a accès à une expérimentation MLflow créée par le bundle :
resources:
experiments:
# Define an MLflow experiment in the bundle
my_experiment:
name: /Users/${workspace.current_user.userName}/my-app-experiment
apps:
my_ml_app:
name: 'my-ml-app'
description: 'An app with access to an MLflow experiment'
source_code_path: ./app
# Grant the app access to the MLflow experiment
resources:
- name: 'app-experiment'
experiment:
experiment_id: ${resources.experiments.my_experiment.id}
permission: 'CAN_MANAGE'
En variante, l'exemple suivant définit une application avec une configuration personnalisée définie dans la configuration du bundle :
resources:
apps:
my_app:
name: my_app
description: my_app_description
source_code_path: ./app
config:
command: ['flask', '--app', 'app', 'run']
env:
- name: MY_ENV_VAR
value: test_value
- name: ANOTHER_VAR
value: another_value
L'exemple suivant définit une application avec une Ressource de mise à l'échelle automatique Lakebase :
resources:
apps:
my_app:
name: my-app
source_code_path: .
resources:
- name: lakebase-db
postgres:
branch: projects/my-app/branches/production
database: projects/my-app/branches/production/databases/db-xxxx-yyyyyyyy
permission: CAN_CONNECT_AND_CREATE
catalogues
Type: Map
La ressource de catalogue vous permet de définir des catalogues (Unity Catalog) dans un bundle.
L'utilisation de bundles d'automatisation déclaratifs pour définir des catalogues n'est prise en charge que si vous utilisez le moteur de déploiement direct.
Ajouté dans la version 0.287.0 de la CLI Databricks
catalogs:
<catalog-name>:
<catalog-field-name>: <catalog-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Une description textuelle libre fournie par l'utilisateur pour le catalogue. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Le nom de la connexion à une source de données externe. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Séquence | Les octrois associés au catalogue. Voir l'octroi. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Carte | Contrôler le chiffrement CMK pour les données de catalogue gérées. Consulter catalog.managed_encryption_settings. Ajouté dans Databricks CLI version 0.298.0 |
| Chaîne | Obligatoire. Le nom du catalogue. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Objet | Une carte de propriétés clé-valeur attachée à l'élément sécurisable. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Objet | Une carte de propriétés clé-valeur attachée à l'élément sécurisable. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Le nom du fournisseur OpenSharing. Un catalogue OpenSharing est un catalogue basé sur un partage OpenSharing sur un serveur de partage distant. Consultez Qu'est-ce qu'OpenSharing ?. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Le nom du partage sous le fournisseur de partage. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | L'URL racine du stockage pour les tables gérées au sein du catalogue. Ajouté dans la version 0.287.0 de la CLI Databricks |
Exemple
# databricks.yml
bundle:
name: catalogs-example
engine: direct # catalogs require the direct deployment engine
resources:
catalogs:
my_catalog:
name: my_catalog
comment: 'Catalog created by Declarative Automation Bundles'
properties:
purpose: 'Testing'
grants:
- principal: someone@example.com
privileges:
- USE_CATALOG
- CREATE_SCHEMA
schemas:
my_schema:
name: my_schema
catalog_name: ${resources.catalogs.my_catalog.name}
comment: 'Schema in custom catalog'
catalog.managed_encryption_settings
Type: Map
Paramètres de chiffrement pour les données de catalogue gérées. Utilisé pour configurer une clé gérée par le client (CMK).
Ajouté dans Databricks CLI version 0.298.0
Clé | Type | Description |
|---|---|---|
| Carte | Paramètres Azure facultatifs — requis uniquement si une CMK Azure est utilisée. Ajouté dans Databricks CLI version 0.298.0 |
| Chaîne | L’URL AKV dans Azure, ou null sinon. Ajouté dans Databricks CLI version 0.298.0 |
| Chaîne | L'UUID CMK dans AWS et GCP, null sinon. Ajouté dans Databricks CLI version 0.298.0 |
clusters
Type: Map
La ressource de cluster définit un cluster.
clusters:
<cluster-name>:
<cluster-field-name>: <cluster-field-value>
Clé | Type | Description |
|---|---|---|
| Booléen | Lorsque défini sur vrai, les valeurs fixes et default de la politique seront utilisées pour les champs qui sont omis. Lorsqu'il est défini sur false, seules les valeurs fixes de la politique seront appliquées. |
| Carte | Paramètres nécessaires pour Monter en charge les clusters à la hausse et à la baisse en fonction de la charge. Voir autoscale. |
| Entier | Arrête automatiquement le cluster après qu'il est inactif pendant ce temps en minutes. Si non défini, ce cluster ne sera pas automatiquement arrêté. S'il est spécifié, le threshold doit être compris entre 10 et 10 000 minutes. Les utilisateurs peuvent également définir cette valeur sur 0 pour désactiver explicitement l'arrêt automatique. |
| Carte | Attributs liés aux clusters fonctionnant sur Amazon Web Services. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir aws_attributes. |
| Carte | Attributs liés aux clusters s’exécutant sur Microsoft Azure. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir azure_attributes. |
| Carte | La configuration pour la livraison des Logs Spark vers une destination de stockage à long terme. Voir cluster_log_conf. |
| Chaîne | Nom du cluster demandé par l’utilisateur. Cela n'a pas à être unique. S'il n'est pas spécifié lors de la création, le nom du cluster sera une chaîne vide. |
| Carte | Tags supplémentaires pour les ressources de cluster. Databricks taguera toutes les ressources de cluster (par exemple, les instances AWS et les volumes EBS) avec ces tags en plus de |
| Chaîne | Le modèle de gouvernance des données à utiliser lors de l'accès aux données depuis un cluster. Les valeurs valides incluent |
| Carte | L'image Docker personnalisée. Voir docker_image. |
| Chaîne | L'ID facultatif du pool d'instances auquel appartient le Driver du cluster. Le cluster de pool utilise le pool d'instances avec l'ID (instance*pool_id) si le pool de Driver n'est pas attribué. |
| Carte | Configuration de type de nœud flexible pour le nœud du driver. Voir cluster.driver_node_type_flexibility. Ajouté dans la version 0.285.0 de Databricks CLI |
| Chaîne | Le type de nœud du driver Spark. Ce champ est facultatif. S'il n'est pas défini, le type de nœud Driver est défini sur la valeur de |
| Booléen | Mise à l’échelle automatique du stockage local : lorsqu’elle est activée, ce cluster acquiert dynamiquement de l’espace disque supplémentaire lorsque ses workers Spark manquent d’espace disque. Cette fonctionnalité nécessite des autorisations AWS spécifiques pour fonctionner correctement. Reportez-vous au Guide d'utilisation pour plus de détails. |
| Booléen | Détermine s’il faut activer LUKS sur les disques locaux des VMs du cluster. |
| Carte | Attributs liés aux clusters exécutés sur Google Cloud Platform. Si non spécifié lors de la création du cluster, un ensemble de valeurs par default sera utilisé. Voir gcp_attributes. |
| Séquence | La configuration pour le stockage des scripts d'initialisation. N'importe quel nombre de destinations peut être spécifié. Les scripts sont exécutés séquentiellement dans l'ordre fourni. Consultez init_scripts. |
| Chaîne | L'ID facultatif du pool d'instances auquel le cluster appartient. |
| Booléen | Ce champ peut être utilisé uniquement lorsque Ajouté dans la version 0.237.0 de Databricks CLI. |
| Chaîne | Le type de compute décrit par cette spécification de compute. Ajouté dans la version 0.237.0 de Databricks CLI. |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Ce champ encode, par le biais d'une seule valeur, les Ressources disponibles pour chacun des nœuds Spark de ce cluster. Par exemple, les nœuds Spark peuvent être provisionnés et optimisés pour les charges de travail gourmandes en mémoire ou en compute. Une liste des types de nœuds disponibles peut être récupérée en utilisant l'API List node types. |
| Entier | Nombre de nœuds Worker que ce cluster devrait avoir. Un cluster a un Driver Spark et |
| Séquence | Les autorisations de cluster. Afficher les autorisations. |
| Chaîne | L'ID de la règle de cluster utilisée pour créer le cluster, le cas échéant. |
| Entier | Throughput de disque distant en octets par seconde. Ajouté dans la version 0.257.0 de la Databricks CLI |
| Chaîne | Détermine le moteur d'exécution du cluster, soit |
| Chaîne | Nom de l'utilisateur unique si data*security_mode est |
| Carte | Un objet contenant un ensemble de paires clé-valeur de configuration Spark optionnelles et spécifiées par l'utilisateur. Les utilisateurs peuvent également transmettre une chaîne d'options JVM supplémentaires au Driver et aux exécuteurs via |
| Carte | Un objet contenant un ensemble de paires clé-valeur de variables d'environnement facultatives et spécifiées par l'utilisateur. |
| Chaîne | La version Spark du cluster, par exemple : |
| Séquence | Contenu de la clé publique SSH qui sera ajouté à chaque nœud Spark dans ce cluster. Les clés privées correspondantes peuvent être utilisées pour se connecter avec le nom d'utilisateur |
| Entier | Taille totale initiale du disque distant en octets. Ajouté dans la version 0.257.0 de la Databricks CLI |
| Booléen | Ce champ ne peut être utilisé que lorsque Ajouté dans la version 0.237.0 de Databricks CLI. |
| Carte | Configuration de type de nœud flexible pour les nœuds worker. Voir cluster.worker_node_type_flexibility. Ajouté dans la version 0.285.0 de Databricks CLI |
| Carte | Attributs des clusters affichés pour les types de charge de travail des clusters. Voir workload_type. |
cluster.autoscale
Type: Map
Paramètres pour la mise à l'échelle automatique des clusters en fonction de la charge.
Clé | Type | Description |
|---|---|---|
| Entier | Le nombre minimal de Workers auquel le cluster peut réduire sa taille lorsqu’il est sous-utilisé. C’est également le nombre initial de Workers que le cluster aura après sa création. |
| Entier | Le nombre maximal de Worker auquel le cluster peut monter en charge en cas de surcharge. |
cluster.aws_attributes
Type: Map
Attributs relatifs aux clusters s'exécutant sur Amazon Web Services.
Clé | Type | Description |
|---|---|---|
| Chaîne | Identifiant de la zone de disponibilité/du centre de données dans laquelle le cluster réside. Cette chaîne de caractères aura une forme telle que |
| Chaîne | Type de disponibilité utilisé pour tous les nœuds suivants après les |
| Entier | Le prix maximum des instances ponctuelles AWS, en pourcentage du prix à la demande du type d'instance correspondant. |
| Chaîne | Les nœuds de ce cluster seront uniquement placés sur des instances AWS avec ce profil d'instance. |
| Entier | Les |
| Chaîne | Le type de volumes EBS qui seront lancés avec ce cluster. Les valeurs valides sont |
| Entier | Le nombre de volumes lancés pour chaque instance. |
| Entier | Taille de chaque volume EBS (en GiB) lancé pour chaque instance. |
| Entier | Le nombre d'IOPS par volume EBS gp3. |
| Entier | Le throughput par volume EBS gp3, en Mio par seconde. |
cluster.azure_attributes
Type: Map
Attributs liés aux clusters s’exécutant sur Microsoft Azure.
Clé | Type | Description |
|---|---|---|
| Entier | Les |
| Chaîne | Type de disponibilité utilisé pour tous les nœuds suivants après les |
| Nombre | Le prix maximal pour les instances spot Azure. Utilisez |
| Carte | La configuration de l'agent Azure Log Analytique. Consultez log_analytics_info. |
cluster.azure_attributes.log_analytics_info
Type: Map
La configuration de l'agent Azure Log analytique.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID du Workspace Azure Log analytique. |
| Chaîne | La clé primaire pour le Workspace Azure Log Analytics. |
cluster.gcp_attributes
Type: Map
Attributs liés aux clusters s'exécutant sur Google Cloud Platform.
Clé | Type | Description |
|---|---|---|
| Booléen | Faut-il utiliser des exécuteurs préemptables. Les exécuteurs préemptables sont des instances GCE préemptables qui peuvent être récupérées par GCE à tout moment. |
| Chaîne | Le compte de service Google à utiliser par les instances de VM de cluster Databricks. |
| Entier | Le nombre de SSD locaux à attacher à chaque nœud du cluster. La valeur par default est |
| Chaîne | Identifiant de la zone de disponibilité/centre de données dans lequel le cluster réside. |
| Chaîne | Type de disponibilité utilisé pour tous les nœuds. Les valeurs valides sont |
| Entier | La taille du disque de démarrage en Go. Les valeurs varient généralement de 100 à 1000. |
cluster.cluster_log_conf
La configuration pour la livraison des Logs Spark vers une destination de stockage à long terme.
cluster.cluster_log_conf.dbfs
Type: Map
Emplacement DBFS pour la livraison des logs de cluster.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin DBFS pour la livraison des Logs de cluster (par exemple, |
cluster.cluster_log_conf.s3
Type: Map
Emplacement S3 pour la livraison des Logs de clusters.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'URI S3 pour la livraison des logs du cluster (par exemple, |
| Chaîne | La région AWS du compartiment S3. |
| Chaîne | L'URL de l'Endpoint S3 (facultatif). |
| Booléen | Faut-il activer le chiffrement pour les Logs de clusters ? |
| Chaîne | Le type de chiffrement. Les valeurs valides incluent |
| Chaîne | L'ARN de la clé KMS pour le chiffrement (lors de l'utilisation de |
| Chaîne | L'ACL prédéfinie à appliquer aux Logs de clusters. |
cluster.cluster_log_conf.volumes
Type: Map
Emplacement des volumes pour la livraison des logs de cluster.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin de volume pour la livraison de Logs de cluster (par exemple, |
cluster.docker_image
Type: Map
La configuration de l'image Docker personnalisée.
Clé | Type | Description |
|---|---|---|
| Chaîne | URL de l'image Docker. |
| Carte | Authentification de base pour le repository Docker. Voir basic_auth. |
cluster.docker_image.basic_auth
Type: Map
Authentification de base pour le repository Docker.
Clé | Type | Description |
|---|---|---|
| Chaîne | Nom d'utilisateur pour l'authentification au registre Docker. |
| Chaîne | Le mot de passe pour l'authentification du registre Docker. |
cluster.init_scripts
Type: Map
La configuration pour le stockage des scripts d'initialisation. Au moins un type d'emplacement doit être spécifié.
Clé | Type | Description |
|---|---|---|
| Carte | Emplacement DBFS du script d'initialisation. Consultez DBFS. |
| Carte | Emplacement du workspace du script d'initialisation. See Workspace. |
| Carte | Emplacement S3 du script d'initialisation. Voir s3. |
| Carte | Emplacement ABFSS du script d'initialisation. Consultez abfss. |
| Carte | Emplacement GCS de script d'initialisation. See GCS. |
| Carte | Emplacement des volumes Unity Catalog du script d'initialisation. Voir volumes. |
cluster.init_scripts.dbfs
Type: Map
Emplacement DBFS du script d’initialisation.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin DBFS du script d'initialisation. |
cluster.init_scripts.workspace
Type: Map
Emplacement du script d'initialisation du Workspace.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin d'accès du Workspace du script d'initialisation. |
cluster.init_scripts.s3
Type: Map
Emplacement S3 du script d'initialisation.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'URI S3 du script d'initialisation. |
| Chaîne | La région AWS du compartiment S3. |
| Chaîne | L'URL de l'Endpoint S3 (facultatif). |
cluster.init_scripts.abfss
Type: Map
Emplacement ABFSS du script d'initialisation.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin ABFSS du script d'initialisation. |
cluster.init_scripts.gcs
Type: Map
Emplacement GCS du script d'initialisation.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin GCS du script d'initialisation. |
cluster.init_scripts.volumes
Type: Map
Emplacement du script d'initialisation des volumes.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin d'accès des volumes Unity Catalog du script d'initialisation. |
cluster.driver_node_type_flexibility
Type: Map
Configuration du type de nœud flexible pour le nœud du driver.
Ajouté dans la version 0.285.0 de Databricks CLI
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'ID de type de nœud à utiliser comme fallbacks lorsque le type de nœud primaire n'est pas disponible. Ajouté dans la version 0.285.0 de Databricks CLI |
cluster.worker_node_type_flexibility
Type: Map
Configuration de type de nœud flexible pour les nœuds Worker.
Ajouté dans la version 0.285.0 de Databricks CLI
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'ID de type de nœud à utiliser comme fallbacks lorsque le type de nœud primaire n'est pas disponible. Ajouté dans la version 0.285.0 de Databricks CLI |
clusters.type_de_charge_de_travail
Type: Map
Attributs de cluster affichant les types de charges de travail de cluster.
Clé | Type | Description |
|---|---|---|
| Carte | Définit le type de clients qui peuvent utiliser le cluster. Voir clients. |
cluster.workload_type.clients
Type: Map
Le type de clients pour cette charge de travail compute.
Clé | Type | Description |
|---|---|---|
| Booléen | Si le cluster peut exécuter des jobs. |
| Booléen | Si le cluster peut exécuter des notebooks. |
Exemples
L'exemple suivant crée un cluster dédié (mono-utilisateur) pour l'utilisateur actuel avec Databricks Runtime 15.4 LTS et une politique de cluster :
resources:
clusters:
my_cluster:
num_workers: 0
node_type_id: 'i3.xlarge'
driver_node_type_id: 'i3.xlarge'
spark_version: '15.4.x-scala2.12'
spark_conf:
'spark.executor.memory': '2g'
autotermination_minutes: 60
enable_elastic_disk: true
single_user_name: ${workspace.current_user.userName}
policy_id: '000128DB309672CA'
enable_local_disk_encryption: false
data_security_mode: SINGLE_USER
runtime_engine: STANDARD
Cet exemple crée un cluster simple my_cluster et le définit comme le cluster à utiliser pour exécuter le Notebook dans my_job:
bundle:
name: clusters
resources:
clusters:
my_cluster:
num_workers: 2
node_type_id: 'i3.xlarge'
autoscale:
min_workers: 2
max_workers: 7
spark_version: '13.3.x-scala2.12'
spark_conf:
'spark.executor.memory': '2g'
jobs:
my_job:
tasks:
- task_key: test_task
notebook_task:
notebook_path: './src/my_notebook.py'
existing_cluster_id: ${resources.clusters.my_cluster.id}
tableau de bord
Type: Map
La ressource de tableau de bord vous permet de gérer les tableaux de bord AI/BI dans un bundle. Pour plus d'information sur les tableaux de bord AI/BI, consultez Tableaux de bord.
Si vous avez déployé un bundle contenant un tableau de bord à partir de votre environnement local et que vous utilisez ensuite l'interface utilisateur pour modifier ce tableau de bord, les modifications apportées via l'interface utilisateur ne sont pas appliquées au fichier JSON du tableau de bord dans le bundle local, sauf si vous le mettez à jour explicitement à l'aide de bundle generate. Vous pouvez utiliser l'option --watch pour interroger et récupérer en continu les modifications apportées au tableau de bord. Voir databricks bundle generate.
De plus, si vous tentez de déployer un bundle depuis votre environnement local contenant un fichier JSON de tableau de bord différent de celui du workspace distant, une erreur se produira. Pour forcer le déploiement et écraser le tableau de bord du workspace distant avec le tableau de bord local, utilisez l'option --force. Voir databricks bundle deploy.
Ajouté dans la version 0.232.0 de la CLI Databricks
Lors de l'utilisation de bundles d'automatisation déclaratifs avec le support Git des tableaux de bord, empêchez la génération de tableaux de bord en double en ajoutant le mappage de synchronisation pour exclure les tableaux de bord de la synchronisation en tant que fichiers :
sync:
exclude:
- src/*.lvdash.json
dashboards:
<dashboard-name>:
<dashboard-field-name>: <dashboard-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | La valeur de catalogue par default utilisée par tous les dataset du tableau de bord si elle n’est pas autrement spécifiée dans la query. Pour un exemple de configuration qui définit ce champ, consultez Paramétrage du catalogue et du schéma du tableau de bord. Ajouté dans la version 0.283.0 de Databricks CLI. |
| Chaîne | La valeur de schéma default utilisée par tous les datasets du tableau de bord s’il n’est pas spécifié autrement dans la query. Pour un exemple de configuration qui définit ce champ, consultez Paramétrage du catalogue et du schéma du tableau de bord. Ajouté dans la version 0.283.0 de Databricks CLI. |
| Chaîne | Le nom d'affichage du tableau de bord. Ajouté dans la version 0.232.0 de la CLI Databricks |
| Booléen | Si les identifiants de l’identité de déploiement du bundle sont utilisés pour exécuter des requêtes pour tous les visualiseurs de tableau de bord. Si elle est définie sur Ajouté dans la version 0.232.0 de la CLI Databricks |
| Chaîne | L'etag du tableau de bord. Peut être fourni en option lors des mises à jour pour s'assurer que le tableau de bord n'a pas été modifié depuis la dernière lecture. Ajouté dans la version 0,234,0 de la CLI Databricks. |
| Chaîne | Le chemin local de l'asset du tableau de bord, y compris le nom du fichier. Les tableaux de bord exportés ont toujours l'extension de fichier Ajouté dans la version 0.232.0 de la CLI Databricks |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. |
| Chaîne | Le chemin du workspace du dossier contenant le tableau de bord. Inclut une barre oblique de début et aucune barre oblique de fin. Ajouté dans la version 0.232.0 de la CLI Databricks |
| Chaîne | Le chemin workspace de l'asset du tableau de bord, y compris le nom de l'asset. Ajouté dans la version 0,234,0 de la CLI Databricks. |
| Séquence | Les autorisations du tableau de bord. Afficher les autorisations. Ajouté dans la version 0.232.0 de la CLI Databricks |
| Tout | Le contenu du tableau de bord sous forme de chaîne sérialisée. Ajouté dans la version 0.232.0 de la CLI Databricks |
| Chaîne | L'ID du warehouse utilisé pour exécuter le tableau de bord. Ajouté dans la version 0.232.0 de la CLI Databricks |
Exemple
L'exemple suivant inclut et déploie l'exemple de tableau de bord NYC Taxi Trip analyse vers l'espace de travail Databricks.
resources:
dashboards:
nyc_taxi_trip_analysis:
display_name: 'NYC Taxi Trip Analysis'
file_path: ../src/nyc_taxi_trip_analysis.lvdash.json
warehouse_id: ${var.warehouse_id}
database_catalog
Type: Map
La ressource de catalogue de base de données vous permet de définir des catalogues de base de données qui correspondent à des instances de base de données dans un bundle. Un catalogue de base de données est une base de données Lakebase qui est enregistrée en tant que catalogue Unity Catalog.
Pour obtenir des informations sur les catalogues de bases de données, consultez Créer un catalogue.
Ajouté dans la version 0.265.0 de Databricks CLI
database_catalogs:
<database_catalog-name>:
<database_catalog-field-name>: <database_catalog-field-value>
Clé | Type | Description |
|---|---|---|
| Booléen | S'il faut créer la base de données si elle n'existe pas. Ajouté dans la version 0.265.0 de Databricks CLI |
| Chaîne | Le nom de l'instance hébergeant la base de données. Ajouté dans la version 0.265.0 de Databricks CLI |
| Chaîne | Le nom de la base de données (dans une instance) associée au catalogue. Ajouté dans la version 0.265.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource, y compris le comportement de la ressource lorsqu'elle est déployée ou détruite. Consultez le cycle de vie. Ajouté dans la version 0.265.0 de Databricks CLI |
| Chaîne | Le nom du catalogue dans Unity Catalog. Ajouté dans la version 0.265.0 de Databricks CLI |
Exemple
L'exemple suivant définit une instance de base de données avec un catalogue de bases de données correspondant :
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: ${resources.database_instances.my_instance.name}
name: example_catalog
database_name: my_database
create_database_if_not_exists: true
database_instance
Type: Map
La ressource d'instance de base de données vous permet de définir des instances de base de données dans un bundle. Une instance de base de données Lakebase gère les ressources de stockage et de compute et fournit les Endpoints auxquels les utilisateurs se connectent.
De nouvelles instances de base de données créées par la ressource database_instances sont désormais créées en tant que projets Lakebase Autoscaling. Consulter Autoscaling default pour plus de détails. Pour les nouveaux travaux Lakebase, nous recommandons d'utiliser la ressource postgres_projects à la place.
Lorsque vous déployez un bundle avec une instance de base de données, l'instance commence immédiatement à s'exécuter et est soumise aux Tarifs. Voir Tarifs Lakebase.
Pour plus d'informations sur les instances de base de données, consultez Lakebase provisionnée.
Ajouté dans la version 0.265.0 de Databricks CLI
database_instances:
<database_instance-name>:
<database_instance-field-name>: <database_instance-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | La SKU de l'instance. Les valeurs valides sont Ajouté dans la version 0.265.0 de Databricks CLI |
| Séquence | Une liste de paires clé-valeur qui spécifient des balises personnalisées associées à l'instance. Ajouté dans la version 0.273.0 de Databricks CLI |
| Booléen | Si la connexion par mot de passe native PG est activée pour l'instance. La valeur default est Ajouté dans Databricks CLI version 0.267.0 |
| Booléen | Permet d'activer les secondaires pour gérer le trafic en lecture seule. La valeur default est Ajouté dans la version 0.265.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Le nom de l’instance. Il s'agit de l'identifiant unique de l'instance. Ajouté dans la version 0.265.0 de Databricks CLI |
| Entier | Le nombre de nœuds dans l'instance, composé d'1 nœud primaire et de 0 ou plusieurs nœuds secondaires. default to 1 primary and 0 secondaries. Ajouté dans la version 0.265.0 de Databricks CLI |
| Carte | La référence de l'instance parente. Ceci est disponible uniquement si l’instance est une instance enfant. Voir instance parente. Ajouté dans la version 0.265.0 de Databricks CLI |
| Séquence | Les autorisations de l'instance de base de données. Afficher les autorisations. Ajouté dans la version 0.265.0 de Databricks CLI |
| Entier | La fenêtre de rétention pour l'instance. Il s'agit de la fenêtre de temps en jours pendant laquelle les données historiques sont conservées. La valeur par default est de 7 jours. Les valeurs valides sont de 2 à 35 jours. Ajouté dans la version 0.265.0 de Databricks CLI |
| Booléen | Si l'instance est arrêtée. Ajouté dans la version 0.265.0 de Databricks CLI |
| Chaîne | La politique d’utilisation serverless souhaitée à associer à l’instance. Ajouté dans la version 0.273.0 de Databricks CLI |
database_instance.parent_instance_ref
Type: Map
La référence de l'instance parente. Ceci n'est disponible que si l'instance est une instance enfant.
Clé | Type | Description |
|---|---|---|
| Chaîne | Heure de Branch de l'instance de base de données ref. Pour une instance de référence parente, il s'agit du moment sur l'instance parente à partir duquel l'instance a été créée. Pour une instance de référence enfant, il s'agit du point dans le temps sur l'instance à partir duquel l'instance enfant a été créée. |
| Chaîne | WAL LSN spécifié par l'utilisateur de l'instance de base de données de référence. |
| Chaîne | Nom de l'instance de la base de données de référence. |
Exemple
L'exemple suivant définit une instance de base de données avec un catalogue de base de données correspondant :
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: ${resources.database_instances.my_instance.name}
name: example_catalog
database_name: my_database
create_database_if_not_exists: true
Pour un exemple de bundle qui montre comment définir une instance de base de données et le catalogue de base de données correspondant, consultez le repository GitHub bundle-examples.
Experimentation
Type: Map
La ressource d'expérimentation vous permet de définir des expérimentations MLflow dans un bundle. Pour plus d'informations sur les expérimentations MLflow, consultez Organiser les exécutions d'entraînement avec les expérimentations MLflow.
experiments:
<experiment-name>:
<experiment-field-name>: <experiment-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | L'emplacement où les artefacts pour l'expérimentation sont stockés. L'emplacement doit inclure un schéma URI tel que |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Le nom convivial qui identifie l'expérimentation. Un nom d'Experimentation doit être un chemin absolu dans le workspace Databricks, par exemple |
| Séquence | Les autorisations de l'expérience. Afficher les autorisations. |
| Séquence | Paires clé-valeur de métadonnées supplémentaires. Voir les tags. Pour définir une description pour l’expérimentation, utilisez le tag |
Exemple
L'exemple suivant définit une experimentation que tous les utilisateurs peuvent consulter :
resources:
experiments:
experiment:
name: /Workspace/Users/someone@example.com/my_experiment
permissions:
- level: CAN_READ
group_name: users
tags:
- key: mlflow.note.content
value: MLflow experiment used to track runs
external_location (Unity Catalog)
Type: Map
La ressource d'emplacement externe vous permet de définir des emplacements externes (Unity Catalog) dans un bundle.
L’utilisation de Declarative Automation Bundles pour définir des emplacements externes n’est prise en charge que si vous utilisez le moteur de déploiement direct.
Ajouté dans la CLI Databricks version 0.289.0
external_locations:
<external-location-name>:
<external-location-field-name>: <external-location-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Description textuelle de forme libre fournie par l'utilisateur de l'emplacement externe. Ajouté dans la CLI Databricks version 0.289.0 |
| Chaîne | Obligatoire. Le nom de l'identifiant de stockage utilisé avec cet emplacement. Ajouté dans la CLI Databricks version 0.289.0 |
| Booléen | Faut-il activer les événements de fichiers sur cet emplacement externe. La valeur par défaut est Ajouté dans la CLI Databricks version 0.289.0 |
| Carte | Options de chiffrement qui s'appliquent aux clients se connectant au stockage cloud. Voir détails de cryptage de l'emplacement externe. Ajouté dans la CLI Databricks version 0.289.0 |
| Booléen | Indique si le mode fallback est activé pour cet emplacement externe. Lorsque le mode fallback est activé, l'accès à l'emplacement est rétabli via les identifiants du cluster si les identifiants Unity Catalog ne sont pas suffisants. Ajouté dans la CLI Databricks version 0.289.0 |
| Carte | Paramètres de la file d'attente d'événements de fichier pour cet emplacement externe. Si Ajouté dans la CLI Databricks version 0.289.0 |
| Séquence | Les autorisations associées à l'emplacement externe. Voir l'octroi. Ajouté dans la CLI Databricks version 0.289.0 |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la CLI Databricks version 0.289.0 |
| Chaîne | Obligatoire. Le nom de l'emplacement externe. Ajouté dans la CLI Databricks version 0.289.0 |
| Booléen | Indique si l'emplacement externe est en lecture seule. Ajouté dans la CLI Databricks version 0.289.0 |
| Booléen | Ignore la validation de l'identifiant de stockage associé à l'emplacement externe. Ajouté dans la CLI Databricks version 0.289.0 |
| Chaîne | Obligatoire. URL du chemin de l'emplacement externe. Ajouté dans la CLI Databricks version 0.289.0 |
external_location.encryption_details
Type: Map
Options de chiffrement qui s'appliquent aux clients se connectant au stockage cloud.
Clé | Type | Description |
|---|---|---|
| Carte | Propriétés de chiffrement côté serveur pour les clients communiquant avec Amazon S3. |
external_location.file_event_queue
Type: Map
Paramètres de la file d'attente d'événements de fichier pour cet emplacement externe.
Clé | Type | Description |
|---|---|---|
| Carte | Paramètres de stockage de file d'attente Azure gérés. |
| Carte | Paramètres gérés de Google Cloud Pub/Sub. |
| Carte | Paramètres Amazon SQS gérés. |
| Carte | Paramètres de stockage de file d'attente Azure fournis par l'utilisateur. |
| Carte | Paramètres Google Cloud Pub/Sub fournis par l'utilisateur. |
| Carte | Paramètres Amazon SQS fournis par l'utilisateur. |
Exemple
# databricks.yml
bundle:
name: external-locations-example
engine: direct # External locations require the direct deployment engine
resources:
external_locations:
my_external_location:
name: my_external_location
url: 's3://my-bucket/my-path'
credential_name: my_storage_credential
comment: 'External location created by Databricks Asset Bundles'
grants:
- principal: someone@example.com
privileges:
- CREATE_EXTERNAL_TABLE
- READ_FILES
genie_space
Type: Map
La ressource d'agent Genie vous permet de définir des agents Genie dans un pack. Pour plus d’informations sur les agents Genie, consultez Agents Genie.
L'utilisation des paquets d'automatisation déclaratifs pour définir les agents Genie n'est prise en charge que si vous utilisez le moteur de déploiement direct.
Ajouté à la version 1,3,0 de Databricks CLI
genie_spaces:
<genie_space-name>:
<genie_space-field-name>: <genie_space-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | La description de l'agent Genie. Ajouté à la version 1,3,0 de Databricks CLI |
| Chaîne | Le chemin d'accès à un fichier local (par exemple, |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté à la version 1,3,0 de Databricks CLI |
| Chaîne | Le chemin du dossier parent où l'agent Genie sera enregistré. Ajouté à la version 1,3,0 de Databricks CLI |
| Séquence | Les autorisations de l'agent Genie. Afficher les autorisations. Ajouté à la version 1,3,0 de Databricks CLI |
| Chaîne | Obligatoire. Le contenu du Genie Agent sous forme de chaîne sérialisée. Ce champ fournit la structure de la chaîne JSON qui représente le Layout et les composants de l'espace. Si Ajouté à la version 1,3,0 de Databricks CLI |
| Chaîne | Une substitution de titre facultative pour l’agent Genie. Ajouté à la version 1,3,0 de Databricks CLI |
| Chaîne | Obligatoire. L'ID du SQL Warehouse à associer au nouvel espace. Ajouté à la version 1,3,0 de Databricks CLI |
Exemples
L'exemple suivant définit une ressource d'agent Genie :
# databricks.yml
bundle:
name: nyc-taxi-genie
engine: direct # genie_spaces require the direct deployment engine
resources:
genie_spaces:
nyc_taxi_genie:
title: 'NYC Taxi Trip Analysis'
description: 'Ask questions about NYC taxi trip data in natural language'
warehouse_id: <warehouse-id>
file_path: ./nyc_taxi_genie.geniespace.json
permissions:
- level: CAN_RUN
group_name: users
Le fichier nyc_taxi_genie.geniespace.json correspondant contient la définition sérialisée de l'espace, y compris ses sources de données, instructions et exemples de questions. Il peut également être spécifié en YAML dans la clé serialized_space à la place.
// nyc_taxi_genie.geniespace.json
{
"version": 2,
"config": {
"sample_questions": [
{
"id": "11111111111111111111111111111111",
"question": ["What is the average fare per trip?"]
}
]
},
"data_sources": {
"tables": [
{
"identifier": "samples.nyctaxi.trips",
"column_configs": [
{ "column_name": "fare_amount" },
{ "column_name": "pickup_zip" },
{ "column_name": "tpep_pickup_datetime" },
{ "column_name": "trip_distance" }
]
}
]
},
"instructions": {
"text_instructions": [
{
"id": "22222222222222222222222222222222",
"content": ["Fare amounts are in USD. When asked about revenue, use SUM(fare_amount)."]
}
]
}
}
Job
Type: Map
Les tâches sont prises en charge en Python pour les Declarative Automation Bundles. Consultez databricks.bundles.jobs.
La ressource Job vous permet de définir des Jobs et leurs tâches correspondantes dans votre bundle.
Pour des informations sur les tâches, consultez Lakeflow Jobs. Pour un tutoriel qui utilise un template de Declarative Automation Bundles pour créer un job, voir Développer un job avec Declarative Automation Bundles.
jobs:
<job-name>:
<job-field-name>: <job-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | L'identifiant de la politique budgétaire spécifiée par l'utilisateur à utiliser pour ce Job. Si elle n'est pas spécifiée, une politique budgétaire default peut être appliquée lors de la création ou de la modification du Job. Consultez Ajouté dans la version 0,231,0 de la CLI Databricks. |
| Carte | Une propriété continue facultative pour ce Job. La propriété continue garantira qu’il y a toujours une exécution en cours. Un seul de |
| Carte | Informations de déploiement pour les Jobs gérés par des sources externes. Voir déploiement. |
| Chaîne | Une description facultative pour le job. La longueur maximale est de 27 700 caractères en encodage UTF-8. |
| Carte | Un ensemble facultatif d'adresses e-mail qui est averti lorsque des exécutions de ce Job commencent ou se terminent, ainsi que lorsque ce Job est supprimé. Consultez email_notifications. |
| Séquence | Une liste de spécifications d'environnement d'exécution de tâche qui peuvent être référencées par les tâches serverless de ce job. Un environnement est requis pour les tâches serverless. Pour les tâches Notebook serverless, l'environnement est accessible dans le panneau d'environnement du Notebook. Pour les autres tâches serverless, l'environnement de la tâche doit être spécifié à l'aide de environment_key dans les paramètres de la tâche. Consultez les environnements. |
| Chaîne | Obsolète. Le format du Job. |
| Carte | Une spécification facultative pour un repository Git distant contenant le code source utilisé par les tâches. Voir Job.git_source. Important : Le champ Au lieu de cela, clonez le repository localement et configurez votre projet de bundle dans ce repository, de sorte que la source des tâches soit le workspace. |
| Carte | Un ensemble facultatif de règles d'intégrité pouvant être définies pour ce Job. Voir l'intégrité. |
| Séquence | Liste des spécifications de clusters Job pouvant être partagées et réutilisées par les tâches de ce Job. Voir les job_clusters. |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Entier | Un nombre maximal facultatif autorisé d'exécutions simultanées du job. Définissez cette valeur si vous souhaitez pouvoir exécuter plusieurs exécutions du même job simultanément. |
| Chaîne | Un nom facultatif pour le Job. La longueur maximale est de 4096 octets en encodage UTF-8. |
| Carte | Paramètres de notification facultatifs qui sont utilisés lors de l'envoi de notifications à chacun des |
| Séquence | Définitions des paramètres au niveau du job. Voir les paramètres de job. |
| Chaîne | Définit le niveau de performance ou de rentabilité de l'exécution sur serverless. Ajouté dans la version 0.241.0 de Databricks CLI |
| Séquence | Les autorisations du Job. Afficher les autorisations. |
| Carte | Les paramètres de la file d'attente du job. Voir la file d'attente. |
| Carte | Paramètre en écriture seule. Spécifie l'utilisateur ou le Service Principal sous lequel le Job s'exécute. S'il n'est pas spécifié, le job est exécuté par l'utilisateur qui l'a créé. Soit |
| Carte | Un planning périodique facultatif pour ce job. Le comportement default est que le Job ne s'exécute que lorsqu'il est Trigger en cliquant sur « Run Now » dans l'interface utilisateur des Jobs ou en envoyant une requête API à |
| Carte | Une carte des tags associés au job. Celles-ci sont transmises au cluster en tant que Cluster Tags pour les clusters de jobs, et sont soumises aux mêmes limitations que les Cluster Tags. Un maximum de 25 tags peut être ajouté au job. |
| Séquence | Une liste de spécifications de tâches à exécuter par ce Job. Consultez Ajouter des tâches aux jobs dans les Declarative Automation Bundles. Ajouté dans la version 0.237.0 de Databricks CLI. |
| Entier | Un délai d'expiration facultatif appliqué à chaque exécution de ce Job. Une valeur de |
| Carte | Une configuration pour Trigger une exécution lorsque certaines conditions sont remplies. See Trigger. |
| Chaîne | L'ID de la politique d'utilisation serverless à utiliser pour ce job. Ajouté dans la version 0.273.0 de Databricks CLI |
| Carte | Une collection d'ID de notification système à notifier lorsque les exécutions de ce Job commencent ou se terminent. Voir webhook_notifications. |
Job.continuous
Type: Map
Configuration pour l'exécution continue des jobs.
Clé | Type | Description |
|---|---|---|
| Chaîne | Que le Job continu soit en pause ou non. Valeurs valides : |
| Chaîne | Indiquez comment le job continu applique les nouvelles tentatives au niveau de la tâche. Les valeurs valides sont |
déploiement du job
Type: Map
Informations de déploiement pour les Jobs gérés par des sources externes.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le type de déploiement. Par exemple, |
| Chaîne | Le chemin d'accès au fichier de métadonnées pour le déploiement. |
notifications_par_e-mail.Job
Type: Map
Paramètres de notification par e-mail pour les exécutions de jobs.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'adresses e-mail à notifier lorsqu'une exécution start. |
| Séquence | Liste d'adresses e-mail à notifier lorsqu'une exécution aboutit. |
| Séquence | Une liste d'adresses e-mail à notifier lorsqu'une exécution échoue. |
| Séquence | Liste d'adresses e-mail à notifier lorsqu'une durée d'exécution dépasse le threshold d'avertissement. |
| Booléen | Faut-il ignorer l'envoi d'alertes pour les exécutions ignorées. |
| Séquence | Une liste d'adresses e-mail à notifier lorsque les seuils de backlog de streaming sont dépassés pour tout Stream. Les thresholds de backlog de streaming peuvent être définis dans le champ |
Job.environnements
Type: Sequence
Liste des spécifications d'environnement d'exécution de tâche qui peuvent être référencées par des tâches serverless d'un job.
Chaque élément de la liste est un JobEnvironment:
Clé | Type | Description |
|---|---|---|
| Chaîne | La clé d'un environnement. Il doit être unique au sein d'un job. |
| Carte | L’entité qui représente un environnement serverless. Voir job.environments.spec. |
job.environments.spec
Type: Map
L'entité qui représente un environnement serverless.
Clé | Type | Description |
|---|---|---|
| Chaîne | Obsolète. La version client. |
| Séquence | Liste des dépendances pip, telles que prises en charge par la version de pip dans cet environnement. |
| Chaîne | Obligatoire. Version de l’environnement utilisée par l’environnement. Chaque version est livrée avec une version spécifique de Python et un ensemble de packages Python. La version est une chaîne, composée d'un entier. |
job.git_source
Type: Map
Configuration du repository Git pour le code source des jobs.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom de la Branch à extraire et à utiliser par ce Job. Ce champ ne peut pas être spécifié en conjonction avec |
| Chaîne | commit à extraire et à utiliser pour cette job. Ce champ ne peut pas être spécifié en conjonction avec |
| Chaîne | Identifiant unique du service utilisé pour héberger le repository Git. La valeur est insensible à la casse. Les valeurs valides sont |
| Carte | État en lecture seule du repository distant au moment de l'exécution du job. Ce champ n'est inclus que dans les exécutions de job. Voir git_snapshot. |
| Chaîne | Nom du tag à extraire et à utiliser par ce job. Ce champ ne peut pas être spécifié en conjonction avec |
| Chaîne | URL du repository à cloner par ce Job. |
| Carte | Configuration de l'extraction éparse pour le repository Git. Consultez job.git_source.sparse_checkout. Ajouté à la version 0,290.0 de Databricks CLI |
job.git_source.sparse_checkout
Type: Map
Configuration de récupération fragmentée pour le repository Git.
Ajouté à la version 0,290.0 de Databricks CLI
Clé | Type | Description |
|---|---|---|
| Séquence | Liste des modèles à inclure pour la récupération fragmentée. Ajouté à la version 0,290.0 de Databricks CLI |
job.git_source.git_snapshot
Type: Map
Instantané des informations de commit en lecture seule.
Clé | Type | Description |
|---|---|---|
| Chaîne | Commit qui a été utilisé pour l'exécution. Si |
job.health
Type: Map
Configuration de monitoring de l'état pour le Job.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste de règles de santé du Job. Chaque règle contient un |
job.health.rules
Type: Sequence
Une liste de règles de santé du Job.
Chaque élément de la liste est un JobHealthRule:
Clé | Type | Description |
|---|---|---|
| Chaîne | Spécifie la métrique de santé qui est évaluée pour une règle de santé particulière.
|
| Chaîne | Spécifie l'opérateur utilisé pour comparer la valeur de la métrique de santé avec le threshold spécifié. |
| Entier | Spécifie la valeur threshold que l'indicateur de santé doit respecter pour satisfaire la règle de santé. |
Job.clusters de Jobs
Type: Sequence
Liste des spécifications de clusters Job pouvant être partagées et réutilisées par les tâches de ce Job. Les bibliothèques ne peuvent pas être déclarées dans un cluster Job partagé. Vous devez déclarer les bibliothèques dépendantes dans les paramètres de tâche.
Chaque élément de la liste est un JobCluster:
Clé | Type | Description |
|---|---|---|
| Chaîne | Un nom unique pour le cluster de jobs. Ce champ est obligatoire et doit être unique dans le job. |
| Carte | Si new_cluster, une description d'un cluster qui est créé pour chaque tâche. See clusters. |
Job.notification_settings
Type: Map
Paramètres de notification qui s'appliquent à toutes les notifications pour le job.
Clé | Type | Description |
|---|---|---|
| Booléen | Faut-il ignorer l'envoi d'alertes pour les exécutions ignorées. |
| Booléen | Ne pas envoyer d'alertes pour les exécutions annulées. |
job.parameters
Type: Sequence
Une liste de définitions de parameter de Job.
Chaque élément de la liste est un JobParameter:
Clé | Type | Description |
|---|---|---|
| Chaîne | Obligatoire. Valeur default du paramètre, par exemple, « users ». |
| Chaîne | Obligatoire. Le nom du parameter défini, par exemple, « table ». Les valeurs valides ne contiennent que des caractères alphanumériques, |
job.queue
Type: Map
Paramètres de file d'attente pour le Job.
Clé | Type | Description |
|---|---|---|
| Booléen | Faut-il activer la mise en file d'attente pour le Job. |
job.schedule
Type: Map
Configuration de la planification pour l'exécution périodique des jobs.
Clé | Type | Description |
|---|---|---|
| Chaîne | Une expression Cron utilisant la syntaxe Quartz qui spécifie l'exécution du Job. Par exemple, |
| Chaîne | Le fuseau horaire pour la planification. Par exemple, |
| Chaîne | Si la planification est suspendue ou non. Valeurs valides : |
job.trigger
Type: Map
Configuration du Trigger pour l'exécution de Job basée sur les événements.
Clé | Type | Description |
|---|---|---|
| Carte | Trigger basé sur l'arrivée de fichiers. Voir file_arrival. |
| Carte | Trigger basé sur une table. Consultez le tableau. |
| Carte | Trigger basé sur les mises à jour de table. Voir table_update. |
| Carte | Trigger périodique. Voir périodique. |
job.Trigger.file_arrival
Type: Map
Configuration du Trigger basée sur l'arrivée de fichiers.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin d'accès au fichier à surveiller pour les nouveaux fichiers. |
| Entier | Délai minimal en secondes entre les événements de Trigger. |
| Entier | Temps d'attente en secondes après la dernière modification du fichier avant le Trigger. |
job.trigger.table
Type: Map
Configuration du Trigger basée sur une table.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste de noms de tables à surveiller. |
| Chaîne | La condition SQL qui doit être remplie pour Trigger le Job. |
job.trigger.table_update
Type: Map
Configuration du Trigger basée sur les mises à jour de table.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste de noms de table à surveiller pour les mises à jour. |
| Chaîne | La condition SQL qui doit être remplie pour Trigger le Job. |
| Entier | Temps d’attente en secondes après la dernière mise à jour de la table avant le Trigger. |
job.trigger.periodic
Type: Map
Configuration du Trigger périodique.
Clé | Type | Description |
|---|---|---|
| Entier | La valeur d'intervalle pour le Trigger périodique. |
| Chaîne | L'unité de temps pour l'intervalle. Valeurs valides : |
Job.webhook_notifications
Type: Map
Paramètres de notification de Webhook pour les exécutions de job.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'ID de notifications de webhook à envoyer lorsqu'une exécution start. |
| Séquence | Une liste d'ID de notification webhook à notifier lorsqu'une exécution réussit. |
| Séquence | Une liste des ID de notification de webhook à notifier lorsqu'une exécution échoue. |
| Séquence | Une liste d'ID de notifications de webhook à notifier lorsqu'une durée d'exécution dépasse le threshold d'avertissement. |
| Séquence | Liste des ID de notification système à appeler lorsqu'un backlog threshold de streaming est dépassé pour un Stream. Les thresholds de backlog de streaming peuvent être définis dans le champ |
Exemples
L'exemple suivant définit un Job avec la clé de ressource hello-job et une tâche de Notebook :
resources:
jobs:
hello-job:
name: hello-job
tasks:
- task_key: hello-task
notebook_task:
notebook_path: ./hello.py
L’exemple suivant définit un job avec un notebook SQL :
resources:
jobs:
job_with_sql_notebook:
name: 'Job to demonstrate using a SQL notebook with a SQL warehouse'
tasks:
- task_key: notebook
notebook_task:
notebook_path: ./select.sql
warehouse_id: 799f096837fzzzz4
Pour d'autres exemples de configuration de Job, consultez Configuration de Job.
Pour des informations sur la définition des tâches de job et la substitution des paramètres de job, consultez :
- Ajouter des tâches aux Jobs dans les Bundles d'Automatisation Déclarative
- Remplacement des paramètres de tâche du Job
modèle (hérité)
Type: Map
La ressource de modèle vous permet de définir des modèles hérités dans des bundles. Databricks vous recommande d'utiliser les modèles enregistrés du Unity Catalog à la place.
point de terminaison de service de modèle
Type: Map
La ressource `model_serving_endpoint` vous permet de définir des Endpoint de service de modèle. Consultez Gérer les Endpoint de Model Serving.
model_serving_endpoints:
<model_serving_endpoint-name>:
<model_serving_endpoint-field-name>: <model_serving_endpoint-field-value>
Clé | Type | Description |
|---|---|---|
| Carte | La configuration de la passerelle IA pour l’Endpoint de diffusion. REMARQUE : Seuls les Endpoint de modèle externe et de throughput provisionné sont actuellement pris en charge. Voir ai_gateway. Ajouté dans la version 0.230.0 de Databricks CLI |
| Chaîne | L'identifiant de la politique budgétaire à utiliser pour cet Endpoint. Ajouté dans la version 0.244.0 de Databricks CLI |
| Carte | La configuration principale de l'Endpoint de service. Voir configuration. |
| Chaîne | Une description pour l'endpoint de service. Ajouté dans la CLI Databricks version 0.260.0 |
| Carte | Configuration des notifications par e-mail pour l'Endpoint de service. Consultez email_notifications. Ajouté dans la version 0.264.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Le nom de l'Endpoint de service. Ce champ est obligatoire et doit être unique dans l'ensemble d'un Workspace Databricks. Un nom d'Endpoint peut être composé de caractères alphanumériques, de tirets et de traits de soulignement. |
| Séquence | Les autorisations de l'endpoint de mise en service du modèle. Afficher les autorisations. |
| Séquence | Obsolète. Limites de débit à appliquer à l'Endpoint de service. Utilisez la Passerelle IA pour gérer les limites de débit. |
| Booléen | Activez l'optimisation des itinéraires pour l'Endpoint de service. |
| Séquence | Tags à associer à l'Endpoint de service et automatiquement propagés aux Logs de facturation. |
model_serving_endpoint.email_notifications
Type: Map
Configuration des notifications e-mail pour l'endpoint de service.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d’adresses e-mail à notifier lorsqu’un endpoint ne parvient pas à mettre à jour sa configuration ou son état. |
| Séquence | Une liste d'adresses e-mail à notifier lorsqu'un Endpoint met à jour avec succès sa configuration ou son état. |
model_serving_endpoint.ai_gateway
Type: Map
Configuration de la passerelle IA pour l'Endpoint de service.
Clé | Type | Description |
|---|---|---|
| Carte | Configuration pour le fallback du trafic qui bascule automatiquement vers d'autres entités servies si la requête vers une entité servie échoue avec certains codes d'erreur, afin d'augmenter la disponibilité. Consultez fallback_config. |
| Carte | Configuration des garde-fous. Voir garde-fous. |
| Carte | Configuration pour la journalisation de l'inférence vers les tables Unity Catalog. Consultez inference_table_config. |
| Séquence | Configurations des limites de débit. |
| Carte | Configuration du suivi de l’utilisation. Voir usage_tracking_config. |
model_serving_endpoint.ai_gateway.fallback_config
Type: Map
Configuration du fallback de trafic qui bascule automatiquement vers d'autres entités servies si une demande échoue avec certains codes d'erreur.
Clé | Type | Description |
|---|---|---|
| Booléen | Si le fallback est activé pour cet Endpoint. |
model_serving_endpoint.ai_gateway.guardrails
Type: Map
La configuration des garde-fous de la passerelle IA.
Clé | Type | Description |
|---|---|---|
| Carte | Configuration des garde-fous d’entrée avec des champs tels que |
| Carte | Configuration des garde-fous de sortie avec des champs tels que |
| Séquence | Une liste de mots-clés à bloquer. |
model_serving_endpoint.ai_gateway.inference_table_config
Type: Map
Configuration pour la journalisation de l'inférence dans les tables Unity Catalog.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du catalogue dans Unity Catalog. |
| Chaîne | Le nom du schéma dans Unity Catalog. |
| Chaîne | Le préfixe pour les noms de tables d'inférence. |
| Booléen | Indique si la journalisation de la table d'inférence est activée. |
model_serving_endpoint.ai_gateway.usage_tracking_config
Type: Map
La configuration de la passerelle AI pour le suivi de l'utilisation.
Clé | Type | Description |
|---|---|---|
| Booléen | Si le suivi de l'utilisation est activé. |
model_serving_endpoint.config
Type: Map
La configuration principale de l'endpoint de service.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'entités servies pour l'endpoint à desservir. Chaque entité servie contient des champs tels que |
| Séquence | (Obsolète : utilisez |
| Carte | La configuration du trafic définissant la manière dont les invocations vers l'endpoint de service doivent être acheminées. Voir traffic_config. |
model_serving_endpoint.config.traffic_config
Type: Map
La configuration du trafic définissant comment les invocations vers l'endpoint de service doivent être acheminées.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'itinéraires pour la distribution du trafic. Chaque itinéraire contient |
Exemple
L'exemple suivant définit un endpoint de service de modèle Unity Catalog :
resources:
model_serving_endpoints:
uc_model_serving_endpoint:
name: 'uc-model-endpoint'
config:
served_entities:
- entity_name: 'myCatalog.mySchema.my-ads-model'
entity_version: '10'
workload_size: 'Small'
scale_to_zero_enabled: 'true'
traffic_config:
routes:
- served_model_name: 'my-ads-model-10'
traffic_percentage: '100'
tags:
- key: 'team'
value: 'data science'
pipeline
Type: Map
Les pipelines sont pris en charge en Python pour les Declarative Automation Bundles. Consultez databricks.bundles.pipelines.
La ressource de pipeline vous permet de créer des pipelines. Pour en savoir plus sur les pipelines, consultez Spark Declarative Pipelines. Pour un didacticiel qui utilise le Template Declarative Automation Bundles pour créer un pipeline, consultez Développer des pipelines avec Declarative Automation Bundles.
pipelines:
<pipeline-name>:
<pipeline-field-name>: <pipeline-field-value>
Clé | Type | Description |
|---|---|---|
| Booléen | Si faux, le déploiement échouera si le nom est en conflit avec celui d'un autre pipeline. Ajouté dans la version 0.261.0 de Databricks CLI |
| Chaîne | Politique budgétaire de ce pipeline. Ajouté dans la version 0.230.0 de Databricks CLI |
| Chaîne | Un catalogue dans Unity Catalog vers lequel publier des données à partir de ce pipeline. Si |
| Chaîne | Le Canal de distribution LakeFlow Pipelines qui spécifie la version de LakeFlow Pipelines à utiliser. |
| Séquence | Les paramètres du cluster pour ce déploiement de pipeline. See clusters. |
| Carte | La configuration pour cette exécution de pipeline. |
| Booléen | Que le pipeline soit continu ou Trigger. Ceci remplace |
| Carte | Type de déploiement de ce pipeline. Voir déploiement. |
| Booléen | Si le pipeline est en mode développement. default to false. |
| Booléen | Indique si le pipeline est un pipeline de simulation. |
| Chaîne | L'édition du produit pipeline. |
| Carte | La spécification d'environnement de ce pipeline servait à installer des dépendances sur le compute serverless. Consultez l'environnement. Cette clé est uniquement prise en charge dans Databricks CLI version 0,258 et les versions ultérieures. Ajouté dans la version 0.257.0 de la Databricks CLI |
| Carte | La configuration du log des événements pour ce pipeline. Voir event_log. Ajouté dans la version 0.246.0 de la CLI Databricks |
| Carte | Les filtres qui déterminent les packages de pipelines à inclure dans le Graphe déployé. Voir les filtres. |
| Carte | La configuration d'un pipeline de passerelle. Ces paramètres ne peuvent pas être utilisés avec les paramètres |
| Chaîne | Identifiant unique pour ce pipeline. |
| Carte | La configuration d'un pipeline d'ingestion géré. Ces paramètres ne peuvent pas être utilisés avec les paramètres |
| Séquence | Une liste de bibliothèques ou de code nécessaire à ce déploiement. Consultez pipeline.libraries. |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Un nom convivial pour ce pipeline. |
| Séquence | Les paramètres de notification pour ce pipeline. Voir les notifications. |
| Carte | Les paramètres de ce pipeline, où chaque clé est le nom du paramètre et la valeur est la valeur du paramètre. |
| Séquence | Les autorisations du pipeline. Afficher les autorisations. |
| Booléen | Indique si Photon est activé pour ce pipeline. Cette clé est ignorée si |
| Carte | Définit une fenêtre de redémarrage pour ce pipeline. Les pipelines peuvent être redémarrés dans cette fenêtre sans prendre de retard. |
| Chaîne | Le chemin racine de ce pipeline. Ceci est utilisé comme répertoire racine lors de la modification du pipeline dans l'interface utilisateur Databricks et il est ajouté à sys.path lors de l'exécution des sources Python pendant l'exécution du pipeline. Ajouté à la version 0.253.0 de la CLI Databricks |
| Carte | L'identité sous laquelle le pipeline s'exécute. S'il n'est pas spécifié, le pipeline s'exécute en tant qu'utilisateur qui l'a créé. Seuls Ajouté dans la version 0.241.0 de Databricks CLI |
| Chaîne | Le schéma default (base de données) à partir duquel les tables sont lues ou vers lequel elles sont publiées. Ajouté dans la version 0.230.0 de Databricks CLI |
| Booléen | Si le compute Serverless est activé pour ce pipeline. |
| Chaîne | Le répertoire racine DBFS pour le stockage des points de contrôle et des tables. |
| Carte | Une carte des tags associés au pipeline. Ceux-ci sont transmis au cluster en tant que cluster tags, et sont donc soumis aux mêmes limitations. Un maximum de 25 tags peut être ajouté au pipeline. Ajouté dans la version 0.256.0 de Databricks CLI |
| Chaîne | Schéma cible (base de données) auquel ajouter les tables de ce pipeline. Exactement l'un de |
| Chaîne | L'ID de la politique d'utilisation serverless à utiliser pour ce pipeline. Ajouté dans la version 0.273.0 de Databricks CLI |
pipeline.déploiement
Type: Map
Configuration du type de déploiement pour le pipeline.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le type de déploiement. Par exemple, |
| Chaîne | Le chemin d'accès au fichier de métadonnées pour le déploiement. |
pipeline.environment
Type: Map
Spécification d'environnement pour l'installation des dépendances sur le compute serverless.
Clé | Type | Description |
|---|---|---|
| Séquence | Liste des dépendances pip, telles que prises en charge par la version de pip dans cet environnement. Chaque dépendance est une ligne de fichier d'exigences pip. |
pipeline.event_log
Type: Map
Configuration du Logs des événements pour le pipeline.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le catalogue Unity Catalog sous lequel le log d'événements est publié. |
| Chaîne | Le nom sous lequel le journal des événements est publié dans Unity Catalog. |
| Chaîne | Le schéma Unity Catalog sous lequel le journal des événements est publié. |
pipeline.filters
Type: Map
Filtres qui déterminent les packages de pipeline à inclure dans le Graphe déployé.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste de noms de package à inclure. |
| Séquence | Une liste de noms de packages à exclure. |
pipeline.définition_d'ingestion
Type: Map
Configuration d'un pipeline d'ingestion géré. Ces paramètres ne peuvent pas être utilisés avec les paramètres libraries, schema, target ou catalog.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom de la connexion à utiliser pour l'ingestion. |
| Chaîne | Facultatif. Type de connecteur pour les sources. Les valeurs valides sont Ajouté à la version 0,296.0 de Databricks CLI |
| Carte | Facultatif. Emplacement de stockage des données intermédiaires. Ceci est requis pour la migration d'un pipeline d'ingestion géré CDC avec un pipeline de passerelle vers un pipeline d'ingestion géré CDC combiné. Si non spécifié, le volume pour les données intermédiaires est créé dans le catalogue et le schéma/la cible spécifiés dans la définition du pipeline de haut niveau. Ajouté à la version 0,296.0 de Databricks CLI |
| Carte | Facultatif. Une fenêtre qui spécifie un ensemble d'intervalles de temps pour les requêtes instantanées dans la CDC. |
| Booléen | Immuable. Si activé, le pipeline ingérera les tables des catalogues externes Unity Catalog directement sans avoir à spécifier une connexion Unity Catalog ou une passerelle d'ingestion. Les champs Ajouté dans la version 0,279.0 de Databricks CLI |
| Chaîne | L’ID de la passerelle d’ingestion. |
| Séquence | Obligatoire. Paramètres spécifiant les tables à répliquer et la destination des tables répliquées. Chaque objet peut être un SchemaSpec, un TableSpec ou un ReportSpec. |
| Chaîne | Requis lors de l'utilisation de |
| Séquence | paramètres de configuration de la source au niveau du catalogue. Lorsque vous utilisez ce champ, vous devez également spécifier |
| Carte | Configuration des tables d'ingestion. Voir table_configuration. |
SchemaSpec
Type: Map
Spécification d'objet de schéma pour l'ingestion de toutes les tables d'un schéma.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du schéma source à ingérer. |
| Chaîne | Le nom du catalogue de destination dans Unity Catalog. |
| Chaîne | Le nom du schéma de destination dans Unity Catalog. |
| Carte | Configuration à appliquer à toutes les tables de ce schéma. Consultez pipeline.ingestion_definition.table_configuration. |
TableSpec
Type: Map
Spécification de l'objet table pour l'ingestion d'une table spécifique.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du schéma source contenant la table. |
| Chaîne | Le nom de la table source à ingérer. |
| Chaîne | Le nom du catalogue de destination dans Unity Catalog. |
| Chaîne | Le nom du schéma de destination dans Unity Catalog. |
| Chaîne | Le nom de la table de destination dans Unity Catalog. |
| Carte | Configuration pour cette table spécifique. Consultez pipeline.ingestion_definition.table_configuration. |
ReportSpec
Type: Map
Spécification d'objet de rapport pour l'ingestion de rapports analytiques.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'URL du rapport source. |
| Chaîne | Le nom ou l'identifiant du rapport source. |
| Chaîne | Le nom du catalogue de destination dans Unity Catalog. |
| Chaîne | Le nom du schéma de destination dans Unity Catalog. |
| Chaîne | Le nom de la table de destination pour les données du rapport. |
| Carte | Configuration de la table de rapport. Consultez pipeline.ingestion_definition.table_configuration. |
pipeline.ingestion_definition.source_configurations
Type: Sequence
Configuration de la source. Chaque élément de la séquence est une carte contenant la configuration au niveau du catalogue.
Clé | Type | Description |
|---|---|---|
| Carte | paramètres de configuration de la source au niveau du catalogue. Consultez le catalogue. |
pipeline.ingestion_definition.source_configurations.catalog
Type: Map
Paramètres de configuration source au niveau du catalogue
Clé | Type | Description |
|---|---|---|
| Carte | Paramètres de configuration au niveau du catalogue spécifiques à Postgres. Contient une clé |
| Chaîne | Le nom du catalogue source. |
pipeline.ingestion_definition.table_configuration
Type: Map
Options de configuration pour les tables d'ingestion.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste de noms de colonnes à exclure pour l'ingestion. Lorsque ce n'est pas spécifié, |
| Séquence | Liste des noms de colonnes à inclure pour l’ingestion. Lorsqu'elles ne sont pas spécifiées, toutes les colonnes, à l'exception de celles de |
| Séquence | Une liste de noms de colonnes à utiliser comme clés primaires pour la table. |
| Séquence | Les noms de colonne spécifiant l'ordre logique des événements dans les données source. Spark Declarative Pipelines utilise ce séquençage pour gérer les événements de modification qui arrivent dans le désordre. |
pipeline.libraries
Type: Sequence
Définit la liste des bibliothèques ou du code nécessaires à ce pipeline.
Chaque élément de la liste est une définition :
Clé | Type | Description |
|---|---|---|
| Carte | Le chemin d'accès à un fichier qui définit un pipeline et qui est stocké dans Databricks Repos. Voir pipeline.libraries.file. |
| Carte | Le champ unifié pour inclure le code source. Chaque entrée peut être un chemin de Notebook, un chemin de fichier ou un chemin de dossier qui se termine par |
| Carte | Le chemin d'accès à un Notebook qui définit un pipeline et est stocké dans le Workspace Databricks. Voir pipeline.libraries.Notebook. |
| Chaîne | Ce champ est obsolète. |
pipeline.libraries.file
Type: Map
Le chemin d'accès à un fichier qui définit un pipeline et est stocké dans les Repos Databricks.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin absolu du code source. |
pipeline.libraries.glob
Type: Map
Le champ unifié pour inclure le code source. Chaque entrée peut être un chemin de Notebook, un chemin de fichier ou un chemin de dossier qui se termine par /**. Ce champ ne peut pas être utilisé avec notebook ou file.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le code source à inclure pour les pipelines. |
pipeline.libraries.notebook
Type: Map
Le chemin d'accès à un Notebook qui définit un pipeline et est stocké dans le Workspace Databricks.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le chemin absolu du code source. |
pipeline.notifications
Type: Sequence
Les paramètres de notification pour ce pipeline. Chaque élément de la séquence est une configuration de notification.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'alertes de notifications Trigger. Les valeurs valides incluent |
| Séquence | Liste d'adresses e-mail à notifier lorsqu'une alerte configurée est Trigger. |
Exemple
L'exemple suivant définit un pipeline avec la clé de ressource hello-pipeline:
resources:
pipelines:
hello-pipeline:
name: hello-pipeline
clusters:
- label: default
num_workers: 1
development: true
continuous: false
channel: CURRENT
edition: CORE
photon: false
libraries:
- notebook:
path: ./pipeline.py
Pour d'autres exemples de configuration de pipeline, consultez Configuration de pipeline.
postgres_branch
Type:Map
La ressource de Branch Postgres vous permet de définir des Branches Lakebase dans un lot. Vous devez également définir les projets Postgres et les points de terminaison compute correspondants.
Ajouté dans la version 0.287.0 de la CLI Databricks
postgres_branches:
<postgres_branch-name>:
<postgres_branch-field-name>: <postgres_branches-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID à utiliser pour la Branch. Cela devient le composant final du nom de ressource de la Branch. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Timestamp d'expiration absolu. Lorsqu'elle est définie, la Branch expirera à ce moment-là. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | Lorsque défini sur vrai, protège la Branch de la suppression et du Reset. Les endpoints de compute associés et le projet ne peuvent pas être supprimés tant que la Branch est protégée. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | Désactivez explicitement l'expiration. Lorsque défini sur vrai, la Branch n'expirera pas. S'il est défini sur faux, la requête n'est pas valide ; fournissez plutôt ttl ou expire_time. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Le projet où cette Branch sera créée. Format : Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | Faut-il remplacer une branch existante ayant le même ID lors du déploiement ? Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Le nom de la Branch source à partir de laquelle cette Branch a été créée (data lineage pour la récupération à un point dans le temps). Si non spécifié, la valeur par default est la Branch par default du projet. Format : Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Le numéro de séquence de logs (LSN) sur la Branch source à partir de laquelle cette Branch a été créée. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Le moment précis sur la Branch source à partir duquel cette Branch a été créée. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Durée de vie relative. Lorsqu'elle est définie, la branch expirera à creation_time + ttl. Ajouté dans la version 0.287.0 de la CLI Databricks |
Exemple
Voir l'exemple postgres_projects.
postgres_catalog
Type: Map
La ressource de catalogue Postgres vous permet de définir des catalogues Lakebase Postgres dans un bundle. Chaque catalogue lie un catalogue Unity Catalog à une base de données Postgres sur une branch de mise à l'échelle automatique Lakebase.
Ajouté dans la version 1.0.0 de Databricks CLI
postgres_catalogs:
<postgres_catalog-name>:
<postgres_catalog-field-name>: <postgres_catalog-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | La branch Lakebase Autoscaling qui prend en charge le catalogue. Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Obligatoire. L'ID du catalogue Unity Catalog à lier à la base de données Postgres. Ajouté dans la version 1.0.0 de Databricks CLI |
| Booléen | Indique si la base de données Postgres doit être créée si elle n'existe pas déjà. Ajouté dans la version 1.0.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Obligatoire. Le nom de la base de données Postgres à lier au catalogue. Ajouté dans la version 1.0.0 de Databricks CLI |
Exemple
resources:
postgres_projects:
project:
project_id: test-pg-project
display_name: Test Postgres Project
postgres_catalogs:
catalog:
catalog_id: test_catalog
branch: ${resources.postgres_projects.project.name}/branches/production
postgres_database: appdb
create_database_if_missing: true
postgres_database
Type: Map
La ressource de base de données Postgres vous permet de définir des bases de données Lakebase Postgres dans un bundle. Chaque base de données est créée sur une branch Lakebase Autoscaling.
Ajouté dans la version 1.4.0 de Databricks CLI
postgres_databases:
<postgres_database-name>:
<postgres_database-field-name>: <postgres_database-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Obligatoire. L'ID à utiliser pour la base de données. Il devient le composant final du nom de la ressource de la base de données. Ajouté dans la version 1.4.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 1.4.0 de Databricks CLI |
| Chaîne | Obligatoire. La Branch où cette base de données est créée. Format : Ajouté dans la version 1.4.0 de Databricks CLI |
| Chaîne | Le nom de la base de données Postgres. Ajouté dans la version 1.4.0 de Databricks CLI |
| Booléen | S'il faut remplacer une base de données existante qui a le même ID lors du déploiement. Ajouté dans la version 1.7.0 de Databricks CLI |
| Chaîne | Requis à la création. Le nom de la ressource du rôle Postgres qui possède la base de données. Format : Ajouté dans la version 1.4.0 de Databricks CLI |
Exemples
resources:
postgres_projects:
my_project:
project_id: test-pg-proj
display_name: 'Test Project for Database'
pg_version: 16
history_retention_duration: '604800s'
postgres_branches:
main:
parent: ${resources.postgres_projects.my_project.id}
branch_id: main
no_expiry: true
postgres_roles:
owner:
parent: ${resources.postgres_branches.main.id}
role_id: app-owner
postgres_role: app_owner
postgres_databases:
my_database:
parent: ${resources.postgres_branches.main.id}
database_id: my-database
postgres_database: app_db
# The live API requires `role`. Declare an explicit role so the bundle is
# portable across users (the auto-created project-owner role's id is
# derived from the creator's identity).
role: ${resources.postgres_roles.owner.id}
postgres_endpoint
Type: Map
La ressource postgres_endpoints vous permet de définir des Endpoint de compute Lakebase dans un bundle. Vous devez également définir les projets Lakebase et les branches Lakebase correspondants.
Ajouté dans la version 0.287.0 de la CLI Databricks
postgres_endpoints:
<postgres_endpoint-name>:
<postgres_endpoint-field-name>: <postgres_endpoint-field-value>
Clé | Type | Description |
|---|---|---|
| Nombre | Le nombre maximal d'unités de calcul. La valeur minimale est de 0,5. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Nombre | Le nombre minimum d'unités de compute. La valeur minimale est de 0,5. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | Restreindre les connexions au Endpoint de compute. L'activation de cette option planifie une opération de suspension du compute. Un Endpoint compute désactivé ne peut pas être activé par une connexion ou une action de console. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | L’ID à utiliser pour l’Endpoint. Cela devient le composant final du nom de ressource de l’endpoint. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Le type d'endpoint. Une branch ne peut avoir qu'un seul endpoint READ_WRITE. Valeurs possibles : Ajouté dans la version 0.287.0 de la CLI Databricks |
| Carte | La configuration du groupe d'Endpoint. Voir postgres_endpoint.group. |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | Lorsque défini sur true, désactive explicitement la suspension automatique (ne jamais suspendre). Doit être défini sur true lorsqu'il est fourni. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | La Branch où cet Endpoint sera créé. Format : Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | Faut-il remplacer un endpoint de compute existant ayant le même ID lors du déploiement ? Ajouté dans la version 1.0.0 de Databricks CLI |
| Carte | Un ensemble de paramètres pour un Endpoint de compute. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Durée d'inactivité après laquelle l'endpoint de compute est automatiquement suspendu. Si spécifié, doit être compris entre 60 secondes et 604 800 secondes (1 minute à 1 semaine). Ajouté dans la version 0.287.0 de la CLI Databricks |
postgres_endpoint.group
Type: Map
La configuration du groupe d'Endpoint.
Clé | Type | Description |
|---|---|---|
| Booléen | Autoriser ou non les connexions en lecture seule aux Endpoint en lecture-écriture. Applicable uniquement aux Endpoint en lecture-écriture où |
| Entier | Obligatoire. Le nombre maximum de computes dans le groupe d'Endpoint. Actuellement, ceci doit être égal à |
| Entier | Obligatoire. Le nombre minimal de computes dans le groupe d'endpoint. Actuellement, ceci doit être égal à |
Exemple
Voir l'exemple postgres_projects.
postgres_project
Type: Map
La ressource de projet Postgres vous permet de définir des projets de base de données Lakebase Autoscaling Postgres dans un bundle. Vous devez également définir les branches Postgres et les endpoints de compute correspondants.
Ajouté dans la version 0.287.0 de la CLI Databricks
postgres_projects:
<postgres_project-name>:
<postgres_project-field-name>: <postgres_project-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID de politique budgétaire pour ce projet. |
| Séquence | Tags personnalisés pour ce projet. Voir postgres_project.custom_tags. |
| Chaîne | La Branch default du projet, au format |
| Carte | Un ensemble de paramètres pour un endpoint de compute. Consulter postgres_project.default_endpoint_settings. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | Nom de projet lisible par l'humain. Doit comporter entre 1 et 256 caractères Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | Activer la connexion Postgres native pour le projet. Ajouté dans la version 0.294.0 du CLI Databricks. |
| Chaîne | Le nombre de secondes pour conserver l'historique partagé pour la récupération à un instant T pour toutes les branches de ce projet. La valeur doit être comprise entre 0s et 2592000s (jusqu'à 30 jours). Ajouté dans la version 0.287.0 de la CLI Databricks |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Séquence | Les autorisations pour le projet Postgres. Afficher les autorisations. Ajouté dans la version Databricks CLI 0.292.0 |
| Entier | Le numéro de version majeure de Postgres. Les versions prises en charge sont les 16 et 17. Ajouté dans la version 0.287.0 de la CLI Databricks |
| Chaîne | L'ID de projet à utiliser. Cela devient le composant final du nom de la ressource du projet. L'ID est requis et doit comporter de 1 à 63 caractères, start with une lettre minuscule et contenir uniquement des lettres minuscules, des chiffres et des tirets. Par exemple, Ajouté dans la version 0.287.0 de la CLI Databricks |
| Booléen | S'il faut purger les données du projet lorsqu'il est supprimé. Ajoutée dans la version 1.2.0 de la CLI Databricks. |
Exemple
resources:
postgres_projects:
my_db:
project_id: test-prod-app
display_name: 'Production Database'
pg_version: 17
postgres_branches:
main:
parent: ${resources.postgres_projects.my_db.id}
branch_id: main
is_protected: false
no_expiry: true
postgres_endpoints:
primary:
parent: ${resources.postgres_branches.main.id}
endpoint_id: primary
endpoint_type: ENDPOINT_TYPE_READ_WRITE
autoscaling_limit_min_cu: 0.5
autoscaling_limit_max_cu: 4
postgres_project.custom_tags
Type: Sequence
Une liste d'étiquettes personnalisées pour le projet.
Clé | Type | Description |
|---|---|---|
| Chaîne | La clé du tag personnalisé. |
| Chaîne | La valeur du tag personnalisé. |
postgres_project.default_endpoint_settings
Type: Map
Clé | Type | Description |
|---|---|---|
| Nombre | Le nombre maximal d'unités de calcul. La valeur minimale est de 0,5. |
| Nombre | Le nombre minimum d'unités de compute. La valeur minimale est de 0,5. |
| Booléen | Lorsque défini sur true, désactive explicitement la suspension automatique (ne jamais suspendre). Devrait être défini sur vrai lorsqu'il est fourni. Mutuellement exclusif avec |
| Carte | Une représentation brute des paramètres Postgres. |
| Chaîne | Durée d'inactivité après laquelle l'endpoint de compute est automatiquement suspendu. S’il est spécifié, il doit être compris entre 60 s et 604800 s (1 minute et 1 semaine). Mutuellement exclusif avec |
rôle_postgres
Type: Map
La ressource de rôle Postgres vous permet de définir des rôles Lakebase Postgres dans un bundle. Chaque rôle est créé sur une Lakebase Autoscaling Branch.
Ajouté dans la version 1.4.0 de Databricks CLI
postgres_roles:
<postgres_role-name>:
<postgres_role-field-name>: <postgres_role-field-value>
Clé | Type | Description |
|---|---|---|
| Carte | Les attributs de rôle Postgres exposés par l'API souhaités à associer au rôle. Consultez postgres_role.attributes. Ajouté dans la version 1.4.0 de Databricks CLI |
| Chaîne | Comment le rôle est-il authentifié lors de la connexion à Postgres. Si non spécifiée, une méthode d'authentification pertinente est dérivée de Ajouté dans la version 1.4.0 de Databricks CLI |
| Chaîne | Le type d'identité gérée Databricks que ce rôle représente. Laissez vide pour créer un rôle Postgres standard non associé à une identité Databricks. Les valeurs valides sont Ajouté dans la version 1.4.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 1.4.0 de Databricks CLI |
| Séquence | Rôles standard dont ce rôle est membre. Ajouté dans la version 1.4.0 de Databricks CLI |
| Chaîne | Obligatoire. La Branch où ce rôle est créé. Format : Ajouté dans la version 1.4.0 de Databricks CLI |
| Chaîne | Le nom du rôle Postgres. Obligatoire lors de la création du rôle. Pour créer un rôle Postgres basé sur une identité Databricks gérée,
Ajouté dans la version 1.4.0 de Databricks CLI |
| Booléen | Remplacer un rôle existant qui a le même ID lors du déploiement. Ajouté dans la version 1.7.0 de Databricks CLI |
| Chaîne | Obligatoire. L'ID de rôle spécifié par l'utilisateur ; il devient le composant final du nom de ressource du rôle. Doit comporter 4 à 63 caractères, des lettres minuscules, des chiffres et des tirets (RFC 1123). Ajouté dans la version 1.4.0 de Databricks CLI |
postgres_role.attributes
Type: Map
Les attributs de rôle Postgres exposés par l'API à associer au rôle.
Ajouté dans la version 1.4.0 de Databricks CLI
Clé | Type | Description |
|---|---|---|
| Booléen | Si le rôle ignore la sécurité au niveau des lignes. |
| Booléen | La capacité du rôle à créer des bases de données. |
| Booléen | Permet au rôle de créer, modifier, supprimer, commenter et modifier l'étiquette de sécurité des autres rôles. |
Exemples
resources:
postgres_projects:
my_project:
project_id: my-pg-proj
display_name: 'Test Project for Role'
pg_version: 16
history_retention_duration: '604800s'
postgres_branches:
main:
parent: ${resources.postgres_projects.my_project.id}
branch_id: main
no_expiry: true
postgres_roles:
my_role:
parent: ${resources.postgres_branches.main.id}
role_id: my-role
postgres_role: app_role
attributes:
createdb: true
postgres_synced_table
Type: Map
La ressource de table synchronisée Postgres vous permet de définir des tables synchronisées Lakebase Postgres dans un bundle. Chaque table synchronisée réplique en continu une table source Delta Unity Catalog dans une table Postgres sur une instance Lakebase Autoscaling.
Ajouté dans la version 1.0.0 de Databricks CLI
postgres_synced_tables:
<postgres_synced_table-name>:
<postgres_synced_table-field-name>: <postgres_synced_table-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | La branch Autoscaling Lakebase où la table synchronisée est créée. Ajouté dans la version 1.0.0 de Databricks CLI |
| Booléen | S'il faut créer la base de données logique et les ressources de schéma de la table synchronisée si elles n'existent pas déjà. Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | L'ID d'un pipeline existant. Si cette option est définie, la table synchronisée sera regroupée dans le pipeline existant référencé. Cela évite de créer un nouveau pipeline et permet de partager le compute existant. Dans ce cas, le Ajouté dans la version 1.0.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 1.0.0 de Databricks CLI |
| Carte | La spécification d'un nouveau pipeline. Voir postgres_synced_table.new_pipeline_spec. Au maximum un seul de Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Le nom de la base de données Postgres cible pour la table synchronisée. Ajouté dans la version 1.0.0 de Databricks CLI |
| Séquence | La liste des noms de colonnes qui forment la clé primaire. Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Stratégie de planification du pipeline sous-jacent de la table synchronisée. Les valeurs valides sont Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Le nom complet de la table source au format Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Obligatoire. L'ID à utiliser pour la table synchronisée. Ajouté dans la version 1.0.0 de Databricks CLI |
| Chaîne | Clé de série temporelle pour dédupliquer les lignes avec la même clé primaire. Ajouté dans la version 1.0.0 de Databricks CLI |
postgres_synced_table.new_pipeline_spec
Type: Map
La spécification pour un nouveau pipeline utilisé par la table synchronisée.
Ajouté dans la version 1.0.0 de Databricks CLI
Clé | Type | Description |
|---|---|---|
| Chaîne | La politique budgétaire à définir sur le pipeline nouvellement créé. |
| Chaîne | Le catalogue pour le pipeline afin de stocker les fichiers intermédiaires, tels que les points de contrôle et les Logs d'événements. Il doit s’agir d’un catalogue standard où l’utilisateur dispose des autorisations pour créer des tables Delta. |
| Chaîne | Le schéma du pipeline pour stocker les fichiers intermédiaires, tels que les points de contrôle et les logs d'événements. Cela doit être dans le catalogue standard où l'utilisateur a les autorisations pour créer des tables Delta. |
Exemple
resources:
schemas:
pipeline_storage:
name: test_pipeline_storage
catalog_name: main
comment: 'Pipeline storage for the synced-table test'
postgres_projects:
my_project:
project_id: test-pg-proj
display_name: 'Test Project for Synced Table'
pg_version: 17
postgres_catalogs:
my_catalog:
catalog_id: lakebase_test
branch: ${resources.postgres_projects.my_project.id}/branches/production
postgres_database: appdb
create_database_if_missing: true
postgres_synced_tables:
my_table:
synced_table_id: ${resources.postgres_catalogs.my_catalog.catalog_id}.public.trips_synced
source_table_full_name: main.source_test.trips_source
primary_key_columns: ['tpep_pickup_datetime']
scheduling_policy: SNAPSHOT
postgres_database: appdb
branch: ${resources.postgres_projects.my_project.id}/branches/production
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: ${resources.schemas.pipeline_storage.catalog_name}
storage_schema: ${resources.schemas.pipeline_storage.name}
quality_monitor (Unity Catalog)
Type: Map
La ressource quality_monitor vous permet de définir un moniteur de table Unity Catalog. Pour plus d'information sur les moniteurs, consultez le profilage des données.
quality_monitors:
<quality_monitor-name>:
<quality_monitor-field-name>: <quality_monitor-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Le répertoire pour stocker les assets de monitoring (p. ex. tableau de bord, tables de métriques). |
| Chaîne | Nom de la table de référence à partir de laquelle les métriques de drift sont computées. Les colonnes de la table surveillée doivent également être présentes dans la table de base. |
| Séquence | Mesures personnalisées à compute sur la table surveillée. Il peut s'agir de métriques agrégées, de métriques dérivées (à partir de métriques agrégées déjà calculées) ou de métriques de drift (comparant les métriques sur des fenêtres temporelles). Voir custom_metrics. |
| Carte | Configuration pour le monitoring des Logs d'inférence. Voir inference_log. |
| Chaîne | Le dernier message d’erreur pour une défaillance de moniteur. Il s'agit d'un champ en lecture seule qui est renseigné lorsqu'un moniteur échoue. Ajouté dans la version 0.264.0 de Databricks CLI |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Carte | Les réglages de notification pour la surveillance. Voir les notifications. |
| Chaîne | Schéma où les tables de métriques de sortie sont créées. |
| Carte | Le calendrier de mise à jour et d'actualisation automatique des tables de métriques. Consultez le programme. |
| Booléen | S'il faut ignorer la création d'un tableau de bord default résumant les métriques de qualité des données. |
| Séquence | Liste des expressions de colonne pour découper les données en vue d'une analyse ciblée. Les données sont regroupées par chaque expression indépendamment, ce qui donne une tranche séparée pour chaque prédicat et ses compléments. Pour les colonnes à cardinalité élevée, seules les 100 premières valeurs uniques par fréquence généreront des tranches. |
| Carte | Configuration pour le monitoring des tables d'instantanés. Voir l'aperçu instantané. |
| Chaîne | Le nom complet de la table. Ajouté dans la version 0,235.0 de la CLI Databricks. |
| Carte | Configuration pour le monitoring des tables de séries chronologiques. Voir time_series. |
| Chaîne | Argument facultatif pour spécifier le warehouse pour la création de tableaux de bord. Si non spécifié, le premier warehouse en cours d'exécution sera utilisé. |
quality_monitor.custom_metrics
Type: Sequence
Une liste de définitions de métriques personnalisées.
Chaque élément de la liste est un CustomMetric:
Clé | Type | Description |
|---|---|---|
| Chaîne | Template Jinja pour une expression SQL qui spécifie comment calculer la métrique. Consultez créer une définition d'indicateur. |
| Séquence | Une liste de noms de colonnes dans la table d'entrée pour lesquelles la métrique doit être calculée. Peut utiliser |
| Chaîne | Nom de la métrique dans les tables de sortie. |
| Chaîne | Le type de sortie de la métrique personnalisée. |
| Chaîne | Ne peut être que l'une des valeurs suivantes :
|
quality_monitor.inference_log
Type: Map
Configuration pour le monitoring des Logs d'inférence.
Clé | Type | Description |
|---|---|---|
| Séquence | Les granularités temporelles pour l'agrégation des logs d'inférence (par exemple, |
| Chaîne | Le nom de la colonne contenant l'ID du modèle. |
| Chaîne | Le nom de la colonne contenant la prédiction. |
| Chaîne | Le nom de la colonne contenant le timestamp. |
| Chaîne | Le type de problème ML. Les valeurs valides incluent |
| Chaîne | Le nom de la colonne contenant l’étiquette (vérité de terrain). |
| Chaîne | Le nom de la colonne contenant les probabilités de prédiction. |
quality_monitor.notifications
Type: Map
Paramètres de notification pour le moniteur.
Clé | Type | Description |
|---|---|---|
| Carte | Paramètres de notification en cas d’échec du moniteur. Voir on_failure. |
| Carte | Paramètres de notification lorsque de nouvelles étiquettes de classification sont détectées. Voir on_new_classification_tag_detected. |
quality_monitor.notifications.on_failure
Type: Map
Paramètres de notification lorsque le moniteur échoue.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d’adresses e-mail à notifier en cas d’échec du moniteur. |
quality_monitor.notifications.on_new_classification_tag_detected
Type: Map
Paramètres de notification lorsque de nouvelles étiquettes de classification sont détectées.
Clé | Type | Description |
|---|---|---|
| Séquence | Une liste d'adresses e-mail à notifier lorsque de nouvelles étiquettes de classification sont détectées. |
quality_monitor.schedule
Type: Map
Planification pour la mise à jour et l'actualisation automatiques des tables de métriques.
Clé | Type | Description |
|---|---|---|
| Chaîne | Une expression Cron utilisant la syntaxe Quartz. Par exemple, |
| Chaîne | Le fuseau horaire du planning (par exemple, |
| Chaîne | Indique si la planification est suspendue. Valeurs valides : |
quality_monitor.snapshot
Type: Map
Configuration pour le monitoring des tables d'instantanés.
quality_monitor.time_series
Configuration pour le monitoring des tables de séries chronologiques.
Clé | Type | Description |
|---|---|---|
| Séquence | Les granularités temporelles pour l'agrégation de données de séries chronologiques (par exemple, |
| Chaîne | Le nom de la colonne contenant le timestamp. |
Exemples
Les exemples suivants définissent des moniteurs de qualité pour les types de profil InferenceLog, TimeSeries et Snapshot.
# InferenceLog profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
inference_log:
granularities: [1 day]
model_id_col: model_id
prediction_col: prediction
label_col: price
problem_type: PROBLEM_TYPE_REGRESSION
timestamp_col: timestamp
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
# TimeSeries profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
time_series:
granularities: [30 minutes]
timestamp_col: timestamp
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
# Snapshot profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
snapshot: {}
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
L'exemple suivant configure un moniteur de qualité et un Job de réentraînement de modèle correspondant basés sur le monitoring :
# Quality monitoring workflow
resources:
quality_monitors:
mlops_quality_monitor:
table_name: ${bundle.target}.mlops_demo.predictions
output_schema_name: ${bundle.target}.mlops_demo
assets_dir: /Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
inference_log:
granularities: [1 hour]
model_id_col: model_version
prediction_col: prediction
label_col: fare_amount
problem_type: PROBLEM_TYPE_REGRESSION
timestamp_col: inference_timestamp
schedule:
quartz_cron_expression: 57 0 14 * * ? # refresh monitoring metrics every day at 7 am PT
timezone_id: UTC
jobs:
retraining_job:
name: ${bundle.target}-mlops_demo-monitoring-retraining-job
tasks:
- task_key: monitored_metric_violation_check
notebook_task:
notebook_path: ../monitoring/notebooks/MonitoredMetricViolationCheck.py
base_parameters:
env: ${bundle.target}
table_name_under_monitor: ${bundle.target}.mlops_demo.predictions
metric_to_monitor: r2_score
metric_violation_threshold: 0.7
num_evaluation_windows: 24
num_violation_windows: 5 # 5 out of the past 24 windows have metrics lower than threshold
- task_key: is_metric_violated
depends_on:
- task_key: monitored_metric_violation_check
condition_task:
op: EQUAL_TO
left: '{{tasks.monitored_metric_violation_check.values.is_metric_violated}}'
right: 'true'
- task_key: trigger_retraining
depends_on:
- task_key: is_metric_violated
outcome: 'true'
run_job_task:
job_id: ${resources.jobs.model_training_job.id}
schedule:
quartz_cron_expression: '0 0 15 * * ?' # daily at 8 am PDT
timezone_id: UTC
# To get notifications, provide a list of emails to the on_failure argument.
#
# email_notifications:
# on_failure:
# - someone@example.com
modèle enregistré (Unity Catalog)
Type: Map
La ressource de modèle enregistré vous permet de définir des modèles dans Unity Catalog. Pour plus d'informations sur les modèles enregistrés dans Unity Catalog, consultez Gérer le cycle de vie des modèles dans Unity Catalog.
registered_models:
<registered_model-name>:
<registered_model-field-name>: <registered_model-field-value>
Clé | Type | Description |
|---|---|---|
| Séquence | Liste d'alias associés au modèle enregistré. Consultez registered_model.aliases. Ajouté dans la version 0.273.0 de Databricks CLI |
| Booléen | Indique si le principal est limité à la récupération des métadonnées pour l'objet associé via le privilège BROWSE lorsque include_browse est activé dans la requête. Ajouté dans la version 0.273.0 de Databricks CLI |
| Chaîne | Le nom du catalogue où résident le schéma et le modèle enregistré. |
| Chaîne | Le commentaire joint au modèle enregistré. |
| Entier | Timestamp de création du modèle enregistré en millisecondes depuis l'époque Unix. Ajouté dans la version 0.273.0 de Databricks CLI |
| Chaîne | L'identifiant de l'utilisateur qui a créé le modèle enregistré. Ajouté dans la version 0.273.0 de Databricks CLI |
| Chaîne | Nom à trois niveaux (entièrement qualifié) du modèle enregistré. Ajouté dans la version 0.273.0 de Databricks CLI |
| Séquence | Les subventions associées au modèle ajouté au registre. Voir l'octroi. |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | L'identifiant unique du métastore. Ajouté dans la version 0.273.0 de Databricks CLI |
| Chaîne | Le nom du modèle enregistré. |
| Chaîne | L'identifiant de l'utilisateur qui possède le modèle enregistré. Ajouté dans la version 0.273.0 de Databricks CLI |
| Chaîne | Le nom du schéma où réside le modèle enregistré. |
| Chaîne | L'emplacement de stockage dans le cloud sous lequel les fichiers de données de version de modèle sont stockés. |
| Chaîne | Timestamp de dernière mise à jour du modèle enregistré en millisecondes depuis l'époque Unix. Ajouté dans la version 0.273.0 de Databricks CLI |
| Chaîne | L'identifiant de l'utilisateur qui a mis à jour le Modèle enregistré pour la dernière fois. Ajouté dans la version 0.273.0 de Databricks CLI |
registered_model.aliases
Type: Sequence
Une liste d’alias associés au modèle enregistré.
Chaque élément de la liste est un Alias:
Clé | Type | Description |
|---|---|---|
| Chaîne | Nom de l'alias, par exemple : « champion » ou « latest_stable » |
| Chaîne | Le nom du catalogue contenant la version du modèle |
| Chaîne | L’identifiant unique de l’alias |
| Chaîne | Nom du modèle parent enregistré de la version du modèle, relatif au schéma parent |
| Chaîne | Le nom du schéma contenant la version du modèle, par rapport au catalogue parent. |
| Entier | Numéro de version entier de la version du modèle vers lequel cet alias pointe. |
Exemple
L’exemple suivant définit un modèle enregistré dans Unity Catalog :
resources:
registered_models:
model:
name: my_model
catalog_name: ${bundle.target}
schema_name: mlops_schema
comment: Registered model in Unity Catalog for ${bundle.target} deployment target
grants:
- privileges:
- EXECUTE
principal: account users
schéma (Unity Catalog)
Type: Map
Les schémas sont pris en charge en Python pour les Declarative Automation Bundles. Voir databricks.bundles.schemas.
Le type de ressource de schéma vous permet de définir les schémas Unity Catalog pour les tables et autres asset dans vos workflows et pipeline créés dans le cadre d'un bundle. Un schéma, différent des autres types de Ressources, présente les limitations suivantes :
- Le propriétaire d'une ressource de schéma est toujours l'utilisateur du déploiement et ne peut pas être modifié. Si
run_asest spécifié dans le bundle, il sera ignoré par les opérations sur le schéma. - Seuls les champs pris en charge par l’ API de création d’objet Schemas correspondante sont disponibles pour la ressource de schéma. Par exemple,
enable_predictive_optimizationn'est pas pris en charge, car il n'est disponible que sur l'API de mise à jour.
schemas:
<schema-name>:
<schema-field-name>: <schema-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du catalogue parent. |
| Chaîne | Une description textuelle libre fournie par l'utilisateur. |
| Séquence | Les octrois associés au schéma. Voir l'octroi. |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Le nom du schéma, par rapport au catalogue parent. |
| Carte | Un mappage de propriétés clé-valeur attachées au schéma. |
| Chaîne | L'URL racine de stockage pour les tables gérées au sein du schéma. |
Exemples
L'exemple suivant définit un pipeline avec la clé de ressource my_pipeline qui crée un schéma Unity Catalog avec la clé my_schema comme cible. Cet exemple utilise des substitutions.
resources:
pipelines:
my_pipeline:
name: test-pipeline
libraries:
- notebook:
path: ../src/nb.ipynb
- file:
path: ../src/range.sql
development: true
catalog: ${resources.schemas.my_schema.catalog_name}
target: ${resources.schemas.my_schema.id}
schemas:
my_schema:
name: test-schema
catalog_name: main
comment: This schema was created by Declarative Automation Bundles.
Un mappage des autorisations de niveau supérieur n'est pas pris en charge par les Bundles d'automatisation déclaratifs. Par conséquent, si vous souhaitez définir des autorisations pour un schéma, définissez les autorisations pour le schéma dans le mappage schemas. Pour plus d'information sur les autorisations, consultez Afficher, accorder et révoquer des privilèges.
L'exemple suivant définit un schéma Unity Catalog avec des autorisations :
resources:
schemas:
my_schema:
name: test-schema
grants:
- principal: users
privileges:
- SELECT
- principal: my_team
privileges:
- MANAGE
catalog_name: main
secret_scope
Type: Map
La ressource `secret_scope` vous permet de définir des périmètres secrets dans un bundle. Pour des informations sur les Secret Scopes, consultez Gestion des secrets.
Ajouté dans la version 0.252.0 de la CLI Databricks
secret_scopes:
<secret_scope-name>:
<secret_scope-field-name>: <secret_scope-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Le type de backend avec lequel la portée sera créée. Si non spécifié, cela est défini par default sur Ajouté dans la version 0.252.0 de la CLI Databricks |
| Carte | Les métadonnées pour le Secret Scope si Ajouté dans la version 0.252.0 de la CLI Databricks |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Nom du périmètre demandé par l'utilisateur. Les noms de portée sont uniques. Ajouté dans la version 0.252.0 de la CLI Databricks |
| Séquence | Les autorisations à appliquer au Secret Scope. Les autorisations sont gérées via les ACLs du Secret Scope. Voir les autorisations. Ajouté dans la version 0.252.0 de la CLI Databricks |
secret_scope.keyvault_metadata
Type: Map
Les métadonnées pour les Secret Scope sécurisés par Azure Key Vault.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID de ressource Azure du Key Vault. |
| Chaîne | Le nom DNS d'Azure Key Vault. |
Exemples
L'exemple suivant définit un Secret Scope qui utilise un backend de coffre de clés :
resources:
secret_scopes:
secret_scope_azure:
name: test-secrets-azure-backend
backend_type: 'AZURE_KEYVAULT'
keyvault_metadata:
resource_id: my_azure_keyvault_id
dns_name: my_azure_keyvault_dns_name
L’exemple suivant définit un ACL personnalisé à l’aide de Secret Scope et d’autorisations :
resources:
secret_scopes:
my_secret_scope:
name: my_secret_scope
permissions:
- user_name: admins
level: WRITE
- user_name: users
level: READ
Pour obtenir un exemple de bundle qui montre comment définir un Secret Scope et un Job avec une tâche qui en lit les données dans un bundle, consultez le repository GitHub bundle-examples.
sql_warehouse
Type: Map
La ressource SQL Warehouse vous permet de définir un SQL Warehouse dans un bundle. Pour plus d'informations sur les SQL Warehouse, consultez l'entreposage des données sur Databricks.
Ajouté dans la CLI Databricks version 0.260.0
sql_warehouses:
<sql-warehouse-name>:
<sql-warehouse-field-name>: <sql-warehouse-field-value>
Clé | Type | Description |
|---|---|---|
| Entier | La durée en minutes pendant laquelle un SQL Warehouse doit être inactif (par exemple, aucune requête en cours d'exécution) avant d'être automatiquement arrêté. Les valeurs valides sont 0, ce qui indique l'absence d'arrêt automatique, ou supérieur ou égal à 10. La default est 120. Ajouté dans la CLI Databricks version 0.260.0 |
| Carte | Les détails du Canal de distribution. See Canal de distribution. Ajouté dans la CLI Databricks version 0.260.0 |
| Chaîne | La taille des clusters alloués pour ce warehouse. L'augmentation de la taille d'un cluster Spark vous permet d'y exécuter des requêtes plus volumineuses. Si vous souhaitez augmenter le nombre de requêtes simultanées, ajustez max_num_clusters. Pour les valeurs prises en charge, consultez cluster_size. Ajouté dans la CLI Databricks version 0.260.0 |
| Chaîne | Le nom de l'utilisateur qui a créé le warehouse. Ajouté dans la CLI Databricks version 0.260.0 |
| Booléen | Si le warehouse doit utiliser des clusters optimisés par Photon. default to false. Ajouté dans la CLI Databricks version 0.260.0 |
| Booléen | Si le warehouse doit utiliser le compute serverless. Ajouté dans la CLI Databricks version 0.260.0 |
| Chaîne | Obsolète. Profil d'instance utilisé pour transmettre le rôle IAM au cluster. Ajouté dans la CLI Databricks version 0.260.0 |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Entier | Le nombre maximal de clusters que l'autoscaler créera pour gérer les requêtes simultanées. Les valeurs doivent être inférieures ou égales à 30 et supérieures ou égales à Ajouté dans la CLI Databricks version 0.260.0 |
| Entier | Le nombre minimum de clusters disponibles qui seront maintenus pour ce SQL Warehouse. Augmenter cela garantira qu'un plus grand nombre de clusters sont toujours en cours d'exécution et, par conséquent, peut réduire le temps de cold start pour les nouvelles queries. Ceci est similaire aux cœurs réservés ou révocables dans un gestionnaire de ressources. Les valeurs doivent être supérieures à 0 et inférieures ou égales à min(max_num_clusters, 30). La valeur par défaut est 1. Ajouté dans la CLI Databricks version 0.260.0 |
| Chaîne | Le nom logique du cluster. Le nom doit être unique au sein d'une organisation et comporter moins de 100 caractères. Ajouté dans la CLI Databricks version 0.260.0 |
| Séquence | Les autorisations à appliquer au warehouse. Afficher les autorisations. Ajouté dans la CLI Databricks version 0.260.0 |
| Chaîne | Indique s'il faut utiliser des instances spot. Les valeurs valides sont : Ajouté dans la CLI Databricks version 0.260.0 |
| Carte | Un ensemble de balises personnalisées pour le warehouse. Voir sql_warehouse.tags. Ajouté dans la CLI Databricks version 0.260.0 |
| Chaîne | Le type de warehouse. Les valeurs valides sont Ajouté dans la CLI Databricks version 0.260.0 |
sql_warehouse.channel
Type: Map
La configuration du canal de distribution pour le SQL Warehouse.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du canal de distribution. Les valeurs valides incluent |
| Chaîne | La version DBSQL pour les canaux de distribution personnalisés. |
sql_warehouse.tags
Type: Map
Les balises personnalisées pour le SQL Warehouse.
Clé | Type | Description |
|---|---|---|
| Séquence | Un ensemble de paires clé-valeur qui identifient les balises sur toutes les Ressources (par exemple, les instances AWS et les volumes EBS) associées à ce SQL Warehouse. Le nombre de balises doit être inférieur à 45. |
Exemple
L'exemple suivant définit un SQL Warehouse :
resources:
sql_warehouses:
my_sql_warehouse:
name: my_sql_warehouse
cluster_size: X-Large
enable_serverless_compute: true
max_num_clusters: 3
min_num_clusters: 1
auto_stop_mins: 60
warehouse_type: PRO
tags:
custom_tags:
- key: 'bizunit'
value: 'commercial'
- key: 'area'
value: 'marketing'
table de base de données synchronisée
Type: Map
La ressource de table de base de données synchronisée vous permet de définir les tables de base de données Lakebase dans un bundle.
Pour des informations sur les tables de base de données synchronisées, veuillez consulter Lakebase provisionnée.
Ajouté dans Databricks CLI version 0,266.0
synced_database_tables:
<synced_database_table-name>:
<synced_database_table-field-name>: <synced_database_table-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom de l’instance de base de données cible. Ceci est requis lors de la création de tables de base de données synchronisées dans des catalogues standard. Ceci est facultatif lors de la création de tables de base de données synchronisées dans les catalogues enregistrés. Ajouté dans Databricks CLI version 0,266.0 |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Le nom de l'objet de la base de données Postgres cible (base de données logique) pour cette table. Ajouté dans Databricks CLI version 0,266.0 |
| Chaîne | Le nom complet de la table, au format Ajouté dans Databricks CLI version 0,266.0 |
| Carte | La spécification de la table de base de données. Voir la spécification des tables de base de données synchronisées. Ajouté dans Databricks CLI version 0,266.0 |
synced_database_table.spec
Type: Map
La spécification de la table de la base de données.
Ajouté dans Databricks CLI version 0,266.0
Clé | Type | Description |
|---|---|---|
| Booléen | S'il faut créer la base de données logique et les ressources de schéma de la table synchronisée si elles n'existent pas déjà. |
| Chaîne | L'ID d'un pipeline existant. Si cette option est définie, la table synchronisée sera regroupée dans le pipeline existant référencé. Cela évite de créer un nouveau pipeline et permet de partager le compute existant. Dans ce cas, le |
| Carte | La spécification d'un nouveau pipeline. Voir new_pipeline_spec. Au maximum un seul de |
| Séquence | La liste des noms de colonnes qui forment la clé primaire. |
| Chaîne | La politique de planification de la synchronisation. Les valeurs valides incluent |
| Chaîne | Le nom complet de la table source au format |
| Chaîne | Clé de série temporelle pour dédupliquer les lignes avec la même clé primaire. |
synced_database_table.spec.new_pipeline_spec
Type: Map
La spécification d'un nouveau pipeline utilisé par la table de base de données synchronisée.
Clé | Type | Description |
|---|---|---|
| Chaîne | L'ID de la politique budgétaire à définir sur le pipeline nouvellement créé. |
| Chaîne | Le catalogue pour le pipeline afin de stocker les fichiers intermédiaires, tels que les points de contrôle et les Logs d'événements. Il doit s’agir d’un catalogue standard où l’utilisateur dispose des autorisations pour créer des tables Delta. |
| Chaîne | Le schéma du pipeline pour stocker les fichiers intermédiaires, tels que les points de contrôle et les logs d'événements. Cela doit être dans le catalogue standard où l'utilisateur a les autorisations pour créer des tables Delta. |
Exemples
L'exemple suivant définit une table de base de données synchronisée au sein d'un catalogue de bases de données correspondant :
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: my-instance
database_name: 'my_database'
name: my_catalog
create_database_if_not_exists: true
synced_database_tables:
my_synced_table:
name: ${resources.database_catalogs.my_catalog.name}.${resources.database_catalogs.my_catalog.database_name}.my_destination_table
database_instance_name: ${resources.database_catalogs.my_catalog.database_instance_name}
logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
spec:
source_table_full_name: 'my_source_table'
scheduling_policy: SNAPSHOT
primary_key_columns:
- my_pk_column
new_pipeline_spec:
storage_catalog: 'my_delta_catalog'
storage_schema: 'my_delta_schema'
Voici un exemple qui définit une table de base de données synchronisée au sein d'un catalogue standard :
resources:
synced_database_tables:
my_synced_table:
name: 'my_standard_catalog.public.synced_table'
# database_instance_name is required for synced tables created in standard catalogs.
database_instance_name: 'my-database-instance'
# logical_database_name is required for synced tables created in standard catalogs:
logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
spec:
source_table_full_name: 'source_catalog.schema.table'
scheduling_policy: SNAPSHOT
primary_key_columns:
- my_pk_column
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: 'my_delta_catalog'
storage_schema: 'my_delta_schema'
Cet exemple crée une table de base de données synchronisée et personnalise la planification du pipeline correspondant. Cela suppose que vous disposez déjà de :
- Une instance de base de données nommée
my-database-instance - Un catalogue standard nommé
my_standard_catalog - Un schéma dans le catalogue standard nommé
default - Une table Delta source nommée
source_delta.schema.customeravec la clé primairec_custkey
resources:
synced_database_tables:
my_synced_table:
name: 'my_standard_catalog.default.my_synced_table'
database_instance_name: 'my-database-instance'
logical_database_name: 'test_db'
spec:
source_table_full_name: 'source_delta.schema.customer'
scheduling_policy: SNAPSHOT
primary_key_columns:
- c_custkey
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: 'source_delta'
storage_schema: 'schema'
jobs:
sync_pipeline_schedule_job:
name: sync_pipeline_schedule_job
description: 'Job to schedule synced database table pipeline.'
tasks:
- task_key: synced-table-pipeline
pipeline_task:
pipeline_id: ${resources.synced_database_tables.my_synced_table.data_synchronization_status.pipeline_id}
schedule:
quartz_cron_expression: '0 0 0 * * ?'
vector_search_endpoint
Type: Map
La ressource vector_search_endpoint vous permet de définir des AI Search Endpoint dans un bundle. Pour plus d'informations sur la recherche IA, consultez Databricks AI Search.
L'utilisation des bundles d'automatisation déclaratifs pour définir les Endpoint de recherche vectorielle est prise en charge uniquement si vous utilisez le moteur de déploiement direct.
Ajouté dans Databricks CLI version 0.298.0
vector_search_endpoints:
<vector_search_endpoint-name>:
<vector_search_endpoint-field-name>: <vector_search_endpoint-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | L'identifiant de la politique budgétaire à utiliser pour cet Endpoint. Ajouté dans Databricks CLI version 0.298.0 |
| Chaîne | Type de l'endpoint. Les valeurs valides sont Ajouté dans Databricks CLI version 0.298.0 |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans Databricks CLI version 0.298.0 |
| Entier | Les requêtes cibles par seconde pour l'Endpoint de recherche IA. Ajouté dans Databricks CLI version 0.298.0 Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Chaîne | Le nom de l'Endpoint de recherche IA. Ajouté dans Databricks CLI version 0.298.0 |
| Séquence | Les autorisations à appliquer à l'Endpoint de recherche IA. Afficher les autorisations. Ajouté dans Databricks CLI version 0.298.0 |
Exemple
L'exemple suivant définit un Endpoint de recherche IA :
# databricks.yml
bundle:
name: vector-search-example
engine: direct # Vector Search requires the direct deployment engine
resources:
vector_search_endpoints:
my_vector_search_endpoint:
name: my_vector_search_endpoint
endpoint_type: STANDARD
vector_search_index
Type: Map
La ressource `vector_search_index` vous permet de définir des index de recherche vectorielle dans un bundle. Pour des informations sur la recherche vectorielle, consultez la Recherche Databricks AI.
Ajouté dans la version 1.1.0 de la CLI Databricks.
vector_search_indexes:
<vector_search_index-name>:
<vector_search_index-field-name>: <vector_search_index-field-value>
Clé | Type | Description |
|---|---|---|
| Carte | Spécification pour l'Index Delta Sync. Obligatoire si Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Carte | Spécification pour l'index d'accès direct vectoriel. Obligatoire si Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Chaîne | Obligatoire. Nom de l'endpoint à utiliser pour servir l'index. Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Séquence | Les autorisations associées à l'index de recherche vectorielle. Voir l'octroi. Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Chaîne | (Bêta) Le sous-type de l'index. Les valeurs valides sont Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Chaîne | Obligatoire. Le type d'index. Les valeurs valides sont :
Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Chaîne | Obligatoire. Nom de l'index. Ajouté dans la version 1.1.0 de la CLI Databricks. |
| Chaîne | Obligatoire. Clé primaire de l'index. Ajouté dans la version 1.1.0 de la CLI Databricks. |
vector_search_index.delta_sync_index_spec
Type: Map
Spécification pour un index Delta Sync.
Ajouté dans la version 1.1.0 de la CLI Databricks.
Clé | Type | Description |
|---|---|---|
| Séquence | Facultatif. Alias pour |
| Séquence | Facultatif. Sélectionnez les colonnes à synchroniser avec l'index vectoriel. Si ce champ est vide, toutes les colonnes de la table source sont synchronisées avec l'index. La colonne de clé primaire et la colonne source d'intégration ou la colonne de vecteur d'intégration sont toujours synchronisées. |
| Séquence | Les colonnes qui contiennent la source d'intégration. |
| Séquence | Les colonnes qui contiennent les vecteurs d'intégration. |
| Chaîne | Facultatif. Nom de la table Delta pour synchroniser le contenu de l’index vectoriel et les intégrations calculées. |
| Chaîne | Mode d'exécution du pipeline. Les valeurs valides sont :
|
| Chaîne | Le nom de la table source. |
vector_search_index.direct_access_index_spec
Type: Map
Spécification d'un index d'accès direct aux vecteurs.
Ajouté dans la version 1.1.0 de la CLI Databricks.
Clé | Type | Description |
|---|---|---|
| Séquence | Les colonnes qui contiennent la source d'intégration. Le format doit être |
| Séquence | Les colonnes qui contiennent les vecteurs d'intégration. Le format doit être |
| Chaîne | Le schéma de l'index au format JSON. Les types pris en charge sont |
Exemple
L'exemple suivant définit un index de recherche vectorielle Delta Sync :
resources:
vector_search_endpoints:
my_endpoint:
name: my-endpoint
endpoint_type: STANDARD
vector_search_indexes:
my_index:
name: main.default.my_index
endpoint_name: ${resources.vector_search_endpoints.my_endpoint.name}
primary_key: id
index_type: DELTA_SYNC
delta_sync_index_spec:
source_table: main.default.source
pipeline_type: TRIGGERED
grants:
- principal: data-engineers
privileges: [SELECT]
volume (Unity Catalog)
Type: Map
Les volumes sont pris en charge dans Python pour les Declarative Automation Bundles. Voir databricks.bundles.volumes.
Le type de Ressources de volume vous permet de définir et de créer des volumes Unity Catalog dans le cadre d'un bundle. Lorsque vous déployez un bundle avec un volume défini, veuillez noter que :
- Un volume ne peut pas être référencé dans le
artifact_pathpour le bundle tant qu'il n'existe pas dans le Workspace. Par conséquent, si vous souhaitez utiliser des Bundles d’automatisation déclarative pour créer le volume, vous devez d’abord définir le volume dans le bundle, le déployer pour créer le volume, puis y faire référence dans leartifact_pathlors des déploiements ultérieurs. - Les volumes du bundle ne sont pas précédés du préfixe
dev_${workspace.current_user.short_name}lorsque la cible de déploiement a configurémode: development. Cependant, vous pouvez configurer manuellement ce préfixe. Voir les préréglages personnalisés.
Ajouté dans la version 0.236.0 de la CLI Databricks
volumes:
<volume-name>:
<volume-field-name>: <volume-field-value>
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du catalogue du schéma et du volume. Ajouté dans la version 0.236.0 de la CLI Databricks |
| Chaîne | Le commentaire joint au volume. Ajouté dans la version 0.236.0 de la CLI Databricks |
| Séquence | Les autorisations associées au volume. Voir l'octroi. Ajouté dans la version 0.236.0 de la CLI Databricks |
| Carte | Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite. Voir le cycle de vie. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Chaîne | Le nom du volume. Ajouté dans la version 0.236.0 de la CLI Databricks |
| Chaîne | Le nom du schéma où se trouve le volume. Ajouté dans la version 0.236.0 de la CLI Databricks |
| Chaîne | L'emplacement de stockage sur le cloud. Ajouté dans la version 0.236.0 de la CLI Databricks |
| Chaîne | Le type de volume, soit |
Exemple
L'exemple suivant crée un volume Unity Catalog avec la clé my_volume_id:
resources:
volumes:
my_volume_id:
catalog_name: main
name: my_volume
schema_name: my_schema
Pour un exemple de bundle qui exécute un job qui écrit dans un fichier dans un volume Unity Catalog, consultez le repository GitHub bundle-examples.
Objets courants
accorder
Type: Map
Définit le principal et les privilèges à accorder à ce principal. Pour plus d'informations sur les octrois, consultez Afficher, octroyer et révoquer les privilèges.
Clé | Type | Description |
|---|---|---|
| Chaîne | Le nom du principal auquel des privilèges seront accordés. Il peut s'agir d'un utilisateur, d'un groupe ou d'un Service Principal. |
| Séquence | Les privilèges à accorder à l'entité spécifiée. Les valeurs valides dépendent du type de ressource (par exemple, |
Exemple
L'exemple suivant définit un schéma Unity Catalog avec des autorisations :
resources:
schemas:
my_schema:
name: test-schema
grants:
- principal: users
privileges:
- SELECT
- principal: my_team
privileges:
- MANAGE
catalog_name: main
cycle de vie
Type: Map
Contient les paramètres du cycle de vie d'une ressource. Il contrôle le comportement de la ressource lorsqu'elle est déployée ou détruite.
Ajouté dans la version 0.268.0 de Databricks CLI.
Clé | Type | Description |
|---|---|---|
| Booléen | Paramètre de cycle de vie pour empêcher la destruction de la ressource. Ajouté dans la version 0.268.0 de Databricks CLI. |
| Booléen | Paramètre de cycle de vie pour déployer la ressource en mode start. Pris en charge uniquement pour les applications, les clusters et les entrepôts SQL en mode de déploiement direct. Ajouté dans Databricks CLI version 0.297.0 (applications) Ajouté dans la version 1.1.0 de Databricks CLI (clusters) Ajouté dans la version 1.2.0 de Databricks CLI (sql_warehouses) |