Déplacer un fichier de préparation de données visuelles en production
Chaque fichier de préparation de données visuelles que vous créez dans Lakeflow Designer est basé sur un code prêt pour la production et stocké en tant que Notebook nommé <name>.designer.ipynb. Vous pouvez le déplacer en production avec les mêmes outils que ceux que vous utilisez pour les autres codes Databricks : stockez-le dans Git, exécutez-le en tant que Job et déployez-le avec Declarative Automation Bundles.
Cette page explique comment faire passer un fichier de préparation de données visuelles du prototype à la production.
Stocker et versionner dans Git
Le workspace stocke les fichiers de préparation visuelle des données en mode natif. Pour versionner un fichier de préparation visuelle des données, placez-le dans un dossier Git et suivez-le comme n'importe quel autre notebook :
- Créez un dossier Git dans votre Workspace.
- Déplacez le fichier de préparation visuelle des données dans ce dossier Git.
- Suivez, commit, et versionnez le fichier comme tout autre Notebook dans Git. Dans Git, le fichier apparaît comme
<file_name>.designer.ipynb.
Pour en savoir plus sur les dossiers Git, consultez Dossiers Git Databricks. Pour exporter ou importer un fichier de préparation de données visuelles, consultez Exporter et importer un fichier de préparation de données visuelles.
Planifiez en tant que job
Vous pouvez automatiser un fichier de préparation visuelle de données en le planifiant comme un Job.
- Planifiez directement : Cliquez sur le bouton Schedule dans le menu supérieur pour créer un job planifié pour votre fichier de préparation visuelle des données.
- Ajouter à un Job : Créez un Job Databricks et ajoutez votre fichier de préparation des données visuelles en tant que tâche. Cela vous permet de combiner ce fichier de préparation des données visuelles avec d'autres tâches dans un pipeline plus grand. Dans la liste déroulante Type de tâche, sélectionnez Préparation des données visuelles , puis sélectionnez le fichier.
Les exécutions planifiées affichent chaque opérateur comme un nœud individuel dans le graphe de tâches des Jobs, vous pouvez ainsi inspecter les résultats par opérateur dans une exécution de la même manière que sur la toile.
Pour afficher et gérer les plannings existants, cliquez à nouveau sur Planning pour ouvrir la liste. Cliquez sur Ajouter un planning pour en créer un autre, ou ouvrez le menu kebab d'un planning pour l' Modifier , l' Exécuter maintenant , le Mettre en pause , le Cloner , l' Afficher dans les jobs ou le Supprimer .
Afficher la sortie de l'opérateur dans une exécution
Par default, une exécution planifiée génère une sortie uniquement pour les opérateurs terminaux (opérateurs sans connexion en aval), tels qu'un opérateur de sortie. Pour afficher les résultats de chaque opérateur de l'exécution, développez **Paramètres avancés** dans la boîte de dialogue de planification et sélectionnez **Afficher la sortie de l'opérateur**.

Désactivez cette option pour les grands canevas afin d’éviter de dépasser la limite de taille de la sortie d'exécution.
Sélectionnez l'environnement Serverless
Lorsque vous travaillez avec un fichier de préparation visuelle de données, vous pouvez sélectionner l'environnement serverless utilisé pour les exécutions interactives et les Jobs planifiés. Configurez-le à partir du panneau latéral Environnement dans la barre latérale droite, de la même manière que pour un notebook. Sous Environnement de base , sélectionnez une version d'environnement. Consultez Configurez l'environnement serverless.
Paramétrer pour tous les environnements
Les parameters sont des valeurs nommées définies pour le fichier de préparation de données visuelles dans son ensemble que vous pouvez référencer à partir des opérateurs SQL et Python. Pour plus de détails sur la définition et le référencement des parameters, consultez Parameters.
Les parameters vous permettent d'exécuter le même fichier de préparation visuelle des données dans différents environnements, par exemple, un catalogue de test pendant le développement et un catalogue de production en production.
- Lorsque vous planifiez un Job dans l'UI : remplacez les valeurs de parameter pour chaque planification. Par exemple, créez une planification qui s'exécute avec un paramètre
environmentdéfini surtestet une autre qui s'exécute avec celui-ci défini surproduction. - Lorsque vous déployez avec un bundle : définissez les valeurs des parameters via le
parametersdu Job, et utilisez les cibles de bundle pour fournir des valeurs différentes par environnement. Les cibles de développement et de production de bundle vous permettent de déployer le même Job dans des environnements distincts avec des paramètres spécifiques à l'environnement. Consultez les modes de déploiement de Declarative Automation Bundles et la configuration de Declarative Automation Bundles.
Lors de l'exécution, un fichier de préparation de données visuelles lit ses parameters de la même manière, qu'il s'exécute de manière interactive ou en tant que Job, de sorte que le même fichier fonctionne dans tous vos environnements sans modifications.
Lecture à partir de différentes tables par environnement
Pour lire à partir d'une table source différente dans chaque environnement, utilisez un opérateur SQL avec des paramètres au lieu d'un opérateur Source fixe. Définissez les paramètres catalog, schema et table, puis référencez-les avec la clause IDENTIFIER() pour créer dynamiquement le nom de la table :
SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)
Remplacez les parameters catalog, schema ou table par planning ou par cible de bundle pour pointer le même fichier de préparation de données visuelles vers les données de test pendant le développement et vers les données de production en production. Pour en savoir plus sur la clause IDENTIFIER(), consultez la clause IDENTIFIER.
Déployer avec des Declarative Automation Bundles
Les Declarative Automation Bundles vous permettent de définir et de déployer des Ressources Databricks, telles que des Jobs, en tant que fichiers source, afin que vous puissiez appliquer les meilleures pratiques d'ingénierie logicielle, telles que la gestion de version, la révision de code, les tests et le CI/CD, à vos fichiers de préparation de données visuelles. Consultez Que sont les Declarative Automation Bundles ?.
Pour déployer un fichier de préparation de données visuelles avec un bundle, définissez une tâche Notebook et référencez le chemin d'accès au fichier .designer.ipynb dans notebook_task.notebook_path. Dans un bundle, un fichier de préparation de données visuelles utilise la clé notebook_task, même si l'interface utilisateur des tâches l'affiche comme un type de tâche Préparation visuelle des données .
L'exemple suivant définit un Job qui exécute un fichier de préparation de données visuelles situé à côté du fichier de configuration du bundle :
resources:
jobs:
daily_prep_job:
name: daily_prep_job
tasks:
- task_key: run_visual_data_prep
notebook_task:
notebook_path: ./my_transformation.designer.ipynb
Déployez et exécutez le bundle avec le CLI Databricks :
databricks bundle deploy
databricks bundle run daily_prep_job
Pour l'ensemble complet des clés de tâche de Notebook, consultez Tâche de Notebook. Pour une présentation complète de la définition d'un Job dans un bundle, consultez Développer un Job avec des Declarative Automation Bundles.
Automatisez avec CI/CD
Pour valider et déployer automatiquement les bundles de préparation visuelle de données, intégrez-les dans un pipeline CI/CD. Pour un exemple utilisant GitHub Actions, consultez GitHub Actions.