Aller au contenu principal

Utilisez Genie Code pour le développement de pipelines

info

Aperçu

Cette fonctionnalité est en aperçu public.

Genie Code en mode Agent est le partenaire IA de Data Engineering pour les développeurs dans l'Éditeur de LakeFlow Pipelines. Il explore les données, génère et exécute le code du pipeline, et corrige les erreurs à partir d'une seule invite.

remarque

Cette page décrit comment utiliser Genie Code pour développer et migrer des pipelines Spark Declarative Pipelines sur Lakeflow (SDP). Pour convertir un SQL hérité d'autres dialectes, tels que T-SQL, Snowflake ou Oracle, vers ANSI SQL, utilisez plutôt le convertisseur agentique Lakebridge. Consultez Convertissez du SQL avec le convertisseur agentique Lakebridge.

Qu'est-ce que Genie Code pour le développement de pipelines ?

Genie Code en mode Agent est un partenaire autonome qui peut automatiser des workflows de data engineering multi-étapes entiers dans l'éditeur LakeFlow Pipelines.

Utilisez l'agent Data Engineering.

Comparé au mode de discussion Genie Code, le mode Agent offre des capacités étendues : planification d'une solution, récupération des assets pertinents, exécution de code, utilisation des sorties de pipeline pour améliorer les résultats, correction automatique des erreurs, et plus encore.

Genie Code en mode Agent peut planifier et générer des pipelines entiers de bout en bout à partir de zéro, ou accélérer le travail sur un pipeline existant. L'agent travaille avec vous pour approuver ses plans et confirmer ses prochaines étapes avant de poursuivre. Avec votre approbation, Genie Code peut utiliser des outils pour effectuer des tâches telles que la recherche de tables, la modification d'un fichier source SQL ou Python, l'exécution de mises à jour de pipeline et la lecture de datasets de pipeline.

L'accès et les actions de Genie Code sont régis par les autorisations de l'utilisateur. Il peut uniquement accéder aux données auxquelles vous avez accès et effectuer des opérations pour lesquelles vous avez des autorisations.

remarque

Lorsque vous activez le mode Agent dans Genie Code, Genie Code adapte ses capacités en fonction des fonctionnalités que vous utilisez actuellement dans Databricks. Par exemple, dans l'éditeur de Lakeflow Pipelines, Genie Code se concentre sur l'édition de pipelines et les tâches de data engineering. Dans les Notebooks et l'Éditeur SQL, Genie Code prend en charge l'exploration et l'analyse des données. Consultez Utiliser Genie Code pour la data science pour plus d'informations.

Exigences

Pour utiliser Genie Code pour le Data Engineering, votre Workspace doit remplir les conditions suivantes :

Utilisez Genie Code pour le développement de pipelines

Pour utiliser les capacités agentiques de Genie Code pour le développement de pipelines :

  1. Depuis Lakeflow Pipelines Editor, ouvrez le panneau latéral Genie Code en cliquant sur Icône de code Sparkle genie. **Genie Code** dans le coin supérieur droit de votre workspace.

  2. Dans le coin inférieur droit, sélectionnez Agent . Cela active le mode Agent de Genie Code, vous permettant d'utiliser les capacités de Data Engineering agentiques de Genie Code.

  3. Saisissez une invite pour Genie Code. Par exemple, vous pouvez lui poser des questions sur votre pipeline, telles que « décrire ce pipeline ». Vous pouvez également lui demander d'ajouter de nouveaux datasets, par exemple, « créer silver_sales_data dans un nouveau fichier qui lit à partir de bronze_sales_data, nettoie les données et ajoute des attentes de qualité utiles. »

remarque

Genie Code respecte les autorisations Unity Catalog de l’utilisateur ; il ne peut donc accéder qu’aux données et à la source du pipeline auxquels vous avez accès.

  1. Quand Genie Code génère sa réponse, il se met souvent en pause pour obtenir votre avis :

    • Pour les tâches plus complexes, Genie Code peut créer un plan étape par étape et poser des questions de clarification. Répondez à ses questions de clarification pour l'aider à affiner son plan.

    • Lorsque Genie Code doit exécuter du code ou mettre à jour un pipeline, il demande votre approbation avant de procéder. Autoriser ou Refuser sa demande. Vous pouvez également sélectionner Autoriser dans ce fil (faisant référence au fil de conversation Genie Code) ou Toujours autoriser .

important

Genie Code en mode Agent peut générer et exécuter du code dans votre pipeline. Bien qu'il dispose de garde-fous pour prévenir les actions dangereuses, il existe toujours un risque. Vous ne devez l'utiliser qu'avec des données auxquelles vous faites confiance, et vous devez examiner le code avant de l'exécuter.

  • À mesure que Genie Code poursuit son travail, vous pouvez être invité à sélectionner Continuer ou Rejeter. Examinez son travail existant, puis sélectionnez Continuer pour l'autoriser à passer aux étapes suivantes ou Rejeter pour lui demander d'essayer autre chose.

  • Pour arrêter Genie Code pendant qu'il fonctionne, cliquez sur le rouge Icône d'arrêt..

Genie Code peut créer de nouveaux fichiers, générer du texte, des queries et du code, exécuter les fichiers ou les pipelines et accéder aux datasets de sortie pour interpréter les résultats.

remarque

Afin que Genie Code continue son travail et passe aux étapes suivantes, vous devez rester sur le current tab sur lequel il travaille.

astuce

Vous pouvez ajouter des instructions à Genie Code à utiliser dans la plupart des réponses. Par exemple, si vous avez des conventions de code que vous souhaitez utiliser, ou des bibliothèques préférées, vous pouvez ajouter ces directives aux instructions pour Genie Code. Vous pouvez également créer des compétences pour étendre Genie Code avec des capacités spécialisées pour vos tâches spécifiques à un domaine. Pour plus de détails et d'autres conseils, consultez Conseils pour améliorer les réponses de Genie Code.

Fonctionnalités du mode Agent

En mode Agent, Genie Code peut aider à la plupart des tâches de développement de pipeline. Les principales capacités incluent :

  • Découverte des données : Genie Code peut rechercher des tables dans le Workspace pour vous aider à trouver les données requises pour une tâche.
  • Modifications du code de pipeline : Genie Code peut créer et modifier plusieurs fichiers à la fois. Il vous tient informé des fichiers qu'il modifie et vous montre la différence de code dans chaque fichier, afin que vous puissiez examiner les modifications individuellement ou toutes ensemble à la fin.
  • Exécution de pipeline : Genie Code peut exécuter des fichiers individuels, simuler/exécuter le pipeline ou effectuer un refresh complet. Lorsque Genie Code souhaite continuer, il vous demande votre confirmation avant de le faire.
  • Comprendre et améliorer le comportement des pipelines : Genie Code peut inspecter les datasets et les sorties de pipeline pour vous aider à comprendre ce qu'un pipeline fait de bout en bout et pourquoi. Par exemple, il peut résumer les transformations, tracer le flux de données dans les tables en aval et mettre en évidence les modifications inattendues dans les nombres de lignes ou les schémas. Lorsqu'il détecte des problèmes potentiels de qualité des données, Genie Code peut vous aider à en comprendre la cause et à suggérer où et comment les résoudre dans le pipeline.

Ces capacités prennent en charge des cas d'utilisation courants, tels que :

  • Création d'un nouveau pipeline : Genie Code peut vous aider à toutes les étapes de la création d'un nouveau pipeline d'architecture en médaillon, de l'ingestion des données à leur standardisation, leur nettoyage, leur transformation et leur analyse.
  • Expliquer un pipeline : Genie Code peut analyser et expliquer un pipeline existant pour vous aider à monter en puissance rapidement.
  • Corriger les problèmes : en cas d'erreurs, Genie Code peut aider à diagnostiquer et à résoudre les problèmes, en itérant sur plusieurs fichiers jusqu'à ce que le problème soit résolu.

Migrer d'autres frameworks ETL vers les LakeFlow pipelines

info

Bêta

Cette fonctionnalité est en Bêta.

Genie Code peut migrer un projet de transformation de données existant vers un LakeFlow pipeline. Vous le dirigez vers votre projet upload, et il planifie et exécute la migration de bout en bout. Cette fonctionnalité de migration fait partie de Lakebridge et est également disponible via le transpileur Lakebridge Switch.

remarque

La migration ne prend en charge que les projets dbt et Informatica. La prise en charge de sources supplémentaires est prévue.

Migrer un projet

  1. Upload the project to Databricks. Utilisez l'une des options suivantes :

    • Catalogue : ouvrez un volume, puis upload vers ce volume .
    • Workspace : ouvrez un répertoire, puis cliquez sur Icône du menu kebab. > Importer .
  2. Créer un pipeline Lakeflow vide. Accédez à Jobs et pipelines et créez un pipeline ETL .

  3. Demandez à Genie Code de le migrer. Ouvrez Genie Code et indiquez-lui le chemin d'accès à votre projet upload, par exemple :

prompt

Migrer le projet à l’emplacement /Volumes/my_catalog/my_schema/my_volume/my_project

Fonctionnement de la migration

Après avoir start la migration, Genie Code génère un plan puis l'exécute :

  1. **Lisez la source.** Il lit le projet source pour comprendre ses modèles, Transformations et dépendances.
  2. Recueillir les entrées. Il marque une pause pour demander les entrées nécessaires, par exemple s'il faut générer la source de pipeline SQL ou Python.
  3. Recherchez et générez une représentation intermédiaire (RI). Il analyse le projet et construit une représentation intermédiaire qui capture la logique du pipeline indépendamment de l'outil source.
  4. Convertir, valider et réparer. Il convertit l'IR en source de pipeline, valide le résultat et effectue une itération dans une boucle de réparation jusqu'à ce que le pipeline soit correct.
remarque

Passez en revue la source du pipeline migré et exécutez le pipeline pour confirmer que les résultats correspondent au projet original avant de vous y fier en production.

Exemples

Essayez les invites suivantes pour start :

  • "Créez et exécutez un pipeline d'architecture en médaillon pour la détection de fraudes à l'aide des transactions de table et des clients dans my_catalog.my_schema."
  • "Expliquez chaque étape de ce pipeline."
  • « Corriger l'échec dans ce pipeline. »

Ressources supplémentaires