Aller au contenu principal

Utiliser Genie Code avec le Runtime d’IA

info

Aperçu

Cette fonctionnalité est en Aperçu public.

Genie Code vous aide à développer et à dépanner des charges de travail de deep learning dans des notebooks connectés à AI Runtime. Il peut générer du code d’entraînement distribué, résoudre des problèmes d’environnement et de dépendances, et enquêter sur les défaillances des charges de travail GPU.

Genie Code crée et exécute une charge de travail d’entraînement CNN distribuée sur huit GPU H100 dans un notebook AI Runtime.

Exigences

Pour utiliser Genie Code avec l’IA Runtime :

Get start

  1. Ouvrir un notebook Databricks.

  2. Connectez le notebook à AI Runtime. Voir Se connecter à AI Runtime.

  3. Ouvrez le volet Genie Code.

  4. Décrivez la charge de travail que vous souhaitez développer ou le problème que vous souhaitez résoudre.

  5. Examinez le plan proposé, les modifications de code et les actions avant de les approuver.

important

Genie Code peut faire des erreurs. Examinez le code généré, les modifications d’environnement et les autres actions proposées avant de les exécuter. Certains diagnostics nécessitent des logs supplémentaires ou un contexte de charge de travail.

En quoi Genie Code peut-il vous aider ?

Développer des charges de travail d’entraînement distribué

Genie Code peut générer ou mettre à jour du code d’entraînement pour AI Runtime. Cela peut vous aider à sélectionner une stratégie distribuée PyTorch appropriée, à utiliser l’API @distributed du package serverless_gpu et à appliquer les modèles AI Runtime pour le chargement des données, la création de points de contrôle et le suivi MLflow. Pour plus de détails et d’exemples sur l’API, consultez Entraînement distribué dans les notebooks.

Résoudre les problèmes d’environnement et de dépendances

Genie Code peut inspecter l’environnement actuel, distinguer les échecs de compatibilité des packages des modifications de code ou d’API, et recommander des correctifs ciblés. Il peut également vous aider à choisir entre les environnements Databricks AI et Standard en fonction des dépendances de votre charge de travail. Pour plus d’informations sur les environnements disponibles, consultez Configurer votre environnement.

Déboguer les charges de travail GPU et distribuées

Genie Code peut utiliser la sortie du notebook et les logs disponibles pour enquêter sur les échecs d’entraînement distribué, les erreurs de communication, les blocages d’entraînement et les problèmes de mémoire GPU. Cela peut aider à identifier la défaillance initiale et à la distinguer des erreurs en aval sur d’autres rangs. Pour plus d’informations sur la consultation des logs d’entraînement distribué, consultez Suivi des expérimentations et observabilité.

Exemples d’invites

Développer des charges de travail d’entraînement distribué

  • « Mettre à jour ce notebook pour exécuter un entraînement distribué sur les huit GPU H100 dans AI Runtime. »
  • « Examinez ce notebook d’entraînement distribué et corrigez son utilisation de serverless_gpu et de MLflow. »
  • « Adaptez cette charge de travail d’entraînement pour l’IA Runtime et expliquez les changements importants. »

Résoudre les problèmes d’environnement et de dépendances

  • « Ce notebook a cessé de fonctionner après l’installation d’un nouveau package. Inspectez l’environnement et déterminez si le problème provient d’une dépendance ou d’une modification de l’API de code."
  • « Cette charge de travail doit-elle utiliser l’environnement Databricks AI ou Standard ? Vérifiez ses dépendances et recommandez un environnement avant de modifier quoi que ce soit. »
  • « Diagnostiquez cette erreur de compatibilité de package et recommandez le changement le plus minime approprié. »

Déboguer les charges de travail GPU et distribuées

  • « Analysez cette exécution d’entraînement distribué ayant échoué en utilisant la sortie disponible de chaque rang et identifiez la cause racine. »
  • « Pourquoi cette charge de travail distribuée est-elle bloquée ? Utilisez la sortie du Notebook pour recommander la prochaine étape de debugging."
  • « Analyser cette défaillance de mémoire GPU et recommander une étape suivante fondée sur des preuves. »

Ressources supplémentaires