Aller au contenu principal

Databricks pour les développeurs Scala

Cet article fournit un guide pour le développement de Notebooks et de Jobs dans Databricks en utilisant le langage Scala. La première section fournit des links vers des tutoriels pour les workflows et tâches courants. La deuxième section fournit des links vers des APIs, des bibliothèques et des outils clés.

Un workflow de base pour getting start est :

Au-delà de cela, vous pouvez vous diriger vers des sujets plus spécifiques :

Didacticiels

Les tutoriels ci-dessous fournissent des exemples de code et des Notebooks pour en savoir plus sur les flux de travail courants. Consultez Importer un notebook pour obtenir des instructions sur l'importation d'exemples de notebooks dans votre Workspace.

Référence

Les sous-sections ci-dessous listent les principales fonctionnalités et conseils pour vous aider à démarrer le développement dans Databricks avec Scala.

API Scala

Ces Links fournissent une introduction et une référence pour l'API Apache Spark Scala.

Gérer le code avec des Notebook et des dossiers Git Databricks

Les notebooks Databricks prennent en charge Scala. Ces notebooks offrent des fonctionnalités similaires à celles de Jupyter, mais avec des ajouts tels que des visualisations intégrées utilisant le Big Data, des intégrations Apache Spark pour le debugging et le monitoring des performances, et des intégrations MLflow pour le suivi des expérimentations de Machine Learning. Débutez en important un notebook. Une fois que vous avez accès à un cluster, vous pouvez associer un notebook au cluster et exécuter le notebook.

astuce

Pour Reset l'état de votre Notebook, redémarrez le noyau. Pour les utilisateurs de Jupyter, l'option « restart kernel » dans Jupyter correspond au démarrage d'une nouvelle session dans Databricks. Pour redémarrer le noyau dans un Notebook, cliquez sur le sélecteur de compute dans la barre d'outils du Notebook et survolez le cluster ou le SQL Warehouse attaché dans la liste pour afficher un menu latéral. Sélectionner Nouvelle session . Cela lance une nouvelle session, ce qui redémarre le processus.

Les dossiers Git de Databricks permettent aux utilisateurs de synchroniser les notebooks et d'autres fichiers avec les référentiels Git. Les dossiers Git Databricks facilitent le versionnement et la collaboration de code, et peuvent simplifier l'importation d'un repository complet de code dans Databricks, la visualisation des versions antérieures de notebook et l'intégration avec le développement IDE. start en clonant un repository Git distant. Vous pouvez ensuite ouvrir ou créer des notebooks avec le clone du repository, attacher le notebook à un cluster, et exécuter le notebook.

Clusters et bibliothèques

Databricks compute fournit une gestion du compute pour des clusters de toute taille : des clusters à nœud unique aux grands clusters. Vous pouvez personnaliser le matériel et les bibliothèques des clusters en fonction de vos besoins. Les data scientists commencent généralement à travailler soit en créant un cluster, soit en utilisant un cluster partagé existant. Une fois que vous avez accès à un cluster, vous pouvez attacher un Notebook au cluster ou exécuter un Job sur le cluster.

Les clusters Databricks utilisent un Databricks Runtime, qui fournit de nombreuses bibliothèques prêtes à l'emploi, y compris Apache Spark, Delta Lake et bien d'autres. Vous pouvez également installer des bibliothèques tierces ou personnalisées supplémentaires à utiliser avec des Notebooks et des Jobs.

Visualisations

Les Notebooks Scala Databricks ont un support intégré pour de nombreux types de visualisations. Vous pouvez également utiliser des visualisations héritées :

Interopérabilité

Cette section décrit les fonctionnalités qui prennent en charge l'interopérabilité entre Scala et SQL.

Jobs

Vous pouvez automatiser les charges de travail Scala en tant que jobs planifiés ou Trigger dans Databricks. Les tâches peuvent exécuter des Notebooks et des JAR.

IDEs, outils de développement et SDK.

En plus de développer du code Scala au sein des notebooks Databricks, vous pouvez développer en externe en utilisant des environnements de développement intégrés (IDEs) tels qu'IntelliJ IDEA. Pour synchroniser le travail entre les environnements de développement externes et Databricks, vous disposez de plusieurs options :

  • Code : Vous pouvez synchroniser le code à l’aide de Git. Voir Dossiers Git Databricks.
  • Bibliothèques et Jobs : Vous pouvez créer des bibliothèques en externe et les upload sur Databricks. Ces bibliothèques peuvent être importées dans les Notebooks Databricks, ou elles peuvent être utilisées pour créer des Jobs. Consultez Installer les bibliothèques et Lakeflow Jobs.
  • Exécution de code à distance : Vous pouvez exécuter du code depuis votre IDE local pour le développement et les tests interactifs. L'IDE peut communiquer avec Databricks pour exécuter des calculs volumineux sur les clusters Databricks. Par exemple, vous pouvez utiliser IntelliJ IDEA avec Databricks Connect.

Databricks fournit un ensemble de SDK qui prennent en charge l'automatisation et l'intégration avec des outils externes. Vous pouvez utiliser les SDK Databricks pour gérer des Ressources telles que les clusters et les bibliothèques, le code et d'autres objets Workspace, les charges de travail et les Jobs, et plus encore. Voir les SDK Databricks.

Pour plus d'information sur les IDEs, les outils de développement et les SDK, consultez Outils de développement locaux.

Ressources supplémentaires

  • La Databricks Academy propose des cours à votre rythme et animés par un instructeur sur de nombreux sujets.