Databricks pour les développeurs Scala
Cet article fournit un guide pour le développement de Notebooks et de Jobs dans Databricks en utilisant le langage Scala. La première section fournit des links vers des tutoriels pour les workflows et tâches courants. La deuxième section fournit des links vers des APIs, des bibliothèques et des outils clés.
Un workflow de base pour getting start est :
- Importez du code et exécutez-le à l'aide d'un Notebook Databricks interactif: Importez votre propre code à partir de fichiers ou de dépôts Git, ou essayez un tutoriel listé ci-dessous.
- Exécutez votre code sur un cluster: Créez votre propre cluster ou assurez-vous d'avoir les autorisations nécessaires pour utiliser un cluster partagé. Associez votre Notebook au cluster et exécutez le Notebook.
Au-delà de cela, vous pouvez vous diriger vers des sujets plus spécifiques :
- Travaillez avec des ensembles de données plus volumineux à l'aide d'Apache Spark
- Ajouter des visualisations
- Automatisez votre charge de travail en tant que Job
- Développer dans des IDEs
Didacticiels
Les tutoriels ci-dessous fournissent des exemples de code et des Notebooks pour en savoir plus sur les flux de travail courants. Consultez Importer un notebook pour obtenir des instructions sur l'importation d'exemples de notebooks dans votre Workspace.
- Didacticiel : charger et transformer les données à l'aide des DataFrames Apache Spark
- Tutoriel : Créer et gérer des tables Delta Lake fournit des exemples Scala.
- Utiliser XGBoost sur Databricks fournit un exemple Scala.
Référence
Les sous-sections ci-dessous listent les principales fonctionnalités et conseils pour vous aider à démarrer le développement dans Databricks avec Scala.
API Scala
Ces Links fournissent une introduction et une référence pour l'API Apache Spark Scala.
- Didacticiel : charger et transformer les données à l'aide des DataFrames Apache Spark
- Chaînes JSON de query
- Introduction à Structured Streaming
- Référence de l'API Apache Spark Core
- Référence de l'API ML Apache Spark
Gérer le code avec des Notebook et des dossiers Git Databricks
Les notebooks Databricks prennent en charge Scala. Ces notebooks offrent des fonctionnalités similaires à celles de Jupyter, mais avec des ajouts tels que des visualisations intégrées utilisant le Big Data, des intégrations Apache Spark pour le debugging et le monitoring des performances, et des intégrations MLflow pour le suivi des expérimentations de Machine Learning. Débutez en important un notebook. Une fois que vous avez accès à un cluster, vous pouvez associer un notebook au cluster et exécuter le notebook.
Pour Reset l'état de votre Notebook, redémarrez le noyau. Pour les utilisateurs de Jupyter, l'option « restart kernel » dans Jupyter correspond au démarrage d'une nouvelle session dans Databricks. Pour redémarrer le noyau dans un Notebook, cliquez sur le sélecteur de compute dans la barre d'outils du Notebook et survolez le cluster ou le SQL Warehouse attaché dans la liste pour afficher un menu latéral. Sélectionner Nouvelle session . Cela lance une nouvelle session, ce qui redémarre le processus.
Les dossiers Git de Databricks permettent aux utilisateurs de synchroniser les notebooks et d'autres fichiers avec les référentiels Git. Les dossiers Git Databricks facilitent le versionnement et la collaboration de code, et peuvent simplifier l'importation d'un repository complet de code dans Databricks, la visualisation des versions antérieures de notebook et l'intégration avec le développement IDE. start en clonant un repository Git distant. Vous pouvez ensuite ouvrir ou créer des notebooks avec le clone du repository, attacher le notebook à un cluster, et exécuter le notebook.
Clusters et bibliothèques
Databricks compute fournit une gestion du compute pour des clusters de toute taille : des clusters à nœud unique aux grands clusters. Vous pouvez personnaliser le matériel et les bibliothèques des clusters en fonction de vos besoins. Les data scientists commencent généralement à travailler soit en créant un cluster, soit en utilisant un cluster partagé existant. Une fois que vous avez accès à un cluster, vous pouvez attacher un Notebook au cluster ou exécuter un Job sur le cluster.
- Pour les petites charges de travail qui ne nécessitent qu'un seul nœud, les data scientist peuvent utiliser le single node compute pour réaliser des économies.
- Pour des conseils détaillés, consultez Bonnes pratiques de configuration du compute classique
- Les administrateurs peuvent configurer des politiques de clusters pour simplifier et guider la création de clusters.
Les clusters Databricks utilisent un Databricks Runtime, qui fournit de nombreuses bibliothèques prêtes à l'emploi, y compris Apache Spark, Delta Lake et bien d'autres. Vous pouvez également installer des bibliothèques tierces ou personnalisées supplémentaires à utiliser avec des Notebooks et des Jobs.
- Commencez par les bibliothèques par défaut dans les versions et compatibilité des notes de version de Databricks Runtime. Pour les listes complètes des bibliothèques préinstallées, consultez les notes de version et la compatibilité de Databricks Runtime.
- Vous pouvez également installer des bibliothèques Scala dans un cluster.
- Pour plus de détails, consultez Installer des bibliothèques.
Visualisations
Les Notebooks Scala Databricks ont un support intégré pour de nombreux types de visualisations. Vous pouvez également utiliser des visualisations héritées :
Interopérabilité
Cette section décrit les fonctionnalités qui prennent en charge l'interopérabilité entre Scala et SQL.
Jobs
Vous pouvez automatiser les charges de travail Scala en tant que jobs planifiés ou Trigger dans Databricks. Les tâches peuvent exécuter des Notebooks et des JAR.
- Pour plus de détails sur la création d’un Job via l’interface utilisateur, consultez Configurer et modifier les Lakeflow Jobs.
- Les SDK Databricks vous permettent de créer, modifier et supprimer des jobs par programme.
- Le CLI Databricks fournit une interface de ligne de commande pratique pour l'automatisation des jobs.
IDEs, outils de développement et SDK.
En plus de développer du code Scala au sein des notebooks Databricks, vous pouvez développer en externe en utilisant des environnements de développement intégrés (IDEs) tels qu'IntelliJ IDEA. Pour synchroniser le travail entre les environnements de développement externes et Databricks, vous disposez de plusieurs options :
- Code : Vous pouvez synchroniser le code à l’aide de Git. Voir Dossiers Git Databricks.
- Bibliothèques et Jobs : Vous pouvez créer des bibliothèques en externe et les upload sur Databricks. Ces bibliothèques peuvent être importées dans les Notebooks Databricks, ou elles peuvent être utilisées pour créer des Jobs. Consultez Installer les bibliothèques et Lakeflow Jobs.
- Exécution de code à distance : Vous pouvez exécuter du code depuis votre IDE local pour le développement et les tests interactifs. L'IDE peut communiquer avec Databricks pour exécuter des calculs volumineux sur les clusters Databricks. Par exemple, vous pouvez utiliser IntelliJ IDEA avec Databricks Connect.
Databricks fournit un ensemble de SDK qui prennent en charge l'automatisation et l'intégration avec des outils externes. Vous pouvez utiliser les SDK Databricks pour gérer des Ressources telles que les clusters et les bibliothèques, le code et d'autres objets Workspace, les charges de travail et les Jobs, et plus encore. Voir les SDK Databricks.
Pour plus d'information sur les IDEs, les outils de développement et les SDK, consultez Outils de développement locaux.
Ressources supplémentaires
- La Databricks Academy propose des cours à votre rythme et animés par un instructeur sur de nombreux sujets.