Vue d'ensemble d'Apache Spark
Apache Spark est la technologie qui alimente les clusters de compute et les SQL Warehouse dans Databricks.
Cette page fournit une présentation de la documentation de cette section.
Get start
Démarrer avec Apache Spark sur Databricks.
Sujet | Description |
|---|---|
Obtenez des réponses aux questions fréquemment posées sur Apache Spark sur Databricks. | |
Didacticiel : charger et transformer les données à l'aide des DataFrames Apache Spark | Suivez un guide étape par étape pour travailler avec les DataFrames Spark en Python, R ou Scala pour le chargement des données et les Transformations. |
Apprenez les fondamentaux de l'utilisation de PySpark en parcourant des exemples simples. |
Ressources supplémentaires
Explorez d'autres capacités Spark et la documentation.
Sujet | Description |
|---|---|
Découvrez les différences clés entre Spark Connect et Spark Classic en termes de comportement d'exécution et d'analyse pour éviter les comportements inattendus et les problèmes de performances lors de la migration de code. | |
Définir les propriétés de configuration Spark sur Databricks | Définissez les propriétés de configuration Spark pour personnaliser les paramètres de votre environnement de compute et optimiser les performances. |
Recherchez DataFrameReader, DataFrameWriter et les options d'API associées au même endroit. | |
Lisez une vue d'ensemble de Structured Streaming, un moteur de traitement quasi temps réel. | |
Diagnostiquer les problèmes de coût et de performance à l'aide de la Spark UI | Apprenez à utiliser Spark UI pour l’ajustement des performances, le debugging et l’optimisation des coûts des Job Spark. |
Distributed Machine Learning using Spark MLlib and integration with popular ML frameworks. |
Spark API
Travaillez avec Spark en utilisant votre langage de programmation préféré.
Sujet | Description |
|---|---|
Aperçu de la référence API pour Apache Spark, y compris les liens vers la référence pour les opérations Spark SQL, DataFrames et RDD dans les langues prises en charge. | |
Utilisez Python avec Spark, y compris les bases de PySpark, les sources de données personnalisées et les optimisations spécifiques à Python. | |
Tirez parti de la syntaxe familière de pandas avec l'évolutivité de Spark pour le traitement distribué des données. | |
Travaillez avec R et Spark en utilisant SparkR et sparklyr pour l'informatique statistique et l'analyse de données. | |
Développer des Spark applications hautes performances en Scala avec les Spark APIs natives et la sécurité de type. |