Aller au contenu principal

Vue d'ensemble d'Apache Spark

Apache Spark est la technologie qui alimente les clusters de compute et les SQL Warehouse dans Databricks.

Cette page fournit une présentation de la documentation de cette section.

Get start

Démarrer avec Apache Spark sur Databricks.

Sujet

Description

Apache Spark sur Databricks

Obtenez des réponses aux questions fréquemment posées sur Apache Spark sur Databricks.

Didacticiel : charger et transformer les données à l'aide des DataFrames Apache Spark

Suivez un guide étape par étape pour travailler avec les DataFrames Spark en Python, R ou Scala pour le chargement des données et les Transformations.

Principes de base de PySpark

Apprenez les fondamentaux de l'utilisation de PySpark en parcourant des exemples simples.

Sujet

Description

Apache Spark sur Databricks

Obtenez des réponses aux questions fréquemment posées sur Apache Spark sur Databricks.

Didacticiel : charger et transformer les données à l'aide des DataFrames Apache Spark

Suivez un guide étape par étape pour travailler avec les DataFrames Spark en Python, R ou Scala pour le chargement des données et les Transformations.

Principes de base de PySpark

Apprenez les fondamentaux de l'utilisation de PySpark en parcourant des exemples simples.

Ressources supplémentaires

Explorez d'autres capacités Spark et la documentation.

Sujet

Description

Comparer Spark Connect à Spark Classic

Découvrez les différences clés entre Spark Connect et Spark Classic en termes de comportement d'exécution et d'analyse pour éviter les comportements inattendus et les problèmes de performances lors de la migration de code.

Définir les propriétés de configuration Spark sur Databricks

Définissez les propriétés de configuration Spark pour personnaliser les paramètres de votre environnement de compute et optimiser les performances.

Référence des options Spark API

Recherchez DataFrameReader, DataFrameWriter et les options d'API associées au même endroit.

streaming structuré

Lisez une vue d'ensemble de Structured Streaming, un moteur de traitement quasi temps réel.

Diagnostiquer les problèmes de coût et de performance à l'aide de la Spark UI

Apprenez à utiliser Spark UI pour l’ajustement des performances, le debugging et l’optimisation des coûts des Job Spark.

Utilisez Apache Spark MLlib sur Databricks

Distributed Machine Learning using Spark MLlib and integration with popular ML frameworks.

Sujet

Description

Comparer Spark Connect à Spark Classic

Découvrez les différences clés entre Spark Connect et Spark Classic en termes de comportement d'exécution et d'analyse pour éviter les comportements inattendus et les problèmes de performances lors de la migration de code.

Définir les propriétés de configuration Spark sur Databricks

Définissez les propriétés de configuration Spark pour personnaliser les paramètres de votre environnement de compute et optimiser les performances.

Référence des options Spark API

Recherchez DataFrameReader, DataFrameWriter et les options d'API associées au même endroit.

streaming structuré

Lisez une vue d'ensemble de Structured Streaming, un moteur de traitement quasi temps réel.

Diagnostiquer les problèmes de coût et de performance à l'aide de la Spark UI

Apprenez à utiliser Spark UI pour l’ajustement des performances, le debugging et l’optimisation des coûts des Job Spark.

Utilisez Apache Spark MLlib sur Databricks

Distributed Machine Learning using Spark MLlib and integration with popular ML frameworks.

Spark API

Travaillez avec Spark en utilisant votre langage de programmation préféré.

Sujet

Description

Référence des APIs Apache Spark

Aperçu de la référence API pour Apache Spark, y compris les liens vers la référence pour les opérations Spark SQL, DataFrames et RDD dans les langues prises en charge.

pyspark

Utilisez Python avec Spark, y compris les bases de PySpark, les sources de données personnalisées et les optimisations spécifiques à Python.

API Pandas sur Spark

Tirez parti de la syntaxe familière de pandas avec l'évolutivité de Spark pour le traitement distribué des données.

R pour Spark

Travaillez avec R et Spark en utilisant SparkR et sparklyr pour l'informatique statistique et l'analyse de données.

Scala pour Spark

Développer des Spark applications hautes performances en Scala avec les Spark APIs natives et la sécurité de type.

Sujet

Description

Référence des APIs Apache Spark

Aperçu de la référence API pour Apache Spark, y compris les liens vers la référence pour les opérations Spark SQL, DataFrames et RDD dans les langues prises en charge.

pyspark

Utilisez Python avec Spark, y compris les bases de PySpark, les sources de données personnalisées et les optimisations spécifiques à Python.

API Pandas sur Spark

Tirez parti de la syntaxe familière de pandas avec l'évolutivité de Spark pour le traitement distribué des données.

R pour Spark

Travaillez avec R et Spark en utilisant SparkR et sparklyr pour l'informatique statistique et l'analyse de données.

Scala pour Spark

Développer des Spark applications hautes performances en Scala avec les Spark APIs natives et la sécurité de type.