Référence pour les APIs Apache Spark
Databricks est basé sur Apache Spark, un moteur de unified analytics pour le Big Data et le Machine Learning. Pour plus d'information, consultez la vue d'ensemble d'Apache Spark.
Apache Spark dispose d'APIs DataFrame pour travailler sur de grands datasets, qui incluent plus de 100 opérateurs, en plusieurs langages.
-
APIs PySpark pour les développeurs Python. Consultez le Didacticiel : Charger et transformer des données à l'aide des DataFrames Apache Spark. Les classes clés incluent :
- SparkSession : le point d'entrée pour la programmation Spark avec l'API Dataset et DataFrame.
- DataFrame – Une collection distribuée de données regroupées en colonnes nommées. Voir DataFrames et MLlib basé sur les DataFrames.
-
(Obsolète) APIs SparkR pour les développeurs R. Les classes clés comprennent :
- SparkSession – SparkSession est le point d'entrée de SparkR. Consultez Point de départ : SparkSession.
- SparkDataFrame – Une collection distribuée de données regroupées en colonnes nommées. Voir Datasets et DataFrames, Création de DataFrames et Création de SparkDataFrames.
-
APIs Scala pour les développeurs Scala. Les classes clés comprennent :
- SparkSession — Le point d’entrée de la programmation Spark avec l’API Dataset et DataFrame. Consultez Point de départ : SparkSession.
- Dataset – une collection fortement typée d'objets spécifiques à un domaine qui peut être transformée en parallèle à l'aide d'Opérations fonctionnelles ou relationnelles. Chaque
Datasetdispose également d'une vue non typée appelée DataFrame, qui est unDatasetde Ligne. Voir Datasets et DataFrames, Création de Datasets, Création de DataFrames et fonctions de DataFrame.
-
APIs Java pour les développeurs Java. Les classes clés comprennent :
- SparkSession — Le point d’entrée de la programmation Spark avec l’API Dataset et DataFrame. Consultez Point de départ : SparkSession.
- Dataset – une collection fortement typée d'objets spécifiques à un domaine qui peut être transformée en parallèle à l'aide d'Opérations fonctionnelles ou relationnelles. Chaque
Datasetdispose également d'une vue non typée appelée DataFrame, qui est unDatasetde Ligne. Voir Datasets et DataFrames, Création de Datasets, Création de DataFrames et fonctions de DataFrame.
Pour savoir comment utiliser les APIs Apache Spark sur Databricks, voir :
- PySpark sur Databricks
- Databricks pour les développeurs R
- Databricks pour les développeurs Scala
- Pour Java, vous pouvez exécuter du code Java en tant que JAR Job.