Shell PySpark
Cet article couvre Databricks Connect pour Databricks Runtime 14.0 et versions ultérieures.
Databricks Connect pour Python est fourni avec un binaire pyspark qui est un REPL PySpark (un Shell Spark) configuré pour utiliser Databricks Connect.
Start le Shell
Pour start le Shell Spark et le connecter à votre cluster en cours d'exécution, exécutez la commande suivante depuis votre environnement virtuel Python activé.
Lorsqu'il est starté sans parameters supplémentaires, le Shell récupère les informations d'identification par default de l'environnement (par exemple, les variables d'environnement DATABRICKS_ ou le profil de configuration DEFAULT) pour se connecter au cluster Databricks. Pour plus d'informations sur la configuration d'une connexion, consultez Configuration du compute pour Databricks Connect.
pyspark
Le Shell Spark apparaît, par exemple :
Python 3.10 ...
[Clang ...] on darwin
Type "help", "copyright", "credits" or "license" for more information.
Welcome to
____ __
/ __/__ ___ _____/ /__
_\ \/ _ \/ _ `/ __/ '_/
/__ / .__/\_,_/_/ /_/\_\ version 13.x.dev0
/_/
Using Python version 3.10 ...
Client connected to the Spark Connect server at sc://...:.../;token=...;x-databricks-cluster-id=...
SparkSession available as 'spark'.
>>>
Une fois que le Shell start, l'objet spark est disponible pour exécuter des commandes Apache Spark sur le cluster Databricks. Exécutez une simple commande PySpark, telle que spark.range(1,10).show(). S'il n'y a pas d'erreurs, vous vous êtes connecté avec succès.
Utiliser le Shell
Reportez-vous à Analyse interactive avec le Spark Shell pour plus d'informations sur la façon d'utiliser le Spark Shell avec Python pour exécuter des commandes sur votre compute.
Utilisez la variable spark intégrée pour représenter le SparkSession sur votre cluster en cours d'exécution, par exemple :
>>> df = spark.read.table("samples.nyctaxi.trips")
>>> df.show(5)
+--------------------+---------------------+-------------+-----------+----------+-----------+
|tpep_pickup_datetime|tpep_dropoff_datetime|trip_distance|fare_amount|pickup_zip|dropoff_zip|
+--------------------+---------------------+-------------+-----------+----------+-----------+
| 2016-02-14 16:52:13| 2016-02-14 17:16:04| 4.94| 19.0| 10282| 10171|
| 2016-02-04 18:44:19| 2016-02-04 18:46:00| 0.28| 3.5| 10110| 10110|
| 2016-02-17 17:13:57| 2016-02-17 17:17:55| 0.7| 5.0| 10103| 10023|
| 2016-02-18 10:36:07| 2016-02-18 10:41:45| 0.8| 6.0| 10022| 10017|
| 2016-02-22 14:14:41| 2016-02-22 14:31:52| 4.51| 17.0| 10110| 10282|
+--------------------+---------------------+-------------+-----------+----------+-----------+
only showing top 5 rows
Tout le code Python s'exécute localement, tandis que tout le code PySpark impliquant des opérations DataFrame s'exécute sur le cluster dans l'espace de travail Databricks distant et les réponses d'exécution sont renvoyées à l'appelant local.
Arrêter le Shell
Pour arrêter le Shell Spark, appuyez sur Ctrl + d ou Ctrl + z, ou exécutez la commande quit() ou exit().