Aller au contenu principal

Shell PySpark

remarque

Cet article couvre Databricks Connect pour Databricks Runtime 14.0 et versions ultérieures.

Databricks Connect pour Python est fourni avec un binaire pyspark qui est un REPL PySpark (un Shell Spark) configuré pour utiliser Databricks Connect.

Start le Shell

Pour start le Shell Spark et le connecter à votre cluster en cours d'exécution, exécutez la commande suivante depuis votre environnement virtuel Python activé.

remarque

Lorsqu'il est starté sans parameters supplémentaires, le Shell récupère les informations d'identification par default de l'environnement (par exemple, les variables d'environnement DATABRICKS_ ou le profil de configuration DEFAULT) pour se connecter au cluster Databricks. Pour plus d'informations sur la configuration d'une connexion, consultez Configuration du compute pour Databricks Connect.

Bash
pyspark

Le Shell Spark apparaît, par exemple :

Output
Python 3.10 ...
[Clang ...] on darwin
Type "help", "copyright", "credits" or "license" for more information.
Welcome to
____ __
/ __/__ ___ _____/ /__
_\ \/ _ \/ _ `/ __/ '_/
/__ / .__/\_,_/_/ /_/\_\ version 13.x.dev0
/_/

Using Python version 3.10 ...
Client connected to the Spark Connect server at sc://...:.../;token=...;x-databricks-cluster-id=...
SparkSession available as 'spark'.
>>>

Une fois que le Shell start, l'objet spark est disponible pour exécuter des commandes Apache Spark sur le cluster Databricks. Exécutez une simple commande PySpark, telle que spark.range(1,10).show(). S'il n'y a pas d'erreurs, vous vous êtes connecté avec succès.

Utiliser le Shell

Reportez-vous à Analyse interactive avec le Spark Shell pour plus d'informations sur la façon d'utiliser le Spark Shell avec Python pour exécuter des commandes sur votre compute.

Utilisez la variable spark intégrée pour représenter le SparkSession sur votre cluster en cours d'exécution, par exemple :

>>> df = spark.read.table("samples.nyctaxi.trips")
>>> df.show(5)
+--------------------+---------------------+-------------+-----------+----------+-----------+
|tpep_pickup_datetime|tpep_dropoff_datetime|trip_distance|fare_amount|pickup_zip|dropoff_zip|
+--------------------+---------------------+-------------+-----------+----------+-----------+
| 2016-02-14 16:52:13| 2016-02-14 17:16:04| 4.94| 19.0| 10282| 10171|
| 2016-02-04 18:44:19| 2016-02-04 18:46:00| 0.28| 3.5| 10110| 10110|
| 2016-02-17 17:13:57| 2016-02-17 17:17:55| 0.7| 5.0| 10103| 10023|
| 2016-02-18 10:36:07| 2016-02-18 10:41:45| 0.8| 6.0| 10022| 10017|
| 2016-02-22 14:14:41| 2016-02-22 14:31:52| 4.51| 17.0| 10110| 10282|
+--------------------+---------------------+-------------+-----------+----------+-----------+
only showing top 5 rows

Tout le code Python s'exécute localement, tandis que tout le code PySpark impliquant des opérations DataFrame s'exécute sur le cluster dans l'espace de travail Databricks distant et les réponses d'exécution sont renvoyées à l'appelant local.

Arrêter le Shell

Pour arrêter le Shell Spark, appuyez sur Ctrl + d ou Ctrl + z, ou exécutez la commande quit() ou exit().