Aller au contenu principal

Comment utiliser GraphFrames sur Databricks

Cet article inclut des exemples de notebooks pour vous aider à démarrer start avec GraphFrames sur Databricks. GraphFrames est un package pour Apache Spark qui fournit des graphes basés sur des DataFrames. Il fournit des APIs de haut niveau en Java, Python et Scala. Il vise à fournir à la fois les fonctionnalités de GraphX et des fonctionnalités étendues tirant parti des DataFrames Spark. Cette fonctionnalité étendue inclut la recherche de motifs, la sérialisation basée sur les DataFrames et des queries de graphe très expressives.

Cet article comprend trois notebooks d’exemple : un notebook d’introduction disponible en Python et en Scala, ainsi qu’un guide utilisateur Python. Pour d'autres exemples d'utilisation de GraphFrames avec Scala, consultez le guide de l'utilisateur GraphFrames - Scala.

Recommandation Databricks Runtime pour GraphFrames

Databricks recommande d'utiliser un cluster exécutant Databricks Runtime for Machine Learning, car il inclut une installation optimisée de GraphFrames.

Si vous n'utilisez pas un cluster exécutant Databricks Runtime ML, download le fichier JAR depuis la bibliothèque GraphFrames, chargez-le sur un volume et installez-le sur votre cluster.

Démarrer avec GraphFrames

Les Notebooks suivants vous montrent comment utiliser GraphFrames pour effectuer l'analyse de graphes.

Analyse de graphe avec GraphFrames (Python)

Analyse de Graphe avec GraphFrames (Scala)

Guide d'utilisation de GraphFrames (Python)

Le notebook suivant contient des exemples de code Python sur la façon d’utiliser GraphFrames.

Notebook Python GraphFrames