Aller au contenu principal

Connecteur GitHub

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

Le connecteur GitHub géré dans Lakeflow Connect vous permet d'ingérer des données de GitHub vers Databricks.

Disponibilité des fonctionnalités

Fonctionnalité

Disponibilité

Conception de pipelines via l'interface utilisateur

coché oui Pris en charge

Création de pipeline par API

coché oui Pris en charge

Declarative Automation Bundles

coché oui Pris en charge

Ingestion incrémentielle

coché oui Partiellement pris en charge

Certaines tables prennent en charge l'ingestion incrémentielle. D'autres tables nécessitent un full refresh. Voir données prises en charge.

Gouvernance Unity Catalog

coché oui Pris en charge

Tâches Lakeflow

coché oui Pris en charge

SCD de type 2

coché oui Pris en charge

Sélection et désélection de colonne

coché oui Pris en charge

Filtrage des lignes basé sur l'API

x marquer non Non pris en charge

Évolution automatique des schémas : Nouvelles colonnes et colonnes supprimées

x marquer non Non pris en charge

Évolution automatisée des schémas : changements de type de données

x marquer non Non pris en charge

évolution des schémas automatisée : Renommage de colonnes

x marquer non Non pris en charge

Évolution des schémas automatisée : nouvelles tables

x marquer non Non pris en charge

Fonctionnalité

Disponibilité

Conception de pipelines via l'interface utilisateur

coché oui Pris en charge

Création de pipeline par API

coché oui Pris en charge

Declarative Automation Bundles

coché oui Pris en charge

Ingestion incrémentielle

coché oui Partiellement pris en charge

Certaines tables prennent en charge l'ingestion incrémentielle. D'autres tables nécessitent un full refresh. Voir données prises en charge.

Gouvernance Unity Catalog

coché oui Pris en charge

Tâches Lakeflow

coché oui Pris en charge

SCD de type 2

coché oui Pris en charge

Sélection et désélection de colonne

coché oui Pris en charge

Filtrage des lignes basé sur l'API

x marquer non Non pris en charge

Évolution automatique des schémas : Nouvelles colonnes et colonnes supprimées

x marquer non Non pris en charge

Évolution automatisée des schémas : changements de type de données

x marquer non Non pris en charge

évolution des schémas automatisée : Renommage de colonnes

x marquer non Non pris en charge

Évolution des schémas automatisée : nouvelles tables

x marquer non Non pris en charge

Méthodes d'authentification

Méthode d'authentification

Disponibilité

OAuth U2M

coché oui Pris en charge

OAuth M2M

x marquer non Non pris en charge

OAuth (jeton de refresh manuel)

x marquer non Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

x marquer non Non pris en charge

Authentification de base (clé API)

x marquer non Non pris en charge

Authentification de base (clé JSON du compte de service)

x marquer non Non pris en charge

Méthode d'authentification

Disponibilité

OAuth U2M

coché oui Pris en charge

OAuth M2M

x marquer non Non pris en charge

OAuth (jeton de refresh manuel)

x marquer non Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

x marquer non Non pris en charge

Authentification de base (clé API)

x marquer non Non pris en charge

Authentification de base (clé JSON du compte de service)

x marquer non Non pris en charge

Ce qu'il faut savoir avant de start

Sujet

Pourquoi c'est important

Profil d'utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Mono-utilisateur : un utilisateur administrateur crée une connexion Unity Catalog et un pipeline d'ingestion.
  • Multi-utilisateur : un utilisateur administrateur crée une connexion pour les utilisateurs non-administrateurs afin qu’ils puissent créer des pipelines.

Méthode d'authentification

Les étapes de création d’une connexion dépendent de la méthode d’authentification que vous choisissez.

Interface

Les étapes de création d'un pipeline dépendent de l'interface.

Fréquence d'ingestion

La planification du pipeline dépend de vos exigences en matière de latence et de coût.

Modèles courants

Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations comme le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités.

Sujet

Pourquoi c'est important

Profil d'utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Mono-utilisateur : un utilisateur administrateur crée une connexion Unity Catalog et un pipeline d'ingestion.
  • Multi-utilisateur : un utilisateur administrateur crée une connexion pour les utilisateurs non-administrateurs afin qu’ils puissent créer des pipelines.

Méthode d'authentification

Les étapes de création d’une connexion dépendent de la méthode d’authentification que vous choisissez.

Interface

Les étapes de création d'un pipeline dépendent de l'interface.

Fréquence d'ingestion

La planification du pipeline dépend de vos exigences en matière de latence et de coût.

Modèles courants

Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations comme le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités.

start ingesting from GitHub

Le tableau suivant résume le flux d'ingestion GitHub de bout en bout, basé sur le type d'utilisateur :

Utilisateur

Étapes

Admin

  1. Configurer GitHub pour activer l'authentification depuis Databricks. Consultez Configurer OAuth U2M pour l'ingestion GitHub.
  2. Soit :
    • Utilisez Catalog Explorer pour créer une connexion à GitHub afin que les non-administrateurs puissent créer des pipelines. Consultez Créer une connexion GitHub.
    • Utilisez l'interface utilisateur d'ingestion de données pour créer une connexion et un pipeline en même temps. Voir Ingérer des données depuis GitHub.

Non-administrateur

Utilisez toute interface prise en charge pour créer un pipeline à partir d'une connexion existante. Voir Ingérer des données depuis GitHub.

Utilisateur

Étapes

Admin

  1. Configurer GitHub pour activer l'authentification depuis Databricks. Consultez Configurer OAuth U2M pour l'ingestion GitHub.
  2. Soit :
    • Utilisez Catalog Explorer pour créer une connexion à GitHub afin que les non-administrateurs puissent créer des pipelines. Consultez Créer une connexion GitHub.
    • Utilisez l'interface utilisateur d'ingestion de données pour créer une connexion et un pipeline en même temps. Voir Ingérer des données depuis GitHub.

Non-administrateur

Utilisez toute interface prise en charge pour créer un pipeline à partir d'une connexion existante. Voir Ingérer des données depuis GitHub.