Aller au contenu principal

Connecteur OpenAI

info

Bêta

Cette fonctionnalité est en version bêta. Pour l’utiliser, un administrateur du workspace doit activer Lakeflow Connect for OpenAI depuis la page Previews . Consultez Gérer les aperçus Databricks.

Le connecteur OpenAI géré dans Lakeflow Connect ingère les données d'administration de l'organisation, telles que les utilisateurs, les projets, les clés API, l'utilisation, les coûts et les logs d'audit, depuis OpenAI vers Databricks.

Disponibilité des fonctionnalités​

Fonctionnalité

Disponibilité

Création de pipeline via l'interface utilisateur

Icône de coche verte Pris en charge

Création de pipeline basée sur une API

Icône de coche verte Pris en charge

Declarative Automation Bundles

Icône de coche verte Pris en charge

Ingestion incrémentielle

Icône de coche verte Pris en charge

Gouvernance avec Unity Catalog

Icône de coche verte Pris en charge

Orchestration à l'aide de Databricks Workflows

Icône de coche verte Pris en charge

Sélection et désélection de colonnes basées sur l'API

Icône de coche verte Pris en charge

Filtrage de ligne basé sur l'API

Icône X rouge Non pris en charge

SCD de type 2

Icône de coche verte Pris en charge

S'applique aux tables d'entités mutables. Les tables audit_logs, usage_* et costs en mode ajout uniquement enregistrent des événements immuables et des compartiments quotidiens.

Évolution automatisée des schémas : nouvelles colonnes et colonnes supprimées

Icône de coche verte Pris en charge

Évolution automatisée des schémas : changements de type de données

Icône X rouge Non pris en charge

Évolution automatisée des schémas : renommages de colonnes

Icône X rouge Non pris en charge

Nécessite une refresh complète.

Fonctionnalité

Disponibilité

Création de pipeline via l'interface utilisateur

Icône de coche verte Pris en charge

Création de pipeline basée sur une API

Icône de coche verte Pris en charge

Declarative Automation Bundles

Icône de coche verte Pris en charge

Ingestion incrémentielle

Icône de coche verte Pris en charge

Gouvernance avec Unity Catalog

Icône de coche verte Pris en charge

Orchestration à l'aide de Databricks Workflows

Icône de coche verte Pris en charge

Sélection et désélection de colonnes basées sur l'API

Icône de coche verte Pris en charge

Filtrage de ligne basé sur l'API

Icône X rouge Non pris en charge

SCD de type 2

Icône de coche verte Pris en charge

S'applique aux tables d'entités mutables. Les tables audit_logs, usage_* et costs en mode ajout uniquement enregistrent des événements immuables et des compartiments quotidiens.

Évolution automatisée des schémas : nouvelles colonnes et colonnes supprimées

Icône de coche verte Pris en charge

Évolution automatisée des schémas : changements de type de données

Icône X rouge Non pris en charge

Évolution automatisée des schémas : renommages de colonnes

Icône X rouge Non pris en charge

Nécessite une refresh complète.

Méthodes d'authentification​

Méthode d’authentification

Disponibilité

OAuth U2M

Icône X rouge Non pris en charge

OAuth M2M

Icône X rouge Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

Icône X rouge Non pris en charge

Authentification de base (clé API)

Icône de coche verte Pris en charge

Clé API d'administration OpenAI.

Méthode d’authentification

Disponibilité

OAuth U2M

Icône X rouge Non pris en charge

OAuth M2M

Icône X rouge Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

Icône X rouge Non pris en charge

Authentification de base (clé API)

Icône de coche verte Pris en charge

Clé API d'administration OpenAI.

Ce qu’il faut savoir avant de start​

Sujet

Pourquoi est-ce important

Profil utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Mono-utilisateur : un utilisateur administrateur crée une connexion Unity Catalog et un pipeline d’ingestion.
  • Multi-utilisateur : un utilisateur administrateur crée une connexion que les utilisateurs non administrateurs peuvent utiliser pour créer des pipelines.

Méthode d’authentification

Les étapes de création d'une connexion dépendent de la méthode d'authentification que vous choisissez.

Interface

Les étapes de création d’un pipeline dépendent de l’interface.

Fréquence d'ingestion

La programmation du pipeline dépend de vos critères de latence et de coût.

Modèles courants

Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations telles que le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités.

Sujet

Pourquoi est-ce important

Profil utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Mono-utilisateur : un utilisateur administrateur crée une connexion Unity Catalog et un pipeline d’ingestion.
  • Multi-utilisateur : un utilisateur administrateur crée une connexion que les utilisateurs non administrateurs peuvent utiliser pour créer des pipelines.

Méthode d’authentification

Les étapes de création d'une connexion dépendent de la méthode d'authentification que vous choisissez.

Interface

Les étapes de création d’un pipeline dépendent de l’interface.

Fréquence d'ingestion

La programmation du pipeline dépend de vos critères de latence et de coût.

Modèles courants

Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations telles que le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités.

Ingérer depuis OpenAI en 3 étapes​

  1. Configurer OpenAI pour l’ingestion (administrateurs) : configurez OpenAI pour l’authentification auprès de Databricks.
  2. Créer une connexion Unity Catalog (administrateurs) : créez une connexion dans l'Explorateur de catalogues pour stocker les informations d'identification permettant à Databricks de s'authentifier auprès d'OpenAI.
  3. Créer un pipeline d’ingestion (Administrateurs ou non-administrateurs) : sélectionnez une interface prise en charge et créez un pipeline à partir d’une connexion existante.