Configurez MySQL pour l’ingestion dans Databricks
Aperçu
Le connecteur MySQL est en préversion publique. Contactez votre équipe de compte Databricks pour demander l'accès.
Découvrez comment configurer MySQL pour l'ingestion dans Databricks à l'aide de Lakeflow Connect. Le connecteur MySQL utilise la réplication du journal binaire (binlog) pour capturer les modifications de votre base de données MySQL et les synchroniser de manière incrémentielle avec Databricks.
Exigences
Avant de configurer MySQL pour l'ingestion, veuillez vérifier que votre environnement répond aux exigences suivantes :
-
Versions de base de données prises en charge :
- Amazon RDS : 5.7.44 et versions ultérieures (aussi bien les déploiements autonomes que HA)
- Amazon Aurora : 5.7.mysql_aurora.2.12.2 et versions ultérieures (pour les configurations HA, le support provient uniquement de l'instance principale).
- Amazon Aurora Serverless : Pris en charge.
- Azure Database pour serveurs flexibles MySQL : 5.7.44 et versions ultérieures (déploiements autonomes et HA)
- MySQL sur EC2 : 5.7.44 et versions ultérieures
- GCP Cloud SQL : 5.7.44 et versions ultérieures
-
Configuration de la journalisation binaire : Les configurations de serveur suivantes sont requises :
- Activez la journalisation binaire.
- Définissez le format du journal binaire sur
ROW. - Définissez l'image de ligne du journal binaire sur
FULL.
-
Accès pour créer un utilisateur MySQL avec des privilèges de réplication.
-
Connectivité réseau de Databricks à votre instance MySQL.
Vue d’ensemble des tâches de configuration de la source
Effectuez les tâches suivantes pour configurer MySQL pour l'ingestion :
-
Configurer les paramètres du serveur MySQL pour activer la journalisation binaire et définir le format correct.
Les étapes de configuration varient en fonction du type de déploiement :
-
Créez un utilisateur MySQL avec les privilèges requis pour la réplication. Consultez Accorder des privilèges utilisateur MySQL.
-
Configurez la mise en réseau pour permettre à Databricks de se connecter à votre instance MySQL. Cela peut inclure la configuration de règles de pare-feu, de groupes de sécurité ou de l'appairage réseau.
Consultez Configurer les paramètres du pare-feu pour les bases de données SQL AWS pour plus d'informations sur les adresses IP à autoriser.
Prise en charge des réplicas en lecture
Le connecteur MySQL prend en charge l'ingestion à partir de réplicas en lecture pour les types de déploiement suivants :
- Amazon RDS pour MySQL
- Azure Database pour MySQL
- MySQL sur EC2
Le connecteur ne prend pas en charge l'ingestion à partir des réplicas en lecture Amazon Aurora MySQL. Vous devez vous connecter à l'instance principale pour les déploiements Aurora.
L'utilisation d'un réplica en lecture peut réduire la charge sur votre base de données principale. Cependant, il peut y avoir un décalage de réplication entre la base de données principale et la réplique, ce qui peut affecter la fraîcheur des données.