Dépannage du connecteur Kafka
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.
Cette page montre comment dépanner les erreurs courantes avec le connecteur Kafka géré dans Lakeflow Connect.
Pour obtenir des conseils de dépannage généraux qui s'appliquent à tous les pipelines d'ingestion gérés, consultez Dépannage des pipelines d'ingestion gérés.
Pour les questions de comportement (par exemple, ce qui se passe lorsque des enregistrements sont supprimés de Kafka avant que le pipeline ne les lise), consultez la FAQ du connecteur Kafka.
Stream ne renvoie aucun enregistrement même si des données existent dans la rubrique.
**Cause** : starting_offset L'option est latest default, qui ne lit que les messages qui arrivent après le start du Stream. Si des données ont été écrites dans la rubrique avant le début du pipeline, ces enregistrements ne sont pas lus.
Résolution : Définissez starting_offset: earliest dans votre kafka_options pour lire depuis le début de la rubrique lors de la première exécution. Notez que ce paramètre s’applique uniquement lorsqu’aucun checkpoint n’existe. Une fois que le pipeline a été exécuté, il continue à partir du dernier offset validé, quel que soit starting_offset.
Le Stream se connecte, mais aucun enregistrement n’arrive (problème d’authentification ou d’ACL)
Cause : Le pipeline s'est authentifié avec succès auprès du cluster Kafka, mais les identifiants ne disposent pas de l'autorisation de lecture du sujet spécifié. Les ACLs Kafka peuvent bloquer le groupe de consommateurs ou le sujet.
Résolution :
- Vérifiez que le nom d'utilisateur ou les identifiants de service utilisés dans la connexion Unity Catalog disposent de la permission
READsur le sujet dans votre configuration Kafka ACL. - Vérifiez que le groupe de consommateurs utilisé par le pipeline est autorisé. Contactez votre administrateur Kafka pour examiner les paramètres ACL.
- Vérifiez que le nom du sujet est correct — les noms de sujets Kafka sont sensibles à la casse.
Le pipeline ne parvient pas à se connecter au cluster Kafka (TimeoutException)
Cause : Les serveurs d’amorçage sont inaccessibles depuis l’environnement de compute Serverless Databricks. Les causes courantes incluent la configuration réseau, les règles de pare-feu ou une adresse de serveur d'amorçage incorrecte dans la connexion.
Résolution :
- Vérifiez que les adresses du serveur bootstrap dans la connexion Unity Catalog sont correctes et qu'elles incluent le port approprié (default :
9092). - Assurez-vous que votre cluster Kafka autorise les connexions entrantes à partir du compute Serverless Databricks. Consultez Authentification pour Kafka pour obtenir des directives de configuration réseau.
- Si votre cluster utilise TLS, confirmez que le port correspond à l'écouteur TLS (par default :
9093).
Le pipeline ignore les décalages après le redémarrage
**Cause** : Ce comportement est attendu. Si le pipeline prend du retard et que Kafka supprime des enregistrements (en raison des paramètres de rétention de la rubrique) avant que le pipeline ne les lise, le connecteur ignore automatiquement les offsets manquants et continue à partir du prochain offset disponible. Consultez la FAQ du connecteur Kafka pour plus d'information.
**Résolution** : Pour éviter de sauter des enregistrements, assurez-vous que la période de rétention de votre sujet Kafka est suffisamment longue pour tenir compte des temps d'arrêt ou des retards de pipeline attendus.