Aller au contenu principal

Rédaction des identifiants

Cet article fournit un aperçu de la façon dont Databricks masque les clés d'accès et les identifiants dans les Logs.

Aperçu de la rédaction des identifiants

L'occultation des identifiants est une pratique de sécurité essentielle qui implique le masquage d'informations sensibles, telles que les mots de passe ou les clés API, afin d'empêcher tout accès non autorisé. Databricks masque les clés et les informations d'identification dans les logs d'audit et les logs Apache Spark log4j afin de protéger vos données contre les fuites d'information. Databricks masque automatiquement les identifiants cloud et les identifiants dans l'URI. La rédaction est basée sur la valeur récupérée du secret, quelle que soit la variable ou le contexte dans lequel elle est utilisée.

Pour certains types d'identifiants, Databricks ajoute un hash_prefix, qui est un code court généré à partir de l'identifiant à l'aide d'une méthode appelée MD5. Ce code est utilisé pour vérifier que l'identifiant est valide et qu'il n'a pas été altéré.

Expurgation des identifiants cloud

Les identifiants cloud expurgés peuvent avoir l'un des nombreux remplacements d'expurgation. Certains disent [REDACTED], tandis que d’autres peuvent avoir des remplacements plus spécifiques tels que REDACTED_POSSIBLE_CLOUD_SECRET_ACCESS_KEY.

Databricks peut masquer certaines longues chaînes qui semblent générées aléatoirement, même si ce ne sont pas des identifiants cloud.

Informations d'identification dans le masquage des URI

Databricks détecte //username:password@mycompany.com dans l'URI et remplace username:password par REDACTED_CREDENTIALS(hash_prefix). Databricks calcule le hachage à partir de username:password (y compris le :).

Par exemple, Databricks enregistre 2017/01/08: Accessing https://admin:admin@mycompany.com en tant que 2017/01/08: Accessing https://REDACTED_CREDENTIALS(d2abaa37)@mycompany.com.