Que sont les Transformers de Hugging Face ?
Cet article fournit une introduction à Hugging Face Transformers sur Databricks. Il comprend des conseils sur les raisons d'utiliser Hugging Face Transformers et sur la manière de l'installer sur votre cluster.
Contexte pour Hugging Face Transformers
Hugging Face Transformers est un cadre open source d'apprentissage profond créé par Hugging Face. Il fournit des APIs et des outils pour download des modèles pré-entraînés de pointe et les affiner davantage pour maximiser les performances. Ces modèles prennent en charge les tâches courantes dans différentes modalités, telles que le traitement du langage naturel, la vision par ordinateur, l'audio et les applications multimodales.
Databricks Runtime for Machine Learning inclut Hugging Face transformers dans Databricks Runtime 10.4 LTS ML et versions ultérieures, et inclut les datasets Hugging Face, accelerate et evaluate dans Databricks Runtime 13.0 ML et versions ultérieures.
Pour vérifier la version de Hugging Face incluse dans votre version configurée de Databricks Runtime ML, consultez la section des bibliothèques Python sur les notes de version pertinentes.
Pourquoi utiliser Hugging Face Transformers ?
Pour de nombreuses applications, telles que l'analyse des sentiments et la synthèse de texte, les modèles pré-entraînés fonctionnent bien sans formation de modèle supplémentaire.
Les pipelines Hugging Face Transformers intègrent les meilleures pratiques et ont des modèles par default sélectionnés pour différentes tâches, ce qui facilite le start. Les pipelines facilitent l'utilisation des GPU lorsqu'ils sont disponibles et permettent le traitement par batch des éléments envoyés au GPU pour une meilleure performance de throughput.
Hugging Face propose :
- Un hub de modèles contenant de nombreux modèles pré-entraînés.
- La 🤗 bibliothèque Transformers qui prend en charge le download et l'utilisation de ces modèles pour les applications NLP et l'affinement. Il est courant d'avoir besoin à la fois d'un tokenizer et d'un modèle pour les tâches de traitement du langage naturel (NLP).
- 🤗 Pipelines Transformers qui ont une interface simple pour la plupart des tâches de traitement du langage naturel.
Installer transformers
Si la version de Databricks Runtime sur votre cluster n'inclut pas Hugging Face transformers, vous pouvez installer la dernière bibliothèque Hugging Face transformers en tant que bibliothèque Databricks PyPI.
%pip install transformers
Installer les dépendances du modèle
Différents modèles peuvent avoir différentes dépendances. Databricks vous recommande d'utiliser les commandes magiques %pip pour installer ces dépendances si nécessaire.
Voici les dépendances courantes :
librosa: prend en charge le décodage des fichiers audio.soundfile: requis lors de la génération de certains datasets audio.bitsandbytes: requis lors de l'utilisation deload_in_8bit=True.SentencePiece: utilisé comme tokeniseur pour les modèles NLP.timm: requis par DetrForSegmentation.
Entraînement à nœud unique
Pour tester et migrer des workflows à machine unique, utilisez un cluster de nœuds uniques.
Ressources supplémentaires
Les articles suivants incluent des Notebooks d'exemple et des conseils sur la façon d'utiliser Hugging Face transformers pour l'affinement de grands modèles de langage (LLM) et l'inférence de modèles sur Databricks.