Didacticiel : Déployer et interroger un modèle personnalisé
Cet article fournit les étapes de base pour déployer et interroger un modèle personnalisé, c'est-à-dire un modèle ML traditionnel, à l'aide de Model Serving. Le modèle doit être enregistré dans Unity Catalog ou dans le registre des modèles du Workspace.
Pour en savoir plus sur le service et le déploiement de modèles d'IA générative, consultez plutôt les articles suivants :
Étape 1 : Log le modèle
Il existe différentes manières d'enregistrer votre modèle pour la mise à disposition de modèles :
Technique de journalisation | Description |
|---|---|
Log automatique | Ceci est automatiquement activé lorsque vous utilisez Databricks Runtime pour le machine learning. C'est la méthode la plus simple, mais elle vous offre moins de contrôle. |
Enregistrement à l'aide des saveurs intégrées à MLflow. | Vous pouvez journaliser manuellement le modèle avec les variantes de modèle intégré de MLflow. |
Journalisation personnalisée avec | Utilisez ceci si vous avez un modèle personnalisé ou si vous avez besoin d'étapes supplémentaires avant ou après l'inférence. |
L'exemple suivant montre comment enregistrer votre modèle MLflow à l'aide de la saveur transformer et spécifier les paramètres dont vous avez besoin pour votre modèle.
with mlflow.start_run():
model_info = mlflow.transformers.log_model(
transformers_model=text_generation_pipeline,
artifact_path="my_sentence_generator",
inference_config=inference_config,
registered_model_name='gpt2',
input_example=input_example,
signature=signature
)
Une fois votre modèle enregistré, assurez-vous qu'il est enregistré dans Unity Catalog ou dans le Model Registry MLflow.
Étape 2 : Créer un endpoint à l’aide de l’interface utilisateur de service
Une fois votre modèle enregistré et prêt à être servi, vous pouvez créer un endpoint de déploiement de modèles à l'aide de l'interface utilisateur **Serving**.
-
Cliquez sur Serving dans la barre latérale pour afficher l'interface utilisateur Serving .
-
Cliquez sur Créer un Endpoint de service .

-
Dans le champ Nom , indiquez un nom pour votre endpoint.
-
Dans la section Entités servies
-
Cliquez dans le champ Entité pour ouvrir le formulaire Sélectionner l'entité servie .
-
Sélectionnez le type de modèle que vous souhaitez déployer. Le formulaire se met à jour dynamiquement en fonction de votre sélection.
-
Sélectionnez le modèle et la version du modèle que vous souhaitez déployer.
-
Sélectionnez le pourcentage de trafic à acheminer vers votre modèle servi.
-
Sélectionnez la taille de compute à utiliser.
-
Sous Compute Scale-out , sélectionnez la taille de la Monter en charge de compute qui correspond au nombre de requêtes que ce modèle servi peut traiter simultanément. Ce nombre doit être approximativement égal à QPS x temps d'exécution du modèle.
- Les tailles disponibles sont Petite pour 0 à 4 requêtes, Moyenne pour 8 à 16 requêtes et Grande pour 16 à 64 requêtes.
-
Indiquez si l'Endpoint doit monter en charge à zéro lorsqu'il n'est pas utilisé.
-
-
Cliquez sur Créer. La page Endpoints de service s'affiche avec l' état de l'endpoint de service indiqué comme Non prêt.

Si vous préférez créer un Endpoint par programme avec l’API Databricks Serving, consultez Créer des endpoints de service de modèle personnalisés.
Étape 3 : interrogez l'Endpoint
La manière la plus simple et la plus rapide de tester et d'envoyer des requêtes d'évaluation à votre modèle servi est d'utiliser l'interface utilisateur Serving .
-
À partir de la page Endpoint de service , sélectionnez Endpoint de requête .
-
Insérez les données d'entrée du modèle au format JSON et cliquez sur Envoyer la demande . Si le modèle a été enregistré avec un exemple d'entrée, cliquez sur Afficher l'exemple pour charger l'exemple d'entrée.
Python{
"inputs" : ["Hello, I'm a language model,"],
"params" : {"max_new_tokens": 10, "temperature": 1}
}
Pour envoyer des requêtes de scoring, construisez un JSON avec l'une des clés prises en charge et un objet JSON correspondant au format d'entrée. Consultez les Endpoint de service de query pour les modèles personnalisés pour les formats pris en charge et des conseils sur la façon d'envoyer des requêtes de scoring à l'aide de l'API.
Si vous prévoyez d'accéder à votre endpoint de service en dehors de l'interface utilisateur de service Databricks, vous avez besoin d'un DATABRICKS_API_TOKEN.
En tant que bonne pratique de sécurité pour les scénarios de production, Databricks vous recommande d'utiliser des jetons OAuth machine à machine pour l'authentification pendant la production.
Pour les tests et le développement, Databricks recommande d'utiliser un jeton d'accès personnel appartenant aux Service Principals au lieu des utilisateurs de Workspace. Pour créer des jetons pour les Service Principals, consultez Gérer les jetons pour un Service Principal.
Exemples de Notebooks
Consultez le Notebook suivant pour le déploiement d'un modèle transformers MLflow avec Model Serving.
Déployer un notebook de modèle de transformeurs Hugging Face.
Consultez le notebook suivant pour le déploiement d’un modèle MLflow pyfunc avec Model Serving. Pour plus de détails sur la personnalisation de vos déploiements de modèles, consultez Déployer du code Python avec Model Serving.