Aller au contenu principal

Créer des services de modèles de fondation Endpoint

Dans cet article, vous apprendrez comment créer des Endpoint de service de modèle qui déploient et servent des modèles de fondation.

Model Serving prend en charge les modèles suivants :

  • Modèles externes. Ce sont des modèles de base qui sont hébergés en dehors de Databricks. Les Endpoints qui servent des modèles externes peuvent être régis de manière centralisée et les clients peuvent établir des limites de débit et un contrôle d'accès pour ceux-ci. Les exemples incluent des modèles de fondation comme GPT-4 d'OpenAI et Claude d'Anthropic.

  • Modèles de fondation ouverts de pointe mis à disposition par les APIs de modèle de fondation. Ces modèles sont des architectures de modèle de fondation organisées qui prennent en charge l’inférence optimisée. Des modèles de base, comme Meta-Llama-3.3-70B-Instruct et GTE-Large, sont disponibles pour une utilisation immédiate avec la tarification au paiement par jeton . Les charges de travail de production, utilisant des modèles de base ou affinés, peuvent être déployées avec des garanties de performance grâce au throughput provisionné .

Model Serving offre les options suivantes pour la création d'endpoints de déploiement de modèles :

  • L'Interface utilisateur de déploiement
  • API REST
  • SDK de déploiements MLflow

Pour la création d'Endpoint qui servent des modèles de ML traditionnels ou Python, consultez Créer des Endpoint de service de modèle personnalisés.

Exigences

Python
import mlflow.deployments

client = mlflow.deployments.get_deploy_client("databricks")

Créer un Endpoint de déploiement de modèle de fondation

Vous pouvez créer un Endpoint qui sert des variantes affinées de modèles de fondation mis à disposition à l'aide des APIs de modèles de fondation avec un **throughput provisionné**. Voir Créer votre endpoint de throughput provisionné à l'aide de l'API REST.

Pour les modèles de fondation qui sont rendus disponibles via les API de modèle de fondation paiement par jeton , Databricks fournit automatiquement des points de terminaison spécifiques pour accéder aux modèles pris en charge dans votre Workspace Databricks. Pour y accéder, sélectionnez l'onglet tab dans la barre latérale gauche du Workspace. Les APIs de modèle de fondation se trouvent en haut de la vue Liste des Endpoint.

Pour l'interrogation de ces Endpoint, consultez Utiliser des modèles de base.

Créer un endpoint de service de modèle externe

Voici comment créer un Endpoint qui interroge un modèle de fondation rendu disponible à l’aide des modèles externes Databricks.

  1. Dans le champ Nom , fournissez un nom pour votre Endpoint.

  2. Dans la section Entités servies

    1. Cliquez dans le champ Entité pour ouvrir le formulaire Sélectionner l'entité servie .
    2. Sélectionnez les **modèles de fondation**.
    3. Dans le champ **Sélectionner un modèle de base**, sélectionnez le fournisseur de modèles que vous souhaitez utiliser parmi ceux répertoriés sous **Fournisseurs de modèles externes**. Le formulaire se met à jour dynamiquement en fonction de votre sélection de fournisseur de modèles.
    4. Cliquez sur Confirmer .
    5. Fournissez les détails de configuration pour accéder au fournisseur de modèle sélectionné. Il s'agit généralement du secret qui référence le jeton d'accès personnel que vous souhaitez que l'endpoint utilise pour accéder à ce modèle.
    6. Sélectionnez la tâche. Les tâches disponibles sont le chat, la complétion et les intégrations.
    7. Sélectionnez le nom du modèle externe que vous souhaitez utiliser. La liste des modèles se met à jour dynamiquement en fonction de votre sélection de tâches. Consultez les modèles externes disponibles.
  3. Cliquez sur Créer. La page Endpoints de service s'affiche avec l' état de l'endpoint de service indiqué comme Non prêt.

Créer un Endpoint de service de modèle

Mise à jour des Endpoint de mise en service du modèle

Après avoir activé un Endpoint de modèle, vous pouvez définir la configuration de compute comme vous le souhaitez. Cette configuration est particulièrement utile si vous avez besoin de ressources supplémentaires pour votre modèle. La taille du Workload et la configuration du compute jouent un rôle clé dans les ressources allouées pour la diffusion de votre modèle.

Tant que la nouvelle configuration n'est pas prête, l'ancienne configuration continue de servir le trafic de prédiction. Pendant qu'une mise à jour est en cours, une autre mise à jour ne peut pas être effectuée. Dans l'interface utilisateur de Serving, vous pouvez annuler une mise à jour de configuration en cours en sélectionnant Annuler la mise à jour en haut à droite de la page de détails de l'Endpoint. Cette fonctionnalité est uniquement disponible dans l'interface utilisateur de Serving.

Lorsqu'un external_model est présent dans une configuration d'endpoint, la liste des entités servies ne peut avoir qu'un seul objet served_entity. Les Endpoint existants avec un external_model ne peuvent pas être mis à jour pour ne plus avoir de external_model. Si l'endpoint est créé sans external_model, vous ne pouvez pas le mettre à jour pour ajouter un external_model.

Pour mettre à jour votre endpoint, consultez la documentation sur la mise à jour de la configuration de l'API REST pour obtenir des détails sur les schémas de requête et de réponse.

Bash
{
"name": "openai_endpoint",
"served_entities":
[
{
"name": "openai_chat",
"external_model":{
"name": "gpt-4",
"provider": "openai",
"task": "llm/v1/chat",
"openai_config":{
"openai_api_key": "{{secrets/my_scope/my_openai_api_key}}"
}
}
}
]
}

Ressources supplémentaires