Aller au contenu principal

Migrer vers Model Serving

Cet article montre comment activer Model Serving dans votre Workspace et faire passer vos modèles à l'expérience Model Serving basée sur le compute serverless.

important

À partir du 22 août 2025, les clients ne pourront plus créer de nouveaux endpoints de service en utilisant l'expérience Legacy MLflow Model Serving. Le 15 septembre 2025, l'expérience héritée arrivera en fin de vie et tous les endpoints existants utilisant ce service ne pourront plus être utilisés.

Exigences

Modifications importantes

  • Dans Model Serving, le format de la requête vers l'endpoint et de la réponse de l'endpoint sont légèrement différents de ceux du déploiement de modèles MLflow hérité. Consultez Notation d'un endpoint de modèle pour plus de détails sur le nouveau protocole de format.
  • Dans Model Serving, l'URL de l'Endpoint inclut serving-endpoints au lieu de model.
  • Model Serving inclut la prise en charge complète de la gestion des Ressources avec les workflows d'API.
  • Model Serving est opérationnel et est couvert par le SLA Databricks.

Identifier les Endpoint qui utilisent Legacy MLflow Model Serving

Pour identifier les Endpoint de Model Serving qui utilisent Legacy MLflow Model Serving :

  1. Accédez à l'interface utilisateur Models dans votre workspace.
  2. Sélectionnez le filtre **Workspace Model Registry**.
  3. Sélectionnez le filtre Déploiement hérité activé uniquement .

Migrer les modèles servis par Legacy MLflow Model Serving vers Model Serving

Vous pouvez créer un endpoint Model Serving et faire évoluer les workflows de déploiement de modèles de manière flexible sans désactiver le déploiement de modèles MLflow hérité.

Les étapes suivantes montrent comment y parvenir avec l'interface utilisateur. Pour chaque modèle sur lequel vous avez activé Legacy MLflow Model Serving :

  1. Enregistrez votre modèle dans Unity Catalog.
  2. Accédez à l' Endpoint de service dans la barre latérale de votre Workspace Machine Learning.
  3. Suivez le flux de travail décrit dans Créer des Endpoint de déploiement de modèles personnalisés pour savoir comment créer un Endpoint de déploiement avec votre modèle.
  4. Faites passer votre application à la nouvelle URL fournie par l'Endpoint de service pour query le modèle, ainsi qu'au nouveau format de scoring.
  5. Lorsque vos modèles sont transférés, vous pouvez accéder à Modèles dans la barre latérale de votre workspace de Machine Learning.
  6. Sélectionnez le modèle pour lequel vous souhaitez désactiver le Legacy MLflow Model Serving.
  7. Sur l'onglet **tab**, sélectionnez **Arrêter**.
  8. Un message apparaît pour confirmer. Sélectionnez **Arrêter le déploiement**.

Migrer les versions de modèles déployées vers Model Serving

Dans les versions précédentes de la fonctionnalité Model Serving, l’Endpoint de service a été créé en fonction de l’étape de la version du modèle enregistré : Staging ou Production. Pour migrer vos modèles servis de cette expérience, vous pouvez reproduire ce comportement dans la nouvelle expérience de Model Serving.

Cette section montre comment créer des Endpoint de service de modèle séparés pour les versions de modèle Staging et les versions de modèle Production. Les étapes suivantes montrent comment y parvenir avec l’API des endpoints de mise en service pour chacun de vos modèles déployés.

Dans l'exemple, le nom du modèle enregistré modelA a la version 1 dans le stade du modèle Production et la version 2 dans le stade du modèle Staging.

  1. Créez deux endpoints pour votre modèle enregistré, un pour les versions de modèle Staging et un autre pour les versions de modèle Production.

    Pour Staging versions de modèles :

    Bash
    POST /api/2.0/serving-endpoints
    {
    "name":"modelA-Staging"
    "config":
    {
    "served_entities":
    [
    {
    "entity_name":"model-A",
    "entity_version":"2", // Staging Model Version
    "workload_size":"Small",
    "scale_to_zero_enabled":true
    },
    ],
    },
    }

    Pour Production versions de modèles :

    Bash
    POST /api/2.0/serving-endpoints
    {
    "name":"modelA-Production"
    "config":
    {
    "served_entities":
    [
    {
    "entity_name":"model-A",
    "entity_version":"1", // Production Model Version
    "workload_size":"Small",
    "scale_to_zero_enabled":true
    },
    ],
    },
    }
  2. Vérifier le statut des Endpoint.

    Pour l'endpoint de staging : GET /api/2.0/serving-endpoints/modelA-Staging

    Pour l'Endpoint de production : GET /api/2.0/serving-endpoints/modelA-Production

  3. Une fois les Endpoints prêts, query l'Endpoint en utilisant :

    Pour l'endpoint de staging : POST /serving-endpoints/modelA-Staging/invocations

    Pour l'Endpoint de production : POST /serving-endpoints/modelA-Production/invocations

  4. Mettez à jour l'Endpoint en fonction des transitions de version du modèle.

    Dans le scénario où une nouvelle version du modèle 3 est créée, vous pouvez faire passer la version du modèle 2 à Production, tandis que la version du modèle 3 peut passer à Staging et que la version du modèle 1 est Archived. Ces modifications peuvent se refléter dans des Endpoint de service de modèle distincts, comme suit :

    Pour le endpoint Staging, mettez à jour le endpoint pour utiliser la nouvelle version du modèle dans Staging.

    Bash
    PUT /api/2.0/serving-endpoints/modelA-Staging/config
    {
    "served_entities":
    [
    {
    "entity_name":"model-A",
    "entity_version":"3", // New Staging model version
    "workload_size":"Small",
    "scale_to_zero_enabled":true
    },
    ],
    }

    Pour l’Endpoint Production, mettez à jour l’Endpoint afin d’utiliser la nouvelle version du modèle dans Production.

    Bash
    PUT /api/2.0/serving-endpoints/modelA-Production/config
    {
    "served_entities":
    [
    {
    "entity_name":"model-A",
    "entity_version":"2", // New Production model version
    "workload_size":"Small",
    "scale_to_zero_enabled":true
    },
    ],
    }

Ressources supplémentaires