Migrer les Endpoint de service LLM optimisés vers un throughput provisionné
Cette documentation a été retirée et pourrait ne pas être mise à jour. Les produits, services ou technologies mentionnés dans ce contenu ne sont plus pris en charge.
Cet article décrit comment migrer vos endpoints de service LLM existants vers l'expérience de throughput provisionné disponible via les APIs de modèle de fondation.
Qu'est-ce qui change ?
Le throughput provisionné offre une expérience plus simple pour le lancement d'Endpoints de service LLM optimisés. Databricks a modifié son système de service de modèles LLM afin que :
- Les plages de montée en charge peuvent être configurées en termes natifs pour les LLM, tels que les jetons par seconde au lieu de la simultanéité.
- Les clients n'ont plus besoin de sélectionner eux-mêmes les types de charges de travail GPU.
De nouveaux endpoints de service LLM sont créés avec un throughput provisionné par défaut. Si vous souhaitez continuer à sélectionner le type de charge de travail GPU, cette expérience n'est prise en charge qu'à l'aide de l'API.
Migrer les Endpoint de service LLM vers un throughput provisionné
La façon la plus simple de migrer votre endpoint existant vers le throughput provisionné est de mettre à jour votre endpoint avec une nouvelle version du modèle. Après avoir sélectionné une nouvelle version de modèle, l'interface utilisateur affiche l'interface pour le throughput provisionné. L'interface utilisateur affiche les plages de jetons par seconde basées sur les benchmarks Databricks pour les cas d'utilisation typiques.

Les performances de cette offre mise à jour sont nettement meilleures grâce aux améliorations d'optimisation, et le prix de votre endpoint reste inchangé. Veuillez contacter model-serving-feedback@databricks.com pour vos commentaires sur le produit ou pour toute question.