Conceitos de serving
This page defines key concepts used across online serving on Databricks, including servindo modelo Endpoint, Feature Serving Endpoint, and Online Feature Stores.
Endpoint de servindo modelo
API REST que expõe um ou mais modelos servidos para inferência. Os endpoints do servindo modelo oferecem suporte opcional à pesquisa automática de recursos em uma Feature Store Online.
Endpoint de Feature Serving
REST API for looking up recurso values grouped as a FeatureSpec, which is useful for passing recurso data to a model that executa outside of Databricks. Para obter mais informações, consulte Serve recurso views.
endpointotimizado para roteamento
Propriedade de endpoint que habilita um caminho de rede aprimorado com comunicação mais rápida e direta entre o cliente e o endpoint durante a inferência, o que reduz a latência de sobrecarga e aumenta o throughput. Disponível para endpoints de servindo modelo personalizados e endpoints de Feature Serving. Para obter mais informações, consulte Otimização de rotas em Endpoint de serviço.
provisionamento concorrência
Propriedade do endpoint que especifica o número máximo de solicitações paralelas que um endpoint pode processar. Estime a concorrência necessária usando a fórmula: provisioned concurrency = queries per second (QPS) × model execution time (s).
escalar para zero
Propriedade do endpoint que reduz automaticamente o consumo de recursos a zero quando endpoint não está em uso. Para testes e desenvolvimento, recomenda-se usar escala zero. No entanto, a escalabilidade para zero não é recomendada para endpoints de produção, pois a latência é maior e a capacidade não é garantida quando a escala é reduzida a zero.
Entidade atendida
Unidade de implantação nomeada dentro de um endpoint que representa um modelo específico com sua configuração compute , capaz de receber tráfego roteado.
Online Feature Store
Armazenamento de dados que serve valores de recursos para aplicações em tempo real e Endpoint de serviço com baixa latência. As Feature Stores Online do Databricks são alimentadas pelo Lakebase autoscale e sincronizam dados de recursos de views de recursos ou tabelas de recursos. Para obter mais informações, consulte Databricks Online Feature Stores.
Configuração de tráfego
Especificação da porcentagem de tráfego para um endpoint que deve ser direcionada para cada modelo. É necessária a configuração de tráfego para endpoints com mais de um modelo atendido.
O exemplo a seguir mostra um endpoint chamado multi-pt-model que hospeda a versão 2 de meta_llama_v3_1_70b_instruct , que recebe 60% do tráfego do endpoint, e também hospeda a versão 3 de meta_llama_v3_1_8b_instruct , que recebe 40% do tráfego do endpoint. Para obter mais informações, consulte Servir vários modelos para um endpointde modelo funcional.
POST /api/2.0/serving-endpoints
{
"name":"multi-pt-model"
"config":
{
"served_entities":
[
{
"name":"meta_llama_v3_1_70b_instruct",
"entity_name":"system.ai.meta_llama_v3_1_70b_instruct",
"entity_version":"4",
"min_provisioned_throughput":0,
"max_provisioned_throughput":2400
},
{
"name":"meta_llama_v3_1_8b_instruct",
"entity_name":"system.ai.meta_llama_v3_1_8b_instruct",
"entity_version":"4",
"min_provisioned_throughput":0,
"max_provisioned_throughput":1240
}
],
"traffic_config":
{
"routes":
[
{
"served_model_name":"meta_llama_v3_1_8b_instruct",
"traffic_percentage":"60"
},
{
"served_model_name":"meta_llama_v3_1_70b_instruct",
"traffic_percentage":"40"
}
]
}
}
}