Pular para o conteúdo principal

Governança para Endpoint servindo modelo (legado)

info

Experimente o novo Unity Gateway

Uma nova experiência do Unity Gateway está disponível de forma geral. É o plano de controle empresarial para governar endpoints de LLM e agentes de codificação com recursos aprimorados. Consulte Governança de IA com o Unity Gateway.

Esta página descreve o AI Gateway (legado) para endpoints de disponibilização, que governa e monitora o acesso a modelos de AI suportados e seus respectivos endpoints de servindo modelo.

O que é o AI Gateway (legado) para Endpoint de disponibilização?​

AI Gateway (legacy) is designed to streamline the usage and management of AI models and agents within an organization. É um serviço centralizado que traz governança, monitoramento e prontidão para produção para endpoints de servindo modelo. It also allows you to execução, secure, and govern AI traffic to democratize and accelerate AI adoption for your organization.

Todos os dados são registrados em tabelas Delta no Unity Catalog.

Para começar a visualizar as informações relevantes dos seus dados AI Gateway, download o painel de exemplo AI Gateway do GitHub. Este painel de controle utiliza os dados das tabelas de inferência de acompanhamento de uso e registro de carga útil.

Após download o arquivo JSON , importe o painel para seu workspace. Para obter instruções sobre como importar painéis, consulte Importar um arquivo de painel.

Recurso suportado​

info

Unity Gateway

O novo Unity Gateway apresenta uma interface de usuário rica, observabilidade aprimorada e cobertura de API expandida para LLMs, incluindo modelos externos e APIs de modelos de fundação com pagamento por token. Recomendamos o uso do Unity Gateway para desbloquear esses novos recursos.

A tabela a seguir define os recursos disponíveis do Gateway de AI (legado) e quais tipos de endpoint servindo modelo os suportam.

Recurso

Definição

endpoint do modelo externo

endpointde pagamento por tokens APIs do Foundation Model

Provisionamento APIs do Foundation Model Taxa de transferência endpoint

Agentes Databricks

endpoint do modelo personalizado

Disponível no Unity Gateway

Use recursos aprimorados do Unity Gateway. Consulte governança de AI com o Unity Gateway.

Apoiado

Apoiado

Não suportado

Não suportado

Não suportado

Permissão e limitação de taxas

Controle quem tem acesso e qual o nível de acesso.

Apoiado

Apoiado

Apoiado

Não suportado

Apoiado

Registro de carga útil

Monitorar e auditar os dados enviados para as APIs do modelo usando tabelas de inferência.

Apoiado

Apoiado

Apoiado

Apoiado

Apoiado

Uso

Monitore o uso operacional no endpoint e os custos associados usando tabelas do sistema.

Apoiado

Apoiado

Apoiado

Não suportado

Apoiado

Proteções de AI

Impeça a inclusão de dados indesejados e inseguros em solicitações e respostas. Consulte as diretrizesAI.

Apoiado

Apoiado

Apoiado

Não suportado

Não suportado

Fallbacks

Minimize as interrupções na produção durante e após a implantação.

Apoiado

Não suportado

Não suportado

Não suportado

Não suportado

Divisão de tráfego

Balancear a carga do tráfego entre os modelos.

Apoiado

Não suportado

Apoiado

Não suportado

Apoiado

Recurso

Definição

endpoint do modelo externo

endpointde pagamento por tokens APIs do Foundation Model

Provisionamento APIs do Foundation Model Taxa de transferência endpoint

Agentes Databricks

endpoint do modelo personalizado

Disponível no Unity Gateway

Use recursos aprimorados do Unity Gateway. Consulte governança de AI com o Unity Gateway.

Apoiado

Apoiado

Não suportado

Não suportado

Não suportado

Permissão e limitação de taxas

Controle quem tem acesso e qual o nível de acesso.

Apoiado

Apoiado

Apoiado

Não suportado

Apoiado

Registro de carga útil

Monitorar e auditar os dados enviados para as APIs do modelo usando tabelas de inferência.

Apoiado

Apoiado

Apoiado

Apoiado

Apoiado

Uso

Monitore o uso operacional no endpoint e os custos associados usando tabelas do sistema.

Apoiado

Apoiado

Apoiado

Não suportado

Apoiado

Proteções de AI

Impeça a inclusão de dados indesejados e inseguros em solicitações e respostas. Consulte as diretrizesAI.

Apoiado

Apoiado

Apoiado

Não suportado

Não suportado

Fallbacks

Minimize as interrupções na produção durante e após a implantação.

Apoiado

Não suportado

Não suportado

Não suportado

Não suportado

Divisão de tráfego

Balancear a carga do tráfego entre os modelos.

Apoiado

Não suportado

Apoiado

Não suportado

Apoiado

O Gateway de AI (legado) gera cobranças com base nos recursos habilitados. Os recursos pagos incluem tabelas de inferência e acompanhamento de uso. Recursos como permissões de query, limitação de taxa, fallback e divisão de tráfego são gratuitos. Quaisquer novos recursos estão sujeitos a cobrança.

ProteçõesAI​

info

Visualização

Este recurso está em Pré-visualização Pública.

Os Guardrails AI permitem que os usuários configurem e apliquem compliance de dados no nível endpoint do modelo de serviço e reduzam o conteúdo prejudicial em quaisquer solicitações enviadas ao modelo subjacente. Solicitações e respostas inválidas são bloqueadas e uma mensagem default é retornada ao usuário. Veja como configurar proteções em um endpointdo modelo de serviço.

importante

O serviço de moderação AI Guardrails depende dos modelos de pagamento por token APIs do Foundation Model. Essa dependência limita a disponibilidade do serviço de moderação AI Guardrails às regiões que suportam APIs do Foundation Model com pagamento por token. Regiões que exigem habilitação entre regiões geográficas para usar APIs do Foundation Model com pagamento por token não são compatíveis com as diretrizes AI .

A tabela a seguir resume as proteções configuráveis. Consulte as limitações.

Guarda-corpo

Definição

Filtragem de segurança

A filtragem de segurança impede que seu modelo interaja com conteúdo inseguro e prejudicial, como crimes violentos, automutilação e discurso de ódio.

O filtro de segurança do AI Gateway foi desenvolvido com o Meta Llama 3. O Databricks utiliza o Llama Guard 2-8b como filtro de segurança. Para saber mais sobre o filtro de segurança Llama Guard e os tópicos relacionados a ele, consulte o cartão do modelo Meta Llama Guard 2 8B.

Meta Llama 3 está licenciado sob a Licença LLAMA 3 comunidade, Copyright © Meta Platforms, Inc. Todos os direitos reservados. Os clientes são responsáveis por garantir compliance com as licenças modelo aplicáveis.

Detecção de informações pessoalmente identificáveis (PII)

Os clientes podem detectar qualquer informação sensível, como números de cartão de crédito, dos usuários.

Para este recurso, AI Gateway usa o Presidio para detectar as seguintes categorias de informações pessoais identificáveis (PII) dos EUA: números de cartão de crédito, endereços email , números de telefone, números account bancárias e números de segurança social.

O classificador de PII pode ajudar a identificar informações sensíveis ou PII em dados estruturados e não estruturados. No entanto, como utiliza mecanismos de detecção automatizados, não há garantia de que o serviço encontrará todas as informações sensíveis. Consequentemente, sistemas e proteções adicionais devem ser empregados.

Esses métodos de classificação são direcionados principalmente às categorias de informações pessoais identificáveis (PII) dos EUA, como números de telefone e números de segurança social.

Guarda-corpo

Definição

Filtragem de segurança

A filtragem de segurança impede que seu modelo interaja com conteúdo inseguro e prejudicial, como crimes violentos, automutilação e discurso de ódio.

O filtro de segurança do AI Gateway foi desenvolvido com o Meta Llama 3. O Databricks utiliza o Llama Guard 2-8b como filtro de segurança. Para saber mais sobre o filtro de segurança Llama Guard e os tópicos relacionados a ele, consulte o cartão do modelo Meta Llama Guard 2 8B.

Meta Llama 3 está licenciado sob a Licença LLAMA 3 comunidade, Copyright © Meta Platforms, Inc. Todos os direitos reservados. Os clientes são responsáveis por garantir compliance com as licenças modelo aplicáveis.

Detecção de informações pessoalmente identificáveis (PII)

Os clientes podem detectar qualquer informação sensível, como números de cartão de crédito, dos usuários.

Para este recurso, AI Gateway usa o Presidio para detectar as seguintes categorias de informações pessoais identificáveis (PII) dos EUA: números de cartão de crédito, endereços email , números de telefone, números account bancárias e números de segurança social.

O classificador de PII pode ajudar a identificar informações sensíveis ou PII em dados estruturados e não estruturados. No entanto, como utiliza mecanismos de detecção automatizados, não há garantia de que o serviço encontrará todas as informações sensíveis. Consequentemente, sistemas e proteções adicionais devem ser empregados.

Esses métodos de classificação são direcionados principalmente às categorias de informações pessoais identificáveis (PII) dos EUA, como números de telefone e números de segurança social.

Usar o AI Gateway (legado)​

You can configure AI Gateway (legacy) recursos on your servindo modelo endpoints using the Serving UI. See Configure governance on servindo modelo endpoints (legacy).

Limitações​

As seguintes são limitações para Endpoint com o AI Gateway (legado) habilitado:

  • Quando as proteções AI são usadas, o tamanho dos lotes de solicitação, ou seja, o tamanho dos lotes de embeddings, o tamanho dos lotes de conclusões ou o parâmetro n das solicitações de bate-papo, não pode exceder 16.
  • Se você usar chamadas de função e especificar diretrizes AI , essas diretrizes não serão aplicadas às solicitações e respostas intermediárias da função. No entanto, são aplicadas restrições à resposta final de saída.
  • Cargas de trabalho de conversão de texto em imagem não são suportadas.
  • Somente o acompanhamento de uso é suportado para cargas de trabalho de inferência em lotes em Endpoint pay-per-tokens que têm recursos do AI Gateway (legado) habilitados. Na tabela do sistema endpoint_usage, apenas as correspondentes à solicitação de inferência em lotes estarão visíveis.
  • As salvaguardas e os mecanismos de contingência AI não são suportados no endpoint do modelo de serviço personalizado.
  • Para endpoints de modelo de serviço personalizado, somente cargas de trabalho que não são otimizadas para roteamento suportam limitação de taxa e acompanhamento de uso.
  • As tabelas de inferência para o endpoint do modelo de serviço otimizado para rotas estão em Pré-visualização Pública.
  • Consulte as limitações de tabelas de inferência ativadas pelo AI Gateway (legado) para obter detalhes sobre as limitações das tabelas de inferência.