Pular para o conteúdo principal

Endpoints de servindo modelo do foundation model (legado)

nota

Esta página descreve o fluxo de trabalho de Model Serving baseado em endpoint herdado. Para localizar e fazer query de modelos por meio do Unity Gateway, consulte modelos disponíveis e query model serviços.

Acesse modelos de base hospedados fora do Databricks​

Os modelos de fundação criados por provedores de LLM, como OpenAI e Anthropic, também podem ser acessados no Databricks usando Modelos externos. Estes modelos são hospedados fora do Databricks e você pode criar um endpoint para consultá-los. Esses endpoints podem ser governados centralmente a partir do Databricks, o que simplifica o uso e o gerenciamento de vários provedores de LLM dentro da sua organização.

A tabela a seguir apresenta uma lista não exaustiva de modelos compatíveis e os tipos de endpoint correspondentes. Você pode usar as associações de modelo listadas para ajudar a configurar um endpoint para qualquer tipo de modelo recém-lançado à medida que eles se tornam disponíveis com um determinado provedor. Os clientes são responsáveis por garantir a compliance com as licenças de modelo aplicáveis.

nota

Com o rápido desenvolvimento dos LLMs, não há garantia de que esta lista esteja sempre atualizada. Novas versões de modelo do mesmo provedor normalmente são suportadas, mesmo que não estejam na lista.

Provedor de modelos

llm/v1/completions

llm/v1/chat

llm/v1/embeddings

OpenAI**

  • gpt-3.5-turbo-instruct - babbage-002 - davinci-002
  • o1 - o1-mini - o1-mini-2024-09-12 - gpt-3.5-turbo - gpt-4 - gpt-4-turbo - gpt-4-turbo-2024-04 - gpt-4o - gpt-4o-2024-05-13 - gpt-4o-mini
  • text-embedding-ada-002 - text-embedding-3-large - text-embedding-3-small

Azure OpenAI**

  • text-davinci-003 - gpt-35-turbo-instruct
  • o1 - o1-mini - gpt-35-turbo - gpt-35-turbo-16k - gpt-4 - gpt-4-turbo - gpt-4-32k - gpt-4o - gpt-4o-mini
  • text-embedding-ada-002 - text-embedding-3-large - text-embedding-3-small

Anthropic

  • claude-1 - claude-1.3-100k - claude-2 - claude-2.1 - claude-2.0 - claude-instant-1.2
  • claude-3-5-sonnet-latest - claude-3-5-haiku-latest - claude-3-5-opus-latest - claude-3-5-sonnet-20241022 - claude-3-5-haiku-20241022 - claude-3-5-sonnet-20240620 - claude-3-haiku-20240307 - claude-3-opus-20240229 - claude-3-sonnet-20240229

Cohere**

  • comando - command-light
  • command-r7b-12-2024 - command-r-plus-08-2024 - command-r-08-2024 - command-r-plus - command-r - comando - command-light-nightly - command-light - command-nightly
  • embed-english-v2.0 - embed-multilingual-v2.0 - embed-english-light-v2.0 - embed-english-v3.0 - embed-english-light-v3.0 - embed-multilingual-v3.0 - embed-multilingual-light-v3.0

Servindo modelo

Endpoint de serving do Databricks

Endpoint de serving do Databricks

Endpoint de serving do Databricks

Amazon Bedrock

Anthropic: - claude-instant-v1 - claude-v2 Cohere: - command-text-v14 - command-light-text-v14 AI21 Labs: - j2-grande-instruct - j2-jumbo-instruct - j2-mid - j2-mid-v1 - j2-ultra - j2-ultra-v1

Anthropic: - claude-3-5-sonnet-20241022-v2:0 - claude-3-5-haiku-20241022-v1:0 - claude-3-opus-20240229-v1:0 - claude-3-sonnet-20240229-v1:0 - claude-3-5-sonnet-20240620-v1:0 Cohere: - command-r-plus-v1:0 - comando-R-v1:0 Amazon: - nova-lite-v1:0 - nova-micro-v1:0 - nova-pro-v1:0

Amazon: - titan-embed-text-v2:0 - titan-embed-text-v1 - titan-embed-g1-text-02 Cohere: - embed-english-v3 - embed-multilingual-v3

AI21 Labs†

  • j2-mid - j2-light - j2-ultra

Google Cloud Vertex AI

text-bison

  • chat-bison - gemini-pro - gemini-1.0-pro - gemini-1.5-pro - gemini-1.5-flash - gemini-2.0-flash
  • text-embedding-004 - text-embedding-005 - textembedding-gecko

Provedor de modelos

llm/v1/completions

llm/v1/chat

llm/v1/embeddings

OpenAI**

  • gpt-3.5-turbo-instruct - babbage-002 - davinci-002
  • o1 - o1-mini - o1-mini-2024-09-12 - gpt-3.5-turbo - gpt-4 - gpt-4-turbo - gpt-4-turbo-2024-04 - gpt-4o - gpt-4o-2024-05-13 - gpt-4o-mini
  • text-embedding-ada-002 - text-embedding-3-large - text-embedding-3-small

Azure OpenAI**

  • text-davinci-003 - gpt-35-turbo-instruct
  • o1 - o1-mini - gpt-35-turbo - gpt-35-turbo-16k - gpt-4 - gpt-4-turbo - gpt-4-32k - gpt-4o - gpt-4o-mini
  • text-embedding-ada-002 - text-embedding-3-large - text-embedding-3-small

Anthropic

  • claude-1 - claude-1.3-100k - claude-2 - claude-2.1 - claude-2.0 - claude-instant-1.2
  • claude-3-5-sonnet-latest - claude-3-5-haiku-latest - claude-3-5-opus-latest - claude-3-5-sonnet-20241022 - claude-3-5-haiku-20241022 - claude-3-5-sonnet-20240620 - claude-3-haiku-20240307 - claude-3-opus-20240229 - claude-3-sonnet-20240229

Cohere**

  • comando - command-light
  • command-r7b-12-2024 - command-r-plus-08-2024 - command-r-08-2024 - command-r-plus - command-r - comando - command-light-nightly - command-light - command-nightly
  • embed-english-v2.0 - embed-multilingual-v2.0 - embed-english-light-v2.0 - embed-english-v3.0 - embed-english-light-v3.0 - embed-multilingual-v3.0 - embed-multilingual-light-v3.0

Servindo modelo

Endpoint de serving do Databricks

Endpoint de serving do Databricks

Endpoint de serving do Databricks

Amazon Bedrock

Anthropic: - claude-instant-v1 - claude-v2 Cohere: - command-text-v14 - command-light-text-v14 AI21 Labs: - j2-grande-instruct - j2-jumbo-instruct - j2-mid - j2-mid-v1 - j2-ultra - j2-ultra-v1

Anthropic: - claude-3-5-sonnet-20241022-v2:0 - claude-3-5-haiku-20241022-v1:0 - claude-3-opus-20240229-v1:0 - claude-3-sonnet-20240229-v1:0 - claude-3-5-sonnet-20240620-v1:0 Cohere: - command-r-plus-v1:0 - comando-R-v1:0 Amazon: - nova-lite-v1:0 - nova-micro-v1:0 - nova-pro-v1:0

Amazon: - titan-embed-text-v2:0 - titan-embed-text-v1 - titan-embed-g1-text-02 Cohere: - embed-english-v3 - embed-multilingual-v3

AI21 Labs†

  • j2-mid - j2-light - j2-ultra

Google Cloud Vertex AI

text-bison

  • chat-bison - gemini-pro - gemini-1.0-pro - gemini-1.5-pro - gemini-1.5-flash - gemini-2.0-flash
  • text-embedding-004 - text-embedding-005 - textembedding-gecko

** O provedor de modelos é compatível com modelos de chat e conclusão ajustados. Para consultar um modelo ajustado, preencha o campo name da configuração external model com o nome do seu modelo ajustado.

† O provedor de modelos aceita modelos de conclusão personalizados.

Criar Endpoint de servindo modelo de modelo base​

Para query e usar modelos básicos em seus aplicativos de IA, primeiro você deve criar um Endpoint de servindo modelo. O Model Serving usa uma API unificada e uma interface do usuário para criar e atualizar endpoints de Model Serving de modelos básicos.

Query de endpoints de servindo modelo básico​

Depois de criar seu endpoint de servindo, você poderá consultar seu modelo base. O Model Serving usa uma API e um SDK compatíveis com OpenAI unificados para consultar modelos base. Essa experiência unificada simplifica a forma como você testa e personaliza modelos base para produção em clouds e provedores compatíveis.

Consulte Usar modelos básicos.