Pular para o conteúdo principal

Inferência em lotes

info

Visualização

Esse recurso está em Prévia Pública.

Estes notebooks executam inferência em lote em grande escala em GPUs serverless do AI Runtime. Eles cobrem uma variedade de modalidades, como geração de texto por LLM e conversão de fala em texto, usando frameworks como Ray Data, vLLM e Transformers.

Tutorial

Descrição

Inferência em lote de Qwen2.5-32B com Ray Data e vLLM

Execute a inferência multilíngue em lotes com oito réplicas vLLM persistentes de Qwen2.5-32B-Instruct em 8 GPUs H100 e salve os resultados no Unity Catalog.

Conversão de fala em texto em lote com Whisper

Transcreva áudio em lotes com OpenAI Whisper large-v3-turbo em GPUs serverless, usando bibliotecas pré-instaladas no AI Runtime.

Tutorial

Descrição

Inferência em lote de Qwen2.5-32B com Ray Data e vLLM

Execute a inferência multilíngue em lotes com oito réplicas vLLM persistentes de Qwen2.5-32B-Instruct em 8 GPUs H100 e salve os resultados no Unity Catalog.

Conversão de fala em texto em lote com Whisper

Transcreva áudio em lotes com OpenAI Whisper large-v3-turbo em GPUs serverless, usando bibliotecas pré-instaladas no AI Runtime.