Inferência em lotes
info
Visualização
Esse recurso está em Prévia Pública.
Estes notebooks executam inferência em lote em grande escala em GPUs serverless do AI Runtime. Eles cobrem uma variedade de modalidades, como geração de texto por LLM e conversão de fala em texto, usando frameworks como Ray Data, vLLM e Transformers.
Tutorial | Descrição |
|---|---|
Execute a inferência multilíngue em lotes com oito réplicas vLLM persistentes de Qwen2.5-32B-Instruct em 8 GPUs H100 e salve os resultados no Unity Catalog. | |
Transcreva áudio em lotes com OpenAI Whisper large-v3-turbo em GPUs serverless, usando bibliotecas pré-instaladas no AI Runtime. |