Inférence par batch
info
Aperçu
Cette fonctionnalité est en aperçu public.
Ces notebooks exécutent des inférences par batch à grande échelle sur des GPU serverless AI Runtime. Ils couvrent une gamme de modalités, telles que la génération de texte LLM et la transcription de la parole au texte (speech-to-text), en utilisant des frameworks comme Ray Data, vLLM et Transformers.
Didacticiel | Description |
|---|---|
Exécutez une inférence par batch multilingue avec huit répliques vLLM persistantes de Qwen2.5-32B-Instruct sur 8 GPU H100 et enregistrez les résultats dans le Unity Catalog. | |
Retranscrivez des fichiers audio par batch avec OpenAI Whisper large-v3-turbo sur des GPU serverless, en utilisant des bibliothèques préinstallées dans AI Runtime. |