Aller au contenu principal

Inférence par batch

info

Aperçu

Cette fonctionnalité est en aperçu public.

Ces notebooks exécutent des inférences par batch à grande échelle sur des GPU serverless AI Runtime. Ils couvrent une gamme de modalités, telles que la génération de texte LLM et la transcription de la parole au texte (speech-to-text), en utilisant des frameworks comme Ray Data, vLLM et Transformers.

Didacticiel

Description

Inférence par batch de Qwen2.5-32B avec Ray Data et vLLM

Exécutez une inférence par batch multilingue avec huit répliques vLLM persistantes de Qwen2.5-32B-Instruct sur 8 GPU H100 et enregistrez les résultats dans le Unity Catalog.

Transcription vocale par batch avec Whisper

Retranscrivez des fichiers audio par batch avec OpenAI Whisper large-v3-turbo sur des GPU serverless, en utilisant des bibliothèques préinstallées dans AI Runtime.

Didacticiel

Description

Inférence par batch de Qwen2.5-32B avec Ray Data et vLLM

Exécutez une inférence par batch multilingue avec huit répliques vLLM persistantes de Qwen2.5-32B-Instruct sur 8 GPU H100 et enregistrez les résultats dans le Unity Catalog.

Transcription vocale par batch avec Whisper

Retranscrivez des fichiers audio par batch avec OpenAI Whisper large-v3-turbo sur des GPU serverless, en utilisant des bibliothèques préinstallées dans AI Runtime.