メインコンテンツまでスキップ

バッチ推論

備考

プレビュー

この機能は パブリック プレビュー段階です。

これらのノートブックでは、AIランタイムのServerless GPU上で大規模なバッチ推論を実行します。これらは、Ray Data、vLLM、Transformersなどのフレームワークを使用して、LLMテキスト生成や音声文字起こしなどのさまざまなモダリティをカバーしています。

チュートリアル

説明

Ray DataおよびvLLMを使用したQwen2.5-32Bバッチ推論

8台のH100 GPU上でQwen2.5-32B-Instructの8つの永続的なvLLMレプリカを使用して多言語バッチ推論を実行し、結果をUnity Catalogに保存します。

Whisper を使用したバッチ音声テキスト変換

AIランタイムにプレインストールされているライブラリを使用して、Serverless GPU上のOpenAI Whisper large-v3-turboで音声をバッチで文字起こしします。

チュートリアル

説明

Ray DataおよびvLLMを使用したQwen2.5-32Bバッチ推論

8台のH100 GPU上でQwen2.5-32B-Instructの8つの永続的なvLLMレプリカを使用して多言語バッチ推論を実行し、結果をUnity Catalogに保存します。

Whisper を使用したバッチ音声テキスト変換

AIランタイムにプレインストールされているライブラリを使用して、Serverless GPU上のOpenAI Whisper large-v3-turboで音声をバッチで文字起こしします。