メインコンテンツまでスキップ

AI ランタイムでGenie Codeを使用する

備考

プレビュー

この機能は パブリック プレビュー段階です。

Genie Codeは、AI ランタイムに接続されたノートブックでのディープラーニングワークロードの開発とトラブルシューティングを支援します。分散トレーニングコードの生成、環境および依存関係の問題の解決、GPUワークロードの障害調査を支援します。

Genie Code は、AI Runtime ノートブック内の 8 基の H100 GPU 全体で分散 CNN トレーニングワークロードを作成および実行します。

要件

AI Runtime で Genie Code を使用するには:

使い始める

  1. Databricksノートブックを開きます。

  2. ノートブックをAI Runtimeに接続します。「AI ランタイムへの接続」を参照してください。

  3. Genie Codeペインを開きます。

  4. 開発したいワークロード、または解決したい問題について説明してください。

  5. 提案された計画、コードの変更、およびアクションを承認する前に、それらを確認してください。

重要

Genie Codeはミスをすることがあります。生成されたコード、環境の変更、およびその他の提案されたアクションは、実行前に確認してください。診断によっては、追加のLogsやワークロードのコンテキストが必要になる場合があります。

Genie Codeで何ができますか?

分散トレーニングワークロードを開発する

Genie Codeは、AI ランタイムのトレーニングコードを生成または更新できます。適切なPyTorch分散戦略の選択、serverless_gpuパッケージの@distributed APIの使用、およびデータ読み込み、チェックポイント作成、MLflow追跡のためのAI ランタイムパターンの適用を支援します。APIの詳細と例については、「ノートブックでの分散トレーニング」を参照してください。

環境および依存関係の問題を解決する

Genie Codeは、現在の環境を検査し、パッケージの互換性エラーとコードまたはAPIの変更を区別して、的を絞った修正を推奨できます。また、ワークロードの依存関係に基づいて、Databricks AI環境とStandard環境のどちらを選択すべきかを判断するのにも役立ちます。利用可能な環境の詳細については、環境のセットアップを参照してください。

GPUおよび分散ワークロードをデバッグする

Genie Code は、ノートブックの出力と利用可能な Logs を使用して、分散トレーニングの失敗、通信エラー、トレーニングのハング、および GPU メモリの問題を調査できます。これは、最初の障害を特定し、他のランクで発生したダウンストリームのエラーと区別するのに役立ちます。分散トレーニングの Logs の表示に関する情報については、エクスペリメントの追跡と可観測性を参照してください。

プロンプトの例

分散トレーニングワークロードを開発する

  • 「AI Runtime の 8 基の H100 GPU すべてで分散トレーニングを実行するように、このノートブックを更新してください。」
  • 「この分散トレーニングノートブックをレビューし、serverless_gpuとMLflowの使用方法を修正してください。」
  • 「このトレーニング ワークロードを AI Runtime に適応させ、重要な変更点について説明してください。」

環境および依存関係の問題を解決する

  • 「新しいパッケージをインストールした後、このノートブックが動作しなくなりました。環境を検査し、問題が依存関係の問題なのか、コードAPIの変更なのかを判断してください。」
  • 「このワークロードは Databricks AI 環境と標準環境のどちらを使用すべきですか?変更を行う前に、その依存関係を確認し、環境を推奨してください。」
  • 「このパッケージの互換性エラーを診断し、最小限の適切な変更を推奨してください。」

GPUおよび分散ワークロードをデバッグする

  • 「すべてのランクから得られる出力を使用して、この失敗した分散トレーニングのランを分析し、根本原因を特定してください。」
  • "なぜこの分散ワークロードはハングしているのですか?ノートブックの出力を使用して、次のデバッグステップを推奨します。"
  • 「このGPUメモリ障害を調査し、根拠に基づいた次のステップを推奨してください。」

その他のリソース