ドキュメントの解析
ドキュメント解析は、PDF、画像、Word文書(DOC/DOCX)、PowerPointファイル(PPT/PPTX)など、幅広い種類のドキュメントから構造化データを抽出および視覚化するために、最先端の研究技術を使用しています。テーブル、チャート、テキストと画像の混在コンテンツなど、複雑なレイアウトを処理するように設計されています。
ドキュメントの解析は、 Agent Bricks UI、 SQL、および REST API で利用できます。
UI でドキュメント解析エージェントを作成する
要件
-
以下を含むワークスペースです。
- サーバレス コンピュートが有効になっていること。 サーバレス コンピュートの要件を参照してください。
- Unity Catalogが有効です。「Unity Catalog のワークスペースを有効にする」を参照してください。
- ゼロ以外の予算を持つサーバレス利用ポリシーへのアクセス。
-
この機能は一部のリージョンでのみ利用可能です。AI 機能の利用可能性を参照してください。
ai_parse_document機能は、強化されたセキュリティとコンプライアンス アドオンが適用されたワークスペースでもご利用いただけます。
ドキュメントの解析を使用してドキュメントを解析し、その構造を視覚化します。
- ワークスペースの左側のナビゲーションペインにある
エージェント に移動します。
- 「 エージェントの作成 」>「 ドキュメントの解析 」をクリックします。
- ソースドキュメントを選択します。ファイルをアップロードするか、既存のUnity Catalogカタログからファイルを選択できます。サポートされている形式には、PDF、画像、DOC/DOCX、PPT/PPTXが含まれます。
- ドキュメントを解析 をクリックします。
ドキュメントの解析には数分かかる場合があります。完了すると、「ドキュメントの解析」により、ソースドキュメントが左側に、解析されたドキュメントが右側に表示されます。解析されたドキュメントを フォーマット済み テキストまたは Raw JSON として表示することを選択できます。

クエリ結果の処理
ai_parse_documentクエリを表示してより多くのドキュメントで実行するには、 エージェントを使用 をクリックし、SQLエディターまたはノートブックからクエリを実行するかを選択します。ドキュメントが存在するボリュームまたはテーブルを指すようにクエリを編集できます。
取得(RAG)のために解析済み出力を準備するには、ai_prep_search(ベータ版)をダウンストリームで使用します。
SQL でドキュメントを解析する
SQL で ai_parse_document を呼び出して、ドキュメントを大規模に解析します:
SELECT
ai_parse_document(
content,
map('version', '2.0')
) AS parsed
FROM READ_FILES('/Volumes/my_catalog/my_schema/my_documents', format => 'binaryFile');
ai_parse_document SQL リファレンスを参照してください。
REST APIを使用してドキュメントを解析する
REST API を使用して、アプリケーション、サービス、自動化ワークフローからドキュメントを解析します。詳細については、REST API ドキュメントをご参照ください。
ai_parse_document REST API リクエストは、1 ドキュメントあたり 100 ページまでに制限されています。
ai_parse_document Unity Catalog ボリュームから入力を読み取ります。次の例では、Files API を使用してローカルの PDF をボリュームにuploadし、それを解析します。
まず、ドキュメントをボリュームにuploadします。
curl -X PUT "$DATABRICKS_HOST/api/2.0/fs/files/Volumes/my_catalog/my_schema/my_volume/invoice.pdf?overwrite=true" \
-H "Authorization: Bearer $DATABRICKS_TOKEN" \
-H "Content-Type: application/octet-stream" \
--data-binary @invoice.pdf
次に、uploadされたドキュメントのボリュームパスを content として渡して解析します。
curl -X POST "$DATABRICKS_HOST/api/2.0/ai-functions/ai-parse-document" \
-H "Authorization: Bearer $DATABRICKS_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"content": "/Volumes/my_catalog/my_schema/my_volume/invoice.pdf"
}'
制限事項
ai_parse_documentの制限事項を参照してください。