メインコンテンツまでスキップ

インテリジェントなドキュメント処理

インテリジェントドキュメント処理(IDP)は、PDF、DOCXファイル、画像、プレゼンテーションなどの非構造化コンテンツを、ダウンストリームのエージェント、アプリケーション、アナリティクスを強化する構造化されたエンリッチデータに変換します。

Databricksでは、どちらも同じ研究開発されたAI関数に基づいて構築された、2つのIDP実行方法を提供しています:

  • Agent Bricks UI : ドキュメントの解析、抽出、分類を行うためのノーコードのビジュアルエクスペリエンスです。これを使用して、スケールする前にドキュメントサンプルをテストし、スキーマやラベルを調整し、結果を視覚的に検証します。
  • SQL AI Functions :インテリジェントなドキュメント処理関数をLakehouse上で直接ランします。これらを使用して、ドキュメントを大規模に処理し、ステージを組み合わせて、Lakeflow pipelinesでガバナンスの効いた本番運用グレードのパイプラインを構築します。

インテリジェントなドキュメント処理機能

機能

Agent Bricks UI

SQL関数

PDF、DOCX、画像、PPTを構造化されたテキスト、表、図の説明に変換します。

ドキュメントの解析

ai_parse_document

定義するスキーマを使用して、ドキュメントまたはプレーンテキストから構造化されたフィールドを抽出します。

情報の抽出

ai_extract

ドキュメントやテキストに事前に定義されたカテゴリを割り当て、最大500以上のラベルをサポートします。

分類

ai_classify

解析済みのドキュメントを、検索拡張生成(RAG)およびAI Searchのインデックス作成に対応できるセマンティックチャンクに変換します。

ai_prep_search (ベータ版)

機能

Agent Bricks UI

SQL関数

PDF、DOCX、画像、PPTを構造化されたテキスト、表、図の説明に変換します。

ドキュメントの解析

ai_parse_document

定義するスキーマを使用して、ドキュメントまたはプレーンテキストから構造化されたフィールドを抽出します。

情報の抽出

ai_extract

ドキュメントやテキストに事前に定義されたカテゴリを割り当て、最大500以上のラベルをサポートします。

分類

ai_classify

解析済みのドキュメントを、検索拡張生成(RAG)およびAI Searchのインデックス作成に対応できるセマンティックチャンクに変換します。

ai_prep_search (ベータ版)

一般的なユースケース

Databricks の IDP は、幅広いダウンストリーム アプリケーションを強化します:

  • 検索拡張生成 (RAG) :チャンキング、検索品質、LLMアプリケーションのグラウンディングを改善するために、ドキュメントを解析し、構造化します。
  • ナレッジ抽出とアナリティクス :ドキュメントデータに対する検索、レポート、ビジネスインテリジェンスを可能にするために、主要なフィールドとメタデータを抽出します。
  • Agent-driven workflows :ドキュメントをルーティング、分類、拡充して、自動化された意思決定とタスクの実行を支援します。
  • **文書の理解と分類**:後続の処理のために、種類、トピック、または内容別に大規模なドキュメントコーパスを整理します。

仕組み

Databricksは、レイクハウス上でインテリジェントなドキュメント処理を統合されたエンドツーエンドのワークフローとして実現します。取り込み、解析、エンリッチメント、およびダウンストリーム分析は単一のプラットフォーム上に構築されているため、各ステージは複雑な統合やデータ移動を必要とせずにシームレスに連携します。

  1. 取り込みとオーケストレーション

    LakeFlow Pipelines を使用して生ドキュメント(PDF、画像、DOCXファイルなど)を取り込み、パイプラインをオーケストレートします。取り込みとオーケストレーションがLakehouseにネイティブに統合されているため、ドキュメントは追加のインフラストラクチャなしで直接ダウンストリーム処理に流れます。

  2. ドキュメントの解析(ブロンズレイヤー)

    生ファイルを構造化表現に変換するためにai_parse_documentを適用します。これにより、テキスト、テーブル/画像の説明、およびドキュメント構造をキャプチャする標準化されたブロンズレイヤーが作成され、すべてのダウンストリームユースケースに対して一貫した基盤が形成されます。

  3. 抽出と分類

    ai_extractai_classify を使用して、解析済みドキュメントを構造化フィールドとメタデータで強化します。これらの関数は解析された出力に直接作用し、追加の変換ステップなしで、主要な情報を抽出し、ドキュメントを分類し、ワークフローを介してルーティングすることを可能にします。

  4. 検索のための準備 (RAG)

    解析されたドキュメントを、タイトル、セクションヘッダー、ページ参照などのドキュメントレベルのコンテキストで強化されたセマンティックチャンクに変換するために、ai_prep_search(ベータ版)を適用します。出力は AI Search のインデックス作成用にフォーマットされており、RAG および検索ワークロード向けの一貫した基盤を提供します。

  5. 分析および運用

    下流のアナリティクス、検索 (RAG)、エージェント主導のワークフローには、追加のAI Functionsやその他のツール(AI/BIダッシュボード、アプリ、AI Search)を活用できます。すべてのデータがレイクハウス上にあるため、構造化されたドキュメントデータは、検索、ダッシュボード、およびアプリケーションに即座に利用できます。