動画記事 · AI Engineer
構造化されないデータの整理へ - Red Hat の Cedric Clyburn氏
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Red Hat の Cedric Clyburn 氏が、LLM やエージェントの文脈構築において不可欠な非構造化データ(PDF、表、画像)を、Linux Foundation のオープンソースツール「Docling」を用いて高精度かつローカルで構造化する方法を実演付きで紹介する。
非構造化データの壁を破る:Red Hat が提案する「Docling」による AI 文脈の再構築
企業内で膨大に蓄積された PDF やスキャン文書、図表といった「非構造化データ」は、AI アプリケーションの精度を低下させる最大のボトルネックとなっています。しかし、Red Hat のエンジニアであるセドリック・クライバーン氏が紹介するオープンソースツール「Docling」は、OCR とビジョンモデルを組み合わせることで、これらの複雑なデータを高精度に構造化し、RAG や自律型エージェントが即座に活用できる形に変換します。
非構造化データが AI に与える致命的な影響
AI アプリケーションやエージェントにおいて、コンテキストの質は結果を左右する最も重要な要素です。しかし、現実には世界中のデータの大部分が PDF、プレゼン資料、契約書、スキャン文書、図表といった「非構造化」の状態で散在しており、LLM が直接処理できる形になっていません。
「既存の単純なパーサーや、外部 API を高価に利用する従来の手法では、表や画像の情報が欠落したり誤認識されたりします。その結果、AI は意味不明な用語を生成し、ハルシネーション(幻覚)の原因となります。」
クライバーン氏は、過去に AI が古いスキャン記事を読み込む際、2 つの異なる列にある言葉を誤って結合したことが原因で、科学論文に存在しない用語が蔓延してしまった事例を挙げています。このように、データ処理の精度が低いと、ユーザーや顧客に対して信頼性の低い回答を提供することになりかねません。
単純な PDF パーサーでは、表の内容が線形に切り捨てられたり、画像からの情報が完全に欠落したりします。一方、高価な最先端モデル(例:100 万トークンあたり約 30 ドル)に丸投げすればある程度は処理できますが、数千〜数万のドキュメントを処理する企業規模ではコストが膨大になり、かつ非決定論的な出力によるハルシネーションリスクも残ります。
Docling:ローカルで高速・高精度なデータ抽出を実現
この課題に対する解決策として登場したのが、Linux Foundation の一部であるオープンソースツール「Docling」です。これは、OCR(光学文字認識)と特定のビジョンモデルを組み合わせることで、複雑なレイアウトや画像を含むドキュメントから、Markdown や JSON 形式の構造化データを正確に抽出します。
Docling の最大の特徴は、ローカル環境での実行にあります。GPU を必要とせず CPU でも動作するため、外部 API への依存や高額な利用料を避けつつ、データプライバシーを確保したまま高速処理を実現できます。
「数千もの PDF を処理する際、Docling はコスト削減に 50 倍の効果をもたらします。GPU を使わずにこれを実現できる点は、大規模ドキュメント処理において極めて重要です。」
実際のデモでは、8 ページの PDF を LLM がすぐに活用できる形式でエクスポートするスピードが示されました。単なるテキスト抽出にとどまらず、文書内の表をデータフレームとして抽出したり、画像の内容を記述させたりすることが可能です。
例えば、請求書の「請求番号」や「合計金額」、あるいは組織の専門家が在籍していない場合でも画像から状況を理解できるような注釈付きキャプションなど、必要な情報だけを Pydantic 形式で構造化して取得できます。これにより、RAG(検索拡張生成)アプリケーションにおいて、文脈を失うことなく質問に回答する基盤が整います。
チャンクレス RAG と AI エージェントへの標準連携
Docling の真価は、単なるドキュメント変換ツールを超え、「チャンクレス RAG」やAI エージェントとの連携を可能にする点にあります。
従来の RAG では、文書を細かく分割(チャンキング)し、ベクトルデータベースに埋め込む必要があります。しかし Docling を使えば、ドキュメントの Markdown アウトラインそのものを検索インデックスとして機能させます。LLM がユーザーの質問に関連するセクションを直接特定し、全文を抽出して回答を試みる「エージェント型 RAG」が実現可能です。
「チャンカーや埋め込みモデル、ベクトルデータベースを使わずに、ドキュメント構造内で特定のテキストを検索することで、ユーザーの質問に正確に回答できます。」
また、Docling はMCP(Model Context Protocol)サーバーとしても機能します。これにより、Claude Code や Cursor などの AI エージェントが、標準化されたインターフェースを通じてドキュメントを直接処理・分析できるようになります。
開発者は、複雑な引数やコマンドを覚える必要なく、「この PDF の特定の部分を処理して要約してください」と指示するだけで、AI エージェントが Docling を経由して文書変換や情報抽出を実行します。これにより、データプライバシーが重視されるエンタープライズ環境でも、安全かつ効率的な AI 自動化が可能になります。
まとめ:オープンソースが加速させる実用的な AI 導入
Docling は、非構造化データの活用難易度という長年の課題を、ローカル実行可能で高品質なオープンソースツールによって解決する道筋を示しました。データプライバシーの確保やコスト削減が必要な大規模ドキュメント処理において、このツールは RAG や自律型エージェントの実用化を加速させる重要なインフラとなり得ます。
企業が AI を本格的に導入し、信頼性の高いアプリケーションを提供するためには、データの「形」を整えることが不可欠です。Docling のようなツールを活用することで、散在する非構造化データが、AI が理解できる価値あるコンテキストへと生まれ変わるのです。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。