動画記事 · AI Engineer
LLM 構築知識グラフの根拠を問う
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
LLM 生成の知識グラフにおける不確実性と改変を解決するため、ソースとの完全な系譜(プロベナンス)を追跡可能な時系列グラフ「Graffiti」のアーキテクチャと実装事例を紹介する。
LLM の「嘘」を消す:Graffiti が解決する生成 AI の信頼性危機
大規模言語モデル(LLM)は多様なソースから情報を統合して要約する能力に長けていますが、その非決定論的な性質ゆえに「事実の出所」や「検証可能性」が失われるという致命的な課題を抱えています。この「プロベナンス(由来の追跡)」の問題を解決するために提案されたのが、時系列グラフフレームワーク「Graffiti」です。
LLM が生成した情報の信頼性を担保し、医療や金融といった高リスク領域での法的コンプライアンス対応を可能にする Graffiti の仕組みと、なぜこれが次世代 AI エージェントの基盤となるのかを解説します。
LLM 特有の「出所不明」問題と非決定論的リスク
LLM は複数のソースデータを解釈・統合して要約し、構造化された記録や事実を生成します。しかし、このプロセスは非決定論的です。つまり、同じ入力に対して出力が常に一定ではなく、また生成された事実は元のソースにそのまま存在するわけではありません。
「合成(Synthesis)のプロセスは、どのようにして出力が生まれたのかという足跡(paper trail)を破壊してしまう。」
この「プロベナンス」の喪失は、法的なコンプライアンス要件を満たす上で深刻な障害となります。また、システムデバッグにおいて「なぜその事実が導き出されたのか」を追跡できなければ、エラーの原因特定も不可能になります。
特に医療シナリオを例にとると、LLM が電子カルテ(EHR)、PDF の検査報告書、患者の入力チャットなど複数のソースから「ペニシリンアレルギーあり」という事実を抽出したとします。もしこの情報が患者自身が入力したデータに由来するものであれば、医師に対して「信頼できる臨床記録に基づく」と誤って認識させる危険性があります。
「エージェントが医療現場で事実を提示する際、それがどのソースから来ており、その真偽(veracity)はどれほど確かなのかを指し示せるか。複雑な AI エージェント応用において、この答えは往々にして『いいえ』となります。」
Graffiti が描く「時系列グラフ」の構造
従来のデータウェアハウスやログ管理では、ソース ID を事実ごとに付与する手法が有効に機能することがあります。しかし、LLM によるコンテキストパイプラインでは、複数の名前(例:J. Smith と John Smith)が統合されたり、新しいデータが既存の事実を無効化したりと、データ構造が動的に変化します。
「ログへの追加(append-only)方式は、スケールする中で頻繁に発生する変更や矛盾を追跡するには管理不可能になります。系譜(lineage)は変化するセットであり、変化し続ける環境で生き残る必要があります。」
Graffiti はこの課題に対し、事実とソースデータを「ノード」、それらの関係性を「エッジ」としてモデル化する時系列グラフ構造を採用しています。
- 基本構造: ソースデータ(例:患者のエピソード)から抽出されたエンティティ(患者、ペニシリン)をノードとし、両者の関係をエッジで結びます。このトリプルが「事実」として水化(hydrated)されます。
- 系譜の追跡: グラフ上のパスを辿ることで、事実からソースへの逆引きが即座に可能です。
- 変化への対応:
- エンティティ統合時: 統合されたエンティティは、元の両方のエンティティからのソースリンクを引き継ぎます。これにより、ソースの喪失を防ぎます。
- 矛盾する情報発生時: 新しいデータが既存の事実と矛盾する場合、Graffiti はそのエッジに「無効化日付」を追加し、変更を引き起こしたソースエピソードを記録します。
この構造により、ソースデータと派生した事実(アティファクト)の関係性を明確にモデル化し、変更履歴や矛盾する情報の系譜をすべて追跡可能にしています。
メタデータの継承と動的な信頼性評価
Graffiti の真価は、単なる記録だけでなく、メタデータ(タグ)の継承機能にあります。これにより、事実の検証性を動的に判断し、ビジネスルールに基づいて情報の取得可否を制御できます。
例えば、EHR 記録から派生したエピソードには「EHR」というタグが付与されます。Graffiti では、このタグは派生するすべてのエンティティや事実へと継承されます。エージェントが「臨床的に検証されたソースからの事実のみを取得したい」と要求すれば、グラフを辿る際に該当タグを持つノードのみをフィルタリングするだけで済みます。
しかし、問題は複数のソース(親エピソード)から合成された場合です。ある事実が 3 つの親エピソードに依存している場合、その信頼性は「どのルール」で判断するかによって変わります。
- 命に関わるアレルギー情報: 3 つのうち 1 つでも未検証であれば、その事実を信頼して処方箋を発行すべきではありません。このケースでは、「すべての親が検証済みであること」が条件となります。
- 手続きの同意書: 同様に、患者の同意が必要であれば、すべてのソースから同意が得られている必要があります。
「Graffiti は、どのエピソードに特定のタグがあるかを露呈(expose)しますが、その結果に基づいて『事実を取得すべきか』というビジネスルールを適用するのはエージェント側の役割です。これはグラフに埋め込むものではなく、状況に応じた判断が必要です。」
プライバシー規制と「忘れられる権利」の実現
GDPR などのプライバシー規制における「忘れられる権利(Right to be Forgotten)」への対応も、Graffiti の時系列グラフ構造が威力を発揮する領域です。
文書保存ポリシーや削除要請により、特定のソースデータを削除する必要が生じた際、依存関係にある事実をどう扱うかが課題となります。単純にデータだけを消すと、そのデータに依存して生成された他の事実も誤って失われるリスクがあります。
Graffiti のモデルでは、以下のようなロジックが自動的に機能します。
- 部分削除の対応: 患者が入力したチャット記録(3 つのソースのうち 1 つ)のみを削除する場合、そのソースに依存している「アレルギー情報」は、他の 2 つのソース(EHR や検査報告書)によって支えられているため、保持されます。
- 完全削除の自動判定: 「連絡先設定」などの情報が、削除対象のチャット記録のみから派生していた場合、その事実を支持するエピソードがなくなるため、自動的に削除されます。
「ルールはシンプルです。事実を支持するエピソード(親)が一つも残っていなければ、その事実は削除されます。リンクが存在するため、この適用は容易に行えます。」
結論:AI エージェントの信頼性を支える基盤インフラ
Graffiti は、LLM の生成プロセスにおける「情報の損失」をデータ構造レベルで解決するアプローチです。ログとして後付けするのではなく、グラフ構造そのものに系譜(lineage)を組み込むことで、以下のメリットを実現しています。
- コンプライアンスの自動化: 法的要件を満たすための監査証跡が自動的に構築されます。
- 事実の真偽検証: ソースを遡ることで、情報の信頼性を即座に評価できます。
- デバッグの容易さ: エラー発生時に「なぜその事実が導き出されたか」を明確に追跡可能です。
- プライバシー対応: 削除要請に対して、依存関係を保ちつつ必要なデータのみを安全に削除できます。
「生成 AI の普及において、ハルシネーションや根拠不明確さという弱点を克服し、エンタープライズレベルでの信頼性を担保するには、この種のインフラが不可欠です。」
Graffiti はオープンソースとして GitHub で公開されており、Zep(エンタープライズ用エージェントメモリ基盤)の背後でも活用されています。AI エージェントの実装において「事実の出所」を問うことができない現状を変えるためにも、時系列グラフによるプロベナンス管理はこれからの必須技術と言えるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。