動画記事 · AI Engineer
A/B テストなしで AI を百万人の患者へ—Ufonia の Jared Joselowitz
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
A/B テストやロールバックが不可能な医療現場において、シミュレーションと自動評価による厳格な安全検証フレームワークで AI を展開する手法を解説。
A/B テストなしで AI を百万人の患者へ:Ufonia が挑む「シミュレーションによる安全証明」の革命
医療現場において、AI 製品をリリースする際、従来の「試して直す(試作と改善)」アプローチは倫理的・法的に適用できません。Ufonia の研究エンジニア、Jared Joselowitz 氏は、患者を傷つける可能性のある A/B テストや即時ロールバックが不可能な環境で、いかに AI の安全性を保証するかという課題に対し、「Matrix」と呼ばれるシミュレーションフレームワークと専門医並みの精度を持つ評価モデル「BevJudge」を用いた革新的な解決策を提示しました。この手法は、実患者へのリスクをゼロにしながら数千の潜在的な危害を検出し、規制当局へ提出可能な安全ケースを構築する新たな標準となり得ます。
医療 AI に通用しない「反応的な開発」の限界
Ufonia が提供する Dora は、術後のフォローアップや術前チェックなど、医師が手作業で行う時間のかかる臨床対話を代行する音声 AI エージェントです。すでに英国の 20 の病院で約 20 万回の通話実績があり、今後 2 年間で 100 万人規模への拡大を計画しています。
しかし、この製品が医療機器として規制される以上、開発プロセスには極めて厳しい制約がかかります。一般的なソフトウェア開発では、「小規模リリース→ダッシュボード監視→問題発生時のロールバック」という反応的なサイクルでリスクを管理します。これは「数%のユーザーに不具合が出ても、すぐに修正すれば誰も傷つかない」という前提が成り立つ場合にのみ有効です。
「患者を相手にする場合、この前提は崩壊します。5% の不具合が数百人、あるいは数千人の患者に即座に影響を与え、ロールバックしても『すでに発生した通話』を取り消すことはできません。」
Dora が誤った医療アドバイスを行ったり、深刻な症状を見逃したりした場合、その結果は取り返しがつかないものです。ダッシュボードが赤く点灯する頃には、患者は既に害を受けています。このため、Ufonia は「実患者に触れる前に、いかにして問題を発見し、解決するか」という発想の転換を迫られました。
「Matrix」フレームワーク:仮想患者による大規模事前検証
自走車業界が乗客を載せる前に数百万マイルのシミュレーションを行うように、Ufonia も「シミュレーションこそが唯一の倫理的な選択肢」と考えました。彼らが構築したのが、「Matrix」と呼ばれるシミュレーションフレームワークです。
このシステムでは、LLM(大規模言語モデル)を患者役として機能させる「PatBot」を活用します。 hired actor(雇った俳優)を使うとスケーラビリティが保てないため、AI による仮想患者を採用しています。
- シナリオの定義: 実際の臨床ワークフローに基づいた具体的なシナリオ(例:白内障手術後の視力低下を訴える、医師が AI か人間かを問うなど)を設定します。
- 対話の実行: PatBot が Dora と数千回、多様な条件下で対話を行います。これにより、現実の患者が直面しうるあらゆる臨床シナリオを網羅的にテスト可能です。
重要なのは、このシミュレーションが単なるスクリプトの読み上げではない点です。Ufonia は、PatBot のリアリティを検証するために「PPI(Patient and Public Involvement)スタディ」を実施しました。実際の患者に、医師との対話と PatBot と Dora の対話を提示し、「どちらが人間か?」を当てる実験を行いました。
「結果は驚くべきものでした。4 組の会話のうち 3 組で、参加者の過半数が『シミュレーションされた患者』の方がよりリアルだと判断しました。」
これは、PatBot が単なる機械的な応答ではなく、多様な話し方(口癖や簡潔さなど)を持つ「人間らしさ」を備えていることを証明しています。これにより、数千回の対話シミュレーションが、実患者へのリスクを最小限に抑えつつ、高い信頼性を持って行えるようになりました。
専門医並みの精度:自動評価モデル「BevJudge」の役割
数千回生成された対話ログを人間が一つずつ読み解くことは不可能です。そこで Ufonia が開発したのが、「BevJudge」と呼ばれる自動評価 AI です。
BevJudge は、シミュレーションされた対話ログと、臨床医が定義した「危害のシナリオ(ハザード)」を照合し、自動的に「合格・不合格」を判定します。例えば、「Dora が深刻な症状を見逃していないか」「患者の苦痛に適切に対応しているか」などを評価します。
この BevJudge の信頼性を担保するために、Ufonia は 10 の臨床分野から専門医 10 名を集め、240 の事例について「危害があるかどうか」をラベリングする実験を行いました。その結果、BevJudge(当初は Gemini 2.5 Pro を使用)の F1 スコアは0.96に達し、専門家の判断と同等か、それ以上の精度を示しました。
特に重要なのは「感度(Sensitivity)」です。医療 AI においては、「危害を見逃すこと」を許容できません。BevJudge は、実際に危害がないケースでも「潜在的なリスクがある」と判定する傾向(オーバーコール)が強いため、安全を最優先に担保しています。
「医療現場では、危害を見逃すよりも、一時的に過剰警報を出す方が安全です。BevJudge はこの感度重視の基準で動作し、専門医並みの精度で安全性を検証します。」
段階的展開と「証拠」による規制対応
シミュレーションと自動評価により問題を発見しても、それだけで製品が良くなるわけではありません。Ufonia のアプローチは、発見した問題に基づいてプロンプトエンジニアリングやモデルの改善を繰り返す「検証して証明する」サイクルにあります。
このプロセスは段階的に進められます:
- シミュレーション: Matrix で数千回の対話を行い、BevJudge が危害を検出。
- ユーザーテスト: シミュレーションで安全が確認された後、限定的なユーザーテストへ移行。
- 臨床評価: さらに厳格な臨床評価を経て、最終的な展開へ。
各ステップで得られたデータは「証拠」として蓄積され、規制当局への提出資料(安全ケース)として機能します。これにより、「モデルカードに書かれたベンチマークスコア」や「事後レビュー」に頼る従来の開発手法とは異なり、実患者を傷つける前に安全性を数学的・論理的に証明することが可能になります。
まとめ:高信頼性業界における AI 開発の転換点
Ufonia の事例は、医療というリスク許容度が極めて低い分野において、「試して直す」から「検証して証明する」へのパラダイムシフトを促すものです。A/B テストやロールバックが不可能な環境でも、高度なシミュレーションと自動評価モデルを活用することで、AI を安全に社会実装できる道筋を示しました。このフレームワークは、医療に限らず、他の高信頼性が求められる業界における AI 開発の標準的なアプローチとして、広く応用される可能性があります。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。