Amazon Bedrock を活用した Flo Health の医療コンテンツレビューの拡張(第 2 部)
本文の状態
日本語全文を表示中
詳細モードで約18分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
AWS Machine Learning Blog
Flo Health は Amazon Bedrock を活用し、医療コンテンツのレビュー時間を 60% 短縮してスループットを 3 倍にするシステムを実装した。
AI深層分析を開く2026年7月31日 00:56
AI深層分析
キーポイント
生産環境への移行と成果
Flo Health のエンジニアリングチームは、AWS 生成 AI イノベーションセンターでの概念実証(PoC)を基に、Amazon Bedrock を活用した本番グレードの医療コンテンツレビューおよび生成システムを構築し、レビュー時間を 60% 削減してスループットを 3 倍にした。
専門的な AI ジャッジの実装
システムは異なるレビュー次元に対応する専用の AI ジャッジを実装しており、医療の正確性に関する厳格なチェックリストやコンプライアンス要件を効率的に評価している。
RAG を活用した生成システムの構築
Flo Health は検索拡張生成(RAG)技術を用いて AI コンテンツ生成システムを構築し、信頼できる情報源に基づいた医療コンテンツの作成を支援している。
専門家の不足という課題への対応
医療専門家とコンテンツ expertise を兼ね備えた人材が希少で、チーム拡張のコストが高額であるという課題に対し、AI による自動化でスケーラビリティを確保した。
従来の拡張手法の限界と代替案
専門医の不足やコスト増により、レビュー担当者の数を単純に増やす従来型の拡張は持続不可能である。既存の医療専門家への依存を減らし、その時間を効率化して専門性をスケーラブルにするアプローチが必要となる。
重要な引用
This system reduced review time by 60 percent and tripled content throughput without expanding the medical team.
Our medical experts spend an average of seven working days per article, meticulously verifying facts, checking references against trusted sources, and facilitating compliance with our 10-point medical accuracy checklist.
The traditional scaling approach of hiring more reviewers is not sustainable or economically viable.
These systems can generate information that has no grounding in underlying references or facts, commonly referred to as hallucinations.
編集コメントを表示
編集コメント
医療分野における生成 AI の実用化事例として、品質管理と効率化の両立を達成した具体的な手法が示されており、業界全体への参考価値が高い。特に専門家の不足という構造的課題に対し、技術でどう対応するかという視点は多くの組織にとって示唆に富んでいる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
本記事は、Flo Health の Konstantin Lekh、Sasha Zinchuk、Eugene Sergueev 氏と、AWS の Liza (Elizaveta) Zinovyeva 氏が執筆しました。
今回は、Flo Health のエンジニアリングチームが、AWS ジェネレーティブ AI イノベーションセンターで検証された概念実証(PoC)を、Amazon Bedrock を基盤とした本番環境向けの AI 活用医療コンテンツ審査・生成システムへと昇華させたプロセスを紹介します。このシステムの導入により、審査にかかる時間は 60% 短縮され、医療チームの増員なしにコンテンツ処理能力は 3 倍に拡大しました。
ここでは主に以下の 4 つのポイントを解説します。(1) Flo Health のコンテンツパイプラインに合わせて PoC アーキテクチャを適応させた点、(2) 審査の各次元に対応する専門的な AI ジャッジの実装、(3) 検索拡張生成(RAG)を活用した AI コンテンツ生成システムの構築、そして (4) プロンプトエンジニアリングと本番環境への展開から得られた教訓です。なお、このシリーズの第 1 回では初期の概念実証について取り上げています。
※本記事は Flo Health エンジニアリングチームの視点に基づいています。
Flo Health では、健康に関する旅を歩む数百万人のユーザーをサポートするため、アプリ内の記事やストーリー、オンボーディングフロー、マーケティング資料など、多様なコンテンツを作成しています。テキストであれ画像であれ、すべてのコンテンツはガイドラインで定めた厳格な医療精度基準を満たす必要があります。
AI ツールを活用して編集者やデザイナーのコンテンツ作成を加速させることは成功しましたが、医療レビューが依然として最大のボトルネックとなっていました。

コンテンツ作成における課題
医療専門家は、記事 1 本あたり平均して 7 営業日を費やしています。事実の精査、信頼できる情報源との照合、そして 10 項目からなる医療精度チェックリストへの準拠確認を念入りに行っているのです。
この徹底したプロセスは、信頼と安全性を維持するために不可欠ですが、コンテンツ制作の規模拡大やユーザーニーズへの迅速な対応という点では、足かせとなっていました。

課題は時間的な制約だけではありません。医療レビューチームの規模拡大には、独自の難しさがあります。コンテンツに精通した有資格な医療専門家は貴重であり、採用も困難で時間を要し、こうした専門チームを拡張するコストは莫大です。より多くのレビュアーを採用するという従来の拡大手法は、持続可能でも経済的に実現可能ではありません。 そこで必要だったのは、既存の医療専門家たちの影響力を高める方法でした。つまり、彼らの時間をより効率的に使い、専門知識をスケーラブルなものにするのです。
汎用的な AI ツールは驚くべき能力を示していますが、医療コンテンツのレビューにおいては重大なリスクを伴います。これらのシステムは、基礎となる参照や事実に基づかない情報を生成する可能性があります。これは一般的に「ハルシネーション(幻覚)」と呼ばれる現象です。Flo では数百万人のユーザーが、自身の身体と健康を理解するために当社の教育コンテンツに依存しています。そのため、正確性と信頼性が何よりも重要です。私たちが求めたのは、信頼できる医療情報源からの情報のみを提供し、提示するすべての情報に対して明確な出典を示すように設計されたソリューションでした。
AWS による概念実証(PoC)がスタート地点となる
PoC の成功は、医療コンテンツレビューへの取り組み方を変革する素晴らしい機会をもたらしました。私たちは、医療専門家の能力を拡大しつつ、継続的な検証を通じて信頼を築くという漸進的な導入戦略を選びました。
本番環境での実装では、3 層の検証アプローチを採用しています。まず、システムは「社内医療ガイドライン」に基づいてコンテンツをチェックし、既設ルールに照らして潜在的な問題点を指摘し、修正を提案します。次に、「信頼できる外部医療情報源」、すなわちエビデンスに基づく臨床意思決定ツールから査読付き学術誌、規制当局に至るまでとの整合性を検証します。
最後に、AI が付与した注釈付きのコンテンツを医療専門家がレビューする際にも、適用されたルールを強調表示し、関連情報源への直接リンクを提供する簡素なインターフェースを用意しています。これにより、事実確認が大幅に容易になります。
主な成功指標は、2 つの領域に焦点を当てています。すなわち、レビュー時間の短縮と、専門家が求める修正回数の最小化です。
AI レビューシステム
ここでは、PoC(概念実証)で検証したコンポーネントをどのように統合・変換・拡張し、医療レビューの規模拡大に対応できる本番レベルのシステムへと昇華させたかを探ります。
「AI Review ツール」は、コンテンツ作成者と医療レビュー担当者の間のフィードバックループを短縮します。AI Review を活用することで、人間によるレビュー段階に到達するコンテンツの品質が向上し、反復作業の回数を減らすことが可能になります。
まず、PoC 期間中に特定された MACROS アーキテクチャを Flo のコンテンツモデルに合わせてカスタマイズすることから始めました。
Flo Health では、それぞれ固有のプロンプトと学習・テスト用の例文セットを持つ「AI 審査員(AI Judges)」のグループを構築しました。各審査員は、医療的正確性、法的コンプライアンス、ブランドスタイルなど、特定のレビュー項目に特化して機能します。

各審査員に対して複数のモデルを試し、品質基準やリスクレベル、応答速度(レイテンシ)、運用コストの要件に基づいて最適なモデルを選定します。医療安全や高リスクチェックが必要なケースでは、精度と信頼性が最優先されます。一方、単純な低リスクチェックであれば、性能基準を満たす限り軽量なモデルを採用するのが適切です。このアプローチにより、各審査員を個別に改善できます。具体的には、例文の追加やプロンプトのカスタマイズ、精度向上を図りつつ、他の審査員の動作は変更しないため、既存機能の劣化(回帰)を防ぐことができます。
Flo Health のコンテンツパイプラインでは、Amazon が提唱する MACROS パターンを採用し、Flo 独自の Contentful CMS 上で実運用に適応させました。テキストを管理可能なセクションに分割するという MACROS の戦略は、既存のアーキテクチャと非常に相性が良いです。なぜなら、フロー(アンケートやチャット)のグラフデータはすでにチャンク化された形式で保存されており、各ステップが独立したコンテンツエントリとして扱われるためです。

評価前に、各ステップをボタンテキスト、タイトル、説明文などより小さな単位に分割します。
各コンテンツは単一の巨大なプロンプトではなく、AI 審査員による一連の評価を経ます。つまり、Flo は医療的正確性、法的コンプライアンス、ブランドスタイルなど、レビューの各次元ごとに専用の大規模言語モデル(LLM)プロンプトを実行します。これにより、個々のコンテンツに対して詳細なフィードバックを得ることができます。
審査員の回答を受け取った後は、MACROS フローに従って生成 AI による修正の入力として活用します。Amazon Bedrock を使用して、指摘された課題を解決するより良いテキスト案を生成します。これらの提案は Contentful アプリの UI に直接表示され、変更箇所がハイライトされるため、コンテンツ編集者や医療専門家は、慣れ親しんだワークフロー内で推奨版を選択・編集したり、元のバージョンを維持したりしてレビューできます。

人間が最終決定権を握り、AI は専門家アシスタントとして機能します。各行の判断が完了すると、アプリは Contentful 内の該当エントリに最終コンテンツを更新します。
パイプライン
以下の図は、すべての AI レビュー段階を一つのフローに接続した様子を示しています。各ステップの結果は準備ができ次第読み込まれるため、ユーザーが待ち時間を感じることはありません。

AI によるコンテンツ生成システム
AI コンテンツレビューのワークフローにおいて Amazon Bedrock を基盤として導入し、その成功を受け、同じサービスを活用してコンテンツ作成の加速を図りました。
日常的な業務を自動化し、認知負荷を軽減するための AI 生成ツールが必要でした。これにより、グラフを一から手作業で作成する必要なく、リクエストを迅速にドラフト作成できるようになりました。
思考連鎖プロンプトの利用
生成パイプラインでは、多段階の「思考連鎖(Chain-of-Thought)」アプローチを採用しています。

重要な最適化の一つは、タスクに応じて異なる Amazon Bedrock 上の Anthropic製 Claude モデルを使い分けることです。例えば、軽量な分類やルーチン分析(ユーザーが生成を希望するステップ数の特定など)には、高速かつ低コストの「Claude Haiku」モデルを採用しています。
一方、高品質なコンテンツ生成や複雑な推論が必要なケース(微妙なニュアンスを持つ医療解説の作成や、特定の共感的なトーンで段落を書き直す作業など)では、より高性能な「Claude Sonnet」モデルを呼び出します。
Retrieval Augmented Generation(RAG)
女性の健康という専門領域において生成 AI ツールを構築するには、モデル内部に収まりきらない膨大な文脈情報を取り込む必要があります。そこで私たちは RAG(検索拡張生成)を採用しました。
具体的には、LLM による推論実行時に、必要な情報だけを知識ベースから抽出し、モデルのコンテキストとして読み込ませます。例えばコンテンツ作成時には、そのトピックに関連するガイドラインやルール、医学的知見、既存のテンプレート、あるいは視覚素材のリファレンスなどをシステムが自動的に検索・取得します。
これらの知識ベース資料は、製品チーム、編集チーム、そして医療チームが連携した反復的なプロセスを通じて開発・維持されています。特に安全性に関する範囲については、医療チームが責任を持って管理しています。
さらに、エビデンスに基づく臨床意思決定ツールや査読付き学術誌、規制当局の発表など、信頼性の高い第三者の医学情報源も統合しました。生成された各コンテンツには、参照に使用したソース一覧を自動的に記録・保存するため、医療レビュー担当者は手動で検索することなく、直接出典を確認して検証することが可能です。
ユーザーエクスペリエンス
AI 生成の各段階をユーザーに明確に示し、説明することで、不整合点を早期に発見できるようにしました。また、各工程が完了するたびに中間結果を順次表示して待機時間を削減し、パイプライン全体が終了する前にレビューを開始できる仕組みも整えています。さらに、デザイン要素やコンテンツ同士(画面間)の接続関係を可視化することで、ユーザーがスマホで何度もエクスポートしてテストする必要をなくしました。
以下のアニメーションは、AI 生成時のユーザーエクスペリエンスを示しています。

アーキテクチャ
以下の図は、当社の AI コンテンツ生成アーキテクチャを示しています。

コンテンツ作成者は、馴染み深い Contentful App の環境から生成リクエストを開始します。システムはその後、手作業を最小限に抑えつつ、医学的根拠に基づきガイドラインに沿ったコンテンツを生成するための一連のステップをオーケストレーション(調整・実行)します。
リクエストは Amazon API Gateway を経由してルーティングされ、UI とリアルタイムで通信を行います。これにより、作成者は進捗状況を即座に確認できます。
コアとなるパイプラインには、以下の 3 つのステップがあります:
まず、システムは Amazon Bedrock を介したセマンティック検索(意味検索)により、Amazon S3 に保存されたナレッジベースから関連する医療ガイドライン、ルール、および文脈情報を取得します。これにより、生成されるコンテンツが医学的知識に基づいたものになります。
次に、Anthropic の Claude ファウンデーションモデルを Amazon Bedrock を通じて活用し、S3 内のテンプレートやアセットリポジトリからデータを参照しながらコンテンツを構造化します。これによって、ステップごとのコンテンツフローを生成しつつ、フォーマットの一貫性を維持しています。このワークフローの調整は AWS Lambda 関数が担っています。
最後に、Amazon Bedrock を用いて、生成されたコンテンツが医学的に正確か、ブランドガイドラインに準拠しているかを検証する工程があります。問題が発見された場合はフィードバックループが自動的に作動し再処理が行われるため、クリエイターが受け取るのは常に検証済みの出力のみとなります。
ナレッジベース、医療参照資料、コンテンツテンプレート、そして視覚アセットはすべて Amazon S3 に保存されており、パイプライン全体の状態やメタデータの管理には Amazon DynamoDB が利用されています。AWS Step Functions がエンドツーエンドのワークフローを調整しており、モジュール設計のため、新たなコンテンツタイプや検証要件が発生しても柔軟に拡張可能です。
影響、洞察、そして教訓
これらの生成 AI ツールの開発を通じて、チームはプロンプトエンジニアリングの実践的な応用について貴重な知見を得ました。
YAML と JSON の比較
出力フォーマットとしては、YAML を JSON よりもはるかに堅牢であると実感しました。インデントに基づく構造が柔軟で、無効な出力が発生しにくく、デバッグも容易です。当初の実装以降、Amazon Bedrock が構造化出力機能を導入しました。これは API レベルでスキーマに合致した JSON 応答を強制するもので、同様のフォーマット整合性の課題を抱えるチームにとって有力な代替手段となり得ます。
ルールよりも具体例を重視
プロジェクトが拡大するにつれ、ルールセットは膨大になり、時には互いに矛盾してモデルの優先順位付けを難しくしていました。回避すべき事項を列挙するのではなく、私たちが何を意図しているのかを示す具体的な事例(Few-shot examples)でルールを補強したところ、エラーが大幅に減少しました。具体例を取り入れることで、出力の遵守性が一貫して向上しました。
AI は人間の専門家への代替ではなく、知能化されたアシスタント
私たちのプロダクション戦略は、人間の専門性を排除するのではなく、3 つの重要なワークフロー段階で補完することに焦点を当てています。
1. 知的な事前スクリーニング
AI が検証が必要な医療主張を特定し、専門家による注力が必要となるセクションを抽出します。さらに、医療ガイドラインに基づいた初期のコンプライアンスチェックも実行します。これにより、専門家の作業開始地点は「白紙の状態」から「明確な注目領域が示された事前注釈付きドキュメント」へと変化しました。
2. リアルタイムのコンテンツ支援
ライターは執筆中に、医学的正確性やスタイル準拠、出典記載要件について即座にフィードバックを受けられます。これにより、医学専門家のレビュー段階に至る前に問題を発見・修正できます。
3. 専門家によるレビュー体験の向上
医学専門家は、AI が注釈を付けたコンテンツを受領します。懸念箇所がハイライトされ、修正案や事前に調査済みの関連資料も提示されるため、専門家は AI の洞察の妥当性確認や、人間の判断が必要な複雑な医学的ニュアンスの検証に集中できます。
構造化されたフィードバックループの力
専門家の修正を単発的な編集として扱うのではなく、再利用可能なルールや例として蓄積する仕組みを作りました。これによりレビューサイクルごとにシステムが賢くなり、繰り返されるミスを70%以上削減できました。また、日常的なコンプライアンス関連の修正も80%減らし、コンテンツ1件あたりの平均レビュー時間を60%短縮しています。医療チームの規模拡大なしに、コンテンツ処理能力を3倍に引き上げることができたのです。
一般化よりも特化が勝る
医学ガイドラインや情報源の優先順位、コンテンツ基準に特化して構築し、合成データと実在する匿名事例を組み合わせた事前定義されたテストセットを用いて各「判定モデル(Judge)」を評価した結果、初回提出時の精度に一貫した向上が見られました。これにより、AI の出力に対して完全な再検証を行う必要性も大幅に減っています。
今後の方向性
システムの機能拡張に伴い、私たちは「信頼度スコアリング」の導入を検討しています。これは医療専門家と共同で策定した基準に基づき、コンプライアンス履歴、ガイドラインの優先度、内容の複雑さを総合的に評価するものです。一定の閾値を超えたコンテンツは迅速なレビュー対象とし、リスクが高いと判断されたものはさらに厳重な審査を行います。
また、このアプローチを視覚コンテンツへも拡張すべく検討を進めています。インフォグラフィックやイラストレーションなど、あらゆる視覚素材が同じく厳しい基準を満たしているかを確認する仕組みです。
同様の導入を検討する組織に向けて、以下のポイントを推奨します。
- 明確で文書化された基準をまず策定すること
- 初日から継続的な学習が可能となるよう設計すること
- 効率性と品質の両方を測定指標とすること
- ユーザー体験への投資を惜しまないこと
- 実績による信頼構築を経て、段階的に展開計画を立てること
Flo Health ではこのアプローチにより、コンテンツの質を維持しつつ、処理能力を大幅に拡大することができました。
*以上が Flo Health エンジニアリングチームからの視点です。*
まとめ
本稿では、Flo Health のエンジニアリングチームが、MACROS の概念実証(PoC)を実運用可能な医療コンテンツのレビューおよび生成システムへと転換させた事例を紹介しました。このシステムは Amazon Bedrock を活用しています。
成功の鍵は完全な自動化ではなく、専門的な AI ジャッジと構造化されたフィードバックループ、そして段階的なモデル選定戦略を組み合わせることにありました。これにより、厳格な医療精度基準を維持しつつ、コンテンツ処理量を大幅に増やすことが可能になりました。
同様のコンテンツレビューや生成システムを構築したい場合は、まずドメイン固有の品質基準を定義し、その後 Amazon Bedrock を活用して、専門的な AI ジャッジのプロトタイプを作成することから始めてください。
AI算出
導入事例ainew評価標準
記事は特定の企業(Flo Health)による AWS の生成 AI サービス(Amazon Bedrock)の導入事例と実装プロセスに焦点を当てており、AI/ML との関連性は高いが、単なる一般論ではなく具体的なビジネスケーススタディである。新規性については、既存の PoC から本番環境への移行という具体的な実装知見が含まれるため中程度の評価とした。
6つの評価軸を見る
- AI関連度
- 75
- 情報源の信頼性
- 100
- 新規性
- 50
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み