Gemini Flash の価格上昇、AI 法施行延期、エージェントがオンライントラフィックを牽引
本文の状態
日本語全文を表示中
詳細モードで約30分の本文を読めます。
The Batch は、シリコンバレーで注目される AI フォワードデプロイメントエンジニア(FDE)の役割について報じ、顧客組織に常駐してワークフローをカスタマイズする専門職の台頭を紹介した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
親愛なる皆様、
シリコンバレーにおける新しい注目度の高い職種の1つに、AI フォワードデプロイメントエンジニア(FDE)があります。これは顧客組織内に配置され、顧客の特定のニーズに適したソリューションのカスタマイズを支援するエンジニアで、例えばエージェントワークフローの構築や調整などを行います。OpenAI と Anthropic が FDE を顧客組織内に配置するための新しいチームを構築し始めたことから、FDE のキャリアパスについて改めて疑問を抱く人々の声を聞きました。
AI ワークロードにおける FDE の台頭は、AI が新たな雇用を生み出している1つの側面であり(これが「今後の労働市場の崩壊」という物語が誤りである理由の1つでもあります)、しかし私は、以下に説明する通り、AI エンジニアの職種の数ははるかに増えると考えています。
FDE(Field Deployment Engineer)の役割は約20年前にPalantirによって創始されました。同社はエンジニアを政府機関へ派遣し、安全なエアギャップネットワーク上で作業を行いました。優れた技術スキルに加えて、FDEにはコミュニケーション能力、場合によってはビジネススキルも必要です。例えば、顧客と対話してニーズを理解したり、プロジェクトの優先順位を決める戦略を立てたり、複雑な技術を説明したり、顧客が非現実的な要望を求めてきた際には敬意を持って反対意見を述べたりする必要があります。彼らが再び注目されているのは、市販のLLM(大規模言語モデル)を取り込んで特定のビジネスニーズに合わせたカスタムエージェントワークフローを構築する際に必要な作業量が増えているからです。
しかし、私はAIエンジニアの求人数はさらに大幅に増えるだろうと考えています。ある企業では数人のFDEを組織内に配置することを受け入れるかもしれませんが、ほとんどの企業は自社の従業員がプロジェクトに取り組むことを望むでしょう。私の所属する組織でもFDEを採用していますが、採用するのははるかに多くのAIエンジニアです!また、一般的な顧客の懸念として、ベンダーに偏らない中立なFDEを見つけるのが難しいという点があります。彼らは結局のところ、特定のベンダーの製品を企業に深く統合するために存在しているからです。今後1年間でどのAIサービスが最良になるか予測が難しいこの時期において、オプション性(将来最も適合するベンダーを選べる能力)は非常に価値があります。一方、FDEに企業のプロセスを密接に結びつけることは、オプション性を大幅に低下させます。
image現在、AI ソフトウェアコンポーネント(LLM プロンプト、エージェントフレームワーク、評価指標など)を用いてソフトウェアアプリケーションを構築し、AI コーディングエージェント(Claude Code、Codex、Antigravity CLI、OpenCode など)を効果的に活用できる AI エンジニアに対する需要が急増していると感じています。AI エンジニアという役割が成熟するにつれて、数十年前に一般的なソフトウェアエンジニアの役割がフロントエンド、バックエンド、モバイル、データエンジニアリング、DevOps などに細分化されたように、この役割もより専門的な役割に分裂していくと予想されます。
将来どのような専門的な AI エンジニアリングの役割が登場するのでしょうか。私はまだ知りませんが、おそらく AI FDE(フルスタック開発者)、LLMOps エンジニア、評価エンジニア、AI データエンジニア、Harness エンジニアなど、現在名前が付けられていない他の役割も現れるかもしれません。しかし現時点では、多くの AI エンジニアが一般主義者として大きな価値を生み出している様子が見て取れます。熟練した AI エンジニアに対する需要は非常に高いです!この分野が今後 10 年かけてさらに成熟していく中で、AI エンジニアリングの新たな専門分野が生み出すさらなる雇用機会に期待しています。
作り続けよう!
Andrew
A MESSAGE FROM DEEPLEARNING.AI
image Ambient は、Kian Katanforoosh 氏と Workera によって開発されたもので、業務の流れの中であなたのスキルを測定します。あなたはすでに睡眠、歩数、ストレスなど重要なものを測定しています。なぜスキルの測定をしないのでしょうか?ウェイトリストに参加する
News

Gemini 3.5 Flash は知能と速度を両立
Google の高速モデルは、トークンあたりの価格が大幅に上昇する傾向の一部として、実質的な性能向上をもたらす一方で、従来モデルの約 3 倍という高価格となっています。
新情報: Google は Gemini 3.5 Flash をリリースしました。これはミドルティアのマルチモーダルモデル(複数の入力・出力形式を扱うモデル)のアップデート版です。新バージョンは、エージェント機能(自律的なタスク実行能力)、視覚的理解力、速度において改善が見られますが、その価格は先行する Gemini 3 Flash の約 3 倍となっています。
- 入力/出力:テキスト、画像、音声、動画(最大 100 万トークン)、テキスト出力(最大 64,000 トークン、秒間 204 トークン)
- アーキテクチャ:エキスパート混合型トランスフォーマー
- 機能:推論レベルの調整可能(最小、低、中、高)、思考の保持(推論トークンをコンテキスト内に保持し、複数回の対話にわたって推論を維持する機能。Kimi K2.6 の「思考保持」機能と同様)、ツール使用(コンピュータ操作は未対応)
- パフォーマンス:Artificial Analysis の APEX-Agents-AA ベンチマークおよび MMMU-Pro 多モーダルベンチマーク Flash で最高位を記録する一方、全体的な知能、知識、コーディング能力では主要モデルに劣る
- 利用可能状況/価格:Gemini アプリ、Google AI Studio、Google Antigravity(5 時間ごとにリフレッシュされる計算量制限内、かつ週次上限あり)、Google Search の AI モードを通じて無料。Gemini Enterprise、Gemini Enterprise Agent Platform、API は入力トークン 100 万あたり$1.50、キャッシュ済みトークン 100 万あたり$0.15、出力トークン 100 万あたり$9.00
- 非公開:パラメータ数、トレーニングデータおよび手法、アーキテクチャの詳細
仕組み: Google は Gemini 3.5 Flash の構築方法についてほとんど詳細を明らかにしていない。
- Gemini 3.5 Flash は、そのモデルカードによると、Gemini 3 Flash に基づいており、さらに Gemini 3 Flash は Gemini 3 Pro に基づいています。
- これは混合専門家型トランスフォーマーであり、ウェブから収集されたテキスト、コード、画像、音声、動画に加え、ライセンス付き資料、Google ユーザーデータ、合成データを多角的に事前学習したものです。
- 多段階推論、問題解決、定理証明をカバーするデータセットを用いた強化学習によって微調整が施されました。
性能: Gemini 3.5 Flash は、マルチモーダルモデルの最上位ランクに次ぐパフォーマンスを発揮します。独立したテストによると、エージェント機能と速度において前世代から大幅な向上が見られ、いくつかの最先端指標でもその成果が確認されています。Artificial Analysis Intelligence Index では、推論レベル(未指定)に設定された Qwen 3.7 Max に次いで第5位または第7位(モデルごとの推論レベルによる)となりましたが — 同じ週にデビューした Qwen 3.7 Max を除き — 知能指数で上位のすべてのモデルは、大幅に低速です。
- Artificial Analysis によると、複数の学問分野にわたる視覚的推論を測定する MMMU-Pro において、高推論モードに設定された Gemini 3.5 Flash は 84 パーセントの精度を記録し、過去最高を更新しました。2 位は Gemini 3.1 Pro Preview(82 パーセント)です。
- 投資銀行、経営コンサルティング、企業法務から抽出された長期実行型エージェントタスクを検証する APEX-Agents-AA では、Gemini 3.5 Flash が初回試行でトップの座を奪い(精度 47.1 パーセント)、2 位の GPT-5.5(精度 37.7 パーセント)に約 10 ポイント差をつけました。一方、現実世界のエージェントタスクを対象とする GDPval-AA では、高推論モードに設定された Gemini 3.5 Flash(Elo 1,656)は、推論レベルが未指定の Gemini 3.1 Pro Preview(Elo 1,314)を上回りましたが、xhigh モードに設定された GPT-5.5(Elo 1,769)には及びませんでした。
- 抽象的な視覚的推論を検証する ARC-AGI-2 では、高推論モードに設定された Gemini 3.5 Flash が ARC プライズリーダーボードで 72.1 パーセントのスコアを記録しましたが、これは Gemini 3.1 Pro Preview(77.1 パーセント)および xhigh 推論モードに設定された GPT-5.5(85.0 パーセント)には及びませんでした。
- 正解には加点し、誤った推測によるハルシネーションには減点を行う知識ベンチマーク AA-Omniscience では、推論モードに設定された Gemini 3.5 Flash(23 ポイント)は、推論モードの Gemini 3.1 Pro Preview(33 ポイント)および最大推論モードの Claude Opus 4.7(26 ポイント)に後れをとりました。
- 2026 年 5 月 24 日時点の Arena.ai リーダーボードでは、モデルを盲検の直接対決形式で人間が比較して順位付けする Text Arena で Gemini 3.5 Flash は 9 位(Elo 1,480)、WebDev コーディングアリーナでは 10 位(Elo 1,506)となりました。Anthropic の Claude Opus 4.6 および 4.7 モデルは、両アリーナの上位 3 位を独占しています。Text Arena のカテゴリ別内訳では、Gemini 3.5 Flash は数学分野で 1 位(Elo 1,521)となりましたが、コーディング分野では 31 位(Elo 1,507)でした。
ニュースの背景: Google は、開発者向けの年次カンファレンスである Google I/O 2026 で Gemini 3.5 Flash をデビューさせました。同イベントから発表されたその他の AI 関連の発表は以下の通りです:
- Google は AI コーディングツール「Antigravity」を大規模改修し、エージェントの管理機能を強調するとともに、Microsoft の VSCode などの人気 IDE に似ているという点を意図的に弱めました。Antigravity のコマンドライン版は、オープンソースの Gemini CLI を置き換えるものです。
- 同社はマルチモーダルモデル群「Omni」を発表しました。その第一弾として軽量モデル「Omni Flash」が導入され、テキスト、画像、音声、動画、あるいはこれらの組み合わせを入力として動画を生成できます。Omni Flash は Gemini アプリおよび Google Flow を通じて Google AI Plus、Pro、Ultra のサブスクリプションユーザーに利用可能ですが、API での提供はまだ開始されていません。
- Gemini 3.5 Flash は、Google Search がより対話的でチャットボットのような検索クエリを許可できるようにし、エージェントがユーザーに代わってオンライン調査を行える機能を強化します。また、従来の検索結果トップ10のリンクを置き換え、引用元を明記した AI 生成による要約でユーザーの質問に答える形式へと変更されます。
なぜ重要なのか: Gemini 3.5 Flash は「Flash」という言葉の意味を変えました。Gemini Ultra、Pro、Nano の後に導入された、より小さく高速なモデルティアとして登場しましたが、現時点では Flash は Google のミドルティアのマルチモーダルモデルであり、Anthropic の Sonnet に近く、Haiku ではありません。このモデルの速度は、複数のターンを要するエージェントや、チャットボット、検索、画像・動画分析といった低遅延アプリケーションを開発する開発者にとって、生成されるトークン数が増えるコストに見合う価値があるかもしれません。
私たちが考えていること: Google は Gemini 3.5 Flash が競合モデルの半額未満で動作すると述べていましたが、Artificial Analysis によるインテリジェンス・インデックス(Intelligence Index)でのテスト結果では、実際には Gemini 3.1 Pro よりもコストが高いことが判明しました。Flash という名称はもはや、エージェントワークロードを実行する開発者にとって明確なコスト優位性を示すものではなくなりました。Anthropic、OpenAI、Google はいずれも、最新のフラッグシップモデルおよび Flash タイアモデルのトークンあたりの価格を引き上げました。Gemini 3.5 Flash もこの傾向に当てはまります。

ヨーロッパ、一部の AI 規制を一時停止
欧州連合(EU)は、企業が同法が欧州企業の競争力を低下させると主張したため、画期的な AI 法案(AI Act)の一部規定を弱体化させ、他の規定の施行を延期しました。
何が変わったか: 欧州議会と加盟国は、AI 法を改正し、安全性、健康、個人の権利などに重大な脅威をもたらすと欧州連合(EU)が判断するアプリケーションを対象とした規制の施行を延期するなど、その他の変更を加えることで合意しました。改正案は、EU 理事会および議会の正式な採択を待っています。EU はこの改正案を「市民と企業双方にとってより安全でシンプルなルール」と特徴付けています。
仕組み: 改正案は概して、EU AI オフィスの監督・執行責任を簡素化するものです。また、AI 開発者に対する特定の条項の遵守期限を延長し、他の条項も簡略化します。
- 「法執行、重要インフラ、雇用、移民、個人識別」に使用されるなど「ハイリスク」と見なされる AI システムに対する要件は、以前の期限である 2026 年 8 月から 2027 年 12 月へ延期されます。これにより、開発者には新しいモデルをテスト中に広範な世界から隔離するための監督付きサンドボックス環境(sandbox environments)を実装する猶予が 2027 年 8 月まで与えられます。また、機械や玩具など AI を駆使した製品の期限は 2028 年 8 月へ、AI 生成出力の透かし付けおよびその他の透明性要件に関する期限は 2026 年 12 月頃へと延長されます。
- この改正により、AI システムのトレーニングおよび展開における個人データの使用方法が調整されます。既存の EU 法では、一部の個人データカテゴリーは「厳格に必要」とされる場合のみ使用可能です。一方、この改正案では、バイアスの検出と緩和のために個人データを使用することを可能にします。
- また、特定の製品に対する免除規定の策定または明確化も行われます。例えば、AI 法はすでに製品安全法規によって規制されている産業用機械には影響しません。さらに、小規模企業(従業員数が 50 名未満で、年間世界売上高が 1,000 ユーロ以下または総資産が 1,000 ユーロ以下の企業)および「中小キャップ」企業(従業員数が概ね 250〜749 名で、年間世界売上高が 1.5 億ユーロ以下または総資産が 1.29 億ユーロ以下の企業)に対しては、一部のケースにおいてコンプライアンス要件および行政負担が軽減されます。
- この改正案は、ある重要な分野において AI 法を強化します:児童に対する性的に露骨な画像の生成や、実在する人物の同意のないヌード画像の生成を禁止します。
ニュースの背景: 2024 年、EU は AI を規制するための世界で最も厳格な法律 を可決しました。この法律は同年に発効し、一部の規定はその後数年にかけて段階的に施行される予定です。しかし、立法プロセスが始まった直後から、安全性をほとんど向上させずに不合理な負担を課すものとして批判されていました。
- 2023 年、163 社の経営陣が署名した書簡では、この立法は「官僚主義的」であると主張していました。一方、2025 年には 110 社が政策決定者に対し、規制が「不明確で重複しており、ますます複雑化している」として実施スケジュールの延期を要請する書簡を送りました。ドイツの産業・ソフトウェア企業である Siemens や SAP などの企業は、規制が自社の発展を阻害していると主張し、改正をロビー活動しました。
- 改正に影響を与えた初期の報告書が二つあります。2024 年 4 月にイタリアの前首相エンリコ・レッタ氏が発表した報告書では、EU が 27 の国家市場に分断されており、これが欧州企業が米中企業のように規模を拡大するのを妨げていると指摘しました。また、2024 年 9 月の欧州の競争力に関する報告書では、停滞する GDP 成長率を「存続に関わる課題」と位置づけ、イノベーション格差の解消、脱炭素化、依存度の低下に焦点を当てました。
- 2025 年初頭、EU の執行機関である欧州委員会は、規制負担の軽減、ルールの簡素化、経済競争力の強化を目指す意向を発表しました。
- 2026 年 2 月、欧州委員会は AI 責任指令(AI Liability Directive)の提案を撤回しました。これは AI Act とは別に位置づけられていた議論の的となっていた法案で、AI に起因する被害に関する訴訟における EU 全体の基準を導入するものでした。
一般市民の反応: 改正に対する即座の反応は賛否両論でした。AI 業界は追加された柔軟性を歓迎しましたが、消費者団体は安全基準が弱体化する可能性に懸念を示しました。一部のメディア報道では、これらを企業利益を迎合するために法律を骨抜きにするものとして捉えました。欧州消費者機構(European Consumer Organization)は、「この合意はデジタル環境をより危険にし、AI 企業にとって危険な抜け穴を生み出す」と述べています。
なぜ重要なのか: 元の形と修正後の形の両方において、AI 法は金融やインフラ規制から借用された「システムリスク」という概念を緩和することを目指しています。これは業界全体または経済の大きな部分に波及する可能性のある失敗を指します。AI がシステムリスクをもたらすという考えはまだ推測の域を出ませんが、過度な規制はイノベーションを阻害し有益な技術を妨げるという経済的リスクをもたらします。今回の改正案は、開発者への負担を軽減し、企業が要件を理解して遵守するための追加の猶予期間を与え、製造業や半導体といった重要産業における継続的なイノベーションの道を開くことで、リスクとベネフィットのバランスを図るものです。
私たちが考えていること: 元の AI 法の多くの規定は不明確で、過度に広範であったり、不必要な負担となったりしていました。今回の改正案は、有益な要素を維持しつつ、法律の負担を軽減するもののように見えます。これは欧州の競争力にとって良い一歩です。

エージェントが AI 作成のウェブをサーフィン
AI を駆使したインターネット上の活動は昨年、急激に増加したとある研究で示されています。
何が起きたか: セキュリティ企業 Human Security のレポートによると、AI 駆動型トラフィック、つまり AI システムによってまたはその代わりに生成されたインターネット上のやり取りは、2025 年に約 3 倍に増加しました。AI システムの訓練のために大量のデータを収集するクローラーや、価格などのデータポイントを即時利用するためにスクレイピングするボットによる活動量は、1 の位で桁増しとなりました。一方、AI エージェントおよびエージェント型ブラウザによるトラフィックは急増しましたが(それでも全体のごく一部に留まりました)、AI 駆動型トラフィックの 95% 以上が、著者らが小売・EC、ストリーミング・メディア、または旅行・宿泊業と分類した活動に関連するものでした。
仕組み: 2026 年 AI トラフィックおよびサイバー脅威ベンチマークレポートは、Human Security が 2025 年に観測した 1 京(1,000 兆)件を超えるインターネット上のやり取りを分析した結果に基づいています。同社は 200 以上の国と地域で約 1,200 の顧客にサービスを提供しています。
- AI に駆動されたトラフィックはほぼ3倍に増加し、AI に駆動されたものおよび従来のボットトラフィックの両方を含む自動トラフィックは23%以上成長しました。一方、人間のトラフィックは約3%増加しました。
- AI によるトラフィックの増加には、トレーニングデータの収集を行うクローラー(年間AI トラフィックの68%を占め、前年の2倍以上)、即時利用のためのデータ収集を行うスクレイパー(年間の32%で、7倍の増加)、ブラウザスタイルのタスクを実行するエージェント(12月時点で1.7%、前年比で約80倍の成長)が含まれます。
- エージェントによるインタラクションのうち77%は商品ページおよび検索ページで行われ、残りはアカウントページ、認証、取引完了の順に発生しました。
- 自動トラフィックの約69%をOpenAI が占め、これにはChatGPT の利用者やトレーニングデータの収集を行うクローラー(OAI-SearchBot)、最新情報の収集を行うクローラー(GPTBot)が含まれます。Meta は16%、Anthropic は約11%を担当しました。
セキュリティ上の影響: 研究者らは、自動トラフィックの相当部分が悪意あるものであると判断しました。
- 著者らが悪意ある行為と判断したスクレイピング活動、すなわち AI を活用した対話を支援するためではなく、競合他社の情報収集や体系的な価格引き下げを目的としてデータを抽出しようとする活動は、前年と比較して約 47%増加しました。(著者らは、スクレイパーが自身の身元を偽装している場合、既知の攻撃パターンに従っている場合、またはその他の理由で不審な行動を示す場合に、そのトラフィックを悪意あるものとして分類しています。)研究者らが特定した 750,000 の脅威プロファイルのうち、60%以上が悪意あるスクレイピングに関与していました。
- ボットがユーザーアカウントの乗っ取りを試みる攻撃は、1年間で30%以上減少しました。しかし、残存する試みにおいては、ログイン済みのアカウントに対して行われた攻撃が4倍に増加していることが示されました。このような攻撃は、盗まれた認証情報や進行中のセッションを乗っ取ることで既存のアカウントを利用することが多いものの、エージェントによって作成されたアカウントを対象とした攻撃数は前年と比較して89%増加しました。
- 不正な決済カードを介した取引トラフィックの割合は「低く安定」していますが、カード発行機関によってブロックされた取引量は20%増加しました。これは、インターネット上で実行される取引数の増加、エージェントがカード番号を循環させる能力の向上、あるいはその両方を反映している可能性があります。
ただし注意: このレポートは、Human Security のプラットフォーム上の活動のみを分析しており、インターネット全体を対象としたものではありません。さらに、悪意あるトラフィックはその発信元を誤って表示することが多いため、研究者による特定のデータポイントの評価が誤っている可能性もあります。
なぜ重要なのか: 自律システムはインターネットに増え続ける追加トラフィックを洪水のように押し寄せており、この傾向は今後 foreseeable な未来も続く可能性が高い。インフラはこの点を踏まえて構築またはアップグレードされる必要がある。自動化されたアクティビティの増加は、サイバーセキュリティにおいても課題をもたらす。なぜなら、正当な AI エージェントが以前は悪意のあるボットを示すシグナルとされていた活動(製品の閲覧、アカウント作成、取引のチェックアウトなど)を多く行うためである。
私たちが考えていること: インターネット上のエージェントによるトラフィックはまだ始まったばかりだ。昨年の 80 倍という急増は、エージェントがより能力が高く、堅牢で信頼性を持つようになるにつれ、今後さらに増加するだろう。

ステージ別生成画像の計画
拡散(diffusion)やフローマッチング(flow-matching)を利用するテキストから画像へのジェネレーターは、通常、一度に全体像を構成する(ただし、ステップごとに全体像を精緻化する)。研究者たちは、画像構成を離散的なステージに分け、中間結果を確認・修正することで、より良い結果を得た。
何が新しいか: Meta、カリフォルニア大学サンディエゴ校、ウースター工科大学、ノースウェスタン大学の Lei Zhang 氏らによる研究者グループは、画像生成モデルに対して計画を立てて要素を生成し、プロンプトと一致するか確認し、必要に応じて修正し、別の要素を生成するという段階的なプロセスをループさせることで画像を組み立てるよう学習させる微調整 手法 を提案しました。
重要な洞察: テキストから画像への生成モデルは、空間関係(ある要素が他の要素の上、下、前、後ろにあるかなど)や物体の属性(指、腕、脚の数など)を表現する際にしばしば 失敗 します。モデルが画像を完成させるために段階的なプロセスをループ処理する学習を行うことで、生成プロセスの制御が容易になります。「銀色のスプーンの上に浮かぶクマ」といったプロンプトの場合、以下のステージに分けることができます:
- 計画。次の変更に対する指示(1 回目の反復:「クマを描く」、2 回目の反復:「クマの下にスプーンを追加する」など)と、変更後の画像の説明を作成します。
- スケッチ。これまでに作成された画像の更新版を生成します(1 回目の反復:クマの画像、2 回目の反復:クマとスプーンの画像)。
- 検査。指示と説明がプロンプトと一致しているか確認し、画像が指示と一致しているか確認します。
- 改善。必要であれば修正命令を出し(2 回目の反復:「スプーンがクマの前にあったので、クマの下に描いてください」)、新しい画像を生成します。
このプロセスを表すデータでモデルをトレーニングすることで、プロンプトに基づいて画像を生成するだけでなく、画像の構成を組み立てて修正する能力も身につけることができます。
仕組み: 著者らは、BAGEL-7B から始めました。これは画像とテキスト(例:2 枚の画像とその組み合わせ指示)を入力として受け取り、画像とテキスト(例:組み合わせた画像と入力画像がどのように変更されたかの説明)を出力する事前学習済みマルチモーダルモデルです。著者らは、計画・スケッチ・検査・改善という段階を循環させることで画像を生成するようにファインチューニングを行いました。
- 計画とスケッチのためのファインチューニング:計画とスケッチの段階をファインチューニングするためのデータセットを作成するため、著者らは 32,000 の例を生成しました。各例には中間画像が約 3〜5 枚と最終画像が含まれています。これは、GPT-4o に 2 つのデータセットからのプロンプトを変換させてテキストベースのシーングラフ(scene graph)を作成させることで行いました。グラフのノードはオブジェクト(例えば「猫」や「クマ」)またはオブジェクトの属性(「毛深い」など)であり、エッジはそれらの間の関係(猫が「毛深い」など)を符号化しています。各グラフから、著者らはランダムにオブジェクト、属性、および関係を含む部分を選択しました。そして GPT-4o に、これらのオブジェクト、属性、関係を画像に追加するための段階的なプロンプトに変換させるよう依頼しました。FLUX.1 Kontext を使用して各段階的変更に対して画像を生成し、GPT-4o が段階的なプロンプトと一貫していると判断した結果のみを残しました。著者らはこのテキスト・画像の例を用いてモデルをファインチューニングしました。その結果、モデルは(i)例の次のテキストトークンを生成すること、および(ii)フローマッチング(flow-matching)ステップを数回繰り返して現在の画像のピクセル値を調整し、次の画像を生成することを学習しました。
- 検査のためのファインチューニング:検査段階をファインチューニングするためのデータセットを作成するため、著者らはまず計画とスケッチのためにファインチューニングされたモデルを使用し、段階的な指示と画像の例を生成した後、GPT-4o に中間テキスト記述が元のプロンプトと矛盾していないかを判断させるよう依頼しました。最後に、GPT-4o に批判と修正指示を作成させるようプロンプトを入力しました。著者らは、元のプロンプトと一貫する約 7,000 の例と、一貫しない約 8,300 の例を生成しました。GPT-4o の批判や指示を再現することを学習することで、モデルは現在の計画が元のプロンプトと一致しているかを判断するか、あるいは不整合を修正する方法を記述することを学習しました。
- 洗練のためのファインチューニング:著者らは、画像、画像の改善方法に関するテキストによる考察、および改善された画像からなるデータセットを用いてモデルをファインチューニングしました。
- 最後に、彼らは前述と同じ損失項(loss terms)を用いて、これら 3 つのデータセットすべてでモデルをファインチューニングしました。
結果: 著者らのファインチューニング手法は、オブジェクト間の関係がテキストプロンプトと一致する画像(例えば、スプーンの後ろではなくスプーンの上にクマを配置するなど)を生成する必要があるタスクにおいて BAGEL-7B の性能を向上させました。また、特定の時間帯や歴史的時代などの現実世界の知識に基づいた画像を生成する能力も BAGEL-7B で改善されました。
- GenEval は、プロンプトに記載された詳細のうち生成画像に現れる割合を測定する指標ですが、著者らの手法では 62,000 の例でファインチューニングを行った結果、BAGEL-7B が 77 パーセントから 83 パーセントへと向上しました。この手法には 131 ステップのフローマッチングが使用されました。一方、中間のノイジー拡散状態を批判することで画像生成を改善する手法である PARM は、688,000 の例でファインチューニングを行った後でも 77 パーセントにとどまり、1,000 ステップのフローマッチングが必要でした。
- WISE では GPT-4o を用いて、生成画像とプロンプトとの間のリアリティ、美的品質、一貫性を 0 から 1 のスケールで評価します(数値が高いほど優れています)。この手法により BAGEL は平均して 0.7 から 0.76 に向上しました。ファインチューニングされたモデルは、より頻繁にシーンが正しい時代や時間的文脈に配置されるようになりました。化学データセットでのテストでは、化学的に妥当な構造、物質、実験室のシーンを生成する確率も高まりました。
なぜ重要なのか: 画像生成器はしばしば見た目の良い画像を生成しますが、その出力はプロンプトと矛盾していることがよくあります。例えば、物体が不適切な場所に配置されたり、誤った属性を持ったりします。本研究は、単にトレーニングデータを拡張するだけでなく、このようなシステムをより信頼性の高いものにするための道筋を示しています。
私たちが考えていること: 段階的に画像を組み立てる画像生成器は、入力に対してステップバイステップで推論を行う大規模言語モデル(LLM)と類似しています。両方のアプローチは、モデルに要求を細分化させるよう導き、出力の質を向上させます。
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み