Runway、OS が利用中にアプリや Web を生成する Solaris を発表
本文の状態
日本語全文を表示中
詳細モードで約21分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Runway AI Engineering
Runway AI Engineering は「Solaris」を新ファミリー「Interface World Models」の先駆けとして発表し、OS が利用中にアプリやウェブサイトを生成する概念を具体化した。
AI深層分析を開く2026年9月1日 05:41
AI深層分析
キーポイント
Interface World Models の登場
Runway AI Engineering は「Solaris」を新ファミリー「Interface World Models」の先駆けとして発表し、OS が利用中にアプリやウェブサイトを生成する概念を具体化した。
中間表現の排除とリアルタイム合成
従来のデザインからコードへの翻訳プロセスを経由せず、インタラクションに応じてフレームごとに直接インターフェースを合成することで、情報の損失を防ぐ。
既存モデルの課題克服
テキストベースの LLM が特定のレイアウトに依存して汎用性が低い現状に対し、Solaris は動的な環境下でエージェントがより柔軟にタスクを遂行できる基盤を提供する。
デザインと機能の統合
ビジュアルデザインの忠実さを保ちつつ、すべての挙動をユーザー入力の応答として生成することで、設計上のトレードオフを解消する新たな開発アプローチを示す。
テキストベースモデルの限界とSolarisのアプローチ
従来のテキストベースモデルは特定のレイアウトに依存して学習するため、異なるインターフェースへの適応が困難である。Solaris は行動と応答の間の空間を縮小することで、常に変化するインターフェースや未存在のレイアウトに対してエージェントを訓練可能にする。
重要な引用
Solaris starts with a question: what happens when an operating system generates apps and websites as you use them?
Every frame is synthesized as you interact, allowing the interface to respond continuously to your actions.
A single world model generates every frame and every response to user input, eliminating the need for an intermediate representation.
By collapsing the space between action and response, Solaris lets agents train against interfaces that are constantly changing, and layouts that may never have existed before.
編集コメントを表示
編集コメント
Runway AI Engineering が提示した「Interface World Model」の概念は、従来の静的な UI デザインと動的なコード生成の境界を曖昧にする画期的な試みである。このアプローチが実環境でどの程度安定して動作し、既存の開発ワークフローにどう統合されるかが今後の注目点となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

本日、私たちはSolarisを発表します。これは私たちが「Interface World Models(インターフェース・ワールドモデル)」と呼ぶ新しい AI システムファミリーの最初のモデルです。Solaris は一つの問いから始まります。OS がアプリやウェブサイトを、あなたがそれらを利用している最中に生成したらどうなるでしょうか?
ターミナル時代から Linux、macOS に至るまで、あらゆる OS は画面に何が描画されるか、そして人間やプログラムが操作した際に何が起こるかを決めてきました。その上でアプリケーションが構築され、誰かがアップデートを適用するまで固定されたままです。一方、Solaris はこのレイヤー自体を直接レンダリングします。これはフレーム単位でインターフェースそのものを生成するリアルタイム・インタラクティブモデルです。各フレームはあなたの操作に合わせて合成されるため、インターフェースはあなたの行動に連続して応答することができます。
デザインはこれまで以上に視覚的になっています。ピクセル単位の正確なモックアップや、完成品と見分けがつかないほど精巧な画面全体を生成できる画像モデルが登場しています。しかし、画像はウェブサイトやアプリのように動作しません。現在構築されているあらゆるソフトウェアには依然として「翻訳」が必要です。つまり、何らかの機能を持たせるためには、視覚的なデザインをまず中間表現(例えばコード)に変換しなければならないのです。
この中間表現は、インターフェースがどのようなものであり得るか、そして人間やエージェントとの相互作用にどう応えるかを制限してしまいます。すべての動作は事前に明示的に定義・実装される必要があるため、ソフトウェアは可能なインタラクションの空間を圧縮した劣化版として出荷され、ユーザーが現れる前にその姿が凍結されてしまいます。同じ翻訳プロセスは視覚的な忠実性も犠牲にします。一度デザインが簡略化された表現に還元されると、インターフェースは高速で応答できるようになりますが、それは元のデザインの豊かさを多く放棄することによって成り立っています。
Solaris はレンダリングとインタラクションを統合的に処理し、現代のデザインに伴う多くのトレードオフを取り除きます。単一のワールドモデルがすべてのフレームとユーザー入力へのあらゆる応答を生成するため、中間表現が必要なくなります。変換ステップが存在しないため損失はなく、フレーム全体がインターフェースそのものとなります。
Solaris は、ウェブサイトやアプリ、その他のオンラインインターフェースを構築する新たな道を開くものと考えています。しかし同時に、よりダイナミックな環境におけるエージェントの訓練方法も革新します。
現在、最も優れた大規模言語モデル(LLM)でさえ 基本的なコンピューター操作タスクの遂行に苦戦 しています。例えばホテルの予約や食料品の注文などです。テキストベースのモデルは、コード化されたインターフェースの使用を目的として訓練されているため、訓練時に遭遇した特定のレイアウトに依存してしまい、わずかに異なるインターフェース(例えば、異なる 2 つのホテルウェブサイトなど)には適応できません。
アクションとレスポンスの間の空間を縮めることで、Solaris は常に変化するインターフェースや、これまで存在しなかったかもしれないレイアウトに対してエージェントが訓練できるようにします。
何が新しいのか
Solaris はソフトウェアに 3 つの新機能を追加します。
第一に、Solaris は完全にビジュアルです。画像そのものがアプリケーションとなるため、ユーザーが見ているビジュアルの背後に隠された第 2 の実装ステップは不要になります。仮想のアパレルストアを閲覧するイメージを考えてみてください。ショールーム自体がインターフェースとなっています。自分自身の写真を 1 枚参照として用いるだけで、ラックからシャツを取り出し、試着のために自分の身にドラッグしたり、物理的な店舗で行うように自然にディスプレイの配置を変更したりできます。
第二に、Solaris は「生きている」システムです。アプリケーションが常にレンダリングされているため、次のユーザー操作を待つのではなく、絶えず進化し続けます。照明の変化に応じて反射も移り変わり、オブジェクトは操作される際に自然な反応を示します。ユーザーは、「テーブルの配置を変えて、どんな見た目になるか確認したい」とか「ソファの色を変えて」といったシンプルな指示を出すだけで済みます。その結果、スクリプト化されたページをナビゲートするのではなく、生きた環境と対話しているような感覚が得られるソフトウェアになります。
最後に、Solaris はオープンエンドです。従来のインターフェースは開発者が事前に想定した範囲の相互作用に限定されていますが、Solaris は同じシーン内で全く異なる振る舞いもサポートし、ユーザーの操作に対してリアルタイムで反応します。この柔軟性により、インターフェースが事前定義されたワークフローから切り離され、駆動される世界モデルの能力によって何が実現可能かが決まるようになります。
Solaris はインターフェースをページ列ではなく、インタラクティブな体験へと変えます。メニューから選択肢を選ぶのではなく、ユーザーはシーンそのものと直接対話します。サラダを作る際も、具材をボウルにドラッグするだけでよく、各具材を追加するたびにインターフェースが自然に応答します。
なぜこれまでこれが存在しなかったのか?
デジタルインターフェースは二つのシステムの上に構築されていますが、これらはこれまで別々の世界で存在していました。
検索エンジンや AI アシスタントといった「知識を持つシステム」は、テキストや画像、埋め込まれた動画など、静的なコンテンツで回答します。
一方、JavaScript/CSS、ゲームエンジン、そして近年ではインタラクティブな世界モデルのようにリアルタイムで応答するシステムは、豊かでインタラクティブな体験を生み出しますが、ユーザーの製品やタスク、あるいは達成したい目標については何も知りません。
従来、ソフトウェアインターフェースは決定論的なプログラムとして、世界モデルは視覚コンテンツを生成するものとして考えられてきました。しかし「インターフェース・ワールドモデル」は両方の性質を同時に備えている必要があります:ユーザーの意図を理解しつつ、その周囲でインタラクティブな世界を継続的に描画するシステムです。
実際にこれを実装しようとすると、すぐに三つのエンジニアリング上の課題が浮き彫りになります。
スピード感。インタラクションが「リアルタイム」と感じられなくなるのは、遅延が約半秒に達したあたりです。動画拡散モデルはクリップ生成に数秒から数分を要するため、コンテンツ制作には許容範囲ですが、インターフェースとしては遅すぎます。この閾値を超えるためには、モデルはフレームを順次生成する必要があります。各フレームは過去の情報にのみ依存し、ユーザーの操作に追いつけるほど低コストで実行されなければなりません。
一貫性の維持。インターフェースは単一のクリップだけでなく、セッション全体を通じて一貫した状態を保つ必要があります。テキスト、レイアウト、オブジェクトの同一性など、維持すべき要素は、従来動画生成が苦手としてきた領域と重なります。生成が長引くほど小さな誤差が蓄積し、問題が悪化します。
コスト。すべてのフレームを生成するのは、一度構築されたページを提供するよりも依然として高価です。しかし、Solaris をリアルタイム化するために実施した技術的工夫は、標準的な動画拡散モデルと比較して実行コストを桁違いに削減しました。このコスト曲線は今後もさらに改善され続けています。
Solaris は、これらの概念的・技術的障壁を克服できるという私たちの賭けです。開発では、リアルタイムインタラクション、セッション全体の一貫性、720p で維持される高画質の 3 つに焦点を当てて構築しました。
Solaris の仕組み
Solaris は、私たちが Gen-4.5 として発表した動画生成モデルを基盤に構築されています。このモデルを「インタラクションの理解」と「リアルタイムでの応答」の 2 つの能力を持たせるために改造しました。これは、汎用世界モデルである GWM-1 で開拓した道筋をさらに発展させたものです。
インタラクションの学習。Solaris は、ユーザーの入力を次のフレームを生成するための条件として扱います。これはテキストや画像と同じ扱い方です。モデルは動画生成中にクリックやドラッグといった操作を観察し、次に来るべき動作を示すシグナルとして利用します。モデルが学習できるのは「すでに発生したインタラクション」のみであり、未来の出来事を見ることはありません。これにより、ユーザーの行動と視覚的な結果との関係性を自然に学び取ります。つまり、クリックやドラッグ、変更といった操作に対して何が起こるべきかを理解するようになりますが、それらの動作を明示的にプログラムする必要はありません。
リアルタイムで動作する。標準的な動画拡散モデルは、数十回のノイズ除去ステップを通じて1クリップ全体を生成するため、ダイナミックなユーザー操作にはあまりにも時間がかかります。Solaris をリアルタイムエンジンに変換するために、3 つの段階を行いました。まず、各フレームが直前の情報にのみ依存するように自己回帰的にフレームを生成する能力を学習させました。次に、多数のステップからなるノイズ除去プロセスを少数のステップに圧縮しました。最後に、高速モデルを自身の出力でトレーニングし、長時間の操作でも視覚的な品質が安定するようにしました。その結果、元の教師モデルが持つ高い画質を保ちながら、インタラクティブな速度でフレームを生成できるようになりました。
推論と描画。Solaris はインターフェースを1 フレームずつ生成しますが、その進化を決めるのは言語モデルです。LLM(大規模言語モデル)はユーザーの要求を解釈し、現在のシーンを操作すべきタイミングか、新しいシーンへ遷移すべきかを判断します。また、世界に命を感じさせる振る舞いを定義し、Solaris が各状態を描画する際にガイドとなるプロンプトも生成します。このように、言語モデルと世界モデルは「推論」と「描画」を分離しています。前者がアプリケーションの次の動作を決定し、後者がその動作がリアルタイムでどのように表示され、どう反応するかを生成します。
連続生成
開始状態(ブランド環境や製品シーンなど)を指定すると、モデルはリアルタイムでフレームをストリーミングします。ユーザーがクリック、ドラッグ、または入力を行うと、その操作が次の生成フレームに即座に取り込まれ、シーンはその場で反応します。あらかじめ用意された画面やテンプレートに依存するわけではありません。代わりに、テキストプロンプトによって「特定のシーンにおけるクリックやドラッグ、その他の操作の意味」を定義します。
マウスの再定義
操作をプログラムではなく自然言語で記述できるようになれば、事前に固定する必要はなくなります。シーンのあらゆるオブジェクトが新しい種類のツールになり得ます。猫をクリックすれば、その毛の色や質感を次に触れたものに適用できます。絵画をクリックすれば、そのスタイルで描き始めることも可能です。
Solaris の評価
翻訳のコスト
前述した通り、インターフェースを中間表現に変換すると情報が失われるのは避けられません。この損失を定量化するため、現在のマルチモーダル言語モデルがスクリーンショットからどれほど忠実にインターフェースを再現できるかをテストしました。



この評価を行うため、Claude Fable 5 を含む最先端のマルチモーダル言語モデルを用いて、スクリーンショット一枚から Web サイトのインターフェースを再現するタスクを実施しました。対象としたのは、シンプルな Web ページから画像が豊富なページ、さらには自然画像までを含む多様な 30 のインターフェースです。これらを通じて、視覚理解の異なる側面を検証しています。
情報の保持度を測るため、2 つの補完的なアプローチを採用しました。まず構造的類似度(SSIM)を用いて、再構成されたインターフェースと元の画像を位置合わせで比較し、視覚的な外観がどの程度忠実に再現されているかを評価します。次に、DINOv3 の特徴量を用いて、元の画像の各領域と再構成結果内の最も類似した領域を対応付けます。これにより、要素の配置が変わったりレイアウトが変更されたりした場合でも、背後にある視覚的な情報が保持されているかどうかを測定します。

*視覚的複雑さの増加に伴う再構成精度の変化。 モデルが継続的に進化しているにもかかわらず、視覚的な複雑さが高まるにつれて再構成品質は確実に低下します。これは、インターフェースを言語という媒体を通じて変換する過程で情報が失われていることを示しています。
近年の急速な進展にもかかわらず、すべての言語モデルは再構築過程で情報を失います。自然画像はその影響を最も強く受けます。なぜなら、豊かな視覚的詳細を言語で正確に表現することは不可能だからです。
インターフェースが複雑化するにつれ、テキストやレイアウト、構造におけるわずかな変更さえも、根本的にその動作のあり方を変えてしまいます。
Solaris は、インターフェースを言語に変換して再構築するのではなく、視覚的なインターフェースそのものを直接操作します。中間表現を排除することで、最初のフレームから一貫した完全な視覚的・意味的状態を維持します。
Solaris とコードベースのインターフェースの違い
当社の再構築ベンチマークは、インターフェースがコードに変換される際にどれだけの情報が失われるかを測定するものです。次に問います。同じインターフェースとユーザー操作において、どちらのアプローチがより優れた結果を生むのか?コード化されたインターフェースは、インターフェース世界モデルによって生成されたものと同じ「生きている」「応答性のある」環境の感覚を再現できるのでしょうか。
*比較。 両システムとも同じインタラクション要求に応えますが、Solaris は全体のシーンの整合性を維持し、より自然で物理的な根拠に基づいたインタラクションを生み出します。
この疑問に答えるため、Solaris を最先端の言語モデル(Claude Opus 5)と比較しました。両システムは同じ画像からスタートし、同一の操作リクエストを受け取ります。その上で、それぞれの応答を記録しました。その後、30 の操作例について 250 人の参加者を対象にユーザー調査を実施し、約 7,500 組の比較判断データを収集しました。各比較において、参加者は以下の 2 つの質問に回答します。「どちらの結果が与えられた指示によりよく従っているか」「どちらの方がシーン内でより自然な振る舞いを見せているか」。

参加者は両方の指標において Solaris を好みました。指示への従順さでは、Solaris が 61% の比較で選ばれ、コード生成の結果は 24%、同等と評価されたのは 13% でした。自然な振る舞いについては差がさらに大きく、Solaris は 71% で選ばれ、コード生成のウェブサイトは 21%、同等は 6% でした。
2 つ目の結果は、両アプローチの本質的な違いを浮き彫りにしています。コードベースのインターフェースでは、要求された変更を再現することは可能ですが、その操作をインターフェースへの孤立した更新として扱う傾向があります。一方、Interface World Models では、モデルがオブジェクト、素材、環境の振る舞いをすでに理解しているため、各 UI 操作を孤立した要素として扱うのではなく、シーン全体の中で一貫性のあるインタラクションを生成することが可能になります。
まだできないこと
Solaris は、周囲の動き(アンビエント・モーション)やクリック&ドラッグ操作、シーン遷移において最も強力な性能を発揮します。しかし、解決すべき重要な課題も残されています。
- テキスト。安定して読みやすいテキストの生成は、動画生成における最も困難な問題の一つです。しかし、ユーザーインターフェースにおいては、他のどの視覚領域よりもテキストへの依存度が高いのが実情です。現実的な解決策として、画像生成モデルが短い一時停止を許容できる場面ではテキスト中心の画面を描画し、動画生成モデルが連続した対話を担当するハイブリッドシステムがあります。完全にリアルタイムで生成されるテキストは、依然として未解決の課題です。
- 信頼性。手順説明や商業的な体験においては、説得力のある「間違った回答」を提供されることほど悪いことはありません。現在、Solaris はユーザーが提供した情報に基づいて動作を制限しています。開始フレームには実際の製品画像や参照資料を組み合わせて使用し、シーンを実在するものに基づいて構築します。セッションが進むにつれて、より豊富な検証済みの文脈(参照画像、製品データ、ドキュメントなど)に条件付けを行うことで生成を制御することは、現在も活発に研究されている分野です。
- 長時間のセッション。拡張されたオープンエンドな対話において、視覚的および意味的な一貫性を維持し続けることは、依然として研究が進行中の領域です。
- アクセシビリティと統合。生成されたインターフェースは、スクリーンリーダーやアクセシビリティ API などの支援技術を含む、既存のソフトウェアスタック内で正しく動作する必要があります。柔軟性が使いやすさを損なうことがあってはなりません。
これらの課題は、リアルタイム生成モデルの最前線を反映するものであり、基盤となるモデル自体が向上するにつれて、これらも改善されると予想されます。
新しい種類のインターフェース
Solaris は新たなオペレーティングレイヤーへの第一歩であり、いくつかの新しいインタラクションパターンが出現していると考えられます。
アプリがインタラクションの単位ではなくなる。今日、何かを完了させるには、その目的に特化した既成のアプリを開く必要がある——ショッピング用、ニュース用、レストラン予約用と、用途ごとに別々のアプリだ。しかし、オペレーティングシステムがユーザーの要望に応じた有用なインターフェースを生成できるようになれば、ソフトウェアを固定されたカタログとして分類する必要性は薄れる。必要なものが、あなたに最適化された形で自動的に現れるようになる。
インタフェース・ワールドモデルにより、視覚的なアイデアと中間表現の間で変換を行う必要がなくなる。UI フレームワークやコンポーネント、コードを通じて作業を進めるのではなく、あらゆる視覚的概念をそのままインタラクティブなインターフェースとして実現できる。
オンラインストアはもはや、すべての訪問者が同じレイアウトを見る固定されたものではない。ブランドのアイデンティティを保ちつつ、個々のユーザーに合わせて適応する生成環境へと進化する。商品、レイアウト、色、素材、レコメンデーションがあなたの意図に応じてリアルタイムで再構成され、ハイパーパーソナライズされた体験の中でもブランドと製品が認識可能に保たれる。
チュートリアルももはや、全員に同じ手順を繰り返すものではない。次のステップは、あなた自身の文脈に合わせてレンダリングされ、進捗に応じて適応し、手順から外れた場合でも自然に回復する仕組みとなる。
インタフェース生成の未来は、画像や動画生成と同様の軌道を描くと予想されます。モデルによる生成は、より高速に、一貫性が高く、制御しやすく、そして能力も向上していくでしょう。かつては実用的ではないと見なされていた課題も、今では解決可能なエンジニアリングの問題として捉え直されています。
Solaris は私たちが初めて開発したインタフェース・ワールドモデルです。生成されたソフトウェアがどのような可能性を秘めているか、より豊かな相互作用、強固な基盤、長期間にわたる体験、そして今日まだ存在しない全く新しい種類のインタフェースへと進化していく姿を、私たちは引き続き探求していく予定です。
Solaris の一般公開に向けて主要なパートナーと協力して取り組んでいます。早期アクセスをご希望の方は、以下のフォームにご記入ください。
Solaris の早期アクセスをリクエストするには、このフォームに記入してください
フルネーム*
ビジネス用メールアドレス*
会社名*
会社の規模*
追加情報
0 / 2000
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み