Anthropic、新世代 AI システム「Solaris」を発表
本文の状態
日本語全文を表示中
詳細モードで約21分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Solaris は、従来の中間表現を介さず、ユーザーの操作に応じてフレームごとにインタフェースそのものをリアルタイム生成する「Interface World Model」として発表された。
AI深層分析を開く2026年9月2日 02:06
AI深層分析
キーポイント
Interface World Model の定義
Solaris は新しい AI システムファミリーの第一弾であり、OS がアプリやウェブサイトをユーザーの使用時に生成するという概念を実現するモデルである。
リアルタイムインタフェース生成
従来の固定されたアプリケーションとは異なり、Solaris はユーザーの行動に対してフレーム単位でインタフェースを合成し、継続的な応答を可能にする。
中間表現の不要化と設計の維持
視覚デザインをコードなどの中間表現に変換する工程が不要となるため、情報のロスなく、元のデザインの豊かさを保ったままインタフェースを提供できる。
エージェント学習環境の革新
動的な環境でエージェントを訓練する新たな手段となり、既存の LLM が直面している特定のレイアウトへの依存や適応力の欠如という課題を解決する可能性がある。
テキストベースモデルの限界とSolarisの適応性
従来のテキストベースモデルは特定のレイアウトに学習されるため、異なるインターフェースに対応できない。Solaris はアクションとレスポンスの間の空間を縮小し、常に変化するインターフェースや存在しないレイアウトに対してもエージェントが訓練できるようにする。
重要な引用
what happens when an operating system generates apps and websites as you use them?
It's a real-time interactive model that generates the interface itself, frame by frame.
A single world model generates every frame and every response to user input, eliminating the need for an intermediate representation.
By collapsing the space between action and response, Solaris lets agents train against interfaces that are constantly changing, and layouts that may never have existed before.
編集コメントを表示
編集コメント
Solaris は、従来の静的な UI/UX の概念を根本から覆す「インタフェースそのものが生成される」技術として注目される。特にエージェントが動的環境で自律的に動作するための基盤技術としてのポテンシャルが高く、今後の AI エージェント開発の方向性を示唆する重要な発表である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

本日、私たちは新しい AI システムのファミリー「Interface World Models(インターフェース・ワールドモデル)」の最初のモデルであるSolarisを発表します。Solaris は一つの問いから始まります。OS がアプリやウェブサイトを、あなたが操作している最中に生成したらどうなるでしょうか?
ターミナル時代から Linux、macOS まで、あらゆる OS は画面に何を表示するかを決定し、人間やプログラムがそれに対して行動した際の挙動も規定してきました。その上でアプリケーションが構築され、誰かがアップデートを適用するまで固定されたままです。一方 Solaris は、このレイヤー自体を直接レンダリングします。これはフレーム単位でインターフェースそのものを生成するリアルタイム・インタラクティブモデルです。各フレームはあなたの操作に合わせて合成されるため、インターフェースはあなたの行動に対して絶えず反応し続けます。
デザインはこれまで以上に視覚的になっています。ピクセル単位の正確さを誇るモックアップや、完成品と見分けがつかないほど精巧な画面を生成できる画像モデルが登場しています。しかし、画像はウェブサイトやアプリのように動作しません。現在構築されるすべてのソフトウェアには依然として「翻訳」が必要です。つまり、何らかの機能を持たせるためには、視覚的なデザインをまず中間表現(例えばコード)に変換しなければならないのです。
この中間表現は、インターフェースがどのようなものになり得るか、そして人間やエージェントとの相互作用にどのように応答するかを制限してしまいます。すべての動作は事前に明示的に定義・実装される必要があるため、ソフトウェアは利用者が訪れる前に凍結された「可能な相互作用の空間」に対する劣化圧縮としてリリースされます。同じ変換プロセスは、視覚的な忠実性も犠牲にしてしまいます。
一度デザインが簡略化された表現に還元されると、インターフェースは高速に応答できるようになりますが、その代償としてオリジナルデザインの豊かな要素を多く失うことになります。
Solaris はレンダリングと相互作用を統合的に処理し、現在のデザインで一般的に考えられている多くのトレードオフを取り除きます。単一のワールドモデルがすべてのフレームとユーザー入力への応答を生成するため、中間表現の必要性がなくなります。変換ステップが存在しないため劣化も生じず、フレーム全体がそのままインターフェースとなります。
Solaris は、ウェブサイトやアプリ、その他のオンラインインターフェースを構築する新たな方法を開くものだと考えています。しかし同時に、より動的な環境におけるエージェントの訓練にも新しい道筋をもたらします。
現在、最も優れた大規模言語モデル(LLM)でさえ 基本的なコンピュータ操作タスクの完了に苦労しています。例えばホテルの予約や食料品の注文といった作業です。テキストベースのモデルはコード化されたインターフェースの使用を目的として訓練されているため、学習した特定のレイアウトに依存しがちで、わずかに異なるインターフェース(例えば、異なる 2 つのホテルウェブサイトなど)には適応できません。
Solaris は、アクションとレスポンスの間の空間を縮めることで、常に変化するインターフェースや、かつて存在しなかったかもしれないレイアウトに対してエージェントが訓練できるようにします。
何が新しいのか
Solaris はソフトウェアに 3 つの新機能を追加します。
第一に、Solaris は完全にビジュアルです。画像そのものがアプリケーションとなるため、ユーザーが見ているビジュアルの背後に隠された第 2 の実装ステップは不要になります。仮想のアパレルストアを想像してみてください。ショールーム自体がインターフェースとなっているような場所です。自分自身の単一の画像をリファレンスとして使用すれば、ラックからシャツを取り出し、着てみるために自分の上にドラッグしたり、物理的な店舗で行うように自然にディスプレイの配置を変更したりできます。
第二に、これは「生きている」システムです。アプリケーションが常時レンダリングされるため、次のユーザー操作を待つのではなく、常に進化し続けます。照明の変化に応じて反射も移り変わり、オブジェクトは操作された際に自然な反応を示します。ユーザーは、「テーブルの位置を変えて、見た目を確かめたい」「ソファの色を変更して」といったシンプルな発言をするだけで済みます。その結果、スクリプト化されたページをナビゲートするのではなく、生きた環境と対話しているかのような体験が得られるソフトウェアになります。
最後に、これは「開かれた」システムです。従来のインターフェースは開発者が事前に想定した相互作用に限定されますが、Solaris は同じシーン内で全く異なる振る舞いをサポートし、ユーザーの操作に対してリアルタイムで反応できます。この柔軟性により、インターフェースが事前定義されたワークフローから切り離され、駆動される世界モデルの能力によって何が可能なかが決定されます。
Solaris は、インターフェースをページの一連の遷移ではなく、インタラクティブな体験へと変えます。メニューから選択肢を選ぶのではなく、ユーザーはシーンそのものと直接対話します。サラダを作る作業も、材料をボウルにドラッグするだけで済み、各材料が追加されるたびにインターフェースが自然に応答します。
なぜこれまで存在しなかったのか?
デジタルインターフェースは二つのシステムの上に構築されていますが、これらはこれまで別々の世界で存在していました。
検索エンジンや AI アシスタントといった「知識を持つシステム」は、テキストや画像、埋め込まれた動画など、静的なコンテンツで回答します。
一方、JavaScript や CSS、ゲームエンジン、そして近年ではインタラクティブな世界モデルのように「リアルタイムで応答するシステム」は、豊かでインタラクティブな体験を生み出しますが、ユーザーの製品やタスク、あるいは達成したい目標については何も知りません。
従来、ソフトウェアインターフェースは決定論的なプログラムとして、世界モデルは視覚コンテンツを生成するものとして考えられてきました。しかし「インターフェース・ワールドモデル」は両方の性質を同時に備えている必要があります。つまり、ユーザーの意図を理解しながら、その周囲にインタラクティブな世界を継続的に描画するシステムです。
実際にこれを実装しようとすると、すぐに三つのエンジニアリング上の課題が浮き彫りになります。
スピード感。インタラクションの遅延が半秒を超えると、ユーザーは「対話している」という感覚を失います。動画拡散モデルではクリップ生成に数秒から数分かかるため、コンテンツ制作には許容範囲でも、インターフェースとしては遅すぎます。この閾値を超えるためには、モデルはフレームを順次生成し、各フレームが過去の情報にのみ依存する仕組みとし、ユーザーの操作に追いつけるほど低コストで実行する必要があります。
一貫性の維持。インターフェースは単一のクリップだけでなく、セッション全体を通じて一貫した状態を保つ必要があります。テキスト、レイアウト、オブジェクトの同一性など、維持すべき要素は、従来の動画生成が苦手としてきた領域と重なります。生成時間が長くなるほど小さな誤差が蓄積し、問題が悪化します。
コスト。すべてのフレームを生成するのは、一度構築されたページを提供するよりも依然として高価です。しかし、Solaris をリアルタイム化するために実施した技術的工夫は、標準的な動画拡散モデルと比較して実行コストを桁違いに低下させました。このコスト削減の傾向は今後も続くと見込まれています。
Solaris は、これらの概念的・技術的障壁を克服できるという私たちの確信に基づいています。開発では「リアルタイムインタラクション」「セッション全体での一貫性」「720p 画質で維持される視覚品質」の三つに焦点を当てて構築しました。
Solaris の仕組み
Solaris は、Runway が開発した Gen-4.5 動画生成モデルを基盤にしています。このモデルを改修し、(1) 相互作用を理解し、(2) リアルタイムで応答できるようにしました。これは、汎用世界モデルである GWM-1 で開拓した道筋を引き継ぐものです。
相互作用の学習。Solaris は、ユーザーの入力を次のフレームを生成するための条件として扱います。テキストや画像と同様の扱い方です。モデルは生成中にクリックやドラッグなどの操作を観察し、次に来るべき動作のシグナルとして利用します。モデルが観測するのは過去に起きた相互作用のみであり、未来の出来事を見ることはありません。これにより、ユーザーの行動と視覚的な結果との関係性を学習します。つまり、何かがクリックされたときやドラッグされ、変更されたときに何が起きるかを理解するようになりますが、それらの操作を明示的にプログラムする必要はありません。
リアルタイム実行。 標準的な動画拡散モデルは、数十回のノイズ除去ステップにわたってクリップ全体を精査するため、ダイナミックなユーザー操作には到底追いつきません。Solaris をリアルタイムエンジンへと変換するには、3 つの段階を踏みました。まず、各フレームが過去のフレームのみに基づいて生成されるよう自己回帰的に学習させました。次に、多数のステップにわたるノイズ除去プロセスを数ステップに凝縮しました。最後に、高速モデルを自身の出力で訓練し、長時間の操作においても視覚品質が安定するようにしました。その結果、元の教師モデルと同等の視覚品質を保ちながら、インタラクティブな速度でフレームを生成できるようになりました。
推論とレンダリング。 Solaris はインターフェースを 1 フレームずつ生成しますが、その進化を決定するのは言語モデルです。LLM(大規模言語モデル)はユーザーの要求を解釈し、現在のシーンを修正すべきか新しいシーンへ遷移すべきかを判断します。また、世界に生命感を与える振る舞いを定義し、Solaris が各状態をレンダリングする際に指針となるプロンプトも生成します。このように、言語モデルとワールドモデルは「推論」と「レンダリング」を分離しています。一方がアプリケーションの次の動作を決定し、他方がその動作がリアルタイムでどのように視覚化され、応答するかを生成します。
連続生成
開始状態(ブランド環境や製品シーンなど)を提供すると、モデルはリアルタイムでフレームをストリーミングします。ユーザーがクリック、ドラッグ、または入力を行うと、そのインタラクションが次に生成されるフレームに即座に取り込まれ、シーンはその場で応答します。あらかじめ定義された画面もテンプレートも存在しません。代わりに、テキストプロンプトによって、「特定のシーンにおけるクリックやドラッグ、その他の操作が何を意味するか」を指定します。
マウスの再定義
インタラクションをプログラムではなく自然言語で記述できるようになれば、事前に固定する必要はなくなります。シーンのあらゆるオブジェクトが新しい種類のツールになり得ます。猫をクリックすれば、その毛の色や質感を次に触れるものに適用できます。絵画をクリックすれば、そのスタイルで描き始めることも可能です。
Solaris の評価
翻訳のコスト
前述した通り、インターフェースを中間表現に変換することは、必然的に情報の劣化を招きます。この損失を測定するため、現在のマルチモーダル言語モデルがスクリーンショットからどの程度忠実にインターフェースを再現できるかをテストしました。



この評価を行うため、Claude Fable 5 を含む最先端のマルチモーダル言語モデルを用いて、スクリーンショット 1 枚からウェブサイトインターフェースを再現するタスクを実施しました。対象としたのは 30 の多様なインターフェースで、シンプルなウェブページから画像が多用されたページ、さらには自然画像まで含まれており、視覚理解の異なる側面を検証しています。
情報の保持度は、2 つの補完的な方法で測定します。まず構造的類似度(SSIM)を用いて、再構成したインターフェースと元のものを位置合わせし、視覚的な外観がどれほど忠実に再現されたかを評価します。次に、DINOv3 の特徴量を用いて、元の画像の各領域を再構成結果内の最も類似した領域と比較します。これにより、要素の移動やレイアウトの変更があっても、背後にある視覚的コンテンツが保持されているかどうかを測定します。

*視覚的複雑さの増加に伴う再構成精度の変化。マルチモーダル言語モデルが継続的に進化しているにもかかわらず、視覚的複雑さが増すにつれて再構成品質は確実に低下します。これは、インターフェースを言語を通じて変換する際に情報が失われていることを示しています。
近年の急速な進歩にもかかわらず、すべての言語モデルは再構築の過程で情報を失います。自然画像はその影響を最も強く受けますが、これは豊かな視覚的詳細を言語で正確に表現することができないためです。
インターフェースが複雑化するにつれて、テキストやレイアウト、構造へのわずかな変更さえも、根本的にその動作のあり方を変えてしまいます。
Solaris は、インターフェースを言語に変換して再構築するのではなく、視覚的なインターフェースそのものを直接操作します。中間表現を排除することで、最初のフレームから一貫して、完全な視覚的・意味的な状態を保持します。
Solaris とコードベースのインターフェースの違い
当社の再構築ベンチマークは、インターフェースがコードに変換される際にどれほどの情報が失われるかを測定するものです。次に問います。同じインターフェースとユーザー操作において、どちらのアプローチがより良い結果を生むのか?コード化されたインターフェースは、インターフェース世界モデルによって生成されたものと同じ「生きている」「反応する」環境の感覚を再現できるのでしょうか。
*比較。 両システムとも同じインタラクション要求に応答しますが、Solaris は全体のシーンの整合性を維持し、より自然で物理的な根拠に基づいたインタラクションを生み出します。
この問いに答えるため、Solaris を最先端の言語モデル(Claude Opus 5)と比較しました。両システムは同じ画像から始め、同一の操作リクエストを受け取り、それぞれの反応を記録します。その後、30 の操作例を対象に 250 人の参加者を募り、約 7,500 組の比較評価を集めました。各比較では、参加者に以下の 2 つの質問に答えてもらいました。「どちらが指示により忠実に従っているか」「どちらがその場面でより自然な振る舞いを見せているか」。

参加者は両方の評価項目で Solaris を高く評価しました。指示への従順さでは、Solaris が 61% で選ばれ、コードベースの結果は 24%、同等と評価されたのは 13% です。自然な振る舞いについては差がさらに大きく、Solaris は 71% で選ばれ、コードベースのウェブサイトは 21%、同等は 6% でした。
2 つ目の結果は、両アプローチの本質的な違いを浮き彫りにしています。コードで実装されたインターフェースは要求された変更を再現できることが多いですが、操作を単なるインターフェースの個別更新として扱います。一方、Interface World Models では、モデルがオブジェクト・素材・環境の振る舞いをすでに理解しているため、各 UI 操作を孤立した要素として扱うのではなく、その場面で一貫性のある相互作用を生成できます。
まだできないこと
Solaris は、周囲の動き(アンビエント・モーション)やクリック&ドラッグによる操作、シーン遷移においては最も得意としています。しかし、解決すべき重要な課題も残されています。
- テキスト。安定して読みやすいテキストの生成は、動画生成における最も難しい課題の一つです。しかし、ユーザーインターフェースでは他のどの視覚領域よりもテキストへの依存度が高いのが実情です。一つの現実的な解決策として、画像生成モデルが短い一時停止を許容できる場面ではテキスト重視の画面を描画し、動画生成モデルが連続した操作を担当するハイブリッドシステムがあります。完全にリアルタイムで生成されるテキストは、依然として未解決の課題となっています。
- 信頼性。手順説明や商業的な用途において、説得力のある「間違った回答」を提供されることは、「回答がない」ことよりも悪影響を及ぼします。現在、Solaris はユーザーが提供した情報に基づいて動作し、その信頼性を担保しています。開始フレームには実際の製品画像や参照資料を組み合わせて使用することで、シーンを実在するものに基づいたものに根付かせています。セッションが進むにつれて、より豊富な検証済みの文脈(参照画像、製品データ、ドキュメントなど)を生成の条件として与える研究は現在も活発に進められています。
- 長時間のセッション。拡張された、あるいは終端のない対話において、視覚的・意味的な一貫性を維持し続けることは、現在も研究が活発な分野です。
- アクセシビリティと統合。生成されたインターフェースは、スクリーンリーダーやアクセシビリティ API などの支援技術を含むソフトウェアスタック全体の中で正しく動作する必要があります。柔軟性を追求するあまり、使いやすさが損なわれてはいけません。
これらの課題は、リアルタイム生成モデルの最前線における現状を反映しており、基盤となるモデル自体の進化に伴い改善されていくものと期待しています。
新しい種類のインターフェース
Solaris は新たなオペレーティング層への第一歩であり、いくつかの新しいインタラクションパターンが生まれつつあると考えています。
アプリがインタラクションの単位ではなくなる。今日、何かを完了させるには、その目的に特化した既成のアプリを開く必要がある——ショッピング用、ニュース用、レストラン予約用と、用途ごとに別々のアプリだ。しかし、オペレーティングシステムがユーザーのあらゆる要望に応じて有用なインターフェースを生成できるようになれば、ソフトウェアを固定されたカタログとして分類する必要性は薄れる。必要なものが、あなたに最適化された形で自動的に現れるようになる。
インタフェース・ワールドモデルは、視覚的なアイデアと中間表現の間で変換を行う必要をなくす。UI フレームワークやコンポーネント、コードを通じて作業を進めるのではなく、あらゆる視覚的概念がそのままインタラクティブなインターフェースへと変化する。
店舗のレイアウトはもはや、すべての訪問者が同じものを見る固定された構造ではない。ブランドのアイデンティティを維持しつつ、個々のユーザーに合わせて適応する生成環境へと変わる。商品、レイアウト、色、素材、レコメンデーションが、あなたの意図に応じてリアルタイムで再構成される。これにより、ハイパーパーソナライズされた体験の中でも、ブランドや製品は常に認識可能な状態を保つことができる。
チュートリアルももはや、全員に同じ手順を繰り返すものではない。次なるステップをあなたの現在の文脈に合わせてレンダリングし、進捗に応じて適応し、手順から外れた場合でも自然に回復する仕組みとなる。
インターフェース生成の未来は、画像や動画生成と同じ軌道を描くと予想しています。今後、モデルによる生成はより高速になり、一貫性が高まり、制御性が向上し、能力もさらに強化されていくでしょう。かつては実用性に欠けると見なされていた課題も、今では解決可能なエンジニアリングの問題として捉えられ始めています。
Solaris は当社初の「インターフェース・ワールドモデル」です。生成されたソフトウェアがどのような姿に進化していくか、より豊かなインタラクション、強固な根拠付け、長期間持続する体験、そして現在存在しない全く新しい種類のインターフェースまで、その可能性を探求し続けることにワクワクしています。Solaris の一般公開に向けて主要なパートナー企業と連携して準備を進めており、以下のフォームにご記入いただくことで早期アクセスをリクエストいただけます。
Solaris の早期アクセスをリクエストするには、こちらのフォームにご記入ください
氏名(必須)
ビジネス用メールアドレス(必須)
会社名(必須)
会社の規模(必須)
追加情報
0 / 2000
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み