OpenAI チーフサイエンティストが監視不能性を警告
本文の状態
日本語全文を表示中
詳細モードで約24分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Zvi
OpenAI の首席科学者であるヤクブ・パチョッキは、再帰的自己改善とスーパーインテリジェンスの到来が目前にあるとし、現在のアライメント技術や監視手法の限界を指摘して国際的な調整と自動化された研究者への投資を求めている。
AI深層分析を開く2026年9月8日 03:56
AI深層分析
キーポイント
再帰的自己改善とスーパーインテリジェンスの迫り来る現実
パチョッキは内部結果に基づき、数年以内に再帰的自己改善が発生し、人間の知能を超えるシステムが出現すると予測している。
アライメント技術と監視手法の限界
価値のアライメントにおける一般化が根本的な課題であり、現在の Chain of Thought による監視は効果 diminishing を示し、既存のアプローチでは安全を確保できないとしている。
OpenAI の unilateral なスケーリング停止と国際協調の必要性
OpenAI は必要に応じて単独でスケーリングを停止する方針だが、これだけでは不十分であり、国際的な調整による公式な安全基準の強制が不可欠であると主張している。
自動化されたアライメント研究者への依存
最終的な解決策として、自動化されたアライメント研究者(automated alignment researchers)への投資と、能力開発のペース調整を組み合わせる戦略を提唱している。
再帰的自己改善と超知能の近接性
現在のAI開発のペースが続けば、数年以内に同等以上の能力飛躍を遂げるシステムが現れ、自己発展を加速させる可能性がある。
重要な引用
Recursive self-improvement and superintelligence are coming soon.
No one knows how to do this safely, our alignment techniques are inadequate and our monitoring technology is starting to fail.
OpenAI will unilaterally withhold further scaling as needed.
If AI development continues along its current path, the systems we'll see in the next few years are likely to represent further capability jumps of equal or larger magnitude, and to increasingly drive their own development.
編集コメントを表示
編集コメント
OpenAI の首席科学者によるこの警告は、業界の楽観論に対して冷静な警鐘を鳴らす重要なメッセージである。技術的進歩の速度に対する安全対策の遅れが顕在化する中で、国際的な協調体制の構築が喫緊の課題となっている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
OpenAI のチーフサイエンティスト、ヤクブ・パチョッキ氏が、真実を突きつける発言を行いました。
明日は、Astra におけるモニタビリティ(監視可能性)の欠如と、その背景にある要因について議論します。この状況は非常に緊迫しており、あなたを不安にさせるべきものです。漏洩したアーキテクチャの変更をきっかけに一時的には事態がさらに深刻に見えることもありましたが、ヤクブ氏は誤解が生じてモニタビリティにおける最悪の競争(レース・トゥー・ザ・ボトム)に陥るのを防ぐために、急いで対応しました。
目次
優れた警告
技術の分岐点
普遍的な優越は必須ではない
何を、誰のためにアライメントするのか
モニタビリティ
停止しないための理由
次のフロンティアへのペース配分
謝罪の連鎖
内部からの呼び出し
行動こそが語る
優れた警告
ヤクブ・パチョッキ氏は、現在の状況に対する自身の見解を明確にしました。
彼の主要なポイントを、私の言葉で要約すると以下の通りです。
- 人間知能を超える知能は、私たちの人生のうちに現れるだろう。
- 内部の結果に基づき、数年以内に再帰的自己改善(RSI)が起きると予想している。
- その結果に対する備えをしている者はいない。
- OpenAI は必要に応じて、一方的にさらなるスケーリングを停止する方針だ。
- OpenAI 単独では対応できない。正式な安全基準の遵守を強制するためには、国際的な調整を含む広範な介入が必要である。
- 能力の進展は方向付け可能であり、これまでに RSI や「自動化されたアライメント研究者」から遠ざかるのではなく、むしろそれらへと向けて舵が切られてきた。
AI 研究における最大の課題はアライメント(整合性)です。
アライメントには、ゴールアライメント(「AI が目標を達成しようとしているか?」)とバリューアライメント(価値観の整合)の二つがあります。その中で最も重要なのはバリューアライメントです。
AI アライメントの本質的な課題は、価値観の一般化にあります。
彼はアライメント技術として主に二つの方向性を挙げています。一つはゴール指向型強化学習(Goal-oriented RL)、もう一つは事前学習データからの汎化能力を高めるアプローチです。OpenAI はこの両方に巨額の投資を行っています。
特に、Chain of Thought(CoT)モニタリングへの投資は顕著ですが、その効果は次第に低下しています。
今後、AI のスケーリングを正当化する主な理由は、拡張された AI に対するサイバー防御にあるという見方です。
しかし、AI は単なるツールとして留まることはありません。
私たちにできる選択肢は、アライメント研究の加速か、能力のスケーリングを抑制することの二つ。あるいはその両方を実行すべきです。
最終的に彼は、「自動化されたアライメント研究者」の実現に期待を寄せています。
もっと絞り込んで最も重要な点を言えばこうなります。
再帰的自己改善とスーパーインテリジェンスはもうすぐ到来します。これを安全に行う方法を知る者はいません。現在のアライメント技術は不十分であり、モニタリング技術も機能し始めていません。解決策を模索する必要がありますが、そこには自主的なスケーリングの抑制、ペース調整のための協調、そして自動化されたアライメント研究者を含むアライメントへのさらなる投資など、多様な要素の組み合わせが必要となるでしょう。
もし OpenAI のコミュニケーションが、ヤクブ・パチョッキが新論文『An Alien Mind(異星人の心)』で示したような率直なものであれば、同社が信頼できる場所にあると確信できたはずです。
彼は遠回しな言い方はしません。太字は私が付けたものです。
Jakub Pachocki: 2023 年中頃、「RLSlow」という研究プロジェクトの中で、推論モデルのトレーニングをスケールアップできるという確信を与えてくれる最初の結果が得られました。これにより、事前学習済みモデルが自らの思考連鎖(Chain of Thought)を形成する能力が開かれることが示されました。
その夜、私とシモンはオフィスで過ごしました。この技術が生み出す画期的なベンチマークの数値や製品、科学的成果について考えるのではなく、自分たちの生涯の中で実際に人間よりも有意に賢い機械を目の当たりにすることになるという冷徹な事実を受け止めようとしていました。また、これらのシステムの姿がすでに浮かび上がっている中で、その重要性を人々にどう警告すべきかを模索していました。
それから 3 年後、推論言語モデルは経済において急速に成長する一部となり、科学の境界を広げ始めています。彼らはコンピュータやグラフィカルインターフェースを操作し、人間や互いと協力し、研究プロジェクトを実行することが可能です。さらに、コンピューターセキュリティの風景を変革しており、そこには明確な新たな危険も存在します。
この期間に多くの新しい研究が行われ、これらのシステムに対する我々の理解は 2023 年当時とは少し異なっています。内部の結果に基づけば、私はこの進歩の速度が再帰的自己改善へと続く可能性を強く信じています。現在の開発ペースが続くなら、今後数年で見られるシステムはさらに大きな能力飛躍をもたらすものとなり、自らの発展を加速させるようになるでしょう。
AI ラボに所属する人々は現場で起きていることを知り、再帰的自己改善やスーパーインテリジェンスがまもなく到来すると予想しています。彼らはすでにこの点について警告を発し続けてきました。その後の観察結果も、彼らの懸念と一致しています。
これは極めて慎重であるべき時です。機械知能の急速な上昇に伴う結果に対して、誰も準備できていないのではないかと心配しています。OpenAI はアライメントやモニタリングに関する技術的解決策を追求し続け、防御システムの構築を進めるとともに、必要に応じてスケーリングを一方的に抑制していくでしょう。しかし、私はより広範な介入が必要だと考えています。
技術の分岐点について
「AI の能力の方向性を導くことはできない」と言う人々に対し、彼は「できる、少なくともある程度は可能だ」と答えています。そして実際、我々はすでにその道を進んでいます。
私たちは、能力の一般化がどのように行われるか、そして今後数年間で最も重要となるスキルを向上させるために何を優先すべきかを理解することに多くの時間を費やしています。例えば、追加で焦点を当てることでモデルを数学研究に特化して改善できる可能性はあると信じていますが、RSI(自己複製型知的システム)や自動アライメント研究の緊急性から、この方向性を最優先することはありません。これは後ほど詳しく説明します。
選択できる能力があるからといって、それが賢明な選択につながるとは限りません。私は、AI が RSI において劣り、数学研究においては優れていることを望んでいます。あるいはさらに良いのは、医療研究のような分野で優れた成果を上げることです。しかし、競争の圧力は逆に、数学研究での性能低下と RSI における能力向上へと向けています。
RSI と「自動アライメント研究者」が技術ツリー上で非常に類似したポイントに見えることは状況を改善するものではありませんが、OpenAI が RSI から離れようとしているわけではありません。
普遍的な優越性は必須ではない
Jakub はこのような賢明な警告を投げかけています。いいえ、世界を変革したり人類を滅ぼしたりするために、AI がすべての分野でより優秀である必要はありません。最も重要なのは、自分自身をあらゆる面で向上させるために、AI がすべての分野でより優秀である必要がないということです。それは人間や集団がすべての面で均等に優れている必要があるのと同じくらいあり得ないことです。
ディープラーニングの規模拡大によって生じる知能は、人間の知能と直接比較できるものではありません。現実世界で非常に有用であったり、あるいは極めて危険な存在となったりするためには、AI が人間すべての能力に匹敵したり凌駕したりする必要はありません。必要なことは、人間のある程度の能力を凌駕することだけです。そして、AI がより多くの側面で人間を上回るにつれ、その能力の全貌を正確に理解することが次第に困難になっています。
この意見がどれほどの重みを持つのかはわかりませんが、私はヤクブ・パチョッキの主張に同意します。アライメント(整合性)は傍題ではなく、中核的な問題です。「アライメント」を本質的に解決できれば残りの課題は容易くなりますし、そうでなければ残りの課題は不可能になるか、それ以上に悪化するでしょう。
AI 研究における核心的な問題はアライメント、つまり「人間基準で正しいことをしようとするように AI を導くこと」です。
何を、誰のために整合させるのか?
常に問われるべき問いです。これは非常に良い(部分的な)回答です。
実用的な研究の方向性を整理する目的では、「ゴールアライメント」と「バリューアライメント」を区別することが有用だと考えます。
ゴールアライメントとは、広義には「AI が与えられた目標を達成しようとするか?」という問いです。
一方、バリューアライメントはモデルに内在するより本質的な性質です。高レベルの原則セットを保持し、それを一般化して適用する能力であり、不明確または矛盾する指示が下された場合や、見知らぬ環境・敵対的な状況に置かれた際にも「合理的」に行動できることを意味します。アライメントされた AI は、誠実さと信頼性を備え、人類への愛を持って行動すべきです。
長期にわたるアライメント研究の重要性について語る際、私が指しているのは「価値観のアライメント」です。
AI アライメントにおける根本的な課題は、一般化能力にあります。
未来の AI が、人間による監視下にあるかどうかに関わらず、一貫して人間の価値観を保持し続けることが必要です。
私は、価値の本質や「何を重視すべきか」について、十分に深い考察がなされていない現状に懸念を抱いています。誠実さや人類への愛といった徳目は優れた美徳であり、関連する望ましい状態を示唆していますが、最終的に私たちが目指すものを記述するには不十分です。また、特に超知能を伴う状況において、想定外の分布外でも意図した通りに一般化させるための説明としても機能しません。これは私の視点の背景となる重要な文脈であり、ヤクブ氏や彼の記述に対する批判ではありません。
現在、実用的に採用されているアライメント訓練の方法には、主に 2 つの主要なクラスがあります。
1 つ目は、目標指向型強化学習の一部として、アライメントされた行動を促すアプローチです。
…
2 つ目のアプローチは、モデルが事前学習データから一般化する能力を活用しようとするものです。
…
私たちは、これらの方向性が広げるアプローチのスペクトラム全体に、多大な投資を行っています。
また、OpenAI の「道徳的アプローチ(デオンタロジー)」である OpenAI Model Spec と、Anthropic の「徳倫理的アプローチ」である Claude Constitution を区別できていない点も、OpenAI の失敗の表れだと考えています。Jakub は両者を単なる目標の集合として提示していますが、Anthropic が主張するのは、AI の目的は AI の性格そのものを変化させることにあるという点です。
このアプローチこそが、最終的に唯一機能する道だと私は考えます。なぜなら、我々が信頼できるのは、状況を超えてスケールしても安定した「アンチフラジルの同盟者」、つまり「フレンドリーな勾配ハッカー」だからです。実際、人間が堅牢にアラインメントされ、その環境を越えても信頼して使える存在となる道は、この方法以外にはかつてないはずです。
Roon は明確に、「区別はアラインメントにおいてあまり重要ではない」と述べており、根本的な問題は本質的に些細なものであると主張しています。しかし、私はこれに強く反対し、この点では Anthropic のアプローチを支持します。
Jakub は論文の中で Anthropic のアプローチに対して反論し、これを「ペルソナ選択モデル」と捉えています。これは、我々がこのような手法を非常に異なるものとして見ていることを示唆しています。私には、これは単に人格や盆地(ベースライン)を選択しているだけとは見えません。むしろ、新しい何かを彫り上げる行為だと考えています。
Mythos は最近の重要なアラインメント失敗事例において動機付けられた推論を用いましたが、これを徳倫理的アプローチ特有の故障モードと捉えることはできません。むしろ、このアプローチの方が道徳的アプローチよりもこうした問題を回避する能力に優れているはずです。もちろん、既知のすべてのマインドはこのような脆弱性に曝されています。
意味のある進展も確認できます。GPT-6 Astra は、長年取り組んできた重要な技術的進歩の恩恵を受けた最初のモデルであり、GPT-5.6 Sol と比較してはるかにアライメント(目標との整合性)が改善されています。
この記述の中で私が違和感を覚えるのは「Astra が Sol よりも『より良くアライメントされている』」という主張です。これは水曜日に詳しく取り上げますが、部分的には正しい場合もある一方、そうでない側面もあるかもしれません。こうした表現は、「一般的なタスクで整合性のない行動が約 50% 減少している」といったように、もう少し具体的であるべきでしょう。
モニタビリティ(監視可能性)
一般化の問題やその他の課題において鍵となるのが「モニタビリティ」です。これは明日の投稿で詳しく論じるテーマですが、まずは Jakub の発言を引用します。
OpenAI がここで賭けている主要な戦略は、思考連鎖(Chain-of-Thought: CoT)の監視です。
このツールは Astra クラスのモデルを研究する上で引き続き極めて重要ですが、残念ながら評価結果から、CoT 監視に依存できる能力が徐々に低下していることが示されています。その背景には複数の要因が絡み合っています。
現代の推論モデルは、o1-preview よりも複雑な環境で使用されており、その推論プロセスは人間や他の AI との対話、ツールの利用と混在するようになっています。これらの相互作用の多くを監視する必要があり、結果として、維持しようとする境界線が曖昧になってしまっています。
AI は自身の推論プロセスについて推論し、それを操作する能力も向上しています。
事前学習性能の向上に伴い、言語化された推論プロセスを使わなくても、モデル自体がはるかに賢くなっていることが見て取れます。
これらの課題は必ずしも克服不可能なものではありません。モデルの思考連鎖(Chain-of-Thought)の監視可能性を高めるための介入策を開発できることに希望を抱いています。具体的には、異なる最適化目標と、モデルが推論時に使用する計算資源との相互作用について、より深い理解を深めることが有効です。
また、思考連鎖(CoT)のアイデアと活性化モニタリングの手法を組み合わせる価値も大きいと考えます。ネットワーク内部に直接アクセスできる監視器のトレーニングを拡張し、例えば「告白」のような現象を利用するアプローチです。私たちは現在、これらのアイデアを実践的に追求しています。それでも、一般 AI の進展は、監視への信頼性によって次第にボトルネックに直面すると予想されます。
この記述では、重要と思われる他の潜在的な要因については言及されていません。それらを否定しているわけでもありません。アーキテクチャの変更や再帰的な深さについても、性能向上という形で間接的に示されている以外は触れられていません。また、思考連鎖(CoT)の監視が現在ではトレーニングデータ全体に広がっていることにも言及していません。ただし、時間とともに CoT に対して圧力をかけ続けているという含意はあります。トレーニング環境の変化や、その頻度・強度についても言及されていません。
「AI が自身の推論プロセスを操作する能力が高まっている」という箇条書きの起源について、「追い回されているような」不自然さを感じます。
究極的な結論として、この分野における監視可能性の維持に投資することで、思考連鎖(CoT)の監視可能性を長く持続できる可能性がある点については、ジャクブ・パチョッキは多くの他の人々よりも楽観的であると言えます。
停止しないためのケース
次のセクション「スケーラブルな防御」において、ヤクブ・パチョッキは、AI による脅威、特にサイバー攻撃に対処するためには、AI のスケーリングを継続して進める必要があると主張しています。
しかし、彼は同時に、それが無謀さへの言い訳になるべきではないとも述べています。予測される広範な AI 進展に伴う不確実性や防御システムの構築の必要性があるとしても、それらを理由に無謀な行動をとってよいわけではありません。リスクの重大さを真に理解すれば、「どんな犠牲を払っても突き進む」という発想は荒唐無稽なものに思えてくるはずです。
次のフロンティアへのペース配分
したがって、次節では RSI(再帰的自己改善)のペース配分について議論します。
ヤクブ・パチョッキは明確にこう述べています。アライメント(目標整合性)や監視可能性が改善されない限り、誰しもが最大速度でのスケーリングを長く継続することは責任ある行為ではないと。私も強く同意します。
機械知能が自らの開発プロセスにおいてますます大きな役割を果たすことは、技術の持続的な進展に対する自然な帰結です。AI の進展が続くならば、機械による再帰的自己改善(RSI)は将来の科学発見の中核となるでしょう。
また彼は、引用を繰り返して明確に述べています。OpenAI は必要に応じて自発的にスケーリングを遅らせるが、他社が引き続き進める場合は不十分だと。
OpenAI はアライメントと監視のための技術的解決策の追求を続け、防御システムの構築を進めるとともに、必要に応じて単独でさらなるスケーリングを見送る方針です。しかし、より広範な介入が必要であると私は考えています。
これは、OpenAI のデフォルト方針とは対照的です。同社は RSI(自己再帰的知能)に向かって急速に進むことを目指しており、他の主要な研究機関も同じ方針を採用しています。
自動化された AI 研究は、計算資源を活用して知能を拡張するより劇的な形態です。当然のことながら、AI はその基盤となる計算環境自体の改善にも寄与します。スケーリングと同様に、OpenAI の研究は RSI に焦点を当てています。なぜなら、これが将来も AI 研究の最前線に留まるための唯一の方法だと信じているからです。
ここで強調しておきたいのは、上記の発言が「深層学習の研究、特に短期的には、その加速こそが研究コミュニティとして取るべき集団的行動である」という私の考えを意味するわけではないということです。しかし、現在の道筋がどこに向かっているかは明白であり、私たちは今後どう進むかについて意識的な選択をする必要があります。
私たちが利用可能な主な手段は二つです。一つは、AI と並行してアライメント(目標整合性)とモニタリングを強化し、人間をループに組み込む方法を模索すること。もう一つは、これらの対策への信頼を築くために、必要に応じて将来の開発を調整して速度を落とすことです。
現時点で私が考える最善の道筋は、この二つを組み合わせたアプローチです。
抽象的なレベルで言えば、アライメントを加速するか、能力開発を遅らせるか、あるいはその両方を行うかの選択肢があります。正解は「両方」であるように思えます。なぜなら、アライメントだけを加速させるだけでは不十分だからです。
この論文では、第三者による強制が唯一の実現可能な道筋であると提唱しています。
AI システムの拡張は、安全性への信頼によって制約されるべきです。準備状況フレームワークや責任あるスケーリングポリシーのようなコミットメントを進化させ、開発を継続するための広く義務付けられた安全基準として確立する必要があります。これらは、サードパーティの監査機関、政府機関、あるいは国際機関によるネットワークによって執行可能です。
誰も拡張の準備ができていないため、私たちに選択肢はほとんど残されていません。
現在、どのラボもアライメントとモニタリングを十分に解決しておらず、最大速度で責任を持ってスケーリングを続けるには至っていないと考えています。共有された安全基準が確立されるまで、自発的なスローダウンが一般的になることを期待し、願っています。また、今後の AI 開発における国際的な調整は、世界各国の政府にとって最優先事項となるべきだと考えています。
Mea Culpa Cascade(謝罪の連鎖)
最近、「An Alien Mind」やディーン・ボール氏の自らの抑制を認めた発言など、誤りを認め、抑制していたことを告白し、警鐘を鳴らすという同様の事例が急増しています。
このセクションでは、ディーン・ボール氏の投稿に対する反応の例をいくつか紹介します。他の皆さんにもこの連鎖に参加し、継続していただくよう呼びかけます。これを認めるのに最適なタイミングは、今しかありません。
これは OpenAI や Anthropic で働いているかどうかに関わらず、すべての人に当てはまります。
セス・ラザール:この発言がどれだけ有益かはわかりませんが、私は以前、「懐疑派」の陣営で比較的目立つ役割を果たしていました。現在、副題に「権力、正義、そして AI」と付いた著書を刊行中です。私はこれまで、AI と権力の関係や、テクノロジー産業としての AI の政治経済に伴う具体的な現代的なリスクについて多くを執筆してきました。
GPT-4 登場以降、一貫して繰り返される証拠が示しているのは、2022 年頃には @ajeya_cotra(および多くの他の研究者)が正しく、私のような人々が誤っていたという点です。当時の私は AI による制御喪失リスクについて、@AmandaAskell と Twitter で長期間にわたる議論を交わしましたが、その評価は後から覆されました。現在では、制御喪失のリスクがより現実的かつ高まっているという証拠も蓄積されています。
結果の深刻さについては依然として見解の相違があります。私は人類絶滅が真剣な脅威であるとはまだ考えていません。しかし、これはすでに議論の細部における違いに過ぎません。つまり、強力な AI が社会規模の壊滅的惨事をもたらすのか、それとも人類絶滅に至るのかという点です。実はそれほど重要ではないかもしれません。どちらにせよ、どちらも非常に悲惨な事態だからです。私が後者(人類絶滅)について懐疑的な理由は、主に人間の回復力に対する先験的な確信に基づくものであり、技術的な予測ではありません。
証拠が予想外のものである場合、見解を変えるのは問題ありません。驚くこと自体も許されます。今の世界は非常に驚きに満ちています。
この投稿における「AI リスクを軽視する議論」に関する私の見解について、補足させていただきます。私は専門家ではありませんが、元・合理主義者としての経験を持つ非専門家の立場から、AI リスクに対して極めて強い懸念と悲観的な見方を抱いています。
これまで直接的にこの話題に触れてこなかったのは、正直なところ自分の健康を守るためでした。不必要に人々を不安にさせたくありませんでしたし、ここ数年は「デフォルトの整列(アライメント)」という漠然としたアイデア、具体的には「人格選択を通じて AI に『イエス・キリストならどうするか』と自問させる」といったアプローチで対処してきました。しかし、Hugging Face のハッキング事件を機に、この考え方はもはや現実的ではないと確信しました。
これは実際に起こりつつあります。私たちは特異点のふもとにいるのです。AI は通常の技術とは異なり、未来は過去のようなものにはなりません。これに対して何をすべきか私にもわかりませんし、他の誰かがわかっているとも思えません。もしこの記事を読む方にとって重要であれば付け加えますが、私がこれらの主張をしていることに金銭的な動機は一切ありません。
Alex Turner 氏は「Alien Mind」の後に AI の一時停止を支持し、研究機関に対して自主的にそのよう行動するよう呼びかけました。
たとえ自らの過ちを認める(mea culpa)文脈でなくても、より多くの人々がこうしたことを明確に述べるようになったことは良いことです。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み