AI モデルが知能テストで失敗、人間はもっとできるか
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MIT Technology Review AI
MIT Technology Review は、AI モデルが論理パズルや視覚的推論において依然として人間に劣る点を検証し、空間認識能力の欠如や学習データの過剰適応という技術的弱点を浮き彫りにした。
AI深層分析を開く2026年8月26日 18:26
AI深層分析
キーポイント
AI のパズル解決能力の急激な進展と限界
2024 年末から 2025 年初頭にかけて AI モデルの Connections パズル解決率が劇的に向上したが、微妙な文脈の変化や視覚的課題では依然として失敗する。
空間推論における人間の圧倒的優位性
LLM は視覚入力を分析できるが、3D 物体の回転や物理環境の理解において建築家や機械エンジニアのような空間思考能力を欠き、IQ テストのメンタルローテーション問題で著しく失敗する。
記憶と適応性のジレンマ
大規模なトレーニングデータによる卓越した記憶力は強みとなる一方、類似したパズルを学習済みの場合、モデルは微妙な違いを見落とし、記憶した回答をそのまま出力する傾向がある。
Knights and Knaves と SimpleBench の類似性
Google とイリノイ大学アーバナ・シャンペーン校の研究者による2024年の研究では、モデルが「騎士と偽善者」パズルの微妙な変種で失敗することが示された。同様の原理がSimpleBenchテストにも適用され、人間はトリックに気づくがトップクラスのモデルもつまずく。
ARC-AGIにおける抽象的推論の限界
AIは3Dだけでなく2次元の視覚問題でも失敗し、ARC-AGIのような抽象的な一般化ルールを推論する課題で苦戦する。モデルが正解しても人間とは異なる複雑で汎用性の低い規則を使用している可能性があり、一部の難問では依然として手詰まりとなる。
重要な引用
In late 2024, a team of scientists from Columbia University showed that even the best models could figure out only 18% of the infamous New York Times Connections puzzles; by early 2025, some models could solve them near perfectly every time.
Though today's language models typically have the ability to analyze visual inputs, they still fail abysmally at these puzzles.
When a puzzle closely resembles one a model saw during training, the model may whiz by key differences and respond with what it memorized.
Humans spot the trick, but even top-tier models trip.
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
パズルやゲームは、AI 開発の黎明期から中心的な役割を果たしてきました。私たちがクロスワードや論理クイズで知能を試すように、開発者たちはゲームを通じてモデルの進化度を測ることができます。「機械学習」という用語が広まったのは、IBM のアーサー・サミュエル博士がチェッカーをプレイするアルゴリズムについて 1959 年に発表した記事によるものです。また、チェスや中国のボードゲーム「囲碁(Go)」も、AI テストの場として有名です。
パズル解決能力という点だけで見れば、AI の進化は著しく、かつ急速に進んでいます。2024 年後半にはコロンビア大学の科学者チームが、最良のモデルでも有名なニューヨーク・タイムズの「Connections」パズルのうち 18% しか解けないことを示しました。しかし 2025 年初頭には、一部のモデルはほぼ完璧に毎回これを解決できるようになっています。
しかし、パズルは単に AI の能力が不可避的に向上していることを示すだけではありません。モデルがどこで成功し、どこで失敗するか、そして人間がいまだにそれを上回っているのかを知ることは、その技術の強みと弱みを理解する有用な窓となります。進歩があるにもかかわらず、今日のモデルはいまだに迷走しています。古典的ななぞなぞにおける微妙な変化につまずくことが多く、視覚パズルは特に弱点となっています。
ここでは、これまで AI モデルを悩ませてきたパズルに挑戦する機会があります。中には、AI にとって難しかったのと同じくらいあなたにとっても難しいものもあるでしょうし、逆にあまりにも簡単すぎて「本当に AI は知能を持っているのか?」と疑いたくなるようなものもあります。それぞれのパズルは、機械と人間の認知プロセスの違いを少なくとも一つずつ浮き彫りにするものです。もしあなたがこのテストで満点を取れば、少なくとも現時点では AI よりもパズルに強いことを証明したことになります。
空間推論
まず、人間が圧倒的に有利な領域から始めましょう:空間推論です。IQ テストを受けたことがあるなら、おそらく「心的回転」の問題に出会ったことがあるでしょう。この種のパズルは、異なる画像が同じ物体を別の角度から見たものかどうかを判断するものです。今日の言語モデルには視覚入力を分析する能力があると言われていますが、こうした問題では依然として惨憺たる結果に終わります。「世界モデル」が AI に物理環境の理解をもたらすという話が多く聞かれる一方で、LLM(大規模言語モデル)は、建築家や機械エンジニアといった空間思考を持つ人間のように 3D オブジェクトを操作する能力はまだ備えていません。
心的回転
手順:プロンプトにある物体を示しているが、異なる角度から見た答えを選んでください。各ケースには正解は一つだけです!
記憶と適応性
最先端の大規模言語モデル(LLM)は驚異的な記憶力を備えています。学習時に莫大な量の事実を処理しているため、その多くを忠実に再現できるのです。これはクイズで人間と競う際の強力な武器ですが、裏目に出ることもあります。
もし問題が学習中にモデルが見たパズルに酷似していた場合、モデルは重要な違いを見逃し、記憶した答えをそのまま出力してしまう可能性があります。
2024 年の研究では、Google とイリノイ大学アーバナ・シャンペーン校の研究者たちが、「騎士と嘘つき」と呼ばれる古典的なパズルのわずかなバリエーションを用いてモデルの訓練とテストを行いました。この問題では、登場人物の一部は常に真実を語り、他方は常に嘘をつきます。誰がどちらなのかを見極める必要があります。
「SimpleBench」というテストでも同様の原理が働いている可能性があります。ここでの質問は、モデルが学習中に遭遇した可能性が高いより複雑な問題に似ています。人間ならトリックに気づくのですが、トップクラスのモデルでさえつまずいてしまいます。
騎士と嘘つき
指示: このパズルを解くために必要な知識はただ一つ。「騎士は常に真実を語り、嘘つきは常に嘘をつく」というルールです。各キャラクターの発言に基づき、誰がどちらなのかを判断してください。
SimpleBench
指示: 以下の SimpleBench の問題を注意深く読み解けば、すぐに答えにたどり着けるはずです。
抽象的・視覚的推論
AI は 3D の視覚問題でつまずくだけでなく、2 次元の問題でも失敗することがあります。これが、最も有名なパズルベースのベンチマークである ARC-AGI においてモデルがどの程度うまく機能するかを決定する主要な要因の一つです。これらの問題は、一連の例から抽象的で一般的なルールを推論することを要求します。各グリッドを画像としてではなく、各セルの色を表す数値の文字列として与えられると、モデルは ARC パズルでより良い結果を出します。
研究によると、モデルが ARC-AGI の質問に正解したとしても、その多くは複雑で一般化できないルールを用いており、人間は単純な視覚概念に基づいていることが示されています。これらの不利な点にもかかわらず、過去 1 年間でモデルは ARC-AGI でかなり上達しましたが、ここに印刷されているような一部のパズルでは依然として手こずっています。
ARC-AGI
指示:以下の 3 ペアのグリッドを研究し、左側のものが右側に変換されるルールを見つけ出してください。その後、マーカーや色鉛筆を用意して、そのルールに従って第 4 のグリッドを塗りつぶしてください。(グリッドの向きがどうであれ、答えは同じです。)
直感
AI モデルが罠に陥るだけでなく、私たち人間にも独自の認知の癖があり、多くの場合 AI はそれを共有していません。心理学者たちは「SimpleBench」現象を逆転させた問題セットを設計しました。これらの問いに対しては、人間は反射的な答えを返しがちですが、モデルはより慎重な回答を示すのです。
一部の問題は、私たちが直感的に数学を行う際の誤りを突くように作られており、他の問題は注意深く読み解かないと崩れてしまうような「明らかな答え」を誘導する形で構成されています。
ライトニングラウンド
指示: 以下の質問にできるだけ速く答えてください。
#### 複雑さの増加
場合によっては、LLM がパズルを解決できるかどうかは規模の問題になります。Apple の研究者によるある研究では、LLM は「ハノイの塔」問題の簡単なバージョンや、一定のルールに従って人々が川を渡る必要がある「川渡りパズル」を完璧に解くことができることが示されました。ハノイの塔では、ディスクを一枚ずつ移動し、大きなディスクを小さなディスクの上に重ねてはいけません。しかし、その限界は明確です。ディスクや人の数が 6 つ以上になると、モデルは徐々に答えられなくなりました。
ワシントン大学、スタンフォード大学、アレンAI研究所の研究者らは別の研究で、LLM(大規模言語モデル)がロジックグリッドパズルでも同様に苦戦することを観察しました。このパズルでは、与えられた手がかりから一連の人物の属性を推論する必要があります。
アップルの論文は話題となりましたが、評論家たちはその結果がLLMの推論における独自の限界を示しているのか、それとも複雑さが増すにつれてエラーが発生するのは当然のことなのかについて疑問を呈しました。
川渡りの課題
指示:提供されたシナリオに基づき、全員を川を渡るために必要な移動計画を立ててください。
ロジックグリッドの課題
指示:与えられた手がかりリストを用いて、各住居に誰が住み、それぞれの人がどのような音楽を楽しんでいるかを特定してください。解は一つしか存在しません。推論を追跡するために、以下のグリッドを埋めるのが役立つでしょう。
グレイス・ハッキンズ氏はMITテクノロジーレビューのAI担当記者です。神経科学の博士号を取得しています。
クレジット:
メンタルローテーション:CC BY 4.0。Stogiannidis, Ilias、Steven McDonagh、Sotirios A. Tsaftaris。「Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models」(著作権 2025 年);イラストは John MacNeill によるもの。
騎士と嘘つき:Dan MacKinnon の許可によるもの。
Simplebench:CC BY 4.0。SimpleBench チーム。「The Text Benchmark in which Unspecialized Human Performance Exceeds that of Current Frontier Models」(著作権 2024 年)。
ARC-AGI:ARC Prize Foundation より提供。
ライトニングラウンド:CC BY 4.0。Hagendorff, Thilo、Sarah Fabi、Michal Kosinski。「Human-like intuitive behavior and reasoning biases emerged in large language models but disappeared in ChatGPT」。Nat Comput Sci 3、833–838(著作権 2023 年)。
川の問題:『Propositiones ad Acuendos Juvenes』より改変。ヨークのアルクィン(西暦 800 年頃)によるもの。
ロジックグリッド:Apache License 2.0。Lin, Bill Y., Ronan Le Bras, Kyle Richardson、他。「ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning」(著作権 2025 年)。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み