AI ラボはペリカンマックスしているか
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Simon Willison Blog
Dylan Castillo は AI ラボが意図的にペリカン自転車画像の生成を強化しているという仮説を検証し、8 動物×6 車両の 48 パターンで 7 モデルをテストしたが、その証拠は見つからなかった。
AI深層分析を開く2026年7月28日 22:46
AI深層分析
キーポイント
検証手法と対象モデル
Dylan Castillo は 8 種類の動物と 6 種類の車両を組み合わせた 48 のプロンプトを 7 つの主要モデルで 3 回ずつ実行し、GPT-5.6 Luna や Gemini 3.1 Flash-Lite を用いて結果を評価した。
ペリカン自転車生成の証拠欠如
テスト結果から、AI ラボが意図的にペリカンの自転車描写を強化しているという「pelicanmaxxing」の明確な証拠は見つからなかった。
特定モデルのわずかな傾向
GLM-5.2 が他のモデルに比べてペリカンと自転車の組み合わせでわずかに高いスコアを示したが、その効果は小さく統計的に有意ではないと結論付けられた。
全体的な生成能力の公平性
ペリカンの描写が他の動物より優れておらず、自転車の描写も他の車両より優れていないため、特定の組み合わせに対する特別な学習は確認されなかった。
重要な引用
For the models he tested he could find no evidence of pelimaxxing
The pelicans on bicycles don’t look any better
Labs are not better at drawing pelicans or bicycles
GLM-5.2 comes closest: it has the largest boost on the exact pelican-bicycle cell, but the effect is small and not significant
編集コメントを表示
編集コメント
「ペリカンの自転車」という一見無意味なテーマを、厳密な統計的手法で検証した点は、AI モデルのバイアスや学習傾向を探る上で示唆に富んでいる。しかし、この結果が業界全体を変えるほどの重大な発見とは言い難く、特定のモデルのわずかな差に過ぎないため、実務的な影響は限定的である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
AI ラボは「ペリカン・マキシング」を行っているのか?
Dylan Castillo 氏のこの素晴らしい記事では、私が以前行った 科学的根拠に乏しいベンチマーク への反応として、AI ラボが意図的に「ペリカンが自転車に乗っている画像」を描くようモデルを訓練しているのではないかという、頻繁に議論される疑問について深掘りしています。
私は過去に、他の動物が別の乗り物を乗るテストなどを通じてランダムに検証を試みていましたが、Dylan 氏の手法ほど徹底した調査は行っていませんでした。
Dylan 氏は「8 種類の動物 × 6 種類の車両」の計 48 のプロンプトを用意し、それぞれを 7 つの異なるモデル(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro)で 3 回ずつ実行しました。その後、結果の評価には GPT-5.6 Luna と Gemini 3.1 Flash-Lite を活用しています。
結果を探索するための便利なフィルタ表示があります:

Dylan 氏がテストしたモデルにおいて、「ペリカン・マキシング」の証拠は見つかりませんでした。
- ペリカンの自転車描写が特に優れているわけではない
- ラボはペリカンの描画が得意ではない
- ラボは自転車の描画が得意ではない
- 難易度を調整しても、ペリカンと自転車の組み合わせ描写が得意ではない
- ペリカンと自転車のシーンには記憶された痕跡が見られない […]
ペリカンも、他の動物よりも描画が優れているわけではありません。自転車も、他の乗り物よりも描画が優れているわけではありません。そして、どのラボも、ペリカンと自転車の組み合わせを、それぞれのモデルが既に予測している以上にうまく描き出せてはいません。
GLM-5.2 が最も近い結果を出しています。特に「ペリカンが自転車に乗っている」セルにおける性能向上幅は最大で、その最初の生成サンプルも私の目を引くものでした。しかし、その効果は小さく統計的に有意とは言えないため、過度に重視する必要はありません。
Via Hacker News
Tags: ai, generative-ai, llms, evals, pelican-riding-a-bicycle
AI算出
技術分析ainew評価高い
AI ラボの意図的な学習を検証するための独自の非科学的ベンチマーク(48 プロンプト×7 モデル)を実施し、統計的に有意な証拠がないという具体的な技術的知見を提供している。既存の議論に対する実証データによる反証・分析であり、再現可能な手法と結果が含まれるため技術分析として分類される。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 75
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み