Fable5とGPT-5.6のNP困難問題比較
本文の状態
日本語全文を表示中
詳細モードで約11分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
著者は未公開の NP ハード最適化問題を用いて Claude Fable 5 と GPT-5.6 Sol を比較し、Fable 5 の圧倒的な性能を確認したが、/goal モードは万能な解決策ではないと結論付けた。
AI深層分析を開く2026年8月5日 16:26
AI深層分析
キーポイント
Claude Fable 5 の圧倒的パフォーマンス
未公開のオペレーションズ・リサーチ問題において、Claude Fable 5 が最も優れた解を生成し、他モデルには見られない高い一貫性を示した。
/goal モードの効果と限界
著者は /goal モードが「もっと頑張れ」というスイッチではなく制御ループや探索経路を変えるものだと分析したが、常に良い結果をもたらすわけではないとした。
KIRO 問題の複雑性
パリ市内の 532 の端末を 11 のハブに割り当てるだけで約 11^532 通りの組み合わせが存在する極めて大規模な探索空間を持つネットワーク設計問題である。
検証データの公開
使用したコード、プロンプト、結果表、除外条件、および探索軌道の詳細は GitHub の CLIArena リポジトリで公開されている。
/goal コマンドの効果はモデルによって異なる
Fable 5 では /goal が平均的にスコアを下げる結果となったが、GPT-5.6 Sol は /goal を使用した際に大幅な改善を示した。
重要な引用
Fable 5 was an absolute beast on this benchmark.
/goal is not a generic try harder switch. It changes the control loop and the search path.
Goal won four of six trials, so win rate alone makes the feature look useful.
The means tell the other half:
編集コメントを表示
編集コメント
これは特定のベンチマークにおけるモデル性能の比較分析であり、業界全体を揺るがす新技術の発表ではない。しかし、複雑な推論タスクにおける各モデルの実力差や機能の限界を理解する上で貴重なデータとなる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
TL;DR: クロードの Fable 5 と GPT-5.6 Sol に、未発表の NP ハード最適化問題を /goal モードあり・なしでそれぞれ解かせました。Fable 5 は圧倒的な強さを見せましたが、/goal が劇的な変化をもたらすわけではありません。

背景: これはハッカソンで学生向けに出題されたオペレーションズ・リサーチの問題です。私は数年前にこの問題を C++ で解くために 1 週間ほど費やしており、人間としての基準値を持っています。
Fable 5 はこのベンチマークにおいて圧倒的な強さを見せました。全体として最良の解を生成し、その一貫性は私がこれまでこの問題で見たどのモデルとも比較になりません。これは純粋な知能の賜物です。驚異的です。
もう一つの結果は、/goal が単なる「もっと頑張れ」という汎用的なスイッチではないということです。それは制御ループと探索経路そのものを変化させます。時にはより良い解の領域に到達できることもあれば、逆に悪いアイデアが育つ時間を無駄にしてしまうこともあります。
すべてのコード、プロンプト、結果表、除外条件、そして軌跡に関するメモは CLIArena にあります。これは私のこのベンチマークに関する最初の論文の続編です。
問題の説明
KIRO は、私が 2018 年に工学学生だった頃に取り組んだファイバーネットワーク設計の問題です。グラノーブル、ニース、パリの有向距離行列が与えられたとき、ソルバーは複数の構造的制約を守りつつ、ループと短いチェーンを使って配分ポイントとターミナルを接続する必要があります。目標となるのはケーブルの総延長で、値が小さいほど優れています。

有効なネットワークは、配分ハブを根とする冗長なループと、そのループ上のタワーから伸びる短い枝で構成されます。各タワーはちょうど 1 回だけ現れなければならず、ケーブルセグメントの向きを変えることでコストが変化します。
探索空間はどれほど大きいのか?
解が使用するループの数やサイズ、枝の固定位置と順序に自由度があるため、単一の閉じた式で総数を数えることはできません。ただし、パリに関するデータだけで有用な下限値を導き出すことができます。
順序や枝の存在を無視し、532 個のターミナルそれぞれを 11 箇所の配分ハブのいずれかに割り当てるだけの場合でも、11^532 通りの組み合わせが存在します。
より厳しい下限値は、意図的に制限された有効解の特定のグループから導き出されます。具体的には、分岐を持たない 28 個のターミナルで構成されるループがちょうど 19 個あるケースです。これにより 19 x 28 = 532 となり、すべての 532 個のターミナルをカバーしつつ、ループごとの 30 個という上限も守られます。
この 532 個のターミナルに順序をつけ、それを 19 の連続するグループに分けます。ただし、ループの集合には順序がないため 19! で割ります。さらに、各ループに対して 11 個あるハブから一つを選ぶ組み合わせも考慮します。
(532! / 19!) x 11^19 ~= 10^1223
検証内容
主な実験はあえて範囲を狭く設定しました。
| 設定 | 値 |
|---|---|
| モデル | Claude Fable 5, Opus 4.8, Sonnet 5; GPT-5.6 Sol, Terra, Luna |
| モード | 通常; ネイティブ /goal |
| 最適化予算 | 30 分 |
| 外側エージェントのタイムアウト | 1,900 秒 |
| 推論 | 各モデルで利用可能な最大設定値 |
| 実行環境 | Harbor 0.1.43, Docker, サブスクリプション認証 |
結果
旗艦モデルのペア比較に集中する前に、スweep 対象となったすべてのモデルについて、ヒントなしで 30 分間実行したペアを 1 つずつ用意しました。Fable と Sol のグラフには、複製されたヘッドラインセットから Pair 1 を使用しています。残りの 4 つのモデルはそれぞれ 1 つずつのペアを使用しています。

その後、Fable 5 と Sol の比較を繰り返して、それぞれについてマッチングされた実行結果を 3 つずつ集めました。

| モデル | 実行 | 通常 | /goal | Goal 差(通常引き算) |
|---|---|---|---|---|
| Fable 5 | 1 | 32,197 | 31,934 | -263 |
| Fable 5 | 2 | 32,516 | 32,324 | -192 |
| Fable 5 | 3 | 32,446 | 35,178 | +2,732 |
| GPT-5.6 Sol | 1 | 33,581 | 39,371 | +5,790 |
| GPT-5.6 Sol | 2 | 35,539 | 32,703 | -2,836 |
| GPT-5.6 Sol | 3 | 33,663 | 33,313 | -350 |
「Negative」は、/goal の方が優れていたことを示します。6 回の試行のうち 4 回で /goal が勝利したため、勝率だけでこの機能が有用であるように見えますが、平均値がもう一方の半分の物語を語っています。
| モデル | 通常平均 | /goal 使用時の平均 | 平均効果 | 中央値効果 |
|---|---|---|---|---|
| Fable 5 | 32,386 | 33,145 | +759 悪化 | -192 改善 |
| GPT-5.6 Sol | 34,261 | 35,129 | +868 悪化 | -350 改善 |
両モデルは通常、わずかな利益を得る一方で、稀に大きな性能低下を被ることがあります。そのため /goal コマンドは多くのランで勝利しましたが、平均スコアについては両モデルとも悪化しました。
Fable は明らかに Sol よりも強力でした。Fable の通常設定の平均点は Sol を 1,875 ポイント上回り、/goal 使用時の平均点でも 1,984 ポイント差をつけました。より重要なのは、Fable の通常設定がわずか 319 ポイントの狭い範囲に収まったのに対し、Sol は 1,958 ポイントにも及ぶ広がりを見せたことです。Fable が /goal を使用した際、最も高いクリーンスコアである 31,934 を記録しました。一方、通常設定が最も安定した構成と言えます。
/goal コマンドの詳細分析
同じコマンドが実装する2つの異なるシステム
Claude Code と Codex はどちらも /goal を公開していますが、その実装は根本的に異なります。

Claude Code: 独立した評価モデル
Claude Code では、/goal はセッションスコープの停止フックとして実装されています。メインモデルの各ターン終了後、デフォルトでは Haiku という小型の評価モデルが条件と会話履歴を読み込み、「Yes」または「No」を理由付きで返します。「No」の場合は次のターンへ進み、「Yes」の場合はゴール達成としてクリアされます。
この評価モデルはツールを使用できず、ファイルも参照できません。トランスクリプト上に現れた証拠のみに基づいて判断を下すため、早期の終了を検知することはできますが、さらに 1,000 万回のソルバー反復を行う価値があるかどうかを判断することはできません。
なお、Claude Code はオープンソースではないため、私たちは Anthropic が公開している情報にのみ依存しています。
Codex: 永続的な状態とライフサイクルツール
また、ベンチマーク対象のリリースである Codex CLI 0.144.4 のソースコードも確認しました。Codex では、ゴールは永続的なスレッド状態として扱われます。
- 作業用モデルは、
create_goal、get_goal、update_goalの各ツールを受け付けます。ツールの仕様
スレッドがアイドル状態になり、ゴールがアクティブな場合、Codex は目的と完了監査を含む継続ターンを注入します。Runtime、prompt
Claude は完了を別のモデルに委譲します。Codex では、作業中のモデルが完了を宣言すると、保存されたゴールがアクティブなまま処理を再開します。Claude の評価者は独立していますが、転記内容しか見ることができません。一方、Codex はファイルやツールを確認できますが、実質的には自分の仕事を自分で採点していることになります。
/goal が多くのケースで勝つ理由と、それでもデフォルト設定として不適切な理由
通常のコーディングタスクでは、進捗が明確に見えます。テストの修正や移行完了など、次のステップで成果が出ることが多いからです。
しかし最適化は異なります。エージェントがソルバーを選んだ後、追加の時間を費やすと、良い判断はさらに強化され、悪い判断は悪化します。
今回のケースもまさにその通りでした。ゴール機能は、Fable が高速なコンパイル済みポートフォリオを維持できた場合や、Sol が成功した連鎖再分割を実行した場合に効果を発揮しました。一方、Fable が低速なソルバーを構築したり、Sol が網羅的なアンカー走査に固執したりした場合は逆効果となりました。
中央値はわずかに正しい方向へ移動しましたが、悪い結果の尾部(ワーストケース)は大幅に誤った方向へと広がりました。
限界について
これは未公開の NP ハードタスクであり、一般的なコーディングリーダーボードではありません。クリーンな対照ペアが3組存在するのは Fable と Sol のみです。他の比較ではプロンプトやラッパーバージョン、時間制限が混在しており、試行はサブスクリプションサービスを通じて順次実行されたため、サービスの性能変動の影響も受けた可能性があります。
コンテナにはタスクメタデータで1つと宣言されていたにもかかわらず8つのCPUが割り当てられており、これが Fable の並列ポートフォリオに有利に働きました。スコアリング対象となった Fable と Sol のすべての出力は有効でした。これはラッパーが早期チェックポイントと最終検証を要求していたためです。
このベンチマークは、モデル、CLI、プロンプト、サブスクリプションサービス、そしてハネス(実行環境)を含む完全なシステムを測定するものです。
再現性について
ベンチマークタスク、ラッパー、分析スクリプト、図生成器、そして完全な証拠メモはすべて CLIArena にあります。ジョブディレクトリはサイズが大きいため Git からは除外されていますが、メモには公開可能なスコア、都市別の内訳、経過時間、戦略、除外条件、および実行 ID がすべて記録されています。
主要なコマンドは以下の通りです。
RUN_ID=article-kiro-YYYYMMDD-clean \
PHASE=nohint-all \
./scripts/run_subscription_article_matrix.sh
uv run python scripts/summarize_subscription_article_results.py RUN_ID...
uv run python scripts/analyze_subscription_article_results.py RUN_ID...結論として「goal」が有益か有害かを headline にするべきではありません。重要なのは、「persistence」という機能が個々の試行では勝つ可能性が高い一方で、観測された平均パフォーマンスを低下させる可能性があるという点です。困難な最適化問題においては、ループ自体の質よりも、そのループ内で何が継続して実行されているかの質の方が重要になります。
AI算出
技術分析ainew評価高い
AI エージェントの挙動を定量的に評価した独自ベンチマーク記事であり、具体的なモデル名(Fable 5, GPT-5.6 Sol)と機能(/goal)を特定しているため検索機会が高い。ただし、対象は世界的な技術検証であり日本固有の事例や規制情報はないため関連性は低め。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み