中国のLLMにおいて蒸留は本当に重要なのか?
本文の状態
日本語全文を表示中
詳細モードで約15分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Interconnects
記事は、強力なモデルの出力で弱モデルを学習する「蒸留」が米中AI競争で頻繁に議論されていると指摘。専門的な知識蒸留の定義を確認し、中国の大規模言語モデル開発においてこの手法がどの程度重要かを考察する。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
蒸留は、米中および AI の技術拡散に関するより広範な物語において、最も頻繁に議論されるトピックの一つとなっています。蒸留という用語には多くの定義がありますが、今日一般的な意味では、強力な AI モデルの出力を用いて、より弱いモデルを訓練することを指します。この言葉自体は、知識蒸留(Hinton, Vinyals, & Dean 2015)というより技術的かつ具体的な定義に由来しており、これは教師モデルの確率分布を一致させるように学習する特定の方法を伴うものです。
今日の蒸留は、一般的には合成データとしてより適切に説明できます。強力なモデルからの出力(通常は API を経由して取得)を取り、その出力を予測するようにモデルを訓練します。知識蒸留の技術的な形式は、API モデルからは実際には不可能です。なぜなら、それらはユーザーに対して必要な情報を公開していないからです。
合成データは、今日 AI 研究者が日常的にモデルを改善するために使用する単一で最も有用な方法と言えるでしょう。もちろん、アーキテクチャは重要であり、一部のデータには依然として人間の入力が必要であり、スケール可能な検証可能な報酬を用いた強化学習のような新しいアイデアが業界を変革する可能性もありますが、今日モデルを改善する日々の生活の多くは、合成データをどのように適切に捕捉し、スケーリングするかを見極めることにあります。
この記事の冒頭から示された点を具体化するために、繰り返し主張されているのは、中国の主要なラボが自社のモデルに蒸留(distillation)を活用し、米国の最上位 API ベースの競合他社から能力を盗んでいるという点です。これまでに最も注目された事例は、DeepSeek R1 のリリースを巡るものであり、OpenAI は DeepSeek が API をハッキングして推論トレース(reasoning traces)を盗んだと非難しました(デフォルトでは公開されていません。文脈として、推論トレースとは、オープンウェイトの推論モデルがユーザーに公開する内部推論プロセスなどを指す慣用的な用語です)。蒸留への恐怖は、Gemini が推論トレースをユーザーに公開することから隠すことに急転した理由でもあったでしょう。Gemini に基づいて構築された非常に注目度の高い初期の推論研究さえ存在しました!
これらすべてが、今日のニュースへと繋がります。Anthropic は中国の複数のラボに対して、Claude モデルに対する精巧な蒸留キャンペーンを執り行ったと名指しで直接非難しました。これは複雑な問題です。本稿では一連の問いを解き明かします。影響から始まり、政治に至るまでです。核心的な問いは、米国のモデルからの蒸留によって中国のラボがどの程度の性能向上を得ているのかという点です。
Interconnects AI は読者支援型の出版物です。購読をご検討ください。
まず、Anthropic が共有した内容を振り返りましょう。ブログ記事より、強調部分は私によるものです:
私たちは、DeepSeek、Moonshot、MiniMax の 3 つの AI ラボが、自社のモデルを改善するために Claude の能力を不正に抽出する産業規模のキャンペーンを実行していることを特定しました。これらのラボは、約 24,000 の不正なアカウントを通じて Claude と 1600 万回以上のやり取りを行い、利用規約および地域アクセス制限に違反しました。
これらのラボは「蒸留(distillation)」と呼ばれる手法を使用しました。これは、より能力の低いモデルを、より強力なモデルの出力に対して訓練する技術です。蒸留は広く使用されており正当なトレーニング方法の一つです。例えば、最先端 AI ラボは顧客向けにより小さく安価なバージョンを作成するために、自社のモデルを定期的に蒸留しています。しかし、蒸留は不正目的にも利用され得ます。競合他社はこれを利用して、独自に開発する場合に必要な時間やコストのほんの一部で、他のラボから強力な能力を獲得することができます。
モデルそのものと同様に、蒸留(distillation)の恩恵も非常にばらつきがあります。特定の能力においては、特にそれに対応する完全なトレーニングパイプラインが整っていない場合、その分野で最先端のモデルからデータを迅速に蒸留することで、劇的な性能向上をもたらすことがあります。これにより、API から蒸行を行うラボが、そうでない場合に比べてはるかに速く追いつく手助けを確実にします。多くの蒸行は比較的穏やかで、LLM の多数のトークンを用いて既存データを処理・洗練させることに用いられ、少数の高品質なトレーニングトークンを得るために大量の計算リソースを投入するものです。このような生データ処理作業は様々な API で実施可能ですが、一つの API が最も優れている傾向があります。
Anthropic が中国の LLM 構築者 3 社が実際に Claude API を何のために使用したかを述べている内容について触れると(余談ですが、Anthropic は攻撃が API を通じて行われたのか、チャットアプリ経由なのか、それとも Claude Code 経由なのかは確認していません)、これらの操作の実際の影響は非常に混在しています。これらのラボが他のプロジェクトや他の米国製モデルのために追跡されていない利用をどの程度展開したかを知ることは困難です。
まず、Anthropic はブログ記事で DeepSeek を最初に挙げています。これは中国 AI において米国で最も知られた名前であるためです。その使用範囲は実際には非常に小さく、この投稿が詳細よりも大局的な視点に焦点を当てていることがわかります:
DeepSeek
規模:150,000 回以上のやり取り
対象となった操作:
多様なタスクにおける推論能力
Claude が強化学習のための報酬モデルとして機能するためのルブリックに基づく評価タスク
ポリシーに敏感なクエリに対する検閲回避の代替案作成
言語モデルのトレーニング規模において、150K のサンプルは実質的な実験としてはまだ表面をなぞっている程度に過ぎません。彼らは何らかのルブリック(評価基準)を実験していたようですが、これはオンライン RL 実行のためのものであった可能性があります。しかし、アクセスが極めて分散されていたことを考えると、それは非常に unlikely です。また、敏感なクエリに対する補完処理に関するいくつかの小さな事柄も含まれていました。Anthropic の API を使用したこの利用は、DeepSeek の長年噂されている V4 モデル(あるいはここで提供されたデータが貢献したとされるいずれかのモデル)に対して、無視できるほどの影響しか与えないでしょう。また、これはおそらく DeepSeek 内の小規模チームによるものであり、より広範なトレーニング組織の多くには知られていなかった可能性が高いです。
残りの2つのラボ、Moonshot AI(Kimi モデルの開発元)と MiniMax は、はるかに広範な利用を示していました。
Moonshot AI
規模:340 万を超えるやり取り
対象となった運用:
エージェント推論およびツール使用
コーディングおよびデータ分析
コンピュータ使用型エージェント開発
コンピュータビジョン
MiniMax
規模:1300 万を超えるやり取り
対象となった運用:
エージェントコーディング
ツールの使用とオーケストレーション
蒸留の役割は絶えず変化しています。今日の Claude からそのエージェントとしての振る舞いを蒸留することは、過去に教師として機能してきた Claude のバージョンよりもはるかに価値があります。Claude Opus 4.6 は、他のどのモデルも完全に匹敵しない、バランスの取れたエージェントナビゲーションを備えています。なぜ、モデル出力の一部をトレーニングデータとして使用し、自社のモデルがそれを吸収できるか試してみないのでしょうか?今後数ヶ月で、この差別化は薄れていくでしょう。まるですべてのモデルが今日では数学においてほとんどの人が必要とする以上に優れているようなものであり、蒸留の源となる場所は山ほどあります。
見積もりにはばらつきがありますが、各レスポンスが 1 回のやり取りあたり 10,000〜25,000 トークンであったと仮定すると、この 2 つの研究機関(主に MiniMax と連携)全体での総トークン数は 1,500 億〜4,000 億トークンに達します。これは非常に大量のデータであり、モデルのポストトレーニングにおいて意味のある改善をもたらす可能性があります。例えば、Olmo 3 では、同様の方法で構築された 200 億トークンの SFT(Supervised Fine-Tuning: 教師あり微調整)データセットが存在しましたが、それを 10 倍に増やすことは非常に妥当な施策となります。
これらの数字は、米国の企業がホストする API を通じた合成データ生成の全体像のごく一部に過ぎません。同時に、数量は影響を測る非常に粗い指標です。Claude の出力を取得し、それをモデルパイプラインに追加する方法を考えることさえ容易ではありません。研究コミュニティでは、特定の教師モデルからの出力を取得した結果、予期せぬ形で学生モデルのパフォーマンスが低下する事例が数多く報告されています。データ間の微妙な相互作用により、この種の知識蒸留は可変的で困難を伴います。これは本質的に研究課題です。
これが中国のラボで革新が行われている領域です。中国のフロンティアラボは西側の競合他社よりも大幅に効率的であるという主張がありますが、これは誤解を招くものです。
各ラボが直面する制約は異なります。中国のラボはリソースが限られているためやむを得ずわずかに効率的になっている可能性がありますが、人材へのアクセスに関する全体的な状況は非常に似ています。また、中国のラボはベンチマークに対するアプローチが異なり、実際よりも近い位置にあるように見せかけ(さらには潜在的に凌駕しているかのように見せる)ことで、AI 市場での勢いとブランド認知度を獲得しようとしています。
中国のラボは、GPU へのアクセス制限があるため、主要な API モデルからの知識蒸留において大きな革新を遂げている可能性があります。GPU は合成データの構築に使用できますが、研究計算資源に対する支出よりも資金力がありながら供給制約に直面している組織にとっては、API ベースのモデルを利用することが、より多くの計算リソースを実効的に獲得するための数少ない選択肢の一つです。「禁止された」API モデルへのアクセスを得る方法を考えることは、数万台の物理 GPU を密輸してセットアップするよりもはるかに容易です。
このような運用を行うのは中国のラボだけではありません。所有していないモデルからの合成データは、すべてが知識蒸留とみなすことができます。知識蒸留は、誰にとってもより多くの計算リソースを得るための近道です。また、研究用の大規模クラスターを構築するには巨額の資金コミットメントが必要となる一方、API は従量課金制であるため、リスクの低いコストで済みます。例えば、Olmo 3 では合成データのために Frontier スーパーコンピュータ上で数百万 GPU 時間と、NAIRR を通じた Azure クレジットを使用しました。GPU の同等物(あるいは現金)は持っていませんでした(研究クレジットのおかげです!)。
これらを総合すると、Anthropic がこれを懸念するのは非常に妥当なことです。しかし、依然として中国のラボのポストトレーニング能力においてこれが決定的要因であるとは言い切れません。特に、米中のパフォーマンス格差のように、蒸留元のモデルに追いつくまでの時間差で測定しやすい要因でもないでしょう。
一歩引いて考えてみると、Claude Sonnet が Opus よりもフラッグシップモデルだった時期さえありました(おそらく Sonnet 3.5 の頃でしょうか)。この多くは、Opus のチェックポイントから内部でよく蒸留されたことによるものです。迅速な反復と高品質なデータは非常に大きな効果を持ち、生徒モデルが教師モデルを上回ることも可能になります。最先端研究所はこの点を有利に利用し、合成データの生成には社内限定モデルを使用していますが、「中国のモデルはデータ蒸留のために米国の最先端を越えることができない」と言うのは、Claude Sonnet が Opus に勝つことが決してないと言うのと同じです。それは unlikely であり、リリース時期にも大きく依存しますが、AI モデルが劇的な進歩を遂げる中で、このような奇妙な出来事が実際に起こり得るのです。
ここで未解決の最大の要因は、最良モデルを訓練するために大規模な強化学習(RL)が必要となる時代において、より強力な教師モデルからの蒸留が困難であるという点です。プロンプトを注意深く作成・フィルタリングするために計算リソースを費やすことはできますが、それでも実質的なオンポリシー推論(on-policy inference)を用いて自らモデルを訓練する必要があります。生成は RL における計算コストの大部分を占めており、それは他のモデルからの生成では代用できません。このため、私はこの話題が少し沈静化するだろうと予想していました。しかし、彼らの公開研究から明らかなように、中国の研究所は計算リソースの不足にもかかわらず、優れた強化学習インフラストラクチャを持っています。
私がこれが薄れていくと予想した理由は、モデルの蒸留を「競争目的」で行うことが許可されていないことが、API モデルの利用規約に違反している状態がかなり前から続いているからです。米国の研究者やオープンモデル開発者は以前、これについて非常に懸念し議論していました(私は 2022 年と 2023 年に何度もこの点について執筆しています)。しかし、コミュニティにおけるその懸念が収まったのは 2024 年後半になってからであり、小規模なモデル開発者に対する何らかの措置が取られたわけではありません。
Anthropic の今回の行動は、AI を巡る地政学的緊張をさらに高めるための継続的な一歩を表しています。モデル蒸留を制限することは、GPU などの物理製品の輸出を規制するよりもはるかに困難です。多くの点で、分散アクセス手法を通じて蒸留を完全に制限するのはほぼ不可能に思え、GPU の販売を制限する方がはるかに大きな影響を与えるでしょう。
Anthropic と AI 業界は、戦うべき戦場を選ぶ必要があります。最良のモデルに対する API エンドポイントが利用可能になれば、他の組織はその情報を利用して当該モデルの変種を訓練します。これは AI モデルにおける自然な進化です。もし AI モデルがあまりにも貴重で、蒸留(distillation)が極端なリスクとなるなら、そのモデルはファーストパーティ製品に限定されることになります。Anthropic は最新のモデルにおいてこの道を選ぶ選択肢を持っています。API ベースのモデル代替品市場は競争が激しく、一部の企業はこの道を進む可能性があります — 中国製モデルによる価格破壊の影響も一部あるでしょう — しかし、API は主要なラボがすぐに撤回するリスクを負うような基本的な提供物です。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み