動画記事 · AI Engineer
AI エージェントが記憶を失うまでの期間、スキル限界は? — Laurie Voss氏(Arize AI)
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
AI エージェントのスキルファイル容量限界が過去1年で約10倍に拡大したが、信頼性の検証と評価の重要性が増している。
AI エージェントは「200 個のルール」を忘れるのか?限界突破と新たな課題
AI エージェントに記述する指示(スキルファイル)の数には明確な限界があると言われていますが、その数値は過去1年で劇的に変化しています。かつて「200 個のルールを超えるとモデルが記憶を失う」と言われていたのが、最新モデルでは約2,000〜5,000 個まで処理可能になったという驚くべき事実が明らかになりました。
しかし、処理能力の限界が引き上げられた今こそ、開発者が最も警戒すべきは「指示を実行したかを確認する検証プロセス」です。モデルが複雑なルールを無視したり、セキュリティフィルターで拒絶されたりするリスクが常時存在するため、従来のワークフローを見直す必要があります。
処理能力の限界は10倍に拡大した
AI エージェントの同時指示処理能力に関する「200」という数字は、過去の実験(IFEval)から生まれた事実です。このテストでは、モデルに対して特定の単語をレポートに含めるよう指示を出し、その正確さを測ります。
「200 個のルールを超えるとモデルが記憶を失う」と言われていたのは、約1年前の話です。
著者のローリー・ヴォス氏(Arize AI)は、この基準値が現在も有効か検証するため、最新のモデルで同様のテストを再実行しました。その結果、処理能力の限界は劇的に拡大していることが判明しました。
- 1年前: 先進的なモデルでも200〜300 個のルールで精度が低下し始めた。
- 現在: GPT-5.5 や Gemini 3.1 Pro などの最新モデルでは、2,000 個から最大5,000 個のルールを同時に処理しても高い精度を維持できる。
これは、過去1年間でモデルの同時指示処理能力が約10倍向上したことを意味します。かつては「スキルファイルに多くの指示を書き込むとすぐに失敗する」という制約がありましたが、現在はより複雑なワークフローを実装するための十分な余裕が生まれました。
モデルごとに異なる「失敗モード」
重要なのは、単に処理できるルール数が増えただけでなく、モデルがどのようにして失敗するか(故障モード)が劇的に変化しているという点です。かつては単純な「忘却」が主流でしたが、現在はモデル固有の特性による多様な障害が発生します。
1. DeepSeek V4 Pro: 予測可能な「忘却」
DeepSeek は最も伝統的な失敗を示しました。約750 個のルールを超えると記憶が曖昧になり始め、2,000 個に達するとほぼ半数を忘れます。
「単純に忘れる」という失敗は、開発者にとって最も信頼できるタイプです。なぜなら、その挙動が予測可能で、測定しやすいからです。
2. Claude Opus 4.7: セキュリティフィルターによる「拒絶」
Claude は、指示数が増えるにつれて「危険」と判断して実行を拒否する傾向があります。これはセキュリティフィルターの感度が高すぎるためです。
- ランダムな単語を含むテストでは、「アンソキシン(毒)」や「シアン化物」などの単語が含まれると、モデルが「爆弾の作成を求めている」と誤判定し、API レベルで実行を拒絶します。
- 医療用語など、文脈によっては安全でも危険とみなされる単語を含む場合、わずか200〜300 個のルールでさえ拒絶されることがあります。
3. Gemini 3.1 Pro: 「思考トークンの枯渇」
Gemini は5,000 個までの指示に対しては非常に安定していますが、それを超えると奇妙な挙動を示します。モデルが「すべての指示を遵守しているか確認する」ために、思考(Reflection)に使用するトークン予算をすべて使い果たしてしまいます。
- その結果、回答を生成する前にトークンが枯渇し、何も出力しないという事態が発生します。
4. GPT-5.5: 論理的な破綻
GPT-5.5 は、処理能力自体は高いものの、ルール数が極端に多くなると論理的一貫性が崩壊する様子が観察されました。単なる忘却ではなく、指示同士の矛盾や論理の飛躍が生じるリスクです。
検証(Evaluation)プロセスが新たな必須要件となる
処理限界が2,000〜5,000 個に引き上げられたことで、「スキルファイルが大きすぎて実行できない」という問題は解決しました。しかし、「指示を実行したかを確認する」という課題が浮き彫りになりました。
「モデルがすべてのルールを無視している可能性」は常時存在します。
かつては「200 個を超えたら失敗する」という明確な閾値がありましたが、現在はモデルが指示を無視したり、セキュリティでブロックされたり、トークン不足で回答不能になったりしても、開発者がその瞬間に気づくことが困難です。ユーザーが「結果を見て、本当にルールを守ったのか?」と疑うしかない状態は解消されていません。
この変化により、開発プロセスには以下の対応が求められます:
- 自動評価ツールの標準化: CI/CD パイプラインに、生成された出力がすべての指示を遵守しているかを自動的に検証するツールを組み込む必要があります。
- モデルごとの挙動理解: セキュリティフィルターの感度やトークン枯渇のリスクを理解し、使用するモデルに応じたテスト設計が必要です。
- 定期的な見直し: モデルの進化は速く、半年前のエンジニアリング仮定が既に古くなっている可能性があります。スキルファイルのサイズ制限やクエリの長さに関する前提を常に最新の状態に保つ必要があります。
まとめ
AI エージェントの処理能力は飛躍的に向上しましたが、その分「指示を正しく実行しているか」を保証する検証プロセスが不可欠になりました。開発者は単にルール数を増やすだけでなく、モデルの特性に応じた堅牢な評価システムを構築することで、初めて複雑で信頼性の高いエージェントワークフローを実現できるのです。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。