動画記事 · AI Engineer
2026 年のコンテキストエンジニアリング:Towards AI 編集長らが語る
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Towards AI は、コンテキストウィンドウの制限とコスト増を解決するため、AI エージェントにおける「コンパクション」や「ハイブリッド検索」の実験結果と、2026 年の実用的なコンテキストエンジニアリング戦略を報告する。
2026 年のコンテキストエンジニアリング:AI エージェントが「劣化」する原因と、我々の解決策
AI エージェント開発において、「指示した通りに動かない」「長文の会話で突然精度が落ちる」といった現象は、モデルそのものの性能低下ではなく、コンテキスト・ルート(Context Rut)と呼ばれる現象が原因であることが多いです。Towards AI の編集チームは、自社の AI タートル(学習支援ツール)がこの課題に直面し、コスト増とユーザー体験の悪化を招いたことから、単純な削除や要約を超えた解決策を探求しました。
その結果、ハイブリッド検索の採用やトークン数に応じた動的な管理が不可欠であるという結論に至りました。本記事では、コンテキスト劣化の実態から、最終的に採用したアーキテクチャまで、実証されたベストプラクティスを解説します。
コンテキスト・ルート:なぜ AI は長文で「バカ」になるのか
AI エージェントの会話履歴が長くなるほど、モデルの回答精度が低下し、コストとレイテンシ(応答時間)が増大する現象を我々はコンテキスト・ルートと呼びます。これは単にトークン数が増えたからというだけでなく、現在の LLM の学習バイアスが「文脈全体を統合的に理解する」ことよりも「直近の情報を優先する」ことに最適化されていることが一因です。
「モデルがバカになったのではなく、コンテキストが劣化しているのです。結果が悪くなるのは、コンテキストウィンドウに情報が詰め込まれすぎているからです。」
我々の AI タートルでは、以下の要素が一つのコンテキスト空間に積み重なります。
- システムプロンプト(タスク定義)
- コース教材の断片(Course Chunks)
- ツールの定義と実行履歴
- 過去のチャット履歴
- ユーザーからの質問やコード、エラーログ
特に問題となるのは「古いツールの出力」です。検索結果やファイル操作の結果が蓄積され続けると、重要な情報が埋もれ、モデルはノイズに紛れてしまいます。また、LLM はステートレス(状態を保持しない)であるため、セッションを跨ぐと直前の文脈を失い、ゼロからやり直す必要が生じます。
このコンテキストの肥大化は、以下の 3 つの悪影響をもたらします。
- 精度の低下: 重要な情報が「ルート(rut)」に埋もれ、回答が的外れになる。
- コスト増: トークン数が増えるほど、クエリごとに高額な請求が発生する。
- レイテンシの増加: 処理すべきデータ量が増え、応答までの時間(TTFT)が延び、ユーザー体験を損なう。
コンパクション戦略の実験:削除と要約の限界
コンテキスト・ルートを解消するため、まず試みたのがコンパクション(圧縮)です。これは、必要な情報だけを保持し、不要な部分を削除または要約してトークン数を削減する手法です。
具体的には以下の 3 つのアプローチをテストしました。
1. トークン数の単純カットとスライディングウィンドウ
最も基本的な方法として、直近の N 回の会話のみを保持し、それより前の履歴を削除する「スライディングウィンドウ」や、特定のツール出力(例:300 行のログ)から先頭と末尾だけを残すトリミングを行いました。
「大規模言語モデルを使わずとも、単純なルールベースで効果はあります。ただし、詳細な情報保持が必要なケースでは精度が低下することが判明しました。」
2. 動的要約(Summarization)
会話の進行に合わせて、過去の会話を定期的に要約し、その要約をコンテキストに含める手法です。
「Cloud Code が採用しているような『デルタ要約』は、サブエージェント spawned 時に有用ですが、我々の単一モデル構成では複雑さが増すだけでメリットが限定的でした。」
3. 選択的保持(Selective Retention)
LLM に判断させ、会話の文脈から「何を保存し、何を破棄すべきか」を決定させる手法です。
実験の結果、単純な要約や削除だけでは不十分であることが明らかになりました。特に、学生がデバッグに時間をかけたり、複雑な質問を繰り返したりするケースでは、情報を切り捨てたことで回答の精度が大きく低下しました。「何が残っているか」よりも「何が失われたか」の方が問題となる瞬間が多かったのです。
ハイブリッド検索:埋もれた情報を蘇らせる鍵
コンパクションでトークン数を減らすだけでは解決できないのが、「重要な情報が文脈から消えてしまう(または埋もれてしまう)」という課題です。そこで、我々はハイブリッド検索の導入を決断しました。
意味的検索(Dense RAG)の限界
従来の意味的検索(ベクトル検索)のみでは、キーワードが一致しない重要な情報を見逃すリスクがありました。「AI エンジニア向けのコース」という文脈で「エラーログ」を検索する際、単語が完全に一致しなくても意味的に理解できるはずですが、単純なベクトル検索だけでは埋もれた情報が拾えないケースが発生しました。
BM25 との組み合わせによる再現率向上
そこで、BM25(キーワードベースの検索)とDense RAG(意味的検索)を組み合わせたハイブリッド検索を採用しました。これにより、以下の効果が得られました。
- 再現率の向上: キーワードマッチングで重要な情報を確実に拾い上げつつ、意味的検索で文脈に合った情報を補完する。
- コスト削減: 常に全履歴をコンテキストに含める必要がなくなり、必要な情報だけを動的に呼び出すことでトークン数を抑制。
「意味的検索だけでは埋もれた情報が拾えないため、BM25 と組み合わせたハイブリッド検索で再現率を劇的に向上させました。」
また、Graph RAG(グラフベースの RAG)との比較も行いましたが、我々のケースでは構築コストが高くつき、結果に大差がなかったため採用を見送りました。ただし、データ間の複雑な関係性を扱う場合は Graph RAG の検討も価値があるでしょう。
最終アーキテクチャ:DeepSeek V4 Flash と動的管理の融合
数多くの実験と評価を経て、我々はコスト、レイテンシ、精度のバランスを最適化する最終アーキテクチャを決定しました。この構成は、ハードウェア制約とモデルの特性を深く考慮した結果です。
採用したモデル:DeepSeek V4 Flash
コストパフォーマンスに優れ、長文コンテキスト処理にも対応可能なDeepSeek V4 Flashを採用しました。これにより、高い精度を保ちつつ、推論コストを大幅に削減しています。
トークン数に応じた動的管理ルール
コンテキストの管理には、トークン数を基準とした動的な切り替えロジックを導入しました。
- 30k トークン以内: 全履歴(Full History)を保持。会話の文脈を完全に維持し、精度を最大化します。
- 30k トークン超え: コンパクションとハイブリッド検索を併用した管理モードへ移行。不要な情報を圧縮し、重要な情報だけを抽出してコンテキストに再構築します。
この構成により、学生が長く対話しても「突然バカになる」ことなく、かつコストも抑制できる環境を実現しました。また、すべての実験コードと AI タートルのソースコードはオープンソース化され、Hugging Face Space で誰でも検証・利用可能です。
まとめ:コンテキスト管理は経営的な意思決定である
本報告が示すのは、コンテキスト管理が単なる技術的なチューニングではなく、コストとユーザー体験に直結する経営的な意思決定だということです。特に大規模な学習データや長文コンテキストを扱うエンタープライズ環境では、ハイブリッド検索の採用やトークン数に応じた動的な管理が不可欠です。
「コンテキスト・ルートを解消するには、単純な削除ではなく、情報の価値を動的に評価し、必要な情報を適切なタイミングで呼び出す仕組みが必要です。」
2026 年の AI エージェント開発において、この「コンテキストエンジニアリング」の知見は、より賢く、安価で、使いやすい AI ツールを実現するための重要な指針となるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。