動画記事 · AI Engineer
エージェント型表面の進化 — Anthropic の Gagan Bhat と Isabella Kai He
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Anthropic は、エージェント開発の複雑さを解消し、モデル進化に追従するインフラを提供する「Claude Managed Agents」を発表した。
エージェント開発の転換点:Anthropic が「インフラ」から「ドメイン知識」へ焦点を移す理由
過去3年間、AI エージェントの開発現場は「複雑なループの実装」という大きな壁に直面してきました。しかし、Anthropic はこの状況を根本的に変えるため、開発者が手動で構築していたインフラ課題を完全に管理する「Claude Managed Agents」を発表しました。これにより、開発者は基盤の保守から解放され、自社のドメイン知識とタスク定義という真の価値創造に集中できるようになります。
エージェント表面(Surface)の3段階進化
AI の進歩は加速しており、モデルが扱えるタスクの複雑さも劇的に変化しています。初期の Q&A からタスクの委任へ、そして現在では「結果(Outcome)の所有」へと役割が進化しました。これに伴い、エージェントを構築するためのインターフェースや仕組みも3つの段階を経て進化してきました。
最初の段階はMessages APIです。これは単純にトークンを投入し、テキストで返すという入出力のみに特化したものでした。しかし、タスクが複雑化するにつれ、モデル自身に情報を取得させたり、長い実行プロセスの中でコンテキストを管理させる必要が生じました。
そこで登場したのが2つ目の段階である手動ループ(Agentic Loop)です。開発者は自社のプロダクトに組み込むために、Claude を呼び出し、ツールを実行し、コンテキストを管理する「ループ」をゼロから実装する必要がありました。これは非常に手間のかかる作業であり、さらに本番環境(プロダクション)で運用するには、セッション管理や可視化、認証情報の扱い、サンドボックス化など、インフラに関する数多くの課題に直面しました。
3つ目の段階として登場したのがClaude Agent SDKです。Anthropic が持つ「ハッチス(Agent Harness)」をパッケージ化したもので、組み込みのループやファイルシステムへのアクセス権限、サンドボックス機能などが提供されました。しかし、開発者は依然として認証情報の管理やホスティング基盤のスケーリングなど、インフラ構築の負担を抱えたままでした。
Managed Agents が解決する「インフラ」の重荷
これらの課題を解決するために生まれたのがClaude Managed Agentsです。このアプローチの核心は、開発者が持つべきものと Anthropic が管理すべきものを明確に分離することにあります。
「プロダクト、タスク、コンテキスト(文脈)はあなたが所有し、Claude Managed Agents に呼び出すことで、本番環境対応可能なインフラを提供してもらうのです」
具体的には、Anthropic が以下の要素を完全に管理・提供します。
- 脳(Brain):エージェントループと Claude モデル自体、そしてカスタムハッチスや進化機能。
- 手(Hands):ファイルシステムへのアクセスやコード実行のための、必要に応じて起動されるサンドボックス環境。
- 基盤:認証情報の管理、セッション履歴の保存、可視化ツール、ホスティングインフラなど。
開発者が残るべきは、自社のドメイン知識に基づいたタスク定義と、システムプロンプトやツールの設計のみです。これにより、チームは「箱に収めてスケールさせる」という技術的負担から解放され、製品そのものの価値向上に注力できます。
モデル進化に対応する「アジャイルなハッチス」の設計思想
Managed Agents の背後には、モデルの急速な進化をどう捉えるかという重要な設計思想があります。ハッチスは、モデルが「自分ではできないこと」に対する前提条件(例:コンテキストリセットや圧縮)をコードに埋め込むものですが、モデルが進化するとこれらの前提は古くなり、逆に性能を低下させるリスクがあります。
例えば、Sonnet 4.5 では「コンテキストの限界への不安(Context Anxiety)」という現象が起き、エージェントがまだ余力があるのにタスクを早期終了させてしまう問題がありました。これに対応するため、Anthropic はハッチスに自動でリセットする機能を追加しました。しかし、後続の Opus 4.5 ではこの現象自体が消滅し、以前の実装は単なる遅延やキャッシュの不具合を引き起こす「重り」となっていました。
「モデルが進化してもハッチスが追いつかない場合、エージェントのパフォーマンスは低下します」
このような事態を防ぐため、Managed Agents は個別のコンポーネントを独立させ、容易に交換・更新できる設計になっています。これにより、新しいモデルの能力が発揮された瞬間に、即座に対応したハッチスへアップデートすることが可能になります。
また、長時間実行される非同期タスクや複雑な問題解決に対応するため、以下の機能を備えています。
- コンテキストエンジニアリング:長期にわたる作業で蓄積されるコンテキストを効率的に管理。
- 信頼性の高いサンドボックス:安全にアクションを実行できる環境の提供。
- 並列ワークフロー:複雑な問題を複数のパートに分けて同時に処理する能力。
未来への進化:Dreaming と Outcomes
Managed Agents の新機能として、2 つの重要な概念が導入されました。一つは「Dreaming」です。これは過去のセッションログを分析し、学習した内容を記憶として更新する機能で、エージェントが継続的に自身を改善していく基盤となります。
もう一つは「Outcomes」です。これは単にタスクを実行するだけでなく、「成功の基準」を満たすまで反復実行を行う仕組みです。モデルが一度で正解を出せない場合でも、自己検証と再試行を自動的に行い、最終的な目標達成を目指します。
これらの機能は、エージェント開発における「インフラ構築」というボトルネックを取り除くだけでなく、モデルの能力向上とハッチスの進化を分離管理することで、長期的なシステムの信頼性とスケーラビリティを高める標準的なアプローチとなっています。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。