動画記事 · LangChain
Hex が AI エージェントを構築する仕組み:人間のアナリストのように推論させる
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
HexのAIエンジニアが、単一セル内の生成からノートブック全体のコンテキストを考慮するエージェントへ移行した背景と、矛盾するコンテキストによる推論崩壊、長期評価の課題を明かす。
Hex が AI エージェントを「人間のアナリスト」に進化させた:コンテキストと評価の真実
データ分析における反復的な作業特性に対応するため、Hex は単一セル内のコード生成から、ノートブック全体を把握する高度なエージェントへと進化しました。しかし、その過程で明らかになったのは、矛盾する情報が注入された際の「モデル崩壊」リスクと、従来の評価手法では捉えきれない長期学習の重要性です。
単一セルからプロジェクト全体へ:反復作業への対応
Hex のコアは、SQL や Python のセルを組み合わせ、テキストやチャートで分析を構築するノートブックインターフェースにあります。初期の AI 機能は「セル内完結型」でした。ユーザーが SQL セルを開き質問すると、即座にクエリが返ってくる仕組みです。
「これは GPT-3.5 Turbo の時代の話ですが、神様、懐かしいですね」と振り返る Hex のエンジニア、イジー・ミラー氏によれば、このアプローチには根本的な限界がありました。
データ分析は本質的に反復的です。答えが出た瞬間に「もっと深く掘り下げたい」「別の角度から見てみたい」という思考が生まれます。しかし、単一セルの AI はその文脈を保持できず、「ワンショット(一回きりの回答)」で終わってしまいました。
Hex がエージェントへの回帰を決断した理由は二つです。まず、モデルの能力が飛躍的に向上し、複雑な推論が可能になったこと。そして何より、「高出力のビーストを、制限されたゾーン(学校区域)で走らせているようなもの」だと気づいたからです。
ユーザーはノートブック全体を使って複雑な分析を行いますが、AI はその一部しか見ていませんでした。Hex は遂に、モデルに対してセルだけでなくプロジェクト全体の文脈を提供するよう設計を変更しました。サイドバーにツールを配置し、ユーザーがアクセスできるすべての機能をエージェントに開放した瞬間、社内では「これがそれだ」という反応が沸き起こりました。
矛盾するコンテキストが招く「崩壊モード」
しかし、文脈(コンテキスト)を増やすことは、必ずしも性能向上を意味しません。Hex が直面した最大の課題の一つは、矛盾する指示や情報が注入された際のモデルの挙動でした。
「矛盾するコンテキストを注入すると、モデルは推論に 30 分も費やし、『待てよ、ちょっと待って』と迷走し始めます。そして奇妙な『崩壊モード』に陥るのです」
人間のアナリストなら「これは矛盾している」と即座に判断できる場面でも、AI はすべての情報を同等に扱い、解決策を探そうとして時間だけを浪費します。この現象を防ぐため、Hex は強力なガバナンスとガイドラインの整備を急務としました。
特に重要なのが「メモリとガバナンスの分離」です。ユーザーレベルのメモリ(過去の会話履歴など)はノイズとなりうるため、データチームが主導する厳格なガイドラインと切り離して扱う方針を採用しています。これにより、AI が誤った文脈に引きずられずに、正確な推論を行う基盤を築いています。
90 日間のシミュレーションで測る「メトリックシティ」
コーディングエージェントとデータ分析エージェントには決定的な違いがあります。コード生成は「5 つのボタンでダッシュボードを作る」といった明確なゴールがあり、実行結果が検証可能です。一方、データ分析には多くの意思決定ポイントが存在し、「これは面白い」「別のトレンドを見ようか」という判断が随所にあります。
この曖昧さをどう評価するか。Hex は従来の「ワンショット評価」では不十分だと考え、長期にわたる学習と改善を測る新しい基準を開発しました。
具体的には、90 日間のシミュレーション環境を構築しています。エージェントがコンテキストから学び、徐々に改善していく様子を追跡するのです。
「90 日目までに、すべての質問とチケットに正解するはずです」という目標に対し、Sonnet 4.6 モデルは初期段階で 24% の正解率しか示しませんでした。しかし、この長期評価こそが真の価値を測る鍵となります。
このアプローチは、単なる精度の数値化を超え、エージェントが「どのように学習し、どう振る舞いを修正していくか」というプロセス自体を評価するものです。Hex はこれを「メトリックシティ(Metric City)」のような概念として捉え、実務レベルの AI 開発において不可欠な要素としています。
エージェントの統合と未来の UI/UX
現在、Hex ではノートブックエージェントに加え、「スレッド(会話型インターフェース)」やセマンティックモデルを扱うエージェントなど、複数のエージェントが並行して開発されています。当初はこれらが別々の機能として存在し、ユーザーから「なぜスレッドでは Python が書けないのに、ノートブックエージェントは書けるのか?」といった疑問が投げかけられていました。
Hex はこれらを統合し、ツールやスキルをバンドル化するアプローチへと移行しました。異なる場所にある同じ製品と対話する場合でも、ユーザーは一貫した能力セットを持つことを期待します。
「Microsoft Word のすべてのツールバーにあるボタンがどれくらいあるかという話を思い出してください。エージェントはそれらすべてを使用できる必要があります。複雑な電動工具を扱うように、新しい機能を追加せずとも、自然言語の入力だけで全てにアクセスできるようにする」
この統合により、UI/UX はより流動的で興味深いものへと進化しています。ユーザーは抽象化された会話を通じてデータアーティファクトを探求したり、複雑なレポートを自動生成したりできるようになります。
まとめ
Hex の事例が示唆するのは、実務レベルの AI エージェント開発において「コンテキストの質」と「長期評価」が単なる精度以上の重要課題であるという事実です。高出力のモデルを扱う以上、矛盾する情報の排除と、学習プロセスそのものを測るガバナンス設計こそが、AI を人間のアナリストのように推論させる鍵となります。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。