発見型 AI の評価基盤「Apodex Discovery」を Hugging Face が公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Apodex Discovery は、基盤モデルやツールを統合した重役ソルバーを用いて、現実世界の複雑な課題を検証可能な調査として評価・構築するフレームワークであり、既存のベンチマークを超えた実用的な発見能力の実現を目指すものである。
AI深層分析を開く2026年8月18日 03:26
AI深層分析
キーポイント
Apodex Discovery の構成要素
基盤モデル、ハネス、ツール、制御ポリシーからなる重役ソルバー(HDS6)を中核とし、問題の探索、環境タスク抽象化、多角的評価機能を備える。
現実課題の収集と選定プロセス
16 のセクターにわたる 561 の産業を調査し、423 の高価値な実世界課題を特定した上で、最初のリリース向けに 20 の課題を選定した。
科学的成果の実証
AAV カプシッド設計において既存の最先端を 7% 上回り、薬物再利用や再構成タスクでは GPT-5.5 や GPT-5.6-sol の予測スコアを大幅に向上させた。
評価指標の多様化
最終的なタスク成功とは独立して、ツール使用、修復能力、代替案提示、一貫性、証拠、範囲といった 6 つの側面を個別に評価する HDS6 を導入した。
重要な引用
Apodex Discovery moves AI evaluation beyond predefined benchmarks toward verifiable investigations aimed at genuine discovery.
In AAV capsid design, Apodex surpassed the published state of the art by 7% across viability, tropism, structure prediction, and generative design.
編集コメントを表示
編集コメント
この発表は、AI が単に問題を解くだけでなく、未知の領域で検証可能な発見を行うための具体的なアーキテクチャを示した点で画期的である。特に科学分野での実証結果は、次世代 AI システムの評価基準を再定義する重要な示唆を含んでいる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
アポロ計画が月面到達を成し遂げたのは、単にエンジニアたちが難解な方程式を解きほぐせたからではありません。遠い夢を実現するために、明確な目標、シミュレーション、検証、そして繰り返される修正というミッションアーキテクチャへと昇華させたからこそでした。
現在、AI も同様の転換期を迎えています。問題、ツール、成功基準が定義されれば最先端モデルは困難なタスクを解決できますが、現実世界における重要な課題は、実行可能で検証可能な形で提示されることは稀です。
そこで私たちは「Apodex Discovery」を発表します。これは、基盤モデル、ハネス(環境)、ツール、制御ポリシーから構成される「ヘビーデューティー・ソルバー」というシステムを通じて、発見的 AI を構築・評価するためのフレームワークです。このシステムは、拡張性があり、状態を保持し、検証可能な調査活動に注力します。
Apodex Discovery には3 つの主要コンポーネントがあります。まず、問題探索プロセスでは 16 のセクターにまたがる 561 の産業を調査し、423 の高価値な実世界課題を収集しました。その中から初期リリース用に 20 を選定しています。
次に、共通の環境・タスク・エピソード抽象化層が提供されます。ここではデータ、ツール、制約条件、フィードバック、軌跡記録、そして中間成果物と最終提出物の検証が行われます。
最後に、HDS6 は最終的なタスク成功とは独立して、「ツール」「修復」「代替案」「一貫性」「証拠」「範囲」の 6 つを個別に評価します。
AAV カプシッド設計において、Apodex は生存率、トロピズム、構造予測、生成設計のすべての指標で既存の最先端技術を 7% 上回りました。また、薬物再利用や再製剤化という特定のタスクに特化した生体医学環境では、GPT-5.5 と GPT-5.6-sol の平均正規化予測スコアが、同じクローズドブックベースラインと比較してそれぞれ 2.5 ポイント、7.6 ポイント向上しました。
制御されたアブレーション実験の結果、固定された TRACES エピソードインターフェースにより、性能差を特定のソルバーコンポーネントに帰属させることが可能であることが示されました。Apodex Discovery は、AI 評価を事前定義されたベンチマークから脱却させ、真の発見を目指した検証可能な調査へと進化させます。
原文を表示
Apollo did not reach the Moon merely because its engineers could solve difficult equations. It succeeded by turning a distant ambition into a mission architecture of explicit objectives, simulation, verification, and repeated correction. AI now faces a similar transition: frontier models can solve difficult tasks once the problem, tools, and success criteria are specified, yet consequential real-world challenges rarely arrive in an executable or verifiable form.
We introduce Apodex Discovery, a framework for building and evaluating discoverative AI through the heavy-duty solver, a system comprising a foundation model, harness, tools, and control policies that pursues extended, stateful, verifiable investigations. It has three core components. First, a problem-scouting process surveyed 561 industries across 16 sectors, assembled 423 high-value real-world problems, and selected 20 for the initial release. Second, a common environment-task-episode abstraction provides data, tools, constraints, feedback, trajectory recording, and verification of intermediate artifacts and final submissions. Third, HDS6 evaluates Tools, Repair, Alternatives, Coherence, Evidence, and Scope independently of final-task success.
In AAV capsid design, Apodex surpassed the published state of the art by 7% across viability, tropism, structure prediction, and generative design. In drug repurposing and reformulation, a task-specific biomedical environment improved the mean normalized prediction score of GPT-5.5 and GPT-5.6-sol by 2.5 and 7.6 points over the same closed-book backbone. Controlled ablations show that the fixed TRACES episode interface enables attribution of performance differences to specific solver components. Apodex Discovery moves AI evaluation beyond predefined benchmarks toward verifiable investigations aimed at genuine discovery.
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み