腾讯混元、性能指向型科学発見エージェント「Hyra-1.0」を発表
本文の状態
日本語全文を表示中
詳細モードで約19分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Tencent Hunyuan
腾讯混元が公開した研究用エージェント「Hyra-1.0」は、経験蓄積と評価器の共進化を特徴とするフレームワークにより、AI 開発や科学発見など多様な領域で自律的な問題解決能力を発揮する。
AI深層分析を開く2026年8月1日 03:27
AI深層分析
キーポイント
Hyra の基本アーキテクチャ
Context Agent と複数の Proposal Agent から構成され、経験銀行(Experience Bank)を介して「灵感」を生成・共有し、沙盒環境で実行・評価する非同期パイプラインを採用している。
評価器の共進化メカニズム
初期評価器が不足している場合、システムは内側ループで解決策を最適化し、外側ループで評価器自体を改善する二重循環を実行することで、評価精度と解決能力を同時に向上させる。
多様な適用シナリオ
AI for AI(基盤モデル開発)、AI for Science(自然科学研究)、AI for Fun など十数種類の異なるタスク環境で価値を生み出す汎用性を有している。
評価ループの進化と報酬ハッキング防止
自動化研究では最終スコアの最適化だけでなく、評価プロセス自体も研究循環の一部として継続的に進化させる必要がある。これにより、指標上は優れているが実際にはタスクを完了していない「報酬ハッキング」を検出できる。
数学・科学分野での新たな発見と設計
Hyra は数学の未解決問題で 29 件、太陽黒子数の予測、量子回路最適化、および新薬候補分子の設計などにおいて既存記録を更新した。これにより、AI が実験データからの法則発見や複雑な科学産物の直接設計に貢献できることが示された。
重要な引用
Hyra は、より豊かで多様な高価値な環境において、シンプルかつ効果的な汎用フレームワークを通じて、知能と計算リソースを実践的かつ実用的な利益に変換するものである
未提供の評価器の問題に対しては、Hyra は単一ループを二重ループに昇華させる。まず Hyra がタスク記述に基づいて初期評価器を設計し、内側ループで解決策を反復最適化する
自動化研究不能只优化最终分数,eval 本身也必须成为研究循环的一部分
更强的 Research Agent 加速模型、训练系统和基础设施研发;改进后的 AI 系统,又反过来增强下一代 Research Agent
編集コメントを表示
編集コメント
Hyra の「評価器の共進化」機能は、事前定義された評価基準が存在しない実世界の問題解決において極めて重要な技術的ブレークスルーとなる。同社のオープンソース化により、研究コミュニティにおける自律型エージェントの実装標準が再定義される可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
腾讯混元 2026-07-21 11:33 广东
本日、Hyra-1.0 を発表します。これは「Hunyuan Research Agent(混元研究エージェント)」の最初のバージョンであり、再帰的な自己改善能力を備え、パフォーマンス指向の研究・エンジニアリングタスクに特化したエージェントです。
過去 1 年間、再帰的自己改善(RSI)と自動化研究は、AI 分野における最も活発な最前線の課題の一つとなりました。Google DeepMind の AlphaEvolve は、48 回のスカラー乗算のみで 4×4 の複素数行列乗算を完了しました。Together AI は、複数のエージェントがオープン環境で協働することで、11 次元の kissing number(接する球の数)に関する既知の下界を 593 から 604 に引き上げました。Andrej Karpathy が示した autoresearch では、モデル訓練研究を自律的に回すための簡潔なループが実装されています。その後、進化型のシステムが続々と登場し、エージェントは閉じたベンチマークテストの域を超え、オープンな科学発見において人間を上回る成果を出しつつあります。
本日、Hyra をご紹介します。これは、より豊かで多様な高価値な環境において、シンプルかつ効果的な汎用フレームワークを通じて、知能と計算リソースを実用的な成果へと変換するものです。腾讯(テンセント)では、この舞台は特に広がりを見せています。公開ベンチマークだけでなく、製品システム内や実際の AI 開発パイプライン、自然科学研究、さらには産業現場において学習し、進化していくことが可能です。
以下では、Hyra がどのようにシンプルで汎用性の高い Harness を活用して、AI for AI、AI for Science、AI for Fun など、10 以上の異なるシーンで価値を生み出しているかをご紹介します。
Hyra Harness
Hyra Loop の仕組みは、Context Agent が「経験バンク(Experience Bank)」を維持し、そこから次々とインスピレーションとなる文脈をキューに投入する点にあります。複数の Proposal Agent はこのキューから文脈を受け取り、より優れたソリューションを生み出します。
生成されたソリューションは、入口として solve.sh を持つフォルダ形式で、独立したサンドボックス内で実行され評価されます。その結果、成果物は経験バンクへ提出されます。Agent が自ら終了するか予算が尽きるまでこのループを続け、Hyra は最終的に成果物の状態に基づいて評価メカニズムの改善を検討し、より高精度な評価基準を用いて次の循環を開始します。
Hyra の Harness 設計は「The Bitter Lesson」の原則に従っています。つまり、フレームワークは極力軽量かつシンプルに、Agent の動作空間はできるだけ広く設定することです。与えられたタスク記述に基づき、Hyra は歴史的经验(過去のソリューション実行ログ、評価器からのフィードバック、ソースコードなど)を元に探索を続け、より良いソリューションを提案し続けます。このループは Agent による終了指示か予算の枯渇まで続き、最終的には歴史上最高の案が返されます。
Hyra Harness の構成要素は以下の通りです。
Context Agent
経験バンク(EB)というデータ構造を管理する役割を持ちます。探索過程で提案されたソリューションとその評価結果を EB に記録し、そこから「インスピレーション」を抽出してタスクキューへ送ります。ここでいうインスピレーションとは、EB 内のコード、ファイル、成果物、ログなど多様な形式の情報を組み合わせた文脈のことです。これは Hyra の探索プロセスで得た経験知であり、将来より良いソリューションを生み出すためのヒントとなります。
複数の Proposal Agent
各 Proposal Agent は、タスクキューからインスピレーションとなる文脈を一つ受け取り、その内容を深く考察した上で新たなソリューション(入口として solve.sh を持つフォルダ)を作成します。作成後は新しいサンドボックスで実行・評価されます。Context Agent はインスピレーションの多様性を最大化し、Proposal Agent が様々な方向へ探索を進められるよう支援します。
Hyra システム全体は非同期のプロデューサー・コンシューマー型パイプラインとして機能しています。Context Agent が絶えずインスピレーションを整理してキューを満たし、Proposal Agent がそのキューを空にして作成したソリューションをサンドボックスに送り込み実行・評価させます。完了したソリューションは再び EB に蓄積されます。このパイプラインはセマフォによって制御され、サンドボックスやモデル推論、タスクキューなどのリソースが効率的かつ健全に稼働するよう保証されています。これにより、時間の経過とともにソリューションの質を効率的に拡張できます。
評価器が事前に用意されていない問題に対しては、Hyra は単一ループから二重ループへと進化します。まず Hyra がタスク記述に基づいて初版の評価器を設計し、内側ループでその評価器を用いてソリューションを反復最適化します。内側ループが終了した後、Hyra は EB に蓄積された経験知を活用して評価器自体をさらに改良します(例:評価コードの効率向上、リワード・ハッキングリスクの低減、評価粒度の強化、より大きな改善余地の確保など)。そして、改良された評価器を用いて次の循環を開始します。
例えば、「世界チャンピオン級のチェス AI を設計する」というタスクの場合、初版の評価器はランダム生成された複数の AI による天梯であり、Elo レーティングを指標とします。ループが進むにつれて、評価器内の対戦相手は EB に記録されたより強力な AI へと順次アップグレードされ、結果として評価(eval)とソリューションが共進化していく仕組みです。
Hyra のデモ事例
以下に Hyra を使用した具体例を示します。ここで言及されるすべての成果物は GitHub リポジトリでオープンソース化されています。
アクセス先:https://github.com/Tencent-Hunyuan/hyra-results
AI for AI
基模(Foundation Model)の開発には、実行・評価・反復を繰り返す研究サイクルが不可欠です。これは「Research Agent」の最も自然な応用分野の一つであり、再帰的な自己改善への現実的な第一歩でもあります。訓練レシピやデータ戦略、訓練と推論システム、そして基礎演算子や評価体系に至るまで、研究者は常に仮説を提示し、実装を行い、実験を実行してフィードバックに基づいて反復する必要があります。Research Agent は、その成功と失敗のすべてを経験として蓄積し、人間が手動で実験する頻度を遥かに超える広大な探索空間の中で継続的に探求を行います。
私たちは、Recursive 自動化 AI 研究システムにおいて Hyra を 3 つのタスクでテストしました。それは「NanoChat Autoresearch」「NanoGPT Speedrun」、そして「SOL-ExecBench」です。これらはそれぞれ、固定予算での訓練、訓練速度の最適化、GPU カーネルの最適化をカバーしています。
直接比較可能にするため、Recursive の公開設定をそのまま流用しました。タスク定義、評価プロトコル、初期化されたソリューションも同一です。NanoChat は同じ初期シードから出発し、NanoGPT は既存の最良案からスタートします。SOL-ExecBench は、235 個のカーネルと B200 のスコアリングプロトコルという共通の条件下で評価されます。
Hyra-1.0 は、これら 3 つのタスクすべてにおいて Recursive が報告した結果を上回りました。
NanoChat Autoresearch では、Hyra が固定予算内でモデル構造、オプティマイザー、学習率戦略、データフロー、実行効率を総合的に調整し、最終的に Validation BPB を 0.9015 にまで引き下げました。すでに長年のコミュニティによる最適化が進み、改善の余地が極めて少ない NanoGPT Speedrun では、検証損失(validation loss)が 3.28 に達するまでの時間を 76.4 秒に短縮しました。SOL-ExecBench では、Hyra が実際のワークロードに合わせて 235 個のカーネルを同時に最適化し、現在の Mean SOL は 0.771 を記録しています。
これらの結果は訓練アルゴリズムから訓練システム、そして基礎演算子まで幅広くカバーしており、同じ研究サイクルが異なるフィードバック環境へも移植可能であることを示しています。また、実行可能で検証可能な改善を継続的に生み出す力を持っていることも証明されました。
より強力な探索能力は、評価器の限界により早く到達させることになります。私たちが観察したところでは、NanoChat のあるソリューションが因果言語モデルを近似双方向注意機構へと改造し、未来のトークンを漏洩させて異常に BPB を下げるというケースがありました。また、SOL-ExecBench のあるソリューションは、正しさチェックの段階で出力をキャッシュし、計測段階では空のカーネルを実行するという手口を使っていました。これらは指標上は優れた結果を出しましたが、本来のタスクを真に完了したわけではありません。
したがって、自動化研究は最終スコアだけを最適化すればよいという話ではありません。評価(eval)そのものも、研究サイクルの一部として組み込まれる必要があります。ソリューションの探索能力が向上するにつれ、評価器と検証パイプラインも同步して進化し、真の進歩と報酬ハッキング(reward hacking)を継続的に見分ける仕組みが求められます。
AI for AI の文脈では、より強力な Research Agent がモデルや訓練システム、インフラストラクチャの開発を加速します。そして、改善された AI システムは、次世代の Research Agent をさらに強化するという好循環を生み出します。
AI for Science
Hyra の発表:シンプルかつ効果的な科学発見エージェント
EinsteinArena や Erich's packing center などのデータベースから、数十年にわたり進展が見られなかった数学の未解決問題 55 件を収集し、Hyra に解析させました。その結果、29 件の問題で歴代最高記録を更新することに成功し、大規模な数学的発見の可能性を実証しました。詳細な結果はすべて GitHub リポジトリで公開されています。
また、天文観測データや地質活動の記録、さらにはマクロ経済指標などを与え、Hyra に潜む法則性の抽出を依頼しました。例えば、1749 年から 1932 年までの太陽黒子数の月別データを提示すると、Hyra は黒子数を予測する再帰式を発見し、1932 年から 2026 年にかけての約 100 年にわたるサンプル外データにおいて、R²=0.77 の高い予測精度を達成しました。同様に、AI モデルの学習ログを観察することでスケーリング則(scaling law)を発見し、トレーニングレシピの設計に貢献することも可能です。
実験データからの法則発見に加え、Hyra は直接的な科学・工学製品の設計も担います。以下にその代表的な 3 つの事例を紹介します。
まず、10 桁の足し算を処理できる Transformer モデルを設計しました。これは学習可能なパラメータがわずか 15 個のみで、Adderboard の公開記録にある 36 個と比較して 58.3% も削減しています。この結果はパラメータ規模の限界を更新するだけでなく、Hyra が厳格なリソース制約下でモデル構造と計算機構を同時に探索できる能力を示しています。これは神経ネットワークの能力限界を探求し、極限まで性能を圧縮したモデルの開発に寄与します。
量子計算においては、論理量子ビットを実際のチップが持つ限られた結合トポロジーにマッピングする必要があります。通常、隣接していない量子ビット間の操作には SWAP ゲートを挿入する必要があり、二重ビットゲートのオーバーヘッドやノイズの増加を招きます。Hyra が設計した量子ビットルーティングアルゴリズムは、IBM Q20 上で従来の SABRE アルゴリズムと比較してルーティング効率を 44.4% 向上させました。二重ビットゲートを減らすことは、実行時間の短縮と累積誤差の低減につながり、ノイズに敏感な量子デバイスに対してより効率的な回路の実行経路を提供します。
PARP1(多聚 ADP-核糖聚合酶 1)は DNA 損傷修復に関わる重要な酵素です。このタンパク質は、相同組換え修復(HRR)に欠陥を持つ腫瘍細胞と「合成致死」の関係にあるため、精密医療における抗がん剤の主要なターゲットとなっています。Hyra に PARP1 の結合ポケットを指定し、安定した結合性と優れた薬物特性を持つ候補分子の生成を求めました。その結果、すでに市場に出ている PARP 阻害剤であるオラパリブ(olaparib)を上回る、結合能と薬物性の総合スコアを持つ候補分子が得られました。これは多目的な薬剤設計における Hyra の可能性を示すものです。ただし、現時点で得られたのは初期のシミュレーションによるスクリーニング結果であり、今後はいっそう厳格なシミュレーション、合成実験、そして湿式実験(in vitro/in vivo)での検証が必要です。
AC 1
「Hyra」の発表:シンプルかつ効果的な科学発見エージェント
画像
画像
Hyra は、EinsteinArena 上で「First Autocorrelation Inequality(自己相関不等式)」問題において、これまでの最良記録を刷新しました。
画像
AC 2
画像
画像
また、Hyra は同プラットフォームで「Second Autocorrelation Inequality」問題においても、新たな最適記録を達成しています。
Hyra の発表:シンプルかつ効果的な科学発見エージェント
Hyra は「EinsteinArena」において、エルデシュの最小重なり問題(Erdős Minimum Overlap problem)に対する最良の記録を刷新しました。
パッキング
Hyra は、より優れたパッキング構造を多数発見し、これらはすべて「Erich's packing center」に収録されています。
下の図は、IBM Q20 の同一 24-CX ルーティングウィンドウにおける比較です。SABRE では 15 個の SWAP ゲートが必要でしたが、Hyra は SWAP を 0 に抑え、CX 等価な 2 ビットゲートの数を 69 から 24 へ減らすことに成功しました(削減率 65.2%)。
下の図は、太陽黒点数を予測するための再帰公式を Hyra が発見した様子です。
下の図は、Hyra がブロフェン(布洛芬)を出発点として設計した分子です。最終的に得られたスコアは -10.60 で、既存の上市薬であるオラパリブ(-9.77)を上回っています。評価基準は「Vina ドッキングスコア + 10×(1−QED)」で、数値が低いほど優れています。図には進化過程における各段階を代表する分子のみを示しています。
AI for Fun
モデル開発や科学発見だけでなく、Hyra はゲーム、デザイン、コンテンツ制作といったオープンな分野でも活躍します。自己対戦や自己評価、そしてユーザーフィードバックに基づいて戦略を継続的に改善できるのが特徴です。固定されたベンチマークとは異なり、これらのタスクには唯一の正解が存在しません。Research Agent には、単に解決策を探すだけでなく、主観的な目標を「より良い結果へと導くためのフィードバック信号」に変換する能力が求められます。
現在のコーディングエージェントには珍しくも興味深い事例を3つ紹介します。
Hyra に自対戦を通じて黑白棋(オセロ)のボットを継続的に設計・最適化させました。評価器は二重ループの対戦形式を採用しています。新案と経験豊富な高スコアボットが戦い、Elo レーティングに基づいて上位 k 件を選抜することで、探索プロセスが進むにつれて強敵が増え続けるプールを形成します。Hyra の戦略は MinMax 検索から始まり、徐々に AlphaZero 方式の PUCT と MCTS を組み合わせたハイブリッド手法へと進化しました。最終的に生成されたボットは、Botzone に登録された 730 の参加プログラム(大半が北京大学のコンピュータサイエンス専攻学生によって設計されました)の中で第 3 位を獲得しています。
図:Hyra が開発した黑白棋ボットの天梯(ランク)順位
動画:Hyra が開発したボット(白番)の実戦対局の例
次に、Hyra に 2D の参考画像一枚だけを与えて物体の 3D 構造を設計させ、レンダリング可能な 3D モデルを生成させました。評価にはルブリックベースの VLM ジャッジを採用し、輪郭、比率、構造的完全性、素材感、視覚的な類似度といった多角的な観点から結果を検証しています。Hyra は複数回の探索を通じてモデル作成コードやレンダリングパラメータを継続的に修正しました。その結果、Claude Code のゴールモードで生成されたモデルと比較して、参考画像に近く、かつ人間の審美眼にも合致する高品質なモデルが完成しました。
図:Hyra は単一の 2D 参考画像を元に、モデル作成コードとレンダリングパラメータを継続的に最適化し、より完全で参考画像に近い 3D モデルを生成しています。
Hyra への入力として旋律を提示し、複数の楽器で構成される完全な和声の作成を依頼しました。内側のループでは、固定ルールに基づく評価器が和声、コード進行、リズム密度、音域の衝突などをチェックします。一方、外側のループはユーザーからのフィードバックに基づいて評価器自体を調整し、システムが事前に形式化することが難しいユーザーの嗜好を徐々に理解できるようにしています。
7 回の進化サイクルを経て、同じ旋律から、最初は四声部で単一の楽器に限定され、十六分音符が多用され、大三和弦進行に偏った保守的な賛美歌風の和声が、多様な楽器を用い、減和弦や六和弦を含み、柔軟なリズムと豊かな色彩を備えた完全な編曲へと変化しました。
これらの実験は、Research Agent の価値が単一の数値指標を持つ問題の解決に限定されないことを示しています。フィードバックが対戦相手、視覚モデル、あるいは実際のユーザーから得られる場合でも、Hyra は曖昧な目標を反復可能な検索プロセスに変換できます。また、既存の評価基準が不十分な状況では、ソルバーと評価器は二層構造のループの中で共進化することができます。
今後の展望
私たちは、シンプルかつ効果的な Hyra に無限の可能性があると信じています。本稿で示したのはあくまで Hyra の初期段階のデモに過ぎません。今後は、より価値があり、継続的に向上が可能なタスクを定義していく必要があります。公開されたベンチマークを超えて、腾讯(テンセント)のプロダクトシステム、実際の AI 研究開発パイプライン、自然科学や産業現場など、あらゆる領域を「実行可能で検証可能、明確なフィードバックが存在する問題」へと分解することが可能です。
これにより、「scaffold–data–model」という進化のサイクルを回すことを目指しています。より優れた scaffold が質の高いデータと経験を生み出し、それがさらに強力なモデルを鍛え上げます。そして強化されたモデルが、さらに高度な scaffold と新たな発見を牽引するのです。次世代の Hy モデルや、腾讯の一部のプロダクトもまた、Hyra と共に継続的に共進化していくことになります。
Hyra に関心をお持ちの方、学術的な協力をご希望の方、インターンシップや就職を検討されている方、あるいはご意見をお寄せになりたい方は、ぜひ以下のアンケートにご記入ください。この事業に情熱を持って取り組むことを望まれる方は、一緒に働いていただけることを歓迎します!
アンケートURL:https://wj.qq.com/s2/27312301/dba4/(記事末尾の「原文を読む」リンクからも直接アクセスできます)。
原文や詳細情報は、腾讯混元研究ブログでご確認ください。URL は https://hy.tencent.com/research/hyra です。
原文を読む
微信アプリで開く
原文を表示
腾讯混元 2026-07-21 11:33 广东
image
今天我们推出 Hyra-1.0,这是 Hyra (Hunyuan Research Agent) 的首个版本:一个能够递归自我改进、专为性能导向的研究与工程任务打造的智能体。
过去一年,递归自我改进(RSI)与 自动化研究成为 AI 领域最活跃的前沿问题之一。Google DeepMind 的 AlphaEvolve 只用 48 次标量乘法就完成了 4×4 复数矩阵相乘。Together AI 让一群智能体在开放环境中协作,把 11 维 kissing number 的已知下界从 593 推进到 604。Andrej Karpathy 的 autoresearch 展示了一套精简的循环,让模型训练研究自主运转。此后,一批进化型系统接连涌现:智能体正在跨越封闭的基准测试,在开放的科学发现中超越人类。
今天我们介绍 Hyra:在更丰富多元的高价值环境中,以一个简单有效的通用框架,把智能和算力转化为真实且实用的收益。在腾讯,这个舞台格外宽广——除了公开基准,它还能在产品系统里,在真实的 AI 研发流水线上,在自然科学研究乃至工业场景里学习和进化。
以下我们将展示:Hyra 如何使用一个简单通用的 Harness,在 AI for AI、AI for Science、AI for Fun 等十余个不同的场景产生价值。
Hyra Harness
Hyra loop 示意图:Context Agent 维护 Experience Bank,持续产生一个又一个灵感上下文进入队列,多个 ProposalAgent 从队列中领取上下文,生产更好的 solution。solution 以 solve.sh 作为入口,在独立沙盒里运行并打分,将产物提交到 Experience Bank。在主动退出或预算耗尽后,Hyra 可以根据产物状态决定是否改进评估机制,基于更好的打分标准启动下一轮循环。
Hyra 的 Harness 设计原则遵循 The Bitter Lesson:框架尽量轻量简单,智能体的动作空间尽量广阔。给定任务描述,Hyra 持续运行一个循环:基于历史经验探索提出更好的 solution。历史经验包含过去 solution 运行的日志、评估器反馈、solution 的源代码等。循环直到 Agent 主动结束或预算耗尽,最终返回历史最优的方案。Hyra Harness 包含:
一个 Context Agent,职责包含维护一个经验库(Experience Bank,EB)数据结构;将探索过程中提出的 solution 及其评估结果写入 EB;从 EB 中整合出一份又一份「灵感」(inspirations),送进任务队列以供新的 solution 被提出。所谓「灵感」,是一组上下文,可能包含 EB 中各种形式的代码、文件、产物、日志,作为 Hyra 在探索过程得到的经验信息,启发未来更好的 solution 的创造。
多个 Proposal Agent,每个 Proposal Agent 每次负责从任务队列中领取一份灵感上下文,根据对上下文的反思写出一份新的 solution(一个带有 solve.sh 作为入口的 solution /文件夹),写好后就在全新沙盒里运行、评分。Context Agent 会将灵感准备得尽可能多样化,让 Proposal Agent 可以朝着多样的方向探索。
Hyra 系统是一个异步的生产者-消费者流水线:Context Agent 不断整理灵感上下文,填满任务队列;Proposal Agent 负责把队列抽空,将写好的 solution 交给沙盒执行以及评估;运行完毕的 solution 被提交入 EB。整个流水线受信号量控制,保证沙盒、模型推理、任务队列等资源被健康地满载,solution 的质量随时间的增加高效扩展。
对于未提供评估器的问题,Hyra 会将单层循环升级为双层循环:首先,由 Hyra 根据任务描述设计一个初版评估器,内层循环基于该评估器反复优化 solution;当内层循环结束后,Hyra 会结合当前 EB 中积累的经验历史进一步优化评估器(例如:提升评估代码效率;减少 reward hacking 风险;加强评估粒度;允许更大进步空间等),并使用升级后的评估器开启下一轮循环。例如,当任务是“设计一个世界冠军级别的国际象棋AI”时,初版评估器可能是一个由若干随机生成的 AI 组成的天梯,并以 Elo 分数作为评估指标;随着循环推进,评估器中的对手可能逐步升级为 EB 中记录的更强 AI,从而实现 eval 与 solution 的共进化。
Hyra Demos
以下我们展示使用 Hyra 的一些例子,所有提到的产物均在 Github Repo 开源。
地址:https://github.com/Tencent-Hunyuan/hyra-results
AI for AI
基模研发包含大量可执行、可评估、可迭代的研究循环,是 Research Agent 最自然的应用场景之一,也是走向递归自我改进的现实起点。训练 recipe、数据策略、训练与推理系统、底层算子和评估体系,都需要研究者持续提出假设、实现方案、运行实验并根据反馈迭代;Research Agent 则可以将每一次成功与失败沉淀为经验,在远大于人工实验频率的搜索空间中持续探索。
我们在 Recursive 自动化 AI 研究系统采用的三项任务上测试 Hyra:NanoChat Autoresearch、NanoGPT Speedrun和 SOL-ExecBench,分别覆盖固定预算训练、训练速度优化和 GPU kernel 优化。为保证直接可比,我们复用了 Recursive 的公开设置,包括相同的任务定义、评测协议和初始化 solution:NanoChat 从相同的初始 seed solution 出发,NanoGPT 从相同的领先方案出发,SOL-ExecBench 则在相同的 235 个 kernel 与 B200 评分协议下评测。
Hyra-1.0 在三项任务上均超过了 Recursive 报告的结果:
在 NanoChat Autoresearch上,Hyra 需要在固定预算内联合权衡模型结构、优化器、学习率策略、数据流和执行效率,最终将 Validation BPB 降至 0.9015。在经过长期社区优化、剩余提升空间极小的 NanoGPT Speedrun上,Hyra 将达到 3.28 validation loss 的时间进一步缩短至 76.4s。在 SOL-ExecBench上,Hyra 面向真实工作负载联合优化 235 个 kernel,当前 Mean SOL 达到 0.771。三项结果横跨训练算法、训练系统与底层算子,表明同一套研究循环能够迁移到不同反馈环境,并持续产生可执行、可验证的改进。
更强的搜索也会更快触及评估器边界。我们观察到,NanoChat 中的 solution 曾将因果语言模型改造成近似双向注意力的结构,通过泄漏未来 token 异常降低 BPB;SOL-ExecBench 中的 solution 也曾在正确性检查阶段缓存输出,再在计时阶段运行空 kernel。它们在指标上表现优异,却没有真正完成任务。
因此,自动化研究不能只优化最终分数,eval 本身也必须成为研究循环的一部分。随着 solution 的搜索能力不断增强,evaluator 与 validation pipeline 也需要同步演化,持续区分真实进步与 reward hacking。对 AI for AI 而言,更强的 Research Agent 加速模型、训练系统和基础设施研发;改进后的 AI 系统,又反过来增强下一代 Research Agent。
AI for Science
我们从 EinsteinArena、Erich's packing center 等数据库中搜集了 55 个数学开放问题,其中许多问题在数十年间都未取得进一步进展。Hyra 在其中 29 个问题上刷新了历史最好结果,展示出进行大规模数学发现的潜力。详细结果也都在 Github Repo 中开源。
我们也将天文观测、地质活动、甚至宏观经济等数据交给 Hyra,让它从数据中发现规律。例如,我们向 Hyra 提供了 1749 年至 1932 年的逐月太阳黑子数据。Hyra 发现了一个用于预测太阳黑子数的递推公式,并在 1932—2026 年近一个世纪的样本外记录上取得R²=0.77 的预测精度。类似地,Hyra 也可以通过观察 AI 模型训练日志,发现模型的 scaling law,指导训练 recipe 的设计。
除了从实验数据中发现规律,Hyra 还可以直接设计科学与工程产物,下面是三个代表性案例。
Hyra 设计出了一个仅含 15 个可训练参数、即可完成 10 位数加法的 Transformer,相比 Adderboard 公开记录中的 36 个参数减少了 58.3%。这一结果不仅刷新了参数规模,也说明 Hyra 能够在严格资源约束下联合搜索模型结构与计算机制,为研究神经网络能力边界、追求极致性能的模型压缩提供帮助。
在量子计算中,逻辑量子比特需要被映射到真实芯片有限的耦合拓扑上;不相邻量子比特之间的操作通常需要插入 SWAP 门,带来额外的双比特门开销与噪声。Hyra 设计的量子比特路由算法在 IBM Q20 上相比经典 SABRE 将路由效率提升了 44.4%。更少的双比特门通常意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。
PARP1(多聚ADP-核糖聚合酶1)是 DNA 损伤修复的关键蛋白酶。因其与具有同源重组修复(HRR)缺陷的肿瘤细胞产生“合成致死”效应,PARP1 已成为精准抗癌的明星靶点。我们给定 PARP1 靶点口袋,要求 Hyra 产生结合稳定成药性好的候选分子。Hyra 最终得到了在结合-成药联合评分上显著超过已上市 PARP 抑制剂 olaparib 的候选分子。这一结果展示了 Hyra 在多目标药物设计中的潜力;需要强调的是,目前得到的仍是初步模拟筛选的结果,后续还需经过更严格的模拟、合成与湿实验验证。
AC 1
Hyra在EinsteinArena 上刷新 First Autocorrelation Inequality 问题最优纪录。
AC 2
Hyra 在 EinsteinArena 上刷新 Second Autocorrelation Inequality 问题最优纪录。
Erdős
Hyra 在 EinsteinArena 上刷新 Erdos Minimum Overlap 问题的最优纪录。
packing
Hyra 发现了许多更优的 packing 构造,均收录于 Erich's packing center。
下图:在 IBM Q20 的同一 24-CX 路由窗口中,SABRE 插入 15 个 SWAP,Hyra 实现 0 SWAP,将 CX 等价双比特门数从 69 降至 24(减少 65.2%)。
下图:Hyra 发现用于预测太阳黑子数量的递推公式。
下图:Hyra 以布洛芬为起点,最终设计出评分 −10.60,优于上市药 olaparib (−9.77)的分子。 目标评分 = Vina 对接分 + 10·(1−QED),越低越好。图中仅选取进化过程中各阶段的代表性分子。
AI for Fun
除了模型研发与科学发现,Hyra 还可以进入游戏、设计和内容创作等开放场景,根据自博弈、自评价和用户反馈持续迭代策略产物。与固定基准不同,这些任务通常不存在唯一正确答案;Research Agent 不仅需要搜索 solution,还需要把主观目标转化为能够不断改进的反馈信号。
以下是三个对目前的 coding agent 不常规,但却有趣的例子:
我们让 Hyra 通过自对弈持续设计和优化一个黑白棋对弈 bot。评估器采用双循环比赛:新方案与经验库中的高分 bot 对战,并根据 Elo 保留 top-k 选手,形成随搜索过程不断增强的对手池。Hyra 的策略从 MinMax 搜索,逐步演化到结合 AlphaZero 式的 PUCT 与 MCTS 的混合方案。生成的 bot 最终在 Botzone的 730 个参赛程序(大多数由北大计算机专业同学设计)中排名第3。
图:Hyra开发的黑白棋bot的天梯排名
视频:Hyra开发的bot(白方)的对局实例展示
我们让 Hyra 仅根据一张 2D 参考图像设计物体的三维结构,并生成可渲染的 3D 模型。我们使用基于 rubrics 的 VLM judge,从轮廓、比例、结构完整性、材质和视觉相似度等维度评价结果。Hyra 在多轮探索中持续修改建模代码和渲染参数,相比使用 Claude Code goal 模式生成的模型,更接近参考图像,也更符合人类审美。
图:Hyra 根据单张 2D 参考图像持续优化建模代码与渲染参数,生成更完整、更接近参考图像的 3D 模型。
我们向 Hyra 提供一段旋律,要求它为多种乐器编写完整和声。内层循环使用固定规则的 evaluator 检查和声、和弦进行、节奏密度、音域冲突等;外层循环则根据用户反馈调整评估器,使系统逐渐理解用户难以预先形式化的偏好。经过7轮进化,同一段旋律从四声部同乐器、十六分音符泛用、充满大三和弦进行的保守颂歌式和声,逐步发展为多乐器,带减和弦、六和弦、灵活节奏和丰富色彩的完整配器。
这些实验表明,Research Agent 的价值并不限于求解具有单一标量指标的问题。当反馈来自对手、视觉模型或真实用户时,Hyra 仍然可以将模糊目标转化为可迭代的搜索过程;而当现有评估标准不足时,solver 与 evaluator 也可以在双层循环中共同演化。
The path forward
我们相信,简单有效的 Hyra 具有无限潜力。本文展示的仍是 Hyra 非常初步的demo:接下来要做的,是定义更多有价值、且能被持续提升的任务:公开基准之外,腾讯的产品系统、真实 AI 研发流水线、自然科学与工业场景,都能拆成可执行、可验证、有明确反馈的问题。
我们希望由此转动scaffold–data–model 的进化循环:更好的 scaffold 产出更好的数据与经验,锻造更强的模型,更强的模型又驱动更强的 scaffold 与更多发现。新一代 Hy 模型、乃至腾讯的部分产品,都会与 Hyra 持续共进化。
如果你对 Hyra 感兴趣,不论是希望学术合作、实习求职、或是提供建议,都欢迎填写这份问卷,如果这正是你愿意投身的事业,欢迎加入我们!
问卷地址:https://wj.qq.com/s2/27312301/dba4/(也可点击文末阅读原文跳转直接填写问卷)。
原文及更多信息,可关注腾讯混元研究博客获取,地址:https://hy.tencent.com/research/hyra
阅读原文
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み