Xaira、創薬向け因果モデル「X-Cell」発表
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Latent Space
Xaira Therapeutics は、遺伝子発現変化の予測においてデータの情報量がボトルネックとなる課題を解決するため、情報豊富なデータセットを活用した X-Cell モデルを開発し、AI 創薬のパラダイムシフトを示唆している。
AI深層分析を開く2026年7月27日 20:06
AI深層分析
キーポイント
スケーリングの壁と情報の不足
パラメータ数を増やしてもテスト損失が横ばいになる現象は、モデルがデータの情報量によって制限されていることを示しており、単に計算リソースを増やすだけでは性能向上に限界がある。
情報豊富なデータセットの構築
Ci Chu と Bo Wang のチームは、既存の CELLxGENE データベースが因果関係の特定に弱かった点を補うため、より情報密度の高いデータセットを構築し、X-Cell モデルの基盤とした。
戦略的組織体制の変更
この取り組みの重要性を示すため、Ci Chu が Chief Discovery Officer に、Bo Wang が Chief AI Scientist に昇格し、情報豊富なデータが AI 創薬開発の鍵であると位置付けた。
仮想細胞モデルの進化
RNA 発現モデルは従来の「仮想細胞」モデルとは異なり、遺伝子発現への変化に対する予測能力を備えることで、創薬プロセスにおける因果関係の解明を可能にする。
遺伝子操作による因果関係の解明と予測モデル
一つの遺伝子を個別に制御することで、その遺伝子の上下流にある関係性を特定できる。これにより、遺伝子変更が細胞に与える影響や、最小限の侵襲性で発現を変える方法を学習するモデルを構築可能になる。
重要な引用
If test loss flatlines after 1.5B parameters while training loss continues to drop as you scale, that tells you that your model is limited by the amount of information in your data.
Neither parameters nor compute will improve performance past this wall.
We don't know how much this effort costed, but we can guess that data collection experiments and infrastructure was a few tens of millions.
If you could "turn the dial down" on one gene at a time, however, then you would be able to observe what is upstream and downstream of a given gene.
編集コメントを表示
編集コメント
創薬分野における AI の進歩は、単なるシミュレーション精度の向上から、因果関係に基づく予測へとパラダイムを移行しつつある。Xaira の試みは、データ収集のコストとリターンを明確に示すことで、業界全体のデータ戦略に新たな基準を提示していると言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
情報の質に賭ける
パラメータを 15 億個まで増やしてもテスト誤差が横ばいになる一方で、トレーニング誤差は引き続き低下し続ける場合、それはモデルの性能がデータに含まれる情報量の限界によって制約されていることを意味します。

単一の、やや小規模なデータセットでのトレーニングでは情報不足が浮き彫りになりました。31 億パラメータのモデルはスケーリングのトレンドから外れてしまいます。この壁を越えて性能を向上させるには、パラメータ数を増やしたり計算リソースを増強したりするだけでは不十分です。遺伝子発現の変化を予測するためには、より情報密度の高いデータが必要なのです。
これが Chu 氏と Bo 氏のチームが取り組んだことであり、約 30 倍の情報量を得ることで何が可能になるかを示します。

これで、パラメータ数とトレーニング計算リソースを拡大してモデルを成長させることが可能になりました。この取り組みにどれほどの費用がかかったかは不明ですが、データ収集実験やインフラ整備には数千万ドル規模の予算が必要だったと推測されます。一方、計算資源、人員、研究開発には数百万ドル程度で収まったでしょう。この予算配分は、情報豊富な事前学習モデル向けというよりは、強化学習(RL)の展開プロジェクトに近いものです。
この物語の中心人物二人を、私たちは幸運にもポッドキャストにお招きできました。Ci Chu と Bo Wang のリードのもと、Xaira Therapeutics は、情報量の豊富なデータが AI 駆動型創薬の鍵であると確信し、その賭けに出ています。最近、Chu がチーフディスカバリーオフィサーに、Bo がチーフ AI サイエンティストに昇進したことは、Xaira がこの戦略的賭けをいかに重要視しているかを如実に示しています。
ヒト細胞の逆解析
もしヒト細胞がどのように機能するかを理解しようとしたら、どうしますか?まず手始めとして、異なる種類の細胞や状況下で、どの遺伝子が発現しているか(つまり、どのような RNA が浮遊しているか)を記録することから始めるのが良いでしょう。
それが CELLxGENE です。チャン・マーク・ザッカーバーグ研究所が構築したこのデータベースには 1 億 6800 万個の細胞が含まれており、各細胞において 2 万〜3 万個の遺伝子が検出された回数をマッピングしています。さらに、すべての細胞に関する詳細なメタデータも含まれています。これは約 4 兆エントリに及ぶ巨大な行列です。
タンパク質構造データベース(PDB)が構造生物学モデルを解き放ったように [Boltz, BioHub リンク]、CellXGene はバーチャルセルモデルにおいて同様の役割を果たしました。PDB が RNA 発現モデルの群れを生み出したように、CELLxGENE もまた多くの AI モデルにインスピレーションを与えています。そのほどほどの影響力により、「RNA 発現モデル」と「バーチャルセルモデル」はほぼ同義語として扱われるようになりました。Bo Wang は、Xaira の新モデルの出発点となった最も影響力のあるモデルの一つである scGPT を開発しました。
RNA 発現 ≠ バーチャルセル
CELLxGENE で学習されたモデルは、細胞の種類と状態の関係を記述することは得意ですが、RNA 発現に人為的な変化を加えた場合に何が起きるかを予測するのは苦手です。遺伝子発現の変化は高い相関を示すことが多く、ほとんどのケースで「何が原因で何の結果を生んだのか」を特定するのは困難(あるいは不可能)です。
しかし、もし一度に一つの遺伝子の発現量を調整できるような実験が可能であれば、ある特定の遺伝子の上位と下位にある要素を観察できるようになります。例えば、「A が B と C を引き起こすのか」、それとも「B が A を引き起こし、C は別の経路なのか」、あるいは「B → A、C → B → …」といった因果関係の方向性を特定できるかもしれません。すべての遺伝子に対してこの実験を行えれば、ある遺伝子を改変した際(薬剤投与や遺伝子編集など)に細胞がどう反応するかを予測するモデルを構築できる可能性があります。あるいは、特定の遺伝子の発現を変化させるための最も侵襲性の低い方法を見出すこともできるでしょう。
X-Atlas → X-Cell
まさにこれが Chu 氏と Bo 氏のチームが行ったことです。彼らが利用したデータセットは「X-Atlas」、そして構築されたモデルは「X-Cell」と名付けられています。
今回のエピソードでは、以下の点について議論します:
- なぜ自己回帰モデルではなく拡散モデルを採用したのか
- CRISPR を活用して数百万のテストを並列実行し、X-Atlas と X-Cell の生データを生み出す実験手法
- 実際のヒト細胞を用いた研究室の実験への一般化能力
- 先行モデルを上回る性能を示してきた線形ベースラインを打ち破る成果
- 「ありとあらゆる事前知識(Kitchen-sink priors)」を採用する正当性と、それがデータやアーキテクチャと比較してどう評価されるか
ボー氏は、学術界のリーダーと産業界のリーダーとしての自身の強みについて、またそのラボが AI 革新の驚異的なスピードにどう対応しているかについても共有しました。
YouTube やお気に入りのポッドキャストプラットフォームでエピソード全体をご覧ください。
1 この昇進は、私たちがエピソードを録音した後に実現したものです。
2 もちろん、連鎖反応にはサイクルが存在し、二次的・三次次的な効果(複数の遺伝子が同時に変化した場合にのみ生じる現象など)も起こり得ます。しかし、一次効果から始めるのは非常に有効なアプローチであり、私たちが知るべき多くのことを教えてくれる可能性があります。
AI算出
主要ニュースainew評価高い
AI モデルの発表であり、従来のスケーリング則の限界に対する新しい因果データに基づくアプローチという明確な新規性がある。ただし、対象は創薬分野であり日本企業との直接的な関連性は薄い。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 75
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み