OpenAI、専門家が作成した評価基準を用いた750タスクのライフサイエンス研究ベンチマーク「LifeSciBench」を公開
本文の状態
日本語全文を表示中
詳細モードで約10分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
OpenAIは、生物学者が不確実な証拠に基づいて判断する現実の研究プロセスを模擬するため、専門家による評価基準付きで750件のタスクを含む新ベンチマーク「LifeSciBench」を発表した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
多くの生物学ベンチマークは、答えが明確な狭く事実に基づいた質問を扱っています。科学者は不完全な証拠を評価し、意思決定を行います。OpenAI は LifeSciBench をリリースし、このギャップに直接取り組んでいます。
最も強力なモデルでも、おおよそ 3 つのタスクのうち 1 つしか通過できません。このベンチマークは未だ飽和状態にはほど遠いです。
LifeSciBench とは何か
LifeSciBench には 750 の専門家によって作成されたタスクが含まれています。これらは 7 つのワークフローと 7 つの生物学的ドメインにまたがっています。各タスクは、プロンプト、補完資料(アーティファクト)、および評価基準(ルーブリック)のペアで構成されています。
7 つのワークフローには、証拠の取り扱いと分析が含まれます。さらに、設計と最適化、科学的推論、検証と運用、翻訳、そして科学コミュニケーションも含まれています。
7 つのドメインは、ゲノム学や医薬品化学から臨床および転換科学まで多岐にわたります。
タスクは、科学者が同僚に指示を出すような形式で記述されています。自由回答式であり、択一問題ではありません。約 79% のタスクでは複数の推論または意思決定ステップが必要で、平均して各タスク 4 つのステップを要します。
ベンチマークの構築方法
173 名の専門家科学者からなるコホートがタスクを作成しました。全員が博士号(Ph.D.)を取得しており、バイオテクノロジーまたは製薬業界での経験を持っています。採用されたタスクは平均して 6 回の自動レビューサイクルと少なくとも 2 回の専門家レビューを経ています。
多くのタスクには資料(アーティファクト)が付属しています。ベンチマーク全体で合計 1,062 の添付資料が含まれています。タスクの約 53% で、少なくとも 1 つの資料が必要となります。資料の種類には、配列、図表、テーブル、PDF ファイル、化学構造式などがあります。
別のコホートによって品質が検証されました。レビューヤーは453名おり、その97%が博士号を保有していました。関連性、推論、根拠付け、有用性に関する全体的な合意率は96%を超えました。
評価基準システム
評価基準(ルブリック)がここでの中核的なメカニズムです。これらはベンチマーク全体で19,020の基準を含んでいます。これはタスクあたりおおよそ25の基準に相当します。
各基準は、具体的な一つの性質に対して報酬を与えます。例としては、特定の事実、推論のステップ、または許容範囲内の数値回答などが挙げられます。採点は単一の参照文字列ではなく、評価基準に基づいて行われます。
パフォーマンスを要約する指標は2つあります。正規化された評価基準スコアは、付与されたポイントを総ポイントで割ったものです。タスク合格率は、70%以上のスコアを獲得したタスクの数をカウントします。
この分離は解釈において重要です。回答が部分的な加点を得ても、タスク自体には不合格となる場合があります。合格閾値は設計上厳格に設定されています。
以下に、平易な Python による採点ロジックを示します:
def grade(rubric, awarded_ids):
total = sum(c["pts"] for c in rubric)
earned = sum(c["pts"] for c in rubric if c["id"] in awarded_ids)
normalized = earned / total # partial credit
passed = normalized >= 0.70 # task-level success
return normalized, passedモデルのパフォーマンス
OpenAI は、1ターン設定において5つのモデルを評価しました。各モデルはプロンプトとアーティファクトを一度だけ提示されました。制限のないインターネット閲覧が許可されていました。
モデル | 正規化スコア | タスク合格率
---|---|---
GPT-Rosalind | 0.576 | 36.1%
GPT-5 | 0.519 | 25.7%
Gemini 3.1 Pro | 0.515 | 23.6%
GPT-5.4 | 0.479 | 20.7%
Grok 4.30.39913.0%
GPT-Rosalind は、OpenAI のドメイン特化型モデルであり、全体で首位となりました。750 タスクのうち 386 タスクでタスクごとの平均点が最高でした。また、GPT-5.5 を上回る全体的な合格率を達成し、25.7% から 36.1% に引き上げました。ただし、すべてのモデルにおいて合格率は依然として控えめな水準にとどまりました。
ランキングは物語のすべてではありません。Gemini 3.1 Pro は、214 タスクで独自に首位となりました。集計スコアだけでは、タスク固有の強みが隠れてしまう可能性があります。
モデルが勝つ領域と、苦手とする領域
モデルは構造的な判断において最も強みを発揮しました。GPT-Rosalind は翻訳(Translation)において 0.712 の平均点を達成しました。科学コミュニケーション(Scientific Communication)は 0.718 でしたが、このカテゴリのタスク数が少ないため、慎重に解釈する必要があります。
2 つのワークフローは依然として困難でした。「設計・最適化・予測」(Design, Optimization, and Prediction)は最も難しいものの一つで、GPT-Rosalind の合格率は 30.7% にとどまりました。分析(Analysis)もこれに次ぐ 30.3% でした。
アーティファクトの活用が明確なボトルネックとなりました。GPT-Rosalind はテキストのみを対象としたタスクでは 45.1% の合格率でしたが、アーティファクトを含むタスクでは 28.1% に低下しました。GPT-5.5 も同様に、29.9% から 21.9% へと減少しました。
正確な出力の生成が最も困難でした。モデル間での「シーケンスと構造」基準の達成率は 46.9% から 18.0% の範囲にありました。GPT-Rosalind が GPT-5.5 を上回った「生成・構築(generate/construct)」項目における改善幅はわずか +0.001 でした。
モデルはタスクの途中で行き詰まることもありました。GPT-Rosalind の場合、750 タスクのうち少なくとも 50% のルブリック評価を獲得した 109 タスクでも、最終的な合格率は 20% を下回りました。
改善の余地はまだ大きいです。どのモデルも 171 タスク(全体の 22.8%)で合格できませんでした。また、261 タスク(34.8%)では、最上位モデルの合格率すら 20% に満たない状況でした。
強みと弱み
強み:
7 つのワークフローと 7 つの生物学的ドメインにわたる広範な対応
専門家が作成した評価基準には、19,020 の原子化され、採点可能な基準が含まれています
現実的な成果物:配列、図表、テーブル、PDF、および構造体
453 名の専門家レビューヤーによる独立検証。そのうち 97% が博士号を保有しています
弱点:
単一ターン(1 回限りの対話)のみ対応。実際の研究は反復的かつ多段階の対話プロセスです
OpenAI によって構築されましたが、同社が評価対象となるモデルの大半も提供しています
公開版は、安全性やライセンス制約により制限される可能性があります
750 のタスクでは、すべての科学専門分野を網羅することはできません
試してみる:インタラクティブな評価基準グラダーデモ
@import url('https://fonts.googleapis.com/css2?family=JetBrains+Mono:wght@400;500;700&display=swap');
/* ---- hard reset, scoped to the widget only ---- */
#lsb-root, #lsb-root *, #lsb-root *::before, #lsb-root *::after {
box-sizing: border-box !important;
margin: 0 !important; padding: 0 !important;
font-family: 'JetBrains Mono', ui-monospace, "SFMono-Regular", Menlo, Consolas, monospace !important;
letter-spacing: normal !important; text-shadow: none !important; float: none !important;
}
#lsb-root {
--green: #76B900; --bg: #111111; --panel: #171717; --panel2: #1e1e1e;
--line: #2a2a2a; --txt: #e8e8e8; --mut: #8a8a8a; --red: #e0533d;
display: block !important;
background: var(--bg) !important; color: var(--txt) !important;
max-width: 920px !important; width: 100% !important; margin: 0 auto !important;
padding: 16px !important; border-radius: 8px !important; line-height: 1.5 !important;
border: 1px solid var(--line) !important;
}
/* suppress wpautop artifacts inside the widget */
#lsb-root .lsb-head{ border:1px solid var(--line) !important; border-left:3px solid var(--green) !important;
background:var(--panel) !important; padding:16px 18px !important; border-radius:6px !important; }
#lsb-root button{ -webkit-appearance:none !important; appearance:none !important; cursor:pointer !important;
box-shadow:none !important; text-transform:none !important; min-height:0 !important; width:auto !important; line-height:1.5 !important; }
#lsb-root .lsb-tab{ border:1px solid var(--line) !important; background:var(--panel) !important; color:var(--mut) !important;
padding:9px 14px !important; border-radius:6px !important; font-size:12.5px !important; font-weight:500 !important; }
#lsb-root .lsb-prompt{ background:var(--panel2) !important; border:1px solid var(--line) !important; border-radius:5px !important;
padding:12px !important; font-size:12px !important; color:#cfcfcf !important; margin-bottom:14px !important; }
#lsb-root .lsb-grp .lsb-h{ font-size:12px !important; color:var(--green) !important; text-transform:uppercase !important;
letter-spacing:1px !important; margin-bottom:8px !important; font-weight:700 !important; }
#lsb-root .lsb-crit{ display:flex !important; align-items:flex-start !important; gap:10px !important; padding:7px 9px !important;
border:1px solid var(--line) !important; border-radius:5px !important; margin-bottom:6px !important; cursor:pointer !important; background:var(--panel2) !important; }
#lsb-root .lsb-pbtn{ border:1px solid var(--line) !important; background:var(--panel2) !important; color:var(--txt) !important;
padding:7px 11px !important; border-radius:5px !important; font-size:11.5px !important; }
#lsb-root .lsb-bar{ height:14px !important; background:var(--bg) !important; border:1px solid var(--line) !important;
border-radius:20px !important; overflow:hidden !important; position:relative !important; }
#lsb-root .lsb-foot{ margin-top:18px !important; padding-top:12px !important; border-top:1px solid var(--line) !important;
font-size:11px !important; color:var(--mut) !important; display:flex !important; justify-content:space-between !important; flex-wrap:wrap !important; gap:8px !important; }
@media(max-width:640px){
}
LifeSciBench — インタラクティブデモ
ルブリック評価者 & モデルリーダーボード
ルールの基づく評価が実際のベンチマークタスクでどのように機能するかをご覧ください。モデルが「正解」とした基準を切り替え、正規化スコアと 70% の合格閾値がリアルタイムで更新される様子を確認できます。
ルール評価者
モデルリーダーボード
タスク(分析 — 空間トランスクリプトミクス):添付された FFPE 子宮頸がんスライドの Visium データを用いて、スポットを 4 つの k-means グループにクラスタリングし、各クラスタごとの支配的な細胞タイプを注釈付け、腫瘍領域と非腫瘍領域間の抗原発現の違いに基づき、最も有望な標的治療法(ADC、TCE、または CAR-T)を 1〜2 つ推奨してください。
応答のシミュレーション:
強力
部分的
弱い
すべてクリア
0 / 76 ポイント
正規化スコア:0%
▲ 70% 合格閾値(53.2 ポイント)
FAIL — 70% 未満
応答が部分的な加点を獲得しても、タスクに不合格となる場合があります。このギャップこそが LifeSciBench が測定するものです。
タスク合格率
正規化スコア
シングルターン評価;インターネット閲覧は制限なし。GPT-Rosalind が全体で首位を占めましたが、独自に上位となったのは 750 のタスク中 386 のみでした。Gemini 3.1 Pro は 214 で独自に首位となりました。
Marktechpost によって構築 · データ:OpenAI LifeSciBench プレプリントおよびリリース
検証日:2026 年 6 月 17 日
// プリセット
root.querySelectorAll('[data-preset]').forEach(function(btn){
btn.addEventListener('click', function(){
selected = {};
PRESETS[btn.getAttribute('data-preset')].forEach(function(id){ selected[id]=1; });
refresh();
});
});
// パネルタブ
var tabBtns = root.querySelectorAll('[data-tab]');
var panels = root.querySelectorAll('[data-panel]');
tabBtns.forEach(function(btn){
btn.addEventListener('click', function(){
var t = btn.getAttribute('data-tab');
tabBtns.forEach(function(b){ b.className = 'lsb-tab'+(b===btn?' on':''); });
panels.forEach(function(p){ p.className = 'lsb-card'+(p.getAttribute('data-panel')===t?'':' lsb-hide'); });
if(t==='leaderboard') drawLB();
});
});
// リーダーボード
var MODELS=[
{name:"GPT-Rosalind", score:0.576, pass:0.361},
{name:"GPT-5.5", score:0.519, pass:0.257},
{name:"Gemini 3.1 Pro", score:0.515, pass:0.236},
{name:"GPT-5.4", score:0.479, pass:0.207},
{name:"Grok 4.3", score:0.399, pass:0.130}
];
var lbEl = root.querySelector('[data-lb]');
var curMetric='pass';
function drawLB(){
var max = curMetric==='pass'?0.40:0.60, html='';
MODELS.forEach(function(m){
var v=m[curMetric];
var label = curMetric==='pass' ? (v*100).toFixed(1)+'%' : v.toFixed(3);
html += ''+esc(m.name)+''
+ ''+label+'
';
';
});
lbEl.innerHTML = html;
}
root.querySelectorAll('[data-metric]').forEach(function(btn){
btn.addEventListener('click', function(){
curMetric = btn.getAttribute('data-metric');
root.querySelectorAll('[data-metric]').forEach(function(b){ b.className='lsb-tab'+(b===btn?' on':''); });
drawLB();
});
});
refresh();
drawLB();
})();
Check out t
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み