ページを読み込み中…
ページを読み込み中…
5件の記事
Amazon Science は、仮想患者との対話を通じて安全な対応を判断する臨床設計に焦点を当てた、患者向け健康 AI エージェントの評価新ベンチマークを発表した。
スタンフォード大学が実施した研究により、主要な大規模言語モデル開発者が心理学者らを「安全専門家」として雇用しベンチマークテストを実施している現状において、その安全性評価手法に重大な欠陥があることが明らかになった。
OpenAIは、生物学者が不確実な証拠に基づいて判断する現実の研究プロセスを模擬するため、専門家による評価基準付きで750件のタスクを含む新ベンチマーク「LifeSciBench」を発表した。
Artificial Analysis は、複雑な多段階のユーザー指示をモデルが確実に実行できるかという現実的な能力を捉えられるため、Ai2 が公開した IFBench 評価指標を利用している。
Stephan Rabanserらは、生産性向上を目的としたAIエージェントの信頼性測定ツールが業界に欠如している現状を指摘し、その科学的研究への取り組みを提案した。