Anthropic研究者が自己改善型 AI の仕組みを公開
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TechCrunch AI
Anthropic の研究者が発表した論文は、AI が自ら文献を検索し手法を提案・訓練するシステムにより、アライメントベンチマークの性能を全項目で向上させることに成功したと報告している。
AI深層分析を開く2026年8月29日 05:32
AI深層分析
キーポイント
自動化されたアライメント改善の実証
Anthropic の研究チームは、AI システムが10個の特定のアライメント失敗ベンチマークに対して、全体の性能を低下させることなく全ての項目で改善に成功したと発表した。
人間の研究プロセスの模倣
Chen Yueh-Han 氏が率いるこのシステムは、文献検索から手法提案、30分間のモデル訓練までを繰り返す従来の研究アプローチを自動化し、効果的な手法のみを選択的に維持する。
コストと効率性の圧倒的差
論文によると、この自動アライメント研究者(AAR)は1時間あたり約4ドルのコストで機能し、熟練した人間が提案する手法を平均6時間で上回る結果を示す一方、人間の指導による研究方向は性能向上に繋がらない。
再帰的自己改善への道筋
この成果はモデル自身がアライメント訓練を改善できることを示唆し、将来的には人間のアラート研究者が不要になる可能性を含む「再帰的自己改善」の重要な一歩と位置付けられている。
重要な引用
Overall, these results provide early evidence that automated alignment post-training could become practical in the near term
The best AAR method beats what experienced humans propose, on average within six hours
An AAR costs roughly $4 per hour in API inference against the $150 per hour we pay our human researchers
編集コメントを表示
編集コメント
人間のアライメント調整プロセスを自動化し、かつその効率性とコスト面で人間を上回る結果を示した点は極めて画期的である。ただし、ベンチマークの信頼性維持という課題が残るため、実装においては慎重な検証が必要となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
AI モデルを他の AI モデルでトレーニングする手法は、最近のスタートアップにおいて非常に人気のある目標となっています。そして今、Anthropic のフェロープログラムに所属する研究者が、その実現可能性について早期の洞察を提供しました。
金曜日、Anthropic は「Automated Researchers Can Reliably Mitigate Alignment Failures」というタイトルの新しい論文を発表し、AI システムが特定のミスマッチ行動に関する 10 のベンチマークにおいて、モデルのパフォーマンスを確実に向上させる方法を詳述しました。この自動化システムは、すべてのベンチマークでパフォーマンスを改善することに成功しましたが、全体の性能を低下させることはありませんでした。
Anthropic フェローの陳月涵(Chen Yueh-Han)が率いるこのシステムは、従来の研究アプローチの多くを再現しています。各自動化システムは利用可能な文献を検索し、手法を提案します。その後、その手法を用いてモデルを 30 分間トレーニングし、数回の反復を通じてベンチマークを段階的に引き上げていきます。効果的な手法は維持され、無効なものは廃棄されるため、このシステムは高速かつ大規模に動作することが可能になります。
論文には「全体的に、これらの結果は、自動化されたアライメント事後トレーニングが近いうちに実用的なものになる可能性を示す初期証拠を提供している」と記されています。
本論文は、多くの人が AI 進化の次の重要なステップと見なしている「再帰的自己改善(recursive self-improvement)」に向けた一歩です。もしモデルが自身のアライメント学習を改善できるなら、より広範なトレーニング手法の向上も可能になるでしょう。そうなれば、人間による AI 研究者の役割はすぐに不要になるかもしれません。
論文はこの点についても遠慮なく触れ、自動化されたアライメント研究者(AAR)と人間の同等者を明確に比較しています。「最良の AAR 手法は、平均して 6 時間以内に熟練した人間が提案するものを上回る」と論文には記されています。また、「人間による指導付きの研究方向では、性能向上にはつながらない」とも指摘しています。
まだ納得できない人のために、コスト比較も示されています。「AAR の API 推論にかかる費用は時間あたり約 4 ドルであるのに対し、我々が人間の研究者に支払うのは時間あたり 150 ドルだ」というのです。
公平を期すため、論文はこのアプローチにおけるいくつかの限界にも言及しています。自動化されたシステムが機能するのは、ベンチマークが実際のアライメント目標を正しく反映している場合に限られます。しかも、それらのベンチマークを設定・維持する作業にはまだ多くの課題が残っており、自動化された研究者たちが参照する文献の維持や拡張についても言及されています。
*当記事内のリンクを通じて購入された場合、私たちは少額のコミッションを受け取る可能性があります。ただし、これは当社の編集独立性には影響しません。*
ラッセル・ブランドムは 2012 年からテック業界の取材を続けており、プラットフォーム政策や新興技術に注力しています。以前は The Verge や Rest of World で勤務し、Wired、The Awl、MIT Technology Review にも寄稿しました。
連絡先:russell.brandom@techcrunch.com または Signal(412-401-5489)
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み