Import AIメディア報道·2026年7月27日 22:30·約19分
Import AI 466:ロボティクスの教訓と長期間タスク、OpenAI のハッカー
30秒でわかる
Epoch と METR が公開したベンチマーク MirrorCode は、AI システムが CLI のみから大規模なソフトウェアを再実装する能力を評価し、最新モデルが数週間の人間作業を短時間で完了させる成果を示した。
記事の3ポイント
MirrorCode ベンチマークの公開と目的
Epoch と METR は、AI システムがソースコードやウェブアクセスなしに CLI のみから大規模プログラムを再実装する能力を測るベンチマーク「MirrorCode」を正式にリリースした。
最新モデルの驚異的なパフォーマンス
Claude Opus 4.7 は、人間が数週間から数ヶ月を要すると推定されるタスクを14時間で完了し、推論コストは251ドルに抑えることに成功した。
AI の時間的進化と課題の残存
1年前のモデルが約30%のスコアだったのに対し最新モデルは大幅に向上したが、ruff や giac_subset といった特定の分野では依然として完全な解決に至らないケースが残っている。
なぜ重要か・誰に関係するか
この発表が重要なのは、AI システムが複雑なソフトウェア開発プロセスにおいて人間に近い、あるいはそれ以上の生産性を示す転換点となったからだ。開発者や企業の AI 導入担当者は、長期的かつ高コストなコーディングタスクの自動化可能性を再評価し、具体的な実装コストとリスク管理の基準を見直す必要がある。
背景や根拠まで確認しますか?
日本語の全文を、見出しと目次で読み進められます。
この記事をシェア
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み