Anthropic Engineering公式発表·2025年1月6日 09:00·約1分
Claude 3.5 SonnetによるSWE-bench検証で基準を引き上げ
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Anthropic Engineering
まず要点
Anthropic社が、AIモデルの実世界ソフトウェア工学タスク遂行能力を評価するベンチマーク「SWE-bench」において、Claude 3.5 Sonnetで検証し、評価基準を向上させた。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
SWE-benchは、モデルが現実世界のソフトウェアエンジニアリングタスクを完了する能力を評価するAI評価ベンチマークです。
原文を表示
SWE-bench is an AI evaluation benchmark that assesses a model's ability to complete real-world software engineering tasks.
この記事をシェア
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み