ページを読み込み中…
ページを読み込み中…
7件の記事
OpenAI は、長期ホライズンモデルの時代における安全性とアライメント(目標整合性)の重要性について発表した。
OpenAI は SWE-Bench Pro の構築プロセス、モデルの失敗事例、タスクメタデータを調査した結果、公開されているタスクのおよそ 30% が破損していることを結論付けました。この分析は、不正確な評価がコーディング能力や安全性、モデルの進捗の評価を歪める可能性を示しています。
AnthropicはClaude Opus 4.7の公式発表と一般利用に関するヒントを公開し、その能力について解説した。モデルの福祉や安全性に関する懸念は別記事で後日扱う予定である。
研究者が、AIモデルの新旧バージョンの動作の違いを特定する「diff」ツールを開発した。このツールは、モデルの振る舞いの変化を可視化し、AIの解釈可能性を向上させることを目的としている。
OpenAIは、AIモデルが信頼できる指示を信頼できない指示よりも優先するように教えるためのトレーニングデータセット「IH-Challenge」をリリースした。初期結果では、セキュリティとプロンプトインジェクション防御の両方で大幅な改善が見られている。