最前線で働く:Cognition が Claude Fable 5 を信頼して夜間作業を遂行する理由
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Claude Blog
Cognition は、既存のベンチマークでは評価できない実務での信頼性を重視し、Claude Fable 5 が長時間のタスクや複雑な推論において先行モデルを凌駕する性能を示したと発表した。
AI深層分析を開く2026年8月6日 19:43
AI深層分析
キーポイント
ベンチマークへの懐疑と独自の評価基準
Cognition は既存のスコアに依存せず、開発者が実際の業務でコードを採用できるかを基準とした独自ベンチマーク「Frontier Code」を構築し、これを「アンチスロップ(質の低い出力)対策」と位置づけている。
Claude Fable 5 の実務性能向上
Claude Fable 5 は、先行する Opus モデルが苦手としていた長時間タスクでの文脈維持や複雑な推論において劇的な改善を見せ、Frontier Code の難易度が高いサブセットで約 30% のスコアを記録した。
自律型エンジニア Devin の進化
Cognition が開発する自律型ソフトウェアエンジニア「Devin」において、Claude Fable 5 を採用することでコードの信頼性が向上し、実運用での使用率が劇的に増加したことが確認された。
モデル評価における人間の判断の重要性
同社はベンチマークのスコアよりも、熟練エンジニアが一日中作業を行った結果としてコードを維持できるかという実証プロセスを最優先し、スコアに踊らされない姿勢を貫いている。
長時間の自律的作業の実現
Claude Fable 5 は8時間以上停止せず継続して作業を進める能力を持ち、ユーザーが就寝中に任せても翌朝には実質的な進捗を達成する。
重要な引用
"We've been burned like this a bunch of times," Alberti says.
"we trust no eval."
Alberti calls it an "anti-slop" standard.
"It was kind of a shocker, honestly,"
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Cognition は、シリコンバレーの基準からみてもまだ若いです。同社は 2024 年初頭、エージェントの基本的な仕組みが barely 機能していた時期に、自律型 AI ソフトウェアエンジニアである Devin を構築しました。
Devin が引き受けるのは、エンジニアたちが決して手が回さない仕事です。コードベースの移行、溜まりに溜まったバグの解消、そして次々と先送りされる新機能などです。顧客は急成長中のスタートアップからフォーチュン 500 企業まで多岐にわたり、基準は非常に高いです。Devin が作成したコードは信頼性があり、本番環境で即座に使用できるものでなければなりません。静かに導入された小さなバグが、後工程で重大な問題を引き起こす可能性があります。
Alberti のチームは Devin の背後にあるモデルの訓練とテストを担当し、開始以来ほぼすべての Claude 世代を実行してきました。彼は最初の決定的な飛躍を、2024 年後半の Claude 3.6 Sonnet に遡ります。これは、ツールを確実に連鎖させ、多段階のタスクを保持できる初のモデルでした。チームがこれを Devin に組み込んだ際、内部での使用量は 3 倍に増えました。
その歴史こそが、彼を驚かせることを難しくしています。Cognition は、モデルがベンチマークで高得点を記録した直後に、エンジニアたちが実際に使用しようとした瞬間に崩壊する様子を目の当たりにしてきました。「私たちは何度もこのように痛い目を見ています」と Alberti は語ります。そのため、チームはあらゆるスコアよりも自社のエンジニアを信頼しています。最も審美眼の高い開発者たちは、新しいモデルを実際の一日の仕事を通じて厳しくテストし、基準となるのは「そのコードを自分たちが実際に採用するか」です。
Alberti の言葉通り、「私たちは評価(eval)を一切信用しないのです」。
以前のモデルが限界に達した地点
これらの進歩にもかかわらず、一つの天井は残っていました:エージェントが糸のつながりを失う前に、どれほど長く稼働できるかという点です。
"Fable の登場以前は、タスクに集中できるエージェントを数分間、あるいは長くても 1 時間程度しか委ねられませんでした」とアルベルティ氏は語ります。それを超えるとセッションは迷走し始めます。以前のモデルに一度に検討すべきアイデアを 5 つ与えれば、それは行方を見失い混乱してしまいます。あるデータベース移行プロジェクトでは、以前の Opus モデルは技術的にはタスクを完了しましたが、その過程で一連の微妙なバグを導入してしまいました。
インシデントのトリアージ(優先度付け)でも同様の傾向が見られました。以前のモデルはログの表面に留まり、関連する行を探ろうとせず、また何があっても回答を与えるように訓練されていたため、「最初に発見した妥当そうなものを自信満々に主張し、そこで止まってしまう」のです。エンジニアたちはそれらを無視するように学習しました。

Cognition は、Frontier Code( Frontier コード)を含む一連のベンチマークを用いて、フロンティアモデルを評価しています。
Claude Fable 5 が Cognition の独自の基準をクリア
Cognition は、既存のベンチマークがテストに合格するコードは称賛するものの、実際のコードベースでは生き残れないという傾向があったため、Frontier Code( Frontier コード)と呼ばれる独自ベンチマークを開発し、モデルを評価しています。アルベルティ氏はこれを「アンチ・スロップ(安っぽいコード排除)」基準と呼んでいます。最も困難なサブセットにおいて、以前の Opus モデルは約 10% のスコアでしたが、Claude Fable 5 は約 30% を記録しました。
チームの最初の反応は疑念でした。「バグがあるのか?これはありえない」と。通常、ベンチマークの数値が跳ね上がる際には、エンジニアたちが数週間にわたって「実際にモデルが改善されているのか」を巡って議論するものです。しかし今回は、社内での実証実験(dogfooding)がその数値と一致しました。「正直に言って、それはある種の衝撃でした」とアルベルティは語ります。
「私たちが最も注目したのは、ホライズン、つまり自律的に作業を継続できる時間の長さです」と彼は言います。「就寝しようかと思ったようなタスクでも、『このまま続けてくれ、私が起きるまで決して止まるな』と心の中で願うことがありました。そして目が覚めると、8 時間連続で稼働し、実際に実りある進捗を遂げていたのです。以前には見たことのない光景でした」
ホライズンが維持されたのは、Claude Fable 5 が複雑なコンテキスト(文脈)の中でも冷静さを保ち続けたからです。これは、ブラウザ内のログを閲覧し、ノイズの多い状況でも結論を導き出すために Cognition の内部デバッグツールを適切に活用した初のモデルでした。以前は他のモデルが躓いた移行作業においては、自身が遵守する不変条件(インバリアント)を明確に示し、それに基づいて実行しました。また、優先順位付け(トライアージ)においては、根本原因を特定するとともに「自分が知らないこと」も率直に表明しました。アルベルティによれば、これが信頼を再構築する上で実際に必要な要素なのです。
彼はこの飛躍を、真のステップ変化(step change)の中でも極めて稀なクラスに位置づけました。それはおよそ年に一度しか訪れないような劇的な進化です。

サイラスとそのチームは、Claude などのモデルを駆使して Devin を構築しており、より複雑で長時間実行されるワークロードの処理に取り組んでいます。
次のステップ
Cognition の創業時の賭けは、エージェントがクラウド上で数時間にわたって動作するべきだというものでした。しかし、同社の最初の 1 年間はそのためのモデルはまだ整っていなかったのです。
Alberti 氏は、Claude Fable 5 がその賭けの完全な実現を可能にし、一部はすでに製品に組み込まれていると述べています。Devin は Slack チャンネルを監視し、タグ付けされなくても問題に即座に対応したり、生産環境をモニタリングして独自にスパイク(急増)をトリアージしたりできます。それがうまくいったとき、彼は「まるでチームの一人である本物のエンジニアのようだ」と感じると言います。
彼はこの機能がエンジニアリングチームのデフォルトになると予想しています。1〜2 年後には、エージェントセッションの 90% が、問題を発見し、コードベースをスキャンして修正内容をメッセージとして通知する能動的なものになるでしょう。
「当社がこれまでずっと実現したかった多くのことが、今では可能になりました」と Alberti 氏は述べています。
Claude Fable 5 の利用を開始するにはこちらをご覧ください。
AI算出
導入事例ainew評価高い
記事は Cognition という特定の企業が、Claude Fable 5 の実運用における性能(特に長時間のタスク処理やコード品質)を検証したケーススタディであり、AI モデルの評価基準に関する重要な知見を提供しています。ただし、日本企業への直接的な影響や日本語一次情報ではないため、日本の関連性は低めです。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み