Claude 5.1が登場、世界最強モデルがここに

chaincatcherchaincatcher

出典:AIのMachine Heart


Anthropicは次世代モデル「Claude Fable 5.1」と「Claude Mythos 5.1」を発表した。

Anthropicによると、Claude Fable 5.1は複雑な推論、長時間タスク、エージェント型ワークフロー向けに設計された、公開されている中で最も強力なモデルの一つだ。Claude Mythos 5.1は、より高い能力の限界への探求を表している。

重要なのは、両者は同じ基盤モデルの能力を共有しているが、異なる使用シナリオに応じて異なる安全対策が採用されている点だ。

Fable 5.1は一般ユーザー、開発者、企業に公開される一方、Mythos 5.1は高リスク分野の審査済みパートナー向けで、より厳格なアクセス制御が維持される。

つまり、一方は実世界のタスクを担当し、もう一方はより厳格に管理された環境に置かれる。これはAnthropicによるAI製品の将来像の探求とも言える。最強のモデルが必ずしも同じ形で全員に提供されるとは限らないのだ。

公式声明によると、これら2つのモデルはClaudeシリーズの能力を大幅に進歩させた。また、モデル能力を向上させながら安全な展開を進める方法を示している。

「名目上最強」のモデルとして、Fable 5.1の性能は依然として印象的だ。公式データによると、Fable 5.1は複数のベンチマークテストで前世代のフラッグシップであるFable 5を上回っている。

しかし、能力が向上した一方で、価格は下がった。Anthropicによると、Fable 5.1は基本価格を維持しつつ、キャッシュ読み取りのコストがFable 5と比べて75%削減された。実際の使用では、一般的なワークロードでモデル全体のコストが約25%削減され、高度にエージェント化されたワークロードでは最大45%のコスト削減が可能になる。

最強のモデルでさえ、コストパフォーマンスに力を入れているようだ。

詳しく見ていこう。

 

下位モデルが前世代に追いつく、Fable 5.1は「コストパフォーマンス」に注力

Anthropicは単にリーダーボードを更新するのではなく、今回強調したいのは、Fable 5.1が以前はFable 5の上位ティアが必要だったタスクを、より低い推論コストで完了できるということだ。

公式テストによると、Fable 5.1は低~中程度の推論強度で、Fable 5に近い、あるいはそれを上回る性能をすでに達成している。Claude Codeはデフォルトで高推論強度、Claude CoworkとClaude .aiはデフォルトで中推論強度に設定されており、ユーザーはタスクの複雑さに応じて速度、コスト、効果のバランスを調整できる。

具体的には、Fable 5.1は科学研究エージェントのベンチマーク「Terminal - Bench - Science 0.1」で52.6%のスコアを達成し、Fable 5の24.7%から倍以上に向上した。「Terminal - Bench 4.0」ではFable 5.1が55.8%に達し、より高性能なMythos 5.1はさらに60.9%を達成した。

ナレッジワーク、コンピュータ操作、ビジネスプロセスのテストでも、新モデルは改善を示した。AutomationBenchのスコアはFable 5の17.1%から31.4%に上昇し、CursorBench 3.2.0は70.5%から73.4%に向上した。

複数のベンチマークテストで、Fable 5.1のスコアはFable 5を上回り、特に科学研究エージェントとビジネスワークフロー能力で大幅な改善が見られた。

Terminal - Bench 4.0テストでは、Fable 5.1とMythos 5.1の両方が、異なる推論強度で前世代のMythos 5を上回った。

Terminal - Bench - Science 0.1テストでは、Fable 5.1は最高52.6%のスコアを達成し、Fable 5の2倍以上となった。

Anthropicは、Fable 5.1の重要な変化として、問題の根本原因を追跡する意欲が高まったことを挙げている。これにより、数時間から数十時間に及ぶ複雑なタスクの実行により適しているとしている。

投資会社Millenniumはテストで、内部コードが約100万回に1回クラッシュすることを発見した。この問題はエンジニアリングチームを4~5年間悩ませており、他のモデルでは原因を特定できなかった。Fable 5.1は、外部ベンダーのライブラリを逆アセンブルし、コアダンプファイルを比較することで、問題をサードパーティ製プログラムライブラリのバグに特定した。

RampもFable 5.1を38時間連続で実行させた。元の機械学習結果がラベル付けエラーの影響を受けていることを発見した後、モデルは自律的に問題を修正し、6セットの実験を並行して開始し、最終的に新しい結果とその後の推奨事項をまとめた。

 

コード作成から科学研究へ

今回のリリースで、AnthropicはFable 5.1とMythos 5.1の科学研究における性能について、かなりの部分を割いて議論した。

タンパク質設計実験では、研究者がMythos 5.1にオープンソースのタンパク質設計・折りたたみツールを呼び出させ、生成された設計を2つの外部機関に送って実験的検証を行った。

3つの標的タンパク質について、Mythos 5.1が設計したリガンドの結合親和性は、Adaptyv Bio関連のタンパク質設計コンペティションにおける最良のソリューションの10倍に達した。12の標的タンパク質に対しては、モデルの有効リガンドヒット率は50%近くに達し、Anthropicが提示した業界の一般的な水準は10%~15%である。

Fable 5.1はまた、NASAのマゼラン探査機が30年以上前に収集したレーダー画像を利用して、金星表面の約3分の1について新しい高解像度の標高マップを生成した。

NASAのマゼラン探査機が撮影した金星のレーダー画像。中央に直径約15キロメートルの小型の楯状火山が見える。

元のマップは10~20キロメートルのスケールでしか詳細を表現できなかったが、新しいマップは解像度を2~3キロメートルに向上させ、高さ測定の精度は最大25%改善された。Anthropicはこのマップを知識共有ライセンスの下で公開し、NASAのVERITASや欧州宇宙機関のEnVisionなどの将来のミッションに役立てる計画だ。

計算生物学の分野では、Mythos 5.1がカスタムGPUカーネルの作成と中間結果のキャッシュにより、7つのオープンソースのタンパク質およびゲノム深層学習モデルの実行速度を最大2.5倍向上させ、出力結果の一貫性を維持した。一部の全ゲノム解析タスクでは、GPUコストを30%~60%削減できると期待されている。

7つのオープンソースのタンパク質およびゲノムモデルを最適化した後、Mythos 5.1の推論速度は1.4~2.5倍に向上した。

Anthropicはこれらの事例を用いて、モデルが情報の整理やコード作成から、解決策の提案、ツールの実行、実験的に検証可能な研究成果の提供へと進化していることを示そうとしている。

キャッシュ価格が75%下落、エージェントタスクは最大45%安く

性能以外では、価格がFable 5.1における最も直接的な変化だ。

Fable 5.1の入力価格と出力価格は調整されておらず、それぞれ100万トークンあたり10ドルと50ドルのままだが、キャッシュ読み取り価格は75%引き下げられ、100万トークンあたり0.25ドルになった。

キャッシュ読み取りとは、モデルがすでに処理したコンテキストを再利用することを指す。通常のQ&Aではその割合は限られているかもしれないが、コードベース、履歴ダイアログ、ツール結果を繰り返し読み取る必要があるエージェントタスクでは、キャッシュが主要なコストを占めることが多い。

Anthropicが2026年8月の実際の使用データに基づいて計算したところによると、Fable 5.1で一般的なタスクを実行する全体コストはFable 5より約25%低く、コンテキストが長くツール呼び出しが頻繁な複雑なエージェントタスクでは、コスト削減は最大約45%に達する。

キャッシュ読み取り価格の引き下げ後、Fable 5.1での一般的なタスクのコストは約25%削減され、高度にエージェント化されたタスクのコストは最大約45%削減される。

Fable 5.1は現在、Claude .ai、Claude Code、Claude APIで利用可能で、AWS、Google Cloud、Microsoft Azureを通じても提供されている。開発者はclaude - fable -5-1で新モデルを呼び出すことができる。

 

強化された蒸留対策メカニズム

Fable 5.1とMythos 5.1は実際には同じ基盤モデルを使用しており、主な違いは安全制限にある。

Fable 5.1は一般ユーザーと企業に完全に公開されているが、Mythos 5.1はサイバーセキュリティとライフサイエンスの制限がより緩やかで、現在は審査済みの個人と機関のみが利用できる。

サイバーセキュリティの分野では、Fable 5.1はすでにユーザーがソフトウェアの脆弱性を発見するのを支援できるが、エクスプロイトプログラムを直接生成することはできない。ペネトレーションテスト、エクスプロイト生成、バイナリファイルベースの脆弱性スキャンなどのデュアルユースタスクは、より厳格な制限のあるモデルに委ねられる可能性がある。

調整後、新バージョンのサイバーセキュリティ保護メカニズムは、Fable 5と比較して誤検出を約60%削減した。基本的な生物学および医療問題に関するバイオセーフティメカニズムの誤検出率も85%減少し、ライフサイエンス研究に関連する高度な能力は主にMythos 5.1の審査プログラムを通じて開放される。

Anthropicはまた、Enterprise Frontier Safeguardsを開始した。企業はデータを自社が管理するクラウドインフラストラクチャに保存でき、デフォルトの手動レビューは企業が責任を負うため、「データ保持ゼロ」に近いプライバシー効果を実現しつつ、セキュリティ監視機能を維持できる。このメカニズムは今秋から段階的に導入される予定だ。

大規模モデルの蒸留に対して、Fable 5.1は新たな制限も追加した。その日以降に作成されたAPIアカウントは、Claudeの履歴思考記録を保持したまま、マルチターン対話で以前のコンテキストを手動で変更することができなくなる。Anthropicは、この変更は主に公に知られている能力抽出手法をブロックするためだと述べている。

さらに、EUの人工知能法の要件を満たすため、Fable 5.1のテキスト出力には不可視の透かしが含まれる。Anthropicは検出APIの小規模テストも開始しており、当初は規制機関、メディア、ファクトチェック組織、研究機関に開放される。

最後に、ネットユーザーの言う通り、早起きの鳥は5.1を先に使える。

この内容は情報提供および教育目的であり、BTCCに関連する投資助言ではありません。BTCCは信頼性・正確性・独自性に努めていますが、これらを完全に保証するものではありません。

おすすめ

Altman最新インタビュー:OpenAIが突然ブレーキを踏んだ理由とは?Astra、AI暴走、IPO計画を語る世界の債券利回り低下で韓国株0.26%高、円急騰、ブレント原油は日中1%超下落「反データセンター」の波が米国を席巻、ベッセント氏はクラウド大手を「人心掌握が分かっていない」と非難BTCC デイリー(9.4)|ビットコイン一時8.2万ドル突破、ETFは1日で7.31億ドル流入BTCC 朝のニュースセレクション(9月4日)