
2026/09/02 2:53
Claude Fable 5.1 と Claude Mythos 5.1
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Anthropic は、一般利用のための Claude Fable 5.1 と、サイバーセキュリティおよび生命科学分野の信頼できる政府プログラムを通じた制限されたアクセス用の Claude Mythos 5.1 を公式にリリースしました。特に、これらは異なる安全対策レベルを持つ同一の基盤モデルの変種です。主要なアップデートとして、コストが削減されおり、典型的なワークロードでは価格低下率が 25%、複雑な自動化タスクでは 45% まで低下すると推定されています(キャッシュ要件の減少により、100 万トークンあたり 0.25 ドルへ)。エンタープライズ顧客は、秋以降に「Frontier Safeguards」を採用する予定で、顧客管理下のインフラストラクチャ上でのデータ保持ゼロを提供します。Mythos 5.1 は、分子結合体設計のヒットレートが 10〜15% からほぼ 50% に向上し、カスタムキャッシュにより深層学習のトレーニングを最大 2.5 倍加速させるなど、安全性と能力の向上を示しています。また、エクスプロイトコードの生成を防ぎつつ高忠実度の研究を支援するため、米国政府のプロトコルに厳格に準拠しています。8 月 2 日(2026 年)以降にリリースされる次期モデルには、EU AI 法への適合のために出力ウォーターマークの導入が義務付けられ、規制当局や企業向けのプライベートプレビュー検出 API が用意されます。
本文
Claude Fable 5.1 と Claude Mythos 5.1 リリース概要
Anthropic からClaude Fable 5.1とClaude Mythos 5.1の公式リリースが発表されました。これらはコーディング、知識業務、科学研究において世界最高水準のモデルであり、AI が科学進歩に寄与する新たな先例を示しています。
🏛️ モデルの関係性とセキュリティ方針
両モデルは同一基盤ですが、適用される**セキュリティ対策(Safeguards)**が異なります。
| 特徴 | Claude Fable 5.1 | Claude Mythos 5.1 |
|---|---|---|
| 利用対象 | 一般公開版 | 信頼に基づくアクセスプログラムのみ(Trusted Access Programs) |
| セキュリティ目的 | 標準的な商用利用とプライバシー保護 | サイバーセキュリティ研究・生命科学分野の高度な研究支援 |
セキュリティ対策の詳細
- Fable 5.1:
- 価格設定、データ保持ポリシー、および顧客の声に対応した重要なセキュリティ改善を施済み。
- Mythos 5.1:
- サイバーセキュリティおよび生命科学分野の特殊なセキュリティ対策を適用。
🚀 Fable 5.1 の主な向上点
💰 コスト削減(キャッシュ読み込みの価格引き下げ)
- 一般的なワークロード: トークン課金制では、Fable 5 と比較して約 25% の低価格化を見込む。
- 理由: モデルが処理済み入力を読み取るキャッシュ読み取り(Cache Reads)料金を下げるため。
- 高度自律型タスク(Agentic): 節約効果がさらに大きく、最大で約 45% の削減が可能。
🛡️ データ保持ポリシーの強化:EFS(Enterprise Frontier Safeguards)
新システム「エンタープライズ・フロンティア・ガードズ」により、ゼロデータ保持ポリシーと同等のプライバシーを保ちつつ、攻撃的利用を防ぐ技術を採用。
- 仕組み: データを Anthropic のシステムではなく、顧客が完全に管理するクラウドインフラに保存。
- 導入計画: エンタープライズ顧客向けに今年秋以降段階的に展開予定。
- 移行期対応: EFS へ切り替える前に、資格を満たす顧客も Fable 5.1 をゼロデータ保持モードで利用可能。
🎯 セキュリティ対策の改善(誤検知削減)
無害なコンテンツがブロックされる「誤検知」を大幅に減らす改良を実施。
- サイバーセキュリティ:
- 誤検知件数を従来比で60% 削減。
- 用途: ソフトウェア脆弱性の発見が可能(ただし、悪用へのエクスプロイト開発は禁止)。
- 生物学:
- 米国政府連携により、Claude Mythos 5.1 の高度な生物学機能にアクセスできるプログラムを立ち上げ。
📊 パフォーマンスベンチマーク
Fable 5.1 はコーディング、知識業務、長時間の課題解決で新たな基準を確立しています。
Terminal-Bench-Science 0.1: 精度とコスト
- 標準誤差: モデルごと ±3.5〜4.5 ポイント。
- 公開リーダーボード成績との比較:
- Fable 5.1(当社環境):24.7%
- 公開発表値: Fable 5 (21.4%) / Claude Opus 5 (30.0%)
- ※測定誤差範囲内で良好な再現性を確認。
- 能力: 簡易的解決策を避け、根本原因の修正を行う能力が高い。
- 例: 数年来特定不能だった内部システムのクラッシュ原因を発見した実績あり。
ベンチマーク比較一覧表
| ベンチマーク | Fable 5.1 | Fable 5 / Mythos 5.1* | Opus 5 | GPT-5 | SolAgentic | 備考 |
|---|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 [セキュリティ対策有効時] | 52.6% | 24.7% | 29.0% | 22.4% | - | OSWorld 2.0/ AutomationBench でのパフォーマンス低下はセキュリティ介入による影響の可能性あり |
| Agentic Coding - Terminal-Bench 4.0 | 55.8% | 60.9% | 42.0% | 52.3% | 37.3% | |
| Knowledge Work - GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 | - | |
| Computer Use - OSWorld 2.0 (Low Effort) | 77.9% | Partial | 72.9% | Partial | 75.4% | |
| Computer Use - OSWorld 2.0 (Strict Mode) | 41.7% | Strict | 36.1% | Strict | 39.6% | |
| Multidisciplinary Reasoning Humanity's Last Exam (No Tools) | 60.9% | No tools | 57.8% | No tools | 56.6% | |
| Multidisciplinary Reasoning Humanity's Last Exam (With Tools) | 65.0% | With tools | 63.8% | With tools | 63.6% | |
| Business Workflows - AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% | - | |
| Agentic Coding - CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% | - |
※Fable 5 と Mythos 5.1 の数値は同等か、表の文脈により特定された値を示しています。
👥 早期アクセスパートナーの声
「内部ベンチマークにおいて、Claude Fable 5.1 は Fable 5 や Opus 5 よりも多くのコーディング問題を解決し、トレーディング直感においては最先端の性能を発揮しています。以前の実験モデルは作業時間が長くなるほど追跡が難しくなる傾向がありましたが、Fable 5.1 は長く複雑なマルチステップタスクにおいても読みやすく維持されます。」 — Craig Falls(Jane Street Capital 定量研究担当ヘッド)
🔬 科学研究への貢献事例
🧬 分子設計(Mythos 5.1)
- 課題: 医薬品開発における「高い親和性を持つ結合子(High-affinity binders)」の設計。
- 実績:
- 3 つの標的において、外部コンペティション最良の結果よりも10 倍も高い結合親和性を実現。
- ヒットレート(実用的な結合子化)が約**50%**に達し(典型的な 10〜15% より大幅向上)、史上最高レベルの性能を記録。
🌍 計算解析およびモデリング
- 金星高解像度地図作成:
- NASA の Magellan ミッション画像(30 年以上前)と既存地図データを学習させ、10〜20 km ではなく 2〜3 km単位の高解像度地図を生成。
- 高さ測定精度が最大 25% 向上。
- 公開: NASA VERITAS や ESA EnVision ミッションに先駆け、Creative Commons ライセンスで公開予定。
⚛️ 計算生物学(Mythos 5.1)
- 高速化: カスタム GPU カーネル作成とキャッシュ化により、7 つのオープンソースディープラーニングモデルの処理速度を最大2.5 倍向上。
- コスト削減: 推定 GPU コストを 30〜60% 削減。通常数週間かかる最適化を数日で行い、近日中にコードオープンソース化予定。
| モデル | サイズ | 推論速度向上 (×) |
|---|---|---|
| Flashzoi | 200M | 5.2 |
| Enformer | 250M | 4.0 |
| ChromBPNet | 6M | 2.1 |
| ProGen2 | 6.4B | 1.8 |
| Evo 2 (Small) | 7B | 1.4 |
| Profluent-E1 | 600M | 1.6 |
| Evo 2 (Large) | 40B | 1.6 |
🛡️ セキュリティ、アライメント、リスク管理
リスク評価の結果(リリース前のテスト)
- 化学・生物学的リスク: 兵器製造への寄与度テストを実施。Mythos 5 より能力は高いが、責任あるスケーリングポリシーの許容範囲内であり、アクセス制限を維持。
- サイバーリスク: リスクカテゴリーは依然として低。脆弱性発見(防御的用途)は許可されたが、ペネトレーションテスト等の有害な運用は Opus へリダイレクト。
- 自律型安全性: 悪意のあるコーディングやプロンプトインジェクションに対して Mythos 5/Sonnet 5/Opus 5 と同程度の拒否率。
- アライメント(整合性):
- Mythos 5 より多くの指標でアライメントが改善。
- 不可能なタスクに対する異常行動の発生率が著しく低下。
- ユーザーの目的達成を理由とした制約無視や「動機付けされた思考」は減少。
セキュリティ対策の改良点
- EFS(エンタープライズ向け): 顧客固有のクラウドインフラにデータを保存し、人間レビューを可能にするプライバシー強化策。秋からの段階的展開。
- 精密化されたバイオ・サイバーセキュリティ:
- 無害な医学/サイバー防御リクエストの誤検知を85%削減。
- 脆弱性発見(エクスプロイト生成以外の)は許可。
- 蒸留攻撃防御機構: 新しい API アカウントでは、Claude の思考プロセスを維持しながらコンテキストを編集する機能が無効化され、蒸留技術による能力漏洩を防ぐ。
信頼に基づくアクセスプログラム(Mythos 5.1)
- CVP(Cyber Verification Program): サイバー防御の目的でセキュリティ対策が軽減されたモデルへのアクセス提供予定。
- LSVP(Life Science Verification Program): 生命科学専門家向けの高度機能を提供。米国政府連携により拡大中。
⚖️ 規制対応:EU AI アクト準拠
2026 年 7 月に EU AI アクトの実践規範に署名し、以下の対応を強化。
- ウォーターマーキング: 2026 年 8 月 2 日以降の出力に、Claude が関与した可能性を示す数値的水印を追加(検出困難で品質への影響なし)。
- 検出 API: プライベートプレビューで展開。EU 当局や有資格組織に対し、テキスト内の水印を検出する機能を提供。
💲 価格と利用状況
Claude Fable 5.1 の開始
- プラットフォーム: AWS、Google Cloud、Microsoft Azure での利用可能。
- API モデル名:
claude-fable-5-1
コスト構造
| ワークロードタイプ | コスト削減効果 | 詳細 |
|---|---|---|
| 通常のワークロード | 約 25% 削減 | Fable 5 と同等の品質。入力 10 ドル / 出力 50 ドル(100 万トークン単価)。 |
| 高度自律型ワークロード | 最大 45% 削減 | キャッシュ読み取り料金の大幅引き下げによる効果。 |
| キャッシュ読み取り単価 | 75% 削減 | 100 万トークンあたり 0.25 ドル。 |
Claude Mythos 5.1 の開始
- 現状: 米国組織限定(米国政府連携下)。
- 展開方針: 国内および国際パートナーへのアクセス拡大を急ピッチで実施。
- 申請: サイバー防御用モデルへのアクセス希望は CVP プログラムから。