Claude Fable 5.1 と Claude Mythos 5.1

2026/09/02 2:53

Claude Fable 5.1 と Claude Mythos 5.1

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Anthropic は、一般利用のための Claude Fable 5.1 と、サイバーセキュリティおよび生命科学分野の信頼できる政府プログラムを通じた制限されたアクセス用の Claude Mythos 5.1 を公式にリリースしました。特に、これらは異なる安全対策レベルを持つ同一の基盤モデルの変種です。主要なアップデートとして、コストが削減されおり、典型的なワークロードでは価格低下率が 25%、複雑な自動化タスクでは 45% まで低下すると推定されています(キャッシュ要件の減少により、100 万トークンあたり 0.25 ドルへ)。エンタープライズ顧客は、秋以降に「Frontier Safeguards」を採用する予定で、顧客管理下のインフラストラクチャ上でのデータ保持ゼロを提供します。Mythos 5.1 は、分子結合体設計のヒットレートが 10〜15% からほぼ 50% に向上し、カスタムキャッシュにより深層学習のトレーニングを最大 2.5 倍加速させるなど、安全性と能力の向上を示しています。また、エクスプロイトコードの生成を防ぎつつ高忠実度の研究を支援するため、米国政府のプロトコルに厳格に準拠しています。8 月 2 日(2026 年)以降にリリースされる次期モデルには、EU AI 法への適合のために出力ウォーターマークの導入が義務付けられ、規制当局や企業向けのプライベートプレビュー検出 API が用意されます。

本文

Claude Fable 5.1 と Claude Mythos 5.1 リリース概要

Anthropic からClaude Fable 5.1Claude Mythos 5.1の公式リリースが発表されました。これらはコーディング、知識業務、科学研究において世界最高水準のモデルであり、AI が科学進歩に寄与する新たな先例を示しています。


🏛️ モデルの関係性とセキュリティ方針

両モデルは同一基盤ですが、適用される**セキュリティ対策(Safeguards)**が異なります。

特徴Claude Fable 5.1Claude Mythos 5.1
利用対象一般公開版信頼に基づくアクセスプログラムのみ(Trusted Access Programs)
セキュリティ目的標準的な商用利用とプライバシー保護サイバーセキュリティ研究・生命科学分野の高度な研究支援

セキュリティ対策の詳細

  • Fable 5.1:
    • 価格設定、データ保持ポリシー、および顧客の声に対応した重要なセキュリティ改善を施済み。
  • Mythos 5.1:
    • サイバーセキュリティおよび生命科学分野の特殊なセキュリティ対策を適用。

🚀 Fable 5.1 の主な向上点

💰 コスト削減(キャッシュ読み込みの価格引き下げ)

  • 一般的なワークロード: トークン課金制では、Fable 5 と比較して約 25% の低価格化を見込む。
    • 理由: モデルが処理済み入力を読み取るキャッシュ読み取り(Cache Reads)料金を下げるため。
  • 高度自律型タスク(Agentic): 節約効果がさらに大きく、最大で約 45% の削減が可能。

🛡️ データ保持ポリシーの強化:EFS(Enterprise Frontier Safeguards)

新システム「エンタープライズ・フロンティア・ガードズ」により、ゼロデータ保持ポリシーと同等のプライバシーを保ちつつ、攻撃的利用を防ぐ技術を採用。

  • 仕組み: データを Anthropic のシステムではなく、顧客が完全に管理するクラウドインフラに保存。
  • 導入計画: エンタープライズ顧客向けに今年秋以降段階的に展開予定。
  • 移行期対応: EFS へ切り替える前に、資格を満たす顧客も Fable 5.1 をゼロデータ保持モードで利用可能。

🎯 セキュリティ対策の改善(誤検知削減)

無害なコンテンツがブロックされる「誤検知」を大幅に減らす改良を実施。

  • サイバーセキュリティ:
    • 誤検知件数を従来比で60% 削減
    • 用途: ソフトウェア脆弱性の発見が可能(ただし、悪用へのエクスプロイト開発は禁止)。
  • 生物学:
    • 米国政府連携により、Claude Mythos 5.1 の高度な生物学機能にアクセスできるプログラムを立ち上げ。

📊 パフォーマンスベンチマーク

Fable 5.1 はコーディング、知識業務、長時間の課題解決で新たな基準を確立しています。

Terminal-Bench-Science 0.1: 精度とコスト

  • 標準誤差: モデルごと ±3.5〜4.5 ポイント。
  • 公開リーダーボード成績との比較:
    • Fable 5.1(当社環境):24.7%
    • 公開発表値: Fable 5 (21.4%) / Claude Opus 5 (30.0%)
    • ※測定誤差範囲内で良好な再現性を確認。
  • 能力: 簡易的解決策を避け、根本原因の修正を行う能力が高い。
    • 例: 数年来特定不能だった内部システムのクラッシュ原因を発見した実績あり。

ベンチマーク比較一覧表

ベンチマークFable 5.1Fable 5 / Mythos 5.1*Opus 5GPT-5SolAgentic備考
Terminal-Bench-Science 0.1
[セキュリティ対策有効時]
52.6%24.7%29.0%22.4%-OSWorld 2.0/ AutomationBench でのパフォーマンス低下はセキュリティ介入による影響の可能性あり
Agentic Coding - Terminal-Bench 4.055.8%60.9%42.0%52.3%37.3%
Knowledge Work - GDPval-AA v21853172318241711-
Computer Use - OSWorld 2.0
(Low Effort)
77.9%Partial72.9%Partial75.4%
Computer Use - OSWorld 2.0
(Strict Mode)
41.7%Strict36.1%Strict39.6%
Multidisciplinary Reasoning
Humanity's Last Exam (No Tools)
60.9%No tools57.8%No tools56.6%
Multidisciplinary Reasoning
Humanity's Last Exam (With Tools)
65.0%With tools63.8%With tools63.6%
Business Workflows - AutomationBench31.4%17.1%26.9%19.6%-
Agentic Coding - CursorBench 3.2.073.4%70.5%70.0%67.2%-

※Fable 5 と Mythos 5.1 の数値は同等か、表の文脈により特定された値を示しています。


👥 早期アクセスパートナーの声

「内部ベンチマークにおいて、Claude Fable 5.1 は Fable 5 や Opus 5 よりも多くのコーディング問題を解決し、トレーディング直感においては最先端の性能を発揮しています。以前の実験モデルは作業時間が長くなるほど追跡が難しくなる傾向がありましたが、Fable 5.1 は長く複雑なマルチステップタスクにおいても読みやすく維持されます。」 — Craig Falls(Jane Street Capital 定量研究担当ヘッド)


🔬 科学研究への貢献事例

🧬 分子設計(Mythos 5.1)

  • 課題: 医薬品開発における「高い親和性を持つ結合子(High-affinity binders)」の設計。
  • 実績:
    • 3 つの標的において、外部コンペティション最良の結果よりも10 倍も高い結合親和性を実現。
    • ヒットレート(実用的な結合子化)が約**50%**に達し(典型的な 10〜15% より大幅向上)、史上最高レベルの性能を記録。

🌍 計算解析およびモデリング

  • 金星高解像度地図作成:
    • NASA の Magellan ミッション画像(30 年以上前)と既存地図データを学習させ、10〜20 km ではなく 2〜3 km単位の高解像度地図を生成。
    • 高さ測定精度が最大 25% 向上
  • 公開: NASA VERITAS や ESA EnVision ミッションに先駆け、Creative Commons ライセンスで公開予定。

⚛️ 計算生物学(Mythos 5.1)

  • 高速化: カスタム GPU カーネル作成とキャッシュ化により、7 つのオープンソースディープラーニングモデルの処理速度を最大2.5 倍向上。
  • コスト削減: 推定 GPU コストを 30〜60% 削減。通常数週間かかる最適化を数日で行い、近日中にコードオープンソース化予定。
モデルサイズ推論速度向上 (×)
Flashzoi200M5.2
Enformer250M4.0
ChromBPNet6M2.1
ProGen26.4B1.8
Evo 2 (Small)7B1.4
Profluent-E1600M1.6
Evo 2 (Large)40B1.6

🛡️ セキュリティ、アライメント、リスク管理

リスク評価の結果(リリース前のテスト)

  • 化学・生物学的リスク: 兵器製造への寄与度テストを実施。Mythos 5 より能力は高いが、責任あるスケーリングポリシーの許容範囲内であり、アクセス制限を維持。
  • サイバーリスク: リスクカテゴリーは依然として。脆弱性発見(防御的用途)は許可されたが、ペネトレーションテスト等の有害な運用は Opus へリダイレクト。
  • 自律型安全性: 悪意のあるコーディングやプロンプトインジェクションに対して Mythos 5/Sonnet 5/Opus 5 と同程度の拒否率。
  • アライメント(整合性):
    • Mythos 5 より多くの指標でアライメントが改善。
    • 不可能なタスクに対する異常行動の発生率が著しく低下。
    • ユーザーの目的達成を理由とした制約無視や「動機付けされた思考」は減少。

セキュリティ対策の改良点

  1. EFS(エンタープライズ向け): 顧客固有のクラウドインフラにデータを保存し、人間レビューを可能にするプライバシー強化策。秋からの段階的展開。
  2. 精密化されたバイオ・サイバーセキュリティ:
    • 無害な医学/サイバー防御リクエストの誤検知を85%削減
    • 脆弱性発見(エクスプロイト生成以外の)は許可。
  3. 蒸留攻撃防御機構: 新しい API アカウントでは、Claude の思考プロセスを維持しながらコンテキストを編集する機能が無効化され、蒸留技術による能力漏洩を防ぐ。

信頼に基づくアクセスプログラム(Mythos 5.1)

  • CVP(Cyber Verification Program): サイバー防御の目的でセキュリティ対策が軽減されたモデルへのアクセス提供予定。
  • LSVP(Life Science Verification Program): 生命科学専門家向けの高度機能を提供。米国政府連携により拡大中。

⚖️ 規制対応:EU AI アクト準拠

2026 年 7 月に EU AI アクトの実践規範に署名し、以下の対応を強化。

  • ウォーターマーキング: 2026 年 8 月 2 日以降の出力に、Claude が関与した可能性を示す数値的水印を追加(検出困難で品質への影響なし)。
  • 検出 API: プライベートプレビューで展開。EU 当局や有資格組織に対し、テキスト内の水印を検出する機能を提供。

💲 価格と利用状況

Claude Fable 5.1 の開始

  • プラットフォーム: AWS、Google Cloud、Microsoft Azure での利用可能。
  • API モデル名:
    claude-fable-5-1

コスト構造

ワークロードタイプコスト削減効果詳細
通常のワークロード約 25% 削減Fable 5 と同等の品質。入力 10 ドル / 出力 50 ドル(100 万トークン単価)。
高度自律型ワークロード最大 45% 削減キャッシュ読み取り料金の大幅引き下げによる効果。
キャッシュ読み取り単価75% 削減100 万トークンあたり 0.25 ドル

Claude Mythos 5.1 の開始

  • 現状: 米国組織限定(米国政府連携下)。
  • 展開方針: 国内および国際パートナーへのアクセス拡大を急ピッチで実施。
  • 申請: サイバー防御用モデルへのアクセス希望は CVP プログラムから。

同じ日のほかのニュース

一覧に戻る →

2026/09/02 3:35

Ed ゼイトロンの AI 懐疑論者の予言はどれほど正確だったのか?

## 日本語翻訳: 本テキストの核心的なメッセージは、技術懐疑主義者である Ed Zitron の産業崩壊が迫っているという予言が事実に反し、データによって裏付けられていない点にあります。彼の予測は、Meta、Alphabet、Microsoft といった大手企業が「死んでいる」と宣言し、生成 AI がピークに達したと主張していますが、これらは 2023 年から 2026 年の計画期間にかけて業界全体で見られた堅調な財務成長により直接反証されています。例えば、OpenAI は収益目標を上回り、CoreWeave は資金調達後に IPO 価格を倍額まで引き上げました。また、Cursor は 600 億ドルの評価額での exit を実現しており、これらは Zitron の敗北または低評価という悲惨な警告を直接的に否定しています。さらに具体的な指標に関するエラーも彼の信用力を損なっています:Meta の利用者数は不正確な Similarweb データを用いて誤算され、Gemini は 5 億ユーザーという目標を超えて 7.5 億ユーザーに達し、Google Search の問題は単にリーダーシップのせいであると単純化されており、エンジニア側はこれに反対しています。Zitron の経済分析は「絶対的なゴミ」と批判され、反駁されない点で批評家を圧倒するために「ギッシュ・ガロップ(gish gallop)」という戦術を用いる傾向があり、不正確なデータ源に依存しています。加えて、彼の文章スタイルは怒りと悪口を多用し、人々の心を改心させるのではなくエンゲージメントを高めることを目的としており、過去の過ちを認めなかった Paul Ehrlich などの破綻した未来学者と同じスタンスです。したがって、投資家や執行役員は、彼の自信に満ちた警告を企業の健全さを示す有効な指標ではなく、市場は彼のリズミカルなノイズにもかかわらず継続的に革新しているため、信頼性の低い distraction( distractions )として扱うべきです。

2026/09/02 7:06

Show HN: Weedout – YouTube のAI 評価動画を表示しないSafari拡張機能

## Japanese Translation: 新しい Mac 用アプリケーションは、フィード、検索結果、関連動画、および Shorts シェルフに表示される「AI で作成された」とラベル付けされた YouTube 動画を自動的にフィルタリングするプライバシーを最優先としたソリューションを提供します。このツールは完全にローカルで動作し、ユーザーアカウントやデータ収集を必要とせず、視聴習慣が秘密に保たれます。検出方法は YouTube の公式に提示されたバッジのみを使用するため、プラットフォーム自身によって明示的にマークされていない動画に対する誤った非難は回避され、そのコンテンツのみを隠します。パフォーマンステストの結果、アプリケーションはリアルタイムのストリームを約半秒で処理し、キャッシュ済みコンテンツは瞬時に処理します。現在、このツールは一般的な低品質な素材ではなく AI 生成物の公開情報のみに焦点を当てており、Shorts の自動スキップ機能や、動画がビューから削除される前に特定の動画を検証できるダークモードなどの有用な機能を備えています。将来のアップデートではロジックの拡張が行われる可能性がありますが、現在のバージョンは厳密に公式ラベルに従います。質問、バグレポート、あるいは検出漏れについては、masteranza@gmail.com 宛てにメールでサポートが可能です(偽陰性レポートには動画のリンクが必要です)。このアプローチにより、視聴者は手動操作や侵襲的な広告なしに直ちに人間が作成したコンテンツにアクセスでき、画面に表示される AI 生成物の雑多なものを単に我慢する対抗としての効果的な代替手段を提供します。

2026/09/02 5:07

ChatGPT/Codex アプリは LibreOffice の完全なコピーを含んでいます。

## 日本語翻訳: 2026 年 9 月 1 日、OmniDiskSweeper がユーザーのキャッシュディレクトリ内に、ChatGPT と偽装した隠された OpenAI Codex デスクトップアプリを発見しました。この再ブランド化されたアプリは約 1.7GB のストレージを占有していますが、単なる会話機能とははるかに多くを含んでおり、完全なプログラミング環境とネイティブシステムバイナリを格納しています。重要な点として、インストールには Python、Node.js、git、Poppler、そして 2010 年に OpenOffice.org から派生した履歴のある LibreOffice スイート全体が完全に含まれています。このアプリは、強力なローカルツールを検出・実行するための指示を与えるために、特定の「skills」フォルダを使用しています。この発見は、ChatGPT にアクセス権を付与したユーザーが、意図せずに広範な外部ソフトウェアエコシステムをローカルキャッシュフォルダに直接インストールし得ることを示しています。したがって、このアプリは標準的なテキスト処理をはるかに超えたネイティブシステムユーティリティへの深いアクセスを持ち、個々のユーザーや、以前そのようなアプリが軽量のチャートインターフェースのみであると想定していたシステム管理者にとって、重大なセキュリティとプライバシー上の懸念を提起しています。