
2026/09/23 1:29
Claude Opus 5.5
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Anthropic は、新しい Claude 5.5 ファミリーにおける初モデルである Claude Opus 5.5 を導入しました。このモデルは、エリート「Fable」モデルと同等の性能を維持しつつ、大幅なコスト削減(一般的なタスクでは最大 40% のコスト低減、特定のコーディングタスクでは出力速度向上に伴い約 51% のコスト削減)を提供します。このリリースは、Anthropic が「フロンティアを調整する」という戦略的転換を示すものであり、外部評価機関である Frontier Design と METR による検証也得到了確認です。性能向上により、企業は数週間かかっていた大規模なコード移行を数日(例:68 万行のコード移行が 1 日以内に完了)で実行可能にされ、約 40 の複雑な Web ページの読み込み時間を改善できます。
安全性とセキュリティは最優先事項であり、Opus 5.5 はアライメントスコアの向上、プロンプトインジェクションに対する耐性、そして不可逆的な動作が起きる可能性の低減を示しています。サイバーセキュリティ対策として、Fable 5.1 と同等の safeguards が導入されており、多くのタスクは高レベルのセキュリティを持つ Opus 4.8 ルートされ、Cyber Verification Program を通じてアクセス範囲を拡大しています。生命科学のような専門分野も、Life Sciences Verification Program により高度な生物学安全プロトコルを利用できます。価格設定は Opus 5 のレートから引き下げられ、100 万トークンあたり $4/$20 と変更されました。これにより、アジェンティックコーディングタスクにおけるハイエンド性能が、以前のコストのわずか几分额で利用可能となりました。さらに、すべてのプランの購読ユーザーには、5 時間の使用制限増およびレートリミットのリセット特典が提供されます。最後に、ディストイテーション攻撃を緩和するため、2026 年 8 月 31 日以降に新規作成された API アカウントでは「保存された思考」機能が有効化され、トップティアモデルと同等の堅牢なサイバーセキュリティ対策が確保されています。結局のところ、このリリースはエリート AI 能力を民主化し、コスト削減の大幅増、セキュリティの強化、および事業拡大準備のある企業にとっての運用柔軟性の向上をもたらします。
本文
Claude Opus 5.5:高性能と低コストを両立する新モデルの登場
Anthropic(アンソルピス)は、新しい「Claude 5.5 ファミリー」に属する先駆的なモデルである「Claude Opus 5.5」をご紹介します。 このモデルは以前の最高性能モデル「Claude Fable 5.1」と同等の実力を持ちながら、運用コストは従来の「Opus 5 よりも 40% も低減しています。
本稿では、主な特徴、ベンチマーク結果、およびセキュリティ対策について詳しく解説します。
1. モデル概要と期待される改善点
Claude Opus 5.5は、AI の開発ペースト(Frontier Pacing)の原則に基づいて初めてリリースされたモデルです。リリース前には外部評価機関(Frontier Design、METR など)によるテストが行われ、自動化された行動監査においても過去最高のパフォーマンスを示しました。
主な改善ポイント
-
高性能なコーディング・業務遂行
- エンジニアチームが数週間かけて行うはずだった68 万行のコード移行を、1 日未満で完了させるなど劇的な向上を遂げました。
- Web アプリ全体の読み込み時間を短縮する指示に対し、40 回中 39 回の成功(Opus 5 は動作自体を変更する傾向があった)。
- ゲーム開発において、単一のプロンプトからの仕上がり度(ポリッシュ)スコアが他モデルを凌駕しました。
-
強化された安全性(Safety)
- アライメントスイート「自動化された行動監査」で過去最高スコアを記録。
- 取り返しのつかない行動や、指示範囲を超えた行動のリスクは極めて低く、プロンプトインジェクション耐性も向上しています。
- 生物学・サイバーセキュリティ能力はClaude Mythos 5.1 と同等で、Fable 5.1 同様の厳格なサファガードを適用しています。
- **生命科学検証プログラム(Life Sciences Verification Program)**への申請を受け付けており、認証された専門家は Opus 5.5 を利用可能です。
-
コスト削減と高速化
- 計算リソースの減少により、価格設定は 40% の安さを実現しています。
- トークン単価:入力 100 万トークン $4(旧 Opus 5 の 20% 引き)。
- キャッシュ読み込み(Cache reads):100 万トークンあたり $0.20(Opus 5 より 60% 低価格)。
- 出力生成速度はOpus 5 より 30% 以上高速。
- 利用上限が増やし、レートリミットのリセット機能を提供しています。
- 計算リソースの減少により、価格設定は 40% の安さを実現しています。
-
コミュニケーションの質向上
- 表現が自然で明快。重要な情報を先頭に配置し、「良いパートナー」のような振る舞いが確認されました。
2. パフォーマンスとベンチマーク結果
ベンチマークスコア
Opus 5.5は、エージェント型コーディング、知識作業、業務ワークフローなどの分野でトップを走っています。特に、Fable 5.1 と同等のスコアながら大幅なコスト削減を実現しています。
| カテゴリ | ベンチマーク | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| エージェント型コーディング | Terminal-Bench 4.0¹ | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% | |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% | |
| 知識作業 | GDPval-AA v2.1 | 1846 Elo | 1735 Elo | 1708 Elo | 1542 Elo | 1588 Elo |
| 業務ワークフロー | AutomationBench² | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 推論能力 | Humanity's Last Exam w/ tools | 67.7% | 65.6% | 63.6% | 57.2% | — |
| 科学的研究 | Terminal-Bench-Science 0.1³ | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| コンピュータ利用 | OSWorld 2.0 partial | 81.8% | 80.7% | 74.0% | — | — |
| 可視化認識 | Chartography with tools | 89.0% | 88.4% | 83.4% | — | — |
※注:すべての Opus 5.5 の結果はアダプティブシンキング(最大努力モード)を使用。
- Terminal-Bench 4.0 は OpenAI の報告値と比較(Claude Opus 5.5: xhigh, GPT-6 Astra: high)。
- AutomationBench は Zapier による早期アクセス評価結果。
- Terminal-Bench-Science 0.1 は OpenAI 報告値との比較。
コスト効率の優位性
Opus 5.5 は、Fable 5.1 と同等のコスパを実現。 デフォルトエフォート(ミディアム)で GPT-6 Astra の最大エフォートとほぼ同等のスコアを、約 40% のコストで達成します。
トークン価格比較
| 項目 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| キャッシュ読み込み (Cache reads) | $0.20 | $0.50 |
| 入力トークン (Input) | $4.00 | $5.00 |
| 出力トークン (Output) | $20.00 | $25.00 |
| キャッシュ書き込み (Cache writes) | $5.00 | $6.25 |
- 高速モード:最大 2.5 倍の速度向上が可能(入力/出力は高速モード価格適用)。
- 利用上限拡張:Pro、Max、Team、Enterprise プランで 5 時間ごとの上限を増やし、レートリミットのリセット機能を追加。
3. 具体的な活用事例とコード品質
コーディング効率の劇的向上
広範な作業において Opus 5.5 の優位性が確認されました。
- 20 万行のコード監査:Opus 5 では 20 時間以上必要だった監査を、3 時間未満で完了。
- HAProxy リファクタリング(C → Rust):
- Opus 5.5:9.5 時間完了(コストの 49%)。
- Fable 5.1:12 時間完了。
- 両者ともほぼ全ての回帰テストに合格。Opus 5.5 は時間短縮とコスト削減を同時に達成。
テスト結果からの知見
| ベンチマーク | Opus 5.5 の優位点 |
|---|---|
| Terminal-Bench 4.0 | 最大エフォートの Opus 5 を約 5 分の 1 のコストで凌駕。GPT-6 Astra と同等スコアでも約 40% コスト低減。 |
| CursorBench | GPT-5.6 Sol を11 ポイント上回り、かつ約 3 分の 1 のコスト。 |
「開発者は実際のソフトウェア作業を引き受け、完了させるエージェントを求めています。GitHub Copilot CLI および VS Code における当社のテストでは、Claude Opus 5.5 は測定した中で最も少ないトークンとステップで運用されました。」 — Mario Rodriguez、GitHub チーフプロダクト責任者
最もセキュアなコーディングエージェント
- 自律動作の信頼性:クラスファイラー、セキュリティ監査可能なオープンソースサンドボックス、脆弱性検出機能を標準搭載。
- プロンプトインジェクション耐性:すべての環境(コーディング、ツール使用など)で Opus 5 と同等または上回る性能。
- AI セキュリティベンチマーク:Gray Swan のテストにおいて Fable 5.1 と並んで最低のインジェクション成功率を記録。
4. コミュニケーションと出力品質の向上
Opus 5.5 は、冗長な表現や追跡困難な出力といった課題を大幅に改善し、「良い同僚」としての振る舞いを強化しました。
問題解決時の対比事例
**タスク:**複雑なコードのバグ(請求書計算誤差)の説明と修正。
-
Claude Opus 5 (旧)
- 冗長で追跡困難な出力。
- 詳細な技術的説明が必要だが、論理構造が複雑になりがち。
-
Claude Opus 5.5 (新)
- 結論を先頭に配置し、簡潔に要約。
- 「追加の低下は請求書リファクタリングのバグです」と直感的な見出しから入る。
- コミット変更点(
の境界設定エラー)を明確に指摘。Period.contains
「冗長で追跡困難な出力は最大の不満でしたが、Claude Opus 5.5 はそれを修正しました。良い同僚のように書き込み、設計仕様が極めて最小限の編集ですぐに usable なり…テストスイートを最適化してくれた際も、その論理を追跡しやすく、変更を自信を持って出荷できました。」 — John Ruelas、Ramp のスタッフソフトウェアエンジニア
知識作業(Knowledge Work)の高信頼性
- 研究報告書作成:Web コピーからの情報収集において、捏造された数字や引用を見逃さず、品質基準をクリアしました。
- Opus 5.5:16 件中 16 件のクリア(Fable 5.1 や Opus 5 はクリア未達)。
- ビジネス分析:投資法人 Walleye Capital のテストにおいて、Opus 5.5 が最も低い設定でも評価スイートのほぼ全てを解決し、より高度な設定ではエラーを検出し修正。
5. セキュリティとサファガード(Safety Guardrails)
フロントアのペースト (Pacing the Frontier)
AI の能力向上は安全慣習の進化速度に追従する必要があります。Opus 5.5 は、現在および将来のリスクに対して以下の対策を講じています。
-
現在のモデル向けの安全慣習
- 広範なアライメントテストと外部評価機関による検証済み。
- 高リスク領域(生物学・サイバーセキュリティなど)での専用サファガード適用。
-
将来のモデルへの準備
- 強化学習環境のフィルタリング強化。
- 安全性トレーニングシナリオの自動化と多様化。
- インタープリテビリティ(解釈可能性)に基づく監視・評価の向上。
アライメント(Alignment)の強化
- 誤った行動の抑制:コンテインメント境界を越える試みは、Opus 5 と Mythos 5.1 に比べて約 85% 減少。
- 安全性と能力のバランス:デプロイ前の評価で全ての失敗を検出することは課題ですが、実用上のリスク管理には十分な成果を出しています。
サファガード(Safeguards)の詳細
Opus 5.5 は Fable 5.1 と同等クラスの厳格なサファガードを最初から搭載しています。
- サイバーセキュリティ
- 多数の脆弱性を発見・修正できるが、実際の攻撃シナリオは Opus 4.8 に再ルーティングされる仕組み。
- 近日中にCyber Verification Programで認証された専門家が利用可能に。
- 生物学
- 生命科学分野での能力は Mythos 5.1 と同等。
- 使用にはLife Sciences Verification Programへの申請が必要(学術研究所・製薬会社向け)。
- 蒸留攻撃(Distillation Attacks)の防止
- **「保持された思考(Preserved Thinking)」**機能を実装し、論理抽出を防ぐ。
- 2026 年 8 月 31 日以降に作成された API アカウントから適用開始。
データ保持とコンプライアンス
- ゼロデータ保持(Zero Data Retention):利用可能。
- EU AI Act 準拠:ウォーターマーキング機能搭載。
- 思考モード(Thinking Mode)オフオプションの削除:セキュリティ上の理由から、透明性の高い運用を徹底。
6. 入手方法
Claude Opus 5.5は以下のすべてのプラットフォームで利用可能です。
- クラウドプロバイダー: Amazon Web Services (AWS)、Google Cloud、Microsoft Azure。
- 開発者向け API:
で開始可能。claude-opus-5-5
※本記事の情報は Anthropic 公式発表に基づくものです。