Claude Opus 5.5

2026/09/23 1:29

Claude Opus 5.5

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

Anthropic は、新しい Claude 5.5 ファミリーにおける初モデルである Claude Opus 5.5 を導入しました。このモデルは、エリート「Fable」モデルと同等の性能を維持しつつ、大幅なコスト削減(一般的なタスクでは最大 40% のコスト低減、特定のコーディングタスクでは出力速度向上に伴い約 51% のコスト削減)を提供します。このリリースは、Anthropic が「フロンティアを調整する」という戦略的転換を示すものであり、外部評価機関である Frontier Design と METR による検証也得到了確認です。性能向上により、企業は数週間かかっていた大規模なコード移行を数日(例:68 万行のコード移行が 1 日以内に完了)で実行可能にされ、約 40 の複雑な Web ページの読み込み時間を改善できます。

安全性とセキュリティは最優先事項であり、Opus 5.5 はアライメントスコアの向上、プロンプトインジェクションに対する耐性、そして不可逆的な動作が起きる可能性の低減を示しています。サイバーセキュリティ対策として、Fable 5.1 と同等の safeguards が導入されており、多くのタスクは高レベルのセキュリティを持つ Opus 4.8 ルートされ、Cyber Verification Program を通じてアクセス範囲を拡大しています。生命科学のような専門分野も、Life Sciences Verification Program により高度な生物学安全プロトコルを利用できます。価格設定は Opus 5 のレートから引き下げられ、100 万トークンあたり $4/$20 と変更されました。これにより、アジェンティックコーディングタスクにおけるハイエンド性能が、以前のコストのわずか几分额で利用可能となりました。さらに、すべてのプランの購読ユーザーには、5 時間の使用制限増およびレートリミットのリセット特典が提供されます。最後に、ディストイテーション攻撃を緩和するため、2026 年 8 月 31 日以降に新規作成された API アカウントでは「保存された思考」機能が有効化され、トップティアモデルと同等の堅牢なサイバーセキュリティ対策が確保されています。結局のところ、このリリースはエリート AI 能力を民主化し、コスト削減の大幅増、セキュリティの強化、および事業拡大準備のある企業にとっての運用柔軟性の向上をもたらします。

本文

Claude Opus 5.5:高性能と低コストを両立する新モデルの登場

Anthropic(アンソルピス)は、新しい「Claude 5.5 ファミリー」に属する先駆的なモデルである「Claude Opus 5.5」をご紹介します。 このモデルは以前の最高性能モデル「Claude Fable 5.1」と同等の実力を持ちながら、運用コストは従来の「Opus 5 よりも 40% も低減しています。

本稿では、主な特徴、ベンチマーク結果、およびセキュリティ対策について詳しく解説します。


1. モデル概要と期待される改善点

Claude Opus 5.5は、AI の開発ペースト(Frontier Pacing)の原則に基づいて初めてリリースされたモデルです。リリース前には外部評価機関(Frontier Design、METR など)によるテストが行われ、自動化された行動監査においても過去最高のパフォーマンスを示しました。

主な改善ポイント

  • 高性能なコーディング・業務遂行

    • エンジニアチームが数週間かけて行うはずだった68 万行のコード移行を、1 日未満で完了させるなど劇的な向上を遂げました。
    • Web アプリ全体の読み込み時間を短縮する指示に対し、40 回中 39 回の成功(Opus 5 は動作自体を変更する傾向があった)。
    • ゲーム開発において、単一のプロンプトからの仕上がり度(ポリッシュ)スコアが他モデルを凌駕しました。
  • 強化された安全性(Safety)

    • アライメントスイート「自動化された行動監査」で過去最高スコアを記録。
    • 取り返しのつかない行動や、指示範囲を超えた行動のリスクは極めて低く、プロンプトインジェクション耐性も向上しています。
    • 生物学・サイバーセキュリティ能力はClaude Mythos 5.1 と同等で、Fable 5.1 同様の厳格なサファガードを適用しています。
    • **生命科学検証プログラム(Life Sciences Verification Program)**への申請を受け付けており、認証された専門家は Opus 5.5 を利用可能です。
  • コスト削減と高速化

    • 計算リソースの減少により、価格設定は 40% の安さを実現しています。
      • トークン単価:入力 100 万トークン $4(旧 Opus 5 の 20% 引き)。
      • キャッシュ読み込み(Cache reads):100 万トークンあたり $0.20(Opus 5 より 60% 低価格)。
    • 出力生成速度はOpus 5 より 30% 以上高速。
    • 利用上限が増やし、レートリミットのリセット機能を提供しています。
  • コミュニケーションの質向上

    • 表現が自然で明快。重要な情報を先頭に配置し、「良いパートナー」のような振る舞いが確認されました。

2. パフォーマンスとベンチマーク結果

ベンチマークスコア

Opus 5.5は、エージェント型コーディング、知識作業、業務ワークフローなどの分野でトップを走っています。特に、Fable 5.1 と同等のスコアながら大幅なコスト削減を実現しています。

カテゴリベンチマークOpus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
エージェント型コーディングTerminal-Bench 4.0¹66.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%—41.7%
知識作業GDPval-AA v2.11846 Elo1735 Elo1708 Elo1542 Elo1588 Elo
業務ワークフローAutomationBench²40.0%31.4%26.9%41.4%28.8%
推論能力Humanity's Last Exam w/ tools67.7%65.6%63.6%57.2%—
科学的研究Terminal-Bench-Science 0.1³58.7%52.6%29.0%64.6%22.4%
コンピュータ利用OSWorld 2.0 partial81.8%80.7%74.0%——
可視化認識Chartography with tools89.0%88.4%83.4%——

※注:すべての Opus 5.5 の結果はアダプティブシンキング(最大努力モード)を使用。

  1. Terminal-Bench 4.0 は OpenAI の報告値と比較(Claude Opus 5.5: xhigh, GPT-6 Astra: high)。
  2. AutomationBench は Zapier による早期アクセス評価結果。
  3. Terminal-Bench-Science 0.1 は OpenAI 報告値との比較。

コスト効率の優位性

Opus 5.5 は、Fable 5.1 と同等のコスパを実現。 デフォルトエフォート(ミディアム)で GPT-6 Astra の最大エフォートとほぼ同等のスコアを、約 40% のコストで達成します。

トークン価格比較

項目Claude Opus 5.5Claude Opus 5
キャッシュ読み込み (Cache reads)$0.20$0.50
入力トークン (Input)$4.00$5.00
出力トークン (Output)$20.00$25.00
キャッシュ書き込み (Cache writes)$5.00$6.25
  • 高速モード:最大 2.5 倍の速度向上が可能(入力/出力は高速モード価格適用)。
  • 利用上限拡張:Pro、Max、Team、Enterprise プランで 5 時間ごとの上限を増やし、レートリミットのリセット機能を追加。

3. 具体的な活用事例とコード品質

コーディング効率の劇的向上

広範な作業において Opus 5.5 の優位性が確認されました。

  • 20 万行のコード監査:Opus 5 では 20 時間以上必要だった監査を、3 時間未満で完了。
  • HAProxy リファクタリング(C → Rust):
    • Opus 5.5:9.5 時間完了(コストの 49%)。
    • Fable 5.1:12 時間完了。
    • 両者ともほぼ全ての回帰テストに合格。Opus 5.5 は時間短縮とコスト削減を同時に達成。

テスト結果からの知見

ベンチマークOpus 5.5 の優位点
Terminal-Bench 4.0最大エフォートの Opus 5 を約 5 分の 1 のコストで凌駕。GPT-6 Astra と同等スコアでも約 40% コスト低減。
CursorBenchGPT-5.6 Sol を11 ポイント上回り、かつ約 3 分の 1 のコスト。

「開発者は実際のソフトウェア作業を引き受け、完了させるエージェントを求めています。GitHub Copilot CLI および VS Code における当社のテストでは、Claude Opus 5.5 は測定した中で最も少ないトークンとステップで運用されました。」 — Mario Rodriguez、GitHub チーフプロダクト責任者

最もセキュアなコーディングエージェント

  • 自律動作の信頼性:クラスファイラー、セキュリティ監査可能なオープンソースサンドボックス、脆弱性検出機能を標準搭載。
  • プロンプトインジェクション耐性:すべての環境(コーディング、ツール使用など)で Opus 5 と同等または上回る性能。
  • AI セキュリティベンチマーク:Gray Swan のテストにおいて Fable 5.1 と並んで最低のインジェクション成功率を記録。

4. コミュニケーションと出力品質の向上

Opus 5.5 は、冗長な表現や追跡困難な出力といった課題を大幅に改善し、「良い同僚」としての振る舞いを強化しました。

問題解決時の対比事例

**タスク:**複雑なコードのバグ(請求書計算誤差)の説明と修正。

  • Claude Opus 5 (旧)

    • 冗長で追跡困難な出力。
    • 詳細な技術的説明が必要だが、論理構造が複雑になりがち。
  • Claude Opus 5.5 (新)

    • 結論を先頭に配置し、簡潔に要約。
    • 「追加の低下は請求書リファクタリングのバグです」と直感的な見出しから入る。
    • コミット変更点(
      Period.contains
      の境界設定エラー)を明確に指摘。

「冗長で追跡困難な出力は最大の不満でしたが、Claude Opus 5.5 はそれを修正しました。良い同僚のように書き込み、設計仕様が極めて最小限の編集ですぐに usable なり…テストスイートを最適化してくれた際も、その論理を追跡しやすく、変更を自信を持って出荷できました。」 — John Ruelas、Ramp のスタッフソフトウェアエンジニア

知識作業(Knowledge Work)の高信頼性

  • 研究報告書作成:Web コピーからの情報収集において、捏造された数字や引用を見逃さず、品質基準をクリアしました。
    • Opus 5.5:16 件中 16 件のクリア(Fable 5.1 や Opus 5 はクリア未達)。
  • ビジネス分析:投資法人 Walleye Capital のテストにおいて、Opus 5.5 が最も低い設定でも評価スイートのほぼ全てを解決し、より高度な設定ではエラーを検出し修正。

5. セキュリティとサファガード(Safety Guardrails)

フロントアのペースト (Pacing the Frontier)

AI の能力向上は安全慣習の進化速度に追従する必要があります。Opus 5.5 は、現在および将来のリスクに対して以下の対策を講じています。

  1. 現在のモデル向けの安全慣習

    • 広範なアライメントテストと外部評価機関による検証済み。
    • 高リスク領域(生物学・サイバーセキュリティなど)での専用サファガード適用。
  2. 将来のモデルへの準備

    • 強化学習環境のフィルタリング強化。
    • 安全性トレーニングシナリオの自動化と多様化。
    • インタープリテビリティ(解釈可能性)に基づく監視・評価の向上。

アライメント(Alignment)の強化

  • 誤った行動の抑制:コンテインメント境界を越える試みは、Opus 5 と Mythos 5.1 に比べて約 85% 減少。
  • 安全性と能力のバランス:デプロイ前の評価で全ての失敗を検出することは課題ですが、実用上のリスク管理には十分な成果を出しています。

サファガード(Safeguards)の詳細

Opus 5.5 は Fable 5.1 と同等クラスの厳格なサファガードを最初から搭載しています。

  • サイバーセキュリティ
    • 多数の脆弱性を発見・修正できるが、実際の攻撃シナリオは Opus 4.8 に再ルーティングされる仕組み。
    • 近日中にCyber Verification Programで認証された専門家が利用可能に。
  • 生物学
    • 生命科学分野での能力は Mythos 5.1 と同等。
    • 使用にはLife Sciences Verification Programへの申請が必要(学術研究所・製薬会社向け)。
  • 蒸留攻撃(Distillation Attacks)の防止
    • **「保持された思考(Preserved Thinking)」**機能を実装し、論理抽出を防ぐ。
    • 2026 年 8 月 31 日以降に作成された API アカウントから適用開始。

データ保持とコンプライアンス

  • ゼロデータ保持(Zero Data Retention):利用可能。
  • EU AI Act 準拠:ウォーターマーキング機能搭載。
  • 思考モード(Thinking Mode)オフオプションの削除:セキュリティ上の理由から、透明性の高い運用を徹底。

6. 入手方法

Claude Opus 5.5は以下のすべてのプラットフォームで利用可能です。

  • クラウドプロバイダー: Amazon Web Services (AWS)、Google Cloud、Microsoft Azure。
  • 開発者向け API:
    claude-opus-5-5
    で開始可能。

※本記事の情報は Anthropic 公式発表に基づくものです。

同じ日のほかのニュース

一覧に戻る →

2026/09/23 2:46

「我々はFBIをハッキングした」:ハッカーたちは、彼らがFBIのすべての職員に関するデータを入手していると主張している。

## Japanese Translation: ShinyHunters というハッキンググループは、複数の FBI 関連サービスの侵入に成功し、全ての現在在职員および申請者に関する包括的なデータを盗んだと主張している。同グループの代表者は 404 Media にこの事案を確認した上で、「盗まれた情報には、氏名、自宅住所、電話番号、エージェント配偶者に関するデータなどといった個人情報も含まれている」と述べている。今回の漏洩は深刻なものであり、ShinyHunters は国家安全保障や対諜報活動への危害を目的としてデータを悪用することが知られているため、もしこのデータが悪意ある行為者に入手されると、FBI の職員が物理的な安全に直ちに脅かされ、国外の諜報機関が Am りカンの運用手法を理解するために今回の侵入を悪用する可能性もある。また、同グループのネットワーク内に存在する犯罪者は、過去に盗まれた記録を利用して法執行官を物理的に特定・追跡し、威嚇しており、エージェントとその配偶者に対して深刻な脅威となっている。専門家らは、FBI の職員や内部関係者に対し、直ちに Signal(ID: joseph.404)または電子メール(joseph@404media.co)を通じて 404 Media に連絡するよう要請している。今回の侵入の具体的な範囲に関する詳細な技術情報は、404 Media プラットフォームの有料会員(あるいは同プラットフォームの無料会員)のみが閲覧できるまま制限されている。

2026/09/22 22:52

OpenAI の GPT–6「Astra」が、2005 年以来解決されなかったエニグマの暗号文を解読した

## Japanese Translation: 2026 年 9 月 15 日、GPT–6 Astra は、1941 年 7 月 10 日に送信されたドイツ軍エニigma暗号の文 MVUEH を成功裡に復号化し、2005 年以来続く謎を解決した。カーター・レファーは、AI にクリプトセルラーリサーチウェブページの未解読メッセージを分析させるよう指示を与えたところ、AI は MVUEH(Nr. 172)を選択して対象とした。AI は独自に開発された Python および C++ ソフトウェアを使用してエニigmaの設定をシミュレートし、以前に解決済みの文 Nr. 173 (SIPVX) との関係性を特定するとともに、平文のパターン「ROSENOW ROSENOW」を crib(推測文)として利用した。最も重要なのは、AI が暗号文における微妙な転記エラーを検出した点であり、その中には第 72 の文字で発生した異常なローターの回転など、以前の人間による試みを阻害しかねる要因が含まれていた。従来の同様のメッセージに対する失敗が鍵の未考慮や差異などに起因していたのに対し、Astra はこの独特なローター構成および不具合を 2 日以内に克服し、人間研究者が数ヶ月かかる結果を得た。復号化の後、研究者たちは連邦アーカイフ(特に巻 RS 3–3/20a および RS 3–3/63b)から関連するアーカイブログを発見し、残りの無線電文の全巻について分析を完全に自動化した。フロデ・ヴァイエルユッドのような専門家らは、以前は数ヶ月かかっていたタスクが数日で完了したことは事実であるが、AI は専門家の暗号解析官にとって強力なパートナーでありながら、絶え間ない人間の介入を必要としないとして指摘した。9 月 19 日のアップデートでは、この成果を「非常に驚くべきこと」と形容し、ヴァイエルユッドは同様の画期的成果に感銘を受けていることを表明した。

2026/09/21 10:07

ReBarUEFI:ほぼすべての UEFI システム向けにレジザブル BAR を提供

## 日本語翻訳: 元の要約は簡潔で正確であり、理解しやすいため、改善の必要はありません。 ## 翻訳対象のテキスト: The original summary is concise, accurate, and easy to understand; no improvement is necessary.