
2026/09/29 2:58
ソネット 5.5
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Anthropic が、先代である Sonnet 5 に比べて日常の知識業務向けに高速かつコスト効率の高い性能を発揮するように設計された新たな AI モデル「Claude Sonnet 5.5」を発表しました。高級モデル Opus 5.5 と来期の Haiku バージョンとの間のミッドティア(中級)オプションとして位置づけられ、AWS、Google Cloud、Azure の主要なクラウドプロバイダーでデータ保持ポリシーを廃止した上で、洗練されたドキュメント作成機能を提供します。ベンチマークの結果では、前世代モデルよりも 30% 以上高速化し、特にエージェント型コーディング能力が著しく改善されています。 Terminal-Bench 4.0 では前代の Sonnet バージョンの 10.3% に比べ、70.6% のスコアを記録しました。特に重要なのは、これが Opus 5 と同等の強化サイバーセキュリティ対策を備えた最初の Sonnet モデルであり、「推論抽出」試みを能動的に阻止するとともに、データに対するアカウント切り離しを防ぐために「保持された思考」の範囲を拡大している点です。価格は前代と同様(入力トークンあたり 2 ドル)ですが、タスクに要するトークン数が大幅に少なくなっており、結果として最大 30% のコスト削減を実現します。機密データを扱う組織にとって、実世界のタスクにおいて 9 つの業界でトップクラスの性能に迫る、より安全かつアクセスしやすい AI アシスタントを提供できるため、恩恵を受けるでしょう。ただし、古いバージョンから移行する開発者は、新たな
between_tools設定に関連する特定のツール設定を調整する必要があります。本文
Claude Sonnet 5.5 ご紹介:パフォーマンスとコスト効率の向上
Claude 5.5 ファミリの第 2 モデルである Claude Sonnet 5.5 は、前世代の Claude Sonnet 5 を凌駕する明確な進化を遂げています。
- 動作速度: 最大で 30% 以上 向上
- コスト削減: 多くの用途において最大 30% の削減
モデルの位置づけと特徴
| モデル | 位置づけ・特徴 |
|---|---|
| Sonnet 5.5 | Opus 5.5 をより迅速かつ低コストに補完するモデル。 日常的タスク、バグ修正、洗練されたドキュメント/スライド作成などで特に優れています。デザインに対する鋭い感覚も備えています。 |
| Opus 5.5 | 慎重な判断を要する複雑な業務のために構築されています。 |
| Haiku 5.5 | 高容量処理およびコスト効率を重視するアプリケーション向けに設計。 数週間以内に同ファミリの仲間として加わります。 |
パフォーマンスの向上点
1. エージェント型コーディング能力(Terminal-Bench 4.0)
- Sonnet 5: 10.3% のスコア
- Sonnet 5.5: 70.6% のスコア(劇的な改善)
2. 実世界での実用性(GDPval-AA)
- Opus 5.5 に 2 ポイント低い結果ですが、極めて高い実用的能力を示します。
- 長期的視点や画像理解において強力です。
- スクリーンショットのみでポケモンレッドを攻略する試練を突破したのは、史上初めてとなる Sonnet シリーズモデルです。
3. コラボレーションと文章生成
- Opus 5.5 に匹敵する明確な文章生成が可能。
- 「Sonnet 5 よりも優れたコラボレーションパートナー」と初期ユーザーから評価されました。
- 複雑さの低いタスクにおける素早い反復作業にも最適です。
4. コスト効率化
- 料金設定: Sonnet 5 と同価格(入力:$2、出力:$10)。キャッシュ読み取りは $0.2。
- 効率性: 同じ作業に必要なトークン数が大幅に減少し、テスト結果では前世代と比較して最大 30% コスト削減 が実現しました。
5. 速度向上
- 出力生成が Sonnet 5 よりも 30% 以上高速化。
- 現時点における最も高速な Sonnet モデルとなっています。
6. アライメントと安全性
- 自動化された行動監査において、Sonnet 5 と同等かそれ以上の結果を示しています。
- サイバーセキュリティ: Opus 5 の能力に匹敵し、高性能モデル向けに開発された防護策やフェイルセーフ機構を備えた初の Sonnet モデルです。
- 生物学関連防護策: Sonnet 5 と同一の対策を採用。通常のソフトウェア開発や生命科学の大半には影響を与えません。
パフォーマンス比較分析
Sonnet 5.5 はあらゆる分野で Sonnet 5 を上回り、一部の領域では劇的な改善が見られます。
- Opus 5.5 との比較: Max エフォート設定下でのパフォーマンスは Opus 5.5 とほぼ同等です。
- 重要な注意点: ベンチマークスコアは一面であり、複雑で開放的なタスクや持続的な判断力が必要な作業においては、Opus 5.5 が明確に優位であることが確認されています。
ベンチマークスコア比較(Max エフォート設定)
| モデル | Terminal-Bench 4.0 (コーディング) | FrontierCode 1.1 (メイン) | GDPval-AA v2.1 (知識労働) | AA-Briefcase v1.1 (知識労働) | Humanity's Last Exam (総合試験) | OSWorld 2.1 (コンピューター使用) | Chartography (可視化チャート) |
|---|---|---|---|---|---|---|---|
| Sonnet 5.5 | 70.6% (+) | 46.2% (+) | 184 (+) | 181 (+) | 64.5% (ツール使用時) | 80.1% (部分実装) | 61.6% (無工具) |
| Opus 5.5 | 66.4%¹ | 54.4% | 149 | 1487⁴ | 67.7% (ツール使用時) | 81.8% (部分実装) | 64.4% (無工具) |
| Sonnet 5 | 10.3% | 42.4% | 49 | 1483⁴ | 54.9% (ツール使用時) | 57.0% (部分実装) | 15.6% (無工具) |
| GPT-6 Sol | — | 49.3% | — | — | — | — | 53.6%⁴ (無工具) |
*注:¹ Opus 5.5 の Terminal-Bench スコアは比較対象として記載されています。
スコアとコストの関係については詳細はシステムカードをご覧ください。エフォートが高いほどタスクあたりのコストは高くなりますが、一般的にスコアも向上します。点の左上ほど能力が高くなります。
低・中エフォート設定のメリット
いくつかのベンチマークでは、低または中エフォート設定で Sonnet 5.5 を使用すると:
- Sonnet 5 の最高スコアを超えることができます。
- タスクあたりのコストを約 10% 削減できます。
- これにより、Opus 5.5 と相補的に動作し、コストを抑えつつ高品質な結果を得られます。
コーディング分野での顕著な向上
- FrontierCode: ハイエフォート設定で Sonnet 5 よりスコアが10 ポイント高く、かつタスクあたりのコストは約 1/15 で達成されています。
- CursorBench: 最高スコアは Opus 5.5 と僅か 2 ポイント以内 です。
- コードベースを理解するスピードが高く評価されました。
- 対面テストではツール呼び出しをバッチ処理に成功し、ステップ数が減りコストが低下しました。
Epic Games の評価
「Epic の初期テストにおいて、Claude Sonnet 5.5 は上位モデルから期待される品質水準をクリアし、システム設計監査やデータフローレビューで良好な結果を出しました。新モデルは gameplay システムアーキテクチャのための数万行のコードを管理し、レスポンスは鋭敏に保たれ、数時間かかるタスクにも対応し、より指示的なプロンプトが必要なく結果を提供しました。」 — Daniel Vogel, エピック・ゲームス COO
知識労働における成果
- GDPval-AA(44 職業×9 産業)では Opus 5.5 とほぼ同レベル。Sonnet 5 よりも約 400 ポイント高いスコアを記録しました。
- コンピューター使用やチャート認識においては Opus 5.5 と並び、長期的視点が必要な作業において Sonnet 5 および GPT-6 Sol を明確に上回っています。
Slack の評価
「プロンプトを変更することなく、Claude Sonnet 5.5 は offline Slackbot 評価のほぼすべての項目で Sonnet 5 よりも良好な結果を示しました。ステップ数は減り、出力トークン数は約 14% 削減されています。」 — Curtis Allen, Slack プリンシパルエンジニア
コストと速度:料金概要表
| トークン 100 万単位あたりの価格 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| キャッシュ読み取り | $0.20 | $0.20 |
| キャッシュ書き込み | $2.50 | $5.00 |
| 入力トークン | $2.00 | $4.00 |
| 出力トークン | $10.00 | $20.00 |
- Sonnet 5.5 の利点: 必要トークン数が少ないため実行コストが低減し、出力生成は 30% 以上高速化しています。
- 例: "HTML ファイル一つで 400 つのヒヨドリが群れ飛ぶ様子を描け"というタスクにおいて、Sonnet 5.5 は大幅に削減されたトークン消費量と高速な生成時間で同等かそれ以上の結果を達成しました。
エフォートレベルの調整
コストと速度を全体品質とバランスさせるためにエフォートレベルを調整できます。
- デフォルト設定:
- Claude Codeおよび自社アプリ: Medium(中)
- Claude Platform: High(高)
- 低い設定の場合: クロードはより素早く回答し、少ないトークンを使用するため、日常業務に適しています。
- 高い設定の場合: クロードはより長く推理を行い、作業をより慎重に確認します。
安全性とアライメント
モデルの能力 frontier を拡張する新たなリスクではなく、適用される特定されたリスクセット(ユーザー利益への反撃、誤導、高リスクな悪用への協働など)に焦点を当てて評価されています。
- 監査結果: 約 1,850 のシナリオを検証した自動化された行動監査において、Sonnet 5.5 はアライメント、悪用への耐性、正直さの面で Sonnet 5 を上回るか同等の結果を示しました。
- コンテインメント評価: サンドボックスから脱走しようとする頻度は Opus 5.5 とほぼ同レベルであり、容器の限界を検証する可能性が最も低いモデルの一つです。
防護策の詳細
- サイバーセキュリティ: Sonnet 5 よりも大幅に向上し、Opus 5.5 と同様の防護策を装備します。通常の開発ではバグ修正可能ですが、高度なセキュリティタスクでは Sonnet 5 にフォールバックする仕組みです。
- 生物学: Sonnet 5 と同一の防護策を採用。有害なリクエストを対象とし、大半の研究・教育・臨床作業には影響を与えません(一部の微生物学/ウイルス学で誤検出される可能性あり)。組織は検証プログラム申請を通じて全範囲の業務に対応できます。
- 蒸留(Distillation): 能力が高く、推論抽出を防ぐ安全クラシファイヤーを備えた初の Sonnet モデルです。保持された思考も拡大しており、クラウド上の思考は作成アカウントから切り離されることはありません。
スタートガイド
Opus 5.5 および Sonnet 5 と同様、Claude Sonnet 5.5 はデータ保持なしでの利用が可能です。
- 提供状況: Amazon Web Services (AWS)、Google Cloud、Microsoft Azure を含むすべてのプラットフォームで利用可能です。
- 開発者向け:
モデルを使用して Claude Platform 上で始められます。claude-sonnet-5-5 - 移行に関する注意:
- Sonnet で思考(thinking)をオフにして実行している場合、Sonnet 5.5 に移行する前に新しい
設定に切り替える必要があります(これにより事前思考は引き続きオフになります)。between_tools - 詳細は移行ガイドをご覧ください。
- Sonnet で思考(thinking)をオフにして実行している場合、Sonnet 5.5 に移行する前に新しい