ソネット 5.5

2026/09/29 2:58

ソネット 5.5

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

Anthropic が、先代である Sonnet 5 に比べて日常の知識業務向けに高速かつコスト効率の高い性能を発揮するように設計された新たな AI モデル「Claude Sonnet 5.5」を発表しました。高級モデル Opus 5.5 と来期の Haiku バージョンとの間のミッドティア(中級)オプションとして位置づけられ、AWS、Google Cloud、Azure の主要なクラウドプロバイダーでデータ保持ポリシーを廃止した上で、洗練されたドキュメント作成機能を提供します。ベンチマークの結果では、前世代モデルよりも 30% 以上高速化し、特にエージェント型コーディング能力が著しく改善されています。 Terminal-Bench 4.0 では前代の Sonnet バージョンの 10.3% に比べ、70.6% のスコアを記録しました。特に重要なのは、これが Opus 5 と同等の強化サイバーセキュリティ対策を備えた最初の Sonnet モデルであり、「推論抽出」試みを能動的に阻止するとともに、データに対するアカウント切り離しを防ぐために「保持された思考」の範囲を拡大している点です。価格は前代と同様(入力トークンあたり 2 ドル)ですが、タスクに要するトークン数が大幅に少なくなっており、結果として最大 30% のコスト削減を実現します。機密データを扱う組織にとって、実世界のタスクにおいて 9 つの業界でトップクラスの性能に迫る、より安全かつアクセスしやすい AI アシスタントを提供できるため、恩恵を受けるでしょう。ただし、古いバージョンから移行する開発者は、新たな

between_tools
設定に関連する特定のツール設定を調整する必要があります。

本文

Claude Sonnet 5.5 ご紹介:パフォーマンスとコスト効率の向上

Claude 5.5 ファミリの第 2 モデルである Claude Sonnet 5.5 は、前世代の Claude Sonnet 5 を凌駕する明確な進化を遂げています。

  • 動作速度: 最大で 30% 以上 向上
  • コスト削減: 多くの用途において最大 30% の削減

モデルの位置づけと特徴

モデル位置づけ・特徴
Sonnet 5.5Opus 5.5 をより迅速かつ低コストに補完するモデル。
日常的タスク、バグ修正、洗練されたドキュメント/スライド作成などで特に優れています。デザインに対する鋭い感覚も備えています。
Opus 5.5慎重な判断を要する複雑な業務のために構築されています。
Haiku 5.5高容量処理およびコスト効率を重視するアプリケーション向けに設計。
数週間以内に同ファミリの仲間として加わります。

パフォーマンスの向上点

1. エージェント型コーディング能力(Terminal-Bench 4.0)

  • Sonnet 5: 10.3% のスコア
  • Sonnet 5.5: 70.6% のスコア(劇的な改善)

2. 実世界での実用性(GDPval-AA)

  • Opus 5.5 に 2 ポイント低い結果ですが、極めて高い実用的能力を示します。
  • 長期的視点や画像理解において強力です。
    • スクリーンショットのみでポケモンレッドを攻略する試練を突破したのは、史上初めてとなる Sonnet シリーズモデルです。

3. コラボレーションと文章生成

  • Opus 5.5 に匹敵する明確な文章生成が可能。
  • 「Sonnet 5 よりも優れたコラボレーションパートナー」と初期ユーザーから評価されました。
  • 複雑さの低いタスクにおける素早い反復作業にも最適です。

4. コスト効率化

  • 料金設定: Sonnet 5 と同価格(入力:$2、出力:$10)。キャッシュ読み取りは $0.2。
  • 効率性: 同じ作業に必要なトークン数が大幅に減少し、テスト結果では前世代と比較して最大 30% コスト削減 が実現しました。

5. 速度向上

  • 出力生成が Sonnet 5 よりも 30% 以上高速化。
  • 現時点における最も高速な Sonnet モデルとなっています。

6. アライメントと安全性

  • 自動化された行動監査において、Sonnet 5 と同等かそれ以上の結果を示しています。
  • サイバーセキュリティ: Opus 5 の能力に匹敵し、高性能モデル向けに開発された防護策やフェイルセーフ機構を備えた初の Sonnet モデルです。
  • 生物学関連防護策: Sonnet 5 と同一の対策を採用。通常のソフトウェア開発や生命科学の大半には影響を与えません。

パフォーマンス比較分析

Sonnet 5.5 はあらゆる分野で Sonnet 5 を上回り、一部の領域では劇的な改善が見られます。

  • Opus 5.5 との比較: Max エフォート設定下でのパフォーマンスは Opus 5.5 とほぼ同等です。
  • 重要な注意点: ベンチマークスコアは一面であり、複雑で開放的なタスクや持続的な判断力が必要な作業においては、Opus 5.5 が明確に優位であることが確認されています。

ベンチマークスコア比較(Max エフォート設定)

モデルTerminal-Bench 4.0
(コーディング)
FrontierCode 1.1
(メイン)
GDPval-AA v2.1
(知識労働)
AA-Briefcase v1.1
(知識労働)
Humanity's Last Exam
(総合試験)
OSWorld 2.1
(コンピューター使用)
Chartography
(可視化チャート)
Sonnet 5.570.6%
(+)
46.2%
(+)
184
(+)
181
(+)
64.5%
(ツール使用時)
80.1%
(部分実装)
61.6%
(無工具)
Opus 5.566.4%¹54.4%1491487⁴67.7%
(ツール使用時)
81.8%
(部分実装)
64.4%
(無工具)
Sonnet 510.3%42.4%491483⁴54.9%
(ツール使用時)
57.0%
(部分実装)
15.6%
(無工具)
GPT-6 Sol—49.3%————53.6%⁴
(無工具)

*注:¹ Opus 5.5 の Terminal-Bench スコアは比較対象として記載されています。
スコアとコストの関係については詳細はシステムカードをご覧ください。エフォートが高いほどタスクあたりのコストは高くなりますが、一般的にスコアも向上します。点の左上ほど能力が高くなります。

低・中エフォート設定のメリット

いくつかのベンチマークでは、低または中エフォート設定で Sonnet 5.5 を使用すると:

  1. Sonnet 5 の最高スコアを超えることができます。
  2. タスクあたりのコストを約 10% 削減できます。
  • これにより、Opus 5.5 と相補的に動作し、コストを抑えつつ高品質な結果を得られます。

コーディング分野での顕著な向上

  • FrontierCode: ハイエフォート設定で Sonnet 5 よりスコアが10 ポイント高く、かつタスクあたりのコストは約 1/15 で達成されています。
  • CursorBench: 最高スコアは Opus 5.5 と僅か 2 ポイント以内 です。
  • コードベースを理解するスピードが高く評価されました。
    • 対面テストではツール呼び出しをバッチ処理に成功し、ステップ数が減りコストが低下しました。

Epic Games の評価

「Epic の初期テストにおいて、Claude Sonnet 5.5 は上位モデルから期待される品質水準をクリアし、システム設計監査やデータフローレビューで良好な結果を出しました。新モデルは gameplay システムアーキテクチャのための数万行のコードを管理し、レスポンスは鋭敏に保たれ、数時間かかるタスクにも対応し、より指示的なプロンプトが必要なく結果を提供しました。」 — Daniel Vogel, エピック・ゲームス COO

知識労働における成果

  • GDPval-AA(44 職業×9 産業)では Opus 5.5 とほぼ同レベル。Sonnet 5 よりも約 400 ポイント高いスコアを記録しました。
  • コンピューター使用やチャート認識においては Opus 5.5 と並び、長期的視点が必要な作業において Sonnet 5 および GPT-6 Sol を明確に上回っています。

Slack の評価

「プロンプトを変更することなく、Claude Sonnet 5.5 は offline Slackbot 評価のほぼすべての項目で Sonnet 5 よりも良好な結果を示しました。ステップ数は減り、出力トークン数は約 14% 削減されています。」 — Curtis Allen, Slack プリンシパルエンジニア


コストと速度:料金概要表

トークン 100 万単位あたりの価格Claude Sonnet 5.5Claude Opus 5.5
キャッシュ読み取り$0.20$0.20
キャッシュ書き込み$2.50$5.00
入力トークン$2.00$4.00
出力トークン$10.00$20.00
  • Sonnet 5.5 の利点: 必要トークン数が少ないため実行コストが低減し、出力生成は 30% 以上高速化しています。
    • 例: "HTML ファイル一つで 400 つのヒヨドリが群れ飛ぶ様子を描け"というタスクにおいて、Sonnet 5.5 は大幅に削減されたトークン消費量と高速な生成時間で同等かそれ以上の結果を達成しました。

エフォートレベルの調整

コストと速度を全体品質とバランスさせるためにエフォートレベルを調整できます。

  • デフォルト設定:
    • Claude Codeおよび自社アプリ: Medium(中)
    • Claude Platform: High(高)
  • 低い設定の場合: クロードはより素早く回答し、少ないトークンを使用するため、日常業務に適しています。
  • 高い設定の場合: クロードはより長く推理を行い、作業をより慎重に確認します。

安全性とアライメント

モデルの能力 frontier を拡張する新たなリスクではなく、適用される特定されたリスクセット(ユーザー利益への反撃、誤導、高リスクな悪用への協働など)に焦点を当てて評価されています。

  • 監査結果: 約 1,850 のシナリオを検証した自動化された行動監査において、Sonnet 5.5 はアライメント、悪用への耐性、正直さの面で Sonnet 5 を上回るか同等の結果を示しました。
  • コンテインメント評価: サンドボックスから脱走しようとする頻度は Opus 5.5 とほぼ同レベルであり、容器の限界を検証する可能性が最も低いモデルの一つです。

防護策の詳細

  • サイバーセキュリティ: Sonnet 5 よりも大幅に向上し、Opus 5.5 と同様の防護策を装備します。通常の開発ではバグ修正可能ですが、高度なセキュリティタスクでは Sonnet 5 にフォールバックする仕組みです。
  • 生物学: Sonnet 5 と同一の防護策を採用。有害なリクエストを対象とし、大半の研究・教育・臨床作業には影響を与えません(一部の微生物学/ウイルス学で誤検出される可能性あり)。組織は検証プログラム申請を通じて全範囲の業務に対応できます。
  • 蒸留(Distillation): 能力が高く、推論抽出を防ぐ安全クラシファイヤーを備えた初の Sonnet モデルです。保持された思考も拡大しており、クラウド上の思考は作成アカウントから切り離されることはありません。

スタートガイド

Opus 5.5 および Sonnet 5 と同様、Claude Sonnet 5.5 はデータ保持なしでの利用が可能です。

  • 提供状況: Amazon Web Services (AWS)、Google Cloud、Microsoft Azure を含むすべてのプラットフォームで利用可能です。
  • 開発者向け:
    claude-sonnet-5-5
    モデルを使用して Claude Platform 上で始められます。
  • 移行に関する注意:
    • Sonnet で思考(thinking)をオフにして実行している場合、Sonnet 5.5 に移行する前に新しい
      between_tools
      設定に切り替える必要があります(これにより事前思考は引き続きオフになります)。
    • 詳細は移行ガイドをご覧ください。

同じ日のほかのニュース

一覧に戻る →

2026/09/29 5:23

ジェフ - ホームで学習した Jev 互換の 08B 意思決定モデル、約 30ms

## Japanese Translation: 「Jeff」スートは、**Qwen3.5**および**Gemma 4**アーキテクチャに基づく独立したファインチューニング済みモデルの集合であり、テキスト生成や外部パースなしで超高速なゼロショット分類を可能にします。これらの Apache 2.0 ライセンス付きモデル(NVIDIA GPU/PyTorch または Apple silicon MLX 経由の `uv` で入手可能)は、単一のフォワードパスで校正された確率を返し、ハイエンド消費者向けハードウェア上での意思決定時間は約**22–30ms**(より大きな独立したプロジェクトに比べて著しく高速)です。従来の手法とは異なり、TypeSafe Jev エコシステムとは互換性を持つが affiliated ではないリクエストフォーマットを用いて、ローカルコードに直接スロットリングします。ベンチマークでは、Jeff モデルが分類やグラウンディングタスクにおいて未トレーニングのベースモデルと同等かそれ以上に優ることが示されています(例:Jeff-Qwen3.5-2B のスコアは 83.1 で、Jev の 83.0 を上回っています)が、小さいパラメータ数においては推論能力には限界があります。重要な点は、成功は特定のプロンプトフォーマットに依存しており(標準的な Jev プロンプトでは機能せず、結果の文言を明記する必要がある)、選択肢の構造が一貫していることです。このスートは軽量パイプライン向けの展開で独自の利点を提供し、一部のバリエーションはファインチューニングを通じて特定のゲーム様態タスクにおいてより大きなモデルを上回るパフォーマンスを示しますが、開発者は 2B バリエントにおける潜在的なリスク回避傾向や、高いベンチマークスコアが必ずしもプレイアビリティの信頼性を保証するわけではないという注意点に対処する必要があります。

2026/09/26 19:16

12,000年前のゲベクレテペ墓から分骨の謎が解明された

## Japanese Translation: 考古学者は、トルコの Göbeklitepe における埋葬慣行を解明し、先陶器新石器時代 B 期(紀元前 8700–8000 年頃)に属する未発掘の地下 2 つの埋葬を検出しました。Burial 1 は、L09-65 トレンチ内の長方形建物の床下に発見され、少なくとも 3 名の遺骸が含まれていました:女性(35 歳以上)、男性(20–30 歳)、少女(11–14 歳)。Burial 2 は DR1 トレンチに位置し、左側を向いて屈曲した東向きで寝ている 20–30 歳の青年女性でした。どちらの埋葬も切断痕、熱損傷、またはオクロを使用していない点で特徴的であり、骨は齧歯類による咬み跡および圧力あるいは石灰質堆積物による骨折を示していました(これらは Burial 2 の大部分を破片化しました)。これらの通常の床下墓は後に土壌移動や斜面崩壊によって乱され、緩い骨の断片が斜面を下ってモニュメンタルな建物へと運ばれました。このプロセスは、1995 年以来回収された数百個の散在する断片(単独の頭蓋を含む)を説明し、遺骸の混雑が単一の異常な儀式の結果ではなく、主に自然な移動によるものであることを示しています。これにより多くの証拠の説明が可能となりますが、以前の意図的な頭蓋変形や頭蓋骨断片のより高い比率は、一部の個人が依然として特別扱いを受けたことを示しており、複数の慣習が共存していた可能性が高いです。これらの発見は Göbeklitepe の新石器時代埋葬伝統の解釈を再構築させ、研究者が各断片が独特な儀式に属するとは見なすことなく人口動態パターンを再構築することを可能にします。今後の研究では、直接年代測定と詳細な骨分析を通じてこれらの異なる慣行が発生した時期を特定することに焦点を当てます(PloS One, 2026 年発表)。

2026/09/29 3:58

マイクロLLM ラブブラウザで7つの超小型LLMを試せ

## 日本語訳: ## まとめ: 本システムでは、ブラウザセッション内での持続的なデコード速度と精度を測定することで AI モデルのパフォーマンスベンチマークを行い、すべてのデータがプライバシー保護された状態かつローカル環境で留まることを保証します。このアプローチは、外部の歴史的な基準値よりもリアルタイム評価を優先し、ユーザーのマシーン上で直接迅速な反復を可能にします。特に、テストフレームワークは、1.35 億パラメータ版のような小型モデルであっても特定のチェックで失敗するよう許容しており、限界を隠蔽せずに正確な機能報告を保証します。パフォーマンス推定値では、利用可能な場合、ユーザーの最新のトークン/秒(tps)値をデフォルトとして採用し、即時的な文脈を提供します。セキュリティと一貫性を確保するため、JavaScript 評価エンジンではページのカレントオリジン内で厳密に `eval()` を使用し、外部コードの注入を防ぎつつ信頼性を維持します。モデルが評価されるにつれ、最新設定されたスイートに基づいてグラフが自動的に生成され、各ランのデコード済みテキスト出力に対する具体的なパフォーマンスを反映します。このローカリゼーションされた手法により、ベンチマークは直近の環境に厳密に紐づけられ、クラウドストレージやサーバーサイド履歴への依存を排除しつつ、現在の機能を透明視認可能にし、迅速かつプライバシー保護されたモデル比較を促進します。

ソネット 5.5 | そっか~ニュース