Claude Opus 5.5 の知能・パフォーマンス・価格分析(マックス)

2026/09/23 1:51

Claude Opus 5.5 の知能・パフォーマンス・価格分析(マックス)

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

人工分析知能指数(Artificial Analysis Intelligence Index)v4.3.2 は、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、および AA-LCR v1.1 という 10 つの異なる評価を通じて AI モデルを包括的に評価するためのフレームワークを提供する。単純な一般知能スコアとは異なり、この指数は、AA-Briefcase の集計された Elo ルーブリック(合格率、分析品質、提示)のようなパフォーマンス指標と、幻覚を最小化し知識の信頼性を測定するための AA-Omniscience といった特別テストを組み合わせた構造化されたアプローチを提供する(スコアは -100 から 100 の範囲)。重要な構成要素としては、法的遵守を確実にするため、「商業利用制限付き」または「非商用」というカテゴリで明確にモデルを分類するライセンス規定への準拠がある。さらに、この指数は評価の経済的現実に対応し、入力トークン(キャッシュヒット/ライト)、推論、出力トークン使用量に基づく特定のトークン価格を計算して総コストを算出し、正確な費用予測を可能にしている。フレームワークがより大きなコンテキストウィンドウおよび業界固有のニーズに適応するにつれて、ユーザーは厳格なライセンス条件をナビゲートできるようにされ、複数の能力指数にわたる許可された商業利用と禁止された用途の区別を行うことができるようになる。

本文

Intelligence Index v4.3.2 概要と評価指標

人工分析(Artificial Analysis)が提供する Intelligence Index v4.3.2 は以下の 10 つの評価指標を統合しています。詳細な手法については メソドロジードキュメント をご参照ください。

統合された評価指標

  • AA-Briefcase v1.1
  • GDPval-AA v2.1
  • AutomationBench-AA
  • Terminal-Bench 4.0
  • SciCode
  • Humanity's Last Exam
  • GDP.pdf
  • CritPt
  • AA-Omniscience
  • AA-LCR v1.1

主要指標とライセンス

ライセンス状況(License Status)

モデルの商用利用可否を示すカテゴリです。

  • Commercial Use Restricted:商用利用には条件が付けられています。
  • Non-commercial:ライセンスにより商用利用が禁止されています。

能力インデックス

特定のカテゴリや産業におけるモデルの実績を測定します。多様なユースケースでの知能水準に加え、特定の用途に特化した評価も重要です。

Intelligence Evaluations(知能評価)

人工分析が独立して測定したスコアで、数値が高いほど優れています。主要な評価項目は以下の通りです。

  • 代理型の知識作業(Elo スコア:0〜2,000)
  • 代理型の現実世界タスク遂行(Elo スコア:0〜2,000)
  • 代理型コーディングとターミナル利用
  • 専門文書における推論能力(全項目合格基準)
  • 医療分野の長期コンテキストにおける推論

個別指標詳細

AA-Briefcase v1.1

知識作業用のベンチマークであり、以下の要素を統合した AA-Briefcase Elo スコア を出力します。

  • Rubric(基準)合格率
  • 分析品質 Elo
  • プレゼンテーション Elo

仕様: Rubric パフォーマンスは合成された対戦マッチを通じて Elo に変換され、スコアは 0 で下限制限(clamp)されます。

AA-Omniscience Index

知識の信頼性とハルシネーション(事実と異なる回答)を測定します。「回答しない」行為にはペナルティが適用されません。

  • 採点基準: 正しい回答に加点、ハルシネーションに減点。
  • スコア範囲: −100 〜 +100
    • 0
      : 正誤数が同等
    • 負の値: 誤りの方が正しいよりも多いことを示します。

コストとパフォーマンス指標

各タスクあたりのコスト効率性を以下のメトリクスで評価します。

  • Intelligence Index vs. コスト per タスク
    • 入出力トークン単価の合計値をタスク数で除算し、Intelligence Index の重み付けを行った加重平均コスト(USD)です。
  • Token 使用量(出力トークン)
    • 各評価あたりの出力トークン数を相対的な重みで掛け合わせ、重複を除いた総タスク数で除算した値です。
  • コスト
    • トークンタイプ別(入力・キャッシュ・推論等)の加重平均コスト(USD per タスク)。値が低いほど有利です。
  • 全評価実行時の総コスト
    • 全評価を完了させるのに必要な総額(USD)。入力・キャッシュ・推論トークンの単価に、重複を除いた使用トークン数を掛け合わせた合計です。

プライシングとシステム仕様

価格体系:キャッシュヒット・入力・出力

  • 定義: キャッシュされたプロンプト(以前処理済み)あたりの価格。
  • 単位: 1M トークンあたり(USD)。
  • 特記事項: 通常の入力度に比べ大幅な割引が適用されます。※表示価格はキャッシュヒット単価であり、キャッシュライトおよびストレージは別途課金され、事業者によって異なります。

コンテキストウィンドウ

  • 制限: トークン数の上限。値が高いほど有利です。
  • 関連性: 大きなコンテキストウィンドウは、RAG(検索増強生成)LLM ワークフローや大量データの推論に特に適しています。
  • 注記: 最大値は入力と出力の合計トークン数を指します(ただし、出力上限はモデルにより制限される場合があります)。

同じ日のほかのニュース

一覧に戻る →

2026/09/23 1:29

Claude Opus 5.5

## Japanese Translation: Anthropic は、新しい Claude 5.5 ファミリーにおける初モデルである Claude Opus 5.5 を導入しました。このモデルは、エリート「Fable」モデルと同等の性能を維持しつつ、大幅なコスト削減(一般的なタスクでは最大 40% のコスト低減、特定のコーディングタスクでは出力速度向上に伴い約 51% のコスト削減)を提供します。このリリースは、Anthropic が「フロンティアを調整する」という戦略的転換を示すものであり、外部評価機関である Frontier Design と METR による検証也得到了確認です。性能向上により、企業は数週間かかっていた大規模なコード移行を数日(例:68 万行のコード移行が 1 日以内に完了)で実行可能にされ、約 40 の複雑な Web ページの読み込み時間を改善できます。 安全性とセキュリティは最優先事項であり、Opus 5.5 はアライメントスコアの向上、プロンプトインジェクションに対する耐性、そして不可逆的な動作が起きる可能性の低減を示しています。サイバーセキュリティ対策として、Fable 5.1 と同等の safeguards が導入されており、多くのタスクは高レベルのセキュリティを持つ Opus 4.8 ルートされ、Cyber Verification Program を通じてアクセス範囲を拡大しています。生命科学のような専門分野も、Life Sciences Verification Program により高度な生物学安全プロトコルを利用できます。価格設定は Opus 5 のレートから引き下げられ、100 万トークンあたり $4/$20 と変更されました。これにより、アジェンティックコーディングタスクにおけるハイエンド性能が、以前のコストのわずか几分额で利用可能となりました。さらに、すべてのプランの購読ユーザーには、5 時間の使用制限増およびレートリミットのリセット特典が提供されます。最後に、ディストイテーション攻撃を緩和するため、2026 年 8 月 31 日以降に新規作成された API アカウントでは「保存された思考」機能が有効化され、トップティアモデルと同等の堅牢なサイバーセキュリティ対策が確保されています。結局のところ、このリリースはエリート AI 能力を民主化し、コスト削減の大幅増、セキュリティの強化、および事業拡大準備のある企業にとっての運用柔軟性の向上をもたらします。

2026/09/23 2:46

「我々はFBIをハッキングした」:ハッカーたちは、彼らがFBIのすべての職員に関するデータを入手していると主張している。

## Japanese Translation: ShinyHunters というハッキンググループは、複数の FBI 関連サービスの侵入に成功し、全ての現在在职員および申請者に関する包括的なデータを盗んだと主張している。同グループの代表者は 404 Media にこの事案を確認した上で、「盗まれた情報には、氏名、自宅住所、電話番号、エージェント配偶者に関するデータなどといった個人情報も含まれている」と述べている。今回の漏洩は深刻なものであり、ShinyHunters は国家安全保障や対諜報活動への危害を目的としてデータを悪用することが知られているため、もしこのデータが悪意ある行為者に入手されると、FBI の職員が物理的な安全に直ちに脅かされ、国外の諜報機関が Am りカンの運用手法を理解するために今回の侵入を悪用する可能性もある。また、同グループのネットワーク内に存在する犯罪者は、過去に盗まれた記録を利用して法執行官を物理的に特定・追跡し、威嚇しており、エージェントとその配偶者に対して深刻な脅威となっている。専門家らは、FBI の職員や内部関係者に対し、直ちに Signal(ID: joseph.404)または電子メール(joseph@404media.co)を通じて 404 Media に連絡するよう要請している。今回の侵入の具体的な範囲に関する詳細な技術情報は、404 Media プラットフォームの有料会員(あるいは同プラットフォームの無料会員)のみが閲覧できるまま制限されている。

2026/09/22 22:52

OpenAI の GPT–6「Astra」が、2005 年以来解決されなかったエニグマの暗号文を解読した

## Japanese Translation: 2026 年 9 月 15 日、GPT–6 Astra は、1941 年 7 月 10 日に送信されたドイツ軍エニigma暗号の文 MVUEH を成功裡に復号化し、2005 年以来続く謎を解決した。カーター・レファーは、AI にクリプトセルラーリサーチウェブページの未解読メッセージを分析させるよう指示を与えたところ、AI は MVUEH(Nr. 172)を選択して対象とした。AI は独自に開発された Python および C++ ソフトウェアを使用してエニigmaの設定をシミュレートし、以前に解決済みの文 Nr. 173 (SIPVX) との関係性を特定するとともに、平文のパターン「ROSENOW ROSENOW」を crib(推測文)として利用した。最も重要なのは、AI が暗号文における微妙な転記エラーを検出した点であり、その中には第 72 の文字で発生した異常なローターの回転など、以前の人間による試みを阻害しかねる要因が含まれていた。従来の同様のメッセージに対する失敗が鍵の未考慮や差異などに起因していたのに対し、Astra はこの独特なローター構成および不具合を 2 日以内に克服し、人間研究者が数ヶ月かかる結果を得た。復号化の後、研究者たちは連邦アーカイフ(特に巻 RS 3–3/20a および RS 3–3/63b)から関連するアーカイブログを発見し、残りの無線電文の全巻について分析を完全に自動化した。フロデ・ヴァイエルユッドのような専門家らは、以前は数ヶ月かかっていたタスクが数日で完了したことは事実であるが、AI は専門家の暗号解析官にとって強力なパートナーでありながら、絶え間ない人間の介入を必要としないとして指摘した。9 月 19 日のアップデートでは、この成果を「非常に驚くべきこと」と形容し、ヴァイエルユッドは同様の画期的成果に感銘を受けていることを表明した。