
2026/09/23 1:51
Claude Opus 5.5 の知能・パフォーマンス・価格分析(マックス)
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
人工分析知能指数(Artificial Analysis Intelligence Index)v4.3.2 は、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、および AA-LCR v1.1 という 10 つの異なる評価を通じて AI モデルを包括的に評価するためのフレームワークを提供する。単純な一般知能スコアとは異なり、この指数は、AA-Briefcase の集計された Elo ルーブリック(合格率、分析品質、提示)のようなパフォーマンス指標と、幻覚を最小化し知識の信頼性を測定するための AA-Omniscience といった特別テストを組み合わせた構造化されたアプローチを提供する(スコアは -100 から 100 の範囲)。重要な構成要素としては、法的遵守を確実にするため、「商業利用制限付き」または「非商用」というカテゴリで明確にモデルを分類するライセンス規定への準拠がある。さらに、この指数は評価の経済的現実に対応し、入力トークン(キャッシュヒット/ライト)、推論、出力トークン使用量に基づく特定のトークン価格を計算して総コストを算出し、正確な費用予測を可能にしている。フレームワークがより大きなコンテキストウィンドウおよび業界固有のニーズに適応するにつれて、ユーザーは厳格なライセンス条件をナビゲートできるようにされ、複数の能力指数にわたる許可された商業利用と禁止された用途の区別を行うことができるようになる。
本文
Intelligence Index v4.3.2 概要と評価指標
人工分析(Artificial Analysis)が提供する Intelligence Index v4.3.2 は以下の 10 つの評価指標を統合しています。詳細な手法については メソドロジードキュメント をご参照ください。
統合された評価指標
- AA-Briefcase v1.1
- GDPval-AA v2.1
- AutomationBench-AA
- Terminal-Bench 4.0
- SciCode
- Humanity's Last Exam
- GDP.pdf
- CritPt
- AA-Omniscience
- AA-LCR v1.1
主要指標とライセンス
ライセンス状況(License Status)
モデルの商用利用可否を示すカテゴリです。
- Commercial Use Restricted:商用利用には条件が付けられています。
- Non-commercial:ライセンスにより商用利用が禁止されています。
能力インデックス
特定のカテゴリや産業におけるモデルの実績を測定します。多様なユースケースでの知能水準に加え、特定の用途に特化した評価も重要です。
Intelligence Evaluations(知能評価)
人工分析が独立して測定したスコアで、数値が高いほど優れています。主要な評価項目は以下の通りです。
- 代理型の知識作業(Elo スコア:0〜2,000)
- 代理型の現実世界タスク遂行(Elo スコア:0〜2,000)
- 代理型コーディングとターミナル利用
- 専門文書における推論能力(全項目合格基準)
- 医療分野の長期コンテキストにおける推論
個別指標詳細
AA-Briefcase v1.1
知識作業用のベンチマークであり、以下の要素を統合した AA-Briefcase Elo スコア を出力します。
- Rubric(基準)合格率
- 分析品質 Elo
- プレゼンテーション Elo
仕様: Rubric パフォーマンスは合成された対戦マッチを通じて Elo に変換され、スコアは 0 で下限制限(clamp)されます。
AA-Omniscience Index
知識の信頼性とハルシネーション(事実と異なる回答)を測定します。「回答しない」行為にはペナルティが適用されません。
- 採点基準: 正しい回答に加点、ハルシネーションに減点。
- スコア範囲: −100 〜 +100
: 正誤数が同等0- 負の値: 誤りの方が正しいよりも多いことを示します。
コストとパフォーマンス指標
各タスクあたりのコスト効率性を以下のメトリクスで評価します。
- Intelligence Index vs. コスト per タスク
- 入出力トークン単価の合計値をタスク数で除算し、Intelligence Index の重み付けを行った加重平均コスト(USD)です。
- Token 使用量(出力トークン)
- 各評価あたりの出力トークン数を相対的な重みで掛け合わせ、重複を除いた総タスク数で除算した値です。
- コスト
- トークンタイプ別(入力・キャッシュ・推論等)の加重平均コスト(USD per タスク)。値が低いほど有利です。
- 全評価実行時の総コスト
- 全評価を完了させるのに必要な総額(USD)。入力・キャッシュ・推論トークンの単価に、重複を除いた使用トークン数を掛け合わせた合計です。
プライシングとシステム仕様
価格体系:キャッシュヒット・入力・出力
- 定義: キャッシュされたプロンプト(以前処理済み)あたりの価格。
- 単位: 1M トークンあたり(USD)。
- 特記事項: 通常の入力度に比べ大幅な割引が適用されます。※表示価格はキャッシュヒット単価であり、キャッシュライトおよびストレージは別途課金され、事業者によって異なります。
コンテキストウィンドウ
- 制限: トークン数の上限。値が高いほど有利です。
- 関連性: 大きなコンテキストウィンドウは、RAG(検索増強生成)LLM ワークフローや大量データの推論に特に適しています。
- 注記: 最大値は入力と出力の合計トークン数を指します(ただし、出力上限はモデルにより制限される場合があります)。