
2026/08/18 2:25
Qwen3.8 27B は人工知能分析でスコア 52 を獲得
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Summary:
人工分析知能インデックス(AI Analysis Intelligence Index)v4.1.1 は、9 つの異なる性能評価を統合するよう設計された、AI モデルを評価するための統一されたフレームワークを提供します。その最も重要な特徴は、導入前にモデルの能力、費用対効果、コンテキストウィンドウ数やパラメータ数といった技術仕様を測定する標準化された指標を提供することです。オープンウェイトモデルと有料商業ライセンスが必要なモデルとの区別により、ユーザーが迅速にライセンス要件を特定できるようになっています。高度な推論機能を備えたモデルは特別な電球アイコンで強調表示され、知識の信頼性とハルシネーション(スコア:-100 から 100)を対象とした AA-Omniscience インデックスと、開示性(スコア:0 から 100)を対象とした Openness インデックスという別個のインデックスが、正規化された尺度での比較を可能にしています。さらに、このフレームワークはキャッシュヒットに対する割引を含む価格帯を含めた微妙なコスト構造の詳細を提供し、推論中に使用されるモデルパラメータの総数とアクティブパラメータを区別することにより技術アーキテクチャを明確にし、特に Mixture of Experts 設計の特徴を注記しています。結局のところ、この包括的なベンチマークツールは、Retrieval-Augmented Generation(RAG)などのワークフローのための情報に基づいた導入決定を行うことを可能にし、特定のニーズに対して最も信頼性が高く費用対効果の優れたソリューションを選択するよう保証します。
本文
AI 分析知能指数 Ver. 4.1.1
概要
AI 分析知能指数(Artificial Analysis Intelligence Index)Ver. 4.1.1 は、以下の 9 つの指標を統合してモデルの性能を評価します。
- GDPval-AA v2
- 𝜏³-Banking
- Terminal-Bench v2.1
- SciCode
- Humanity's Last Exam
- GPQA Diamond
- CritPt
- AA-Omniscience
- AA-LCR
注釈:
- リアゾニングモデル(推論能力に特化したモデル)は、記事内に電球アイコンで示されています。
- 各評価の詳細および実施方法については、「知能指数手法(Intelligence Index methodology)」をご参照ください。
オープンウェイト/プロプライエタリモデル向け評価
人工分析社が独立して測定する知能評価です。数値が高いほど優れた性能を意味します。 シートおよびドキュメント向けの定量的分析において、特定の用途に適合した評価項目を選ぶことが推奨されます。
主要指標一覧
- GDPval-AA v2
- 𝜏³-Banking
- Terminal-Bench v2.1
- SciCode
- Humanity's Last Exam
- GPQA Diamond
- CritPt
- AA-Omniscience
- AA-LCR
個々の評価項目の詳細
AA-Omniscience(AA-全知性指数)
AI 分析知能指数 Ver. 4.1.1 に含まれる指標の一つです。
- 定義: 数値が高いほど信頼性の高い知識を意味し、ハルシネーションが少ないことを示します。
- 採点ルール:
- 正解: 加点
- ハルシネーション: 減点
- 回答見送: 罰則なし
- スコア範囲: $-100$ から $100$ の間。
- $0$: 正解数と誤答数が同数
- 負値: 誤答の方が多くなる
オープンネス指数
モデルの開放性を評価する指数です。
- スケール: $0$ から $100$ の正規化されたスケール。
- 解釈: 数値が高いほど開かれていることを意味します。
知能指数比較分析
1. 知能指数タスク単価との対比
人工分析知能指数・加重平均コスト(USD)
- 計算式: 入力トークン、キャッシュヒット/ライト、推論、回答トークンの単価を合計し、タスク数で割った後、「知能指数における重み」に応じて加重平均計算。
2. トークン使用量
1 つの AI 分析知能指数タスクあたりの出力トークン数
- 計算式: 各評価項目ごとの出力トークン数を相対的な重みで乗算し、タスク数(重複を除く)で割る。
3. コストパフォーマンス
AI 分析知能指数タスク単価別コスト(USD)
- タイプ別区分: 入力、キャッシュヒット、キャッシュライト、推論、回答トークン。
- 解釈: 数値が低いほど優れたコストパフォーマンスです。
4. 全評価の実行コスト
AI 分析知能指数におけるすべての評価を実行するためのコスト(USD)
- 内容: モデルの単価(入力、キャッシュ、推論、回答)と、各評価項目で消費されたトークン数(重複を除く)を組み合わせた総コスト。
料金詳細
キャッシュヒット・入力・出力価格
価格(100 万トークンあたりの USD)
- キャッシュヒット: 以前処理済みのプロンプトに対する単価で、通常の入力価格に比べ大幅な割引が適用されます。
- 注: 表示される値はキャッシュヒット時の単価です。
- 別途課金: キャッシュライトおよびキャッシュストレージの料金は別途発生します(プロバイダーにより異なります)。
- [「プロバイダーごとのキャッシュ料金」を参照]
モデル仕様
コンテキストウィンドウ
コンテキストウィンドウ:トークン上限数
- 解釈: 数値が高いほど優れた性能。
- 重要性: 大量のデータ retrieval 推論や RAG(Retrieval Augmented Generation)ワークフローにおいて特に重要です。
モデルサイズ(オープンウェイトモデルのみ対象)
モデルサイズ:総パラメータ数および推論時アクティブパラメータ数
- 定義: モデルの全パラメータ数と、推論時に実際に活用されるパラメータ数の比較です。
総パラメータ数 (Total Parameters)
- 概要: モデル内に存在する学習可能な重みおよびバイアスの総数(十億単位:Billion)。
- 役割: 訓練を通じて習得され、処理能力及び回答生成能力を決定します。
アクティブパラメータ数 (Active Parameters)
- 概要: 各推論フォワードパスで実際に実行されるパラメータの数(十億単位:Billion)。
- モデルによる違い:
- Mixture of Experts (MoE): ルーター機構が専門家のサブセットを選択するため、アクティブパラメータ数は総パラメータ数よりも少なくなります。
- Dense モデル: 全パラメータを使用するため、両者の値は等しくなります。