
2026/07/31 16:59
DeepSeek V4 Flash 0731 の知能性・性能と価格分析
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
人工分析知能指数 v4.1 は、GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR の 9 つの特定ベンチマークを通じてモデルの知能を評価します。指数内で推論能力のあるモデルは電球アイコンで示されており、さらに方法論の詳細は「人工分析知能指数の方法論」にて入手可能です。一般知能に加え、指数は専門指標にも焦点を当てています:AA-Omniscience(知識の信頼性および幻覚スコアリングを -100 から 100 の範囲で実施し、正しい回答には加点、幻覚には減点とし、拒否もペナルティなしで行うもの)と Openness(正規化された 0〜100 の尺度)。コストの透明性は、トークンタイプごとの加重平均コスト(米ドル)およびタスクあたりの加重平均出力トークン数を介して提供されます。トークンタイプとしては入力、キャッシュヒット、キャッシュライト、推論、回答トークンを区別しています。オープンウェイトモデルについては、指数は総パラメータ数と推論中のアクティブなパラメータ数を区分しており、実際のリソース要件の明確化を図っています。コンテキストウィンドウの制限も報告され、特に RAG ワークフローにおいて大きなウィンドウが重要であることが示されています。本指数は Artificial Analysis によりオープンウェイトまたはプロプライエタリオプションとして提供可能です。一般知能はタスク間で転移しますが、特定のベンチマークは個別の使用事例に対してより関連性がある場合があります。これら粒度の高い指標(幻覚率、タスクあたりのコスト、パラメータ使用量、コンテキストウィンドウ制約)を追跡することにより、本指数は組織にオープンモデルとプロプライエタリモデルとの間でデータ駆動型の意思決定を可能にし、非使用の計算リソースを支払うことなく効率性・信頼性・機能的要件のバランスが取れたデプロイメント戦略の最適化を支援します。
本文
知能指標 v4.1 の概要と詳細
1. 評価項目の統合
知能指標 v4.1 は以下の 9 つの評価項目を統合しています。
- GDPval-AA v2
- τ³・バンキング(Tau Cubed Banking)
- Terminal Bench v2.1
- SciCode
- ヒューマニティ・ラスト・エクスアム(Humanity's Last Exam)
- GPQA ダイヤモンド
- CritPt
- AA-Omniscience
- AA-LCR
注記:
- 推論モデルは電球のアイコンで示されます。各評価の詳細や実施方法は「知能指標の実施方法」を参照してください。
- この指標は、**オープン・ウェイト(Open Weights)またはプロプライエタリ・モデル(Proprietary Models)**の両方で利用可能です。
2. 知能評価体系
知能評価は人工分析により個別に測定され、値が高いほど優れています。特定の用途では関連性の高い指標が異なります。
AA-Omniscience 指標
- 概要: 知識の信頼性とハルシネーション(妄想的回答)を測定します。
- スコア範囲 (-100 ~ 100):
- 正解: ポジティブなスコアは正解を示し、値が高いほど優れています。
- 誤答: ネガティブなスコアは誤答が正解より多いことを意味します。
- 中立: スコアが 0 の場合は正解数と誤答数が同等です。
- メカニズム: 正解には加点、ハルシネーションにはペナルティを課しますが、回答拒否の場合はペナルティはかかりません。
オープンネス指標(Openness Index)
- 概要: ノーマライズされたスケール(0 ~ 100)でモデルの「開かれた性質」を評価します。
- 評価基準: 値が高いほどより開放的です。
3. コストとパフォーマンス比較
タスクあたりの重平均コスト(米ドル)
- 概要: 各評価項目の「知能指標の重み」に応じて加重平均された単位タスクコストです。値が低いほど優れます。
- 計算式: 以下の要素から総コストを算出し、タスク数で割り、加重平均します。
- 入力トークン単価
- キャッシュヒット単価
- キャッシュ書き込み単価
- 推論単価
- 回答トークン単価
タスクあたりの出力トークン数
- 概要: 1 つのタスク実行に必要な出力トークンの重平均数です。
- 計算式: 各ベンチマークの相対的加重係数を掛け合わせ、タスク数(重複除外)で割ります。
コストセグメンテーション
- トークンタイプ別のコスト分類を行っており、値が低いほど望ましいです。
全評価実行時の総コスト(米ドル)
- 概要: 指標内の全評価を実行するための総額です。
- 計算式: 各モデルの単価 × 使用トークン数(重複除外)の合計です。
4. プライシング:キャッシュヒット・入力・出力
価格表記単位: 1 ミリオントークンあたり米ドル
| 項目 | 定義と特徴 |
|---|---|
| キャッシュヒット | 以前に処理済みのプロンプト(キャッシュ化されたもの)あたりの単価。 通常の入力量程ではなく、大幅な割引が適用されます。 |
注意点: 上記価格はキャッシュヒット価格のみです。キャッシュ書き込み料金およびキャッシュストレージ料金は別途課金され、プロバイダーによって異なります(詳細は「プロバイダー別のキャッシュ価格設定」を参照)。
5. モデル仕様
コンテキストウィンドウ
- 定義: コンテキストウィンドウ内のトークン制限数。
- 重要性: 値が高いほど優れます。
- 特に大規模データの推論や、RAG(レトリバル・オーグメンテッド・ジェネレーション)ワークフローにおいて、大きなコンテキストウィンドウは極めて重要です。
モデルサイズ(オープン・ウェイトモデルのみ)
- 指標: トータル・パラメータ数と推論時にアクティブなパラメータ数の比較。
- 定義:
- トレーニング中に学習された重みおよびバイアスの総数(数十億単位:Billion)。
- モデルがデータを処理し回答を生成する能力を決定します。