
2026/10/01 5:50
Gemini 4 アルゴン(高機能版):知能、パフォーマンス、価格分析
RSS: https://news.ycombinator.com/rss
要約▶
日本語訳:
人工知能分析インデックス v4.3.2 は、多様な AI 能力を測定するための 10 の明確な評価指標を導入することで、新たな重要な基準を確立します。これらには、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience および医療領域の長文脈推論に焦点を当てた AA-LCR v1.1 が含まれます。最も重要なのは、このフレームワークが一般推論やコーディングから医療のような専門分野まで、幅広い複雑なタスクにおけるモデルのパフォーマンスを信頼性を持って比較できるようにする点です。
Elo スケール(相対的なスキルレベルを計算するための統計的手法)と厳格な採点基準チェックを組み合わせて使用することで、インデックスはより高いスコアが一貫して優れた品質を示すことを保証します。具体的には、AA-Briefcase Elo は採点基準通過率、分析質の Elo、プレゼンテーション Elo を統合した複合指標です。システムは幻覚を効果的に罰則化し、知識の正確性を確保します。また、AA-Omniscience インデックスはこの信頼性を -100 から 100 の範囲でスコアリングすることで測定します。さらに、システムは検索拡張生成(RAG)ワークフローに対する主要な技術指標を定義しており、コンテキストウィンドウは入力と出力のトークンの最大合計数を表す例として挙げられます。
生粋の能力を超えて、このスイートは意思決定者にとって不可欠な実用的データを提供し、評価ウェイトによって加重された入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格を用いて運用コストを詳細に算出します。フレームワークはまた、ライセンス制限を明確にするとともに、「商用利用制限付き」と使用が限定される場合、「非商用」と禁止される場合にそれぞれモデルをラベル付けします。さらに、エージェント型の現実世界の作業タスクは (Elo-500)/2000 メトリックを用いて測定され、エージェント型知識およびコーディング/ターミナルタスクには Elo スケールが使用されます。この標準化されたアプローチにより、企業は将来リリースの特定の予測を必要とせずに、明確なパフォーマンスデータと財政的制約に基づいて情報を得た選択を行うことができます。究極的には、それは AI モデル選択というしばしば不透明な景観を、個人ユーザーおよび信頼できる技術ソリューションを求める大企業双方にとって透明で実行可能なプロセスへと変革します。
本文
AI 知能指数 Ver.4.3.2
「AI Analysis」が提供する**「AI 知能指数」(Ver.4.3.2)は、以下の10 つの評価指標**を統合した包括的な評価体系です。詳細な内訳および実装方法は、「AI 知能指数の手法」 をご参照ください。
- AA-Briefcase v1.1
- GDPval-AA v2.1
- AutomationBench-AA
- Terminal-Bench 4.0
- SciCode
- Humanity's Last Exam
- GDP.pdf
- CritPt
- AA-Omniscience
- AA-LCR v1.1
1. AI 知能評価概要
この指標は、モデルが特定の能力や業界におけるパフォーマンスを発揮する度合いを測定します。
- 評価方法: すべての評価は**人工分析(Artificial Analysis)**によって独立して行われます。
- スコアの意味: スコアが高いほど、優れたパフォーマンスを示すことを意味します。
重要な注意点: モデルの知能は一般的にあらゆるユースケースで通用しますが、特定の評価指標は特定の利用シーンにおいてより関連性が深い場合があります。
2. 主要な評価指標
エージェント機能
- エージェント型知識作業(Elo-500/2000)
- エージェント型知識作業のパフォーマンスを測定します。
- エージェント型実世界タスク(Elo-500/2000)
- エージェント型の実世界タスクのパフォーマンスを測定します。
- エージェント型コーディングおよびターミナル利用
- プロフェッショナルドキュメントにおける**推論能力(全問正答)**を測定します。
- ターミナル上でのエージェント型科学研究ワークフロー
- 医療分野の**ロングコンテキスト推論(MLCR-AA)**を測定します。
個別ベンチマーク詳細
AA-Briefcase v1.1
- 概要: エージェント型知識作業向けに開発されたベンチマークです。
- 指標(AA-Briefcase Elo)の構成:
- Rubric のパス率、分析品質の Elo、プレゼンテーションの Eloを統合した複合指標。
- スコアが高いほど優れています。
- Rubric パフォーマンスは合成による対戦マッチを介して Elo スコアに変換されます。
- 計算範囲: Elo と 95% 信頼区間の上下限は**0 にクリップ(固定)**されています。
AA-Omniscience インデックス
- 概要: 知識の信頼性と**ハルシネーション(幻覚)**を測定します(スコアが高いほど優れています)。
- 正解には加点され、ハルシネーションには減点されます。
- 回答拒否に対するペナルティはありません。
- 得点範囲:
から-100100
: 正答数と誤答数が同等。0- 負のスコア: 誤答数が正答数を上回る状態。
3. コストおよび効率性指標
AI 知能指数タスクあたりのコスト(単位:米ドル)
人工分析の AI 知能指数タスク 1 つあたりの加重平均コストです。
- 算出ロジック: 各評価のコストは、入力トークン、キャッシュヒット、キャッシュ書き込み、推論、出力トークンの単価を合計し、タスク数で割った値に、「AI 知能指数における加重」を乗じて算出されます。
- セグメント別コスト: 低値が望ましいです。
全体実行コスト
「人工分析 AI 知能指数」全体を実行するための総コスト(米ドル)です。
- 指数的に包含されているすべての評価を実行するために必要なコスト。
- 各評価におけるトークン単価と使用量を基に算出されます(繰り返し分は除く)。
トークン使用量
AI 知能指数を動かす際の、1 タスクあたりの出力トークンの加重平均数です。
- 算出ロジック: 各評価ごとの出力トークン数にそれぞれのベンチマークの相対的加重を乗じて合計し、タスク数(繰り返し分を除く)で割ることで算出されます。
4. モデル仕様
| 仕様項目 | 説明 |
|---|---|
| コンテキストウィンドウ | トークン制限数であり、値が高いほど優れています。大規模なデータ量の推論および検索を伴う**RAG(文脈強化生成)**ワークフローにおいて重要です。 ※ 最大結合入出力トークン数として計算されます。ただし、出力トークンの制限はモデルによって大幅に異なる場合があります。 |
| 利用可否 | モデルの重みが入手可能かどうかを示します。 * 商用利用が制限されている場合:Commercial Use Restricted(商用利用制限付き) * ライセンスがそれを禁止する場合:Non-commercial(非商用) |
5. 料金詳細
トークン単価(米ドル)
- キャッシュヒット:
- 以前処理済みのプロンプトをキャッシュから読み込んだ際の価格です。
- 通常の入力料に比べて大幅な割引が適用されます。
- ※ 記載されている値はキャッシュヒット価格です。キャッシュ書き込みとストレージ料金は別途請求されます。
- 入力:
- 新規の入力トークンに対する標準単価です。
- 出力:
- 生成された出力トークンに対する価格です。
詳細情報: より詳細なバリエーションについては、**「プロバイダー別キャッシュ料金」**をご参照ください。