
2026/08/13 1:54
Gro k 4.6 が人工知能分析インデックスで 61 点を取得
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
SpaceXAI の Grok 4.6 は、人工知能分析インテリジェンス指数(Artificial Analysis Intelligence Index)で 61 を獲得し、GPT-5.6 Sol とともに最前線の AI モデルとして確立され、Claude Opus 5(63)や Fable 5(62)といったトップティアの Anthropic システムに匹敵する順位を占めています。この大幅な性能向上には、Grok 4.5 より +5 ポイントの改善(Grok 4.3 からは +23 ポイントの飛躍)、そして agentic ワークロードにおいて上位ライバル群と統計的に区別がつかない GDPval-AA v2 Elo スコア 1753 が含まれています。
特に重要なのは、Gro k 4.6 がこの高い知的能力を実現しながらも、入力・出力トークン 100 万語あたり $2/$6 の平準化された頭文字価格を維持していることです。これは Claude Opus 5 や GPT-5.6 Sol などの競合他社に対して 60% 以上もの値引き に相当し、特に出力コストは他社の価格の僅かのごく一部にとどまっており、高度なモデルアップデートに伴う典型的な業界トレンドである価格上昇とは対照的な状況です。効率性は特定のベンチマークでも際立っています:Grok 4.6 は 𝜏³-Banking や Terminal-Bench v2.1 といったタスクにおいてエリートライバルと同等の性能を示し、AA-Briefcase ロングホライズンベンチマークにおいては Claude Opus 5 よりも大幅に高速に完了します(Claude の約 20 億入力トークンおよび約 103 ターンに対して、Gro k 4.6 は同様の作業を約 5 億入力トークンおよび約 53 ターンで完了)。先端的な推論能力と卓越した経済的効率性を兼ね備える Grok 4.6 は、高度な AI パフォーマンスがプレミアム価格ペナルティを必要としない新たな基準を設定します。
本文
SpaceGrok 4.6 の性能向上とコスト優位性:先頭集団への復帰と卓越したエージェント能力
SpaceX AI の最新モデル Grok 4.6 は、約 1 ヶ月半のリリース後、人工知能指数(Intelligence Index)で スコア 61 を達成し、GPT-5.6 Sol と並走する先頭集団に復帰しました。低廉なコストながら卓越したエージェント性能を誇ります。
🚀 主要な成果とベンチマークスコア
人工知能指数の急上昇
- スコア向上: Grok 4.3(28 ポイント差)から 23 ポイント、Grok 4.5 からさらに 5 ポイント の大幅改善を達成。
- 立ち位置: OpenAI を追い抜き、Anthropic に次ぐ 先頭集団(Frontier) へ復帰。
- スコア 61 で GPT-5.6 Sol(最高値)と並走しています。
- Claude Opus 5(63)、Claude Fable 5(フォールバックありで 62)に次ぐ成績です。
- Kimi K3 よりもわずかに上回るスコアを記録しました。
エージェント性能の躍進
- 総合評価: GDPval-AA v2 Elo スコアで 1753 を達成し、Claude Opus 5 に次ぐ結果となりました。
- 統計的な信頼区間の重なりにより、Claude Fable 5 および Qwen3.8 Max と同等の性能を有しています。
- 特定タスクでの実力:
- 「𝜏³-Banking」: スコア 50.7% を記録(Qwen3.8 Max の 51.3% に次ぐトップ 2)。
- マルチターンのカスタマーサービスおよびツール使用能力を十分に発揮。
- 「Terminal-Bench v2.1」: 達成率 88.4% を記録。
- リーディングモデルと同等の端末ベースソフトウェア操作実力を示しました。
- 「𝜏³-Banking」: スコア 50.7% を記録(Qwen3.8 Max の 51.3% に次ぐトップ 2)。
私的ベンチマーク(AA-Briefcase)における長期的知識作業
- スコア: Elo スコア 1577 を獲得し、Claude Opus 5 ファミリーに次ぐ成績です。
- Fable 5 レベルの性能を実証しています。
- 効率性の比較(タークあたりコスト対比):
| モデル | ターン数 | 入力トークン数 | 特徴 |
|---|---|---|---|
| Grok 4.6 | 約 53 ターン | 約 0.5B(5 億) | 高効率、低コスト |
| Claude Opus 5 | 約 103 ターン | 約 2.0B(20 億) | 対照的な高リソース使用 |
- Grok 4.6 は、同等の回答を達成するのに必要なターン数を半減させ、入力トークン量を四分の一に削減しています。
💰 コストパフォーマンスとプライシング戦略
グローバル・ヘッディングプライシング(定価)
- 単価: 入力/出力トークンあたり $2 / $6 です。
- Grok 4.5 から変更なく維持されています。
- Claude Opus 5($5/$25)および GPT-5.6 Sol($5/$30)のそれぞれ 60% 以上安い 設定です。
- タスクあたりのコスト: $0.84 です。
- Kimi K3 と同等のコストですが、知能水準はそれより高く、「知能対タスク単価パレートフロンティア」上に位置しています。
キャッシュヒット時の利用単価
- 1 兆トークンあたりの利用単価が $0.5 です。
- Grok 4.5 のキャッシュヒット時単価($0.3)から引き上げられていますが、依然として低廉です。
コスト対性能のパレート優位性
- Grok 4.6 は、推論負荷の重いワークロードにおいてコスト面で圧倒的な優位性を誇ります。
- スコアが僅か 2 ポイント以内の差異しかない Claude Opus 5 と GPT-5.6 Sol と比較しても:
- GPT-5.6 Sol とほぼ同等の指数スコアを提供しつつ、出力トークンの単価を大幅に抑制。
📊 その他のモデル詳細
- コンテキストウィンドウ容量: 50 万トークン(Grok 4.5 と同等)。
- 総合評価: 知識作業、カスタマーサービス、端末操作のすべてで競争力を持ち、人工知能指数におけるすべてのエージェント評価項目においてパレートフロンティア上に位置しています。
🔗 詳細情報へのアクセス
人工分析知能指数(Artificial Analysis)における Grok 4.6 の各評価項目の詳細内訳については、公式サイトをご覧ください。
https://artificialanalysis.ai/models/grok-4-6