
2026/09/22 0:50
Grok 4.7
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
X.AI は、複雑なコーディングおよび専門的な知識タスク向けのトップモデルとして位置づけられる Grok 4.7 を正式にリリースしました。より大規模なベースモデルを構築し、ハードなタスクにおける長時間の強化学習で訓練されています。Grok Bot ハネスとのネイティブ統合により、会話および汎用知識タスクのパフォーマンス向上が実現しています。その顕著な成果は「境界価格・性能」であり、コスト増や速度低下なしに長期間にわたるプロジェクトでも優れた結果を納品します。前バージョンと同価格(入力トークンあたり 2 ドル、出力トークンあたり 6 ドル)で、CursorBench 4.0 および複数時間のワークフローにおける独立したテストでは GPT-5.6 Sol Max といった業界トップクラスを上回る性能を発揮しています。モデルは、法律推論(Harvey Legal Agent Benchmark)、ターミナル作業(Terminal-Bench 4.0)、ソフトウェアエンジニアリング(DeepSWE v1.1)などニッチ領域において顕著な改善を示しました。今日から Grok API および Cursor プラットフォームを通じて利用可能で、既存ツールとのシームレスな統合を支援します。より高速動作が必要なユーザー向けには、価格が 2 倍になるファスト版も用意されています。さらに、X.AI は選ばれた研究パートナーのみを対象とした招待制でサイバーセキュリティ防衛機能のレッドチーム化を提供しており、モデルは全新規のサファガードスタックを採用し、バイオセーフティ(LatchBio)およびデュアルユースリスクベンチマーク(HackerBench v0.3)において高い安全スコアを取得しています。このリリースは競合的な転換点を示唆し、開発者に対し、効率的かつ責任を持って複雑なプロフェッショナルワークロードを処理する強力な AI 機能を即時に利用可能にします。
本文
Grok 4.7:コーディングタスクにおいて最高性能を発揮する次世代 AI モデル
Grok 4.7 は、コーディングおよび知識関連のタスクにおいて最も高性能なモデルです。困難な課題に対して長時間にわたって処理を継続し、自身の作業を慎重に検証します。また、史上最も堅牢な安全保障メカニズムを搭載しており、Gro k 4.6 と同等のコストパフォーマンスとレスポンス速度を提供しています。
主要な性能向上とベンチマーク結果
CursorBench 4.0 という長時間コーディングタスクを重視するベンチマークにおいて、Grok 4.7 は価格と性能のバランスで最先端に位置しています。
モデルの技術的進化
- 大規模基礎モデル: Grok 4.6 よりも新しい、より大規模な基礎モデルを使用。
- 強化された訓練手法: 複雑なタスク混合物に対して長時間の強化学習を実行。
- 長文脈管理と検証能力: 完了に数時間を要する問題への比重を高め、長大なコンテキスト管理能力が向上。
- ネイティブ統合: Grok Bot ハーネスをネイティブに理解するように設計され、対話タスクおよび一般的な知識業務での性能が格段に向上。
価格設定(百万トークンあたり USD)
| タイプ | 入力トークン価格 | 出力トークン価格 | 備考 |
|---|---|---|---|
| 標準 | $2 | $6 | 基本プラン |
| 高速バリアント | $4* | $20* | 通常倍速、価格は 2 倍 |
| 高階層 | $10* | $50* | プランによる変動あり |
*価格設定は複数プランで提供される場合があります。
多岐にわたるベンチマークでの比較スコア
以下は、ソフトウェア工学から医療・法律分野までを含む 7 つのベンチマークにおける Grok 4.7 の成績です(※DeepSWE スコアのアスタリスク
* は「高度な労力(High Effort)」スコアを示します)。
| モデル | ソフトウェア工学 (CursorBench 4.0) | ソフトウェア工学 (DeepSWE v1.1)* | 電気工学 (EEBench) | 長時間オフィス作業 (AA Briefcase v1.1) | 長時間ターミナル作業 (Terminal-Bench 4.0) | レーガルワーク (Harvey Legal Agent) | クリニカル推論 (HealthBench Prof.) |
|---|---|---|---|---|---|---|---|
| Grok 4.7 | 46.3% | 71.0%* | 64.0% | 1,657 | 38.0% | 19.6% | 56.7% |
| Fable 5.1 Max | 51.8% | 70.0% | 56.4% | 1,678 | 57.9% | 6.7% | 62.1% |
| GPT-5.6 Sol Max | 41.7% | 72.7% | 39.4% | 1,487 | 37.3% | 2.5% | 60.5% |
| Grok 4.6 High | 40.4% | 65.2% | 53.0% | 1,546 | 20.3% | 15.8% | 48.5% |
GDPval & AA Briefcase ベンチマーク(ドキュメント・プレゼンテーション作成) 弁護士、看護師、財務アナリストなど専門家が行うタスクにおいて、Grok 4.7 は Grok 4.6 を上回り、他の最先端モデルと遜色ない性能を発揮しました。
| ベンチマーク | Fable 5.1 (max) | Grok 4.7 (xhigh) | Grok 4.6 (high) | GPT-6 Astra (max) |
|---|---|---|---|---|
| GDPval (Elo スコア) | 1,735 | 1,695 | 1,605 | 1,542 |
セーフティとサイバーセキュリティ強化
Grok 4.7 は全く新しい安全保障スタックに基づき、以下の点で業界最高水準を実現しています。
- 最強の拒否反応: ジャイルブレイク耐性と拒否反応への対応においてテストされた中で最も強力。
- 二重利用可能な領域での優位性: サイバーセキュリティや生体工学分野で、有用性と安全性の両立を図る(LatchBio バイオセーフティベンチマーク:62.4%)。
- バランスの取れた防御力: 正当なセキュリティ作業をブロックしながらも、危険な二重利用プロンプトのうちわずか**3.3%**だけを通過させる。
- HackerBench v0.3 最高安全性: リスクの高いサイバー攻撃タスクにおいて最も高い安全性を示した。
- レッドチーム機能への招待限定アクセス: 一部のサイバーセキュリティパートナーに対し、防御研究のための専用アクセスを開始。
価格設定と利用開始方法
Grok 4.7 は現在、以下のプラットフォームからご利用可能です。
- Cursor
- Grok Build
- Grok API
- サードパーティ製コーディングハーネス
- モデルルーティングサービス
- クラウドプラットフォーム
グリッド・プラン概要
| プラン | 入力トークン価格 | 出力トークン価格 |
|---|---|---|
| 基本 | $2 /百万 | $6 /百万 |
| 高速バリアント | $4 /百万 | $20 /百万 |
すぐに試す方法
- Grok Build で無料でお試しください。
- 直ちにご利用を開始するには、x.ai/build をアクセスしてください。