
2026/08/13 0:32
Groq 4.6
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Grok 4.6 は人工知能において画期的な飛躍を成し遂げ、複雑な長期的なエージェントと対話的な視覚タスクを実行する能力を得ました。Artificial Analysis Intelligence (AAI) インデックスの 9 つのベンチマークにおいて GPT-5.6 Sol Max と比較可能なフロンティアクラスの知能水準を達成し、研究、構造化、実装、フィードバックループによる改善を通じて広範な製品アイデアを即座に動作する最初のバージョンへと変換できます。この進歩は、推論と高品質なエンジニアリングデータ向けのキュレーションされたモデル生成データを用いたより長い補完トレーニングの実行、知識作業、一般コード作成、カーネル最適化、Web 開発、コンピュータ支援設計にわたるエージェント型 RL タスク、ならびに改良されたオプティマイザーによるもの です。
以前のバージョンとは異なり、Grok 4.6 はより長い経路での自己テストと検証において優れ、単一のパスでプロジェクト構造と視覚言語を独自に定義することで対話型プロジェクトの作成を簡素化します。安全性の防護策は強化され、脆弱性情報パッチングやエンジニアリング設計サイクルなどの重要なドメインにおいてセキュリティを確保しつつ最大限の利便性を保証するように設定されています。
モデルは Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare を含むパートナーを通じてすぐに利用可能です。料金は入力トークンあたり 2 ドル、出力トークンあたり 6 ドルから始められ、高速版はそれらの二倍の価格です。採用を促進するため、X.ai は Grok Build および Cursor で最初の週の利用容量を二倍にしています。参照されている競合他社の数値とベンチマークスコア(例:DeepSWE v1.1 が 65.9%、Terminal-Bench v3.0 が 26%)は公開されたシステムカードやリーダーボードから得られています。このリリースは、実世界での実装に備えた堅牢で自律的な AI エージェントへとの大きな転換を表しています。
本文
Grok 4.6 リリース:複雑な課題と視覚的タスクを強化
本日、x.ai からGrok 4.6のリリースを発表しました。前作である Grok 4.5 の機能を継承しつつ、以下のような大幅な進化を遂げています。
- 長期間にわたるエージェント作業への対応力向上
- 野心的な対話型および視覚的タスクへの重点化
- 複数のステップを要する複雑な課題における一貫した高品質な性能の発揮
- トピック研究、情報分析、コードベース全体でのナビゲーション(「又る」→ ナビゲート/理解)、アイデアから実用的なアプリケーションや成果物への転換が可能に
Groak 4.6 は、エージェント型コーディングおよび知識関連の仕事を行う各種ベンチマークにおいて最先端の知能水準を達成しました。
- 9 つのベンチマークからなる合成スコアである**人工分析知能指数(AAI)**においても、GPT-5.6 Solと同等の性能を示しています。
ベンチマーク成績概要
各主要指標における Grok 4.6 と競合他社の比較結果です。
-
AA 知能指数 (Artificial Analysis Intelligence Index)
- Grok 4.6: 61
- Fable 5 Max: 62
- GPT-5.6 Sol Max: 56
- Grok 4.5 High: (前作)
- ※競合他社のデータは、各開発者の公表情報およびベンチマークリーダーボードからのものです。
-
ベンチマーク比較グラフの主要指標
- AA 知能指数
- GDPVal-AA
- DeepSWE 1.1
- CursorBench 3.2
- FrontierCode 1.1
🚀 グローバル 4.6 の学習と技術進化
Grok 4.6 は、前作 Grok 4.5 よりも長期間にわたる補完的学習を実施しました。このプロセスで取り込まれた要素は以下の通りです。
- 推論能力および高度な技術概念のための厳選されたモデル生成データ
- 高品質なエンジニアリングデータ
- 改善された最適化アルゴリズムと学習レシピ
これにより、後の強化学習(RL)および少样本微調整(SFT)の段階に向けたより堅牢な基盤を築くことができました。
SFT とフィルタリングプロセス
Grok 4.5 を用いて、以下のような領域における SFT の遷移パス全体を再生成しました。
- 対象領域: 推論活動、エージェントハネス(管理フレームワーク)、STEM、ソフトウェア工学、知識関連の仕事など。
- フィルタリング: モデルベースのチェックにより問題のあるトレースを除去。
- 成果: 得られた SFT チェックポイントは、優れた性能と改善された振る舞いを示しています。
幅広いエージェント型強化学習
Groak 4.6 は、多様な環境に基づいて訓練されています。
- 知識関連の仕事
- 一般的なコーディング
- 特定ドメイン: カーネル最適化、ウェブ開発、CAD(コンピュータ支援設計)など
💡 野心的なアイデアを実際のプロジェクトへ
Groak 4.6 は、広範な製品アイデアを実際に動作するファーストバージョンへと転換する能力に特に優れています。
対応可能なプロセス
- 不慣れな分野の研究からアプリケーションの構造化まで
- コアインタラクションの実装
- フィードバックを繰り返して結果を改善する一連のフロー
自己テストと検証の強化
長期的な実行パスにおいて、以下の動作が顕著に観察されました。
- 次のステップへ進む前に自身の作業を検証する**「自己テスト」**
- **「検証」**機能の向上
視覚的・対話型プロジェクトへの適用
- Grok 4.5 よりもはるかに質の高いファーストパスの生成が可能になりました。
- 具体的な製品アイデアを与えられた場合、**1 つのパス(通し)**でアプリケーションの構造と視覚言語を設定できます。
- これは、「まず手堅いものを作り、その後イテレーションを重ねる」というアプローチが必要なプロジェクトにおいて非常に有効です。
🛡️ セーフティと機能
Groak 4.6 のセーフガード(安全対策)は、モデルの能力に合わせて改善・微調整されました。
- 目的: 合法的な使用例においてユーティリティとセキュリティを最大化すること
- 有用分野: 脆弱性パッチ適用、エンジニアリングデザインサイクルの加速、AI リサーチの支援など
評価作業
Groak 4.6 の拡張された能力を反映させた広範なテストを実施しています。
- 事前展開テスト: 能力とセーフティキャリブレーション
- 事後展開テスト: サードパーティによる検証も実施
📊 詳細な評価結果(Evals)
各評価項目におけるスコア一覧です。 ※各項目の最高得点は太字で示しています。 サードパーティモデルのスコアは、自己報告または公開されている結果から最も良いものを選定したものです。
| 評価項目 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max / Fable 5 Max (他) |
|---|---|---|---|
| AA 知能指数 | 61 | 56 | 62 / 56 |
| GDPVal-AA v2 | 175 | 315 | 261 |
| CursorBench v3.2 | 70.9% | 66.7% | 70.5% (Fable 5 Max) |
| DeepSWE v1.1 | 65.9% | 54% | 73% |
| FrontierCode v1.1 (Ext) | 61.3% | 56.6% | 60.6% (Fable 5 Max) |
| APEX-Agents | 57.5% | 47.1% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.1% (Fable 5 Max) |
| APEX-SWE | 56.4% | 53.6% | — |
| AA-Briefcase | 150 | 215 | 741 |
| Harvey LAB (Vals) | 158% | 131% | 1502% |
🌟 Grok 4.6 の活用を開始
アクセス方法
- Cursor: 利用開始可
- Grok Build: 利用開始可
- API: OpenRouter、Vercel、Cloudflare などのパートナー経由でも提供。
コスト構造
- 入力トークン: 2 ドル / 百万単位
- 出力トークン: 6 ドル / 百万単位
- 高速バージョン: 通常の2 倍の価格で利用可能
✅ 初週限定特典
最初の 1 週間は、Groak Build と Cursor 内の使用量に対して2 倍の追加枠を提供します。今すぐ体験を開始できます!
🏁 スタートガイド
API キーを作成して今日から構築を始める
SpaceXAI API を通じて直ちに Grok 4.6 で構築を開始可能です。
- ドキュメントを読み込む
- Groak 4.6 を技術スタックに統合
👉 API ドキュメント (※例示) を参照してください。
無料で Grok Build で試してみる
x.ai/build で今すぐ無料でご利用を開始できます。