Grok 4.7

2026/09/22 0:50

Grok 4.7

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

X.AI は、複雑なコーディングおよび専門的な知識タスク向けのトップモデルとして位置づけられる Grok 4.7 を正式にリリースしました。より大規模なベースモデルを構築し、ハードなタスクにおける長時間の強化学習で訓練されています。Grok Bot ハネスとのネイティブ統合により、会話および汎用知識タスクのパフォーマンス向上が実現しています。その顕著な成果は「境界価格・性能」であり、コスト増や速度低下なしに長期間にわたるプロジェクトでも優れた結果を納品します。前バージョンと同価格(入力トークンあたり 2 ドル、出力トークンあたり 6 ドル)で、CursorBench 4.0 および複数時間のワークフローにおける独立したテストでは GPT-5.6 Sol Max といった業界トップクラスを上回る性能を発揮しています。モデルは、法律推論(Harvey Legal Agent Benchmark)、ターミナル作業(Terminal-Bench 4.0)、ソフトウェアエンジニアリング(DeepSWE v1.1)などニッチ領域において顕著な改善を示しました。今日から Grok API および Cursor プラットフォームを通じて利用可能で、既存ツールとのシームレスな統合を支援します。より高速動作が必要なユーザー向けには、価格が 2 倍になるファスト版も用意されています。さらに、X.AI は選ばれた研究パートナーのみを対象とした招待制でサイバーセキュリティ防衛機能のレッドチーム化を提供しており、モデルは全新規のサファガードスタックを採用し、バイオセーフティ(LatchBio)およびデュアルユースリスクベンチマーク(HackerBench v0.3)において高い安全スコアを取得しています。このリリースは競合的な転換点を示唆し、開発者に対し、効率的かつ責任を持って複雑なプロフェッショナルワークロードを処理する強力な AI 機能を即時に利用可能にします。

本文

Grok 4.7:コーディングタスクにおいて最高性能を発揮する次世代 AI モデル

Grok 4.7 は、コーディングおよび知識関連のタスクにおいて最も高性能なモデルです。困難な課題に対して長時間にわたって処理を継続し、自身の作業を慎重に検証します。また、史上最も堅牢な安全保障メカニズムを搭載しており、Gro k 4.6 と同等のコストパフォーマンスとレスポンス速度を提供しています。

主要な性能向上とベンチマーク結果

CursorBench 4.0 という長時間コーディングタスクを重視するベンチマークにおいて、Grok 4.7 は価格と性能のバランスで最先端に位置しています。

モデルの技術的進化

  • 大規模基礎モデル: Grok 4.6 よりも新しい、より大規模な基礎モデルを使用。
  • 強化された訓練手法: 複雑なタスク混合物に対して長時間の強化学習を実行。
  • 長文脈管理と検証能力: 完了に数時間を要する問題への比重を高め、長大なコンテキスト管理能力が向上。
  • ネイティブ統合: Grok Bot ハーネスをネイティブに理解するように設計され、対話タスクおよび一般的な知識業務での性能が格段に向上。

価格設定(百万トークンあたり USD)

タイプ入力トークン価格出力トークン価格備考
標準$2$6基本プラン
高速バリアント$4*$20*通常倍速、価格は 2 倍
高階層$10*$50*プランによる変動あり

*価格設定は複数プランで提供される場合があります。

多岐にわたるベンチマークでの比較スコア

以下は、ソフトウェア工学から医療・法律分野までを含む 7 つのベンチマークにおける Grok 4.7 の成績です(※DeepSWE スコアのアスタリスク

*
は「高度な労力(High Effort)」スコアを示します)。

モデルソフトウェア工学 (CursorBench 4.0)ソフトウェア工学 (DeepSWE v1.1)*電気工学 (EEBench)長時間オフィス作業 (AA Briefcase v1.1)長時間ターミナル作業 (Terminal-Bench 4.0)レーガルワーク (Harvey Legal Agent)クリニカル推論 (HealthBench Prof.)
Grok 4.746.3%71.0%*64.0%1,65738.0%19.6%56.7%
Fable 5.1 Max51.8%70.0%56.4%1,67857.9%6.7%62.1%
GPT-5.6 Sol Max41.7%72.7%39.4%1,48737.3%2.5%60.5%
Grok 4.6 High40.4%65.2%53.0%1,54620.3%15.8%48.5%

GDPval & AA Briefcase ベンチマーク(ドキュメント・プレゼンテーション作成) 弁護士、看護師、財務アナリストなど専門家が行うタスクにおいて、Grok 4.7 は Grok 4.6 を上回り、他の最先端モデルと遜色ない性能を発揮しました。

ベンチマークFable 5.1 (max)Grok 4.7 (xhigh)Grok 4.6 (high)GPT-6 Astra (max)
GDPval (Elo スコア)1,7351,6951,6051,542

セーフティとサイバーセキュリティ強化

Grok 4.7 は全く新しい安全保障スタックに基づき、以下の点で業界最高水準を実現しています。

  • 最強の拒否反応: ジャイルブレイク耐性と拒否反応への対応においてテストされた中で最も強力。
  • 二重利用可能な領域での優位性: サイバーセキュリティや生体工学分野で、有用性と安全性の両立を図る(LatchBio バイオセーフティベンチマーク:62.4%)。
  • バランスの取れた防御力: 正当なセキュリティ作業をブロックしながらも、危険な二重利用プロンプトのうちわずか**3.3%**だけを通過させる。
  • HackerBench v0.3 最高安全性: リスクの高いサイバー攻撃タスクにおいて最も高い安全性を示した。
  • レッドチーム機能への招待限定アクセス: 一部のサイバーセキュリティパートナーに対し、防御研究のための専用アクセスを開始。

価格設定と利用開始方法

Grok 4.7 は現在、以下のプラットフォームからご利用可能です。

  • Cursor
  • Grok Build
  • Grok API
  • サードパーティ製コーディングハーネス
  • モデルルーティングサービス
  • クラウドプラットフォーム

グリッド・プラン概要

プラン入力トークン価格出力トークン価格
基本$2 /百万$6 /百万
高速バリアント$4 /百万$20 /百万

すぐに試す方法

  • Grok Build で無料でお試しください。
  • 直ちにご利用を開始するには、x.ai/build をアクセスしてください。

同じ日のほかのニュース

一覧に戻る →

2026/09/22 5:58

輸入額が 800 ドル以下の小口免税措置の停止

## Japanese Translation: 個人処方箋輸入運動(CPPI)は、米国人がライセンス取得済みのカナダの薬局から処方薬を購入する権利を主張しており、これらの薬局が 100% の安全性記録を持つと述べている。この運動を支援することで、人々は健康を損なうことなく安価な医薬品にアクセスしながら資金を節約できる。CPPI は、公衆が即座に無料キャンペーンに参加することを招き、米国での医療費高騰に対する実用的な財務戦略として海外で医薬品を購入する原因を積極的に支持するために、事務所へ連絡すること(202-765-3290 または info@personalimportation.org(N.J. 08844, Hillsborough, 601 Rt. 206, Suite 26-423))を呼びかけている。

2026/09/22 7:33

データ保護委員会が位置情報の処理問題に対し、Google に4,030 万ユーロの制裁金科する

## 日本語翻訳: EU 欧州データ保護委員(DPC)は、GDPR ルールの遵守違反によりユーザの位置情報データを処理したことに伴い、Google アイルランドに巨額の 4030 ユーロの制裁金科しました。2020 年 2 月に開始された自主発議による調査および BEUC などの団体からの苦情に基づき、調査官らは 2018 年 5 月 25 日から 2020 年 2 月 4 日の間に発生した違反行為を特定しました。DPC は、Google が「Web & App Activity」と「Location History」の処理を法的かつ公正に行っておらず、また「Location Accuracy」に関する透明性および説明責任の義務も履行しなかったと結論付けました。コミッショナーズ Dr Des Hogan 氏、Mr Dale Sunderland 氏、Ms Niamh Sweeney 氏、副コミッショナー Graham Doyle 氏は、これらの無許可なデータ保持 practices がユーザが個人情報を制御する権利を損なう損失を増大させたことを指摘しました。したがって、Google は 2 つの特定の機能におけるデータの保持を停止し、6 ヶ月以内にすべての処理をコンプライアンスに合わせるよう命令されました。DPC は適時、本件の最終決定を発表する予定です。

2026/09/22 4:43

ビジュアルで解説するトランスフォーマー

## 日本語訳: 本稿の核心となるメッセージは、2017 年に論文「Attention is All You Need」によって紹介された Transformer アーキテクチャが、GPT、Llama、Gemini のような主要な AI モデルの基盤となるエンジンとして機能しているという点である。このアーキテクチャはテキスト、音声、画像認識、タンパク質予測、ゲームプレイなど多岐にわたる分野で活用されている。これらの大規模システムを抽象的に記述するのではなく、解説ではアクセス可能な GPT-2(小規模)モデル——パラメータ数が 1 億 2400 万、語彙数は 50,257 のユニークなトークン、そして 12 の Transformer ブロックを持つもの——を用いて、Transformer が実際どのように動作するかを具体的に示す。このアーキテクチャは、(1) エンベディメント:文字列の生のトークンをトークナイゼーション、エンベッディング、および位置符号化を通じて数値データに変換する部分、(2) Transformer ブロック:マルチヘッド自己注意機構(クエリ、キー、バリュー行列を 12 ヘッドにわたって使用)と MLP レイヤーを用い、データを順次処理しつつ、マスキングによって未来のトークンへのアクセスを防ぐ機構、(3) 出力確率:表現を高次元空間に射影し、それを確率に変換することで次の単語を数学的に予測する部分——という 3 つの不可欠な要素に依存している。これらの概念は、自然言語理解から複雑なタンパク質予測に至るまでの分野を革命させたが、「Transformer Explainer」という実装により、開発者や学生にとって具体的な形を与えられている。これは Andrej Karpathy の nanoGPT プロジェクトから派生したライブウェブ実装であり、高度なバックエンド知識を必要とせず、理論的研究と実践的な応用の間のギャップを埋める。このツールは、これらの数学的射影がリアルタイムでどのようにテキストを生成するかを可視化することを可能にする。ジョージア工科大学の Aeree Cho、Grace C. Kim、Alexander Karpekov、Alec Helbling、Jay Wang、Seongmin Lee、Benjamin Hoover、Polo Chau の開発により、プロジェクトは性能向上のための追加機能としてレイヤー正規化、ドロップアウト、レシデュアル接続も組み込んでいる。