Gro k 4.6 が人工知能分析インデックスで 61 点を取得

2026/08/13 1:54

Gro k 4.6 が人工知能分析インデックスで 61 点を取得

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

SpaceXAI の Grok 4.6 は、人工知能分析インテリジェンス指数(Artificial Analysis Intelligence Index)で 61 を獲得し、GPT-5.6 Sol とともに最前線の AI モデルとして確立され、Claude Opus 5(63)や Fable 5(62)といったトップティアの Anthropic システムに匹敵する順位を占めています。この大幅な性能向上には、Grok 4.5 より +5 ポイントの改善(Grok 4.3 からは +23 ポイントの飛躍)、そして agentic ワークロードにおいて上位ライバル群と統計的に区別がつかない GDPval-AA v2 Elo スコア 1753 が含まれています。

特に重要なのは、Gro k 4.6 がこの高い知的能力を実現しながらも、入力・出力トークン 100 万語あたり $2/$6 の平準化された頭文字価格を維持していることです。これは Claude Opus 5 や GPT-5.6 Sol などの競合他社に対して 60% 以上もの値引き に相当し、特に出力コストは他社の価格の僅かのごく一部にとどまっており、高度なモデルアップデートに伴う典型的な業界トレンドである価格上昇とは対照的な状況です。効率性は特定のベンチマークでも際立っています:Grok 4.6 は 𝜏³-Banking や Terminal-Bench v2.1 といったタスクにおいてエリートライバルと同等の性能を示し、AA-Briefcase ロングホライズンベンチマークにおいては Claude Opus 5 よりも大幅に高速に完了します(Claude の約 20 億入力トークンおよび約 103 ターンに対して、Gro k 4.6 は同様の作業を約 5 億入力トークンおよび約 53 ターンで完了)。先端的な推論能力と卓越した経済的効率性を兼ね備える Grok 4.6 は、高度な AI パフォーマンスがプレミアム価格ペナルティを必要としない新たな基準を設定します。

本文

SpaceGrok 4.6 の性能向上とコスト優位性:先頭集団への復帰と卓越したエージェント能力

SpaceX AI の最新モデル Grok 4.6 は、約 1 ヶ月半のリリース後、人工知能指数(Intelligence Index)で スコア 61 を達成し、GPT-5.6 Sol と並走する先頭集団に復帰しました。低廉なコストながら卓越したエージェント性能を誇ります。


🚀 主要な成果とベンチマークスコア

人工知能指数の急上昇

  • スコア向上: Grok 4.3(28 ポイント差)から 23 ポイント、Grok 4.5 からさらに 5 ポイント の大幅改善を達成。
  • 立ち位置: OpenAI を追い抜き、Anthropic に次ぐ 先頭集団(Frontier) へ復帰。
    • スコア 61 で GPT-5.6 Sol(最高値)と並走しています。
    • Claude Opus 5(63)、Claude Fable 5(フォールバックありで 62)に次ぐ成績です。
    • Kimi K3 よりもわずかに上回るスコアを記録しました。

エージェント性能の躍進

  • 総合評価: GDPval-AA v2 Elo スコアで 1753 を達成し、Claude Opus 5 に次ぐ結果となりました。
    • 統計的な信頼区間の重なりにより、Claude Fable 5 および Qwen3.8 Max と同等の性能を有しています。
  • 特定タスクでの実力:
    • 「𝜏³-Banking」: スコア 50.7% を記録(Qwen3.8 Max の 51.3% に次ぐトップ 2)。
      • マルチターンのカスタマーサービスおよびツール使用能力を十分に発揮。
    • 「Terminal-Bench v2.1」: 達成率 88.4% を記録。
      • リーディングモデルと同等の端末ベースソフトウェア操作実力を示しました。

私的ベンチマーク(AA-Briefcase)における長期的知識作業

  • スコア: Elo スコア 1577 を獲得し、Claude Opus 5 ファミリーに次ぐ成績です。
    • Fable 5 レベルの性能を実証しています。
  • 効率性の比較(タークあたりコスト対比):
モデルターン数入力トークン数特徴
Grok 4.6約 53 ターン約 0.5B(5 億)高効率、低コスト
Claude Opus 5約 103 ターン約 2.0B(20 億)対照的な高リソース使用
  • Grok 4.6 は、同等の回答を達成するのに必要なターン数を半減させ、入力トークン量を四分の一に削減しています。

💰 コストパフォーマンスとプライシング戦略

グローバル・ヘッディングプライシング(定価)

  • 単価: 入力/出力トークンあたり $2 / $6 です。
    • Grok 4.5 から変更なく維持されています。
    • Claude Opus 5($5/$25)および GPT-5.6 Sol($5/$30)のそれぞれ 60% 以上安い 設定です。
  • タスクあたりのコスト: $0.84 です。
    • Kimi K3 と同等のコストですが、知能水準はそれより高く、「知能対タスク単価パレートフロンティア」上に位置しています。

キャッシュヒット時の利用単価

  • 1 兆トークンあたりの利用単価が $0.5 です。
    • Grok 4.5 のキャッシュヒット時単価($0.3)から引き上げられていますが、依然として低廉です。

コスト対性能のパレート優位性

  • Grok 4.6 は、推論負荷の重いワークロードにおいてコスト面で圧倒的な優位性を誇ります。
  • スコアが僅か 2 ポイント以内の差異しかない Claude Opus 5GPT-5.6 Sol と比較しても:
    • GPT-5.6 Sol とほぼ同等の指数スコアを提供しつつ、出力トークンの単価を大幅に抑制。

📊 その他のモデル詳細

  • コンテキストウィンドウ容量: 50 万トークン(Grok 4.5 と同等)。
  • 総合評価: 知識作業、カスタマーサービス、端末操作のすべてで競争力を持ち、人工知能指数におけるすべてのエージェント評価項目においてパレートフロンティア上に位置しています。

🔗 詳細情報へのアクセス

人工分析知能指数(Artificial Analysis)における Grok 4.6 の各評価項目の詳細内訳については、公式サイトをご覧ください。

https://artificialanalysis.ai/models/grok-4-6

同じ日のほかのニュース

一覧に戻る →

2026/08/13 1:04

DeepSeek V4 プロ 0813

## Japanese Translation: 現時点でソーステキストが提供されていないため、コンテンツ固有のポイントに焦点を当てた 120 から 200 ワード程度の要約を作成することはできません。要約をご希望の記事、抜粋または文書をお提供ください。受け取った段階で、主要なメッセージを抽出し、技術用語を定義するとともに、最も重要な洞察を最初に提示することで明確性と関与性を確保します。元の論旨を反映しつつ外部の意見や逸話を追加することなく、簡潔な概要を提供することが目標です。素材をご共有いただくことで、すぐに作業を進めることができます。

2026/08/13 3:19

デルタ

## Japanese Translation: Delta は、今日より公開のプライベートベータ招待状付きの画期的な新世代マルチプレイヤーコーディング環境です。人間と AI エージェントの双方に対してコードと対話をリアルタイムで緊密に連携させるよう、専用設計されています。既存のワークフローを阻害する従来のツールとは異なり、Delta は Zed や Git といった現在の開発環境の隣に立ち、数百万人の毎日のユーザーのワークフローを乱さないよう、Zed に機能を追加するのではなく新規アプリケーションとして構築された専用コンパニオンです。Rust ベースの技術、WebAssembly、WebGL を活用することで、ローカルのインストールなしでどのブラウザ内でも開発者と AI エージェントが協働することを可能にしています。 本プラットフォームは、カスタムデータベース「DeltaDB」を用いて、対話とワークツリーをリアルタイムで即座に複製し、招待されたすべてのファーストクラス参加者に同期させることで、リモートコラボレーションにおける決定的なギャップを解消します。チームはワンクリックでメンバーを招待でき、プライベートスレッドは招待された者だけに共有されるため、クラウドランナーによるバックアップによりローカルデバイスが閉じられていてもコードと対話が同期して維持されます。注釈は、著者(人間またはエージェント)や時間を問わずコード行や対話ステップに正確にアンカーされ、プロジェクトが進化する過程で陳腐化することを防ぎます。Delta はフルディフ、全体トランスクリプトを表示し、モデル速度でコンテンツをレンダリングし、対話をナビゲ可能なドキュメントとして扱うことで、ユーザーは任意の場所(ディフ、プラン、思考ブロックなど)にカーソルを置けば、正確な意図をもってコメント付けられます。今後のアップデートによりさらに機能は拡張されますが、究極的には Delta は、既存の Git リポジトリと第 3 者のエージェントハネス(例:Claude Code)とのシームレスな統合を通じて、端末セッションを実時間同期して共同レビューを行うことで、プライバシーを維持しながら透明性のあるナビゲ可能な対話履歴を実現し、チーム全体の課題解決効率を大幅に向上させることを可能にします。

2026/08/12 23:22

Tailscale のトレースデータベースが、16 歳向けの SQLite WAL リセットバグに汚染されました。

## Japanese 翻訳: Tailscale は、SQLite の希少な、16 年間にわたるバグである「WAL-Reset bug」により引き起こされた深刻なデータベース腐敗の 6 ヶ月を解決することに成功しました。この問題は、標準的なオープンソースソフトウェアが Tailscale の非標準的手動チェックポイント構成下で機能不全に陥った際に発覚し、しばしば退屈とみなされる技術内に潜んでいた欠陥を露呈させました。修正には、Tailscale のエンジニアとコア SQLite 開発者の間での唯一の協力が求められ、ソースコードへのパッチ適用と同時に内部設定を調整して特定の丸め動作を排除する必要がありますでした。エンジニアらは、「tmstmpvfs shims」(シミュレートされたファイルシステム)というフォレンジックツールを用いてデータレースを分離し、初期パッチが失敗した後にタイムスタンプの精度を浮動小数点数テキストから整数秒に切り替えました。2 ヶ月のカニアリーロールアウトで安全性が確認された後、Tailscale は 4 ヶ月間インシデントフリーで稼働しています。この事例は、類似のデータベース構成に依存する他の組織に対する重要な警告であり、手動最適化機能は複雑な長期リスクを招くことがあり、深刻な問題の解決には公式アップデートを待つだけでなく、アプリケーションチームとメンテナンス担当者の共同努力が必要であることを示しています。

Gro k 4.6 が人工知能分析インデックスで 61 点を取得 | そっか~ニュース