Groq 4.6

2026/08/13 0:32

Groq 4.6

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Grok 4.6 は人工知能において画期的な飛躍を成し遂げ、複雑な長期的なエージェントと対話的な視覚タスクを実行する能力を得ました。Artificial Analysis Intelligence (AAI) インデックスの 9 つのベンチマークにおいて GPT-5.6 Sol Max と比較可能なフロンティアクラスの知能水準を達成し、研究、構造化、実装、フィードバックループによる改善を通じて広範な製品アイデアを即座に動作する最初のバージョンへと変換できます。この進歩は、推論と高品質なエンジニアリングデータ向けのキュレーションされたモデル生成データを用いたより長い補完トレーニングの実行、知識作業、一般コード作成、カーネル最適化、Web 開発、コンピュータ支援設計にわたるエージェント型 RL タスク、ならびに改良されたオプティマイザーによるもの です。

以前のバージョンとは異なり、Grok 4.6 はより長い経路での自己テストと検証において優れ、単一のパスでプロジェクト構造と視覚言語を独自に定義することで対話型プロジェクトの作成を簡素化します。安全性の防護策は強化され、脆弱性情報パッチングやエンジニアリング設計サイクルなどの重要なドメインにおいてセキュリティを確保しつつ最大限の利便性を保証するように設定されています。

モデルは Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare を含むパートナーを通じてすぐに利用可能です。料金は入力トークンあたり 2 ドル、出力トークンあたり 6 ドルから始められ、高速版はそれらの二倍の価格です。採用を促進するため、X.ai は Grok Build および Cursor で最初の週の利用容量を二倍にしています。参照されている競合他社の数値とベンチマークスコア(例:DeepSWE v1.1 が 65.9%、Terminal-Bench v3.0 が 26%)は公開されたシステムカードやリーダーボードから得られています。このリリースは、実世界での実装に備えた堅牢で自律的な AI エージェントへとの大きな転換を表しています。

本文

Grok 4.6 リリース:複雑な課題と視覚的タスクを強化

本日、x.ai からGrok 4.6のリリースを発表しました。前作である Grok 4.5 の機能を継承しつつ、以下のような大幅な進化を遂げています。

  • 長期間にわたるエージェント作業への対応力向上
  • 野心的な対話型および視覚的タスクへの重点化
  • 複数のステップを要する複雑な課題における一貫した高品質な性能の発揮
    • トピック研究、情報分析、コードベース全体でのナビゲーション(「又る」→ ナビゲート/理解)、アイデアから実用的なアプリケーションや成果物への転換が可能に

Groak 4.6 は、エージェント型コーディングおよび知識関連の仕事を行う各種ベンチマークにおいて最先端の知能水準を達成しました。

  • 9 つのベンチマークからなる合成スコアである**人工分析知能指数(AAI)**においても、GPT-5.6 Solと同等の性能を示しています。

ベンチマーク成績概要

各主要指標における Grok 4.6 と競合他社の比較結果です。

  • AA 知能指数 (Artificial Analysis Intelligence Index)

    • Grok 4.6: 61
    • Fable 5 Max: 62
    • GPT-5.6 Sol Max: 56
    • Grok 4.5 High: (前作)
    • ※競合他社のデータは、各開発者の公表情報およびベンチマークリーダーボードからのものです。
  • ベンチマーク比較グラフの主要指標

    • AA 知能指数
    • GDPVal-AA
    • DeepSWE 1.1
    • CursorBench 3.2
    • FrontierCode 1.1

🚀 グローバル 4.6 の学習と技術進化

Grok 4.6 は、前作 Grok 4.5 よりも長期間にわたる補完的学習を実施しました。このプロセスで取り込まれた要素は以下の通りです。

  • 推論能力および高度な技術概念のための厳選されたモデル生成データ
  • 高品質なエンジニアリングデータ
  • 改善された最適化アルゴリズムと学習レシピ

これにより、後の強化学習(RL)および少样本微調整(SFT)の段階に向けたより堅牢な基盤を築くことができました。

SFT とフィルタリングプロセス

Grok 4.5 を用いて、以下のような領域における SFT の遷移パス全体を再生成しました。

  1. 対象領域: 推論活動、エージェントハネス(管理フレームワーク)、STEM、ソフトウェア工学、知識関連の仕事など。
  2. フィルタリング: モデルベースのチェックにより問題のあるトレースを除去。
  3. 成果: 得られた SFT チェックポイントは、優れた性能と改善された振る舞いを示しています。

幅広いエージェント型強化学習

Groak 4.6 は、多様な環境に基づいて訓練されています。

  • 知識関連の仕事
  • 一般的なコーディング
  • 特定ドメイン: カーネル最適化、ウェブ開発、CAD(コンピュータ支援設計)など

💡 野心的なアイデアを実際のプロジェクトへ

Groak 4.6 は、広範な製品アイデアを実際に動作するファーストバージョンへと転換する能力に特に優れています。

対応可能なプロセス

  • 不慣れな分野の研究からアプリケーションの構造化まで
  • コアインタラクションの実装
  • フィードバックを繰り返して結果を改善する一連のフロー

自己テストと検証の強化

長期的な実行パスにおいて、以下の動作が顕著に観察されました。

  • 次のステップへ進む前に自身の作業を検証する**「自己テスト」**
  • **「検証」**機能の向上

視覚的・対話型プロジェクトへの適用

  • Grok 4.5 よりもはるかに質の高いファーストパスの生成が可能になりました。
  • 具体的な製品アイデアを与えられた場合、**1 つのパス(通し)**でアプリケーションの構造と視覚言語を設定できます。
    • これは、「まず手堅いものを作り、その後イテレーションを重ねる」というアプローチが必要なプロジェクトにおいて非常に有効です。

🛡️ セーフティと機能

Groak 4.6 のセーフガード(安全対策)は、モデルの能力に合わせて改善・微調整されました。

  • 目的: 合法的な使用例においてユーティリティとセキュリティを最大化すること
  • 有用分野: 脆弱性パッチ適用、エンジニアリングデザインサイクルの加速、AI リサーチの支援など

評価作業

Groak 4.6 の拡張された能力を反映させた広範なテストを実施しています。

  • 事前展開テスト: 能力とセーフティキャリブレーション
  • 事後展開テスト: サードパーティによる検証も実施

📊 詳細な評価結果(Evals)

各評価項目におけるスコア一覧です。 ※各項目の最高得点は太字で示しています。 サードパーティモデルのスコアは、自己報告または公開されている結果から最も良いものを選定したものです。

評価項目Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol Max / Fable 5 Max (他)
AA 知能指数615662 / 56
GDPVal-AA v2175315261
CursorBench v3.270.9%66.7%70.5% (Fable 5 Max)
DeepSWE v1.165.9%54%73%
FrontierCode v1.1 (Ext)61.3%56.6%60.6% (Fable 5 Max)
APEX-Agents57.5%47.1%59.2%
Terminal-Bench v3.026%15.7%34.1% (Fable 5 Max)
APEX-SWE56.4%53.6%
AA-Briefcase150215741
Harvey LAB (Vals)158%131%1502%

🌟 Grok 4.6 の活用を開始

アクセス方法

  • Cursor: 利用開始可
  • Grok Build: 利用開始可
  • API: OpenRouter、Vercel、Cloudflare などのパートナー経由でも提供。

コスト構造

  • 入力トークン: 2 ドル / 百万単位
  • 出力トークン: 6 ドル / 百万単位
  • 高速バージョン: 通常の2 倍の価格で利用可能

✅ 初週限定特典

最初の 1 週間は、Groak Build と Cursor 内の使用量に対して2 倍の追加枠を提供します。今すぐ体験を開始できます!

🏁 スタートガイド

API キーを作成して今日から構築を始める

SpaceXAI API を通じて直ちに Grok 4.6 で構築を開始可能です。

  1. ドキュメントを読み込む
  2. Groak 4.6 を技術スタックに統合

👉 API ドキュメント (※例示) を参照してください。

無料で Grok Build で試してみる

x.ai/build で今すぐ無料でご利用を開始できます。

同じ日のほかのニュース

一覧に戻る →

2026/08/13 1:04

DeepSeek V4 プロ 0813

## Japanese Translation: 現時点でソーステキストが提供されていないため、コンテンツ固有のポイントに焦点を当てた 120 から 200 ワード程度の要約を作成することはできません。要約をご希望の記事、抜粋または文書をお提供ください。受け取った段階で、主要なメッセージを抽出し、技術用語を定義するとともに、最も重要な洞察を最初に提示することで明確性と関与性を確保します。元の論旨を反映しつつ外部の意見や逸話を追加することなく、簡潔な概要を提供することが目標です。素材をご共有いただくことで、すぐに作業を進めることができます。

2026/08/13 3:19

デルタ

## Japanese Translation: Delta は、今日より公開のプライベートベータ招待状付きの画期的な新世代マルチプレイヤーコーディング環境です。人間と AI エージェントの双方に対してコードと対話をリアルタイムで緊密に連携させるよう、専用設計されています。既存のワークフローを阻害する従来のツールとは異なり、Delta は Zed や Git といった現在の開発環境の隣に立ち、数百万人の毎日のユーザーのワークフローを乱さないよう、Zed に機能を追加するのではなく新規アプリケーションとして構築された専用コンパニオンです。Rust ベースの技術、WebAssembly、WebGL を活用することで、ローカルのインストールなしでどのブラウザ内でも開発者と AI エージェントが協働することを可能にしています。 本プラットフォームは、カスタムデータベース「DeltaDB」を用いて、対話とワークツリーをリアルタイムで即座に複製し、招待されたすべてのファーストクラス参加者に同期させることで、リモートコラボレーションにおける決定的なギャップを解消します。チームはワンクリックでメンバーを招待でき、プライベートスレッドは招待された者だけに共有されるため、クラウドランナーによるバックアップによりローカルデバイスが閉じられていてもコードと対話が同期して維持されます。注釈は、著者(人間またはエージェント)や時間を問わずコード行や対話ステップに正確にアンカーされ、プロジェクトが進化する過程で陳腐化することを防ぎます。Delta はフルディフ、全体トランスクリプトを表示し、モデル速度でコンテンツをレンダリングし、対話をナビゲ可能なドキュメントとして扱うことで、ユーザーは任意の場所(ディフ、プラン、思考ブロックなど)にカーソルを置けば、正確な意図をもってコメント付けられます。今後のアップデートによりさらに機能は拡張されますが、究極的には Delta は、既存の Git リポジトリと第 3 者のエージェントハネス(例:Claude Code)とのシームレスな統合を通じて、端末セッションを実時間同期して共同レビューを行うことで、プライバシーを維持しながら透明性のあるナビゲ可能な対話履歴を実現し、チーム全体の課題解決効率を大幅に向上させることを可能にします。

2026/08/12 23:22

Tailscale のトレースデータベースが、16 歳向けの SQLite WAL リセットバグに汚染されました。

## Japanese 翻訳: Tailscale は、SQLite の希少な、16 年間にわたるバグである「WAL-Reset bug」により引き起こされた深刻なデータベース腐敗の 6 ヶ月を解決することに成功しました。この問題は、標準的なオープンソースソフトウェアが Tailscale の非標準的手動チェックポイント構成下で機能不全に陥った際に発覚し、しばしば退屈とみなされる技術内に潜んでいた欠陥を露呈させました。修正には、Tailscale のエンジニアとコア SQLite 開発者の間での唯一の協力が求められ、ソースコードへのパッチ適用と同時に内部設定を調整して特定の丸め動作を排除する必要がありますでした。エンジニアらは、「tmstmpvfs shims」(シミュレートされたファイルシステム)というフォレンジックツールを用いてデータレースを分離し、初期パッチが失敗した後にタイムスタンプの精度を浮動小数点数テキストから整数秒に切り替えました。2 ヶ月のカニアリーロールアウトで安全性が確認された後、Tailscale は 4 ヶ月間インシデントフリーで稼働しています。この事例は、類似のデータベース構成に依存する他の組織に対する重要な警告であり、手動最適化機能は複雑な長期リスクを招くことがあり、深刻な問題の解決には公式アップデートを待つだけでなく、アプリケーションチームとメンテナンス担当者の共同努力が必要であることを示しています。

Groq 4.6 | そっか~ニュース