
2026/10/01 5:04
ジェミニ 4 アルゴン
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Google は、ソフトウェアエンジニアリング、企業向け知識業務(法務および財務を含む)、およびサイバーセキュリティ防衛における複雑で長期にわたるワークフローを扱うための深い推論に特化された AI モデル「Gemini 4 "Argon"」を発表しました。Argon は産業標準を超える出力トークン制限 100 万トークン(従来の 64K から向上)をサポートし、単一のトリアジェクト内での複雑な問題に対する深い推論を可能にします。そのアーキテクチャには、最適化された量子コンピューティングサブルーチンが組み込まれており、 prior システムと比較して約 40% の高速化を実現するとともにメモリ使用量を大幅に削減しています。内部テストの結果では、Google データセンター全体で 300 TiB を超えるメモリが解放され(推定節約額は 500 TiB〜1 PiB)、効果が確認されました。
Argon は現在、Fairwind プログラムを通じて信頼されたサイバー防衛者に対してのみ展開されており、米国政府による任意のプレリリースアクセスレビューを経ています。一般公開は安全なガードレールのさらなる精錬を待って行われ、まず有料 API 顧客および Google AI Ultra 契約者のみから開始されます。安全対策には、CBRN 攻撃への拒否メカニズム、Gray Swan IPI ベンチマークにおける間接プロンプトインジェクションに対する堅牢性、思考の連鎖分析を通じた非整合性のモニタリングなどが含まれます。
ベンチマーク結果は Argon の能力を浮き彫りにしています:ソフトウェアエンジニアリングタスクにおいて DeepSWE v1.1 で 77.9% のスコアを達成し、AutomationBench では 51.3% のスコアで第 1 位にランクされ、長期間のビデオ理解における LVBench で 91.7% のスコアを獲得、CWE-bench v1 では脆弱性修復において 68% のスコアで 1 位と並んでいます。また、Wiz の Scan for Good イニシアチブにおいて、以前の実験モデルが見過ごしていた世界中で使用されている医療ソフトウェアにおける重大な脆弱性を成功裏に特定しました。
価格は入力トークン 100 万あたり 2 ドル(出力トークン 100 万あたり 10 ドル)から開始され、キャッシュされた入力トークンは標準の入力価格に対して 95% の割引で利用可能です。このコスト効率の高い構造は、大規模な計算タスク向けに高度な AI 機能を可能にすることで、長期ワークフロー自動化およびサイバーセキュリティ防衛戦略を革新することを目的としています。さらに、Argon エージェントは積極的に C/C++ コードベースを Rust へ移行しており、re2 などのコアライブラリでは数万行以上、Fuchsia Zircon カーネルでは最大 800 万行以上に達しています。libgav1 ビデオデコーダーの Rust ポートと比較して 2.7 倍の速度向上を実現するとともに、出力とメモリの安全性を維持しています。
本文
ジーミネー 4 アルゴン:最先端のパフォーマンスと安全性を発表
本日、Google は次世代モデルとしてGemini 4 Argon(ジミニ 4 アルゴン)のリリースを公式に発表しました。本モデルは、信頼されたサイバー防御者向けに段階的に展開され、「ファアワインド・プログラム」を通じて提供されています。 複雑で長期的な視野が必要なタスクにおいて深層推論を維持するように設計されたアルゴンは、Google 内での作業スタイルやシステム構築のあり方を根本から変えるものです。
📌 概要と利用開始
- 適用分野
- 実世界のソフトウェアエンジニアリング
- 法律や金融などの企業向け知識業務
- サイバーセキュリティ防御における複雑なタスク
- リリース戦略
- 安全性確保のため、段階的なアプローチを採用。
- 米国政府による先行モデルアクセスの自主的手続きを推進中。
- 開発者、企業、一般消費者への提供に向けた準備と、フィードバックに基づくガードレールの改善を継続。
- 利用料金
- 入力トークン: 2 ドル(キャッシュされた入力では単価から**95%**の割引適用)
- 出力トークン: 10 ドル
🚀 Google で働く・開発するスタイルを変革します
Gemini 4 Argon はすでに数万名の Googler に採用されており、特殊なコーディングタスクでの優位性や研究活動の支援などが高く評価されています。チームの生産性向上と画期的な成果加速を支援しています。
- 量子アルゴリズム最適化
- 量子コンピューティング研究者の強力なパートナーとして機能。
- サブルーチンの時空資源(量子ビット×ゲート)を最適化。
- 既存の公開基準性能よりも**40%**も優れた成果を数分で達成。
- メモリの効率化
- グループ全体のプロファイリングデータを自動分析し、データセンター全体でメモリ最適化を実行。
- 展開後は300 TiB(テラバイト)以上のメモリ解放が可能。
- 総体的には**500 TiB から 1 ピタバイト(PiB)**の節約が予想される。
- 大規模コードベースの移行および最適化
- C/C++ コードベースを Rust への大規模移行支援中(例:re2, libgav1, Fuchsia Zircon カーネル)。
- libgav1 の最適化事例:
- コンパイラが自動的にベクトル化するよう、Rust ポートを研究・最適化。
- Rust 版は C++ に比較して2.7 倍高速動作かつメモリ安全性を維持。
- ビデオ出力品質は同等レベルを保証。
🧠 最も複雑な課題に全力で取り組みます
長期的かつ複雑なユースケースに対応するため、モデルの出力トークン制限を大幅に拡張しました。
- トークン制限の拡大
- 従来の64,000 トークンから業界トップクラスの100 万トークンへ引き上げ。
- 深層推論の強化
- 数十万乃至百万単位のトークンを生成する余裕を持つことで、一方向的な深層思考が可能に。
- 困難な課題を一度に解決し、推論のレベルを一層深くします。
💻 コーディングおよび企業向けワークフローを多分野で実現します
コーディング、推論、マルチモーダル機能に加え、長期かつ複数ステップにわたるタスク維持能力により、多岐にわたる業務において卓越したパフォーマンスを発揮します。
- ソフトウェアエンジニアリングベンチマーク
- DeepSWE v1.1 ベンチマーク(長期視野を持つエンジニアリングタスク測定)でスコア**77.9%**を獲得。
- 業界最高水準(State of the Art)を樹立。
- 多分野でのトップクラス性能
- Vals インデックス: 金融・コーディング・法律・税務における経済的インパクトで Top レベル。
- Vals Finance Agent v2: 複数ステップの財務研究において優位性発揮。
- Harvey ベンチマーク: 法律研究および草案作成でトップクラス。
- AutomationBench (Zapier): 主要ビジネス機能実行スコア**51.3%**で第 1 位。
- 視覚的理解能力
- プロフェッショナルなチャート分析や長時間動画からの詳細特定が可能。
- LVBench(長時間ビデオ理解測定)でスコア**91.7%**を記録し業界トップに。
🛡️ 防御型サイバーセキュリティでリードします
新たなサイバー攻撃時代に対応するため、強力な防御機能を持つモデルとして訓練されています。
- 自律的な脆弱性対策
- 重大なソフトウェア脆弱性を発見・検証・パッチ適用を自動実行可能。
- 信頼された防御者向けにガードレールなしでリリースされ、フルスケールの frontier レベル機能を活用可能。
- 実績と評価
- Wiz「Scan for Good」イニシアチブ: 医療ソフトウェアの重大な脆弱性(機密情報漏洩リスク)を発見・是正。
- CWE-bench v1: 脆弱性是正能力スコア**68%**で第 1 位に並ぶ最高記録(前モデルの 3.8 倍)。
- 比較的性能優位性 (3.8 Flash Cyber と比較)
- Google 内部ベンチマーク: 20 言語以上のコードベースで広範囲な露出を特定。
- Wiz ブロックボックスペネトレーションテスト: ソースコードなしでの攻撃表面発見と検証において優位。
🔒 広範な利用への準備として frontier 機能の安全性を強化します
広範な展開前に、以下の 4 つの主要分野で frontier ガードレールを強化しました。
- 悪用対策
- サイバー攻撃や CBRN(化学的・生物的・放射性・核)攻撃への悪用を防ぐため、不当な要求は拒否しつつ正当な科学的研究を維持。
- Frontier Safety Framework に準拠し、レッドチームによる厳格なロバストネステストを経ています。
- プロンプトインジェクション対策
- 悪意ある指示やコンテキストによる振る舞い乗っ取り(間接的プロンプトインジェクション)に対する高回復力モデル化。
- Gray Swan の IPI ベンチマークでリードしています。
- 誤り合わせ(Misalignment)の監視
- ユーザー意図を超えたタスク実行や境界超過を防ぐため、思考連鎖と行動を常時監視。
- 必要時に実行を停止させる仕組みを導入し、推論が監視を回避するリスクを排除しています。
- システム強化
- 高リスクなトレーニングまたは評価を行う前に、サンドボックス環境を隔離・シール化(沙漏化)。
- エージェントセキュリティベストプラクティスをパートナーと共有し、エコシステム全体の向上を図ります。
🚧 近日中に展開いたします
Gemini 4 Argon は、コーディング、知識業務、サイバーセキュリティ防御、創作活動において frontier レベルの能力を備え、最も困難な課題に対処するパートナーとして設計されています。
- 初期コホート: サイバー防御者および信頼されたテスト参加者のフィードバックに基づきシステム強化を完了。
- 今後の展開計画:
- 開発者、企業、一般消費者へのリリース準備を進めています。
- 対象ユーザー: 有料 API 顧客および Google AI Ultra サブスクリプション利用者から開始予定。
⚠️ 注記:このコンテンツは Google AI によって生成されました。