
2026/09/03 0:12
Gemini 3.8 Flash および Gemini 3.8 Flash Cyber
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
現在のサマリーは物語的な流れに優れていますが、キーポイントリストに含まれる具体的な定量基準が不足しています。以下の改善版では、これらの特定のデータポイントを統合しつつ、読みやすさを維持しています:
改善されたサマリー:
Google は Gemini 3.8 を導入し、Gemini 3.8 Flash と専門的な Gemini 3.8 Flash Cyber の 2 つのバリエーションを特徴としています。標準的な Flash バリエーションは、100 万入力トークンあたり$0.75、100 万出力トークンあたり$3.75(以前の価格と同様)で提供されており、推論能力において著しい飛躍を実現し、プロンプト注入に対する堅牢性を備えた HLE-Verified で 54.9% のスコアを達成しました。複雑なエンジニアリングタスク(DeepSWE)、法律・金融ベンチマークにおいて、より大きな最前線モデルを上回る性能を示しました。
Flash Cyber バリエーションは、新しい Fairwind プログラムを通じて認定されたセキュリティ専門家のみが利用でき、標準モデルに比べて許可された防衛者に対してより寛容な緩和措置を備えています。このバージョンは脆弱性発見においてかつてないスピードを発揮し、例えば重要な基盤的な欠陥を検出するのに通常必要だった数ヶ月に対して 2 時間未満で特定しました。また、Wiz や Collinear などが実施した内部ペネトレーションテストベンチマークにおいて、Flash Cyber は 20 のプログラミング言語にわたり 70% 以上の成功率を達成し、コストも大幅に低下(2.3 倍〜5.2 倍の削減)しました。さらに、Google のクラウド脆弱性研究チームは、Chrome の脆弱性に対してベストクラスの商用モデルよりも 2.6 倍多くの正しいパッチを生産したと報告しており、これにより効率的な脅威検出における新しい業界標準としての地位を確立しました。
本文
Gemini 3.8 と Fairwind プログラム発表:次世代エージェント型知能とサイバーセキュリティの革新
Google DeepMind セキュリティ担当リーダーである**ラルーカ・アダ・ポパ(Raluca Ada Popa)**氏より、最新モデル「Gemini 3.8」および新たなプログラム「Fairwind」に関する発表が行われました。
概要:高速性と高知能を両立する「Gemini 3.8」
3 週間前にリリースされた「Gemini 3.7 Flash」の成功を受け、わずか 6 週間で**「Gemini 3.8」**を正式に公開しました。推論能力とコーディング性能において過去最高レベルとなり、3.7 と同等の高速性と低コストを実現します。
本リリースには以下の 2 つのバリエーションが含まれます:
- Gemini 3.8 Flash
- 実務に堪える「万能モデル」。ソフトウェア工学、エージェント型タスク、専門分野での多段階推論において大幅な性能向上が見られます。
- 入力トークンあたり 75 ドル/百万件、出力トークンあたり 37.5 ドル/百万件という低コストで提供(3.7 Flash と同等)。
- Gemini 3.8 Flash Cyber
- 脆弱性情報の検出や自動パッチ適用において最先端レベルのパフォーマンスを発揮する、サイバーセキュリティ専用モデル。
- 新たな**「Fairwind プログラム」**を通じて、信頼を得た防衛者の方々へ提供されます。
両モデルは異なるデプロイ環境を想定して設計されていますが、基盤となる知能は同一です。長周期的なエージェント型ループによる再帰的な評価・改善プロセスにより加速され、特に高難易度を要するサイバーセキュリティ分野での厳格なトレーニングが性能向上の原動力となりました。
Gemini 3.8 Flash:長期的コード作成と自律型エージェントのために
3.7 Flash から大幅な性能向上を遂げ、高コストの最先端モデルに匹敵するパフォーマンスを発揮します。
主要な性能向上
- DeepSWE v1.1(長期視野を持つソフトウェア工学)
- 複雑なエンジニアリング課題の解決において、3.8 Flash はほとんどの大型最先端モデルを上回り、かつコストは僅かです。
- 専門知識領域における信頼性
- 定量分析や高度なレポート作成を必要とする分野で不可欠な信頼性を備えています。
- Vals Finance Agent V2やHarvey's Legal Agent Benchmarkにおいて他モデルを上回る結果。
- STEM、人文、複数分野を跨ぐ多段階推論に対応(**HLE-Verified で 54.9%**のスコア達成)。
仕組み:「より懸命に働く」
- 複雑なタスクでは慎重になり、追加の推論ステップを実行したり、ツールを反復的に呼び出します。
- パフォーマンス最大化のため、必要に応じてトークン数を増やします(特に高負荷時)。
- コスト効率性が制約となる場合:開発者は低い労力レベルを選択するか、引き続き**「Gemini 3.7 Flash」**を利用できます(効率優先ワークロードは完全サポート継続)。
Gemini 3.8 Flash Cyber:専門的なサイバーセキュリティパフォーマンス
Fairwind プログラムを通じ、複雑な環境での決定的な優位性と、フラッシュ版特有の高速・低コスト特性を提供します。
自律型脆弱性情報発見
- 業界ベンチマーク「CyberGym」
- 自律的な脆弱性発見で最先端レベルのパフォーマンスを発揮。3.5 Flash Cyber を上回り、大型最先端モデルも凌駕します。
- 広範なコードベース対応
- C/C++ に限らず、20 のプログラミング言語にまたがるコードベースを網羅する内部ベンチマークでも評価されました。
- 広範な脆弱性の発見で成功率が70% を超える驚異的な結果を出しました。
自動パッチ適用
- 「攻勢的攻撃」よりも「脆弱性修正(パッチ適用)」を優先的に強化。防衛者に攻撃者に対する優位性を与えます。
- CWE-Bench(Collinear 提供)
- 困難な外部ベンチマークで**47.2%の pass@1 を記録し、主要最先端モデルの47.8%**に匹敵する性能を低いコストで実現。パレート frontier に位置しています。
実世界へのインパクト(Google のコード保護実績)
- Chrome セキュリティチーム
- 商用最良モデルと比較して、Chrome の脆弱性に対し2.6 倍多く正しいパッチを発見。
- Wiz
- コストを2.3〜5.2 倍低く抑えつつ、社内ペネトレーションテストベンチマークでの再検出率が**+7.5%〜9.7%**向上。
- Google クラウド脆弱性情報研究チーム
- 通常数ヶ月を要する調査に代わり、重要な基礎脆弱性を2 時間以内に発見。
安全性とガバナンス
Fairwind プログラムのパートナーの皆様へ
(※信頼された防衛者・政府当局への優先的な提供実績に関する詳細は公式サイトをご参照ください)
開発における安全性の確保
- セーフガード搭載
- CBRN(化学・生物・放射能・核)分野およびサイバー攻勢分野の誤用を防ぎつつ、有益なユースケースを実現(Frontier Safety Framework に準拠)。
- 専用緩和策(Relaxation Policies)
- 3.8 Flash Cyber はより許容的なセットを搭載しており、信頼された防衛者の方々へのみ提供されます。
- プロンプトインジェクションへの強固さ
- Gray Swan測定結果において大幅な飛躍を遂げ、悪意ある攻撃からのユーザー保護を実現しました。
今すぐ始める:アクセス方法
🛠️ 開発者向け
- Google Antigravityにてエージェントファーストのワークフローを構築。
- Google AI StudioおよびAndroid StudioでGemini APIから直ちに開発開始可能。
- UI 生成にはStitchをご利用ください。
- 詳細:開発者ドキュメント
🏢 企業向け
- Gemini Enterpriseにて 3.8 Flash をご利用いただけます。
👤 消費者向け
- Google AI Proおよび Ultra スクエアプランの会員様へ。
- Gemini アプリ、Google シーアの AI モード、Google シーツ上の Gemini で 3.8 Flash を提供。
🔒 サイバーセキュリティ・インフラ運用者向け
- 新たなFairwind プログラムを通じて優先的に利用可能。
- 重要なインフラストラクチャーの運用者様およびソフトウェア保守担当者様向けに、信頼を得た政府当局へGemini 3.8 Flash Cyberを提供します。