
2026/07/22 0:17
Gemini 3.6 Flash、3.5 Flash-Lite および 3.5 Flash Cyber
RSS: https://news.ycombinator.com/rss
要約▶
Japanese 翻訳:
以下の改良版は、欠落していた価格データ、具体的なベンチマークハイライト、および販売チャネルを統合し、「要点リスト」への完全な忠実性を確保しています:
改善されたサマリー
Google は正式に、AI エージェントの効率を大幅に向上させ、レイテンシを低減し、コストを削減することを目的とした 3 つの進化した Gemini モデル——3.6 Flash、3.5 Flash-Lite、および専門性の高い 3.5 Flash Cyber を紹介しました。Gemini 3.6 Flashは、トークン使用量を最大で 17%削減(入力トークンあたり$1.50 で提供)しながら、より高い精度を実現します。DeepSWE のようなベンチマークでは、先行する 3.5 Flash の 37% に対して 49% という成功率を達成し、ML リサーチおよびコンピューター使用に関する能力にも顕著な改善が見られます。Gemini 3.5 Flash-Liteはシリーズ内で最も高速なモデルとして際立っており、1 秒間に 350 以上の出力トークンを処理(入力トークンあたり$0.3 で提供)し、複数のコーディングベンチマークにおいて 3.5 Flash および 3 Flash を凌駕しています。
セキュリティニーズに応えるため、Google は CodeMender エコシステム内でのサイバーセキュリティ脆弱性の特定と是正に最適化された3.5 Flash Cyberバリアントをローンチしました。これらの技術の二重用途特性により、この特定のモデルは、限定されたパイロットプログラムを通じて検証済みの政府機関および信頼パートナーのみが利用可能です。すべての新モデルは直ちに Gemini API、Google AI Studio、Android Studio、およびその他の開発プラットフォーム経由で利用可能であり、すぐに Google Search への展開も始まっています。
本文
ジーミニ(Gemini)新モデル発表:効率性と品質の両立で AI エージェント構築を加速
Google は、大規模な AI エージェント構築において高い効率性、低遅延、そして堅牢な信頼性を提供する最新モデルを発表しました。本稿では、新リリースのモデル構成と主要な性能向上について整理します。
🚀 新シリーズのコンセプト:Flash シリーズ
開発者が本番環境での AI エージェント構築を実現するためには、以下の 3 つが不可欠です。
- 極めて高いトークン効率
- 最小限のレイテンシ(遅延)
- 安定したパフォーマンス
「Flash シリーズ」は、これらを絶妙なバランスで実現し、エージェントワークフローのスケールアップを可能にするよう設計されています。
📋 発表された新モデル一覧
1. Gemini 3.6 Flash:主力モデルとしての進化
コーディング、知識ベースタスク、マルチモーダルパフォーマンスにおいて優れています。
- トークン効率の劇的改善
- **「人工分析指数(Artificial Analysis Index)」**によれば、出力トークンの使用量を 3.5 Flash よりも 17% 削減。
- 「Datacurve」の「DeepSWE」ベンチマークでは最大 65% の削減が実現。
- 出力トークンあたりのコスト低減を達成。
2. Gemini 3.5 Flash-Lite:高速で高コストパフォーマンスモデル
3.5 シリーズの中で最も処理速度が速く、かつコスト効率に優れています。
- 高出力速度
- 「人工分析指数」の計測では、1 秒あたり 350 トークンの出力が可能。
- 従来の Flash-Lite 世代よりもエージェントワークフローにおいて著しく高いパフォーマンスを発揮。
3. Gemini 3.5 Flash Cyber in CodeMender:セキュリティ特化モデル
セキュリティアプリケーション向けに、モデルとインフラストラクチャを慎重にオーケストレーションしたソリューションです。
- 高度なセキュリティ機能
- 新しい高効率なサイバーセキュリティ特化モデルと、「CodeMender」コードセキュリティエージェントを組み合わせています。
- 最先端かつ競争力のあるセキュリティパフォーマンスを達成します。
🔮 今後の展開について
本日発表されたリリース以外にも、以下の計画が進められています。
- Gemini 3.5 Pro:すでにパートナーとのテスト段階へ入っており、準備が整った時点で広く一般に利用可能と予定です。
- 次世代モデル構築:現時点で最も大規模な事前学習(pre-training)キャンペーンを開始しました。
⚡ Gemini 3.6 Flash の詳細:より効率的で質の高いパフォーマンス
3.6 Flash は、開発者およびお客様からの「3.5 Flash」に関するフィードバックを直接反映させる形で構築されています。
💰 コスト効率
低い価格設定と組み合わされたコスト削減効果です。
- 入力トークン:$1.50/件
- 出力トークン:$7.50/件
- これにより、エージェントタスク全体のコストが削減され、AI エージェントの構築および運用におけるコスト効率が著しく高まっています。
📊 パフォーマンスベンチマーク
効率性を損なうことなく、以下のユースケースにおいて 3.5 Flash を凌駕する性能を発揮します。
- コーディング・知識ベースタスク
- 誤ったコード編集や無限ループが減少し、より高い精度を提供します。
- DeepSWE:49%(対比:3.5 Flash の 37%)
- MLE Bench:63.9%(対比:3.5 Flash の 49.7%)
- コンピュータ操作能力
- OSWorld-Verified ベンチマークで 83.0% を達成(対比:3.5 Flash の 78.4%)。
- ネイティブなクライアントサイドツールとしてコンピュータ操作機能が組み込まれています(Gemini API / Enterprise 共通)。
- 知識ベースタスク
- GDPval-AA v2 ベンチマークで 1421 を記録(対比:3.5 Flash の 1349)。
- 顧客例(Hebbia, Harvey など):ドキュメント解析、グラフおよびデータ分析、レポートドラフティングにおいて特に高い能力を持つと評価。
🛡️ 安全性について (Frontier Safety)
3.6 Flash は、以下の分野における強化された Frontier Safety サイガードを備えた状態でリリースされます。
- 対象領域:化学(Chemical)、生物学的(Biological)、放射性(Radiological)、核(Nuclear)(CBRN)およびサイバー攻撃の悪用。
- 耐性向上:モデルは jailbreak(強制的な指令誘発)に対して大幅に耐性が高まっています。
- 有益性維持:同時に、有益な用途に対する拒否を最小限に抑えるよう学習済みです。
- 詳細は「3.6 Flash モデルカード」をご覧ください。
🚀 Gemini 3.5 Flash-Lite の詳細:エージェントワークフローのスケールアップ向け
低遅延タスクや高いスループットが重要な開発者ワークフロー(例:エージェント検索、ドキュメント処理)向けにリリースされます。
💰 コスト効率
- 入力トークン:$0.3/件
- 出力トークン:$2.5/件
- 3.1 Flash-Lite よりも著しく高い品質を提供し、高スループットの本番トラフィックを処理するコスト対性能比が優れています。
📈 パフォーマンス特性
- 大容量タスクの効率化
- 思考レベル(Thought level)に応じてモデルを構成可能。
- 大容量タスク:最小限かつ低い思考レベルで低遅延・低コストの実行を優先。
- マルチステップサブエージェントワークロード:高い思考レベルを使用可能。
- 包括的なパフォーマンス向上
- Terminal-Bench 2.1:54%(対比:3.5 Flash-Lite の 31%)
- 長文脈対応(GDM-MRCR v2):72.2%(対比:60.1%)
- 現実世界でのタスク実行(GDPval-AA v2):1140(対比:642)
- 上位モデルを超える性能
- 多くのエージェント評価およびコーディングタスクにおいて、3.5 Flash-Lite は 3 Flash を凌駕。
- SWE-Bench Pro:54.2%(対比:49.6%)
- OSWorld-Verified:74.0%(対比:65.1%)
- これにより、2.5 および 3 Flash のワークロードの両方で、より高速かつ能力の高い選択肢となります。
🗣️ お客様の声
早期に活用されたお客様は、スケーラブルなエージェントワークフローおよびデータ処理タスクにおいて、速度、知能、コスト効率という独自の組み合わせを高く評価しています。
- 詳細は「3.5 Flash-Lite モデルカード」をご覧ください。
🛡️ 3.5 Flash Cyber in CodeMender の運用アプローチ
AI モデルがシステムよりも速くセキュリティ脆弱性を発見する能力を獲得しました。これに対処するには、極めて高度かつ効率的なソフトウェア保護アプローチが必要です。
高効率な基盤
- 「Flash」のパフォーマンスと効率が、コードセキュリティ問題を大規模に検出・検証・パッチ適用するための理想的な基盤を提供します。
- トークンコストの削減:より大きなモデルよりもトークンあたりのコストが低減しています。
- 統合レポート:「CodeMender」内では、複数の 3.5 Flash Cyber エージェントが連携して単一の統合レポートを生成し、「CyberGym」ベンチマークにおいて最先端かつ競争力のあるパフォーマンスを達成します。
慎重な展開計画 (デュアルユース対策)
- 限られたアクセス:政府および信頼されたパートナー(CodeMender 経由)のみを対象としたパイロットプログラムとして近日中に利用可能になります。
- 目的:最前線の防衛者が重要な脆弱性を悪用される前に発見・修正できる「先手」を取り、広範な誤用の防止にも寄与します。
📅 今日から始める:入手とロードマップ
🛒 3.6 Flash と 3.5 Flash-Lite の入手開始
- 開発者向け
- Google AI Studio および Android Studio を通じて Gemini API で利用可能。
- 「3.6 Flash」はまた、Google Antigravity でも利用可能。
- 詳細:「開発者ガイド」をご覧ください。
- 企業向け
- Gemini Enterprise Agent Platform と Gemini Enterprise アプリにおいて「3.6 Flash」の利用が可能です。
- 一般ユーザー向け
- Gemini アプリで利用可能です。
🔜 今後のロードマップ
- フィードバック募集:3.6 Flash および 3.5 Flash-Lite の活用による貴重なご意見をお待ちしております(今後のモデル改善に役立ちます)。
- 次期リリース:間もなく Gemini 3.5 Pro のリリースも予定です。