Gemini 3.8 Flash および Gemini 3.8 Flash Cyber

2026/09/03 0:12

Gemini 3.8 Flash および Gemini 3.8 Flash Cyber

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

現在のサマリーは物語的な流れに優れていますが、キーポイントリストに含まれる具体的な定量基準が不足しています。以下の改善版では、これらの特定のデータポイントを統合しつつ、読みやすさを維持しています:

改善されたサマリー:

Google は Gemini 3.8 を導入し、Gemini 3.8 Flash と専門的な Gemini 3.8 Flash Cyber の 2 つのバリエーションを特徴としています。標準的な Flash バリエーションは、100 万入力トークンあたり$0.75、100 万出力トークンあたり$3.75(以前の価格と同様)で提供されており、推論能力において著しい飛躍を実現し、プロンプト注入に対する堅牢性を備えた HLE-Verified で 54.9% のスコアを達成しました。複雑なエンジニアリングタスク(DeepSWE)、法律・金融ベンチマークにおいて、より大きな最前線モデルを上回る性能を示しました。

Flash Cyber バリエーションは、新しい Fairwind プログラムを通じて認定されたセキュリティ専門家のみが利用でき、標準モデルに比べて許可された防衛者に対してより寛容な緩和措置を備えています。このバージョンは脆弱性発見においてかつてないスピードを発揮し、例えば重要な基盤的な欠陥を検出するのに通常必要だった数ヶ月に対して 2 時間未満で特定しました。また、Wiz や Collinear などが実施した内部ペネトレーションテストベンチマークにおいて、Flash Cyber は 20 のプログラミング言語にわたり 70% 以上の成功率を達成し、コストも大幅に低下(2.3 倍〜5.2 倍の削減)しました。さらに、Google のクラウド脆弱性研究チームは、Chrome の脆弱性に対してベストクラスの商用モデルよりも 2.6 倍多くの正しいパッチを生産したと報告しており、これにより効率的な脅威検出における新しい業界標準としての地位を確立しました。

本文

Gemini 3.8 と Fairwind プログラム発表:次世代エージェント型知能とサイバーセキュリティの革新

Google DeepMind セキュリティ担当リーダーである**ラルーカ・アダ・ポパ(Raluca Ada Popa)**氏より、最新モデル「Gemini 3.8」および新たなプログラム「Fairwind」に関する発表が行われました。

概要:高速性と高知能を両立する「Gemini 3.8」

3 週間前にリリースされた「Gemini 3.7 Flash」の成功を受け、わずか 6 週間で**「Gemini 3.8」**を正式に公開しました。推論能力とコーディング性能において過去最高レベルとなり、3.7 と同等の高速性と低コストを実現します。

本リリースには以下の 2 つのバリエーションが含まれます:

  • Gemini 3.8 Flash
    • 実務に堪える「万能モデル」。ソフトウェア工学、エージェント型タスク、専門分野での多段階推論において大幅な性能向上が見られます。
    • 入力トークンあたり 75 ドル/百万件出力トークンあたり 37.5 ドル/百万件という低コストで提供(3.7 Flash と同等)。
  • Gemini 3.8 Flash Cyber
    • 脆弱性情報の検出や自動パッチ適用において最先端レベルのパフォーマンスを発揮する、サイバーセキュリティ専用モデル。
    • 新たな**「Fairwind プログラム」**を通じて、信頼を得た防衛者の方々へ提供されます。

両モデルは異なるデプロイ環境を想定して設計されていますが、基盤となる知能は同一です。長周期的なエージェント型ループによる再帰的な評価・改善プロセスにより加速され、特に高難易度を要するサイバーセキュリティ分野での厳格なトレーニングが性能向上の原動力となりました。


Gemini 3.8 Flash:長期的コード作成と自律型エージェントのために

3.7 Flash から大幅な性能向上を遂げ、高コストの最先端モデルに匹敵するパフォーマンスを発揮します。

主要な性能向上

  • DeepSWE v1.1(長期視野を持つソフトウェア工学)
    • 複雑なエンジニアリング課題の解決において、3.8 Flash はほとんどの大型最先端モデルを上回り、かつコストは僅かです。
  • 専門知識領域における信頼性
    • 定量分析や高度なレポート作成を必要とする分野で不可欠な信頼性を備えています。
    • Vals Finance Agent V2Harvey's Legal Agent Benchmarkにおいて他モデルを上回る結果。
    • STEM、人文、複数分野を跨ぐ多段階推論に対応(**HLE-Verified で 54.9%**のスコア達成)。

仕組み:「より懸命に働く」

  • 複雑なタスクでは慎重になり、追加の推論ステップを実行したり、ツールを反復的に呼び出します。
  • パフォーマンス最大化のため、必要に応じてトークン数を増やします(特に高負荷時)。
  • コスト効率性が制約となる場合:開発者は低い労力レベルを選択するか、引き続き**「Gemini 3.7 Flash」**を利用できます(効率優先ワークロードは完全サポート継続)。

Gemini 3.8 Flash Cyber:専門的なサイバーセキュリティパフォーマンス

Fairwind プログラムを通じ、複雑な環境での決定的な優位性と、フラッシュ版特有の高速・低コスト特性を提供します。

自律型脆弱性情報発見

  • 業界ベンチマーク「CyberGym」
    • 自律的な脆弱性発見で最先端レベルのパフォーマンスを発揮。3.5 Flash Cyber を上回り、大型最先端モデルも凌駕します。
  • 広範なコードベース対応
    • C/C++ に限らず、20 のプログラミング言語にまたがるコードベースを網羅する内部ベンチマークでも評価されました。
    • 広範な脆弱性の発見で成功率が70% を超える驚異的な結果を出しました。

自動パッチ適用

  • 「攻勢的攻撃」よりも「脆弱性修正(パッチ適用)」を優先的に強化。防衛者に攻撃者に対する優位性を与えます。
  • CWE-Bench(Collinear 提供)
    • 困難な外部ベンチマークで**47.2%の pass@1 を記録し、主要最先端モデルの47.8%**に匹敵する性能を低いコストで実現。パレート frontier に位置しています。

実世界へのインパクト(Google のコード保護実績)

  • Chrome セキュリティチーム
    • 商用最良モデルと比較して、Chrome の脆弱性に対し2.6 倍多く正しいパッチを発見。
  • Wiz
    • コストを2.3〜5.2 倍低く抑えつつ、社内ペネトレーションテストベンチマークでの再検出率が**+7.5%〜9.7%**向上。
  • Google クラウド脆弱性情報研究チーム
    • 通常数ヶ月を要する調査に代わり、重要な基礎脆弱性を2 時間以内に発見。

安全性とガバナンス

Fairwind プログラムのパートナーの皆様へ

(※信頼された防衛者・政府当局への優先的な提供実績に関する詳細は公式サイトをご参照ください)

開発における安全性の確保

  • セーフガード搭載
    • CBRN(化学・生物・放射能・核)分野およびサイバー攻勢分野の誤用を防ぎつつ、有益なユースケースを実現(Frontier Safety Framework に準拠)。
  • 専用緩和策(Relaxation Policies)
    • 3.8 Flash Cyber はより許容的なセットを搭載しており、信頼された防衛者の方々へのみ提供されます。
  • プロンプトインジェクションへの強固さ
    • Gray Swan測定結果において大幅な飛躍を遂げ、悪意ある攻撃からのユーザー保護を実現しました。

今すぐ始める:アクセス方法

🛠️ 開発者向け

  • Google Antigravityにてエージェントファーストのワークフローを構築。
  • Google AI StudioおよびAndroid StudioGemini APIから直ちに開発開始可能。
  • UI 生成にはStitchをご利用ください。

🏢 企業向け

  • Gemini Enterpriseにて 3.8 Flash をご利用いただけます。

👤 消費者向け

  • Google AI Proおよび Ultra スクエアプランの会員様へ。
    • Gemini アプリ、Google シーアの AI モード、Google シーツ上の Gemini で 3.8 Flash を提供。

🔒 サイバーセキュリティ・インフラ運用者向け

  • 新たなFairwind プログラムを通じて優先的に利用可能。
  • 重要なインフラストラクチャーの運用者様およびソフトウェア保守担当者様向けに、信頼を得た政府当局へGemini 3.8 Flash Cyberを提供します。

同じ日のほかのニュース

一覧に戻る →

2026/08/31 21:01

ImHex を使った未知のファイル形式のリバースエンジニアリング

## Japanese Translation: ここで詳述される主な成就是不動の ImHex 解析ツールを用いて、FEZ の独自バイナリセーブファイル形式を完全な構造定義へと逆工学するに至ったことである。JetBrains Rider を用いてゲームの .NET コンポーネントをデコンパイルすることで、研究者は `EasyStorage` ライブラリ内部にある特定のロジック、特にデータシリアライゼーションを担当する `PCKsaveDevice` コンポーネントを特定した。このコンポーネントは、Windows の FILETIME タイムスタンプとシリアライズされたゲームデータを含まれる 4096 バイトのバッファー内で動作する。このプロセスには、ImHex 内にカスタムのパターンを作成して複雑な内部レイアウト(7 ビット符号化文字列、`OneTimeTutorials` のようなキー値ペアのリスト、`LevelSaveData` のようなネスト構造、`ActorType` のような列挙体など)をマッピングする作業が含まれた。注目すべきは、FEZ のセーブファイルが OS 固有のパスに格納されながら暗号化も標準的なマジックヘッダーも含まず、今や完全にデコード可能になった点である。ImHex で設定された後、ユーザーは強調表示された Hex View を通じて生データを閲覧し、Pattern Data View を通じて編集可能な値を変更することができる。その結果、プレイヤーは公式のゲーム内ツールに依存せずにセーブファイルを独自に編集する能力を得る一方で、開発者はこのオープンな定義を用いて安全にゲーム状態を分析したり、バックアップユーティリティを作成したりできるようになる。なお、著者は秘密や終盤コンテンツに関する重いス ポイラーがあるため、FEZ をプレイしてから本文を読むことを推奨していることに注意されたい。

2026/09/03 7:36

Launch HN: ロナン・エックス(YC S26)– 個別最適化されたペプチドとGLP-1

## Japanese Translation: 本サービスは、GLP-1 減量治療を転換させ、硬直した標準プロトコルを、患者それぞれの唯一無二の医療歴および耐容性に合わせた、極めて個別化された医師主導のケア計画で置き換えます。吐き気や疲労などの副作用に対応せずにはいられない固定的なラベルアプローチとは異なり、本モデルは必要に応じてターゲッティングされたサポートを加え、耐容性と一貫性を向上させます。重要な安全機能として厳格な「失敗時に閉じる(fail-closed)」検証プロセスがあります:患者が選択した薬局(例:Elite Care Pharmacy LLC または別の希望薬局)の認可を受けた薬剤師は、調剤薬をリリースする前に、すべての詳細が特定の患者チャートと一致することを確認し、棚から決して取られないロット追跡可能な成分を使用します。これにより投与前の精密性が確保され、有効期限(beyond-use date)の制限とともに、リリース時に薬剤師の署名が含まれます。このプロセスは医師主導の権限チェーンに従い—医師が処方し、認可された薬剤師が検証してリリースする—with 何人も医師の判断を上回ることはできません。すべての工程には「失敗時に閉じる」ゲートが組み込まれており、検証が失敗した場合(例:処方がチャートと一致しないか、ロットが追跡できない場合)は注文が停止し、何も出荷されません。品質保証は完全に行間ごとのチェックに依存し、必要に応じて冷鏈要件を満たす温度感知包装、配送、トラッキングを使用します。調剤製剤は通常、現金払いによるブランド名のリスト価格よりもコストが低い傾向がありますが、実際のコストは計画、薬局、州によって異なります。これにより、ブランド医薬品と比較して長期的な持続可能性が向上します。なお、調剤薬は FDA の直接承認の枠外で運営され、ブランド版からの臨床試験データは直接的に適用できないことに注意が必要です。将来のリフィルは決して自動的ではなく、継続的な医師によるレビューを必要とするため、治療計画は患者の体が初期週間にわたって安定化するにつれて適応させることができます。本サービスは HIPAA 準拠とエンドツーエンド暗号化を維持し、ケア全体を通じて高水準のプライバシーを確保します。究極的には、このアプローチは業界を「ワンサイズフィッツオール」なラベルから、安価さ、安全性、品質保証、医療監督が個別化された検証と継続的な医師監督を通じてバランスされている厳格なシステムへとシフトさせます。

2026/09/03 4:49

Fable 5.1 ワールドモデリング

## Japanese Translation: 「Worlds via code」プロジェクトは、高価なゲームエンジンや手動のモデリングを必要とせず、標準的な Web ブラウザ内で直接リアルな街並みの再構築を自律的に行うことで、3D コンテンツの制作方法を革命化した。自律エージェントによる高度なパイプラインを用いて、OpenStreetMap の幾何学データ、USGS の標高データ、公共交通仕様、店舗調査などのオープンデータを取り込み、ゼロから高忠実度の環境を構築する。 主なデモはサンフランシスコのユニオンスクエアの再構築であり、Powell、Geary、Post、Stockton 通りを覆う実地形上での航空撮影式ウォークスルー、実際のストリートグリッドを含んでいる。この環境には、75 の手作業で作成されたファサードバリアントを含む 453 の OSM フットプリントにわたる 129 つの特定された店舗、作動する信号機、ケーブルカー、そして一日・日没・夜の完全なサイクルが含まれる。ライフシミュレーションでは、Powell ストリートケーブルカーを含む 1,398 ノードのナビゲーショングラフをnavigate し、220 の歩行者、および 109 の車両が移動し、シーンを生気に満ちたものとしている。Apple Union Square と Nintendo SAN FRANCISCO という 2 つの探索可能な内部空間には、それぞれ 23 つのインタラクティブなオブジェクトが用意されている。 アセット生成は Blender-as-a-library スクリプトを使用してオフラインで行われ、ファサード、家具、車両、植生、設備、歩行者部品などの最適化された GLB パッケージを出力する。実行時においては、Three.js 純粋なアプリケーションが JSON の仕様に従って地形、道路、ファサード、小道具、群衆、交通を組み合わせ、プロプライエタリソフトウェアは必要としない。品質保証では、Playwright を使用して固定されたカメラ位置一致のビューポイント(合計 34)でアプリを操作し、これらのビューのスクリーンショットを取得し、フリーライセンスの photographs と diff することで、9 人の独立したレビュアーからの入力に基づき、147 の比較シートにわたって検証を行う。生成されたプロジェクトは `npm run dev` を通じて実行可能な単純な Three.js アプリとして配布され、コードは MIT ライセンス下、幾何学は ODbL および USGS のパブリックドメインデータから派生し、ブランド名・ロゴは実在の企業がその正しい場所にあることを識別するために使用される。このフレームワークは、最終的に、新しい地理データを投入するだけで、Web ブラウザを持つ誰でも高忠実度の仮想世界を作成することを可能にする。

Gemini 3.8 Flash および Gemini 3.8 Flash Cyber | そっか~ニュース