Gemini 3.8 Live と Gemini 3.8 Live 拡張思考

2026/09/16 2:38

Gemini 3.8 Live と Gemini 3.8 Live 拡張思考

RSS: https://news.ycombinator.com/rss

要約

日本語訳:

Google が、AI の音声技術における飛躍的な前進を目指して生産環境での使用を想定した音声エージェント向けに公式リリースした「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表しました。これらのモデルは知能と並列推論において大幅な向上を遂げ、Search や Workspace、ServiceNow などのエンタープライズアプリケーションに至るまで Google のエコシステム全体で円滑かつ流動的な連携を実現することを可能にします。安全性の確保のため、生成された全てのオーディオには SynthID を使用して AI コンテンツを検出し誤情報の発生を防ぐためのウォーターマークが施されています。開発者は Gemini API(Agora や LangChain、LiveKit などのパートナー含む)を通じて直ちにこれらの機能を利用でき、エンタープライズ企業はプライベートプレビューを探索できます。この展開により、97 カ国以上の言語を同時に扱える複雑なワークフローに対応可能なスケーラブルで費用効果の高い音声インターフェースを実装できるようになります。特に、「Gemini 3.8 Live Extended Thinking」は Big Bench Audio の推論スコアにおいてトップクラスの 97.7% を記録し、Artificial Analysis の Speech to Speech Quality インデックスでは総合第 1位となりました。一方、標準の「Live」モデルはニアリアルタイムな視覚処理、ツールの実行、自動的な言語切り替えにおいて優れています。両モデルとも、流暢な人間と AI の協働を可能とする新時代を示しています。

本文

Gemini 3.8 Live と 3.8 Live Extended Thinking を発表:リアルタイム対話の新たな進化

Gemini オーディオチーム代表 マリーニ・ジャガナサンです。

本日、近似的リアルタイム推論に新たな進展をもたらす 2 つの新モデル をご報告申し上げます。これにより、音声エージェントの実用性を高め、AI との会話体験をより直感的かつ知能あふれるものへと進化させます。

🚀 新モデルの特徴と概要

当社のこれまで最も進化したリアルタイム対話モデルです。知能水準と並列推論能力の大幅な向上により、音声を通じて複雑なタスクを遂行する際、より直感的に協業・活用できるようになりました。

  • Gemini 3.8 Live

    • スケーラビリティとコスト効率を重視したモデルです。
    • 対話的な知能と流暢な対話を実現しています。
    • **視覚的根拠(Visual Grounding)**を統合し、画像や動画などのコンテキストも理解できます。
  • Gemini 3.8 Live Extended Thinking

    • 高複雑性のタスク向けに設計されたモデルです。
    • 知能水準の向上複数ステップにわたる推論能力を備えています。
    • 思考プロセスをリアルタイムで可視化し、ユーザーが推論を追うことを可能にします。

これらのモデルは、開発者や企業に向けて信頼性が高く即戦力となる音声エージェントの構築基盤を提供します。また、Gemini アプリ、Google Workspace、検索サービス全体を通じて、音声だけで複雑なタスクに取り組むことを支援します。


📊 パフォーマンスとベンチマーク結果

Gemini 3.8 Live Extended Thinking

高知能水準とエンタープライズグレードのタスク完了能力を誇ります。

  • 音声対音声品質指数(Speech to Speech Quality Index):人工分析社のランキングで総合第 1 位(スコア:82.6) を記録。
  • エージェント型タスク完了
    • τ-Voice ベンチマーク:68.6%
    • Sierra の τ-Voice-banking ベンチマーク:35.1%
  • Big Bench Audio ベンチマーク:**97.7%**の推論能力を示す強力な推理機能。
  • 価格競争力:他社の最先端モデルと比較しても非常に高いコストパフォーマンスを維持。

Gemini 3.8 Live

ユーザーから高い評価を得ている流暢な対話モデルです。

  • スピーチエージェントアリーナ(Speech Agent Arena)第 2 位にランクイン。
  • ServiceNow の EVA-Benchにおいて、正確性と対話品質のバランスを取りながら、複雑なワークフローにおけるパレートのフロンティア(最適点の境界線)を押し広げる性能を発揮。
    • 注:評価は Gemini エンタープライズ・エージェントプラットフォーム上の Live API を使用して実施されています。

✨ 主要な機能と体験向上

視覚的入力と多言語対応

  • リアルタイム視覚処理:視覚的入力をほぼリアルタイムで処理し、会話に文脈を加味した有用な回答を提供します。
  • 97 の言語に対応:会話の最中に自動対応する 97 の言語を検出し、シームレスに切り替えます。
  • バックグラウンドタスクの実行:ツール実行や API コールをバックグラウンドで実施しつつ対話を継続するため、タスク完了間も会話が続きます。

思考と発話の両立(Extended Thinking)

より深い推論が必要なタスクにおいて、思考プロセスと発話を同時に行います。

  • プロセスの可視化:「確認しましょう…」といった早期の口頭キューを活用し、バックグラウンドでの複数ステップタスク進行状況をライブで解説します。
  • 途切れのない対話:複雑なワークフローでも知能水準を向上させながら、対話の流れを維持します。
  • 自然な認識:プロンプトへの反応を「確認しましょう」など自然な言葉で認識します。

検索サービスとの連携

Google Workspace および検索サービス全体にわたり、Live モデルは複雑なタスク処理において、より直感的で協働的な体験を提供します。

  • Search Live(検索ライブ):Gemini 3.8 Live に裏打ちされた、段階ごとのリアルタイムトラブルシューティング支援をご利用ください。

🛠️ 開発者および企業向けエコシステム

開発プラットフォームの活用

Gemini Live API を活用することで、高性能な音声駆動型インターフェースの構築・デプロイが容易になります。

  • 対応するプラットフォーム:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents など。
  • メリット:裏側の複雑なリアルタイムメディアストリーミングインフラをプラットフォームが管理するため、開発者はユーザー体験の設計に集中できます。

企業連携

Salesforce、Genspark、Lumeris などの企業とも連携しており、3.8 Live および 3.8 Live Extended Thinking の以下の特性に強く期待を示しています。

  • 印象的なレイテンシ(低遅延)
  • 流暢さ
  • ツールコール能力

🔒 透明性とセキュリティ:SynthID ウォータマーキング

当社 AI 製品で生成されるすべての音声出力には、SynthID を用いたウォータマーキングが適用されています。

  • 目に見えない識別子:音声出力に直接織り込まれており、AI 生成コンテンツの検知を可能にします。
  • 誤情報防止:偽情報の拡散防止に貢献します。
  • 詳細確認:モデルカードをご覧ください。

📅 最新 Gemini オーディオモデルのご利用開始スケジュール

✅ Gemini 3.8 Live(本日より順次リリース)

  • 開発者向け:Gemini API および Google AI Studio
  • 企業向け
    • Gemini Enterprise(プライベートプレビュー提供済み)
    • まもなく「Gemini Enterprise for Customer Experience」で利用可能に
  • 一般ユーザー向け:Search Live

✅ Gemini 3.8 Live Extended Thinking(本日より順次リリース)

  • 開発者向け:Gemini API および Google AI Studio
  • 企業向け
    • Gemini Enterprise(プライベートプレビュー提供済み)
    • まもなく「Gemini Enterprise for Customer Experience」および「Google Workspace ビジネス顧客」で利用可能に
  • 一般ユーザー向け
    • Gemini Liveへの加算リリース
    • Google Workspace ドキュメント:Google AI Pro および Ultra サブスクライバー限定
    • Gmail と Keep:すべての Google AI サブスクライバーが利用可能

📩 最新ニュースのお知らせ 製品アップデート、イベント情報、特別オファーなどを受け取るために、メールマガジンのニュースレターに登録してください。
(提供した情報は、Google のプライバシーポリシーの定める通り適切に利用されます。いつでも解除可能です。)

同じ日のほかのニュース

一覧に戻る →

2026/09/16 4:25

「System One モデルと Jev」の紹介

## Japanese Translation: TypeSafe AI は、即座で誤りのない自動意思決定のために設計された画期的な「System One」モデルである **Jev** を発表しました。従来の言語モデルが単なるテキスト文字列を生成するのに対し、Jev は型安全構造化値を出力し、データの一貫性を確保しながらハルシネーションを排除します。このアーキテクチャ変更は並列サンプラにより支えられており、すべての応答を同時に処理して結果を 70ms から 500ms の範囲で提供可能にしています。これにより既存のツールと比較して最大 200 倍高速化されながら、著しく低いコスト(入力トークンあたり約 0.042 ドルで出力コストはほぼゼロ)を実現しています。システムは、標準的なアライメント手法に依存せず、検証可能な報酬を最優先する「Calibrated Decisions」用の強化学習を用いた専門的なトレーニングを受けました。 カハニーマンの快思考といった認知科学の概念に触発された Jev は、現在のフロンティアモデルと対比して顕著な効率性でベンチマークされています。Jev は、高速ゲームインタラクションや迅速なビッグデータ処理といったリアルタイムアプリケーションを可能にしており、既存のツールに対して最大 200 倍高速化されながらコストは大幅に削減されています。その結果、リアルタイムインテリジェンスに依存する業界では、一貫した信頼スコアと近乎ゼロのレイテンシを提供するシステムへの転換が期待でき、これにより現在の大規模言語モデル展開におけるボトルネックを効果的に解決します。

2026/09/15 21:31

Show HN: 鳥の声に反応して、19 世紀の挿絵風に描く電子ペーパーフレーム

## Japanese Translation: 「Fugleramme」プロジェクトは、ノルウェー・ベルゲンの厨房の窓を、ローカル AI と歴史的自然史のアートを組み合わせることでリアルタイムデジタルバードウォッチングキオスクへと変えます。BirdNET-Go を使用してデバイス上で鳴き声を検出し、公有ドメインソースからの手切りされた 1800 年代の図版として一致結果を Inky Impression e-ink パネルに表示します(アート作品は AI で生成されておらず、一部のものは補正されています)。800 枚以上の切り抜きがあり、400 種以上をカバーし、主にスキャンディナヴィア、英国、中欧の種を対象とし、より広いカバレッジが計画されています。検出された種は背景除去処理され、体格サイズに合わせたテクスチャ付きページに配置され、空のスロットには裸の枝が表示されます。システムは Raspberry Pi 5(推奨)、Inky Impression 13.3 インチディスプレイ、マイク、A4 フレームでローカルで動作しますが、Web キオスクまたは Docker(`ghcr.io/arnegiacomo/fugleramme`)または `install.sh` を通じても動作します。また、ローカルまたはリモートの BirdNET-Go インスタンスをターゲットとすることも可能です。現在は初期開発段階であり、コミュニティからの貢献(修正、ドキュメント、アート作品)を歓迎しており、バグ報告には Discussions を使用し、コード・アート・ドキュメントの変更には PR を使用します。WWF のポスター(Axel Thorenfeldt 氏)や AvianVisitors に着想を得た Fugleramme は、アクセシブルなハードウェアが厳選された公有ドメインのアートを通じて複雑なオーディオデータを可視化する方法を示しています。コードは MIT ライセンス、検出および画像は適切な CC ライセンス(適用可能な場合、非商用制限を含む)の下にあります。 ## Text to translate: The "Fugleramme" project turns a kitchen window in Bergen, Norway, into a real-time digital bird-watching kiosk by combining local AI with historical natural history art. Using BirdNET-Go, it detects bird calls on-device and displays matches as hand-cut 1800s illustrations from public-domain sources on an Inky Impression e-ink panel; no artwork is AI-generated (some is retouched). Over 800 cut-outs cover more than 400 species, primarily Scandinavian, British, and central European, with broader coverage planned. Detected species are background-removed and packed onto a textured page sized by body mass; empty slots show a bare perch. The system runs locally on a Raspberry Pi 5 (recommended), an Inky Impression 13.3" display, a microphone, and an A4 frame, but can also run as a web-only kiosk or via Docker (`ghcr.io/arnegiacomo/fugleramme`) or `install.sh`. It supports pointing at local or remote BirdNET-Go instances. Currently in early development, the project invites community contributions (fixes, docs, artwork) and uses Discussions for bug reports while PRs are for code/art/docs changes. Inspired by a WWF poster by Axel Thorenfeldt and AvianVisitors, Fugleramme demonstrates how accessible hardware can visualize complex audio data through curated public-domain art, with code under MIT and detection/images under appropriate CC licenses (including non-commercial constraints where applicable).

2026/09/16 6:07

ドイツのライネメタルが戦術システム接続用武器プロトコルのオープンソース化を発表

## Japanese Translation: The onboardapi ライブラリは、Object Management Group (OMG) から Data Distribution Service (DDS) によるデータ交換の標準化を通じて、センサーシステムとソフトウェア間の通信を簡素化します。ddkit ツールキットを基盤とし、この C++ ベースのソリューションは OMG の XTypes および XCDR2 エンコーディングを活用してシームレスな相互運用性を確保し、データモデルが進化するに連れて完全な後方互換性を保証します。Java、Python、C#、および .NET 向けのラッパーを通じて多言語統合をサポートし、クライアント/サービスアーキテクチャに関するドキュメント、セットアップガイド、コード例、変更ログ、 browsable データモデルインターフェースを含む豊富なリソースを提供します。このライブラリは、堅牢なクロスプラットフォーム接続を維持することでスケール可能な産業用アプリケーションを可能にします。そのインターフェースは EPL v2.0 ライセンスに基づき、ランタイムライブラリは EULA-RME-SDK-1.0 ライセンスに従います。 ## Text to translate: The onboardapi library streamlines communication between sensor systems and software by standardizing data exchange through the Data Distribution Service (DDS) from the Object Management Group (OMG). Built on the ddkit toolkit, this C++-based solution ensures seamless interoperability via OMG's XTypes and XCDR2 encoding, guaranteeing full backward compatibility as the data model evolves. It supports multi-language integration through wrappers for Java, Python, C#, and .NET, with extensive resources including documentation on Client/Service architecture, setup guides, code examples, a changelog, and browsable Data Model interfaces. The library facilitates scalable industrial applications by maintaining robust cross-platform connectivity; its interfaces are licensed under EPL v2.0, while runtime libraries adhere to the EULA-RME-SDK-1.0 license.