
2026/09/16 2:38
Gemini 3.8 Live と Gemini 3.8 Live 拡張思考
RSS: https://news.ycombinator.com/rss
要約▶
日本語訳:
Google が、AI の音声技術における飛躍的な前進を目指して生産環境での使用を想定した音声エージェント向けに公式リリースした「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表しました。これらのモデルは知能と並列推論において大幅な向上を遂げ、Search や Workspace、ServiceNow などのエンタープライズアプリケーションに至るまで Google のエコシステム全体で円滑かつ流動的な連携を実現することを可能にします。安全性の確保のため、生成された全てのオーディオには SynthID を使用して AI コンテンツを検出し誤情報の発生を防ぐためのウォーターマークが施されています。開発者は Gemini API(Agora や LangChain、LiveKit などのパートナー含む)を通じて直ちにこれらの機能を利用でき、エンタープライズ企業はプライベートプレビューを探索できます。この展開により、97 カ国以上の言語を同時に扱える複雑なワークフローに対応可能なスケーラブルで費用効果の高い音声インターフェースを実装できるようになります。特に、「Gemini 3.8 Live Extended Thinking」は Big Bench Audio の推論スコアにおいてトップクラスの 97.7% を記録し、Artificial Analysis の Speech to Speech Quality インデックスでは総合第 1位となりました。一方、標準の「Live」モデルはニアリアルタイムな視覚処理、ツールの実行、自動的な言語切り替えにおいて優れています。両モデルとも、流暢な人間と AI の協働を可能とする新時代を示しています。
本文
Gemini 3.8 Live と 3.8 Live Extended Thinking を発表:リアルタイム対話の新たな進化
Gemini オーディオチーム代表 マリーニ・ジャガナサンです。
本日、近似的リアルタイム推論に新たな進展をもたらす 2 つの新モデル をご報告申し上げます。これにより、音声エージェントの実用性を高め、AI との会話体験をより直感的かつ知能あふれるものへと進化させます。
🚀 新モデルの特徴と概要
当社のこれまで最も進化したリアルタイム対話モデルです。知能水準と並列推論能力の大幅な向上により、音声を通じて複雑なタスクを遂行する際、より直感的に協業・活用できるようになりました。
-
Gemini 3.8 Live
- スケーラビリティとコスト効率を重視したモデルです。
- 対話的な知能と流暢な対話を実現しています。
- **視覚的根拠(Visual Grounding)**を統合し、画像や動画などのコンテキストも理解できます。
-
Gemini 3.8 Live Extended Thinking
- 高複雑性のタスク向けに設計されたモデルです。
- 知能水準の向上と複数ステップにわたる推論能力を備えています。
- 思考プロセスをリアルタイムで可視化し、ユーザーが推論を追うことを可能にします。
これらのモデルは、開発者や企業に向けて信頼性が高く即戦力となる音声エージェントの構築基盤を提供します。また、Gemini アプリ、Google Workspace、検索サービス全体を通じて、音声だけで複雑なタスクに取り組むことを支援します。
📊 パフォーマンスとベンチマーク結果
Gemini 3.8 Live Extended Thinking
高知能水準とエンタープライズグレードのタスク完了能力を誇ります。
- 音声対音声品質指数(Speech to Speech Quality Index):人工分析社のランキングで総合第 1 位(スコア:82.6) を記録。
- エージェント型タスク完了:
- τ-Voice ベンチマーク:68.6%
- Sierra の τ-Voice-banking ベンチマーク:35.1%
- Big Bench Audio ベンチマーク:**97.7%**の推論能力を示す強力な推理機能。
- 価格競争力:他社の最先端モデルと比較しても非常に高いコストパフォーマンスを維持。
Gemini 3.8 Live
ユーザーから高い評価を得ている流暢な対話モデルです。
- スピーチエージェントアリーナ(Speech Agent Arena)で第 2 位にランクイン。
- ServiceNow の EVA-Benchにおいて、正確性と対話品質のバランスを取りながら、複雑なワークフローにおけるパレートのフロンティア(最適点の境界線)を押し広げる性能を発揮。
- 注:評価は Gemini エンタープライズ・エージェントプラットフォーム上の Live API を使用して実施されています。
✨ 主要な機能と体験向上
視覚的入力と多言語対応
- リアルタイム視覚処理:視覚的入力をほぼリアルタイムで処理し、会話に文脈を加味した有用な回答を提供します。
- 97 の言語に対応:会話の最中に自動対応する 97 の言語を検出し、シームレスに切り替えます。
- バックグラウンドタスクの実行:ツール実行や API コールをバックグラウンドで実施しつつ対話を継続するため、タスク完了間も会話が続きます。
思考と発話の両立(Extended Thinking)
より深い推論が必要なタスクにおいて、思考プロセスと発話を同時に行います。
- プロセスの可視化:「確認しましょう…」といった早期の口頭キューを活用し、バックグラウンドでの複数ステップタスク進行状況をライブで解説します。
- 途切れのない対話:複雑なワークフローでも知能水準を向上させながら、対話の流れを維持します。
- 自然な認識:プロンプトへの反応を「確認しましょう」など自然な言葉で認識します。
検索サービスとの連携
Google Workspace および検索サービス全体にわたり、Live モデルは複雑なタスク処理において、より直感的で協働的な体験を提供します。
- Search Live(検索ライブ):Gemini 3.8 Live に裏打ちされた、段階ごとのリアルタイムトラブルシューティング支援をご利用ください。
🛠️ 開発者および企業向けエコシステム
開発プラットフォームの活用
Gemini Live API を活用することで、高性能な音声駆動型インターフェースの構築・デプロイが容易になります。
- 対応するプラットフォーム:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents など。
- メリット:裏側の複雑なリアルタイムメディアストリーミングインフラをプラットフォームが管理するため、開発者はユーザー体験の設計に集中できます。
企業連携
Salesforce、Genspark、Lumeris などの企業とも連携しており、3.8 Live および 3.8 Live Extended Thinking の以下の特性に強く期待を示しています。
- 印象的なレイテンシ(低遅延)
- 流暢さ
- ツールコール能力
🔒 透明性とセキュリティ:SynthID ウォータマーキング
当社 AI 製品で生成されるすべての音声出力には、SynthID を用いたウォータマーキングが適用されています。
- 目に見えない識別子:音声出力に直接織り込まれており、AI 生成コンテンツの検知を可能にします。
- 誤情報防止:偽情報の拡散防止に貢献します。
- 詳細確認:モデルカードをご覧ください。
📅 最新 Gemini オーディオモデルのご利用開始スケジュール
✅ Gemini 3.8 Live(本日より順次リリース)
- 開発者向け:Gemini API および Google AI Studio
- 企業向け:
- Gemini Enterprise(プライベートプレビュー提供済み)
- まもなく「Gemini Enterprise for Customer Experience」で利用可能に
- 一般ユーザー向け:Search Live
✅ Gemini 3.8 Live Extended Thinking(本日より順次リリース)
- 開発者向け:Gemini API および Google AI Studio
- 企業向け:
- Gemini Enterprise(プライベートプレビュー提供済み)
- まもなく「Gemini Enterprise for Customer Experience」および「Google Workspace ビジネス顧客」で利用可能に
- 一般ユーザー向け:
- Gemini Liveへの加算リリース
- Google Workspace ドキュメント:Google AI Pro および Ultra サブスクライバー限定
- Gmail と Keep:すべての Google AI サブスクライバーが利用可能
📩 最新ニュースのお知らせ
製品アップデート、イベント情報、特別オファーなどを受け取るために、メールマガジンのニュースレターに登録してください。
(提供した情報は、Google のプライバシーポリシーの定める通り適切に利用されます。いつでも解除可能です。)