
2026/09/24 0:29
ジェミニ3.8 テキスト読み上げ
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Google が、多様な創造性と効率性のニーズに応えるために設計された 2 つの強力な新しいテキスト対話音声モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発売しました。主な革新点は、100 カ国語以上で自然言語プロンプトを用いて、ゼロから完全に新しい声を生成することが可能であり、話者の変化(ドリフト)が最小限に抑えられた高品質な長編コンテンツのサポートを提供します。これらツールのアクセントモデリングと全体の品質は前世代よりも優れており、Hume AI の Voice Design ベンチマークにおいて総合スコア 71.4、アクセントモデリングスコア 60.8 で第 1 位を確立しました。両モデルとも、自然な響きを持つ対話のために高度な制御機能を備えており、バックチャンネル反応(
<laughs>、|mhm| など)のような行ごとの演技キューに対応しています。信頼性とセキュリティを確保するためには、モデルは実在の人間の声を 30 秒間のサンプルに基づいて複製する際に誤情報の拡散を防ぐための内蔵型 SynthID ウォーターマークと C2PA クレデンシャルを備えています。展開には、Gemini API および Google AI Studio を介して即時利用可能なメキシコスペイン語やスコッツ・イングリッシュなどの地域的なバリエーションを含む 2,000 以上の実生産準備済みの声のライブラリが含まれます。エンタープライズ向け API アクセスおよび今後の音声リミキシング機能(音質、音高、アクセントの微調整を可能にするもの)は近日中にリリースが予定されています。統合は HeyGen、Agora、LiveKit などの多数のパートナーにも拡張され、グローバルな吹き替えプロジェクトおよび大規模な会話型音声エージェントをサポートします。本文
ジェミニ 3.8 Flash TTS とジェミニ 3.8 Flash-Lite TTS:表現力豊かな音声生成モデルの登場
概要:音声生成のパラダイムシフト
Alan Cowen(研究科学責任者 / ジェミニ音声チーム代表) は、以下の通り発表されました。
- 新モデル導入: ジェミニファミリーに 2 つの新しいテキスト対話(TTS)モデルが追加されます。
- 従来の「一方向の固定設定」から、「ダイナミックなクリエイティブスタジオ」へと変革を実現します。
- 利用目的: クリエイター、開発者、企業に対し、以下のような体験の実現を可能にします。
- より豊かで表現力のある音響体験
- ジェミニ ノートブックやGoogle Vidsなど、製品におけるユーザーエクスペリエンスの向上
- 利用可能なプラットフォーム:
- Google AI Studio
- ジェミニ API
- ジェミニ エンタープライズ
- ジェミニ ノートブック
- Google Vids
2 つのモデルと特徴
| モデル名 | 主な用途 | 詳細な特徴 |
|---|---|---|
| ジェミニ 3.8 Flash TTS | クリエイティブディレクション キャラクター設計 | * 自然言語プロンプトで、ゲームや没入型オーディオブック向けにゼロから完全新規のキャラクターを創造できます。 * 演技のキュー(指示)、テンポ、方言の変化、バックチャンネル反応などを細かく制御可能です。 * シーン内のすべてのセリフを個々に演出できます。 |
| ジェミニ 3.8 Flash-Lite TTS | 大規模運用 コスト効率の高い拡張性 | * 大量の吹き替えや音響コンテンツ制作に最適化されています。 * テンポや表現のニュアンスを微調整できる、表現力豊かな音声エージェントにも適しています。 |
これらのモデルは、以下の急速に成長するジェミニオーディオファミリーの一部として補完します。
- 3.5 リアルタイム翻訳
- 3.5 書き起こし
- 3.8 リアルタイム
- 3.8 リアルタイム拡張思考
オリジナルの声を作成・カスタマイズする
無限に広がるライブラリ
- スタート: オリジナルの30 の声から選択可能です。
- スケールアップ: 新しいキャラクターやブランドアンバサダーの声など、あらゆる瞬間で表現力豊かで自然な響きを実現します。
- ジェミニ 3.8 Flash TTS の役割: フルサイズのヴォーカルスタジオを駆使し、開発者や企業がカスタマイズされた音響体験を容易に構築できるよう支援します。
主な機能と能力
- 生成型音声デザイン
- 自然言語プロンプトを用いて、役割・アクセント・音声特性などを100 以上の言語と方言に合わせてカスタマイズできます。
- 例:「ドラマチックな炎を噴き出す竜」の蘇生や、「地域特有のリズムを持つ魅力的なナレーター」の作成。
- 広範な音声ライブラリ
- 2,000 点以上の制作準備ができた声をアクセス可能です。
- メキシコ語版スペイン語、ケベック州のフランス語、スコットランド英語などの地域ごとのバリエーションを含む。
- 声の複製(リピーテーション)
- 本人の声の30 秒間の音声サンプルまたは利用権限のあるサンプルから、一貫した音声プロフィールを再現します。
- 安全性機能: 開発者と声優双方の権利保護のため、「同意確認」「SynthID ワータマージング」「C2PA クレデンシャル」などが内蔵されています。
- 保存とスケーリング
- デザインしたカスタムボイスを保存・管理し、継続的なプロジェクトでパフォーマンスの一貫性と最小限の発話者ドリフト(変化)を実現します。
- ボイスリミキシング(近日公開予定)
- ライブラリから好きな声を選び、「音色」「音高」「テンポ」「アクセント」などを微調整可能。
- プロンプト例:「南部アメリカのアクセントを少し足す」「Delivery を柔らかくする」。
セリフごとに演出を直接指示する
声選定後、両モデルは各セリフの配信方法に対し、以下の精密な制御を提供します。
- セリフごとの演技ディレクション
- 自身の舞台指示(ステージ directions)を書くか、ジェミニに自然な脚本キューを与えて演出を任せることができます。
- 「静かなカスタマー担当者」から「囁きながら展開するサスペンスシーン」まで対応可能です。
- 長編コンテンツ生成
- ポッドキャストやオーディオブック(数時間続く)でも、高い声質・自然なテンポ・キャラクターの音色を維持します。
- 発話者ドリフト(変化)を最小限に抑えます。
- ネイティブ 2 人対談シーン演出
- シングル脚本からシームレスにマルチターン会話を演出できます。
- ポッドキャストやドラマチックな物語において、双方の声が明確に分離された自然な会話ターンテイク(役割交代)を維持します。
- 台詞付きボイスバーストとバックチャンネル
- 非言語キュー(例:
、<笑う>
、<ため息>
)やアクティブリスニングの挿入語(例:<驚く>
、|うん |
)を使用。| やー | - 現実的な会話を演出し、的確なコメディタイミングやリアクションビートを実現します。
- 非言語キュー(例:
大規模グローバル展開に対応した高品質音声生成
パフォーマンスベンチマーク
ジェミニ 3.8 Flash TTS は業界最高クラスの性能を誇ります。
- Hume AI Voice Design ベンチマーク: 全体スコアトップ(71.4 点)
- アクセントモデルリング: スコアトップ(60.8 点)
- Hume AI Overall Quality インデックス:
- ジェミニ 3.8 Flash TTS: 1 位
- ジェミニ 3.8 Flash-Lite TTS: 2 位
比較: ジェミニ 3.1 Flash TTS に比べ、長編コンテンツやデュアルスピーカーの脚本制御など、幅広いユースケースにおいて大幅な性能向上を示しています。
グローバル言語対応
- Voice Arena(盲目的人間評価)での成績:
- 日本語、ブラジルポルトガル語、ベトナム語、標準アラビア語(MSA)、メキシコ語版スペイン語、ヒンディー語などの主要グローバル言語で競合他社との間でも上位成績。
- 対応言語数: 100 以上に対応。
- クリエイターや企業が世界中で高品質な多言語音声体験を構築することを可能にします。
信頼、同意、透明性を基盤とした構築
声優の権利守りとアイデンティティ尊重のため、厳格な防護策が講じられています。
- 同意確認:
- 音声複製において、システムは同意確認を活用しています。
- 声の創出以前に、参照話者との整合性が取れた「口頭による同意レコーディング」が必要です。
- SynthID ワータマージング:
- 生成されるすべての音声クリップには検知不能なワータマージが組み込まれています。
- AI 生成音声を検出可能に保ち、誤情報防止に貢献します。
詳細確認: 安全性と責任に関する詳細については、モデルカードをご確認ください。
新作 Google AI Studio オーディオプレイグラウンドを体験しよう
開発者向け体験環境
- Google AI Studio: 本日より、以下の機能を実際に体験できるようになりました。
- 音声デザインワークスペース: プロンプトで完全に新しいボイスアイデンティティを作成、または自分の声を複製。
- デュアルスピーカーの脚本エディタ: 作成した声を持ち込み、セリフごとの配信を直接指揮できます。
パートナーシップと展開
- API 活用による簡易デプロイ:
- ジェミニ API を通じて、Agora、LiveKit、Pipecat、Vercel などのプラットフォームで高性能な音声生成体験の構築・デプロイが可能になりました。
- 企業パートナーシップ:
- Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang などとの連携により、以下の成果を追求します。
- グローバルな吹き替えの加速
- ニュアンスのある地域アクセントを活用したメディアのローカリゼーション
- 大規模な対話型音声エージェントのパワーアップ
- Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang などとの連携により、以下の成果を追求します。
最新のジェミニオーディオモデルご利用開始状況
🚀 ジェミニ 3.8 Flash TTS(本日リリース)
- 開発者向け: ジェミニ API と Google AI Studio
- 企業向け: 近日中にジェミニ エンタープライズ経由で API 提供予定
- 一般ユーザー向け: ジェミニ ノートブック内にて利用可能
🚀 ジェミニ 3.8 Flash-Lite TTS(本日リリース)
- 開発者向け: ジェミニ API と Google AI Studio
- 企業向け: 近日中にジェミニ エンタープライズ経由で API 提供予定
- 一般ユーザー向け: Google Vids 内にて利用可能