ジェミニ3.8 テキスト読み上げ

2026/09/24 0:29

ジェミニ3.8 テキスト読み上げ

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

Google が、多様な創造性と効率性のニーズに応えるために設計された 2 つの強力な新しいテキスト対話音声モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発売しました。主な革新点は、100 カ国語以上で自然言語プロンプトを用いて、ゼロから完全に新しい声を生成することが可能であり、話者の変化(ドリフト)が最小限に抑えられた高品質な長編コンテンツのサポートを提供します。これらツールのアクセントモデリングと全体の品質は前世代よりも優れており、Hume AI の Voice Design ベンチマークにおいて総合スコア 71.4、アクセントモデリングスコア 60.8 で第 1 位を確立しました。両モデルとも、自然な響きを持つ対話のために高度な制御機能を備えており、バックチャンネル反応(

<laughs>
、
|mhm|
など)のような行ごとの演技キューに対応しています。信頼性とセキュリティを確保するためには、モデルは実在の人間の声を 30 秒間のサンプルに基づいて複製する際に誤情報の拡散を防ぐための内蔵型 SynthID ウォーターマークと C2PA クレデンシャルを備えています。展開には、Gemini API および Google AI Studio を介して即時利用可能なメキシコスペイン語やスコッツ・イングリッシュなどの地域的なバリエーションを含む 2,000 以上の実生産準備済みの声のライブラリが含まれます。エンタープライズ向け API アクセスおよび今後の音声リミキシング機能(音質、音高、アクセントの微調整を可能にするもの)は近日中にリリースが予定されています。統合は HeyGen、Agora、LiveKit などの多数のパートナーにも拡張され、グローバルな吹き替えプロジェクトおよび大規模な会話型音声エージェントをサポートします。

本文

ジェミニ 3.8 Flash TTS とジェミニ 3.8 Flash-Lite TTS:表現力豊かな音声生成モデルの登場

概要:音声生成のパラダイムシフト

Alan Cowen(研究科学責任者 / ジェミニ音声チーム代表) は、以下の通り発表されました。

  • 新モデル導入: ジェミニファミリーに 2 つの新しいテキスト対話(TTS)モデルが追加されます。
    • 従来の「一方向の固定設定」から、「ダイナミックなクリエイティブスタジオ」へと変革を実現します。
  • 利用目的: クリエイター、開発者、企業に対し、以下のような体験の実現を可能にします。
    • より豊かで表現力のある音響体験
    • ジェミニ ノートブックやGoogle Vidsなど、製品におけるユーザーエクスペリエンスの向上
  • 利用可能なプラットフォーム:
    • Google AI Studio
    • ジェミニ API
    • ジェミニ エンタープライズ
    • ジェミニ ノートブック
    • Google Vids

2 つのモデルと特徴

モデル名主な用途詳細な特徴
ジェミニ 3.8 Flash TTSクリエイティブディレクション
キャラクター設計
* 自然言語プロンプトで、ゲームや没入型オーディオブック向けにゼロから完全新規のキャラクターを創造できます。
* 演技のキュー(指示)、テンポ、方言の変化、バックチャンネル反応などを細かく制御可能です。
* シーン内のすべてのセリフを個々に演出できます。
ジェミニ 3.8 Flash-Lite TTS大規模運用
コスト効率の高い拡張性
* 大量の吹き替えや音響コンテンツ制作に最適化されています。
* テンポや表現のニュアンスを微調整できる、表現力豊かな音声エージェントにも適しています。

これらのモデルは、以下の急速に成長するジェミニオーディオファミリーの一部として補完します。

  • 3.5 リアルタイム翻訳
  • 3.5 書き起こし
  • 3.8 リアルタイム
  • 3.8 リアルタイム拡張思考

オリジナルの声を作成・カスタマイズする

無限に広がるライブラリ

  • スタート: オリジナルの30 の声から選択可能です。
  • スケールアップ: 新しいキャラクターやブランドアンバサダーの声など、あらゆる瞬間で表現力豊かで自然な響きを実現します。
  • ジェミニ 3.8 Flash TTS の役割: フルサイズのヴォーカルスタジオを駆使し、開発者や企業がカスタマイズされた音響体験を容易に構築できるよう支援します。

主な機能と能力

  • 生成型音声デザイン
    • 自然言語プロンプトを用いて、役割・アクセント・音声特性などを100 以上の言語と方言に合わせてカスタマイズできます。
    • 例:「ドラマチックな炎を噴き出す竜」の蘇生や、「地域特有のリズムを持つ魅力的なナレーター」の作成。
  • 広範な音声ライブラリ
    • 2,000 点以上の制作準備ができた声をアクセス可能です。
    • メキシコ語版スペイン語、ケベック州のフランス語、スコットランド英語などの地域ごとのバリエーションを含む。
  • 声の複製(リピーテーション)
    • 本人の声の30 秒間の音声サンプルまたは利用権限のあるサンプルから、一貫した音声プロフィールを再現します。
    • 安全性機能: 開発者と声優双方の権利保護のため、「同意確認」「SynthID ワータマージング」「C2PA クレデンシャル」などが内蔵されています。
  • 保存とスケーリング
    • デザインしたカスタムボイスを保存・管理し、継続的なプロジェクトでパフォーマンスの一貫性と最小限の発話者ドリフト(変化)を実現します。
  • ボイスリミキシング(近日公開予定)
    • ライブラリから好きな声を選び、「音色」「音高」「テンポ」「アクセント」などを微調整可能。
    • プロンプト例:「南部アメリカのアクセントを少し足す」「Delivery を柔らかくする」。

セリフごとに演出を直接指示する

声選定後、両モデルは各セリフの配信方法に対し、以下の精密な制御を提供します。

  • セリフごとの演技ディレクション
    • 自身の舞台指示(ステージ directions)を書くか、ジェミニに自然な脚本キューを与えて演出を任せることができます。
    • 「静かなカスタマー担当者」から「囁きながら展開するサスペンスシーン」まで対応可能です。
  • 長編コンテンツ生成
    • ポッドキャストやオーディオブック(数時間続く)でも、高い声質・自然なテンポ・キャラクターの音色を維持します。
    • 発話者ドリフト(変化)を最小限に抑えます。
  • ネイティブ 2 人対談シーン演出
    • シングル脚本からシームレスにマルチターン会話を演出できます。
    • ポッドキャストやドラマチックな物語において、双方の声が明確に分離された自然な会話ターンテイク(役割交代)を維持します。
  • 台詞付きボイスバーストとバックチャンネル
    • 非言語キュー(例:
      <笑う>
      、
      <ため息>
      、
      <驚く>
      )やアクティブリスニングの挿入語(例:
      |うん |
      、
      | やー |
      )を使用。
    • 現実的な会話を演出し、的確なコメディタイミングやリアクションビートを実現します。

大規模グローバル展開に対応した高品質音声生成

パフォーマンスベンチマーク

ジェミニ 3.8 Flash TTS は業界最高クラスの性能を誇ります。

  • Hume AI Voice Design ベンチマーク: 全体スコアトップ(71.4 点)
  • アクセントモデルリング: スコアトップ(60.8 点)
  • Hume AI Overall Quality インデックス:
    • ジェミニ 3.8 Flash TTS: 1 位
    • ジェミニ 3.8 Flash-Lite TTS: 2 位

比較: ジェミニ 3.1 Flash TTS に比べ、長編コンテンツやデュアルスピーカーの脚本制御など、幅広いユースケースにおいて大幅な性能向上を示しています。

グローバル言語対応

  • Voice Arena(盲目的人間評価)での成績:
    • 日本語、ブラジルポルトガル語、ベトナム語、標準アラビア語(MSA)、メキシコ語版スペイン語、ヒンディー語などの主要グローバル言語で競合他社との間でも上位成績。
  • 対応言語数: 100 以上に対応。
    • クリエイターや企業が世界中で高品質な多言語音声体験を構築することを可能にします。

信頼、同意、透明性を基盤とした構築

声優の権利守りとアイデンティティ尊重のため、厳格な防護策が講じられています。

  • 同意確認:
    • 音声複製において、システムは同意確認を活用しています。
    • 声の創出以前に、参照話者との整合性が取れた「口頭による同意レコーディング」が必要です。
  • SynthID ワータマージング:
    • 生成されるすべての音声クリップには検知不能なワータマージが組み込まれています。
    • AI 生成音声を検出可能に保ち、誤情報防止に貢献します。

詳細確認: 安全性と責任に関する詳細については、モデルカードをご確認ください。


新作 Google AI Studio オーディオプレイグラウンドを体験しよう

開発者向け体験環境

  • Google AI Studio: 本日より、以下の機能を実際に体験できるようになりました。
    • 音声デザインワークスペース: プロンプトで完全に新しいボイスアイデンティティを作成、または自分の声を複製。
    • デュアルスピーカーの脚本エディタ: 作成した声を持ち込み、セリフごとの配信を直接指揮できます。

パートナーシップと展開

  • API 活用による簡易デプロイ:
    • ジェミニ API を通じて、Agora、LiveKit、Pipecat、Vercel などのプラットフォームで高性能な音声生成体験の構築・デプロイが可能になりました。
  • 企業パートナーシップ:
    • Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang などとの連携により、以下の成果を追求します。
      • グローバルな吹き替えの加速
      • ニュアンスのある地域アクセントを活用したメディアのローカリゼーション
      • 大規模な対話型音声エージェントのパワーアップ

最新のジェミニオーディオモデルご利用開始状況

🚀 ジェミニ 3.8 Flash TTS(本日リリース)

  • 開発者向け: ジェミニ API と Google AI Studio
  • 企業向け: 近日中にジェミニ エンタープライズ経由で API 提供予定
  • 一般ユーザー向け: ジェミニ ノートブック内にて利用可能

🚀 ジェミニ 3.8 Flash-Lite TTS(本日リリース)

  • 開発者向け: ジェミニ API と Google AI Studio
  • 企業向け: 近日中にジェミニ エンタープライズ経由で API 提供予定
  • 一般ユーザー向け: Google Vids 内にて利用可能

同じ日のほかのニュース

一覧に戻る →

2026/09/24 3:06

クローデが CRISPR 様反復構造を持つ新たな酵素系を発見した

## Japanese Translation: Anthropic は、基礎生物学に特化した新たな Life Sciences 研究グループを立ち上げ、Claude エージェントを使用して DNA データセットを探査し、人間の科学者とともに物理実験室で仮説を検証する取り組みを開始しました。2026 年春、チームはベイエリアに自社工場を建設し、BSL-1/BSL-2 の安全制限下で低リスクの実験のみを行い、すべての実験作業は人間が行う体制を整えました。約 21 時間にわたって約 2 億 1,000 万トークンを処理する約 950 台の自律型 Claude エージェントが、大規模な遺伝子データベースを走査して興味深い逆転写酵素の例を探しました。1 つのエージェントは、RT ゼーン近傍にあるタンデムリピートアレイを発見し、CRISPR 技術に類似していることに着目することで、「配列関連型逆転写酵素(ART)」システムを特定しました。ART システムは 3 つの部分で構成されており、巨大なファージ由来の逆転写酵素、隣接するパートナー遺伝子、ならびに短い RNA として発現する非コード DNA のリピート配列が均等間隔で並ぶ長アレイからなります。CRISPR 先駆者である Feng Zhang 氏による見解を得たうえ、Anthropic の異種タンパク質に関する専門知識を背景に、プロジェクトは一般公開用のプレプリント技術報告書を発行し、物理実験における本質的な人間の監督下で実行されるスケーラブルな AI 主導の仮説検証において新たな先例を確立しました。

2026/09/24 6:01

VSCode の SSH アгентは素晴らしいです

## Japanese Translation: セキュリティ研究者のトーマス・プタチェクは、Visual Studio Code の SSH 遠隔編集機能はシステム整合性に対して深刻な脅威をもたらすと警告しており、Emacs Tramp といった代替手段の安全限界をはるかに超えていると指摘している。Tramp がリモート接続上でローカルに動作する一方、VSCode は Bash スニペット的なステーガーを実行し、エージェントをダウンロードして Node.js バイナリをインストールすることで、「フルスケールの侵入」を行う点で異なる。このダウンロードされたエージェントは、ローカルの VSCode フロントエンドとの間で永続的な WebSocket 接続を維持し、ファイルシステムを探索したり、任意のファイルを編集したり、独自のシェル PTY プロセスを開始したり、リモートシステム上にて自身を持続化したりする能力を有している。プタチェクは、LLM の「幻覚」はエージェントを通じて LLM と実行環境の間でループを閉じることで軽減できると認めつつも、そのようなプロセスは開発用ラップトップにおいては境界上の問題により実施すべきではないと指摘する。理想的には、LLM エージェントを用いた反復開発は、ホストシステム構成を変更できず瞬時に起動されるクリーンスレート Linux インスタンス上で行われるべきである。プタチェクは、この機能を開発サーバーで使用する際に懸念を覚えるだろうし、本番システムでのインシデント中に発生すれば怒り狂うだろうと警告している。また、Fly Machine のカスタム接続はこの懸念を回避可能だが、彼のブログの主な目的はこのセキュリティ洞察を読者に共有することにあることを明記している。

2026/09/24 6:31

クレードの荷重支持継ぎ目

## Japanese Translation: 核心的な論点とは、荷重支持接合部(load-bearing seams)が偶発的な詳細ではなく、重要な構造的要素であるというものであり、状況の理解方法を本質的に変えるものである。表面的な問題と深層的な構造的な問題の間に違いが存在し、元の結論は提示された質問に答えつつも、その証拠が実際に接合部について問いかけていたことを扱わなかった。状況を単一のバイナリ(二値)に還元することはニュアンスを失わせ、代わりに複数の真理を生産的な緊張関係の中で保持すべきである。重要な過ちの一つは、単に記述する証拠と実際の構造的作業を行う証拠の区別を行わなかった点にある。不確実性はノイズを排除すべきものではなく、複数の解釈を可能にするモデルの限界を示しており、分析は複雑性を増しつつ、外観・支持された主張・整合性にとって必要な真理の間の関係を明確化している。今後には、初期の仮見直しを行い、証拠を荷重支持接合部に直接的に対置して再評価することが必要であり、新しい結論に急ぐこと 대신 収束(convergence)を目指すべきである。最も高いレバレッジを持つ行動は、記述的な外観から構造的現実がどの点で乖離しているかを特定し、特に接合部を中心に例外、パターン、カテゴリーエラーを把握することにある。この転換により証明責任の枠組みが再定義され、元の結論が接合部を回避するのではなくそれを考慮するようになり、結果的に組織が表面の詳細と本質的な構造的制約との関係をどのように変革するかを示す。

ジェミニ3.8 テキスト読み上げ | そっか~ニュース