ニュースに戻る
製品AI Understanding ブリーフィング

Google が Gemini 3.8 フラッシュ TTS モデルを発売

Google DeepMind は、Google AI Studio および Gemini API 経由で利用できる新しいテキスト読み上げモデルである Gemini 3.8 Flash TTS および Flash-Lite TTS をリリースしました。カスタム音声作成と SynthID 透かし機能を備えています。

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
一次情報源文書記録されたソース
出版社
deepmind.google
ソースリンク
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
ソースの種類
一次文書 — 私たちが直接読む公式発表、論文、提出書類、またはファーストパーティのページ。
コンテキスト60秒で理解できる

ここから始めましょう

重要な用語

API(アプリケーションプログラミングインターフェース)
あるソフトウェア システムが別のシステムにリクエストを送信し、別のシステムからの応答を受信するための構造化された方法。
透かし
AI が生成したテキストまたはメディアに検出可能な信号を埋め込み、後でそれが機械によって生成されたものであると識別できるようにします。
ベンチマーク
モデルのパフォーマンスを測定および比較するために使用される標準化されたテストまたはデータセット。
自分自身をテストしてくださいAI モデルの説明クイズ

何が起こったのか

Google DeepMind は、Gemini 3.8 Flash TTS と Gemini 3.8 Flash-Lite TTS という 2 つの新しいテキスト読み上げモデルのリリースを発表しました。これらのモデルは、Agora、LiveKit、Vercel などのプラットフォームとの統合により、Google AI Studio および Gemini API を通じてすぐに利用できます。このリリースでは、Gemini Audio ファミリを拡張し、カスタム キャラクターの音声を生成し、配信を正確に制御してシーン ダイアログを演出する機能を追加します。

Google DeepMind は、Gemini 3.8 Flash TTS および Gemini 3.8 Flash-Lite TTS を紹介し、これらを Gemini ファミリの中で最も表現力豊かなオーディオ生成モデルであると説明しました。発表によると、これらのモデルは静的なプリセットからの音声生成を動的なクリエイティブ スタジオに変換し、カスタム キャラクターの音声の作成やシーンのダイアログの方向性を可能にすると述べています。

これらのモデルは本日より Google AI Studio で利用可能になり、音声デザイン ワークスペースとして機能します。ユーザーは、新しいボーカルのアイデンティティを最初から作成したり、自分の声を複製したりして、デュアル スピーカーの脚本エディタを使用して一行ずつ配信することができます。アクセスは Gemini API 経由でも提供され、Agora、LiveKit、Pipecat、Vercel などの開発者プラットフォームで音声生成エクスペリエンスを構築および展開できるようになります。

Google は、Gemini 3.8 Flash TTS が Hume AI の音声デザイン ベンチマークでスコア 71.4 で総合 1 位を確保し、アクセント モデリングでスコア 60.8 でリードしていると主張しています。どちらのモデルも、Hume AI の総合品質指数で第 1 位と第 2 位を確保していると報告されています。 Voice Arena での人間のブラインドによる好みの評価では、このモデルは日本語、ブラジル系ポルトガル語、ベトナム語、現代標準アラビア語、メキシコ系スペイン語、ヒンディー語を含む主要な世界言語でトップの地位を占め、100 以上の言語をサポートしていると言われています。

このリリースには、音声複製のための特定の安全メカニズムが含まれており、ユーザーは音声を作成する前に、基準話者と一致する音声所有者からの口頭同意録音を提供する必要があります。さらに、これらのモデルによって生成されたすべてのオーディオ クリップには SynthID の透かしが入れられます。これは、AI によって生成された音声が検出可能であり、誤報を防ぐために設計された知覚できない透かしです。

ソースの詳細: deepmind.google

なぜそれが重要なのか

このリリースは、AI 音声生成が静的なプリセットから動的でカスタマイズ可能なオーディオ作成に大きく移行したことを示しています。開発者がまったく新しい音声のアイデンティティを作成したり、同意の検証を行って特定の音声を複製したりできるようにすることで、このモデルはメディア ローカリゼーション、会話エージェント、クリエイティブなコンテンツ制作の新たな可能性を開きます。 SynthID 透かしを含めることで、AI によって生成された音声の誤った情報に対する懸念の高まりに対処し、コンテンツの透明性に対する技術的な保護を提供します。

これらのモデルの導入により、固定音声プリセットに依存せずに、より豊かで表現力豊かなオーディオ エクスペリエンスを作成するためのツールが開発者や企業に提供されます。この機能は、メディアのローカリゼーションのための微妙な地域アクセントや、会話エージェントのための一貫したブランド ボイスを必要とする業界に特に関連します。

Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang などの企業とのパートナーシップは、グローバル ダビングを加速し、大規模な会話型音声エージェントを強化する上ですぐに実用化されることを示しています。これは、高度な TTS 機能を主流のクリエイティブ ワークフローやエンタープライズ ワークフローに統合する方向への動きを示唆しています。

音声複製の同意検証と SynthID 透かしの使用に重点を置くことで、AI オーディオ生成における重大な倫理的およびセキュリティ上の懸念に対処します。これらの保護措置は、声優タレントのアイデンティティを保護し、コンテンツの透明性を確保することを目的としています。これは、AI 生成メディアの普及が進むにつれてますます重要になっています。

Interactive Mechanism

インタラクティブなメカニズム: 実際にどのように機能するか

この開発の背後にある基盤となるテクノロジーをインタラクティブに探索します。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
インタラクティブコンセプトチェック+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

次に見るべきもの

Figma や HeyGen などのパートナー企業によるグローバル ダビングやメディア ローカリゼーションへのこれらのモデルの採用を監視します。音声レプリケーションの保護機能と、AI が生成した音声の検出における SynthID 透かしの有効性に関する独立した評価に注目してください。さらに、Google AI Studio のデュアル スピーカー スクリーンプレイ エディターが開発者によって複雑なオーディオ ナラティブにどのように利用されているかを観察してください。

パートナー企業が、特にグローバル ダビングとメディア ローカリゼーションの分野で、これらのモデルを自社の製品にどのように統合して、実際のパフォーマンスとユーザーの受け入れを評価するかを観察してください。

音声複製同意メカニズムと SynthID 透かしの検出可能性に関する独立したサードパーティの評価を監視します。これらはテクノロジーの安全性と整合性を確保するために重要です。

Google AI Studio のデュアル スピーカー スクリーンプレイ エディターの開発を追跡します。この機能は、クリエイターがオーディオ ストーリーテリングにどのようにアプローチするかに影響を与える可能性がある、AI 生成のダイアログを指示するための新しいインターフェイスを表します。

関連ガイドとクイズ

AI モデルの説明AI倫理AIエージェントあなたが知っていることをテストする - 無料の AI クイズに挑戦してください用語集で AI 用語を検索する
これは役に立ちましたか?