發生了什麼事
Google DeepMind宣布发布两款新的文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。這些模型可立即在 Google AI Studio 中並透過 Gemini API 獲取,並整合 Agora、LiveKit 和 Vercel 等平台。该版本扩展了 Gemini 音频系列,增加了生成自定义角色声音和通过精确控制交付来指导场景对话的功能。
Google DeepMind 推出了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,將它們描述為 Gemini 系列中最具表現力的音訊產生模型。公告稱,這些模型將語音生成從靜態預設轉變為動態創意工作室,允許創建自訂角色聲音和場景對話的方向。
這些模型從今天開始在 Google AI Studio 中提供,它們充當語音設計工作區。使用者可以從頭開始提示新的聲音身分或複製自己的聲音,然後使用雙揚聲器劇本編輯器來指導逐行交付。也透過 Gemini API 提供存取權限,使 Agora、LiveKit、Pipecat 和 Vercel 等開發者平台能夠建置和部署語音生成體驗。
Google 聲稱,Gemini 3.8 Flash TTS 在 Hume AI 語音設計基準測試中以 71.4 分穩居第一,在口音建模方面以 60.8 分領先。據報道,這兩種車型在 Hume AI 的整體品質指數中均排名第一和第二。在 Voice Arena 的人類偏好盲評估中,據稱這些模型在日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語和印地語等全球主要語言中佔據領先地位,支持 100 多種語言。
此版本包括用於語音複製的特定安全機制,要求用戶在創建語音之前提供與參考說話者匹配的語音所有者的口頭同意錄音。此外,這些模型生成的每個音訊剪輯都帶有 SynthID 浮水印,這是一種難以察覺的水印,旨在確保人工智慧生成的語音仍然可檢測到,以幫助防止錯誤訊息。
為什麼這很重要
此次發布標誌著人工智慧語音生成從靜態預設向動態、可自訂音訊創建的重大轉變。透過讓開發人員能夠創建全新的聲音身分或透過同意驗證複製特定的聲音,這些模型為媒體在地化、對話代理和創意內容製作開闢了新的可能性。 SynthID 浮水印的加入解決了人們對人工智慧產生的音訊錯誤訊息日益增長的擔憂,為內容透明度提供了技術保障。
這些模型的推出為開發人員和企業提供了創建更豐富、更具表現力的音訊體驗的工具,而無需依賴固定的語音預設。此功能對於需要媒體在地化的細緻地區口音或對話代理一致的品牌聲音的行業尤其重要。
與 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司的合作表明了在加速全球配音和大規模支持會話語音代理方面的直接實際應用。這表明我們正在將先進的 TTS 功能整合到主流創意和企業工作流程中。
強調語音複製的同意驗證和 SynthID 浮水印的使用解決了人工智慧音訊生成中的關鍵道德和安全問題。這些保障措施旨在保護配音人員身分並確保內容透明度,隨著人工智慧產生的媒體變得越來越普遍,這一點變得越來越重要。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
crm_get_transaction(id='4092').In AI, what are a model's "parameters"?
接下來看什麼
监控 Figma 和 HeyGen 等合作伙伴公司对这些模型的采用情况,以进行全球配音和媒体本地化。專注於對語音複製保護措施以及 SynthID 浮水印在檢測 AI 生成語音方面的有效性的獨立評估。此外,觀察開發人員如何利用 Google AI Studio 中的雙揚聲器劇本編輯器來進行複雜的音訊敘述。
觀察合作夥伴公司如何將這些模型整合到他們的產品中,特別是在全球配音和媒體在地化領域,以評估實際性能和用戶接收。
監控獨立第三方對語音複製同意機制和 SynthID 浮水印可偵測性的評估,因為這些對於確保技術的安全性和完整性至關重要。
追蹤 Google AI Studio 中雙揚聲器劇本編輯器的開發,因為此功能代表了一個用於指導 AI 生成的對話的新介面,可能會影響創作者如何處理音訊故事敘述。