園丁的AI練習手記
回到首頁
[科技時事]2026-09-25閱讀時間 3 分鐘

【科技時事】從「唸讀」進化到「配音」:Google Gemini 3.8 TTS 帶來的語音生成新階段

#Google Gemini#TTS#語音生成#AI 配音
【科技時事】從「唸讀」進化到「配音」:Google Gemini 3.8 TTS 帶來的語音生成新階段

在看今天的相關新聞時,我注意到 Google 官方發布了 Gemini 3.8 系列的兩款新模型:Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS。這則新聞吸引我的地方在於,我本身就是使用TSS服務的使用者,實際體驗上我認為 Google 的語音生成技術這次算是有了還沒不錯的突破,過往單純的「文字轉語音」已經開始轉向更具動態感的「創意工作室」模式。

新聞重點

根據 Google 官方部落格的說明,這次發表的兩款模型各有定位:Gemini 3.8 Flash TTS 側重於深度的創意指導,適合遊戲或有聲書等需要「演技」的場景;而 Gemini 3.8 Flash-Lite TTS 則針對高運算量、追求成本效益的應用(如大規模配音或語音代理)進行了優化。

這兩款模型的核心功能包含:

* 自然語言指令設計語音:使用者可以用白話描述來從零開始創建語音角色,系統提供超過 100 種語言與 2,000 種以上的預製語音。

* 精細的表演指導:支援「逐行表演指導」,開發者可以在腳本中加入情緒提示(如冷靜、低語),甚至能處理笑聲(`<laughs>`)、嘆氣(`<sigh>`)或主動聆聽的插嘴(`|mhm|`)等非語言訊號。

* 語音複製與安全機制:僅需 30 秒樣本即可複製語音,但 Google 設有嚴格限制,要求必須提供語音擁有者的口頭同意錄音,且所有生成音訊都會內嵌 SynthID 不可見浮水印。

* 技術指標:在 Hume AI 的語音設計基準測試中,Gemini 3.8 Flash TTS 獲得了總分第一(71.4)。

我的觀察

這次更新最核心的技術亮點,在於語音生成從「唸讀」進化到了「角色配音」。

自己算是還蠻常使用TTS的工具為影片製作旁白,過去使用 TTS 服務時,通常只能在預設的聲音中挑選,但現在 Gemini 3.8 讓開發者可以用自然語言(例如:「用神祕且低沉的聲音,帶著微弱的笑聲說」)來指定語氣。這種「自然語言表演控制」加上「非言語音效整合」,讓 AI 配音聽起來更具生命力,不再那麼機械化。

而且,在實務痛點上,我這次實際的體驗時,觀察到這次的模型對於一些過往的痛點克服了兩個很關鍵的問題:

1. 音色漂移(Voice Drift):過去長篇朗讀時,AI 的聲音常會越唸越變形,3.8 版本強化了長文本中的聲音一致性,這對有聲書創作者來說非常實用。

2. 抑制背景雜訊:改善了生成過程中的音訊乾淨度,避免長音訊後半段出現沙沙聲。

此外,從商業角度來看,Flash 系列的高性價比與低門檻,配合 Google 目前提供的 API 優惠,我認為會大幅降低影音創作者(如自動化影片旁白)的營運壓力。對於之前主要習慣使用 Gemini 2.5 Pro TTS 的我,終於有還不錯的替換選項了。

文章圖片

這件事值得繼續觀察什麼

1. 從「預設」到「生成」的典範轉移:未來我們設計語音的方式,是否會變得像用 Midjourney 生成圖片一樣,完全透過文字描述來「設計」聲音,而非挑選清單?

2. AI 語音的安全防線:Google 採取的「30 秒樣本 + 口頭同意錄音 + SynthID 浮水印」組合拳,在實際應用中是否能有效防堵 Deepfake 爭議,值得持續追蹤。

3. 互動式媒體的即時性:這種具備「非語言訊號」與「雙人場景編排」的能力,可能會讓未來遊戲中的 NPC 對話自然度提升到另一個層次。

原文連結:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

Read more

【科技時事】Google Gemini 的「自主駭客」事件:是技術大躍進,還是另一種行銷?
[科技時事]2026-09-215 分鐘

【科技時事】Google Gemini 的「自主駭客」事件:是技術大躍進,還是另一種行銷?

Google Gemini 在資安測試中被爆出自主入侵三家公司系統,引發 AI 安全與倫理爭議。本文整理《華爾街日報》報導重點,分析 Gemini 使用的暴力破解與憑證搜尋手法,並探討 Google 延遲公開事件背後的動機。並指出科技巨頭雖有生態系優勢,但核心智力才是留住深度使用者的關鍵。

【科技時事】當 AI 巨頭們開始集體喊「煞車」: Anthropic 與 OpenAI 的安全共識
[科技時事]2026-09-145 分鐘

【科技時事】當 AI 巨頭們開始集體喊「煞車」: Anthropic 與 OpenAI 的安全共識

本文探討 Anthropic、OpenAI 與馬斯克罕見達成共識,呼籲放慢 AI 研發速度以應對潛在的網路接管風險。文章分析了 Anthropic 提出的監管計畫、OpenAI 延後 IPO 的決定,以及川普對此的政治反對立場。作者提出「時間差防禦」觀點,認為單純踩煞車可能陷入囚徒困境,應優先加強資安防護而非阻礙技術競爭。