2025 年 6 月 18 日,Google 宣布 AI Mode 開始支援語音對話:使用者可以在 Google App 裡點下 Live 圖示,用說的方式提問,聽到 AI 生成的語音回答後繼續追問。這是繼 5 月 AI Mode 在美國全面開放之後,搜尋往對話式介面推進的又一步。功能不算大,訊號卻不小,值得把細節拆開來看。
對搜尋產品來說,這個改動的意義不只是「多了個麥克風」。語音對話把搜尋從「一次一個查詢框」變成可以連續追問的工作階段,而 Google 為此調整的不只是介面,還有背後取用網頁內容的方式——這正是對開發者與網站經營者影響最深的部分。
功能實際長怎樣
根據 TechCrunch 與 The Verge 的報導,使用方式是:在 Google App(Android 或 iOS)加入 AI Mode 實驗後,點擊新的 Live 圖示,說出問題,系統以語音回答,接著可以像自然對話一樣繼續追問。對話過程中,相關連結會即時顯示在畫面上,供使用者點開查證。
有幾個設計細節值得注意:Search Live 可以在背景執行,切到其他 App 對話不中斷;畫面提供逐字稿按鈕,想改用打字可以隨時切換;過去的語音對話會存進 AI Mode 歷史紀錄,方便之後回查。這些細節讓它比較像一個工作階段,而不是一次性的問答。從產品設計的角度看,每一項都在降低「開口」的心理門檻:可以背景執行,代表使用者不必停在搜尋頁面;可以切回打字,代表安靜的辦公環境裡照樣能用;有歷史紀錄,代表語音對話開始累積可回查的上下文。
背後技術與資料來源
Google 產品主管 Liza Ma 的說法是,AI Mode 裡的 Search Live 使用「具備進階語音能力的客製版 Gemini」。語音介面之下,真正驅動回答品質的是 AI Mode 既有的查詢擴散(query fan-out)技術:把使用者的問題拆解成多個子查詢,擴大取用網頁內容的廣度與多樣性,再合成單一回答。
Google 強調這套流程建立既有的搜尋品質系統之上——換句話說,原來的排名與內容評估機制被搬進了對話流程。這也是 Google 第一次把語音互動、搜尋品質系統與生成式回答,在同一條流程裡串起來對外測試。對網站經營者而言,這預示了後來被反覆討論的問題:當答案用說的,連結的可見度與點擊行為都會改變,內容被取用的方式也跟著不同。對依賴搜尋流量的開發者來說,查詢擴散是比語音介面更值得研究的部分:同一個問題會被拆成多個子查詢,內容被取用的粒度,從「整個頁面對應一個關鍵字」變成「段落層級對應多個意圖」。
使用範圍與限制
發布當下的可用範圍很明確:僅限美國、透過 Google Labs 加入 AI Mode 實驗的用戶,而且只支援語音——The Verge 特別指出,當時版本還不支援相機分享。Google 表示未來幾個月會加入即時鏡頭提問等功能,這類能力在 5 月的 Google I/O 上已經預告過。從 Labs 起步還有工程上的意義:語音對話的延遲控制、插話打斷、背景播放這些細節,只有在真實手機環境裡才驗證得出問題,小範圍測試正好把風險先收斂。
另外要分清楚的是,Google App 裡原有的 Search Live 功能早已存在,並且支援以相機對準物件提問;這次新聞是 Search Live 與 AI Mode 的整合,讓實驗中的 AI Mode 也能進行連續語音對話,兩者不應混為一談。
語音搜尋的競爭格局
把時間點放回 2025 年年中,這是一次遲到但必然的補齊:OpenAI 的 ChatGPT 早已靠進階語音模式建立使用習慣,Perplexity 也在語音問答上快速推進。Google 的差異在於分發——搜尋 App 的安裝量與日常查詢量,是任何獨立助理 App 難以複製的入口。另一層競爭在生態系:把語音對話綁進 Google App,等於把手機上最日常的動作——開瀏覽器查東西——改寫成對話流程,而這正是蘋果與 OpenAI 當時都在搶的同一個位置。
從 2026 年回看,這次小規模測試是搜尋介面語音化的一個起點:查詢變成對話、答案變成音訊、連結變成畫面輔助。對開發者來說,當年 6 月這一步標誌的變化很清楚——為語音互動優化內容結構,開始和為點擊優化一樣重要。
參考來源
- Google’s AI Mode can now have back-and-forth voice conversations - TechCrunch
- Google tests real-time AI voice chats in Search - The Verge
本文由 AI 協助自上述來源整理,經人工審核後發布。
