9 月 15 日,Google 上線了兩個語音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。兩個都是原生的語音到語音模型,當天就進了 Gemini Live API 和 AI Studio,只提供託管呼叫。
Extended Thinking 在 Artificial Analysis 的語音到語音品質榜上拿了第一,82.6 分。
榜首擠在一起,真正分開的是另外三個分數
先看第一名這個位置值多少。82.6 分之後,GPT-Live-1 Astra(Medium)是 81.5,Grok Voice Think Fast 2.0(High)是 81.3。前三名之間隔著 1.3 分。榜首是新聞,領先幅度不是。
真正該看的是同一個模型在三套不同題目上的成績:
- Big Bench Audio(音訊推理)97.7%
- τ-Voice(通用語音代理人任務)68.6%
- Sierra 的 τ-Voice-banking(銀行場景電話任務)35.1%
同一個模型,同一天,從 97.7 掉到 35.1。
另外兩條:非推理版的 Gemini 3.8 Live 在人類偏好評測 Speech Agent Arena 裡拿了第二;在 ServiceNow 的 EVA-Bench 上,Google 說這兩個模型把複雜工作流程的柏拉圖前緣往外推了。
價格早就不是卡點了
官方定價是音訊輸入每分鐘 0.005 美元,音訊輸出每分鐘 0.018 美元,Google 說這是按每百萬輸入 token 3 美元、每百萬輸出 token 12 美元折算的。
按這個價把一小時的雙向通話算出來:輸入 0.30 美元,輸出 1.08 美元,合計約 1.38 美元。這個數是從 Google 公布的每分鐘單價推的,不是官方給的口徑。
一小時 1.38 美元。任何一個市場的真人座席都不是這個量級。所以過去兩年語音客服推不動,原因從來不在錢。
能力清單裡有一條把真正的原因點破了:英數字元精度。Google 特意點名了確認碼、理賠編號和技術參數,並且直說這是語音系統的常見失效點。把這句話翻過來讀就清楚了——語音客服這兩年栽的跟頭,不是聽不懂客戶在說什麼,是把一個理賠編號聽錯了一位。
同一批新能力還包括:工具呼叫可以放到背景跑,音訊照常往外流,不用讓客戶在電話那頭乾等;97 種語言可以在通話中途切換並保持口音一致;模型在執行長任務時會先出聲應一句、說自己去查,再一步一步往回報進度。
35.1% 這個數字,落在客服組織的哪一層
把三個分數並排放,客服這份工的分界線就出來了。
97.7% 說明模型聽得懂、也推得動。68.6% 說明通用的、邊界清楚的語音任務它大多能走完。35.1% 說明的是另一件事:在一通有帳戶、有法遵、有真實金額的銀行電話裡,它有將近三分之二走不到底。
我們 7 月 30 日寫過 AI 正在掏空客服這一行,9 月 8 日寫過 Accenture 和 Google 那 1000 名前置工程師把 YouTube 的處理時長壓掉 37%,9 月 11 日寫過 KB 產險給六個代理人發了員工編號、排進職級。這幾件事拼起來的方向是一致的:能被流程寫死的那一段先走。35.1% 給這個方向補上了刻度。
所以第一層承壓的是第一線接線:查餘額、改地址、報帳單日期、走一段固定話術。這一層本來就是按處理時長考核的,也是訓練週期最短、流動率最高的一層。
第二層的變化更值得盯,因為它不是減人,是換人。剩下那六成多走不完的電話,會被轉到真人。轉過來的這一通,比過去那一通難:客戶已經跟機器繞了幾分鐘,情緒是帶著的,上下文要在接起來的三秒內補齊,而這三分之一已經被機器做掉的事還得快速核一遍對不對。換句話說,第一線的職位在減少,但留下來的那些職位的門檻在上升。這對在職的人不是壞消息,對剛入行、本來指望從第一線練起的人是。
那麼盯什麼。盯 τ-Voice-banking 這個分數下一版往哪走。它從 35.1% 抬到 50% 以上的那一天,才是銀行真正能把第一線電話交出去的時候;在那之前,任何說 AI 已經接管了客服中心的話,都可以先拿這個數字去對一遍。