9 月 15 日,Google 上线了两个语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。两个都是原生的语音到语音模型,当天就进了 Gemini Live API 和 AI Studio,只提供托管调用。
Extended Thinking 在 Artificial Analysis 的语音到语音质量榜上拿了第一,82.6 分。
榜首挤在一起,真正分开的是另外三个分数
先看第一名这个位置值多少。82.6 分之后,GPT-Live-1 Astra(Medium)是 81.5,Grok Voice Think Fast 2.0(High)是 81.3。前三名之间隔着 1.3 分。榜首是新闻,领先幅度不是。
真正该看的是同一个模型在三套不同题目上的成绩:
- Big Bench Audio(音频推理)97.7%
- τ-Voice(通用语音智能体任务)68.6%
- Sierra 的 τ-Voice-banking(银行场景电话任务)35.1%
同一个模型,同一天,从 97.7 掉到 35.1。
另外两条:非推理版的 Gemini 3.8 Live 在人类偏好评测 Speech Agent Arena 里拿了第二;在 ServiceNow 的 EVA-Bench 上,Google 说这两个模型把复杂工作流的帕累托前沿往外推了。
价格早就不是卡点了
官方定价是音频输入每分钟 0.005 美元,音频输出每分钟 0.018 美元,Google 说这是按每百万输入 token 3 美元、每百万输出 token 12 美元折算的。
按这个价把一小时的双向通话算出来:输入 0.30 美元,输出 1.08 美元,合计约 1.38 美元。这个数是从 Google 公布的分钟单价推的,不是官方给的口径。
一小时 1.38 美元。任何一个市场的人工坐席都不是这个量级。所以过去两年语音客服推不动,原因从来不在钱。
能力清单里有一条把真正的原因点破了:字母数字精度。Google 特意点名了确认码、理赔号和技术参数,并且直说这是语音系统的常见失效点。把这句话翻过来读就清楚了——语音客服这两年栽的跟头,不是听不懂客户在说什么,是把一个理赔号听错了一位。
同一批新能力还包括:工具调用可以放到后台跑,音频照常往外流,不用让客户在电话那头干等;97 种语言可以在通话中途切换并保持口音一致;模型在执行长任务时会先出声应一句、说自己去查,再一步一步往回报进度。
35.1% 这个数字,落在客服组织的哪一层
把三个分数并排放,客服这份工的分界线就出来了。
97.7% 说明模型听得懂、也推得动。68.6% 说明通用的、边界清楚的语音任务它大多能走完。35.1% 说明的是另一件事:在一通有账户、有合规、有真实金额的银行电话里,它有将近三分之二走不到底。
我们 7 月 30 日写过 AI 正在掏空客服这一行,9 月 8 日写过 Accenture 和 Google 那 1000 名前置工程师把 YouTube 的处理时长压掉 37%,9 月 11 日写过 KB 损保给六个智能体发了员工编号、排进职级。这几件事拼起来的方向是一致的:能被流程写死的那一段先走。35.1% 给这个方向补上了刻度。
所以第一层承压的是一线接线:查余额、改地址、报账单日期、走一段固定话术。这一层本来就是按处理时长考核的,也是训练周期最短、流动率最高的一层。
第二层的变化更值得盯,因为它不是减人,是换人。剩下那六成多走不完的电话,会被转到人工。转过来的这一通,比过去那一通难:客户已经跟机器绕了几分钟,情绪是带着的,上下文要在接起来的三秒内补齐,而这三分之一已经被机器做掉的事还得快速核一遍对不对。换句话说,一线的岗位在减少,但留下来的那些岗位的门槛在上升。这对在岗的人不是坏消息,对刚入行、本来指望从一线练起的人是。
那么盯什么。盯 τ-Voice-banking 这个分数下一版往哪走。它从 35.1% 抬到 50% 以上的那一天,才是银行真正能把一线电话交出去的时候;在那之前,任何说 AI 已经接管了客服中心的话,都可以先拿这个数字去对一遍。