当前位置:首页>排行榜>突发:谷歌实时语音模型登顶榜单,企业端调用成本降了九成

突发:谷歌实时语音模型登顶榜单,企业端调用成本降了九成

  • 更新时间 2026-09-17 07:43:47
突发:谷歌实时语音模型登顶榜单,企业端调用成本降了九成

很多人都经历过这种抓狂的时刻:给银行或航空公司的智能客服打电话,你字正腔圆地报出一串身份证号或车票兑换码,电话那头却突然陷入死一般的沉默。过了好几秒,机械音才慢悠悠地回一句「请问您能重复一遍吗」。

这种对话就像用对讲机聊天,你说一句,必须按一下按钮等对方接收,对方说完了,你才能开口。要是中途它需要去查个数据库,整个通话就会彻底卡住,只剩下尴尬的空白。哪怕到了各家大模型都在拼语音的今天,这种「听你说话、转成文字、动脑子想、再转成声音读出来」的拼接方式,依然常常让对话慢上半拍甚至整整一秒,更别说在说话的同时去后台办业务了。

2026年9月15日,Google DeepMind 突然甩出了两款新的实时语音模型:Gemini 3.8 Live 以及带深度思考能力的 Gemini 3.8 Live Extended Thinking。它们一亮相,不仅在衡量实时语音对话水平的权威榜单上拿下了第一名,更是把计费价签直接贴到了老对手 OpenAI 的脸上。

更让人意外的是,这场技术交锋没有走向越来越贵的算力军备竞赛,反而狠狠踩了一脚刹车:Google 把每分钟的音频输入费用直接压到了半美分。

实时语音模型在后台处理任务与用户自然对话的场景示意

一、为什么过去的语音助手总像在用对讲机?

要弄明白这次发布为什么能掀起波澜,得先看看过去的语音系统到底卡在哪。

市面上绝大多数语音助手走的是一条「流水线」模式。你对着手机说一句话,第一棒选手是专门的听写系统,把你的声音扒成一段文字;第二棒选手是大语言模型,盯着这段文字苦思冥想,敲出一段回答;第三棒选手则是配音播报系统,把文字再念成语音传回你的耳朵里。

这条流水线看似分工明确,实则处处是坑。三个系统像接力赛一样挨个传递,中间光是传递和转换,就要白白浪费大约450毫秒到1000毫秒的时间。更糟糕的是,第一棒听写系统在把声音敲成冰冷汉字的那一瞬间,你说话时的语调、重音、叹气、拉长音等韵律细节,就被彻底扔掉了。机器读不懂你语气里的焦急或反讽,只能干巴巴地对着字面意思硬猜。

两周前刚发布了文字模型 Gemini 3.8 Flash 的谷歌,这次彻底掉转车头,把力气全部花在了自家的音频技术栈上。新上线的两款模型不再搞接力流水线,而是端到端的原生语音模型,也就是声音直接进、声音直接出,目标是把整套来回延迟压到200毫秒以内。

更关键的改变在于,它打破了那种「要么在想、要么在说」的对讲机僵局。新模型引入了非阻塞式的异步后台任务调用。当你在电话里报出复杂的保险理赔单号,让它去后台核实并算账时,它不需要挂起整个对话陷入长时间的沉默,也不会傻乎乎地放一段等待背景音乐。

它可以在后台悄悄调用接口、查询数据库,嘴上却完全不耽误工夫,甚至能先递过来一句自然的话垫场:「好的,我帮您查一下」,然后一边算一边向你播报最新进度。

二、能边说边干活,凭什么只收三分之一的钱?

会说话的机器不少,但一旦加上「在后台跑任务」和「看懂屏幕画面」,往往就意味着高昂的账单。

在很多开发团队眼里,以前的实时语音接口就像一台飞速空转的计费器。只要用户开着麦克风,哪怕中间有大段的停顿、呼吸声或者背景杂音,后台都在按照极高的费率疯狂扣钱。这也是为什么很多公司觉得技术演示很惊艳,却根本不敢把它做成真正的线上客服业务。

谷歌这次最狠的动作,就是把这笔账算到了骨头里。在基础版 Gemini 3.8 Live 上,音频输入的定价被定在了每分钟0.005美元,音频输出则是每分钟0.018美元。这是个什么概念?对比 OpenAI 的实时语音模型 GPT-Live-1 那种每分钟0.05美元的价码,谷歌光是输入成本就直接砍掉了整整九成。

如果放在一整场一小时的语音对话里做折算,使用谷歌的基础模型大概只需要1.38美元,而用 OpenAI 的方案至少要花上3美元。

开发者调用后台数据与语音模型持续流式交互的流程对照

要是换成对推理要求极高的大型企业客服场景,差距就更加触目惊心。在一家每月需要处理1万小时语音通话的客服中心里,如果全盘采用 OpenAI 的方案,单月账单会高达大约58300美元;换成谷歌具备深度思考能力的版本,开销立刻降到35000美元左右,直接省下40%的成本;若是只用谷歌的基础版模型,每月的支出甚至能被压缩到区区8400美元上下。

十倍级别的输入价差,对于那些天天数着硬币算盈亏的创业团队来说,几乎是「做一个死一个的昂贵玩具」和「能算得过来账的真实业务」之间的区别。

三、登顶权威榜单,真的代表它全面领先了吗?

便宜往往伴随着质疑:价格砍得这么凶,脑子和嘴皮子还够用吗?

从硬指标上来看,谷歌交出的答卷确实非常扎实。在行业知名的 Artificial Analysis 语音评测排行榜上,具备思考能力的版本拿下了82.6分,稳稳排在第一位;紧随其后的是 OpenAI 的 GPT-Live-1 Astra(81.5分),以及马斯克旗下 xAI 的实时语音模型(81.3分)。

除了测说话顺不顺,在模拟真实办事能力的测试里,比如解决退款纠纷、银行查询等复杂事务的任务完成度评估中,谷歌也以35.1%的分数,高过 OpenAI 的32.0%和 xAI 的16.5%。

面对一向容易让语音系统翻车的细碎字符,比如字母与数字混合的优惠券码、证件号,官方还特意加强了解析准确度,并且一口气把支持的语言铺到了97种以上,号称可以在对话里随意切换语言还能保持原有的口音。

但如果只看这些榜单高分,恐怕会漏掉硬币的另一面。

不少业内分析就毫不留情地指出,OpenAI 的模型之所以听起来依然令人惊艳,是因为它采用了真正意义上的全双工架构,也就是可以完全做到一边听你说、一边自己说,遇到你临时插话打断时,反应极为细腻自然。而谷歌虽然在打榜得分上略高一点,但在底层架构的取舍上,更像是为了极致的价格效率做了优化,而非在听觉体验的自然度上全方位压倒了对手。

排行榜给出的82.6分,终究是在标准题目、固定提示词和特定测试集里跑出来的成绩。它不能直接证明每一家企业拿回去落地时都能顺风顺水。

四、尝鲜者的赞叹与翻车现场

模型一上线,全球各地的开发者立刻涌进 Google AI Studio 和代码托管社区去拉示例代码,真实世界的检验也随之而来。

有人给出了极高的评价。一位海外开发者在社区里分享,自己一个人开车跑长途时,把新模型挂在后台,让它用南非荷兰语陪自己全程闲聊练口语,不仅发音地道,而且连绵不断的对话极度解闷。加上模型支持实时视觉输入,在演示里它甚至能对着棋盘上的残局给用户做即时解说,或者看着用户的手机屏幕一步步指导复杂软件的开通流程。

然而,真实的落地从来没有官方宣传片那么光鲜。翻车现场同样在社区里传得沸沸扬扬。

有细心的棋迷在逐帧拆解官方宣传视频时发现,模型在面对最基础的几步杀棋局时,居然看走了眼,直接输掉了比赛,被调侃为「不是谷歌原本想炫的那种技巧」。而在多轮重度测试中,也有开发者抱怨,它在相邻的消息交互之间依然偶尔会弄丢前文的上下文,仿佛脑子突然短路。

除此以外,对于想真正把系统搬上生产线的工程师来说,这套系统还有不少硬性规矩需要填补:模型走的是长连接通信机制,纯音频会话单次最长只能维持15分钟,如果带上视频画面更是卡在区区2分钟上限。工程师必须在自己的代码里精心设计断线重连和会话续接逻辑,否则用户的电话打到一半就会被迫切断。

更现实的问题是,官方虽然声称覆盖了97种以上的语言,但并没有给出每一种具体语言的识别错误率和延迟明细。除了英语等主流语种,它在小语种上的真正表现,目前仍然缺乏大规模实战数据的验证。

实时语音技术应用于全球跨语言远程客服与多终端交互的设想

好在生态的铺设速度非常快。在发布当天,包括实时音视频云服务商 Agora、LiveKit、Pipecat,以及应用框架 LangChain、Vercel 都在第一天就完成了原生接入;企业级软件巨头 Salesforce 和 ServiceNow 也被列入了首发合作名单。所有通过该模型生成的音频,后台还会自动被打上不可感知的防伪数字水印,以应对滥用风险。

一场没有硝烟的落地战,已经从单纯的纸面智商比拼,演变成了每分钟几个美分的肉搏。

语音助手不再只是那个等着你问今天天气如何的呆板工具。它正在被推着变成一个不仅能听懂你倒苦水、还能在后台一声不响帮你把退款单填完的数字柜员。而当这套能力的调用成本被一路砸到原来的三分之一时,决定一家企业要不要用它的,往往不再是它有多聪明,而是月末打印出来的那张账单,终于不再让人心惊肉跳了。

随机文章