当前位置:首页 > AI语音类

和AI语音助手聊了半小时,第五分钟我差点忘了对面不是真人

1周前 (08-31)AI语音类15

和AI语音助手聊了半小时,第五分钟我差点忘了对面不是真人

ai-voice-chat-cover.jpg

电话那头沉默了两秒。

不是网络卡顿那种空白的沉默,是那种人听完问题之后、嘴唇微微抿了一下、在组织措辞的时候会出现的自然停顿。然后那个声音说:"嗯,你这个问题问得挺好的,让我想想怎么回你。"

我下意识回了句"没事不急",说完才意识到对面不是人。

这是上周三晚上发生的事。我本来只是想测试一下新版本的实时语音对话功能,随便聊几句就挂,结果一聊就是半小时。挂掉电话之后我坐了一会儿,脑子里反复回放刚才的对话——中间有那么几分钟,我确实忘了自己在跟一个AI说话。

这个体验让我觉得,语音对话可能是AI交互里最被低估的一个方向。打字聊天你永远知道对面是AI,但一旦有了声音、有了停顿、有了语气,那个边界就变得模糊了。我把最近试过的几个语音对话产品都翻出来重新体验了一遍,下面是我感知到的进步和仍然存在的差距。

停顿和语气,比内容本身更让人分不清

如果你问我,AI语音对话跟真人打电话最像的地方是什么,我觉得不是它说了什么,而是它怎么说的。

真人说话有一个特点:不完美。我们会有"嗯……""那个……""就是……"这种填充词,会在句子中间突然停顿,会在说完一句话之后拖一个尾音表示"我在等你的反应"。以前的AI语音对话没有这些,每个字都说得清清楚楚、字正腔圆,像在念新闻稿。这种"完美"恰恰是最大的破绽。

但现在的模型开始加入这些"不完美"了。ChatGPT的语音模式在对话中会自然地插入"um""uh"这类填充词,不是机械地插入,而是根据话题的复杂程度来调整——问题越需要思考,停顿就越长。我有一次问它"你觉得人类和AI的关系未来会变成什么样",它停顿了将近三秒才开口,那一瞬间的感觉,很像你问了一个朋友一个不太好回答的问题,对方需要想一想。

语气的进步也很明显。不是那种"我现在用开心语气跟你说话"的标签式切换,而是在同一个话题里,语气会随着内容自然流动。聊到有趣的事,声音会稍微上扬;聊到比较严肃的话题,语速会放慢。这种微妙的起伏,让对话不再是"一问一答"的机械交换,而有了点"聊天"的感觉。

但破绽也不是没有。聊到情绪比较复杂的场景,AI的回应还是能听出"计算"的痕迹。比如我说"今天运气太差了,出门被浇了一身雨,到公司发现忘了带工卡,中午外卖还送错了",人类朋友大概会先笑一下或者表示同情,然后说点什么。AI的回应是"听起来你今天确实不太顺利,希望下午会好一点"——内容是对的,但那个语气里少了一种"我能感受到你的烦躁"的共鸣感。它理解了语义,但没有理解情绪。

打断和被打算,AI终于学会了

语音对话和文字聊天有一个根本性的区别:文字聊天是你一句我一句,轮流发言,秩序井然;语音对话是乱的——你会打断对方,对方也会打断你,两个人可能同时开口,然后其中一个人说"你先说"。

这种"乱"是真人对话的核心特征之一,但AI语音对话一直处理不好。之前的AI语音模式基本是"半双工"的——你说完,它再说,你中间打断它,它要么不理你,要么停下来之后从头开始说。这种体验非常别扭,就像在跟一个不允许你插嘴的人说话。

2024年到2025年,全双工对话能力有了比较大突破。ChatGPT的高级语音模式、Gemini Live、以及几家国内厂商的产品,都开始支持实时打断和自然接话。你说到一半可以插一句"等等,刚才那个我没听懂",AI会立刻停下来,然后根据你的反馈重新组织回答。两个人同时开口的时候,AI会主动退让,等你先说完。

不过这里有一个有意思的细节:不同产品对打断的敏感度不一样。有的产品太敏感了,你只是清了下嗓子或者旁边有人路过说了句话,AI就以为你在打断它,立刻停下来。有的产品又太迟钝,你说了好几遍"等等"它还在继续讲。这个"打断阈值"的调试,目前各家还在摸索,没有统一标准。

还有一点容易被忽略:AI的"被打算"体验。真人对谈中,当你被打断的时候,你会停下来,等对方说完,然后从刚才被打断的地方继续——可能稍微回溯一下,但不会从头开始重讲一遍。很多AI语音产品被打断之后会直接说"好的,我重新回答"——之前讲的内容全部作废,从头再来。这个体验挺差的,聊到一半被打断,前面说的都没了。不过比较新的版本已经开始支持"打断后接续"了,被打断之后能记住之前说到哪了,从断点附近接着讲,这才是真人对话该有的样子。

中文场景下的尴尬:方言和语气词

英文语音对话的效果普遍比中文好,这是目前公认的差距。原因不难理解——英文的训练数据更丰富,而且英文的语音形态相对简单,语气词和语法的变化比中文少。

中文的麻烦在于,日常口语里夹杂了大量"非标准"表达。比如句尾的"嘛""呗""咯""啦""哦"——这些词在不同的语境下有不同的含义。"你吃了吧"和"你吃了呗",字面意思一样,但语气完全不同。AI目前对这类语气词的把握不太稳定,有时候该用"呗"的地方用了"吧",听着就有点别扭。

方言的识别更是灾难。我用带点口音的普通话试了几个产品,结果不太理想。不是完全听不懂,而是识别准确率明显下降,有时候一句话要重复两三遍。带粤语腔的普通话、带四川口音的普通话、带东北口音的普通话——这些在国内是大量存在的日常语音场景,但目前AI语音产品的适配程度还比较有限。

中文还有一个特殊的问题:中英文混杂。很多人说话会自然地夹几个英文单词——"这个项目的timeline是什么""我们约个call聊一下"。这种中英混杂在日常对话中很常见,但AI语音识别处理起来容易出错,要么把英文单词识别成发音相近的中文,要么识别对了但理解错了上下文。

国内几个大厂的产品——字节的豆包、阿里的通义千问、百度的文心一言——在中文语音交互上投入不小,中文场景下的表现比ChatGPT和Gemini要好一些,尤其在语气词和日常口语的理解上更自然。但方言和中英混杂的问题,大家都还在解决中。

延迟,语音对话体验的隐形杀手

聊语音对话体验,很多人会关注"AI说得像不像人",但有一个更基础的问题经常被忽略——延迟。

真人对话的响应时间大概在200毫秒左右。对方说完一句话,你在200毫秒内就能开始回应。这个速度是几十万年进化出来的,快到你根本意识不到。但AI语音对话的延迟,从你说完一句话到AI开始回应,中间可能有500毫秒到2秒的间隔。这个差距在文字聊天里无所谓,但在语音对话里非常明显——那多出来的几百毫秒,就是"对方在思考"和"对方在加载"的区别。

目前各家都在优化这个延迟。ChatGPT高级语音模式的"首字延迟"已经做到了300毫秒左右,比较接近真人水平。但"首字延迟"只是第一步——AI需要先理解你的完整意思才能开始组织回答,而真人是边听边想,你话还没说完他已经在准备回应了。这个"边听边想"的能力,AI目前还做不到,需要等到你完全说完才开始处理。所以即使首字延迟很低,整体的响应节奏还是比真人慢半拍。

还有一个容易被忽略的延迟来源:网络。实时语音对话对网络质量要求比较高,如果网络不稳定,延迟会明显增加,甚至出现断断续续的情况。WiFi环境下大多数产品表现还行,但用移动数据的时候,体验下降比较明显。

这个技术目前到底能用来做什么

抛开技术指标不谈,从实际使用场景来看,AI实时语音对话目前有几个方向已经比较可用了:

语言练习。这是目前效果比较直观的场景。用AI语音对话练英语口语,不用担心说错了丢人,AI会纠正发音和语法,而且可以随时切换话题。很多语言学习平台已经把这个功能做进去了,日活数据据说不错。

睡前闲聊和信息速查。不用盯着屏幕,躺着跟AI聊几句,让它帮你查天气、读新闻、设置提醒。这个场景对手眼协调不便的人群——比如开车时、做家务时——尤其方便。

老年人陪伴。这是我最近注意到的一个方向。有些独居老人不太会用智能手机打字,但打电话是会的。用语音对话的方式跟AI聊天,门槛比APP低太多了。当然,这里的问题不是技术层面的,而是伦理层面的——用AI替代人的陪伴,该不该鼓励。但至少从技术可行性来说,这个方向是通的。

至于更深度的应用——比如用AI语音对话做心理咨询、做商务谈判、做情感陪伴——目前还不太行。不是技术完全做不到,而是你一旦聊得深入了,AI缺乏真实情感体验的缺陷就会暴露。它可以说出"我理解你的感受"这句话,但你能感觉到那句话背后是空的。

语音对话可能是AI产品里最接近"图灵测试"的形态。文字聊天你可以假装没注意到对方是AI,但语音对话——有停顿、有语气、有情绪——一旦AI真的过了那条线,你很难再假装不知道。那条线目前还没过,但某些时刻,确实已经离得很近了。

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。