AI语音到底要做到什么程度,才算真的"有人味"
最近吧里看到不少人讨论AI语音,有说GPT声音好的,有说某国产模型音色像真人的,争论挺多。
我之前做春风的时候,做过不少语音互动相关的东西,现在在搞心跳元力,也在和团队死磕这个问题。说几个我自己的判断。
第一,音色像不像真人,其实不是最关键的。你听三秒钟觉得"哇好像",但聊两分钟就觉得不对了。真正决定"有人味"的,是节奏感——什么时候停顿、什么时候接话、什么时候不说话。真人聊天不是乒乓球的来回,有沉默、有犹豫、有突然跑题。现在的AI语音大部分还是"你说一句我马上回一句"的模式,这就很假。
第二,情绪一致性。一个角色的声音不能上一秒温柔下一秒突然机械。角色感来自你听这个人说话,能感受到他的性格。不是声线好听就有角色感,是语气里能听出"他此刻的心情"。这事儿很难,我们现在花了很多精力在这上面。
你们怎么看?
最近吧里看到不少人讨论AI语音,有说GPT声音好的,有说某国产模型音色像真人的,争论挺多。
我之前做春风的时候,做过不少语音互动相关的东西,现在在搞心跳元力,也在和团队死磕这个问题。说几个我自己的判断。
第一,音色像不像真人,其实不是最关键的。你听三秒钟觉得"哇好像",但聊两分钟就觉得不对了。真正决定"有人味"的,是节奏感——什么时候停顿、什么时候接话、什么时候不说话。真人聊天不是乒乓球的来回,有沉默、有犹豫、有突然跑题。现在的AI语音大部分还是"你说一句我马上回一句"的模式,这就很假。
第二,情绪一致性。一个角色的声音不能上一秒温柔下一秒突然机械。角色感来自你听这个人说话,能感受到他的性格。不是声线好听就有角色感,是语气里能听出"他此刻的心情"。这事儿很难,我们现在花了很多精力在这上面。
你们怎么看?
