<p class="ql-block">语音识别与合成的核心是把你说的话先转成文字,再让机器人理解并回答:</p><p class="ql-block">① 语音识别 (ASR):把声音转成文字。</p><p class="ql-block">② 语义理解 (NLP):让机器人明白文字的意思。</p><p class="ql-block">③ 语音合成 (TTS):把机器人的文字回答再变成声音说出来。</p> <p class="ql-block"><b>1、语音识别(ASR)</b></p><p class="ql-block">灵敏如耳辨千声,万语千言转字明。</p><p class="ql-block">却恼方言兼噪扰,混淆音韵误输情。</p><p class="ql-block">注:支持语音识别的聊天机器人软件不少,结合华为 Mate X5 手机,优先推荐小度、小艺、豆包、文小言和 Kimi 这几款。</p> <p class="ql-block"><b>2、语义理解(NLP)</b></p><p class="ql-block">金石镌文意未穷,诗书作筏渡迷丛。</p><p class="ql-block">若求弦外清商曲,且向朦胧月下逢。</p><p class="ql-block">注:语义理解是指让计算机或系统理解人类语言背后的真实含义,不仅识别文字表面,还要把握意图、情感和上下文关系。</p> <p class="ql-block"><b>3、语言合成(TTS)</b></p><p class="ql-block">文字生音口若簧,抑扬顿挫谱华章。</p><p class="ql-block">只嗟情意终难拟,机械声腔少暖凉。</p><p class="ql-block">注:语音合成 包括前端文本处理、声学模型和声码器三部分。</p><p class="ql-block">① 前端文本处理:对文字做分词、注音、数字和符号转换等。</p><p class="ql-block">② 声学模型:把文本转成声学特征。</p><p class="ql-block">③ 声码器:合成语音波形。</p>