日前,圣彼得堡国立大学研究团队将语调模型集成至神经网络,使人工智能合成语音的听感更自然、更贴近真人。这一进展有望优化语音助手、人形机器人等设备所使用的文本转语音系统。
现有语音合成模型往往倾向于生成最常见的单词发音或短语发音变体,难以生成能够传达语义与情感细微差别的语调。同时,若句子各部分的语调组合不当,即便音质生成质量较高,也会影响整体听感。圣彼得堡国立大学的语言学家致力于弥补神经网络的这一短板,其提出的改进方案有效改善了语调不自然、单调的问题。
模型训练依托圣彼得堡国立大学语音学与外语教学方法系开发的语调分类体系,该体系由该系副教授妮娜・沃尔斯卡娅与系主任帕维尔・斯克雷林教授共同构建。这一分类体系涵盖疑问句、陈述句、祈使句、请求句、呼语句等多种句类,并包含多种音高模式变体。
圣彼得堡国立大学副教授乌里亚娜・科切特科娃解释称,得益于合理的数据结构与对音高变化的精准标注,模型能够传达丰富的语调细节,从而生成更自然、更具表现力的语音。这一方法提升了合成系统的灵活性,可应用于语音控制、教育软件等多种场景。
为评估模型训练效果,研究人员邀请42名俄语母语者聆听合成音频并作答。结果显示,受试者普遍认为合成音频听感自然。
研究团队指出,为进一步提升合成质量,模型仍需精细化调整,考虑情感和风格上的差异。
(本栏目稿件来源:俄罗斯金砖国家电视台 编辑整理:本报实习记者 姚易安)

网友评论