计算机辅助设计与图形学学报

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:11-2925/TP

国际刊号:1003-9775

计算机辅助设计与图形学学报杂志2022年第10期:时序对齐视觉特征映射的音效生成方法

发布日期:

作者:谢志峰, 孙络祎, 孙郁洲, 余椿鹏, 马利庄

关键词:音效生成, 跨模态, 自编码器, 时序对齐

针对目前视觉引导的音效生成方法存在的保真度低、时序对齐效果差等问题,提出一种基于时序对齐视觉特征映射的音效生成方法.首先,设计基于时序约束的特征聚合窗口,将视频序列滑动整合为视觉特征集合;其次,构建时空匹配的跨模态视音频特征映射网络,将视觉特征集合转换为多频段音频特征;最后,采用音频解码器将音频特征解码为梅尔频谱,再使用声码器将其转换为最终波形.在VAS数据集上进行定性与定量实验,实验结果表明,与现有方法相比,文中方法在语音质量感知评估、发声点平均偏移量以及人工评估方面均有显著提升,其中,发声点平均偏移量平均降低至0.2 s.

来源:2022年第10期

《计算机辅助设计与图形学学报》期刊编辑部

查看计算机辅助设计与图形学学报杂志2022年第10期

联系我们

  • 地址:北京市海淀区中关村科学院南路6号
  • 电话:010-62562491
  • E-mail:jcad@ict.ac.cn

咨询工作人员