计算机辅助设计与图形学学报

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:11-2925/TP

国际刊号:1003-9775

计算机辅助设计与图形学学报杂志2023年第10期:数字说话人视频生成综述

发布日期:

作者:宋一飞, 张炜, 陈智能, 姜育刚

关键词:虚拟数字人, 数字说话人, 视频生成, 多模态融合, 深度学习

近年来, 基于深度学习的生成技术显著推动了虚拟数字人技术的发展. 针对当前虚拟数字人研究中的热点问题——数字说话人视频生成进行综述, 其在电影配音、 动画制作、 虚拟助手等场景中具有重要的应用前景. 文中从数据集、关键技术、评估策略 3 个方面, 对数字说话人视频生成技术及研究现状做了较系统的梳理与总结, 介绍了其生成过程中涉及的视觉生成、图像识别、语音识别、跨模态分析等多项人工智能的关键技术机器发展演进过程; 从数据、模型、评估策略等方面指出该方向需要迫切解决的问题, 并通过这些问题展望其未来的发展方向, 以期能对该领域的研究者有所帮助和启发, 促进该方向的发展.

来源:2023年第10期

《计算机辅助设计与图形学学报》期刊编辑部

查看计算机辅助设计与图形学学报杂志2023年第10期

联系我们

  • 地址:北京市海淀区中关村科学院南路6号
  • 电话:010-62562491
  • E-mail:jcad@ict.ac.cn

咨询工作人员