计算机辅助设计与图形学学报杂志

计算机辅助设计与图形学学报杂志2022年第10期

  • 基于单词等级和关联性语义多模态主题模型的社会事件分类
    薛峰, 张涛, 李书杰
    多媒体社会事件分类问题是多媒体研究领域中的热点问题.现有基于有监督主题模型的社会事件分类方法,未充分利用语料库(文本、视觉等模态)的内部语义信息,模型分类性能有待进一步提升.针对此问题,提出了一种融合单词等级和单词文档关联性语义的多模态监督主题模型(multi-modal supervised topic model based on word rank and relevance semantic weighting,DPRF-MMSTM),利用依存句法分析结果来划分文本模态单词对文档表征的贡献等级,挖掘出文本单词的等级语义;同时,考虑多模态单词的关联文档频数信息,用于单词文档关联性语义的提取;将2种语义融合到多模态单词的采样过程,实现基于有监督主题模型的社会事件分类.在多模态和单模态数据集上的对比实验表明,对比现有方法,DPRF-MMSTM模型在社会事件分类精度上分别提高了1.200%,1.630%,在主题一致性上分别提高了38.0%,8.5%.
  • 联合图像域间和域内信息建模的图像风格转换
    甘益波, 谭智一, 鲍秉坤
    针对当前图像风格转换算法缺乏建模图像域间语义信息和域内长范围信息的能力,提出了一种联合图像域间和域内信息建模的图像风格转换算法SSC-GAN.通过提出语义残差连接,提取图像域内的语义特征,增强模型建模图像域间语义信息差异的能力;同时,将注意力机制引入图像风格转换任务中,解决卷积缺乏图像域内长范围信息建模能力的问题.SSC-GAN可以在不增加计算量的情况下,显著提升图像风格转换的表现.在图像风格转换数据集vangh2photo和selfie2anime上对SSC-GAN进行训练、评估和验证,结果表明,SSC-GAN不仅能取得极佳的视觉效果,而且在FID和KID指标上分别平均下降了1.3和1.1,证明了SSC-GAN的有效性.
  • 基于语义一致性的细节保持图像生成方法
    崔怀磊, 刘丽, 张化祥, 刘冬梅, 马跃, 王泽康
    生成对抗网络被广泛应用于文本生成图像领域,但在生成过程中容易导致部分图形缺失必要的细节.为了生成包含更多细节特征的细粒度图像,提高文本与图像的语义一致性,提出一种基于语义一致性的细节保持图像生成方法.首先,挖掘文本描述中的潜在语义,引入特征提取模块选择文本中的重要单词和句子,获取单词和句子之间的语义结构信息;其次,构造细节保持模块关联图像与文本信息,结合混合注意力机制,定位特定文本对应的图像区域,将定位区域与文本信息关联,增强和优化生成图像的细节;最后,融合语义损失和感知损失,将句子的图像和单词的子区域映射到共同语义空间.实验结果表明,在CUB数据集上,IS和FID指标分别达到4.77和15.47;在COCO数据集上,IS和FID指标分别达到35.56和27.63.
  • 时序对齐视觉特征映射的音效生成方法
    谢志峰, 孙络祎, 孙郁洲, 余椿鹏, 马利庄
    针对目前视觉引导的音效生成方法存在的保真度低、时序对齐效果差等问题,提出一种基于时序对齐视觉特征映射的音效生成方法.首先,设计基于时序约束的特征聚合窗口,将视频序列滑动整合为视觉特征集合;其次,构建时空匹配的跨模态视音频特征映射网络,将视觉特征集合转换为多频段音频特征;最后,采用音频解码器将音频特征解码为梅尔频谱,再使用声码器将其转换为最终波形.在VAS数据集上进行定性与定量实验,实验结果表明,与现有方法相比,文中方法在语音质量感知评估、发声点平均偏移量以及人工评估方面均有显著提升,其中,发声点平均偏移量平均降低至0.2 s.
  • 颅骨点云曲面重建的Euler’s Elastica模型
    牛慧勤, 潘振宽, 赵俊莉, 周明全
    为从具有复杂拓扑关系的颅骨点云数据中重建精确、光滑的隐式曲面,提出了基于Euler’s Elastica的变分水平集方法.首先,将Euler’s Elastica作为正则化约束引入变分能量泛函,采用增广拉格朗日方法将变分能量泛函最小化问题转化为一系列子问题;其次,分别采用广义软阈值公式、解析公式和快速傅里叶变换求解;最后,在计算过程中采用投影算法,有效地避免了水平集函数的重新初始化过程.实验结果表明,相较于现有方法,所提基于Euler’s Elastica的变分水平集方法具有更好的收敛性和有效性,能够提高重建的精确性,避免曲面边缘的缺失.
  • 基于还音转换规则的胶片音频生成方法
    王睿琦, 程皓楠, 叶龙, 齐秋棠
    还音作为一种将电影音轨胶片记录的声波信号图转换为音频的过程,是老电影重映中的重要环节.为解决当前还音方法中音频生成失真的问题,提出了一种基于还音转换规则的胶片音频生成方法,可实现音轨胶片图像到音频信号的高精度自动化生成.该方法包含2部分:一是在基于光电转换规则的包络线修正中,基于光度积分的包络线提取,并基于光学规则进行局部与全局校正,解决了光电转换过程中的信号误差问题;二是在基于频率调制规则的音频生成中,设计直流偏量调节方法,并基于电影音频录制还音标准进行信号频域调制,提升了合成音频质量.通过对MovieAD数据集中6类不同类别胶片进行音频生成并测试主观及客观音频评价,结果显示,相比目前较新的还音方法,文中方法生成的音频质量平均提高8.00%以上,且音频采样率可提高到行业标准的162.08%.
  • 递归特征融合的单目深度累积估计
    王秋晨, 帅惠, 刘青山
    现有的深度估计方法通常采用编码器-解码器结构,存在图像不同区域对深度特征的需求和深度估计的难度的差异性问题,提出递归特征融合的单目深度累积估计方法.在编码器阶段,递归特征融合通过递归使用门控循环单元筛选融合多尺度特征,提取适应图像不同区域需求的特征以替代跨层连接;在解码器阶段,深度累积估计将深度重建过程分解为多层,不同层分别预测不同细粒度的深度图,最后累积生成深度估计结果.与DPT,BTS,DORN等方法相比,在2个基准数据集KITTI和NYU Depth V2上取得了具有竞争力的结果,Abs Rel分别达到了0.058和0.107,RMSE分别达到了2.411和0.386.
  • 多尺度特征融合的知识蒸馏异常检测方法
    陈亚当, 陈柳任, 余文斌, 朱加乐
    为提高一分类异常检测方法的泛化性,提出了多尺度特征融合的知识蒸馏异常检测方法.在训练阶段,使用训练好的教师网络教授学生网络学习正常样本特征信息;在测试阶段,由于教师网络强大的泛化能力,对未见过的异常样本也有较好的表示能力,而学生网络未见过异常样本,因此,两者对异常样本的表征会产生较大差异,从而实现异常检测.为了进一步提高检测精度,采用中层特征金字塔实现多尺度特征融合,以增强对不同大小异常点的检测能力;同时,为了增大学生和教师网络对异常样本的表征差异,设计了特征重构模块对中层特征进行重构.在公开数据集MVTecAD上的实验结果表明,文中方法分别达到较高的97.8%AUC像素级得分、97.7%AUC图像级得分.
  • 基于全局-局部生成对抗学习的无监督弱光图像增强
    孙子正, 宋慧慧, 樊佳庆, 刘青山
    在弱光图像增强中,现有的无监督方法仍存在着真实性不足以及对于极暗条件的图像增强效果不明显等问题.为此,提出了一种无监督的弱光图像增强方法,通过设计一种高效循环生成对抗网络,直接从弱光图像中恢复出正常光照图像.首先,为解决大尺寸输入导致的内存不足的问题,设计了全局-局部生成器;其次,判别器设计为自适应二阶段分类器,通过判别全局区域来自适应定位需再次判别的局部区域;最后,采用了焦点频域损失函数,使模型自适应地聚焦于分类难以合成的频率波段,以避免生成图像失真.文中方法在NPE,LIME,MEF,DICM和VV数据集上的感知指标(perceptual index,PI)分别达到了2.81,2.78,2.40,3.15和3.69,在LOL数据集上PSNR和SSIM指标分别达到了19.89 dB和0.7823,具有良好的鲁棒性.
  • 针对唇语识别的上下文相关性蒸馏方法
    赵雅, 冯尊磊, 王慧琼, 宋明黎
    针对唇语识别模型的性能受到数据集大小限制的问题,提出一种跨模态知识蒸馏方法C2KD.C2KD将语音识别模型的多尺度上下文相关性知识蒸馏到唇语识别模型中.首先,利用Transformer模型的自注意力模块得到上下文相关性知识;其次,使用层映射策略来决定从语音识别模型的哪一层提取知识;最后,使用自适应训练策略来根据唇语识别模型的性能动态地进行知识的传递.C2KD在数据集LRS2和LRS3上取得了优异的表现,词错误率分别比基线方法低2.0%和2.7%.
  • 多条件生成对抗网络的文本到视频合成方法
    周瑞, 姜聪, 许庆阳, 李贻斌, 张承进, 宋勇
    针对目前主流的模型在视频合成过程中随机性强,缺乏合成复杂场景、多样运动视频的能力的问题,提出基于多条件生成对抗网络的文本生成视频方法,包括文本处理模块、位姿建模与转换模块、视频帧生成与优化模块.文本处理模块将传统生成方法(检索与监督学习方法)与生成模型相结合建立动作检索数据库,提高生成过程的可控性;位姿建模与转换模块实现对位姿信息的提取及三维建模;视频帧生成与优化模块利用多条件生成对抗网络进行视频帧的合成与优化.在iPER,DeepFashion等公开数据集上,采用IS,SSIM,PSNR等指标进行评价的实验结果表明,与现有模型相比,所提方法生成视频的语义一致性及视频质量均具有优势.相较于目前主流的姿势转换模型MonkeyNet,在iPER数据集上的SSIM值提升了16.8%,IS提升了22.7%,PSNR值提升了27.1%.在评价姿势转换方面,在基线数据集DeepFashion进行比较,FreID值提升了26.7%.
  • 基于深度集成及细节感知的细粒度三维模型分类
    白静, 姬卉, 邵会会, 武如嵩, 秦飞巍
    针对基于深度学习的三维模型分类方法应用于细粒度三维模型分类时效果较差的问题,提出一种端到端的细粒度三维模型分类框架,并构建基于深度集成及细节感知的细粒度三维模型分类网络.通过由深度集成学习构成的主干网络提取三维模型多视图下的整体形状特征;采用基于上下文细节感知模块的辅助网络捕捉各个视图下的局部细节特征;两者相互融合,实现端到端的弱监督细粒度三维模型分类.选用公开数据集FG3D中不同难度的子数据集Airplane,Chair和Car进行实验,获得了当前最好的细分类精度,分别达到了96.31%,85.44%和79.62%的分类准确率,表明该网络具有良好的细分类性能和普适性.
  • 3次Bézier曲线的新扩展
    严兰兰, 揭梦柔, 魏子华
    为了使扩展的3次Bézier曲线在C2光滑拼接条件下也能实现FC3连续,并保证单段曲线和组合曲线均可以在不改变控制顶点的前提下自由调整形状,构造了一种结构与3次Bézier曲线相同的新曲线.首先,给出调配函数初步表达式,其中含待定系数;然后,根据预设的曲线在拼接时的性质,反推出调配函数应具有的端点性质,以此建立调配函数中待定系数应满足的方程组;通过解方程组,得到了一组含4个参数的5次多项式调配函数,取特殊参数时其次数可降为4次;最后,将调配函数与控制顶点作线性组合,定义了一种由4个控制顶点确定的带4个形状参数的新曲线,其具有Bézier曲线的凸包性、几何不变性和仿射不变性等基本性质.得益于多个形状参数的引入,由相同控制多边形可以定义形状各异的曲线,每个形状参数的改变都会带动曲线上的点沿固定方向线性移动.构造组合曲线时,相邻曲线段之间的FC3连续条件与C2连续条件一致,组合曲线可以在保持连续性、控制顶点和参数分割均不变的前提下,自由调整形状.该方法能扩展CAD系统对工业产品的处理能力,提高产品设计、修改和优化的速度,节约设计中人力和物力.
  • FP-Net: 基于任意角度单幅人体图像的正面姿态估计
    陈路飞, 张勇, 唐永正, 尹宝才
    准确提取人体正面姿态,能够更好地辅助进行行为识别、图像生成和虚拟试衣工作.然而,侧面图像、背面图像存在人体自遮挡、关键点不可见等问题,使正面姿态提取非常困难.因此,设计并实现了基于任意角度单幅人体图像的正面姿态估计网络FP-Net(frontal pose network).首先,制作了多角度人体图像数据集,为模型设计提供数据支持;其次,为了提高模型预测结果的准确性,设计了基于Anchor pose的回归模块和基于三维姿态的特征融合模块;最后,通过FP-Net实现了任意角度人体图像的正面姿态提取.在BJUT Taichi和CMU Panoptic数据集上采用PCK评价指标进行消融实验,结果表明所提方法有效地提高了人体正面姿态估计的准确率.
  • MDataEE: 多因素时间序列数据的分析与可视化
    路强, 葛逸凡, 余烨, 黎杰, 饶金刚
    多因素时间序列数据及异常数据的可视化对于提高决策分析效率等问题具有十分重要的意义.由于不同种类数据具有不同的特征,传统的可视化方法在绘制此类数据时会出现图像复杂、用户观察效率低的情况.为此,提出一种高效探索多因素时间序列数据及异常数据的可视化方法MDataEE.首先,使用可视化映射简化多种类数据的视图;其次,根据数据的密度和重要性以及视觉感知来优化坐标轴的绘制;最后,增加了一些交互操作,通过图像显隐及生成对比视图等操作,方便用户根据需求自由探索不同方面的数据.在真实PM2.5数据集上进行的实验结果表明,与传统可视化方法相比,所提出的方法能够生成简洁且易于分析的可视化视图,在分析异常数据变化的趋势及原因等方面更有优势,可提高用户理解并分析异常的多因素时间序列数据的效率.
  • 融合多尺度与注意力机制的智能车间场景目标轻量级语义分割
    严成良, 陈光柱, 易佳, 苟荣松, 廖晓鹃
    对场景目标进行语义级分割与识别是实现车间场景中移动机器人智能导航、智能安防的基础.针对车间场景中目标语义分割存在分割目标种类多、形状差异大等多尺度问题,为满足智能车间目标分割实时性的要求,提出一种融合双路平均池化与三分支注意力机制的轻量级语义分割网络;首先,采用编码器-解码器结构,以轻量级卷积神经网络作为整个网络的编码器,解码器包括双路平均池化模块和三分支注意力机制模块,提取多尺度目标的语义信息和实现高精度的语义分割;然后选取ShuffleNet v2,SqueezeNet和MobileNet v2这3种不同的轻量级卷积神经网络与解码器结合,针对智能车间场景目标语义分割数据集,进行目标语义分割对比实验,并确定MobileNet v2作为编码器.与ENet,ERFNet,BiSeNet v2,Deeplab v3,Deeplab v3+,CFPNet和Fast-SCNN轻量级语义分割网络进行语义分割精度和实时性的实验结果表明,所提网络对车间场景目标分割的MPA为94.25%,MIoU为87.67%,浮点运算数量为109×1.66,推理速度为66.67帧/s,能够很好地平衡分割精度与实时性,满足智能车间场景目标语义分割的需求.
计算机辅助设计与图形学学报封面

中文名称:计算机辅助设计与图形学学报

杂志社官网:https://www.jcad.cn/

英文名称:Journal of Computer-Aided Design & Computer Graphics

语言:中文

类别:自动化技术、计算机技术

主 编:胡事民

创刊时间:1989

出版周期:月刊

国内刊号:11-2925/TP

国际刊号:1003-9775

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区中关村科学院南路6号
  • 电话:010-62562491
  • E-mail:jcad@ict.ac.cn