计算机辅助设计与图形学学报杂志

计算机辅助设计与图形学学报杂志2023年第1期

  • 跨媒体智能关联分析与语义理解理论与技术研究进展
    于俊清, 王鑫, 况琨, 刘偲, 张新峰, 宋子恺
    深入分析了跨媒体智能关联分析与语义理解理论技术的最新研究进展,包括多模态数据的统一表达、知识引导的数据融合、跨媒体关联分析、基于知识图谱的跨媒体表征技术以及面向多模态的智能应用.其中,多模态数据的统一表达是对跨媒体信息进行分析推理的先决条件,利用多模态信息间的语义一致性剔除冗余信息,通过跨模态相互转化来实现跨媒体信息统一表达,学习更全面的特征表示;跨媒体关联分析立足于图像语言、视频语言以及音视频语言的跨模态关联分析与理解技术,旨在弥合视觉、听觉以及语言之间的语义鸿沟,充分建立不同模态间的语义关联;基于知识图谱的跨媒体表征技术通过引入跨媒体的知识图谱,从跨媒体知识图谱构建、跨媒体知识图谱嵌入以及跨媒体知识推理3个方面展开研究,增强跨媒体数据表征的可靠性,并提升后续推理任务的分析效率和准确性;随着跨模态分析技术的快速发展,面向多模态的智能应用得到了更多的技术支撑,依据智能应用所需要的领域知识,选取了多模态视觉问答,多模式视频摘要、多模式视觉模式挖掘、多模式推荐、跨模态智能推理和跨模态医学图像预测等跨模态应用实例,梳理了其在多模态数据融合以及跨媒体分析推理方面的研究进展.
  • 知识图谱可视分析研究综述
    刘玉华, 翟如钰, 张翔, 王毅刚, 周志光
    知识图谱是一种以图谱形式描述客观世界中存在的各种实体、概念及其关系的技术,广泛应用于智能搜索、自动问答和决策支持等领域.可视分析技术可以将抽象的知识图谱映射为图形元素,帮助用户直观地感知和分析数据,从而提高知识图谱的构建和表达,也为知识图谱在各个领域的应用提供了有力支持.文中对知识图谱可视分析相关工作进行调研和整理,从知识图谱可视化表现形式、知识图谱构建过程中常用的可视分析方法以及面向应用领域的知识图谱可视分析技术3个方面进行综述;进一步,总结和讨论知识图谱可视分析面临的挑战,并对其未来的发展趋势进行展望.
  • 基于通道多尺度融合的场景深度图超分辨率网络
    缪永伟, 张新杰, 任瀚实, 张佳婧, 孙树森
    针对传统消费级深度相机采集的场景深度图通常存在分辨率低、深度图模糊等缺陷,利用场景高分辨率彩色图引导,提出一种基于通道多尺度融合的场景深度图超分辨率网络——CMSFN.为了有效地利用场景深度图的多尺度信息,CMSFN采用金字塔多尺度结构,在金字塔各层级上,通过对低分辨率深度图进行通道多尺度上采样,并结合残差学习提升深度图分辨率.首先,在超分辨率网络金字塔结构每一层级上对深度特征图与同尺度彩色特征图通过密集连接进行融合,使场景彩色-深度图特征得到复用并能够充分融合场景结构信息;其次,对融合后的深度特征图进行通道多尺度划分,使网络能获得不同大小的感受野,并在不同尺度上有效捕捉特征信息;最后,在CMSFN中加入全局与局部残差结构,使网络在恢复场景深度图高频残差信息的同时缓解梯度消失.对于Middlebury数据集A组,CMSFN方法超分辨率均方根误差平均为1.33,与MFR和PMBANet方法相比,分别降低了6.99%和26.92%;对于Middlebury数据集B组,CMSFN方法超分辨率均方根误差平均为1.41,与MFR和PMBANet方法相比,分别降低了9.03%和17.05%.实验结果表明,CMSFN能够有效地恢复场景深度图的结构信息.
  • 扩增感受野特征融合的小目标检测算法
    魏文晓, 刘洁瑜, 徐军辉, 沈强
    为了解决小目标检测在实际应用中的高漏检率、低准确率、低召回率等问题,提出一种基于感受野扩增特征融合的小目标检测算法.首先,对全卷积单阶段目标检测算法(fully convolutional one-stage object detection, FCOS)基础网络特征提取部分增加感受野扩增模块,改善基础网络ResNet-50特征信息提取较少、浅层特征层信息利用率偏低等问题;其次,在特征金字塔部分利用门控思想筛选信息融合,降低无效信息融合的干扰;最后,对7个特征层增加注意力机制模块,提升目标定位精度和分类精度.在COCO 2017数据集上的实验结果表明,该算法比传统FCOS算法的检测精度提升2.4%.其中,小目标检测精度提升3.2%,具有更好的检测效果.
  • 结合注意力机制和多路径U-Net的视网膜血管分割
    侯向丹, 李紫宇, 牛敬钰, 刘洪普
    针对现有算法无法精确分割细微血管末端,且分割结果易受光学造影与病变区域影响的问题,提出一种结合注意力和多路径U-Net的视网膜血管分割算法.首先,设计一个双路径U-Net,通过纹理与结构分支提取粗和细粒度血管,并使用语义指导模块充分融合深浅层特征;其次,采用一种引入注意力机制和DropBlock的残差模块来代替普通卷积模块,改善处于复杂背景区域中血管的分割效果,防止过拟合;最后,将双路径U-Net的输出图与原图传入特征细化模块进行特征提取和融合,进一步细化血管分割结果.在DRIVE,STARE和CHASEDB1数据集上的实验结果表明,该算法的准确率分别为97.01%,96.43%和97.52%;灵敏度分别为80.31%,84.38%和81.61%;受试者工作特性曲线下方的面积(AUC)分别为98.67%,98.06%和98.83%,综合分割性能优于其他算法.
  • 基于分裂倒残差的轻量化目标检测算法
    周浩然, 侯进, 杨宗源, 曾雷鸣, 康萍萍
    针对工业应用领域中终端设备计算能力较低且对检测算法的响应速度存在较高需求的问题,提出基于分裂倒残差的轻量型实时目标检测算法.首先,在主干网络中使用分裂倒残差结构,削减网络结构的参数量以及运算次数,以达到加快推理速度的目的;其次,引入自适应上下文感知模块以及轻量型双向特征融合模块,旨在提升特征信息交流、增加对小目标检测性能的同时,避免增加额外的学习参数与推理.实验结果表明,文中算法在参数量仅有7.5×105的情况下,MS COCO数据集中检测精度达到21.1%,移动端检测速度达到48帧/s,远超对比算法,该检测算法更适合在无法提供高计算能力的移动端设备上完成目标检测任务.
  • 融合多标签损失与双注意力的U型视网膜血管分割
    梁礼明, 冯骏, 彭仁杰, 曾嵩
    眼底视网膜血管的检测与分析对许多眼科疾病的诊断具有重要意义.为了更精确、健全地提取视网膜血管的特征信息,提出一种融合多标签损失与双注意力的U型网络模型.首先在编码部分通过空间金字塔池化提供多尺度输入,在U型网络内部融入双注意残差块提升网络对特征信息的提取能力;其次,在网络底部嵌入特征相似模块以捕获特征之间的远程依赖关系,为了有效地抑制眼底图像中的噪声影响和捕获血管多尺度信息,在跳连部分分别引入双路径注意门机制与稠密的空洞空间金字塔池化模块;最后,在解码部分设置侧输出层生成与层级对应的局部预测图像,并配合多标签Dice损失函数进行训练.在DRIVE,STARE和CHASE_DB1数据集上进行实验,灵敏度分别为80.54%,83.97%和82.40%,受试者曲线下的面积(AUC)分别为98.07%,98.50%和98.36%.
  • 利用金字塔空间注意力与特征推理的图像修复
    彭豪, 李晓明
    针对现有基于深度学习的图像修复方法对图像未受损区域多尺度特征空间信息利用不足的问题,提出一种利用金字塔空间注意力与特征推理的图像修复模型.首先,采用基于部分卷积的区域识别模块,用于识别本次循环中需要推理的区域,其次,通过循环特征推理模块高效地推理待推理区域的图像特征,最后,使用基于残差去冗余特征的特征融合模块以保证在融合中间特征图的过程中减少无效特征信息对图像修复的干扰.在人脸、街景等数据集上端对端地对所提模型进行实验的结果表明,与经典方法相比,该模型在峰值信噪比、结构相似度和平均L1损失评估指标方面分别提升了3%,1%和3%.
  • 高斯混合模型与GhostNet结合的YOLO-G遗留物检测方法
    林德钰, 周卓彤, 过斌, 闵卫东, 韩清
    遗留物检测作为视频监控的关键支撑技术之一,具有广泛的应用前景.针对现有方法存在无法较好地解决光影变化问题、深度学习遗留物检测方法中神经网络的参数量较多及准确度低等问题,提出基于YOLO-G的遗留物检测方法.首先结合高斯混合模型背景建模进行前景检测,根据移动区域与静止区域的分离距离与时间得到可疑静止区域,将判定为分离时刻的帧图像传入深层神经网络进行检测与识别;然后在网络模型中将幽灵网络中的幽灵模块应用于CSPDarknet53主干网络;最后引入压缩激励网络进一步提高特征提取能力.实验结果表明,所提方法的检测准确率比FCOS,SSD,RefineNet,YOLOv3,LRF和YOLOv4分别提高了34.22%,23.86%,16.64%,13.19%,8.16%和1.41%,网络参数量比YOLOv4减少了22.78%.
  • 基于面部运动单元和时序注意力的视频表情识别方法
    胡敏, 胡鹏远, 葛鹏, 王晓华, 章魁, 任福继
    针对视频序列中表情强度不一致,长短时记忆网络(LSTM)难以有效地提取其特征的问题,提出一种基于面部运动单元和时序注意力的视频表情识别方法.首先在卷积LSTM (ConvLSTM)的基础上引入时序注意力模块,对视频序列进行时序建模,在降低维度的同时保留丰富人脸图像特征信息;其次提出基于面部动作单元的人脸图像分割规则,解决面部表情活跃区域难以界定的问题;最后在模型中嵌入标签修正模块,解决自然条件下数据集中样本不确定性的问题.在MMI,Oulu-CASIA和AFEW数据集上的实验结果表明,所提方法的模型参数量低于已公开的主流模型,且在MMI数据集上的平均识别准确率达到87.22%,高于目前主流方法,在整体效果上优于目前具有代表性的方法.
  • 基于高分辨率网络的自监督单目深度估计方法
    蒲正东, 陈姝, 邹北骥, 蒲保兴
    使用深度学习方法进行单目深度估计时,由于使用多级下采样会出现重建结果细节信息缺失、边缘轮廓模糊等问题.为此,提出一种基于高分辨率网络的自监督单目深度估计方法.首先,通过并行连接使得特征图在编码过程中始终保持高分辨率表示,以充分地保留细节信息;其次,为了提高编码器的学习能力,在编码部分引入注意力模块,对图像特征进行筛选和提炼;最后,针对深度估计的多义性问题,利用非相邻帧图像之间的一致性,设计了一种有效的损失函数,并使用可靠性掩膜来消除动点和遮挡点的干扰.在TensorFlow框架下采用KITTI和Cityscapes数据集进行实验,实验结果表明,与已有深度估计方法相比,该方法不仅能够保留预测深度的边缘信息,而且能够提高预测深度的准确性,可达到0.119的平均相对误差.
  • 面向三维点云的端到端细粒度分类网络
    白静, 邵会会, 姬卉, 武如嵩
    针对基于深度学习的三维点云分类方法在元类识别中对子类解译不足的问题,提出一种面向点云的三维模型细分类框架,构建具备层间语义相关和层内上下文感知的端到端细粒度点云网络——FGP-Net.首先以相互连接的卷积算子构建密集连接块,层内利用球邻域查询构造局部区域以完成局部到整体的特征映射,并通过偏置注意力机制关注上下文差异,从而更好地捕捉细粒度属性;然后在层间利用多层特征融合策略探索各层特征间的相关性,通过反向传播学习相关语义信息以提升模型分类性能.在FG3D的3个子数据集Airplane,Chair和Car上的实验结果表明,FGP-Net的总体准确率分别达到95.77%,80.88%和77.94%;与先进的三维点云分类模型PointNet++,PointCNN,Point2Sequence,DGCNN等相比,FGP-Net的分类性能均具有一定的优越性.
  • 信息见解引导的可视化推荐
    陈滨, 张钰涵, 胡瑞珍
    对高维数据的探索和分析需要在数据中提取有价值的信息见解并生成合适的可视化图表.为降低生成有效图表的门槛,以信息见解为中心自动生成可视化图表,提出一个可视化推荐框架,包含数据片段推荐和视觉编码推荐2部分.在数据片段推荐中,相比现有方法使用单一指标,所提框架结合多种分析方法和机器学习算法进行信息见解的挖掘和数据片段的排序,为用户推荐信息见解丰富的数据片段;在视觉编码推荐中,该框架结合规则和机器学习方法,基于信息见解的特征建立视觉编码映射,并对图表中的关键信息进行高亮以增强用户的理解.在图表类型预测任务中,使用用户绘制的真实可视化图表数据进行实验的结果表明,所提框架比现有方法具有更高的预测准确率;用户调查的结果则证明,该框架能帮助用户更好、更快地了解一个陌生的数据表格中蕴含的关键信息.
  • 动能模型引导的动态虚拟人控制
    毛涵杨, 李晨, 郭谚霖, 王长波
    基于物理的虚拟人控制是一个经典的动力学问题,对游戏开发、影视特效等领域具有重要意义.针对传统的动力学控制器模型构建复杂、缺乏稳定性等问题,提出一个基于动能模型的动态虚拟人控制框架.首先,在黎曼几何空间中对运动捕捉数据进行预处理,构造动能热力分布图;其次,对热力图进行分析,获得控制参数;最后,将得到的参数用于控制器中,计算辅助力矩,使虚拟人保持平衡并提高姿态精度,控制虚拟人进行各种动作.为此,提出一种时间对齐算法,用于融合多个时间片段.通过对复杂地形、运动状态切换和外力作用下的全身双足运动进行测试,获取多种速度、方向的行走数据与跑步数据并进行评估.结果表明,与DeepLoco相比,该框架在外力作用下质心速度变化的波动系数更小,并且能承受更大的干扰力,证明该框架具有鲁棒性.同时,该框架的仿真性能相较DeepLoco提升了2倍,具有高效性.
  • 面向3D打印的自支撑连通性填充结构设计
    徐文鹏, 张鹏, 刘懿, 于梦霖, 王东晓, 侯守明, 王伟明
    针对大多数3D打印轻质化填充结构因不能够自支撑而导致模型无法打印成型,额外添加支撑结构又会造成模型内部残留打印材料无法排出的问题,提出一种面向3D打印的自支撑连通性填充结构设计方法.首先,基于每层打印切片构建填充结构;其次,通过调整参数来控制不同层正三角形连续地周期性变化,实现填充结构的自支撑性和连通性;最后,根据每层的几何信息生成可以直接用于打印的G-code文件.通过进行打印实物、打孔灌水和力学测试实验,实验结果表明,该方法可以打印具有不同自支撑角度且包含2个连通区域的填充结构,与5种典型填充结构相比,该填充结构力学性能良好.
计算机辅助设计与图形学学报封面

中文名称:计算机辅助设计与图形学学报

杂志社官网:https://www.jcad.cn/

英文名称:Journal of Computer-Aided Design & Computer Graphics

语言:中文

类别:自动化技术、计算机技术

主 编:胡事民

创刊时间:1989

出版周期:月刊

国内刊号:11-2925/TP

国际刊号:1003-9775

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区中关村科学院南路6号
  • 电话:010-62562491
  • E-mail:jcad@ict.ac.cn