计算机辅助设计与图形学学报杂志

计算机辅助设计与图形学学报杂志2025年第3期

  • 基于生成式人工智能的图像视频生成方法综述及展望
    张璐瑶, 杨帅, 汪文靖, 高翔, 刘家瑛
    视觉生成在艺术、娱乐等创意领域, 以及医学影像和数字出版等关键领域起到越来越重要的作用, 生成式人工智能在视觉生成方面的发展有望彻底改变人们与视觉数据的交互方式. 文中首先介绍深度学习时代下经典的生成模型框架, 根据视觉生成输入条件的不同, 重点梳理了近年来几类重要的图像生成模型和方法, 包括无条件图像生成、类别生成图像、文字生成图像和图像转换方法, 并介绍了它们在图像编辑方面的应用;然后根据训练数据要求的不同, 详细总结近年来以扩散模型为代表的视频生成和编辑模型及相应的优缺点;再介绍目前经典的图像生成和视频生成数据集和常用的评价标准;最后总结现阶段视觉生成面临的数据获取、推理效率、长视频生成、视频可控生成、安全等方面的挑战, 展望未来的研究方向.
  • 球谐函数局部特征投影的三维人脸生成方法
    赵世杰, 梁瑾裕, 杜晓飞, 高宏娟
    针对三维人脸生成任务中不能精确地控制局部属性生成的问题, 提出球谐函数局部特征投影的三维人脸生成方法. 首先将三维人脸划分为多个属性, 每个属性对应多个潜变量;然后将每个属性映射到单位球面, 使用球谐函数对球面上的形状属性进行特征投影;最后定义一种特征投影损失, 并将其分别应用于3D-VAE的编码器和解码器, 通过度量投影特征和潜变量的差异, 学习具有高解耦性、高可解释性的局部特征潜在表示. 在UHM数据集上与几种主流方法进行对比实验, 结果表明, 所提方法的局部特征解耦效果是最优的;该方法的训练时间最少, 与SD-VAE和SD-VQVAE方法相比, 分别减少约37%和54%.
  • FG-ECVG:细粒度情感可控的视频生成算法
    卫青蓝, 段笑妍, 肖红江, 薛瑞琪, 王宇豪
    情感引导的多媒体内容生成是推动可控人工智能内容生成技术发展的重要一环, 对于丰富公众表达情绪和观点的方式具有独特价值. 针对大模型生成的视觉内容情感属性模糊、交互性弱的问题, 提出一种基于文本指令优化的视频生成算法FG-ECVG, 可以实现自动化生成高情感可控、强交互性的文本指令到视频内容. 首先基于效价-唤醒-控制情感模型构建一个引导词典, 并基于该词典对输入文本进行情感极性分析和情感引导词匹配, 实现整体视觉氛围的情感控制;然后基于检索—增强—生成算法构建一个视觉细节扩写框架, 为用户输入的文本指令添加结构化的类人情感视觉元素, 提升生成内容的情感颗粒度. 在EmoSet数据集上5类场景类别进行情感6分类内容生成, 并对主观及客观微视频评价进行实验的结果表明, 与仅使用生成式视觉大模型相比, 所提算法生成的视频内容具有更强的情感表现力, 情感2分类和情感6分类准确率分别提升23.33个百分点和20.00个百分点;与目前较新的视觉情感迁移或生成算法相比, 情感6分类准确率平均提升26.67个百分点, 证明了该算法的有效性和优越性.
  • 基于特征增强和模态交互的视频异常行为检测
    吴沛宸, 李文斌, 郭放, 刘钊
    对比语言-图像预训练模型作为一种基于多模态对比训练的神经网络, 通过预训练大量的语言-图像对提取具有判别性的图像特征. 为了关注连续帧之间的时序关系, 消除不同模态特征之间的信息分布差异, 提出一种基于特征增强和模态交互的视频异常行为检测算法. 首先针对对比语言-图像预训练模型在视频连续帧特征提取阶段时间依赖性差的问题, 使用局部和全局时间适配器构建时间相关性增强模块, 分别在局部和全局注意力层关注时序信息;然后针对不同模态特征存在域间信息差异的问题, 设计一种基于窗口分区移位的多模态特征交互模块, 通过滑动窗口控制特征内部交互, 消除信息分布差异;最后通过对齐视觉特征和文本特征, 得到帧级异常置信度. 在UCF-Crime数据集上, 所提算法取得87.20%的检测准确率, 验证了其有效性.
  • 基于语义分离和特征融合的人脸编辑方法
    夏垚铮, 郝蕾, 郑宛露, 潘成伟, 王少荣
    人脸图像编辑模型中的语义属性之间有较强的关联性, 编辑其中一种语义可能导致其他语义属性以及非编辑区域的内容改动. 为了提升用户的编辑体验, 实现对人脸图像细节更为精确的编辑, 提出一种在图像域上语义分离和特征融合(ISFL)的人脸图像编辑模型. 首先使用图像掩模将人脸图像的各个语义分离, 并将人脸语义组织成一个层次化的树状结构;然后通过ISFL实现对图像语义的局部分离和全局融合, 用户可通过掩模单独编辑图像中不同语义的结构和外观;最后使用基于编码器和基于优化2种方式优化生成图像的细节部分. 在CelebAMask-HQ数据集上的实验结果表明, 所提出的图像编辑方法可以得到更加真实、细节更加丰富的图像.
  • 基于L1中轴提取和柔性约束的三维点云场景路网提取
    马雪奇, 黄鹏頔, 黄惠
    针对大规模点云场景立体路网结构提取困难的问题, 通过对全局场景连通域进行拓扑分析, 提出了一种基于L1中轴提取和柔性约束的三维点云场景路网提取方法. 首先采用L1骨架提取算法提取初始的三维骨架;接着采用对称性方法构建质心距离场, 并对地面点云进行腐蚀, 以约束道路的中轴区域;然后对初始路网骨架的断尾点进行判断, 并对路网进行补全;最后通过柔性投影获得三维道路点云的最佳中轴位置. 在大规模场景数据集Campus3D, UrbanScene3D, UrbanBIS上的实验结果表明, 所提方法完整度在0.4 m范围内可达到95. 99%, 误差在前88%数据上小于0.2 m. 相比于二维路网提取方法MTH, 可以有效获取路网的三维结构.
  • 基于变分自编码器的流形学习降维方法
    冯琳琳, 王长鹏, 吴田军, 张讲社
    针对科学数据集的规模和复杂性的迅速增长, 现有的降维方法存在“拥挤问题”以及不能嵌入新样本的问题, 提出了一种变分自编码器均匀流形近似与投影的数据降维方法. 首先, 为减小高维数据之间的耦合性, 利用变分自编码器将数据压缩为潜在变量;然后, 运用均匀流形近似与投影进一步将潜在变量降维, 使低维嵌入更好地保持原始数据之间的相似性关系;最后, 将所提方法用训练集进行拟合, 并嵌入一个样本外测试集来评估对新数据的泛化能力. 实验结果表明, 在MNIST和Fashion-MNIST数据集上, 与UMAP, DensMAP, VAE和AE这4个优秀降维方法相比, 所提方法的可信度得分分别达到0. 994 4和0. 993 9, 超越了当前最好方法UMAP 0.031 6和0.014 1, 同时在可视化、Kendall秩相关系数以及分类精度评价指标上也有显著的改进.
  • 集多头点注意力与边卷积的点云分类分割模型
    熊伟, 娄政浩, 徐敏夫, 袁和金
    针对动态图卷积模型只在局部尺度上独立提取点特征, 未将局部点互相关联的问题, 提出了一种集多头点注意力与边卷积的点云分类和分割模型. 首先, 设计单头点注意力模块分别计算点云的注意力特征与邻域注意力特征, 学习点云的旋转不变性, 使用多头机制将单头点注意力模块进行聚合, 构建多头点注意力模块, 赋予邻域内不同点相应的注意力系数;其次, 设计加权金字塔池化模块进行特征融合, 获得更加丰富的特征信息;最后, 提出结合交叉熵损失和焦点损失的联合损失函数, 解决数据集中存在的难分类样本和类别不平衡问题. 在ModelNet40数据集和ShapeNet数据集上分别进行了点云分类与分割实验, 在ModelNet40数据集上, 所提模型的总体精度提升到了94.1%;在ShapeNet数据集上的平均交并比提升到了86.3%, 有效地提升了模型的分类和分割性能.
  • 用于激光雷达目标检测的单阶段无锚框优化网络
    朱望江, 郭建伟, 张吉光, 孟维亮, 张晓鹏
    激光雷达目标检测近年来开始借鉴图像目标检测的网络设计, 但依然存在计算低效无法满足实时应用以及网络结构简单导致性能不足的问题. 为此, 提出的网络采用了单阶段无锚框的简洁设计;优化了激光点云体素化表达, 在提升计算效率的同时保留了一部分点云高程特征;基于残差网络的思想, 设计了更深的主干网络结构用于提取深度特征;引入特征金字塔来提升小目标的检测效果. 在公开数据集KITTI上, 所提网络的mAP指标在各类别目标的检测中均取得了领先的性能(提高了1%~3%). 在自动驾驶计算平台上的运行时间测试表明, 所提网络能够达到43 ms/帧的处理速度, 满足实时性需求.
  • 基于注意力机制的高分辨率自动实时绿幕抠像方法
    靳悦, 李兆歆, 朱登明, 王振强, 陈溟, 王兆其
    随着相机等硬件设备的更新换代以及观众审美水平的提升, 高分辨率下的绿幕抠像技术变得十分重要. 为实现高分辨率图像下精确且高效的绿幕抠像, 提出一种基于注意力机制的高分辨率自动实时绿幕抠像方法. 所提方法分为2个阶段, 第1阶段仅以RGB绿幕图像作为输入, 采用注意力机制来准确提取前景目标对象, 无须人工参与或生成近似背景图等预处理操作, 实现了绿幕抠像的自动化;第2阶段增加深度引导滤波模块进行高分辨率处理, 实现了高分辨率下实时处理. 在绿幕数据集上的实验结果表明, 所提方法在保证较好绿幕抠像精度的前提下, 达到2K分辨率视频下约80.20帧/s的处理速度.
  • 基于自监督学习的医学影像异常检测
    王楠, 林绍辉, 齐福霖, 陈玉珑, 李珂, 沈云航, 马利庄
    自监督学习(SSL)可以很好地捕捉关于不同概念的通用知识, 有利于各种下游任务. 针对自监督学习方法没有充分利用医学图像的多模态特征等问题, 提出一种考虑医学图像多模态互补信息的自监督学习方法——SLeM. 该方法首先将单个模态的图像均匀地划分为4个块, 使用这些块随机组合构建多模态图像, 不同的多模态图像被分配不同的标签, 使得多模态特征可以通过分类任务来学习;为了提取不同大小肿瘤的特征, 在学习到的多模态特征后加入上下文融合块;通过简单的微调将学到的特征转移到下游的多模态医学图像分割任务中. 在公开数据集BraTS2019和CHAOS上与JiGen, Taleb以及Supervoxel等具有代表性的多模态方法对比及消融实验结果表明, 所提方法在整个肿瘤区域的分割准确度提升了2.03个百分点, 在肿瘤核心区域的分割准确度提升了3. 92个百分点, 在肿瘤增强区域的分割准确度提升了1.75个百分点, 并在视觉方面有较好的效果, 明显优于其他方法.
  • 基于BoT-YOLOX的毫米波图像目标检测
    李刚, 叶学义, 蒋甜甜, 李文杰, 应娜
    主动毫米波(active millimeter wave, AMMW)图像具有噪声多、易含伪影、小目标多等特点, 一直是隐匿目标检测的挑战. 为此, 提出了一种基于BoT-YOLOX的毫米波图像目标检测方法. 首先, 在模型主干网络中引入瓶颈型Transformer (bottleneck Transformer, BoT), 加强模型的特征提取能力;然后, 调整多尺度目标检测层, 并集成全局注意力机制来提高对小目标的检测能力;最后, 提出一种多视角加权框融合的后处理方法, 用于集成不同视角检测结果, 以提高模型的鲁棒性. 在自行采集的包括54 000幅图像的AMMW数据集上, 与基准模型(YOLOX)相比, 该模型达到了93.22%的检出率和4.46%的误检率, AP提升了6.74个百分点;在公开AMMW数据集上, 与主流方法相比, mAP提升了4.07个百分点. 实验结果表明, 所提方法对AMMW图像场景的目标, 小目标检测准确度更加出色.
  • 跨层Transformer与多尺度自适应融合的视网膜血管分割算法
    梁礼明, 阳渊, 何安军, 董信, 吴健
    针对现有视网膜血管分割存在视盘误分割、主血管纹理模糊和微细分支血管断裂等问题, 提出融合跨层Transformer (CLTransformer)与跨尺度注意的视网膜血管分割算法. 首先设计轻量化残差编解码模块用于编码和解码器部分, 实现血管纹理特征的粗粒度提取;其次在编解码连接处采用多尺度特征选择模块, 用于跨级融合粗粒度特征;再次在网络底部加入CLTransformer模块, 对深层语义信息交叉融合, 以细化视网膜血管特征轮廓;最后使用融合损失函数监督算法的训练和测试. 在DRIVE, STARE和CHASE_DB1数据集上进行实验, 其准确度分别为97.10%, 97.66%和97.62%, 特异性分别为98.64%, 99.03%和98.72%, F1分数分别为83.05%, 84.07%和81.18%.
  • 基于非局部信息和子空间的模糊C有序均值聚类的图像分割算法
    陈阳, 黄成泉, 覃小素, 彭家磊, 雷欢, 周丽华
    针对模糊C有序均值聚类算法没有考虑图像空间信息, 导致难以有效地分割含噪图像的问题, 提出一种基于非局部信息和子空间的模糊C有序均值聚类(non-local information and subspace for fuzzy C-ordered means, SFCOM-NLS)算法. 首先, 利用图像中给定的相似邻域结构的像素提取当前像素的非局部空间信息;其次, 计算每个像素的典型性, 并对其进行排序, 在每次迭代中更新像素的典型性, 提高像素聚类的准确性, 解决在聚类过程中存在相似类导致的误分类问题;最后, 引入子空间聚类概念, 为图像不同维度分配适当的权重, 提高彩色图像的分割性能. 在含噪合成图像和公开数据集BSDS500, MSRA100和AID上实验结果表明, 所提算法的模糊划分系数、模糊划分熵、分割精度和标准化互信息平均值分别达到了95.00%, 6.66%, 98.77%和95.54%, 均优于对比的同类算法.
  • 典型概念驱动的模态缺失深度跨模态检索
    夏鑫雨, 朱磊, 聂秀山, 董国华, 张化祥
    跨模态检索使用一种模态的数据作为查询条件, 在另一种模态中检索语义相关的数据. 绝大多数的跨模态检索方法仅适用于模态完备条件下的跨模态检索场景, 它们对缺失模态数据的处理能力仍有待提升, 为此, 提出一种典型概念驱动的模态缺失深度跨模态检索模型. 首先提出一个融合多模态预训练网络的多模态Transformer模型, 能在模态缺失的情况下充分地进行多模态细粒度语义交互, 提取多模态融合语义并构造跨模态子空间, 同时引导学习生成多模态典型概念;然后使用典型概念作为跨注意力的键和值来驱动模态映射网络的训练, 使模态映射网络可以自适应地感知查询模态数据中隐含的多模态语义概念, 生成跨模态检索特征, 充分地保留训练提取的多模态融合语义. 在Wikipedia, Pascal-Sentence, NUS-WIDE和XmediaNet这4个基准跨模态检索数据集上的实验结果表明, 所提模型比文中对比模型的平均准确率均值分别提高了1.7%, 5.1%, 1.6%和5.4%. 该模型的源代码可在https://gitee.com/MrSummer123/CPCMR网站获得.
  • 融合引导滤波的无监督图像超像素快速生成
    张永霞, 孙银隆, 郭强, 范琳伟, 张彩明
    超像素生成的速度与准确性是评估方法性能的关键指标. 针对有监督图像超像素分割方法性能通常依赖大量监督数据的问题, 提出一种无监督、保持准确性的图像超像素快速生成方法. 首先利用引导滤波设计下采样-联合上采样的超像素快速生成框架, 以提高模型的推理速度;然后采用空洞空间卷积池化金字塔和多尺度注意力机制, 充分挖掘图像信息, 并设计鲁棒的损失函数, 提高超像素生成的准确性, 实现无监督的图像超像素生成方法;最后采用顺序训练策略减少模型对大量训练数据的依赖. 在公开数据集BSDS500与DRIVE上的实验结果表明, 所提方法的边界召回率和可达分割准确性指标较文中对比的无监督方法分别提高约1%和2%, 且速度提高约50%, 并拥有与有监督方法可比的表现.
计算机辅助设计与图形学学报封面

中文名称:计算机辅助设计与图形学学报

杂志社官网:https://www.jcad.cn/

英文名称:Journal of Computer-Aided Design & Computer Graphics

语言:中文

类别:自动化技术、计算机技术

主 编:胡事民

创刊时间:1989

出版周期:月刊

国内刊号:11-2925/TP

国际刊号:1003-9775

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区中关村科学院南路6号
  • 电话:010-62562491
  • E-mail:jcad@ict.ac.cn