计算机辅助设计与图形学学报杂志

计算机辅助设计与图形学学报杂志2024年第11期

  • RGB-D目标跟踪综述
    欧洲, 应舸, 张大伟, 郑忠龙
    近年来, 随着深度学习的不断发展, 已有许多基于深度学习的RGB目标跟踪算法被提出且取得较为显著的性能提升, 但纯粹依靠可见光进行跟踪的算法在光照变化、背景干扰、严重遮挡等复杂场景下仍难以实现鲁棒跟踪. 为应对高难度场景下的挑战, 实现高效鲁棒的目标跟踪, 多模态目标跟踪应运而生. 以RGB-D目标跟踪算法为主, 详细列举了当前可见光-深度的多模态目标跟踪算法, 对各类算法的优缺点进行分析和比较; 并介绍了主流的RGB-D目标跟踪数据集, 挑战赛及其评价指标; 最后总结了RGB-D目标跟踪技术的发展趋势和挑战, 并展望其未来的发展方向:特殊场景RGB-D数据集建设、全新RGB-D目标跟踪评估范式和有效模态融合的RGB-D模型范式.
  • 结合双线性特征融合与自适应重检测的目标跟踪方法
    闫河, 张唯, 刘宇涵, 黄奎霖, 李尧
    针对SiamRPN目标跟踪方法用一阶浅层网络提取特征, 难以精确地获得丰富的特征信息; 缺少遮挡判别机制, 易导致目标漂移或跟丢的问题, 提出一种双线性特征融合与自适应重检测相结合的孪生网络目标跟踪方法. 使用改进的ResNet50提取序列特征, 对最后3个残差块提取的特征进行双线性级联融合, 获得二阶特征信息, 并通过区域候选网络输出目标框; 计算目标框对应的平均峰值相关能量, 判断目标是否被遮挡; 针对遮挡, 构建以上一帧跟踪结果为中心的邻近检测窗口, 结合权重顺序选择与随机选择的方式选取窗口, 对目标重检测. 对比OTB100和UAV123数据集上的实验结果表明, 所提方法跟踪成功率分别达到0.894和0.800, 跟踪精确度分别达到0.669和0.605, 同时具有较好的跟踪时效性.
  • 非对称的分层特征融合的RGBT跟踪网络
    吴习惠, 李婷, 葛洪伟
    为了解决可见光图像和热红外图像由于成像原理不同而导致的模态存在异质性的问题, 提出一种非对称的分层特征融合的RGBT跟踪网络. 首先通过双流网络分别提取可见光和热红外的特征; 然后通过模态特征提取模块挖掘不同模态特征, 并对获得的特征进行自适应聚合, 以获得有利于增强可见光模态的特征; 最后将各层获得的聚合特征与双流网络获得的可见光特征进行增强融合, 获得更具有鲁棒性的特征. 在GTOT, RGBT234和LasHeR数据集上的实验结果表明, 所提网络的跟踪精度(PR)和成功率(SR)分别达到92.2%/77.2%, 82.9%/61.1%和52. 7%/40.3%, 与目前主流的RGBT目标跟踪网络相比, PR和SR均有所提高, 验证了该网络的有效性.
  • 多辅助任务下的单幅深度图像修复
    范志伟, 李滔, 罗松宁, 周群兵, 林宏伟
    深度图像修复是由稀疏深度图像恢复出密集深度图像. 针对目前单幅深度图像修复算法存在边界模糊、语义信息缺失等问题, 提出一种多辅助任务下的单幅深度图像修复算法. 采用由粗到精的修复模式, 粗修复网络采用核选择卷积有效地提取输入信息, 精修复网络由深度图像修复主任务和相关辅助任务构成; 灰度重建辅助任务旨在从灰度图像中学习到丰富的语义信息, 并由特征融合分支将所学语义信息传递到深度图像修复主任务, 有效地解决深度图像修复中细节缺失、结构混乱等问题; 边界预测辅助任务侧重于提高密集深度图像的边界准确性和清晰度; 深度图像修复主分支和灰度重建辅助分支间的特征融合分支中, 使用空间和通道注意力机制实现多任务特征的自适应融合, 增强相关特征和抑制无关特征. 在NYUv2数据集上的实验结果表明, 所提算法的修复视觉效果良好, 在采样点数量为200时, 客观评价指标RMSE和REL分别取得0.199和0.033的结果, 均优于对比算法.
  • 使用频域卷积的端到端图像数字盲水印方法
    张志伟, 王晗, 崔凯元
    传统数字水印方法对裁剪、噪声、形变等攻击具有强鲁棒性, 但很难抵御真实场景中由图像压缩编码和移动摄像设备翻拍引起的水印信息丢失. 为了增强水印的鲁棒性, 利用离散余弦变换频谱中某些频段对人眼的掩蔽特性, 以及卷积神经网络对一些不可见扰动的学习能力, 提出一种基于频域卷积的端到端图像数字盲水印方法. 首先使用卷积神经网络构建编码网络, 将水印信息嵌入到图像频域中; 其次构建与编码网络对称的解码网络, 从图像频域中提取水印信息; 最后对编码和解码网络进行联合训练, 并监督编码网络的图像质量和解码网络的水印提取效果. 在MIRFLICKR数据集上的实验结果表明, 所提方法对显示器下翻拍攻击的PSNR, SSIM, LPIPS和BPP分别达到36.29 dB, 0.951, 3.11× 10-3, 2.44× 10-3和93.1%, 与其他基准方法相比具有一定的优势, 证明了该方法的有效性.
  • 基于重加权数据项的边缘保持图像平滑算法
    龙建武, 王雪梅, 张臣
    为了避免弱梯度边缘信息被平滑、噪声纹理信息因具有与结构像素相似的强梯度特点而被保留的问题, 提出一种基于重加权数据项的边缘保持图像平滑算法. 该算法将数据项拆分为2项, 首先通过计算图像中当前像素与局部邻域像素间的相似性初步判断待处理像素是否位于结构区域; 然后用分项后的2个权重分别约束待处理像素与原图相似, 以及待处理像素与滤波结果相似, 实现结构信息的保留和非结构信息的平滑. 在基于L2, L0和L1的平滑算法实例中与其他算法进行实验, 并使用PSNR和SSIM评价指标在BSD300数据集上对各种算法进行评估, 结果表明, 所提算法不仅能保持弱梯度结构信息, 还能产生优于原始算法的图像平滑效果; 该算法有较强的实用性, 能适用于大部分全局优化算法.
  • 基于Transformer的东巴画超分辨率重建
    毕聪, 钱文华, 普园媛
    纳西族东巴画线条繁杂、色彩丰富, 直接采用现有的方法对真实场景下的低分辨率东巴画图像进行超分辨率重建, 存在线条不够清晰、局部区域过度平滑、缺少细节等问题. 为了解决上述问题, 提出一种基于Transformer的东巴画超分辨率重建方法. 首先, 生成器采用卷积层和残差密集Swin Transformer块提取东巴画图像的浅层和深层特征, 并通过重建模块融合特征, 重建出高分辨率图像; 其次, 判别器采用U-Net评估每个像素的真实性, 增强重建图像的纹理细节; 最后, 采用像素损失、感知损失和对抗损失训练生成器生成自然清晰的东巴画图像. 在自建的东巴画测试集上与其他8种方法进行对比, 结果表明, 所提方法的重建结果具有更好的视觉质量; 在放大2倍、4倍和8倍时, 平均PIQE分别为22.749 3, 20.264 9和18.378 0, 平均ENIQA分别为0.091 7, 0.063 9和0.068 4, 均优于其他方法; 所提方法具有良好的扩展性, 在自然图像上进行实验也能获得更清晰的结果.
  • 多级多尺神经网络自搜索的焊缝缺陷语义分割
    张睿, 李吉
    为进一步提高焊缝缺陷X-ray底片低质影像语义分割精度, 降低人工设计网络主观影响及耗时等问题, 提出一种多级多尺神经网络自搜索的焊缝缺陷语义分割方法. 通过对多尺度轻量化候选操作、通道注意力机制和多层级动态神经网络架构的设计, 从不同维度提升网络对低质影像缺陷特征提取的表达能力; 同时对网络训练早期与最终识别性能之间的潜在关联探索, 提出使用固定采样逐步确定最优候选操作的渐进式快速神经架构搜索方法. 在架构搜索阶段使用自行采集、标注的483幅X-ray焊缝缺陷图像, 经过随机裁剪、旋转、平移等数据增强操作进行架构寻优, 最终以较低的搜索成本自动构建出焊缝缺陷语义分割网络. 实验表明, 所提方法对X-ray焊缝缺陷进行语义分割最终mIoU指数达到了49.23%, 高于人工设计网络的45.41%和直接使用模型迁移的28.86%, 网络自搜索速度和分割效果提升明显.
  • 面向单幅图像的高质量深度估计方法
    包永堂, 燕帅, 齐越
    单幅图像的深度估计是机器人导航、场景理解中的一项关键任务, 也是计算机视觉领域的一个复杂问题. 针对单幅图像深度估计不准确的问题, 提出一种基于Vision Transformer (ViT)的单幅图像深度估计方法. 首先用预训练的DenseNet对图像进行下采样, 将特征编码成适用于ViT的特征序列; 然后通过稠密连接的ViT处理全局上下文信息, 并将特征序列重新组装成高维度特征图; 最后将RefineNet进行上采样, 得到完整的深度图像. 在NYU V2数据集上与一些代表性的深度估计方法进行对比实验, 并对网络结构进行消融实验, 同时对平均相对误差、均方根误差等误差进行量化分析, 结果表明, 所提方法面向单幅图像可以生成具有丰富细节的高质量深度图像; 与传统的编码器解码器方法相比, 该方法的PSNR值平均提高1.052 dB, 平均相对误差下降7.7%~21.8%, 均方根误差下降5.6%~16.9%.
  • 从单幅图像估计景深的模型到底学到了什么
    胡立华, 朵安鹏, 杨海峰, 张继福, 胡占义
    目前, 基于深度学习的单幅图像景深估计取得了显著的进展, 在一些公开的室内外数据集上均取得了非常高的估计精度. 然而, 不论是基于监督学习还是基于自监督学习的景深估计模型, 这些模型到底学习到了图像的什么性质, 使得其能够对景深进行很好的估计呢?为此, 从2个侧面对这个问题进行了量化的测试和分析. 对于“无纹理”区域, 通过模型对这些区域与该区域邻域估计的景深之间的关系, 探究了这些区域的估计景深是不是其邻域估计景深的某种“填充”效应; 其次分析了模型对高视觉显著性区域估计的景深是否具有更高的估计精度. 测试结果显示, 无纹理区域与其邻域的估计景深分布确实存在比较高的相似性, 但当前景深估计模型的估计精度和图像视觉显著性的关联性不是很强. 所得结果对“景深估计模型解析”“景深估计模型改进”等相关工作均具有一定的参考价值, 例如, 今后在设计和训练景深估计模型的工作中, 有必要充分考虑输入图像的视觉显著性效应, 从而提高模型对高视觉显著性区域的景深估计精度, 以便更好地服务下游任务.
  • 联合滑动窗口和加权评分的多人比赛球员重识别算法
    覃海波, 雒江涛, 许国良
    针对多人比赛球员重识别特征提取时硬性水平划分造成图像特征不连续, 以及关节点识别错误引入噪声特征等问题, 提出一种联合滑动窗口和加权评分的球员重识别算法. 首先修改ResNet-50主干网络, 并利用空间关系感知注意力获取噪声更少的特征图; 然后采用滑动窗口划分策略, 使每一水平条带都包含其相邻区域的部分特征, 以保持图像特征的连续性; 再利用姿态信息提取局部关节点特征, 赋予有效特征更高权重并通过多层感知层进行评分, 以优化关节点分数; 最后采用联合损失函数策略约束网络的学习. 在Occluded-Duke, Market-1501和自建数据集上的实验结果表明, 在3个数据集上, 所提算法的Rank-1指标分别达到60.90%, 94.70%和80.35%.
  • 面向三维模型草图检索的三元层次度量网络
    杨瞻源, 白静, 李文静, 彭斌, 拖继文
    针对基于草图的三维模型检索仍然存在将草图视作普通图像忽略其特有的稀疏性, 以及对草图和三维模型的类内差异性重视不足, 从而影响检索性能的问题, 提出一种面向三维模型草图检索的三元层次度量网络. 首先引入笔画点序列分支构建三元组网络结构, 实现对草图数据的信息增强; 然后通过多层次联合损失对网络进行域内域间跨域的全面约束, 使得网络学习到同时体现数据的单域类内差异和域间关系的表示特征, 有效地提升网络的检索性能. 实验结果表明, 在2个公开数据集SHREC2013和SHREC2014上, 所提网络的平均检索精度均值分别为87.7%和83.3%, 比先进工作(相同基础网络)分别提升0.5个百分点和1. 5个百分点以上.
  • L0法向优化与特征修正的点云去噪
    容宇宙, 马龙, 周元峰
    针对点云去噪中噪声的去除与特征细节保留之间的权衡问题, 提出一种既能有效地去除噪声又能修复尖锐特征的方法. 首先结合法向一阶差和二阶差进行基于L0最小化的法向优化, 根据优化后的法向实施预去噪; 随后构造局部二面角标架, 实现尖锐特征区域点的提取; 最后根据尖锐特征附近区域的几何信息进行法向修正, 完成最终的去噪. 在上百个公开模型数据中, 对不同结构类型的表面及各级噪声强度进行去噪实验的结果表明, 与各种主流去噪方法相比, 所提方法在去除离群点的同时, 对原结构尖锐特征有着更高的还原程度.
  • 基于通道增益的可变比特率点云压缩
    江照意, 邹文钦, 宋超, 杨柏林
    针对现有基于深度学习的点云压缩方法需要训练多个网络, 耗费大量的时间和空间资源的缺陷, 提出一种基于通道增益的可变比特率点云压缩方法. 首先在网络的编码端利用层次化结构, 通过每个层级提取点云特征和应用偏移注意力机制, 有效地捕捉输入点云的关键特征信息; 然后引入增益单元评估和缩放各个隐向量通道的重要度, 消除向量通道间的信息冗余, 仅需训练单个网络即可实现可变比特率压缩; 为了预测特征向量的概率分布, 对特征向量进行超先验编码, 构造高斯熵模型, 通过熵编码进一步降低编码量; 最后在解码端采用子点卷积进行上采样重构原始点云, 避免顶点的局部聚集, 提高点云的重构质量. 实验结果表明, 在ShapeNet数据集上, 以率失真曲线的BD-rate作为性能评价指标, 与VRR和Draco方法相比, 平均比特率分别降低48. 66%和63. 56%; 压缩性能得到了显著的提升.
  • 基于B样条的细分曲面参数化
    王智巍, 陈仁杰
    四边形细分曲面参数化算法在游戏影视领域具有广泛应用, 但现有算法无法兼顾参数化速度和质量. 为此, 提出一种基于B样条的细分曲面参数化算法, 首先将细分曲面转化为分片B样条曲面, 然后通过最优化几何扭曲对样条曲面逐片进行参数化; 对于一些细分曲面分片较多的情况, 文中通过拼接相邻面片, 对合并曲面进行参数化. 不同于定义在分片线性空间上的网格类参数化算法, 文中以数量更少的控制网格为优化变量, 得到的定义在样条空间上的参数化映射在分片内部具有C2连续性. 与现有算法相比, 收敛速度更快, 参数化结果的扭曲更低, 采取的合并策略能有效地减少割缝数量, 提升参数化结果的质量.
  • 基于逐点修匀的Ball-IDW网格变形方法
    黄浩宇, 昌继海, 曹杰, 付营建, 关振群
    为了提高网格变形的效率, 提出一种基于逐点修匀的反距离加权函数(IDW)插值网格变形方法(简称Ball-IDW方法). 根据网格拓扑关系, 以每个内部节点为中心构造子网格系统, 将整体网格分解为多个局部子网格; 通过在中心节点到子网格的边界上添加辅助插值节点, 增强IDW方法的保形能力; 遍历所有内部节点, 利用逐点修匀的方式进行迭代, 直到满足收敛条件; 当网格变形幅度过大时, 通过递归二分法修正中心节点的位移防止单元交叉, 提高方法的鲁棒性. Ball-IDW方法的计算过程是显式的, 不需要求解任何线性方程, 因此具有较高的计算效率. 通用实例结果表明, 与径向基函数方法和IDW方法相比, Ball-IDW方法在质量更高的前提下, 计算效率分别提高20%~85%和10%~80%, 解决三维问题时的变形能力提高2倍.
  • 基于XPBD的微创冠脉旁路移植手术操作实时仿真
    李希轩, 豆振浩, 吴洪宇
    微创冠脉旁路移植术(MICS-CABG)是外科治疗严重冠心病的重要发展方向, 但其手术难度大、风险高, 初学者无法直接对实际病人进行手术技能训练. 基于虚拟现实技术的手术模拟训练能够有效地提高训练效果, 避免手术风险. 针对MICS-CABG的特点, 提出一种扩展的基于位置动力学(XPBD)框架的微创冠脉旁路移植手术操作实时仿真方法. 首先使用四面体外骨骼模型实现复杂心脏的物理形变, 利用圆柱几何体表示手术器械物理模型; 然后利用GPU并行加速XPBD仿真, 利用冠脉中轴线建立Cosserat弹性杆模型的拉伸、剪切、弯曲、扭转约束, 实现了冠脉的形变仿真; 最后基于手术器械与心脏物理模型的碰撞检测, 引入不嵌入约束与附着约束, 生成工具与软组织交互的反馈力. 实验结果表明, 所提方法中手术器械模型与软组织交互变形实时稳定, 在包含100 000个物理单元的场景中, 仿真速率可达到60帧/s, 力反馈仿真频率可达到1 kHz以上, 视觉效果良好, 有着较高的仿真效率.
  • 基于强化学习的机器人自主探索与物体感知算法
    吴关, 夏熙, 曹合智, 刘利刚
    针对如何在未知室内场景的探索中高效感知物体的问题, 提出一种机器人自主探索与物体感知算法. 利用深度强化学习让机器人通过与环境交互的方式学会利用场景的布局规律和语义信息获得更加高效、高质量的探索策略. 算法使用模块化的方式解决强化学习训练困难的问题, 分为同时定位与地图构建模块、全局探索模块、路径规划模块和局部探索模块. 首先同时定位与地图构建模块根据传感器所得数据构建地图; 然后全局探索模块根据当前地图决策长期目标点, 规划机器人将要探索的区域; 接着路径规划模块根据机器人当前位置和长期目标点规划行进路径; 最后局部探索模块基于机器人周围的局部地图信息规划每一步行进时传感器的朝向并更新地图. 在Habitat仿真环境中与SC和ANS这2种先进算法在Gibson和Matterport3D公开数据集上进行实验的结果表明, 所提算法在小、中、大和超大场景中的物体感知率分别为0.942, 0.866, 0.652和0.506, 表现出对场景良好的感知性能.
计算机辅助设计与图形学学报封面

中文名称:计算机辅助设计与图形学学报

杂志社官网:https://www.jcad.cn/

英文名称:Journal of Computer-Aided Design & Computer Graphics

语言:中文

类别:自动化技术、计算机技术

主 编:胡事民

创刊时间:1989

出版周期:月刊

国内刊号:11-2925/TP

国际刊号:1003-9775

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区中关村科学院南路6号
  • 电话:010-62562491
  • E-mail:jcad@ict.ac.cn