计算机辅助设计与图形学学报

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:11-2925/TP

国际刊号:1003-9775

计算机辅助设计与图形学学报杂志2024年第11期:面向单幅图像的高质量深度估计方法

发布日期:

作者:包永堂, 燕帅, 齐越

关键词:深度学习, 深度估计, vision Transformer, 注意力机制

单幅图像的深度估计是机器人导航、场景理解中的一项关键任务, 也是计算机视觉领域的一个复杂问题. 针对单幅图像深度估计不准确的问题, 提出一种基于Vision Transformer (ViT)的单幅图像深度估计方法. 首先用预训练的DenseNet对图像进行下采样, 将特征编码成适用于ViT的特征序列; 然后通过稠密连接的ViT处理全局上下文信息, 并将特征序列重新组装成高维度特征图; 最后将RefineNet进行上采样, 得到完整的深度图像. 在NYU V2数据集上与一些代表性的深度估计方法进行对比实验, 并对网络结构进行消融实验, 同时对平均相对误差、均方根误差等误差进行量化分析, 结果表明, 所提方法面向单幅图像可以生成具有丰富细节的高质量深度图像; 与传统的编码器解码器方法相比, 该方法的PSNR值平均提高1.052 dB, 平均相对误差下降7.7%~21.8%, 均方根误差下降5.6%~16.9%.

来源:2024年第11期

《计算机辅助设计与图形学学报》期刊编辑部

查看计算机辅助设计与图形学学报杂志2024年第11期

联系我们

  • 地址:北京市海淀区中关村科学院南路6号
  • 电话:010-62562491
  • E-mail:jcad@ict.ac.cn

咨询工作人员