该杂志刊期列表
- 2026年
- 1期
国内刊号:11-2925/TP
国际刊号:1003-9775
发布日期:
作者:包永堂, 燕帅, 齐越
关键词:深度学习, 深度估计, vision Transformer, 注意力机制
单幅图像的深度估计是机器人导航、场景理解中的一项关键任务, 也是计算机视觉领域的一个复杂问题. 针对单幅图像深度估计不准确的问题, 提出一种基于Vision Transformer (ViT)的单幅图像深度估计方法. 首先用预训练的DenseNet对图像进行下采样, 将特征编码成适用于ViT的特征序列; 然后通过稠密连接的ViT处理全局上下文信息, 并将特征序列重新组装成高维度特征图; 最后将RefineNet进行上采样, 得到完整的深度图像. 在NYU V2数据集上与一些代表性的深度估计方法进行对比实验, 并对网络结构进行消融实验, 同时对平均相对误差、均方根误差等误差进行量化分析, 结果表明, 所提方法面向单幅图像可以生成具有丰富细节的高质量深度图像; 与传统的编码器解码器方法相比, 该方法的PSNR值平均提高1.052 dB, 平均相对误差下降7.7%~21.8%, 均方根误差下降5.6%~16.9%.
来源:2024年第11期
《计算机辅助设计与图形学学报》期刊编辑部