计算机辅助设计与图形学学报杂志2023年第11期
-
- 基于可视分析的训练数据质量提升综述
- 杨维铠, 陈长建, 朱江宁, 李磊, 刘鹏, 刘世霞
- 在机器学习应用中,由于数据来源渠道多以及部分标注者水平不足,训练数据质量很难得到保证.通过深度结合机器学习和可视化技术,可视分析技术将人融入数据质量分析与提升回路中,帮助提升训练数据质量,从而提高模型性能.文中首先总结了训练数据质量问题的三大类型:标注错,覆盖窄,标注缺;然后基于这些问题类型,介绍分析了相关的可视分析工作,包括标注错误修正方法,数据集偏离纠正方法和无标注数据质量提升方法;最后深入分析了基于可视分析的训练数据质量提升面临的机遇与挑战,包括在复杂任务、大语言模型、多模态数据、流数据等场景下的数据质量提升.
-
- 影子辅助的三维人体重建
- 康杨雨轩, 石剑, 任丽欣, 刘艳丽, 吴恩华
- 光线投射至地面的人体影子可以为人体重建任务提供约束信息,有助于缓解单目图像中的深度歧义问题和自遮挡问题.为了重建三维人体模型,提出一种基于影子输入和深度神经网络的重建方法.首先搭建2个独立的卷积神经网络模块用于提取图像特征和影子特征,并估计对应的人体模型参数;然后建立一个可导投影算子(differentiable projection operator,DPO)对齐2个网络的输出;最后将DPO构建的损失函数应用于微调神经网络和直接优化输出.在Human3.6M合成影子数据集上的实验结果表明,与基线方法相比,微调神经网络的关节误差指标下降了1.4~4.9 mm;在自采集的一个含真实影子的3人2视角小规模数据集上的定性实验结果表明,直接优化的人体姿态更加接近原始图像.
-
- 基于视觉Transformer内在归纳优化的齐白石虾画真假鉴定
- 吴惠思, 陈文杰, 黄晓婷, 刘雪婷, 齐驸
- 当前书画艺术品市场赝品众多,给书画艺术品收藏者带来了极大的经济风险,并且严重扰乱书画艺术市场秩序.针对书画艺术品真假鉴别的数据集一般较小的特点,提出数据高效的齐白石虾画自动真假鉴别算法.以视觉Transformer为基础架构,改进视觉Transformer的标记位置编码方式;以跨架构表征知识蒸馏对模型进行训练,改善视觉Transformer的内在归纳特性,减少模型对训练数据的过度依赖,有效地解决齐白石虾画真假鉴别数据集较小的问题.分别在有429幅画的齐白石虾画真假鉴别数据集、有96 013幅画的WikiArt数据集和有42 479幅画的ArtDL数据集上进行实验的结果表明,所提算法能够有效地应对齐白石虾画真假鉴别任务中数据集小的挑战,并在该任务中的分类性能优于其他方法.
-
- 结合对比学习的三维点云主动标注方法
- 杨国庆, 赖文韬, 黄惠
- 针对当前基于深度学习的点云理解任务需要大量标注数据但数据标注极为消耗成本的现实问题,提出一种基于对比学习预训练的点云主动筛选点云标注方法.通过交替运行对比学习预训练特征提取与主动学习选择模块,在未标注数据中筛选最有代表性的样本进行标注,从而在有限的标注成本下获得最佳性能的点云理解模型.首先基于对比学习的自监督范式进行预训练;然后固定模型参数,利用该模型对未标注点云提取特征,通过设计基于不确定性和特征多样性的指标,从中选择代表性数据进行标注.在点云分类以及分割等任务中,验证了所提方法的有效性;在ModelNet40数据集上的实验结果表明,该方法可有效地提高模型在弱监督下的表现,与随机选择数据进行标注的方法相比,可以提高20%以上的准确率,在接近10%的数据标注下最终达到73%的准确率;在ShapeNet数据集上的实验结果证明,该方法对于分割任务也有较好的表现,在1 000组标注数据下取得了91%的精度,接近于监督训练水平.
-
- 结合MAML和Dirichlet过程的小样本点云分类
- 刘复昌, 李晨璇, 王延斌, 缪永伟
- 点云被广泛使用在各种三维应用场景中,但是实际应用中通常存在扫描、标注费时费力等局限性,因此基于小样本数据集的点云分类网络更加符合应用需求.为了有效地提高深度学习分类算法在小样本点云数据集上的分类效果,提出一种针对小样本数据集的点云分类方法.针对训练数据集不平衡问题,首先采用基于相似度依赖的Dirichlet中餐馆过程对数据集进行预处理,在无需人工指定聚类个数的前提下对样本进行重新聚类,以提升分类网络在小样本数据集上的性能;然后在重新聚类后的样本上使用模型无关(model agnostic meta learning,MAML)算法训练PointNet++,达到用少量点云样本就能快速适应新任务的能力.所提方法不但降低了模型对数据量的依赖,提高了模型泛化能力,而且成功地把MAML算法从二维图像分类拓展到三维点云分类中;在Modelnet40数据集上的实验结果表明,与PointNet++相比,该方法的训练时间减少了一半,分类准确率平均提高6.67%,验证了该方法在小样本数据集上的有效性.
-
- 多尺度显著特征双线注意力细粒度分类方法
- 刘光辉, 占华, 孟月波, 王博, 王博
- 针对细粒度图像分类任务中存在的区分性特征太过细微难以捕捉、无法有效地定位感兴趣的区域等问题,提出一种多尺度显著特征双线注意力分类方法.首先设计区域显著特征增强模块,通过区域切片操作放大并捕获细微可区分特征,增强特征图表达能力;然后提出多分支双线注意力池化策略,以弱监督方式层次化表征对象的显著部位特征,提高不同尺度局部信息的关注能力;最后利用反事实学习思想量化注意力质量,将真实的注意力和无关注意力对最终预测结果的差异作为衡量指标,通过差异最大化迫使双线注意力池化策略学习更有效特征.在CUB-200-2011,Stanford Cars和Stanford Dogs这3个公开数据集上,所提方法的准确率分别达到89.3%,95.0%和87.6%,相比其他方法的性能有较大幅度的提升.
-
- 分段式多层卷积神经网络渲染图像降噪模型
- 郭奕臻, 刘永翔, 纪信佑, 李庭瑶, 马利庄, 吴恩华, 盛斌
- 全局光照渲染技术在虚拟现实应用中日益普及,但其图像高分辨率采样带来的高时间成本严重影响用户感受.为解决上述问题,提出分段式卷积神经网络模型,对低分辨率采样渲染结果进行实时降噪并获得更高质量的渲染图像结果.该模型分为2段,针对已有降噪模型处理时序渲染结果序列时出现的不稳定性瓶颈,前段使用多层跳跃连接的循环卷积神经网络将渲染结果以序列为单位进行处理,保障降噪结果的时序稳定性;针对降噪模型在时序降噪中的效果瑕疵,后段串联多层渲染图像降噪卷积神经网络对处理结果进行优化;为加快模型训练速度并进一步提升降噪效果,使用低分辨率采样的场景反射率图、法线向量图、场景深度图、阴影图等渲染辅助图像信息作为辅助输入.所提模型综合了已有图像和视频降噪模型的优点,在5种自定义场景上的降噪实验结果表明,该模型具有良好的时序稳定性和降噪效果,镜面处噪点数量明显少于当前主流的OptiX降噪器;在降噪结果与目标图像的结构相似性(SSIM)指标上,与OptiX降噪器相比,该模型在5个场景中分别有5.8%,12.2%,1.5%,4.7%和1.8%的提升.
-
- 基于快速顶点漂移的平面物体跟踪
- 田旭辉, 钟凡
- 为了解决基于区域的平面物体跟踪方法容易陷入局部最优的问题,提出一种基于快速顶点漂移的平面物体跟踪方法.首先,构造包含不同尺度下的图像和物体区域采样点集合的金字塔结构;其次,在不同尺度下使用快速顶点漂移方法,利用全局的相似性度量函数迭代求解最优的顶点偏移,得到跟踪结果.在平面物体跟踪数据集POT上的实验结果表明,该方法在不同场景下平均跟踪准确率可达49.65%,平均高出其他参与测试的基于区域的方法31.87个百分点,平均每帧跟踪时间为0.12 s.
-
- 融合自适应加权模块的YOLOv4多尺度目标检测算法
- 聂帅杰, 程德强, 寇旗旗, 陈杰, 钱建生
- 针对残差块中特征图直接相加无法反映特征间相关性以及特征融合阶段存在信息损失的问题,提出一种融合自适应加权模块的目标检测算法.该算法对YOLOv4的主干网络和颈部网络进行改进,设计了一种自适应加权模块,对输入的2个特征图进行通道压缩并提取特征信息,从提取的信息中获取空间权重,最后将空间权重赋予输入特征图来建立其之间的相关性.在特征融合阶段增加跳跃连接,补充特征融合过程中的信息损失.实验结果表明,该算法能够有效地提高目标的精度,在PASCAL VOC数据集与KITTI数据集上的精度较YOLOv4算法分别提高了0.90个百分点与0.89个百分点.
-
- 面向视频去模糊的高效时空特征提取循环神经网络
- 蒲泽栋, 马伟, 米庆
- 针对现有基于循环神经网络的视频去模糊算法跨帧信息聚合能力有限、计算效率低的问题,提出高效时空特征提取循环神经网络的算法.首先结合残差密集网络结构和通道注意力机制,从给定序列图像的各帧中高效提取并选择表达力强的特征类型;然后提出循环神经网络框架下的时空特征增强融合模块,从高度冗余和干扰性强的序列图像中,统筹选择有效信息并将其融入到当前帧特征图中,补充当前帧信息;最后通过重建模块将增强后的特征图转换为去模糊后的当前帧图像.在3个包含合成和真实模糊视频数据的公开数据集上的定量和定性实验结果表明,所提算法能够以较小的计算成本取得优异的视频去模糊效果,在GOPRO数据集上,PSNR达到31.43 dB,SSIM达到0.920 1.
-
- 球谐算子驱动三维激光SLAM闭环检测
- 李子宽, 魏明强, 吴巧云, 郭延文, 徐凯, 李嘉, 汪俊
- 闭环检测是三维激光SLAM实现自主定位和导航的核心环节.针对目前闭环检测存在高复杂度及低准确度的难题,提出具有旋转不变性的球谐算子(spherical harmonic energy,SHE)与绕Z轴旋转不变的球谐算子(sphericalharmonic Z-energy,SHZE);结合SHE和SHZE的优势,通过两步搜索提出一种三维激光SLAM闭环检测算法SH-LCD,在提高信息丰富度的同时降低了闭环检测计算的复杂度,具有较强的特征提取能力与普适性.在KITTI,NCLT和Complex Urban这3个公共基准数据集上的闭环检测实验结果表明,SH-LCD算法的闭环检测精度优于最新的闭环检测方法,包括Scan Context,M2DP,OverlapNet等;此外,该算法闭环检测效率高,计算算子与算子匹配消耗的时间仅需约12.0 ms和2.3 ms,满足SLAM实时性的要求.
-
- 结合先验知识的海底图像配准方法
- 李晓明, 郝沙沙, 陈双慧
- 针对海底环境复杂造成图像质量严重退化,使得经典的基于数据的图像自动匹配算法性能严重下降的问题,提出一种基于海底成像特点与AUV传感数据相结合的图像匹配方法.首先根据海底成像特点选用光波衰减最小的蓝色通道图像,并经过恰当的图像增强和滤波处理有效地改善图像质量;然后利用IMU传感器提供的姿态数据计算旋转不变描述子的主方向,得到更加准确和可靠的主方向,提高特征描述子的准确性;最后利用AUV传感器提供的定位和深度数据计算特征匹配的粗略范围,减小特征匹配的搜索空间.对AUV在某海底区域采集的15 000余幅真实图像的匹配实验结果表明,所提方法无论是在特征匹配数量还是在匹配正确率上都得到明显提升,其中,对低纹理和重复纹理等难以匹配的图像效果更为明显;与经典的方法相比,平均匹配正确率从16.20%提高到35.84%.
-
- 先验GAN的CBCT牙齿图像超分辨率方法
- 宋全博, 李扬科, 范业莹, 陆书一, 周元峰
- 针对高分辨率的锥形束计算机断层扫描图像难以获取的问题,提出一种基于先验生成对抗网络的锥形束计算机断层扫描图像超分辨率方法,其通过微型断层扫描图像作为参照,对超分辨率网络进行弱监督训练.首先训练一个生成对抗网络,用于生成高质量的单颗牙齿的微型计算机断层扫描图像,并将其嵌入到一个U型的主干网络中作为先验解码器;然后利用低分辨率的多颗牙齿的锥形束计算机断层扫描图像对主干网络进行训练,先定位到锥形束计算机断层扫描影像中的每一颗牙,再分别提高分辨率;最后解决锥形束计算机断层扫描与微型计算机断层扫描之间的域差距,通过设计基于小波变换噪声提取的域适应退化模块,间接优化生成器生成更符合微型计算机断层扫描信息分布的图像.在锥形束计算机断层扫描数据集上进行实验的结果表明,与现有的超分辨率方法相比,所提方法的峰值信噪比提高了0.79~6.02 dB,感知相似度评价指标降低了0.01~0.72,并且在牙齿部分获得了更好的视觉效果,具有较强的竞争力.
-
- 重要性驱动的实时间接光泽反射算法
- 陈静, 陈主昕, 郭帆, 张严辞
- 实时间接光泽反射效果有助于提高渲染场景的真实感.为了解决虚拟点光源(virtual point lights,VPLs)在光泽材质处的着色走样问题,提出基于VPLs光照贡献重要性的渲染算法.首先提出基于Tile的光照贡献估算方法,通过分块拟合和分块剔除快速估算VPLs的光照贡献;然后通过自适应权重的时域复用方法,生成重要性驱动的分布图;最后结合Mipmap多级纹理映射技术,快速在场景的不同区域生成不同密度的VPLs.在金属戒指和斯坦福兔子等场景下的实验结果表明,使用相同数量的VPLs进行渲染,所提算法渲染质量优于随机光源裁剪算法,渲染结果的均方根误差不超过2%.
-
- 全局结构引导的人造物体参数化基元检测
- 陈柱瀚, 黄惠
- 点云是表达三维数据的常见形式,点云数据提取出的几何基元能够帮助人们快速地理解并处理场景信息,也方便后续其他任务的开展.为了更好地利用人造物体中普遍存在的全局结构关系,增强基元检测过程中全局结构的正向引导,提出参数化基元检测网络——RelationNet,包括2个子模块.首先,为了更好地编码三维点与其所在基元的结构关系,通过空间偏移预测模块预测三维点所在基元中心的偏移向量,提升点对其所在基元的位置感知能力,为后续分割任务提供更多的特征依据;其次,人造物体的基元与基元之间常常具有如平行、垂直、轴对齐等结构关系,为了更好地利用这些关系实现对几何基元检测结果的改进,还包含全局结构关系提取模块,利用基元拟合后获得的参数判断各个基元之间的结构关系,并通过设置相应的损失函数对提取到的结果进行引导监督.在大型ABC数据集与基元监督拟合(SPFN),ParseNet等主流算法进行对比的实验结果表明,RelationNet在基元分割和基元分类任务上的MIoU分别达到85.32%和90.10%,与当前先进方法相比有明显的效果提升.
-
- GA2T:结合图注意力网络的交通流预测模型
- 祁舒畅, 刘起东, 刘超越, 徐明亮, 邱紫鑫
- 交通流预测是智能交通系统的核心组成部分.针对当前交通流预测方法准确率低的问题,提出一种交通流预测模型GA2T.通过构建具有融合式编解码器的Transformer架构对交通数据进行时间建模,利用图注意力网络对交通数据进行空间建模,从而捕获交通流复杂的时空依赖性.在2个真实交通数据集METR-LA和PEMS-BAY上的实验结果表明,与预测效果最佳的基线模型DCRNN相比,GA2T在3个评价指标(MAE,MAPE和RMSE)上分别降低了0.25,0.38,0.89和0.14,0.34,0.44,在同类工作中处于领先的水平,验证了该模型的可行性及有效性.
-
- 面向高可靠汽车电子系统的低延时异构多核并行差错检测方法
- 吕浙帆, 王天成, 李华伟
- 与业界常用的双核锁步方法相比,异构并行差错检测技术以较小的面积开销实现接近的差错覆盖率,但是会增加差错检测延时并影响主核的性能.针对差错检测不及时带来的潜在安全风险,提出一种低延时的异构并行差错检测方法.首先通过复制寄存器时暂停物理寄存器释放的策略降低复制寄存器对主核性能的影响;然后利用主核控制流指导检查核取指,并基于预测检查核运行时间来划分程序段,以提升差错检测的性能,使得最大差错检测延时可控.使用1个开源香山处理器核作为主核,16个开源Rocket处理器作为检查核进行了方法实现,采用基准程序评估的实验结果表明,所提方法能够以50%的逻辑开销和22%的存储开销实现差错检测,小于双核锁步接近100%的面积开销.同时,在主核上的平均性能开销小于1%,且能将差错检测延迟控制在2 000个时钟周期以内.此外,与原有分支预测策略相比,检查核的平均性能提升了14.9%.
-
- 基于K近邻的数字电路自动测试向量生成方法
- 李文星, 王天成, 李华伟
- 基于分支限界搜索的自动测试向量生成(ATPG)是数字电路测试中的关键技术,搜索中的回溯次数对ATPG性能造成很大影响.为了减少ATPG回溯次数,提出一种基于K近邻(KNN)的数字电路ATPG方法.将机器学习中的KNN算法引入POEDM测试生成算法,KNN结合电路结构数据和可测试性度量信息来指导PODEM算法中回退路径的选择,替代传统的启发式策略,以尽快地到达有效决策点,减少回溯次数.在ISCAS85,ISCAS89和ITC99基准电路上进行验证,与传统启发式策略以及一种基于人工神经网络(ANN)的回退路径选择策略相比,所提方法在回溯次数、回退次数、运行时间和故障覆盖率指标方面分别实现了最高1 625.0%,466.0%,260.0%和2.2%的改进.同时,相比基于ANN的方法,KNN没有显式的训练过程,在搭建模型阶段能够节省一定的显存资源开销,并且可以使用更少的训练集样本得到有效的预测模型.
