计算机辅助设计与图形学学报杂志2023年第10期
-
- 数字说话人视频生成综述
- 宋一飞, 张炜, 陈智能, 姜育刚
- 近年来, 基于深度学习的生成技术显著推动了虚拟数字人技术的发展. 针对当前虚拟数字人研究中的热点问题——数字说话人视频生成进行综述, 其在电影配音、 动画制作、 虚拟助手等场景中具有重要的应用前景. 文中从数据集、关键技术、评估策略 3 个方面, 对数字说话人视频生成技术及研究现状做了较系统的梳理与总结, 介绍了其生成过程中涉及的视觉生成、图像识别、语音识别、跨模态分析等多项人工智能的关键技术机器发展演进过程; 从数据、模型、评估策略等方面指出该方向需要迫切解决的问题, 并通过这些问题展望其未来的发展方向, 以期能对该领域的研究者有所帮助和启发, 促进该方向的发展.
-
- 基于深度半监督学习的植物叶片自动识别
- 吴惠思, 肖芳燕, 史周安, 文振焜
- 植物叶片自动识别算法在植物教学和生态保护等领域有着广泛应用, 但由于植物种类繁多且类间差异小,传统深度学习方法需要大量的数据标注才能获得较好的训练效果. 为此, 提出一种基于深度半监督学习的植物叶片自动识别方法. 首先, 基于一致性正则化思想, 为提升数据扰动质量设计了显性、隐性数据扰动流程; 然后, 运用深度特征提取网络 DenseNet, 有效地提升了植物叶片细粒度特征的辨别能力; 最后, 基于模拟退火训练策略过滤训练过程中的异常数据, 从而缓解过拟合现象. 在分别含有 5 284 幅和 18 000 幅植物叶片图像的公开数据集 MalayaKew-D3 和私 有 数 据 集 LeafSZU-2021 中 获 得 的 实 验 结 果 表 明 , 与 全 量 标 注 数 据 下 监 督 学 习 模 型 相 比 , 该 方 法 在 仅 使 用30%~50%标注数据量时, 仍能达到 92.36%~96.85%的植物叶片识别准确率; 在相同数据标注量下, 其平均识别准确率比当前最新的半监督球面均值聚类方法提高了 2.95%, 且模型参数量降低了 38.12%, 识别速度提高了 61.51%.
-
- 基于混合尺度非局部注意力的纹理图像超分辨率
- 姚鹏飞, 魏育坤, 路昊, 王素琴
- 相较于一般图像, 纹理图像细节特征尺度小、密度大, 导致低分辨率下会丢失更多高频信息, 影响超分辨率重建的效果. 基于此, 提出一种利用混合尺度非局部注意力的纹理图像超分辨率方法. 首先, 在跨尺度非局部注意力的基础上提出等尺度非局部注意力, 用于在整幅图像中挖掘等尺度相似特征块的高频信息, 为解决 2 种注意力并行部署带来的计算操作与参数量较多的问题, 设计参数共享的方法, 将 2 种注意力合并为混合尺度非局部注意力(MSNLA); 其次, 通过通道投影的方式将 MSNLA 生成的不同尺度的相似特征与输入特征图融合; 最后, 利用非局部特征融合重建的方法将 MSNLA 提取到的特征组合后进行超分辨率重建. 实验结果表明, 在 DTD 数据集上, 该方法相较于 CSNLN 算法的 PSNR 提高了 0.16 dB, 模型参数量减少了约 10.3%, 并且重建图像取得了更好的视觉效果.
-
- RGB-D双模态信息互补的语义分割网络
- 王立春, 顾娜娜, 信建佳, 王少帆
- 为了充分融合 RGB 和深度信息以进一步提高语义分割精度, 引入注意力机制实现了 RGB 与深度 2 个模态特征的互补融合. 基于编码器-解码器框架, 提出了 RGB-D 双模态信息互补的语义分割网络, 编码器采用双分支结构分别提取 RGB 图像和深度图像的特征, 解码器采用逐层跳跃连接的结构渐进地融合不同粒度的语义信息实现逐像素语义分类. 编码器对 2 个分支学习到的低层特征, 利用 RGB-D 信息互补模块进行互补融合. RGB-D 信息互补模块包括Depth-guided Attention Module (Depth-AM)和RGB-guided Attention Module (RGB-AM) 2种注意力. 其中, Depth-AM将深度信息补充给 RGB 特征, 解决由于光照变化引起的 RGB 特征不准确问题; RGB-AM 将 RGB 信息补充给深度特征, 解决由于缺乏物体的纹理信息而导致的深度特征不准确问题. 在采用相同结构 backbone 的条件下, RGB-D 双模态信息互补的语义分割网络与 RDF-Net 相比, 在 SUNRGB-D 数据集上的平均交并比, 像素精度和平均精度分别提升 1.8%, 0.5%和 0.7%; 在 NYUv2 数据集上的平均交并比, 像素精度和平均精度分别提升 1.8%, 1.3%和 1.9%.
-
- 改进的PF-AFN在虚拟试衣中的应用
- 韩超远, 李健, 王泽震
- 针对 PF-AFN 中预测外观流精度欠缺和网络泛化能力较差的问题, 提出改进的虚拟试衣网络. 首先, 增加目标人体预测模块, 通过预测目标人体解析图像解耦形状与纹理; 其次, 依据仿射变换的共线特性, 增加共线性损失项以约束形变过程, 根据外观流的特性添加距离损失, 弥补 PF-AFN 对局部区域约束不足的缺陷; 最后, 将生成的人体解析图像与原输入按通道拼接作为图像生成网络的输入, 使用基于 ResNet 的类 UNet++图像生成网络得到最终的试衣图像. 基于 VITON 数据集, 与其他 4 种最新方法进行对比实验, 实验结果表明, 该方法在图像相似度评价指标SSIM, FID 和 LPIPS 上分别比其中最优方法提升了 1.2%, 11.1%和 5.8%, 图像清晰度和多样性评价(IS)与当前最优方法相当. 从整体来看, 所提方法改善了原网络中存在的问题, 并取得了较好的视觉效果.
-
- 具有隐私保护特性的深度伪造人脸检测模型
- 吴畏, 朱剑宇, 张延, 张玲, 陈北京
- 现有伪脸检测研究都是在明文条件下开展, 而人脸图像具有重要的隐私性. 因此, 基于加性秘密分享框架,提出一种具有隐私保护特性的深度伪造人脸图像检测模型. 首先在现有基础运算协议的基础上, 构建 4 个安全通信协议, 并通过理论分析证明了它们的安全性和正确性; 然后使用不共谋的双服务器构建一个类明文的环境, 在构建的安全通信协议支持下, 双服务器中预训练好的 ResNet50 模型交互协同计算; 最后综合双服务器的运算结果, 在不暴露输入的情况下实现安全伪脸检测. 在公开数据集 FaceForensics++, Celeb-DF 和 DFDC 上的实验结果表明, 所提模型能够在实现支持隐私保护的前提下, 与明文条件下的 ResNet50 模型准确率保持一致; 所提出的隐私保护模型也适用于 ResNet50 之外的其他明文 SOTA 伪脸检测模型, 如 Xception 和 EfficientNet-B0 等.
-
- 采用重参数网络的Transformer目标跟踪
- 钱小燕, 施俞洲, 张峰, 朱新瑞, 韩磊, 李智昱
- 针对目前基于 Siamese 结构的目标跟踪计算量大且不能实现模板与搜索区域间充分信息交融的问题, 提出基于重参数网络的 Transformer 目标跟踪算法. 首先采用重参数法降低跟踪过程中骨干网络计算量, 训练时采用多分支并行结构, 测试跟踪过程中使用重参数法将多分支并行结构重构成单分支串行结构; 然后对骨干网络提取的模板特征图和搜索区域特征图使用 Transformer 结构进行自注意力加强, 通过交叉注意力层实现像素级信息交融; 最后将完成充分交融的信息映射到分类分支、中心度估计分支与边框回归分支, 其中, 边框回归分支采用最新的 CIoU-Loss进行训练, 使得跟踪算法精确度更高, 具有更强鲁棒性的同时满足实时性. 实验结果表明, 所提算法在大规模基准数据集 GOT-10k 上平均重叠率为 0.606, 超越 SiamFC++算法 0.011; 在大规模数据集 LaSOT 上, 成功率、归一化精确度、精确度分别达到 0.554, 0.659 和 0.581, 比 SiamFC++算法提高了 0.010, 0.036 和 0.034.
-
- 不确定性感知与类别均衡的表情识别模型
- 洪居兴, 田媚, 黄雅平
- 为解决真实场景下人脸表情识别不确定性和数据不均衡问题, 提出不确定性感知与类别均衡的表情识别模型. 首先设计标签分布生成网络, 以更好地体现人脸表情分布特性, 并提出基于标签分布的重要性加权损失函数, 使用重要性值对输出结果进行加权, 促进模型对不确定性的抑制; 然后使用距离约束损失函数, 扩大不同重要性值分组之间的平均重要性值的差值, 使用重标记模块, 依据样本类别预测向量发现, 纠正不确定性引起的噪声标签; 最后为解决数据不均衡问题, 提出基于标签分布的类别均衡损失函数, 依据难易样本数量自适应地分配各个样本的权重, 加强模型对难样本的学习. 在 RAF 数据集中的实验结果表明, 所提模型识别准确率达到 88.36%, 性能优于其他表情识别模型, 证明了该模型的有效性.
-
- 全局特征感知与融合的多层次蒸馏学习道路提取模型
- 王勇, 曾祥强, 曾俊铖, 黄开青, 叶虎平, 甘宏, 陈宇焜
- 为提取空间特征更细节和语义信息更全面的道路信息, 提高道路信息提取的推理速度, 在端到端的卷积神经网络(convolutional neural network, CNN)基础上, 提出一种结合空间注意力机制、全局信息感知和特征融合模块的道路提取模型. 首先利用空间注意力机制和全局信息感知模块获取道路特征的上下文信息, 提高浅层特征的空间信息表达能力; 然后构建顾及通道和语义信息的特征融合模块, 消除基于端到端的 CNN 中浅层和深层特征之间的语义差距, 完成跨层特征的有效融合; 最后使用多层次知识蒸馏学习策略, 减少并降低所提模型的网络参数和计算复杂度, 快速、准确地获取遥感影像中的道路信息. 在公开的 Deep Globe 和马萨诸塞州 2 个卫星遥感影像道路数据集, 以及京津新城无人机遥感影像道路数据集上进行训练、验证和评估的实验结果表明, 所提模型是一种精度高、效果好的道路提取模型, 无论是卫星遥感数据源还是无人机遥感数据源均具有较好的道路信息提取能力, 其 F1 分别达到79.36%, 78.42%和 84.27%, 均优于对比的道路提取模型; 同时, 多层次知识蒸馏学习策略能显著地提高模型的精度、提升泛化能力, 其 IOU 值分别提高 0.29, 0.77 和 0.46 个百分点, 在模型精度和网络参数方面都取得了较优的效果, 具有广阔的应用前景.
-
- 建水指林寺明代壁画病害区域的自动标定算法
- 邓小超, 余映, 杨琳霞, 朱信耿, 杨蕾, 卢作俊
- 针对云南建水指林寺明代壁画的病害区域标定问题, 提出一种裂隙与脱落病害的自动标定算法. 首先在HSV 空间中对壁画图像进行多维梯度检测, 提取壁画的纹理和线条特征; 然后利用导向滤波抑制壁画中的绘画线条,对滤波后的图像进行自动阈值分割, 得到壁画病害区域的初始掩膜; 再利用张量投票方法连接初始掩膜中不连续的边缘曲线, 通过形态学孔洞填充得到完整的壁画病害区域掩膜; 最后将病害掩膜添加到原始壁画图像, 实现壁画裂隙与脱落病害区域的自动标定. 实验结果表明, 所提算法在自制的 48 幅指林寺壁画数据集上取得了当前最好的标定效果, 准确率和召回率分别达到 78.9%和 69.5%, F-Measure 值比最优对比方法提高 18 个百分点, 而且不需要人机交互, 具有更高的计算效率.
-
- 多层次特征融合表征的图像情感识别
- 张浩, 李海鹏, 彭国琴, 柳雁安, 徐丹
- 可视化的结果证明层次化的网络结构依赖于深层语义信息, 而忽略了对于唤起情感至关重要的浅层视觉细节. 针对当前图像情感分析领域中的方法多单一聚焦于低级视觉特征或高级语义表示上, 未能综合考虑不同层次特征的问题, 提出一种多层次混合表征模型. 首先提出一种浅层视觉特征提取器, 其被嵌入到主干网络用于提取浅层视觉细节; 然后主干的深层语义特征和分支的浅层视觉细节表示被融合层聚合成混合表征, 用于图像情感识别; 最后引入一种损失函数来优化模型, 解决图像情感数据集中数据样本不平衡的问题. 在 FI, Emotion6等 6个情感数据集(包括普通图像和艺术图像)上的实验结果表明, 与当前模型相比, 所提模型的情感识别准确率得到超过 1.5%的性能提升.
-
- 面向人体姿态估计的不可察局部对抗攻击
- 刘复昌, 王昊, 王延斌, 缪永伟
- 尽管深度神经网络在很多任务上取得了良好的结果, 但是它们对于微小的对抗扰动却很容易出现预测错误.然而在人体姿态估计的对抗攻击任务中, 通常需要添加较大的扰动噪声才能攻击成功, 这使得其不可察性变差; 减少扰动噪声又会削弱攻击效果. 为了克服该矛盾, 提出一种面向人体姿态估计的两阶段局部对抗攻击方法. 所提方法首先通过预攻击估计出扰动关键区域, 然后利用不可察性约束在关键区域内生成扰动. 方法不仅可以对人体姿态进行有效攻击, 而且还能确保最终扰动区域具有低可察性. 采用 COCO2017 作为对抗扰动实验数据集并使用PCK(percentage of correct keypoints)作为评价指标, 比较在人体姿态估计模型中 IGSM 和 C&W 方法的攻击效果,其 PCK 降低值分别提高了 15.4%与 2.8%. 实验结果表明所提方法在保证攻击的低可察的同时, 能够取得较好的攻击效果.
-
- 中心型布局的旭日图生成算法
- 杨振凯, 华一新, 张政, 陈敏颉, 杨飞, 张蓝天
- 旭日图是一种新兴的层次数据可视化方法, 对于层级结构及属性关系的表达具有明显优势. 针对经典旭日图算法在可视化中出现的整体和部分区域图形分布不均衡的问题, 提出中心型布局的旭日图生成算法. 首先提出节点中心性的度量方法, 顾及正态分布图像特征对非根节点的子节点进行重排, 使扇环表达兼顾节点中心轴线两侧图形的平衡性和特征节点的突出性; 在非根节点布局完成的基础上, 提出扇环引力的定义, 并以合力最小化原则指导第 1 扇环的重排, 最终基于多种策略实现整体中心型布局. 采用 2019 年我国不同级别行政区划的 GDP 等层次数据进行实验的结果表明, 对于非根节点, 所提算法能够有效地提高其中心性; 对于根节点, 该算法能够以较高的效率生成各向延伸均衡的布局方案, 从而保证旭日图平面内整体和局部图形分布的均衡性.
-
- 基于运动捕捉的机翼形变测量方法
- 吴阳历, 王立志
- 针对实时动态条件下的机翼形变测量问题, 提出一种基于运动捕捉技术的机翼形变测量方法. 首先采用高精度动作捕捉技术实时获取机翼表面物理标记点的绝对坐标数据; 然后使用一种基于拉普拉斯坐标的网格形变插值算法, 利用机翼数字模型及物理标记点的坐标信息进行插值, 获取机翼数字模型的网格顶点的实时坐标; 最后通过比较网格顶点坐标与初始坐标的差异得到机翼的实时形变信息, 完成对机翼形变的测量. 在 2 段运动捕捉数据上与反距离权重插值法进行对比的实验结果表明, 所提方法能够以较高的精度对机翼的形变进行实时测量, 测量误差不超过 1 mm.
-
- 鼻-颅底虚拟手术基于黏膜钳力交互的肿瘤形变
- 韩靖, 田歌, 潘俊君, 王玉辉, 王晶, 骆岩林
- 目前还没有针对黏膜钳力交互的颅底肿瘤形变研究, 黏膜钳作为鼻-颅底手术的主要工具之一, 研究其虚拟仿真可以为鼻-颅底虚拟手术系统提供技术支撑. 首先, 基于 CT 重建颅底脊索瘤模型, 参照实物建立黏膜钳模型; 其次, 根据碰撞点与三角面片的位置关系进行精确碰撞检测; 再次, 根据碰撞点与三角面片顶点的距离的比例将外力分配到顶点上; 从次, 基于 Voigt 模型模拟肿瘤形变, 采用 4 阶龙格-库塔法求解动力学方程; 最后, 基于 GeomagicTouch 设备与弹簧-阻尼器模型实现力反馈. 实验所用脊索瘤模型有 2 601 个顶点, 在 CPU i7-9700K, GPU 1660Ti 环境下的实验结果表明, 形变效果符合软组织的黏弹性、应力-应变非线性与应变滞后性, 形变帧速超过 60 帧/s, 达到实时性要求, 针对 17 位医师的问卷调查也获得了较好评价.
-
- 基于视觉复杂度、空间频率的汽车界面图标视觉搜索效率研究
- 宫勇, 裘曼琳, 霍发仁
- 汽车界面图标需要能在复杂驾驶环境中进行高效、安全交互的设计. 针对图标在有限认知资源环境下的视觉搜索问题, 通过一组双目标的快速序列视觉呈现实验, 考察了图标的视觉复杂度与空间频率对目标搜索效率的影响. 实验设定目标一为警戒任务, 限制认知资源量; 设定目标二为分心任务, 反映注意力需求. 实验结果表明, 视觉搜索效率受视觉复杂度干扰显著, 低复杂度图标识别正确率较高, 且反应时间较短; 视觉搜索效率受空间频率干扰显著, 高空间频率图标识别正确率较高, 且反应时间较短; 视觉复杂度与空间频率的交互效应非常显著. 文中研究表明, 汽车界面图标的视觉复杂度决定了被试的视觉加工机制, 在图标简单时倾向于整体加工; 高空间频率信息是汽车界面图标识别的关键尺度, 且越复杂的图标识别越需要高空间频率信息的参与; 低空间频率信息是影响专家经验加工的重要因素. 研究结果为智能汽车界面图标设计提供了重要的工效学依据.
-
- 基于眼动跟踪的个性化文本摘要生成模型
- 揭志强, 叶阳, 程时伟
- 为了满足不同用户对生成摘要的个性化需求, 提出一种基于眼动跟踪的个性化文本摘要生成网络模型. 首先使用阅读时的注视和扫视等眼动跟踪数据提取眼动关键信息, 并使用长短期记忆模型对眼动关键信息进行编码;然后将眼动关键信息隐藏层状态融合到注意力机制中, 结合内部注意力模型和指针生成器网络生成个性化的文本摘要; 最后设计开发了相关的文本摘要生成系统. 使用包含用户眼动数据的中文新闻数据集 ADEGBTS 进行实验的结果表明, 与现有的文本摘要模型相比, 所提模型在 ROUGE 指标评估上的得分更高, 达到 48.68%; 用户测试结果表明, 所提系统可以高效地生成个性化摘要.
