本网讯(通讯员 吴梓毅)近日,我校计算机学院、智能机器人湖北省重点实验室、多模态感知与认知计算团队的最新研究成果被IEEE Transactions on Multimedia(简称TMM)录用。论文题为《Dual Frequency-Space Aware Fusion Network for Face Super-Resolution》(面向人脸超分辨率的双频率—空间感知融合网络),2023级硕士研究生吴梓毅为第一作者,卢涛教授、张彦铎教授为共同通讯作者,第一署名单位为武汉工程大学。TMM主要刊载多媒体信号处理、计算机视觉、系统与应用等方向的高水平研究成果,是我校认定的Top期刊。
人脸超分辨率可以通俗理解为给低清人脸图像做“智能高清修复”。它不是简单地把图片放大,而是要在有限、模糊的信息中重建更清晰的人脸,同时尽量保持眼睛、鼻子、嘴巴和面部轮廓等关键结构不变。低清图像中的许多细节已经丢失,算法既要恢复纹理,又要避免把人脸“修变形”,因此具有较大挑战。该技术可为视频监控、人脸识别、老照片修复及低清影像增强等提供更可靠的图像基础。
针对现有方法多依赖空间域建模、难以兼顾整体结构与局部细节的问题,吴梓毅在导师指导下提出双频率-空间感知融合网络(DFSAFNet,如图1所示)。其核心创新在于让模型同时从“图像位置”和“变化频率”两个角度理解人脸:空间信息用于判断五官的位置及相互关系,频率信息用于捕捉轮廓、边缘和纹理变化。模型进一步结合傅里叶变换、小波变换、卷积神经网络和Transformer,对人脸的整体结构、多尺度轮廓与细粒度纹理进行互补建模,并通过可学习权重自动融合不同信息。简单来说,该方法能够做到“既看清整张脸,又看清局部细节”,从而减少纹理模糊、轮廓不清和结构失真。
DFSAFNet网络框架:模型协同融合空间域与频率域信息
在此基础上,团队进一步构建了DFSAFGAN,通过生成对抗学习提升重建图像的自然度和视觉真实感。实验结果表明,所提方法在CelebA和Helen公开数据集的4倍、8倍放大任务中,多项评价指标均取得最优结果;在更接近真实监控环境的SCface数据集上,模型能够更清晰地恢复眼部等关键区域,重建人脸与高清身份图像之间的差异也更小。这说明该方法不仅能让低清人脸“看起来更清楚”,还可为后续人脸识别等任务提供更有效的信息支撑。
该研究获得国家自然科学基金(62171328、62401410、62171327)、中央引导地方科技发展资金项目(2022BGE242)、湖北省自然科学基金(2023AFB158)、湖北省高等学校优秀中青年科技创新团队(T2023009)的资助。此次论文录用体现了我校青年学生在人工智能与计算机视觉前沿研究中的创新能力,也标志着多模态感知与认知计算团队在人脸图像处理领域取得新进展,进一步提升了学校在多媒体与计算机视觉领域的学术影响力。(审稿 张炜 周华兵)