光学仪器  2019, Vol. 41 Issue (4): 36-41   PDF    
基于编码−解码对称神经网络的高分辨率图像重构机理研究
熊锐, 张雷洪, 蒋周杰, 王建强, 覃榜道, 赖纯莉     
上海理工大学 出版印刷与艺术设计学院,上海 200093
摘要: 针对目前许多图像重构算法存在重构出来的图像不清晰、分辨率低等问题,提出了一种基于编码−解码对称神经网络的高分辨率图像重构算法。首先将图像进行压缩获取低分辨率图像,然后将低分辨率图像作为输入图像经过编码−解码对称神经网络,并利用其中的卷积神经网络进行编码得到特征图像,最后再利用反卷积神经网络进行解码实现图像的细节恢复。实验结果表明,经过基于编码−解码对称神经网络重构出来的图像比之前的低分辨率图像更加清晰,图像的分辨率得到了提高。
关键词: 卷积神经     反卷积神经     编码     解码     重构    
Research on high-resolution image reconstruction mechanism based on coding-decoding symmetric neural network
XIONG Rui, ZHANG Leihong, JIANG Zhoujie, WANG Jianqiang, QIN Bangdao, LAI Chunli     
College of Communication and Art Design, University of Shanghai for Science and Technology, Shanghai 200093, China
Abstract: Aiming at many current image reconstruction algorithms such as JPEG decompression and compressive sensing reconstruction, there are some problems such as unclear image and low resolution. This paper proposes a high-resolution image reconstruction mechanism based on code-decoding symmetric neural network. Firstly, the image is compressed to obtain a low-resolution image, and then the low-resolution image is used as an input image to encode-decode a symmetric neural network, and the convolutional neural network is used to encode the feature image, and finally the deconvolution neural network is used. Decoding implements detail recovery of the image. The experimental results show that the image reconstructed by the code-decoded symmetric neural network is clearer than the previous low-resolution image, indicating that the resolution of the image is improved.
Key words: convolutional nerve     deconvolutional nerve     coding     decoding     reconstruction    
引 言

随着越来越多的智能服务出现,人类将进入一个新的智能时代,而深度学习无疑是这股智能浪潮的前沿科技[1-5]。深度学习是通过提取和组合低层特征形成高层特征来表示其属性类别,便于数据的表示。目前常用的深度学习有三种,分别是卷积神经网络、受限制波兹曼机以及自编码神经网络。1986年,Rumelhart等提出的反向传播算法解决了多层神经网络的训练问题[6]。1990年,Cun 等首次提出了卷积神经网络(convolutional neural network,CNN)[7],其特点在于卷积层采用局部连接和权值共享的方式进行连接,从而大大降低了需要训练的参数数量,通过降采样层来降低维度,使网络具有更高的鲁棒性,同时能够有效地防止拟合。卷积神经网络作为深度学习的网络模型之一,是专门做图像信息处理的深度神经网络[7-9],应用于大多数的计算机视觉领域,目前正处于快速发展阶段。因此,本文将卷积神经网络与反卷积神经网络相结合,提出了一种基于编码−解码对称神经网络的高分辨率图像重构算法。此算法的特点在于:先将压缩图像作为输入图像,经过编码阶段,利用卷积神经网络来获得特征图像;然后再经过解码阶段,利用反卷积神经网络来实现图像细节的恢复,以期取得更好的图像重构效果。

1 图像处理的神经网络 1.1 卷积神经网络

图1为卷积神经网络结构,该结构是由多个卷积层与池化层相互交替组合而成。卷积神经网络与其他神经网络的不同之处在于采用了转换图像的过滤器,称之为“卷积过滤器”。使用卷积过滤器可使经卷积层后生成的特征图像突出了原始图像的独特特征。在卷积层中,每层设置了多少个卷积过滤器,相应地将会产生多少个特征映射,最后这些特征映射经过激活函数就可以得到特征图像。

图 1 卷积神经网络结构 Figure 1 Convolutional neural network structure

由于神经网络输出端输出的实际值与理论值会存在一定的误差,所以需要通过一个算法来降低输出误差,以此达到优化整个神经网络的目的。因此利用反向传播算法对神经网络结构中的各个权重以及参数进行优化。

1.2 反卷积神经网络

反卷积神经网络是在卷积神经网络的基础上对其进行改进得到的[9]图2为反卷积神经网络结构,其结构与卷积神经网络不同之处在于去掉了卷积神经网络中最后的全连接层,在网络中加入反卷积层。为了得到比输入图像尺寸更大的输出图像,对输入图像进行上采样操作来扩大图片尺寸,同时通过使用反卷积过滤器对图像进行卷积以此来填充图像的内容,使得图像内容变得丰富。这样一个由反卷积层、上采样层组成的层次化的反卷积神经网络结构有助于提取图像的细节特征。

图 2 反卷积神经网络结构 Figure 2 Deconvolution neural network structure

通过反卷积神经网络得到的输出图像可表示为

$\begin{split}{F_1}\left( Y \right) = &\max\left( {{W_1} \times Y + {B_1}, 0} \right) +\\ &{a}\min\left( {0, {W_1} \times Y + {B_1}} \right)\end{split}$ (1)

式中:Y为输入图像;W1为反卷积核;B1为偏置量;a为修正输出图像的一个经验参数。

为了得到更高的神经网络重构图像分辨率,本文将卷积神经网络与反卷积神经网络相结合,采用一种基于编码−解码对称神经网络的图像高分辨率重构方法。

2 基于编码−解码对称神经网络的图像重构

在典型的卷积神经网络中,网络初始端通常是多个卷积层和池化层的交替组合,在靠近输出层的最后几层网络是全连接网络。但是在卷积层提取图像特征时,会丢失一些细节信息,如边缘、纹理等,随着网络层数的加深,细节信息的丢失会逐渐增加,这不利于图像超分辨率重构及恢复。因此,为了避免过多的细节丢失,本文删除了池化层,并在卷积神经网络后增加了一个反卷积神经网络,卷积神经网络充当编码器用以得到特征图像,反卷积神经网络充当解码器用以恢复原始图像。

图3为编码−解码对称神经网络结构示意图,主要有两部分构成。第一部分(编码)为基于卷积神经网络的特征提取,给定原始图像和随机初始化卷积过滤器矩阵,利用卷积神经网络直接对原始图像进行操作生成特征映射,卷积过滤器矩阵的值是在训练过程中经不断优化确定的。第二部分(解码)为基于反卷积神经网络的图像细节的恢复,将经卷积神经网络得到的特征图像作为反卷积神经网络的输入,反卷积核是经卷积过滤器矩阵变换得到的[8],在一定程度上可以理解为,卷积神经网络中的卷积核与反卷积神经网络中的反卷积核是共享的。

图 3 编码−解码对称神经网络 Figure 3 Coding-decoding symmetric neural network

为了衡量基于编码−解码对称神经网络对图像压缩重构的效果,引入损失函数并采用均方误差表示损失函数,其表达式为

$E\left( {w, \beta , k, b} \right) = \frac{1}{{2m}}\mathop \sum \nolimits_{i = 1}^m \left\| {t_m} - {y_m}\right\|^2$ (2)

式中:w为全连接层的网络权重;β为池化层的网络权重;k为卷积核参数;b为各层的偏置参数;m为训练样本的个数;tm为第m个样本预测出来的真值;ym为第m个样本在原来样本中的值,也就是标准答案。由于本文网络结构中并没有涉及全连接层以及池化层,所以参数wβ忽略不计。

损失函数可以用来衡量网络结构的好坏,损失函数越小说明网络结构和参数越符合训练样本。因此训练的过程就是不断地改变参数,从而得到更小的损失函数的过程。在理想情况下,当我们取到损失函数的最小值时,就得到了最优的参数,记为

${\rm{min }} E\left( \theta \right)$ (3)

式中θ为所有参数的总称。

3 实验分析 3.1 实验效果

基于编码−解码对称神经网络的图像压缩重构机理仿真采用MATLAB实验平台。在实验中,所用到的训练数据是MNIST数据库,它包含70 000张手写图像数字的图像,通常用60 000张图像做训练,再用剩下的10 000张做验证,每一张都是28×28像素数的黑白图像。考虑到训练时间,本文只采用10 000张图像,其中用于训练的图像为8 000张。如图4所示,本文选用图像数据库中的数字“2”、数字“7”和数字“1”作为仿真对象,这些数字均为28像素×28像素的二值图像。

图 4 原始图像 Figure 4 The original image

本文所采用的压缩方式为:首先确定图像在尺寸上进行压缩的倍数,本文进行两倍的压缩;其次调整图像的尺寸,使调整后的尺寸能够压缩为原先的两倍;再次以补零的方式进行填充,使图像恢复为原先的尺寸,如图5所示;最后将恢复后的低分辨率图像作为编码−解码对称网络的输入图像来进行接下来的操作。

图 5 输入图像 Figure 5 Input image

将编码−解码对称神经网络结构中的每个隐藏层中的节点个数设置为20个,那么会生成20个卷积滤波器以及20个特征图像。以数字“2”为例,如图6所示,图中(a)为生成的卷积滤波器,(b)为卷积之后的图像,(c)为卷积之后经过激活函数之后的特征图像。图7为经反卷积操作之后数字“2”、数字“7”和数字“1”的重构图像。

图 6 数字图像“2”的卷积过程 Figure 6 Convolution process of digital image "2"

图 7 重构图像 Figure 7 Reconstructed image
3.2 可行性分析

为了客观精确地衡量基于编码−解码对称神经网络的图像重构质量,这里引入了均方差(mean square error,MSE)和峰值性噪比(peak signal-to-noise ratio,PSNR),可分别表示为:

${\rm{PSNR}} = 10\cdot{\rm{lg}}\left( {\frac{{a_{\max}^2}}{{{\rm{MSE}}}}} \right)$ (4)
${\rm{MSE}} = \frac{1}{{MN}}\mathop \sum \nolimits_{i=1}^M \mathop \sum \nolimits_{j=1}^N {\left( {R\left( {i, j} \right) - F\left( {i, j} \right)} \right)^2}$ (5)

式中:MSE为原图像与重构图像之间的均方误差;MN分别为图像的宽度和高度; $R\left( {i, j} \right)$ 为原始图像对应像素点的值; $F\left( {i, j} \right)$ 为恢复图像对应像素点的值;amax为图像中最大像素点的值。PSNR值越大,说明两幅图越相似,即恢复的图像质量越高。

表1分别列出了压缩之后的低分辨率图像和基于编码−解码对称神经网络的图像高分辨率算法重构出来的图像。经计算可以得到,低分辨率图像的PSNR值比本文方法重构出来的PSNR值要低,说明低分辨率图像经基于编码−解码对称网络的图像高分辨率算法之后分辨率、清晰度都得到了提高,说明本文所提出的方法可行。

表 1 压缩图像、重构图像的PSNR值 Table 1 PSNR values of the compressed images and the reconstructed images
3.3 效果对比

本文将基于编码−解码对称神经网络的图像高分辨率重构算法与基于深层前馈卷积神经网络的图像重构算法[9]进行比较。其中基于深层前馈卷积神经网络的图像重构算法主要用于消除图像中的噪声,同时其本身的体系结构也可以通过被训练来重构压缩图像以及提高图像分辨率。为了客观地对这两种算法进行评价,本文采用了相似度参数S,对于大小为M×N的图像,S的数学表达式如下:

$S = \frac{{\mathop {\displaystyle\sum} \nolimits_{i = 1}^M \mathop {\displaystyle\sum} \nolimits_{j = 1}^N X\left( {i, j} \right)X'\left( {i, j} \right)}}{{\mathop {\displaystyle\sum} \nolimits_{i = 1}^M \mathop {\displaystyle\sum} \nolimits_{j = 1}^N X{{\left( {i, j} \right)}^2}}}$ (6)

式中:X为原始图像; $X'$ 为裁切过的重构图像。

图8比较了用不同重构算法得到的图像,其中:(a)为原始图像;(b)为基于编码−解码对称神经网络的图像高分辨率重构算法重构出来的图像(本文算法);(c)为基于深层前馈卷积神经网络的图像重构算法重构出来的图像。由此得出:(1)基于编码−解码对称网络的图像高分辨率算法重构出来的图像效果在图像清晰程度、细节纹理方面要优于基于深层前馈卷积神经网络的图像重构算法重构出来的图像;(2)经相似度公式计算得到基于编码−解码对称网络的图像高分辨率算法重构出来的图像相似度值为0.996 5,而基于深层前馈卷积神经网络的图像重构算法重构出来的图像的相似度值为0.866 4。由此可见,基于编码−解码对称网络的图像高分辨率算法重构出来的效果更佳。

图 8 对比 Figure 8 Comparison
4 结 论

本文提出了一种基于编码−解码对称神经网络的图像高分辨率重构方案。首先将图像在尺寸上进行两倍的压缩以获取低分辨率的压缩图像,然后将此压缩图像作为输入图像,再经过编码−解码的对称神经网络的图像重构算法重构图像。本文采用MATLAB软件进行仿真实验,并进行了可行性分析和效果对比分析。实验结果表明,基于编码−解码对称神经网络的图像高分辨率算法能重构出清晰度更高,质量更好的图像。

参考文献
[1] GANDO G, YAMADA T, SATO H, et al. Fine-tuning deep convolutional neural networks for distinguishing illustrations from photographs[J]. Expert Systems with Applications, 2016, 66: 295–301. DOI:10.1016/j.eswa.2016.08.057
[2] MCCLURE P, KRIEGESKORTE N. Representational distance learning for deep neural networks[J]. Frontiers in Computational Neuroscience, 2016, 10: 131.
[3] QU Y H, YU H, GONG X J, et al. On the prediction of DNA-binding proteins only from primary sequences: A deep learning approach[J]. PLoS One, 2017, 12(12): e0188129. DOI:10.1371/journal.pone.0188129
[4] HAN Y, KIM D. Deep convolutional neural networks for pan-specific peptide-MHC class I binding prediction[J]. BMC Bioinformatics, 2017, 18: 585. DOI:10.1186/s12859-017-1997-x
[5] ASAKURA T, DATE Y, KIKUCHI J. Application of ensemble deep neural network to metabolomics studies[J]. Analytica Chimica Acta, 2018, 1037: 230–236. DOI:10.1016/j.aca.2018.02.045
[6] RUMELHART D E, HINTON G E, WILLIAMS R J. Learning internal representations by error propagation[M]//RUMENHART D E, MCCELLAND J L. Parallel distributed processing: explorations in the microstructure of cognition. Cambridge: MIT Press, 1986: 318 − 362.
[7] CUN Y L, BOSER B, DENKER J S, et al. Handwritten digit recognition with a back-propagation network[C]//Proceedings of the 2nd international conference on neural information processing systems. Cambridge: MIT Press, 1990: 396 − 404.
[8] ZHANG K, ZUO W M, CHEN Y J, et al. Beyond a Gaussian Denoiser: residual learning of deep CNN for image denoising[J]. IEEE Transactions on Image Processing, 2017, 26(7): 3142–3155. DOI:10.1109/TIP.2017.2662206
[9] NOH H, HONG S, HAN B. Learning deconvolution Network for Semantic Segmentation[C]//Proceedings of 2015 IEEE International Conference on Computer Vision. Santiago, Chile: IEEE, 2015.