人工智能和下一代通信技术的发展使得高性能计算需求不断增长,从而促进了硬件技术的快速发展。光学计算可以通过克服电子学固有的限制来显著加快计算速度。与电路技术不同,光子电路具有超宽带、高频、低能耗等特点[1-2]。此外,光具有波长、偏振和空间模式等多个维度,可以实现数据并行处理,与传统的冯·诺伊曼计算机相比,计算速度明显提高。光学神经网络集合了光学计算的这些优点,利用光子集成神经网络芯片,以及深度学习算法,实现机器学习相关应用,并有望在服务器、自动驾驶等场景应用中完成图像分类、目标检测等任务,其作为下一代人工神经网络具有广阔的应用前景。
光学全连接神经网络与光学卷积神经网络都属于前馈神经网络,其基本特征是神经网络各层之间的信息由输入层向输出层单向传递[3]。光学前馈神经网络的矩阵运算最早是采用Reck等在1994年提出的三角分解算法。该算法证明了由分束器、移相器所搭建的三角形网络能够实现任意参数和规模的酉矩阵[4]。随后Clements等在其方案的基础上进行优化设计,提出了矩形分解方案,即可以利用马赫−曾德尔干涉仪(Mach-Zehnder interferometer,MZI)和可变衰减器实现任意矩阵[5]。20世纪80年代末到90年代初,硅基光波导技术在绝缘衬底上的硅(SOI)工艺中实现了低损耗波导。通过微纳加工技术,制备出硅基光波导器件,包括光波导、耦合器和光调制器等。随着低损耗光波导[6]、高效光纤到芯片耦合器[7]、快速电光调制器[8]、宽带硅锗光电探测器[9]等硅光子器件的发展,构建高性能集成硅基光学神经网络已成为可能。近年来随着互补金属氧化物半导体(complementary metal oxide semiconductor,CMOS)集成技术的不断发展,硅基光波导技术开始与CMOS工艺相结合,为大规模制造和可复制光子芯片打开了大门。2017年,Shen等[10]成功研制了世界上第一款光学的全连接神经网络芯片,实现了4个元音的分类。2018年,Bagherian等[11]在此光学全连接神经网络的基础上提出了通过光学延迟线的方式实现光学的卷积神经网络。利用硅光子技术将光子结构与电子器件同时集成在同一硅衬底上[12],使光子器件能够以与微电子芯片相同的规模进行集成和批量生产,同时具有光的计算速度和最小的能耗。
本文首先介绍了光学全连接神经网络与光学卷积神经网络算法原理,介绍了两种光学神经网络的实现方法与结构;随后采用pytorch软件与INTERCONNECT软件,对两种光学神经网络结构进行了仿真,并基于仿真结果,在图像识别准确率、网络复杂度和能耗三方面对两种光学神经网络的性能进行了对比,以期说明光学全连接神经网络与光学卷积神经网络各自的优缺点;最后对两种光学神经网络在可扩展性和与现有系统集成方面进行探讨,从而为以后光学神经网络的发展提供借鉴。
1 神经网络技术光学神经网络是在人工神经网络的基础上发展起来的,其通过光学的方式来代替电子的方式进行神经网络运算[13]。光学神经网络的算法组成部分与人工神经网络的基本一致。
1.1 全连接神经网络全连接神经网络(fully connected neural network,FCNN)是一种最基础的人工神经网络结构。图1(a)为全连接神经网络结构,其中:在FCNN中,输入层与输出层之间的每个神经元都相互连接,形成一个密集的连接结构。如图1(a)所示,FCNN包含输入层、隐藏层、输出层和激活函数。输入层负责接收原始数据,并将其传递给下一层,x[p]表示第p个输入数据。输入层的神经元数量取决于输入数据的维度。隐藏层是FCNN中的中间层,可以有多个。隐藏层的神经元数量可以自由设定,每个神经元都与前一层和后一层的所有神经元相连接。输出层是FCNN的最后一层,负责输出网络的预测结果,y[q]表示第q个输出数据。输出层的神经元数量取决于任务的类型。激活函数用于引入非线性因素,使得神经网络能够拟合复杂的非线性关系。常见的激活函数有ReLU、Sigmoid、Tanh等[14]。FCNN能够学习输入数据的复杂特征,其结构简单,适用性广泛,可用于图像分类、自然语言处理、回归任务等[15]。例如,FCNN对鸢尾花数据集的识别准确率可以达到90%以上,对波士顿房价数据集的预测值与测试集基本拟合,但FCNN容易出现过拟合,在处理大规模数据集和复杂任务时,其可能不是最优的选择。
|
图 1 神经网络结构 Figure 1 Neural network structure |
卷积神经网络(convolutional neural networks,CNN)是在FCNN的基础上发展起来的。Yann 在1998年创建了一个手写数字识别网络LeNet-5,该网络建立在日本科学家福岛邦彦的工作基础上,描述了CNN的原始组成部分,可以被视为CNN的开端[16]。
如图1(b)所示,其主要包括卷积、池化、非线性和全连接层。在结构上,CNN使用卷积操作进行特征提取,从而减少了参数数量和计算复杂度。此外,CNN还使用了池化操作来降低图像的分辨率,从而进一步减少参数数量和计算复杂度。在应用场景上,尤其在视觉应用领域,CNN具有独特的特征提取和识别能力,在对图像进行检测,分类和分割中表现出突出的性能优势[17]。如其在LFW数据集上对人脸的识别率可以达到99%,在COCO数据集上的目标检测精度可以达到65.4 mAP,但其训练需要大量的计算资源,并有较高的硬件支持需求。
2 光学神经网络的实现光学神经网络中最重要的组成部分是光学矩阵乘法器,它可以对输入的光学参数进行矩阵乘法运算,最后输出相应的光学参数[18]。这个过程与电子计算机中的输入参数乘以权重矩阵,然后得到输出结果相类似,只不过在光学神经网络中这个过程是以光速进行的。
通过由MZI集成的光子芯片,可以执行光学矩阵乘法器的功能。对于一个任意的
| $ {\boldsymbol{M}} = {\boldsymbol{U}}{\boldsymbol{\varSigma}} {{\boldsymbol{V}}^{\mathrm{T}}} $ | (1) |
式中:
图2(a)给出了MZI的结构图,它可以由2个直波导和2个3 dB的定向耦合器组成,其中通过热光移相器调节光波导的折射率,引入内移相器
|
图 2 光学神经网络结构 Figure 2 Optical Neural Network Architecture |
| $\begin{split} {\boldsymbol{ T}}(\theta ,\varphi ) = & \dfrac{1}{{\sqrt 2 }}\left( {\begin{array}{*{20}{c}} 1 & {\rm{i}} \\ {\rm{i}} & 1 \end{array}} \right)\left( {\begin{array}{*{20}{c}} {{{\rm{e}}^{{\rm{i}}\theta }}} & 0 \\ 0 & 1 \end{array}} \right)\dfrac{1}{{\sqrt 2 }}\left( {\begin{array}{*{20}{c}} 1 & {\rm{i}} \\ {\rm{i}} & 1 \end{array}} \right)\left( {\begin{array}{*{20}{c}} {{{\rm{e}}^{{\rm{i}}\varphi}}} & 0 \\ 0 & 1 \end{array}} \right) \\ =& \dfrac{1}{2}\left( {\begin{array}{*{20}{c}} {{{\rm{e}}^{{\rm{i}}\varphi}}({{\rm{e}}^{{\rm{i}}\theta }} - 1)} & {{\rm{i}}({{\rm{e}}^{{\rm{i}}\theta }} + 1)} \\ {{{\rm{e}}^{{\rm{i}}\varphi}}{\rm{i}}({{\rm{e}}^{{\rm{i}}\theta }} + 1)} & {1 - {{\rm{e}}^{{\rm{i}}\theta }}} \end{array}} \right) \\ =& {{\rm{e}}^{{\rm{i}}\dfrac{{{\text{π}} + \theta }}{2}}}\left( {\begin{array}{*{20}{c}} {{{\rm{e}}^{{\rm{i}}\varphi}}\sin \dfrac{\theta }{2}} & {\cos \dfrac{\theta }{2}} \\ {{{\rm{e}}^{{\rm{i}}\varphi}}\cos \dfrac{\theta }{2}} & { - \sin \dfrac{\theta }{2}} \end{array}} \right) \end{split} $ | (2) |
由式(2)可知其传输矩阵是一个旋转矩阵,因此MZI在光学矩阵乘法运算起到了重要的作用。对于特定的FCNN,通过提取其权重矩阵,进行奇异值分解和旋转矩阵分解后,提取出
光学神经网络中的非线性单元也是不可或缺的一部分,非线性运算的加入能够让整个网络处理更加复杂的任务。光学神经网络中的非线性单元一般可以由半导体、石墨烯可饱和吸收器构成,它们可以直接集成到光学神经网络中[21-22]。
而对于光学卷积神经网络,由于其多了卷积层和池化层,为了实现光学卷积操作,需要使用光学延迟线的方法。对于池化层则可以通过步长为2的卷积操作来代替。其结构如图2(b)所示。首先对要识别的图像进行预处理,每个图像被分割为很多个卷积核大小的片面,每个片面采用相干光脉冲序列的形式,其幅度编码图像中每个片面像素的强度。然后把每个片面的像素展开成一列,按照时间序列的形式通过纳米光子芯片对每个片面进行卷积,因此卷积后的每个片面也是按照时间序列的方式输出的,输出接口的数量等于卷积核的数量。输入信号在经过一层卷积后,输出信号被放大后通过一组光学延迟线,接着进行下一层光学卷积操作。图2(c)展示了当一个
本文在pytorch环境下构建了特定的FCNN与CNN。使用ReLU函数来代替光学神经网络中的非线性层,分别使用MNIST和Fashion-MNIST数据集,其中MNIST数据集是0~9的灰质手写数字图片,而Fashion-MNIST数据集图像更为复杂,包含了10个类别的图像,分别是:T-shirt(T恤),trouser(牛仔裤),pullover(套衫),dress(裙子),coat(外套),sandal(凉鞋),shirt(衬衫),sneaker(运动鞋),bag(包),ankle boot(短靴)。它们的训练集和测试集的样本数和大小一样,分别为
通过对特定神经网络训练,使用Adam优化器和反向传播算法来计算梯度。同时为了使模型与光子神经网络更接近,在神经网络中没有添加权重偏置且每一层的输出数据也没有进行归一化处理。当神经网络训练完成后,通过提取优化完成的权重参数,经过分解可以得到光学神经网络中需要的
INTERCONNECT软件由于包含丰富的光电器件和光学集成设计工具包,可用于设计、仿真和分析多种复杂光学系统。本文在INTERCONNECT中对光学神经网络进行硬件仿真。连接多个MZI单元结构组成光学矩阵乘法器如图3所示,其中CW为连续激光器,P为检测器,可以检测功率和相位。图中省略了一些连接线,系统工作波长为
|
图 3 光学矩阵乘法器 Figure 3 Optical matrix multiplier |
在两种光学神经网络使用MZI数量基本相同的情况下,构建相对应的FCNN与CNN,采用相同的训练次数,通过测试数据集检测图像识别准确率。
首先构建特定的FCNN模型,激活函数和权重优化方式不变。通过图像插值算法,在保证图像基本特征不变的情况下降低图像分辨率,输入可以设为9×9个节点,一个隐藏层为72节点,输出为10节点。图4(a)给出了FCNN的仿真结构,图4(b)和4(c)给出了FCNN的准确率与其训练次数的曲线,这里给出了30次训练的结果。结果表明,MNIST数据集准确率最高可以达到95%,Fashion-MNIST数据集准确率最高可以达到84%。
|
图 4 FCNN仿真结果 Figure 4 Simulation of fully connected neural network |
光学全连接神经网络主要包括光学矩阵乘法单元。光学矩阵乘法主要通过MZI连接实现,对一个
构建特定的CNN模型,包含三层卷积和一个全连接层,每一层的末尾都用ReLU函数进行激活。通过训练数据集优化CNN的权重参数,其中包括每层卷积核的权重参数和全连接层中的2个权重矩阵参数。如图5(a)所示,第一层卷积使用4个大小为2
|
图 5 CNN仿真结果 Figure 5 Convolutional neural network simulation |
光学卷积神经网络其光学矩阵乘法部分主要由卷积核的大小和数量决定,在进行光学卷积运算时通过把卷积运算转换成行矩阵和列矩阵相乘的形式,对每一通道进行单独卷积,然后每两层通道卷积后的结果可以通过一个MZI耦合相加。当
| $\begin{split} {H_N} * {A_N} = & \sum\limits_{j = 1}^C \left[ {\begin{array}{*{20}{c}} {{h_{j1}}}&{{h_{j2}}}& \cdots &{{h_{j{N^2}}}} \end{array}} \right] \times \\ & \left[ {\begin{array}{*{20}{c}} {{a_{j1}}} \\ {{a_{j2}}} \\ \vdots \\ {{a_{j{N^2}}}} \end{array}} \right] \end{split}$ | (3) |
式中:j表示第j通道。要实现卷积核
在使用MZI数量基本相同的情况下,光学卷积神经网络对图像识别的准确率比光学全连接神经网络对图像识别的准确率要高。相比于全连接神经网络,光学卷积神经网络在算法层面上,通过参数共享的方式,大大减少了参数数量,提高了模型的效率和泛化能力;其次,通过局部感受野的设计,能够更好地捕获输入数据的局部模式和结构,这使得它们对于图像具有空间局部相关性的数据处理更有效,对图像识别的效果也更好。
3.2 网络复杂度的对比在保证相同图像识别准确率的情况下,构建光学全连接神经网络与光学卷积神经网络,对比其网络复杂度。
把图4中FCNN的输入变为28×28个节点,隐藏层变为64个节点,此时FCNN识别MNIST数据集准确率最高可以达到98%,Fashion-MNIST数据集准确率最高可以达到87%。但构建的光学矩阵乘法单元大约需要31万多个MZI。
光学卷积神经网络不仅包括光学矩阵乘法部分还包括光学延迟线部分。为了方便计算光学延迟线的延迟量,设
行延迟量和列延迟量的递归公式为
| $ \Delta {t_i} = \Delta {t_{i - 1}} \times {S_{i - 1}} $ | (5) |
| $ \Delta {T_i} = \Delta {T_{i - 1}} \times {S_{i - 1}} $ | (6) |
当输入图像的尺寸为
| $ \Delta {t_1} = \dfrac{1}{f} $ | (7) |
| $ \Delta {T_1} = \dfrac{1}{f} \times \left(\dfrac{{W - {N_1} + 2P}}{{{S_1}}} + 1\right) $ | (8) |
表1列出了图5光学卷积神经网络每层的最大延迟量。可以看出随着光学卷积神经网络卷积层数越多,网络所需的延迟量也越来越大,此时网络的规模也随之扩大。
|
| 图像尺寸 | 卷积核大小 | 步长 | 列延迟 | 行延迟 | 最大延迟量 |
| 第一层 | 14×14 | 3×3 | 2 | |||
| 第二层 | 7×7 | 3×3 | 2 | |||
| 第三层 | 3×3 | 3×3 |
| 网络层 | 图像尺寸 | 卷积核大小 | 步长 | 列延迟 | 行延迟 | 最大延迟量 |
| 第一层 | 14×14 | 3×3 | 2 | |||
| 第二层 | 7×7 | 3×3 | 2 | |||
| 第三层 | 3×3 | 3×3 |
光学卷积神经网络中多出的光学延迟线部分虽然会增加整个网络的复杂度,但是影响光学神经网络误差的主要因素是MZI中的数值偏差,神经网络中MZI数量越少系统的稳定性越高。而在对图像识别率大致相同的情况下,光学卷积神经网络中MZI的数量要比光学全连接神经网络中少得多。
3.3 能耗的对比在保证相同图像识别准确率的情况下,构建光学全连接神经网络与光学卷积神经网络,对比其能耗。
光学卷积神经网络中的光学延迟线会产生插入损耗和回波损耗,但随着对光学延迟线研究的不断深入,这种损耗也将变小[23]。同时不论是在光学卷积神经网络还是光学全连接神经网络中,由于相互连接的MZI都是通过硅基光波导集成的,所以还会存在波导损耗[24]。但这些都不是本文讨论的重点。它们的能耗主要是由于实现非线性效应产生的,虽然有不同的材料和方式实现非线性激活,但对于光学神经网络中每一个非线性单元每次激活所用能量相同。假如使用石墨烯可饱和吸收剂,则输入功率
对光学全连接神经网络与光学卷积神经网络的仿真分析,为现阶段深度神经网络光子加速器的应用提供了借鉴。由于大多数复杂网络模型如Inception V2、FCN(全卷积网络)等中包含全连接神经网络或卷积神经网络结构,因此也为设计复杂的光学神经网络结构提供了在图像识别准确率、网络复杂度和能耗方面的参考。
目前对于光学神经网络的研究还处于探索阶段,光学全连接神经网络与光学卷积神经网络在实际开发过程中仍然面临诸多挑战。一方面,光学器件固有的噪声如相位编码噪声和热串扰,还有纳米结构的制造误差会导致器件的随机参数漂移,从而增加了扩大光子芯片规模的难度;另一方面,为了触发光学非线性,通常需要较高的光功率强度和特殊的非线性材料,这增加了网络的功耗和控制难度。随着集成光电混合技术和先进封装技术的进步和光神经网络芯片的一体化流片工艺的突破,通过光子神经网络处理器与现有电处理器的融合发展,大规模的光电子集成技术可为光神经网络芯片实现低功耗和高速率的信息处理提供支撑。2021年,曦智科技发布了其最新光子计算处理器PACE(photonic arithmetic computing engine),其单个光子芯片中集成超过
| [1] | 项水英, 宋紫薇, 高爽, 等. 光神经形态计算研究进展与展望(特邀)[J]. 光子学报, 2021, 50(10): 1020001. |
| [2] | XU R Q, LV P, XU F J, et al. A survey of approaches for implementing optical neural networks[J]. Optics & Laser Technology, 2021, 136: 106787. |
| [3] | 陈宏伟, 于振明, 张天, 等. 光子神经网络发展与挑战[J]. 中国激光, 2020, 47(5): 0500004. |
| [4] | RECK M, ZEILINGER A, BERNSTEIN H J, et al. Experimental realization of any discrete unitary operator[J]. Physical Review Letters, 1994, 73(1): 58–61. DOI:10.1103/PhysRevLett.73.58 |
| [5] | CLEMENTS W R, HUMPHREYS P C, METCALF B J, et al. Optimal design for universal multiport interferometers[J]. Optica, 2016, 3(12): 1460–1465. DOI:10.1364/OPTICA.3.001460 |
| [6] | LEE H, CHEN T, LI J, et al. Ultra-low-loss optical delay line on a silicon chip[J]. Nature Communications, 2012, 3: 867. DOI:10.1038/ncomms1876 |
| [7] | NOTAROS J, PAVANELLO F, WADE M T, et al. Ultra-efficient CMOS fiber-to-chip grating couplers[C]//Optical Fiber Communications Conference and Exhibition. Anaheim: IEEE, 2016: 1 − 3. |
| [8] | XIAO X, XU H, LI X Y, et al. High-speed, low-loss silicon Mach-Zehnder modulators with doping optimization[J]. Optics Express, 2013, 21(4): 4116–4125. DOI:10.1364/OE.21.004116 |
| [9] | VIVIEN L, POLZER A, MARRIS-MORINI D, et al. Zero-bias 40 Gbit/s germanium waveguide photodetector on silicon[J]. Optics Express, 2012, 20(2): 1096–1101. DOI:10.1364/OE.20.001096 |
| [10] | SHEN Y C, HARRIS N C, SKIRLO S, et al. Deep learning with coherent nanophotonic circuits[J]. Nature Photonics, 2017, 11(7): 441–446. DOI:10.1038/nphoton.2017.93 |
| [11] | BAGHERIAN H, SKIRLO S, SHEN Y C, et al. On-chip optical convolutional neural networks[J]. arXiv: 1808.03303, 2018. |
| [12] | ATABAKI A H, MOAZENI S, PAVANELLO F, et al. Integrating photonics with silicon nanoelectronics for the next generation of systems on a chip[J]. Nature, 2018, 556: 349–354. DOI:10.1038/s41586-018-0028-z |
| [13] | BAI B W, SHU H W, WANG X J, et al. Towards silicon photonic neural networks for artificial intelligence[J]. Science China Information Sciences, 2020, 63(6): 160403. DOI:10.1007/s11432-020-2872-3 |
| [14] | APICELLA A, DONNARUMMA F, ISGRÒ F, et al. A survey on modern trainable activation functions[J]. Neural Networks, 2021, 138: 14–32. DOI:10.1016/j.neunet.2021.01.026 |
| [15] | 张驰, 郭媛, 黎明. 人工神经网络模型发展及应用综述[J]. 计算机工程与应用, 2021, 57(11): 57–69. DOI:10.3778/j.issn.1002-8331.2102-0256 |
| [16] | LECUN Y, BOTTOU L, BENGIO Y, et al. Gradient-based learning applied to document recognition[J]. Proceedings of the IEEE, 1998, 86(11): 2278–2324. DOI:10.1109/5.726791 |
| [17] | BHATT D, PATEL C, TALSANIA H, et al. CNN variants for computer vision: history, architecture, application, challenges and future scope[J]. Electronics, 2021, 10(20): 2470. DOI:10.3390/electronics10202470 |
| [18] | CHENG J W, ZHOU H L, DONG J J. Photonic matrix computing: from fundamentals to applications[J]. Nanomaterials, 2021, 11(7): 1683. DOI:10.3390/nano11071683 |
| [19] | BOGAERTS W, PÉREZ D, CAPMANY J, et al. Programmable photonic circuits[J]. Nature, 2020, 586(7828): 207–216. DOI:10.1038/s41586-020-2764-0 |
| [20] | HARRIS N C, MA Y J, MOWER J, et al. Efficient, compact and low loss thermo-optic phase shifter in silicon[J]. Optics Express, 2014, 22(9): 10487–10493. DOI:10.1364/OE.22.010487 |
| [21] | BAO Q L, ZHANG H, NI Z H, et al. Monolayer graphene as a saturable absorber in a mode-locked laser[J]. Nano Research, 2011, 4(3): 297–307. DOI:10.1007/s12274-010-0082-9 |
| [22] | CHENG Z Z, TSANG H K, WANG X M, et al. In-plane optical absorption and free carrier absorption in graphene-on-silicon waveguides[J]. IEEE Journal of Selected Topics in Quantum Electronics, 2014, 20(1): 43–48. DOI:10.1109/JSTQE.2013.2263115 |
| [23] | 张春熹, 张晓青, 胡姝玲. 光纤延迟线应用研究动态[J]. 中国激光, 2009, 36(9): 2234–2244. |
| [24] | ZILKIE A J, SRINIVASAN P, TRITA A, et al. Multi-micron silicon photonics platform for highly manufacturable and versatile photonic integrated circuits[J]. IEEE Journal of Selected Topics in Quantum Electronics, 2019, 25(5): 1–13. |
| [25] | LI H, ANUGRAH Y, KOESTER S J, et al. Optical absorption in graphene integrated on silicon waveguides[J]. Applied Physics Letters, 2012, 101(11): 111110. DOI:10.1063/1.4752435 |
2025, Vol. 47
Issue (2): 68-75


