清华大学提出 PMoE 新架构,将混合专家模型思想引入集成光计算
随着人工智能模型规模持续增长,计算系统不仅需要处理更大的网络,还要在同一平台上应对多种任务。光计算凭借高带宽、低能耗和天然并行等优势,为突破传统电子计算的能效与带宽瓶颈提供了新路径。然而,现有光学神经网络大多依赖增加网络深度来提升性能,容易受到线性光学结构、器件控制复杂度以及传输损耗和误差累积等因素制约;面向多任务时,不同任务往往还需要独立硬件或重新配置光学权重。
近日,清华大学电子系陈宏伟团队与合作者提出一种片上光子混合专家架构PMoE(Photonic Mixture-of-Experts),将混合专家模型思想引入集成光计算,为可扩展、多任务片上光学神经网络提供了新思路。
PMoE的核心思想是让多个光子专家协同工作及参数扩展。系统前端由多个并行、无源的衍射型光子专家网络组成;轻量级路由权重决定输入信号被送往哪些专家,以及各专家结果的加权组合;随后,统一的共享数字网络对光学特征进行进一步处理。通过将动态路由与静态光学特征提取解耦,系统在运行中无需改变物理光学权重,只需调整输入路由即可切换任务,从而避免为每项任务分别配置一套光学处理器。
研究团队采用MNIST、Fashion-MNIST和Extended-MNIST三个数据集开展多任务实验。采用硬路由的稀疏PMoE平均分类准确率达到94.8%,显著高于传统光学及数字卷积神经网络基线。采用加权路由后,密集PMoE通过多个光子专家协同,将平均准确率进一步提升至97.1%。与为不同任务分别配置的光学神经网络相比,PMoE在提高分类准确率的同时,将后端数字参数量减少约67%。实验结果还表明了基于“宽度”的光学神经网络参数扩展思路的优势和应用能力。
近日,清华大学电子系陈宏伟团队与合作者提出一种片上光子混合专家架构PMoE(Photonic Mixture-of-Experts),将混合专家模型思想引入集成光计算,为可扩展、多任务片上光学神经网络提供了新思路。
PMoE的核心思想是让多个光子专家协同工作及参数扩展。系统前端由多个并行、无源的衍射型光子专家网络组成;轻量级路由权重决定输入信号被送往哪些专家,以及各专家结果的加权组合;随后,统一的共享数字网络对光学特征进行进一步处理。通过将动态路由与静态光学特征提取解耦,系统在运行中无需改变物理光学权重,只需调整输入路由即可切换任务,从而避免为每项任务分别配置一套光学处理器。
研究团队采用MNIST、Fashion-MNIST和Extended-MNIST三个数据集开展多任务实验。采用硬路由的稀疏PMoE平均分类准确率达到94.8%,显著高于传统光学及数字卷积神经网络基线。采用加权路由后,密集PMoE通过多个光子专家协同,将平均准确率进一步提升至97.1%。与为不同任务分别配置的光学神经网络相比,PMoE在提高分类准确率的同时,将后端数字参数量减少约67%。实验结果还表明了基于“宽度”的光学神经网络参数扩展思路的优势和应用能力。
天津融诺科技有限公司&辽宁融诺电子商务有限公司 主办 技术支持:北方云数据 www.aw9.net
地址:天津市武清区河西务镇 电子邮件: db#aw9.net


