随着大模型架构从 Dense 向 MoE 演进,并融合训练与推理一体化范式,系统对互连网络在节点规模、带宽密度、通信时延和运行稳定性等方面提出更高要求。高性能互连已成为制约超大规模AI集群效率与扩展能力的关键基础设施。
当前主流Scale-up方案依赖机柜内铜缆互连。尽管铜互连在成本与时延上具备优势,但其传输距离受限,迫使系统采用极致高密度、强耦合的“AI Rack”架构,导致制造、布线、供电、散热与运维复杂度随规模急剧上升。当集群扩展至百卡乃至千卡级别时,铜互连的物理覆盖能力已接近极限。因此,从铜到光的演进,成为Scale-up迈向更大规模、更高可运维性的必然路径。
阿里云于2025年10月正式发布 UPN512(Ultra-Performance Network for 512 xPU)全光Scale-up架构白皮书,提出基于单层以太网光互连的全新设计,旨在构建“大规模、高性能、高可靠、低成本、易扩展”的xPU互联系统。
UPN512通过光互连直接连接xPU与交换机,采用单层CLOS拓扑实现512颗xPU的全互联,并为未来扩展至1K+节点预留架构空间。该方案彻底消除机柜内高速铜缆,显著降低布线复杂度、散热负担、供电需求及运维成本。
NPO(Near-Packaged Optics,近封装光学)是UPN512架构的核心使能技术。它将光电引擎部署在靠近主芯片的位置,采用线性直驱(Linear Direct Drive)技术,省去传统依赖先进制程的DSP芯片,从而实现:
功耗降低50%以上
成本下降30%
端到端时延与铜互连相当
供应链更安全可控
相比LPO(Linear-drive Pluggable Optics),NPO提供更高的带宽密度,并降低对主芯片SerDes性能的要求,更利于生态发展;相比CPO(Co-Packaged Optics),NPO采用标准LGA连接器,保持光模块的开放解耦特性,避免主芯片与光引擎绑定,更易被终端用户采纳。
基于NPO光互联系统示意图
阿里云选择从3.2T NPO切入研发,基于OIF标准封装,在仅22.5mm × 35.1mm的尺寸内实现3.2Tb/s传输带宽。通过标准LGA连接器,光引擎与主芯片实现物理与电气解耦,延续了开放、繁荣的光模块生态。该模块同时支持硅光(SiPh)与VCSEL两种技术路线,可灵活适配不同距离与应用场景。
阿里云3.2T NPO模块形态图
基于硅光方案的3.2T NPO内部结构
近日,阿里云宣布全球首款基于OIF标准封装的3.2T NPO模块成功点亮,标志着全光Scale-up迈入工程落地新阶段。
该模块基于两颗16通道收发一体硅光芯片,搭配线性直驱Driver/TIA芯片,采用成熟的2D封装工艺,将光子集成电路(PIC)与电子集成电路(EIC)倒装集成于mSAP基板上,具备快速量产潜力。
阿里云3.2T NPO全功能模块(内部芯片布局图)
关键性能指标如下:
发送端:光眼图性能优异,典型TDECQ仅为1.9dB,全面符合IEEE 802.3bs DR4标准,可与传统带DSP的DR4光模块无缝互通,支持新旧架构混合部署;
接收端:在1E-6误码率下,所有通道灵敏度优于-5dBm,确保充足链路预算;
功耗:典型功耗约20W,显著低于同带宽DSP方案。
发送端光眼图
接收端灵敏度
阿里云已将3.2T NPO技术率先应用于新一代国产四芯片交换机。该设备单机集成4颗25.6T国产交换芯片,总交换容量达102.4T,并可通过升级至4×102.4T芯片平滑演进至409.6T平台。
创新之处在于:每颗芯片以细粒度端口模式(如256×100G)运行,系统内部将物理端口的多条lane拆分并连接到不同交换芯片,从而最大化单芯片Radix利用率,提升组网规模与灵活性。对外仍以400G/800G等主流端口形态交付,兼容现有MPO光纤布线体系。
为实现高密度交叉互联,该交换机采用基于NPO的系统级光互连设计:
NPO模块紧邻交换芯片部署,在芯片侧完成电-光转换,大幅缩短电通道、减少信号损耗;
光信号经前部集成的Shuffle光交叉模组汇聚后输出至面板;
交换模组与Shuffle模组间采用快插式光连接,支持模组级热插拔与独立更换,将故障影响范围收敛至最小单元,显著提升现场运维效率与系统可用性。
目前,该交换机已完成整机上电与核心功能验证,NPO端口实现稳定链路建立,项目正式进入长期可靠性测试阶段。
基于NPO的国产四芯片交换机硬件架构图
基于NPO的交换模组实物图(包含散热器)
基于NPO的交换模组实物图(不含散热器)
阿里云网络研发团队正聚焦NPO在长期运行下的稳定性与故障率验证——这是决定全光Scale-up能否规模化落地的关键。同时,团队正联合多家头部互联网企业,在ODCC(开放数据中心委员会) 推动6.4T UPO(Ultra Performance Optics) 标准立项,旨在构建下一代高性能、低功耗、开放解耦的光互连生态。相关技术规范预计将于2026年发布,敬请期待。