

NEC SX-Aurora TSUBASA是日本电气(NEC)面向后百亿亿次时代推出的向量超级计算机系列,其核心创新在于将传统向量架构从专用整机解耦为PCIe加速卡形态。该系列搭载基于ARMv8的Vector Engine(VE),每颗VE集成8个向量核心,配备高达48GB的HBM2高带宽内存,内存带宽突破1.2TB/s,远超同期GPU方案。这种设计有效缓解了科学计算中常见的“内存墙”问题,使向量处理器擅长的长循环、高数据复用型负载得以充分发挥。与x86+GPU异构模式相比,SX-Aurora TSUBASA在保持低功耗的同时,提供了更优的标量-向量协同效率。
从技术原理看,VE作为独立计算节点运行完整操作系统,通过PCIe Gen3 x16与x86主机通信,形成“矢量引擎+标量主机”的异构模型。编程上支持NLC(NEC Language Compiler)和OpenMP、MPI等标准,并可通过AVEO库将计算任务自动卸载至VE。其向量指令集支持256位宽数据通路,单周期可处理8个双精度浮点操作,峰值性能达2.15 TFLOPS(双精度)。这种架构对气象预报、计算流体动力学、分子动力学等依赖高带宽、低分支的负载尤为友好。
选型时需重点关注三方面:其一,内存容量与带宽匹配,VE的48GB HBM2适合中等规模数据集,若问题规模超出则需多卡集群;其二,主机适配性,需搭配支持PCIe Gen3的x86服务器,并确保BIOS与驱动兼容;其三,软件生态,NEC提供针对VE优化的数学库和编译器,但部分商业应用仍需移植。对于已投资x86集群的用户,可通过NEC总代理获取兼容性评估与技术支持,实现渐进式升级。
典型应用场景包括:日本气象厅的全球天气预报系统、东京大学的流体仿真、以及汽车行业的碰撞模拟。在AI推理领域,VE的向量单元可高效执行卷积与矩阵运算,尤其适合批量小、实时性高的边缘推理任务。与NVIDIA GPU相比,SX-Aurora TSUBASA在双精度浮点性能和内存带宽上具备优势,且无需重写CUDA代码,但生态丰富度稍逊。其能效比在特定科学计算中可达GPU方案的1.5倍以上。
从行业洞察看,NEC通过SX-Aurora TSUBASA延续了自SX系列以来的向量血脉,同时以PCIe卡形态融入主流服务器生态,降低了超算入门门槛。该产品尤其适合需要高内存带宽、低延迟通信的HPC场景,如气候建模、电磁场分析、量子化学等。随着ARM生态的成熟和HBM成本下降,这种“标量+向量”异构模式有望在超算领域开辟差异化路径,为追求能效与精度平衡的用户提供新选择。



