|
就在上个月底,深圳国家超级计算中心搞了个大动作——新一代超算系统“灵晟”全机测试完成了,最近相关论文一曝光,直接在全球科技圈炸了锅。 为什么大家这么激动?因为这台超算没有用一张GPU加速卡,纯靠CPU堆出了超过2EFlops的峰值性能。更关键的是,从处理器到互联网络,全都是中国自己搞出来的。 一、硬件规格拉满,245万个核心怎么堆出来的?先看看这台机器的硬实力。 灵晟系统由20480个计算节点构成,每个节点搭载2颗LX2处理器,全系统一共40960颗处理器。每颗LX2处理器集成两个计算芯粒,加起来有304个CPU核心。这么一算,全系统CPU核心总数超过245万个。 这还没完。节点之间通过名叫“灵渠”的高速网络互连,采用双平面多轨胖树拓扑,每个节点带宽高达1.6Tb/s。整个系统总共包含了47000颗CPU,分布在92个计算机柜里,还有36个网络机柜、428个存储节点,总存储容量达到650PB,存储带宽10TB/s。这套配置放在全球超算领域,绝对是顶级水平。 再说说核心的LX2处理器。这玩意儿基于ARMv9架构,每个核心都支持Arm的SVE和SME扩展指令,意味着它既能高效跑科学计算,也能直接干AI训练和推理的活儿。单颗LX2的FP64算力有60.3TFLOPS,BF16算力能达到240TFLOPS。 内存设计上也很有想法。每颗LX2集成了8个HBM高带宽内存,总共32GB,带宽高达4TB/s;同时还能搭配最高256GB的片外DDR5内存。这套设计思路和日本“富岳”超算的A64FX有点像,但LX2的步子迈得更大——在同一颗CPU里打通了高速缓存和大容量内存的界限。这样一来,CPU不用来回跟GPU搬数据,整个编程模型简单多了。 二、为啥非得走CPU-only的路?是倒退还是破局?肯定有人要问了:现在全球主流超算都是CPU+GPU异构架构,你硬走CPU-only路线,效率能行吗? 这个担心有一定道理。GPU在并行计算上的确比CPU能效更高、算力密度更大。比如马斯克xAI的Colossus集群,虽然实际利用率据说只有11%左右,但人家堆了50多万张GPU,理论算力摆在那里。 但是,灵晟的路子完全不一样。它有自己的一套逻辑,甚至可以说是在被逼无奈的情况下,走出了一条最聪明的路。 第一,被出口管制逼出来的自主可控。 从2022年开始,美国对华高端GPU出口限制一波接一波。高端英伟达GPU进不来,与其等着卡脖子,不如另起炉灶。灵晟从CPU、内存到互联网络全是中国技术,软硬件全栈自主可控,谁也别想掐断。 第三,实际跑起来效果相当惊艳。 用灵晟训练一个63亿参数的地球观测生成压缩模型时,BF16实际性能达到1.543EFlops。在石油勘探领域,GeoEast物探软件适配优化后的偏移成像性能,达到了主流GPU方案A100的1.88倍。这不是实验室数据,是实打实的应用落地。 三、性能超2EFlops,剑指世界第一灵晟的目标非常清晰——成为全球最快超算。 系统总设计师卢宇彤介绍,灵晟是世界首台持续性能超过2EFlops的FP64超级计算机,依托国产高性能CPU、片上高带宽内存、灵渠高速互连网络、全液冷散热等多项核心创新,实现了架构、性能、能耗、编程、扩展性和可靠性六大技术突破。 目前在TOP500榜单上排名第一的是美国劳伦斯利弗莫尔国家实验室的El Capitan,持续性能为1.809EFlops。一旦灵晟全部建成并正式上线,中国有望重回全球超算榜首。 不过话说回来,灵晟现阶段还处于建设期,全面上线可能还需要几年时间。而且从2019年起,中国就没再向TOP500提交过数据,外界想要独立验证这套系统的真实性能,目前还有点难度。 四、九大领域全面开花,算力转化成果已经落地值得一提的是,灵晟虽然还在建设中,应用成果已经铺开了。官方公布的九大领域联合创新成果包括遥感、材料、生物信息、气象、药物研发、石油勘探、人工智能、生命科学和电磁仿真。 在材料领域,深圳超算团队基于灵晟研发的XLSDFT软件,实现了一亿原子大规模第一性原理计算,并行扩展性达到81%,为新能源和半导体材料研发提供了强大的跨尺度仿真能力。在生物信息方面,中山大学团队依托灵晟完成了十万亿级化合物虚拟筛选,结合AI与强化学习,效率提升上千倍,单日筛选量突破十万亿,有力支撑了创新药研发和精准医疗。 五、不跟风GPU,走出自己的路回到最初的问题:灵晟的出现,意味着什么? 坦白说,这台机器不是要去正面硬刚GPU集群的算力密度。在纯粹的稠密AI计算上,灵晟的绝对算力确实比不上顶级GPU方案。但灵晟的价值不在于“赢”,而在于“有”——在外部技术封锁越来越紧的背景下,中国需要一套完全不依赖国外技术的超算系统。灵晟就是那个在关键时刻能顶上去的备份方案。 而且,灵晟探索出的“三算合一”理念——科学计算、工程计算、智能计算统一支撑——正在产生真正的科研和产业价值。在全球超算都往CPU+GPU异构方向狂奔的时候,中国硬生生走出了一条CPU-only的差异化路线,还跑出了2EFlops以上的性能。 这本身就值得好好想一想。
版权声明
“特别声明:以上作品内容(包括在内的视频、图片或音频)为用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user , the platform merely provides information storage space services.”
本文地址: https://www.amtbbs.org/thread-18220-1-1.html
|