【环球网科技报道 记者 李文瑶】近日,中科曙光联合西安交通大学科研团队,依托全国产十万卡AI超集群曙光8000,完成超大规模多喷口超声速射流高精度数值模拟,创下国际已知最大规模的同类仿真纪录。成果面向商业航天可重复使用火箭研究,为结构安全评估与防热设计提供高精度计算手段。
比纪录更值得关注的,是这项成果背后,国产算力正从“能跑”走向“好用”。曙光8000是中科曙光基于异构计算路线打造的AI超集群,采用异构计算架构,兼顾高精度数值模拟与人工智能训练推理,为AI4S研究提供计算基础。目前,它已适配近200项行业应用,覆盖30余个科研产业领域。在此次合作中,团队依托曙光8000,完成33喷口环形阵列三维高精度模拟。
从“测不全、抓不住、做不起”到“给出整个空间的模拟”
可重复使用火箭回收时,多台发动机并联工作,高温、高速尾焰相互干扰,形成复杂压力波动与热量分布。西安交通大学航天航空学院教授、博导,陕西省先进飞行器服役环境与控制重点实验室副主任姬兴说,33股射流相互作用,会使火箭底部喷嘴强烈振动,3000K高温还可能造成回流烧蚀,“安全是首要的,效率也很关键”。
但传统试验很难把这一问题研究清楚。西安交通大学博士生张红总结为六个字:测不全、抓不住、做不起。试验只能在箭体表面布置有限传感器,高频脉动压力难抓,缩比试验难同时复现真实尺寸、喷口间距、环境压力和马赫数,多机并联点火代价高、周期长、风险大。
此次仿真复现了多股尾焰交汇、干扰与混合过程,相当于为发动机群尾焰做了一次“超高清CT扫描”。团队可获取全场三维瞬态压力分布、高频脉动压力及频谱、壁面热流和温度分布、激波相互作用位置等关键数据,为箭体底部结构、防热设计和减重提供依据。张红说,仿真不是替代试验,而是补上试验给不了的那部分——试验负责定标校验,模拟负责扩展和推演。
算法“换道”:不是移植代码,而是让算法更好适配国产算力环境
挑战不只在规模。张红说,最大难点不是把代码“移植”过去,而是让高阶CFD算法与国产异构计算平台的软件环境、线程执行方式和数据访问特点相匹配,并将这种匹配保持到数万卡规模。他以厨房作比:厨师(计算单元)越来越快,但从冷库(显存)到案板的通道(带宽)没变宽,传统多层Runge-Kutta时间推进要让厨师反复跑冷库。到了几万余张卡,每张卡地盘变小,跟邻居交换边界数据的比例反而变大。
团队选择“换一套底层基础算法”:用气体动理学格式(GKS)的时空耦合特性,以单步二阶S1O2替代多层Runge-Kutta,每步只做一次残差构造、一次状态更新、一次边界交换;再通过算子融合、少存多算、SoA布局、通信与计算重叠,以及MPI+HIP框架,实现不依赖GPU-aware MPI即可在国产软件栈部署。张红说:“精度靠GKS的天赋,扩展靠少搬多算。”
最终,数万张国产智能芯片、6.774万亿网格,弱扩展效率99.01%、强扩展效率73.00%、吞吐率34.029 TCUPS。姬兴说,这不是把国外代码翻译到国产卡上,而是为国产卡的“脾气”精挑细选的一套基础算法。
数万卡协同:稳定性本身就是工程挑战
规模到了数万张芯片,系统稳定性成为另一道门槛。中科曙光研发工程师梁超说,超大规模CFD更强调计算、通信、存储和调度的全系统协同,对网络时延、大规模MPI通信效率、IO稳定性和资源调度都更敏感,“一个进程或一张卡慢了,就会影响整体性能”。平台通过数字孪生、全链路可观测、智能故障诊断等机制,保障长时间大规模任务稳定运行;并通过逐级扩展验证,持续校验计算结果、通信效率和资源利用。
姬兴印象最深的是大规模集成能力:“曙光8000能够成功组建起稳定的十万卡级并行计算环境,把这么多卡布局在紧凑空间下,令人印象深刻。”他还提到,国产软件环境为复杂CFD代码的直接部署提供了支撑,不再依赖国外CUDA生态。
这项成果不是终点。姬兴将项目分为“研、算、智、用”四阶段:前两阶段完成里程碑节点,下一步是用高精度数据集训练高效代理模型,把“算一次代价很大”变成“秒级给出工程可用估计”,并拓展到商业航天。国产算力的突破,不只是卡数纪录,更在于让重大科研问题可算、可验、可推演。
中科曙光研发工程师梁超介绍,在此次合作中,曙光8000不仅提供大规模国产异构算力,还提供国产软硬件协同运行环境,从编译、运行时、数学库、通信库到作业调度进行适配优化,并组织覆盖硬件、系统软件、并行计算、通信、存储、应用优化等方向的技术团队联合攻关。
“曙光在这项工作中不仅是提供算力,更希望发挥‘算力底座+软件环境+规模验证+专业技术服务’的综合能力,与应用团队共同把这套系统真正用起来、跑起来,并进一步发挥超大规模国产算力的应用价值。”梁超表示,从气象预报到商业航天流体研究,国产算力正深入更多科研产业场景。