AET原创

算力登峰 定数风云:曙光8000气象实践,国产数值预报实现关键跨越

发布日期:2026-09-22
来源:中科曙光

图片 1.jpg

当前国内科学计算产业正遭遇共性落地难题:大量算法成果止步于论文与 Demo,难以嵌入高可靠业务系统;国产科研软件与算力底座适配不足,硬件跑分亮眼却在实际应用中跑不快,成为阻碍国产科学计算产业化的核心堵点。    2026 年 9 月 15日,位于郑州的国家超算互联网核心节点传来关键实践样本:中科曙光联合中国气象局地球系统数值预报中心,依托十万卡级超智融合集群曙光 8000,实现我国自主 MCV 大气模式全球 5 公里分辨率、未来10天预报的准业务化运行,综合性能迈入全球第一梯队。这一突破不只是气象预报能力的重大跃升,更是国产超算支撑国家级气象业务落地的标志性事件。曙光 8000 以气象数值预报作为重量级 “压力测试场”,成功验证 “国产算力底座 + 行业自研应用 + AI 赋能” 完整闭环,为我国高分辨率气象模式从科研试验迈向生产级业务,打造出可复制的产业范式。

图片 2.jpg

痛点:高分辨率气象业务不是 “算力堆叠”,业务场景对系统提出严苛考验

更高精度气象预报不等于单纯的算力堆砌,气象领域属于 “生产级科学业务”,区别于普通科研试验。普通科研可以容忍任务失败、长时间迭代,但气象预报属于不间断运行的生产系统:汛期、重大活动期间系统不能中断,必须在规定时间内输出准确预报产品,一旦宕机将直接影响防灾减灾决策。

过去不少超算应用项目陷入误区:重硬件建设、轻应用适配;重跑分指标,轻业务可靠性。气象恰好是检验这套体系的 “皇冠级试金石”。一方面要运行 64 位高精度传统数值求解,另一方面可借助 AI 弥补大气初始观测的混沌缺口,需要同一套算力平台同时兼容高双精度科学计算、低精度 AI 推理,对网络、存储 IO、系统稳定性、软硬件协同提出多重约束。

从技术指标看,全球 5 公里气象预报如果沿用传统 CPU 架构,一轮 10 天预报耗时高达 21 小时,远达不到国际通行 “2 小时内输出预报产品” 的业务金标准。想要实现公里级预报,不能简单堆卡,必须完成模式算法、硬件架构、存储通信全链路改造,这也是全球气象机构共同面对的难题。美国、欧洲中心均在冲刺 5 公里全球模式,却同样面临算力与业务时效的矛盾。面向未来,气象预报走向更高精度,AI4S(AI for Science)会是重要发展方向。

破局:曙光 8000 超智融合底座,支撑气象模式持续演进

图片 3.jpg

为实现 MCV 模式在国产加速卡上 “算得对、算得快”,双方组建联合攻关团队,没有采用简单移植的捷径,深入算法底层开展模块化改造:重构内存管理、优化跨卡通信算法、定制适配数学库,攻克异构平台数值一致性难题;针对气象每秒海量读写压力,优化分级存储架构,实现 10 秒完成 200GB 数据写出,破解气象模拟 IO 瓶颈。

实测结果显示,在曙光 8000 上,全球 5 公里 10 天预报可压缩至一小时内完成;已经完成全球 3 公里分辨率试验模拟。系统上线仅一个多月,就支撑这项国家级准业务应用落地,把硬件算力真正转化为可用的业务能力。

中科曙光高端计算总工程师卜景德表示:“气象这套业务打磨的不是单一跑分,而是整套工程化能力。气象模式包含近百个模块,要保障 7×24 小时稳定输出,这种严苛的生产级要求,正是国产超算支撑行业业务落地最需要打磨的能力。”

而随着气象模式向下一代更高精度持续演进,AI方法成为不容被忽视的一条重要路径。

曙光 8000 十万卡超智融合系统在设计之初就跳出 “先建机器再找应用” 的传统思路,坚持应用定义硬件,把行业真实业务需求前置到系统架构设计环节,打造一套覆盖 64 位、32 位、16 位、8 位的全精度异构算力底座,一套集群同时承接传统超算模拟与 AI 智能计算任务。

在气象场景,这套架构可以更好地支撑 “超智融合” 产业落地:
数值模式负责基于大气物理守恒方程做高精度求解,输出气象演变;人工智能负责学习海量历史观测数据,弥补观测点位不足带来的初始场误差,二者在同一算力平台协同工作,而非两套系统割裂运行。

走出 Demo,建立 “应用牵引硬件” 正向循环

曙光 8000 与 MCV 模式的联合攻关,为国产超算产业提供第一条重要启示:科学计算落地,应当建立 “应用提需求、硬件做迭代” 的正向循环,而不是硬件先行,等待应用去适配。

本次合作中,气象模式对更高算力、更高能效的诉求,直接反馈算力体系设计。面向未来 3 公里、百米级更高分辨率预报,分辨率每提升一倍,计算量暴涨 8‑16 倍,万卡乃至十万卡集群会成为刚需。双方已经启动面向气象类科学计算的专用芯片预研,目标用数百张专用卡实现过去 2000 多张通用卡的计算任务,提升能效与稳定性。

这种 “行业应用牵引硬件定制” 的思路,打破通用算力包打一切的惯性。放到更广的科学计算赛道,新材料、石油物探、新药研发同样可以复制这套逻辑:从行业科学问题中提炼计算特征,反向指导算力、芯片架构迭代,摆脱单纯依靠通用芯片的路径依赖。

沉淀工程化方法论,把气象经验复制到千行百业

科学计算产业落地最大缺口不只是算法,更是生产级工程化能力。很多科研团队手握模型算法,却难以完成大规模集群适配、海量 IO 处理、多模块协同调度。

气象场景沉淀的整套工程方法论具备向外迁移价值。第一是模块化移植 + 标准化验证流程,保证代码迁移后计算结果准确可信,这套流程可以复用在石油地震物探、流体仿真等大规模科学计算场景;第二是超智融合混合算力架构实践,“高精度物理求解 + AI 辅助推演” 模式,适配新药分子模拟、材料第一性原理仿真等大量科学计算场景;第三是高可靠业务运维体系,满足不间断生产运行要求。

资源调度层面,曙光 8000 十万卡资源池采用动态智能调度,气象业务仅占用很少一部分算力,其余资源向新药研发、新材料、科学大模型、具身智能开放。石油物探、电池半导体材料研发同样有万卡级大规模算力需求,气象打磨成熟的软硬件协同经验,直接赋能上述产业。

针对大量中小科研团队面临 “代码适配大算力门槛高” 的行业痛点,平台正在搭建新一代智能编程工作流体系,沉淀大量优化经验形成自动化工作流,降低科研人员使用国产大算力的改造成本,弥合算法科研团队与超算硬件之间的鸿沟。

国产软件生态突围,把握科学计算换道超车窗口

长期以来,传统科学计算领域被海外软件生态长期垄断。当前科学计算范式快速迭代,给国内带来换道超车机遇。

历军在发布会上回顾,二十年前气象局机房大量使用海外机器;二十年之后,实现国产算力与国产气象模式深度协同。MCV 模式、清华大学 C‑Coupler 国产耦合器(公里分辨率启动速度较欧美产品快 10 倍以上),代表国产科学软件实现突破。

“很多科学计算场景过去习惯依赖海外开源软件,而气象场景完成了国产模式在国产异构平台上的深度打磨。” 卜景德表示,通过重大国家级场景的实战打磨,能够推动国产科研软件从 “跑得通” 走向 “跑得快、稳得住、大规模可用”,形成软硬件互相促进的生态闭环。

展望:从 5 公里走向更远,国产高分辨率气象预报落地才刚刚起步

5 公里准业务化不是终点。下一步,团队将继续推进 MCV 模式全链条迭代,完成海洋等多圈层模式向异构平台移植,完善资料同化环节,向完整业务化运行持续迈进;同时持续探索 3 公里、更高分辨率模拟。

对超算产业而言,曙光 8000 在气象领域的实践证明:科学计算产业竞争,已经不再是比拼单卡算力、论文数量,而是考验硬件底座、行业应用、工程能力、软件生态的全链条综合实力。气象作为首个跑通准业务化的标杆场景,正在为我国国产超算产业开辟可复制的落地路径,未来这套 “算力 + 行业应用 + AI” 模式,将赋能更多实体经济科研创新,释放新质生产力。

此内容为AET网站原创,未经授权禁止转载。
中科曙光 曙光8000 AI算力 超算