用心打造
VPS知识分享网站

NOAA选择Google Cloud H4D云服务器:天气预报超算转向公有云

Google Cloud 于 7 月 27 日宣布,美国国家海洋和大气管理局 NOAA 已选择其作为天气与气候业务超算系统 WCOSS 的主要高性能计算基础设施提供方。H4D 云服务器将成为新平台的计算核心,用于运行大规模数值天气预报模型。

这次合作的特殊之处在于,NOAA 正把长期依赖本地超算集群的业务预报体系转向公有云。天气模型不是偶尔运行的科研任务,而是直接关系预警时效的持续生产系统,对计算规模、低延迟网络和可靠性都有很高要求。

NOAA 使用 Google Cloud H4D 云服务器进行天气预报高性能计算示意图

天气业务超算开始转向公有云

WCOSS 是 NOAA 用于业务天气与气候预测的核心计算体系。Google Cloud 将承担主要 HPC 基础设施,意味着数值天气预报中心不再只把公有云当作补充算力或数据分发平台,而是把关键模型运行放到云环境中。

公有云能够按需要扩展计算资源,并更快引入新的硬件和调度方式。不过,业务天气预报需要在固定时间窗口内完成数据同化、模型计算和结果发布,能否稳定按时完成比单次峰值性能更重要。

H4D使用第五代AMD EPYC处理器

NOAA 采用的 H4D 是 Google Cloud 面向高性能计算设计的云服务器系列,基于第五代 AMD EPYC 处理器,并通过 Titanium 网络适配器提供 Cloud RDMA。

RDMA 允许不同云服务器之间直接进行低延迟数据交换,减少传统网络协议栈带来的开销。数值天气模型会把地球大气划分为大量网格并行计算,节点之间需要频繁同步,网络延迟过高会让新增 CPU 无法转化为更快的完成时间。

低延迟互联比单台服务器更关键

天气预报属于紧密耦合的并行计算任务。单台云服务器即使拥有较多核心,也必须和数十甚至数百台实例共同工作。Google Cloud 为 H4D 配置 Falcon 硬件传输与低延迟互联,目的就是让多台虚拟机更接近一套完整超算集群。

H4D 支持通过 Cluster Toolkit 配合 Slurm 部署,也可以接入 Google Kubernetes Engine。调度系统负责把模型任务分配到不同实例,并处理资源排队、扩容和运行状态,云平台则负责底层计算与网络。

双方合作此前集中在数据与试点

NOAA 与 Google Cloud 过去已经在环境数据分发、野火追踪和海洋保护方面合作。NOAA 管理的环境数据规模达到 PB 级,把数据放到云端可以让研究机构和应用开发者更方便地读取与处理。

NOAA Fisheries 还测试过云计算加速方案,用于按需要获取科研算力。这些项目与本次 WCOSS 迁移的区别在于,后者进入了业务天气预测的核心基础设施,运行责任和连续性要求更高。

云上超算仍需面对成本与容量调度

公有云能够减少自建超算前期采购和硬件更新压力,但并不代表高性能计算成本会自动下降。大规模 H4D 集群、RDMA 网络、数据存储和模型输出传输都会产生费用,长期稳定负载还需要比较按需、预留与自有设备的综合成本。

容量也是现实限制。天气预报不能因为云平台某一区域资源紧张而推迟,因此 NOAA 仍需规划资源预留、故障切换、数据复制和极端天气期间的峰值需求。Google Cloud 公布的是合作方向,完整迁移节奏、合同规模和灾备架构尚未披露。

虚拟化开始进入传统超算核心场景

天气预测过去常被视为裸金属超算更有优势的领域,因为模型对节点间通信和并行效率极为敏感。H4D 通过硬件卸载与 RDMA 缩小虚拟化环境的性能差距,让公有云开始承担这类持续运行的关键任务。

NOAA 项目后续最值得关注的并不是单次基准成绩,而是模型能否在固定预报窗口内长期稳定完成,以及云端资源调度能否应对突发天气带来的计算需求。只有这两点经受住业务运行验证,云上天气超算才算真正进入生产阶段。

赞(0)
未经允许不得转载;国外VPS测评网 » NOAA选择Google Cloud H4D云服务器:天气预报超算转向公有云
分享到