AI 大模型对算力的需求还在继续往上走,现在云厂商提供的已经不只是普通 GPU 云服务器,而是开始把过去需要企业自己建设的超节点直接放到云上。
8 月 19 日消息显示,阿里云灵骏真武 M890 超节点实例已经进入商业化使用阶段,用户可以通过云服务方式获取 64 卡级别的大规模 AI 算力。相比自己采购服务器、GPU、交换设备再建设集群,这种模式最大的变化就是把超节点也变成了可以直接使用的云资源。

64卡组成一个完整超节点
灵骏真武 M890 对应的 GP9A 超节点实例采用 8 节点、64 卡作为最小交付单元,首批支持乌兰察布地域。
根据阿里云公布的信息,新实例主要面向大规模模型训练和推理场景,单个实例已经可以承担 10T 以上参数规模的 MoE 模型推理任务。相比上一代真武 810E,官方给出的性能提升达到约 3 倍。
这一点和我们平时接触的 2 核 4G、8 核 16G 云服务器完全不是一个量级。
普通云服务器主要解决网站、数据库、应用部署等需求,而这类超节点针对的是大模型训练、AI 推理、多模态处理以及大型智能体系统。过去企业想获得类似规模的算力,往往需要一次采购大量设备,还要解决机房、电力、散热、网络互联以及集群管理问题。
现在把整套算力放进公有云之后,用户可以直接按照业务规模获取资源,前期投入明显降低。
AI算力正在越来越像普通云服务器
这次比较值得关注的并不只是 M890 本身,而是 AI 算力的使用方式正在发生变化。
最早使用 GPU 主要是购买物理服务器,后来云厂商开始提供单卡、双卡以及多卡 GPU 云服务器,现在进一步发展到了整套超节点直接通过云平台交付。
这意味着以后使用大型 AI 集群,可能越来越接近今天购买云服务器的体验:选择地域、选择规格、创建资源,然后按实际使用情况付费。
对于模型开发团队来说,这种变化比较实际。
模型研发经常存在明显的算力波峰,例如训练阶段需要大量资源,模型上线后的推理阶段资源结构又会发生变化。如果全部自己购买硬件,很容易出现训练结束后大量服务器闲置的问题,而云上算力更适合这种资源需求变化明显的场景。
乌兰察布成为首批开放地域
目前灵骏真武 M890 超节点实例首批在乌兰察布提供。
大型 AI 集群和普通云服务器相比,对电力、散热以及服务器之间的高速互联要求更高,所以能够部署超节点的数据中心并不是简单增加几台 GPU 服务器就可以完成。
阿里云近年来持续增加 AI 数据中心和智算基础设施投入,超节点产品直接进入公有云,也说明大型算力资源正在逐渐从少数大型企业内部基础设施,转变成可以直接购买和调用的云服务。
对普通建站用户来说,这次产品更新暂时不会影响日常购买的 ECS 云服务器。但从整个云计算市场来看,AI 已经开始明显改变服务器产品结构。
以后云服务器市场很可能会更加清晰地分成两条路线:一类继续面向网站、应用和传统企业业务,另一类则会围绕 GPU、超节点和大型 AI 集群快速扩张。
随着更多云厂商把大规模 AI 算力开放出来,企业部署大型模型的门槛也会继续下降。


