用心打造
VPS知识分享网站

DigitalOcean上线Kimi K3云推理:8卡GPU服务器承载2.78万亿参数

DigitalOcean于7月30日公布Kimi K3在其Inference Engine上的部署细节。该模型已经通过Serverless Inference对外提供,也可以接入Inference Router,与平台上的其他模型按照成本、延迟或业务类型进行路由。

这次披露的重点不是再发布一个模型入口,而是说明超大规模开放权重模型如何真正落到GPU云基础设施中。Kimi K3约有2.78万亿个总参数、896个路由专家,模型权重约1.56TB,单张GPU无法独立承载完整部署。

DigitalOcean使用八卡异构GPU服务器部署Kimi K3云推理示意图

八卡服务器成为实际部署单元

DigitalOcean为Kimi K3选择NVIDIA HGX B300与AMD Instinct MI350X两类GPU服务器。两种方案都以八卡服务器作为实际部署单元,每张GPU提供288GB显存,加载权重后还要为KV缓存和模型激活预留空间。

官方披露的计算显示,模型权重平均需要约195GiB显存才能分布到每张GPU。完整权重不能放进单卡,因此NVIDIA NVLink或AMD Infinity Fabric一类高速互联成为关键,注意力计算与专家并行都需要频繁交换数据。

DigitalOcean使用llm-d构建分布式推理栈,其中一项原因是它能够原生支持不同GPU类型。平台由此可以同时把Kimi K3部署在NVIDIA与AMD硬件上,减少单一GPU供应对上线容量的限制。

约1.4TiB权重经过MXFP4量化

部署方案与vLLM团队共同优化,MXFP4量化将实际加载的模型权重控制在约1.4TiB,为KV缓存留出显存空间。平台还调整gpu-memory-utilization参数,避免权重、缓存与激活数据争抢显存。

在吞吐方面,团队提高max-num-batched-tokens上限,让调度器在一次计算步骤中打包更多Token。预填充阶段则使用TensorRT-LLM的ragged MLA后端,并加入预填充查询量化。

这些优化更像云推理平台的底层工程,而不是用户在普通GPU云服务器上改一个参数就能复现。模型规模、并发请求、上下文长度与显存预算需要同时平衡,任何一项配置偏差都可能把吞吐提升变成更高延迟。

一百万Token上下文改变容量规划

Kimi K3支持最长一百万Token上下文。长上下文会显著增加KV缓存占用,单台八卡服务器能够同时服务的用户数量因此不会特别高。DigitalOcean需要先找到并发量与首Token延迟之间的平衡,再确定GPU容量。

平台没有给所有请求设置同一条首Token延迟目标,而是按照输入长度分级。短提示与接近一百万Token的超长输入采用不同指标,聊天任务和Agent工作流也使用不同的Token间延迟要求。

这说明超长上下文不只是模型功能列表中的一个数字。云平台真正开放该能力时,必须为缓存占用、排队时间和并发下降付出硬件成本,使用价格与限流策略也会受到影响。

开放权重不代表各平台效果相同

DigitalOcean还披露了模型验证过程。Moonshot提供相同权重后,不同云平台仍可能因为解码参数、工具调用解析和流式响应格式不同,得到差异明显的质量表现。

平台使用Kimi Vendor Verifier进行验证,这套工具包含六类基准测试,覆盖OCR、数学、软件工程、工具调用与JSON结构准确率等项目。最初测试出现30项失败,其中26项与动态工具支持尚未实现有关。

团队补齐动态工具验证、消息合并和错误处理后,复测才全部通过。这个过程说明,模型上线并不等于把权重加载到GPU后直接开放API,代理层与协议兼容性同样会影响用户最终得到的结果。

统一API需要处理模型专属扩展

DigitalOcean的推理代理为70多个模型提供统一入口,大部分请求按照OpenAI兼容格式处理。Kimi K3带来的难点是,它包含动态工具等专属扩展,不能完全套用其他模型的统一逻辑。

动态工具允许Agent先声明少量核心工具,再在对话过程中追加新的工具定义,减少每次请求重复发送完整工具清单的Token开销。代理层需要验证新增工具、合并定义,并在传递给vLLM前清理专属字段。

流式响应也进行了多项整形,包括把推理内容与正式内容分开、补齐阶段边界,以及调整工具参数的分块方式。对开发者来说,统一API看起来更简单,但兼容成本实际被云平台吸收到后端。

Serverless Inference降低直接运维门槛

Kimi K3目前可通过DigitalOcean Serverless Inference按使用量调用,用户不需要自行维护八卡GPU服务器。已有多模型应用也可以通过Inference Router,把请求按成本、延迟或工作负载分配到不同模型。

DigitalOcean披露的性能与验证结果来自特定硬件和内部测试环境,不能直接等同于所有地区、所有并发量下的固定表现。真正值得观察的是平台能否在用户增长后保持容量、延迟与输出一致性。

超大开放权重模型正在把云推理竞争从单纯比GPU数量,推进到硬件异构、推理框架、协议兼容和质量验证的完整链条。谁能把这些复杂环节稳定藏在API之后,才更可能降低开发团队使用大模型的实际门槛。

赞(0)
未经允许不得转载;国外VPS测评网 » DigitalOcean上线Kimi K3云推理:8卡GPU服务器承载2.78万亿参数
分享到