资讯🔥7.0
国产GPU首入CNCF国际开源生态!沐曦携手密瓜智能完成llm-d适配:单卡吞吐5773 tokens/s
📋总体概括
云原生分布式推理开源项目llm-d(CNCF托管)正式纳入沐曦曦云C系列GPU支持,这是该社区支持的加速器名单中首次出现国产GPU。沐曦与密瓜智能合作完成完整适配,验证了单卡、八卡及Prefill/Decode分离推理部署,单卡吞吐达5773 tokens/s。此前llm-d部署指南仅覆盖英伟达、谷歌TPU、AMD、英特尔等平台,国产芯片需用户自行摸索隐性适配。此次适配打通了国产GPU从芯片到生产级推理系统的最后一公里。
⚡关键信息
- ▸llm-d由Red Hat发起,构建于vLLM、SGLang与Kubernetes之上,已交由CNCF托管,GitHub超4400 Star
- ▸沐曦曦云C系列GPU成为llm-d官方支持名单中首个国产GPU,此前仅有英伟达、谷歌TPU、AMD、英特尔XPU等平台
- ▸沐曦与密瓜智能合作完成单卡、单机八卡(TP=8运行DeepSeek-R1-Distill-Llama-70B)及Prefill/Decode分离部署验证
- ▸单卡路径以Qwen3-14B、TP=1配置验证,单卡吞吐达5773 tokens/s
- ▸项目聚焦前缀缓存感知路由、负载感知调度与Prefill/Decode分离等大规模推理服务关键能力
🔥犀利点评
这个里程碑的含金量不在5773 tokens/s的吞吐数字,而在生态门票本身。国产GPU过去卡的不是能不能跑推理,而是国际开源社区默认配置里压根没有你的名字——用户每次部署都在为隐性适配买单。llm-d是CNCF托管的生产级项目,进了官方名单等于拿到了云原生推理世界的通行证。但要清醒:从纳入支持到被企业大规模信任采用,还有很长的距离,英伟达的CUDA生态壁垒不是一次适配就能撼动的。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →