产业观察
Prime Intellect推出Prime Inference:面向前沿开源模型的Serverless与预留式推理服务
原标题: Prime Intellect推出Prime Inference:面向前沿开源模型的Serverless与预留式推理服务
📋总体概括
Prime Intellect推出Prime Inference,一个兼容OpenAI接口的推理服务平台,提供Serverless与预留两种服务模式,用于在NVIDIA Blackwell硬件上部署前沿开源模型。其GLM-5.3部署方案采用Dynamo分布式推理框架、vLLM引擎以及NVFP4 KV缓存压缩技术,实现了每个prefill组66路会话、单用户101 tok/s的生成速度。该平台面向开源大模型推理市场,试图以兼容OpenAI的接口降低开发者迁移成本,同时用软硬件协同优化压低推理成本、提升吞吐。
⚡关键信息
- ▸Prime Intellect发布Prime Inference平台,提供Serverless与Reserved两种推理服务模式
- ▸平台兼容OpenAI API接口,部署于NVIDIA Blackwell架构GPU之上
- ▸GLM-5.3部署采用Dynamo、vLLM与NVFP4 KV压缩三项关键技术
- ▸实测每prefill组承载66路会话,单用户生成速度达101 tok/s
🔥犀利点评
开源模型推理这门生意,拼到最后就是每token成本。Prime Inference的亮点不在Serverless这个老概念,而在NVFP4 KV压缩叠加Dynamo调度把Blackwell的算力榨干——66路会话、101 tok/s的单用户速度说明它不是PPT优化。但真正的考验是:当OpenAI和各家云厂都在降价时,一个第三方推理平台凭什么留住开发者?兼容接口只是门票,规模化后的价格战才是生死线。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →