产业观察

Prime Intellect推出Prime Inference:面向前沿开源模型的Serverless与预留式推理服务

原标题: Prime Intellect推出Prime Inference:面向前沿开源模型的Serverless与预留式推理服务

marktechpost.com·2026/10/3 05:37:18🔗 原文

📋总体概括

Prime Intellect推出Prime Inference,一个兼容OpenAI接口的推理服务平台,提供Serverless与预留两种服务模式,用于在NVIDIA Blackwell硬件上部署前沿开源模型。其GLM-5.3部署方案采用Dynamo分布式推理框架、vLLM引擎以及NVFP4 KV缓存压缩技术,实现了每个prefill组66路会话、单用户101 tok/s的生成速度。该平台面向开源大模型推理市场,试图以兼容OpenAI的接口降低开发者迁移成本,同时用软硬件协同优化压低推理成本、提升吞吐。

⚡关键信息

  • ▸Prime Intellect发布Prime Inference平台,提供Serverless与Reserved两种推理服务模式
  • ▸平台兼容OpenAI API接口,部署于NVIDIA Blackwell架构GPU之上
  • ▸GLM-5.3部署采用Dynamo、vLLM与NVFP4 KV压缩三项关键技术
  • ▸实测每prefill组承载66路会话,单用户生成速度达101 tok/s

🔥犀利点评

开源模型推理这门生意,拼到最后就是每token成本。Prime Inference的亮点不在Serverless这个老概念,而在NVFP4 KV压缩叠加Dynamo调度把Blackwell的算力榨干——66路会话、101 tok/s的单用户速度说明它不是PPT优化。但真正的考验是:当OpenAI和各家云厂都在降价时,一个第三方推理平台凭什么留住开发者?兼容接口只是门票,规模化后的价格战才是生死线。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →