产业观察

AWS推出SageMaker HyperPod推理网关,实现GPU感知路由

原标题: AWS Launches SageMaker HyperPod Inference Gateway for GPU-Aware Routing

unite.ai·2026/9/18 13:27:01🔗 原文

📋总体概括

AWS于2026年9月18日发布SageMaker HyperPod Inference Gateway,一个Kubernetes原生的GPU感知路由系统,以单个托管附加组件形式部署在现有HyperPod基础设施的Amazon EKS上。传统Kubernetes负载均衡算法(如轮询、最少连接)无法感知GPU状态,导致LLM推理请求路由低效,该网关可据此将首token延迟最高降低82%,直击大模型推理服务的成本与性能痛点。

关键信息

  • AWS于2026年9月18日推出SageMaker HyperPod Inference Gateway,定位为LLM推理的GPU感知路由网关
  • 产品以单个托管附加组件形式部署于Amazon EKS,运行在现有HyperPod基础设施上,属Kubernetes原生方案
  • 默认Kubernetes负载均衡算法如轮询和最少连接对GPU负载无感知,是路由低效的根源
  • AWS宣称该网关可将首token延迟最高降低82%

🔥犀利点评

82%的首token延迟降幅数字很漂亮,但本质上是AWS在补Kubernetes做AI推理的原生短板——轮询算法根本不该用来分发需要KV cache亲和性的LLM请求。真正的看点是HyperPod从训练基础设施向推理一站式平台延伸,AWS想把训练到推理全锁在自己生态里。vLLM+SGLang社区的路由方案早已在做类似事,AWS的胜算在于托管和集成便利性,而非技术独占。

本文由本站自动聚合,以下为原始来源:前往 unite.ai 阅读全文