跳到正文
原文
PyTorch· Sean Chen (Red Hat) and Shangdi Yu (PyTorch, Meta Platforms)·· 20 小时前AI 评分50

vLLM 集成 Helion 实现高性能可移植线性后端

Building a High-Performance and Portable vLLM Linear Backend with Helion

AI 导读

vLLM 集成 PyTorch 原生 DSL Helion 构建线性后端,通过自动调优在 NVIDIA Hopper GPU 上超越 CUTLASS 和 DeepGEMM。该方案支持 FP8/INT8 量化,部分工作负载吞吐量提升超 10%,但面临启动延迟与维护开销挑战。

来源:PyTorch · pytorch.org