跳到正文
热点事件持续更新

vLLM集成Helion实现高性能线性后端

1 篇报道1 个报道来源21 小时前更新

先了解这件事

AI 综述

2026年10月3日,PyTorch官方发布消息,确认vLLM已集成其原生DSL Helion以构建高性能可移植线性后端。该方案利用自动调优技术,在NVIDIA Hopper GPU上的性能表现超越了现有的CUTLASS和DeepGEMM库。报道指出,该集成支持FP8和INT8量化格式,在部分工作负载中实现了超过10%的吞吐量提升。然而,新后端也面临启动延迟增加以及维护开销较大的挑战,目前处于功能验证与性能优化阶段。

AI 根据报道生成 · 21 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. PyTorch
    vLLM 集成 Helion 实现高性能可移植线性后端

    vLLM 集成 PyTorch 原生 DSL Helion 构建线性后端,通过自动调优在 NVIDIA Hopper GPU 上超越 CUTLASS 和 DeepGEMM。该方案支持 FP8/INT8 量化,部分工作负载吞吐量提升超 10%,但面临启动延迟与维护开销挑战。

本事件热度走势

当前热度 8·可比范围峰值 10(10月3日 05:00)·近 24 小时可比范围变化 –

02.557.51010月3日05:0010月3日07:0010月3日10:0010月3日12:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。