vLLM 集成 Helion 实现高性能可移植线性后端
vLLM 集成 PyTorch 原生 DSL Helion 构建线性后端,通过自动调优在 NVIDIA Hopper GPU 上超越 CUTLASS 和 DeepGEMM。该方案支持 FP8/INT8 量化,部分工作负载吞吐量提升超 10%,但面临启动延迟与维护开销挑战。
vLLM 集成 PyTorch 原生 DSL Helion 构建线性后端,通过自动调优在 NVIDIA Hopper GPU 上超越 CUTLASS 和 DeepGEMM。该方案支持 FP8/INT8 量化,部分工作负载吞吐量提升超 10%,但面临启动延迟与维护开销挑战。
PyTorch 团队扩展 FlashAttention-4 以支持 MXFP8 前向和反向传播,在 LLM 形状上达到 2.85 PF/s 前向和 2 PF/s 反向吞吐量。
PHP框架Laravel宣布禁止提交issue,仅接受Pull Request以过滤垃圾信息并降低维护成本。Anthropic利用Claude AI耗时11天将安德鲁·怀尔斯的费马大定理人工证明翻译为Lean语言程序,生成超1300万行代码,创下最长数学程序纪录。