跳到正文
原文
PyTorch· Han Xu, Jacky Zhou, Jackie (Jiaqi) Xu, Hongtao Yu, Peng Chen (Dev Infra), Darren Liu, Dev (Devashish) Shankar, Max Leung, Nick Riasanovsky, Hao Yan, Manman Ren, Yuanwei (Kevin) Fang·· 2 天前AI 评分44

PyTorch 用 TLX 优化 Jagged Flash Attention:在 Blackwell 上超越 FA4

Optimizing Jagged Flash Attention with TLX: The Road Toward SOTA FA4 on Blackwell

AI 导读

PyTorch 团队利用 TLX 扩展在 NVIDIA Blackwell (B200) 上优化了 Meta GEM 模型的 Jagged Flash Attention 内核。该实现代码量约为 3.2K 行,比 FlashAttention-4 (FA4) 减少约 3 倍,且在 jagged 形状下前向传播快约 13%、反向传播快约 50%,超越了当前 SOTA 的 FA4 性能。

来源:PyTorch · pytorch.org