PyTorch· Meta Team: Daohang Shi, Oleksandr Stashuk, Rupert Wu, Liangbei Xu, Rich Zhu·· 5 小时前AI 评分31
PyTorch 用 FBTriton 优化 TBE 嵌入查找性能
Modernizing Table Batched Embeddings with FBTriton
AI 导读
PyTorch 推出基于 Triton 的 Table Batched Embedding (TBE) 内核,在推荐系统嵌入查找中超越传统 CUDA 实现。该方案通过直方图与 Tensor Core 路径优化,在 B200 GPU 上使边界检查提速最高达 1.24x,并将特定配置下的总延迟降低 16.8%。
来源:PyTorch · pytorch.org