跳到正文
原文
PyTorch· Meta Team: Daohang Shi, Oleksandr Stashuk, Rupert Wu, Liangbei Xu, Rich Zhu·· 5 小时前AI 评分31

PyTorch 用 FBTriton 优化 TBE 嵌入查找性能

Modernizing Table Batched Embeddings with FBTriton

AI 导读

PyTorch 推出基于 Triton 的 Table Batched Embedding (TBE) 内核,在推荐系统嵌入查找中超越传统 CUDA 实现。该方案通过直方图与 Tensor Core 路径优化,在 B200 GPU 上使边界检查提速最高达 1.24x,并将特定配置下的总延迟降低 16.8%。

来源:PyTorch · pytorch.org