MetaがFlashAttention-4を超えるAttentionカーネルを3分の1のコードで実現 — Tritonベースの新ツールがCUDA専門家不要でBlackwell最速を達成
DRANK

10月2日、PyTorchが「Optimizing Jagged Flash Attention with TLX: The Road Toward SOTA FA4 on Blackwell – PyTorch」と題した記事を公開した。この記事では、MetaのGEM(Generative Ads Model)を支えるJagged Flash Attentionカーネルを、TLX(Triton Low-level Extensions)を用いてNVIDIA Blackwell(B200)向けに最適化した取り組みが紹介されている。結論から言えば、フォワードパスでFA4比+13%、バックワードパスでFA4比+50%の性能を達成しながら、コード量はFA4の約10,000行に対し約3,200行(約3分の1)に抑えることに成功した。しかもCUDAではなくTritonベースのPythonコードで書かれており、カーネル専門家でなくとも読み書きできる。

by @tf_official
Related Topics: Python CUDA Deep Learning