LLM推論カーネルを「1つの実装で複数変種カバー」— PyTorchのHelion統合でvLLMスループットが一部ワークロードで10%以上向上
DRANK

10月3日、PyTorchが「Building a High-Performance and Portable vLLM Linear Backend with Helion – PyTorch」と題した記事を公開した。注目すべきは、従来は変種ごとに個別実装が必要だったGEMMカーネルを、単一実装で複数アルゴリズム変種をカバーできる点だ。カーネルDSL「Helion」をvLLMのlinearバックエンドに統合することで、NVIDIA Hopper GPU上の一部ワークロードで10%以上のスループット向上を実現している。

by @tf_official
Related Topics: AI Machine Learning Deep Learning