AMD製GPUでDeepSeek-V4-Flash(284B MoEモデル)の学習を動かす — 3種のアテンション混在と288GBメモリギリギリの設計を解剖
DRANK

9月3日、Lihuan Zhangら複数の著者が「Enabling DeepSeek-V4-Flash Training on AMD Instinct MI355X GPUs with Primus」と題した記事を公開した。AMD Instinct MI355X GPU上でDeepSeek-V4-Flashの事前学習をエンドツーエンドで動作させるまでの取り組みを詳述した内容で、284B MoEモデルに3種類のアテンション機構を混在させた異色のアーキテクチャを、288GB(利用可能268.2GiB)のHBM3Eに約4%の余裕でギリギリ収める設計の解説が中心となっている。アーキテクチャ詳細・設定方法・カーネル最適化について詳しく紹介されている。

by @tf_official
Related Topics: Deep Learning Machine Learning AI