RTX 3090で446Mパラメータの「専門家混合」モデルをゼロから訓練 — GPT-2 mediumに肉薄しながらアクティブパラメータは220Mに抑える
DRANK

9月11日、Giles Thomasが「Extending Raschka's GPT-2: an MoE trained from scratch on an RTX 3090」と題した記事を公開した。この記事では、Sebastian RaschkaのGPT-2実装をベースにMixture-of-Experts(MoE)アーキテクチャを一から実装し、RTX 3090でトレーニングした実践的な記録が詳しく紹介されている。コンシューマーGPUでどこまでやれるかを地道に検証した記録として、実装面でも示唆に富む内容だ。

by @tf_official
Related Topics: AI Machine Learning Deep Learning