大規模GPU学習で「障害は日常」— チェックポイントを58倍高速化してgoodputを91%に保つDatabricksの実践手法
DRANK

8月28日、Databricksが「Fast, fault-tolerant PyTorch training on AI Runtime」と題した記事を公開した。256基以上のGPUを使う大規模学習ではジョブ実行中に必ず障害が起きると前提を置き、チェックポイント設計・データパイプライン・自動リジュームを組み合わせてgoodputを91%まで高める実装手法を詳述している。

by @tf_official
Related Topics: Machine Learning Deep Learning Python