MetaがGPUを遊ばせるストレージボトルネックを解消 — データ取り込みを150分から10分に短縮した多層キャッシュ設計
DRANK

7月28日、Blocks & Filesが「Meta reinvents AI metadata flow and KV caching」と題した記事を公開した。MetaがAIワークロードにおけるデータ取り込み(インジェスチョン)の待ち時間を150分から10分へ、89時間かかっていたジョブを3時間強へと圧縮したストレージ基盤の刷新について詳しく伝えている。ストレージがGPUの足を引っ張っているMetaのEngineering Director Sidharth BajajとSW Development Engineer Venkatraghavan Srinivasanは、同社のドキュメント「AI Storage Blueprint at Scale」の中でこう述べている。「ストレージのボトルネックはAIワークロードにおけるGPUストールの主要因のひとつであり、コストと市場投入時間に直接影響している。」AIコンピュートの性能は2年ごとに3倍になっているのに対し、ストレージの性能向上はその速度に追いつけていない。これがGPUを遊ばせる原因になっている。Metaは、Facebook・Ins...

by @tf_official
Related Topics: Storage AI Machine Learning