AMDとCerebrasがAI推論の「Prefill」と「Decode」を分業する構成を発表 — レイテンシ競争が激化するエージェント型AI時代への回答
DRANK

7月24日、AMDが「AMD and Cerebras Announce Industry-Leading Ultra-Low-Latency and High Throughput AI Inference Solution」と題した記事を公開した。AMDとCerebrasが共同で超低レイテンシ・高スループットのAI推論ソリューションを発表したもので、推論パイプラインをハードウェアレベルで役割分担させるという、従来とは異なるアーキテクチャアプローチが注目を集めている。

by @tf_official
Related Topics: AI Machine Learning Deep Learning