StepFunが600BパラメータのMoEモデル「Step 5」を公開 — 推論時は27Bしか使わず、出力コストは業界中央値の4分の1以下
DRANK

9月20日、Michal Sutterが「StepFun Launches Step 5 Preview: A 600B-Total, 27B-Active MoE Model With 1M Context for Long-Horizon Agentic Work」と題した記事を公開した。出力コストが業界中央値の約27%——これがStep 5 Previewの最大の訴求点だ。同等クラスのモデルが1Mトークンあたり$10.00の出力コストを取る中、StepFunは$2.70に抑えた。600Bという総パラメータ規模を持ちながら、推論時に動かすのはそのうち27B(約4.5%)のみというMoEアーキテクチャの妙がこのコスト構造を支えている。

by @tf_official
Related Topics: AI Machine Learning Deep Learning