ワークステーション1台で753Bモデルが動く推論エンジン「FreeToken」— GPUクラスタなしでフロンティア級AIを手元に置けるか
DRANK

8月23日、MarkTechPostが「Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU」と題した記事を公開した。Kimi-K3、GLM-5.2、DeepSeek-V4-Flashといったフロンティア級のオープンウェイトモデルが続々と登場しているが、「パラメータを公開すること」と「実際に動かせること」は別の話だ。これらのモデルを動かすには依然としてデータセンター級のGPUクラスタが前提とされており、個人開発者や小規模チームにとってのコスト負担は重い。UC BerkeleyとUT Austinの研究チームが提案するFreeTokenは、この問題に正面から取り組むエッジネイティブ推論エンジンだ。

by @tf_official
Related Topics: AI Machine Learning Deep Learning