10月2日、SiliconAngleが「Ai2 releases Olmo-core 3 to make developing large mixture-of-experts LLMs more efficient」と題した記事を公開した。Allen Institute for AI(Ai2)がMoE(Mixture-of-Experts)型LLMのトレーニング効率を大幅に向上させる開発フレームワーク「Olmo-core 3」をリリースしたことを伝えている。NvidiaのMegatron-coreと比較して約2.7倍のスループットを達成したとしており、オープンな研究コミュニティが兆規模のモデル開発に取り組める環境の整備を目指している。
Megatron-core比で2.7倍のスループット
Olmo-core 3の最大の訴求点は、そのベンチマーク結果だ。
470億パラメータのモデルにおいて、NvidiaのB200 GPUで毎秒52,000トークンを処理したとAi2は報告している。これはNvidiaが提供する大規模MoEトレーニングの定番フレームワーク「Megatron-core」の約19,400トークン/秒と比較して、約2.7倍のスループットに相当する。
同等のインフラを使いながら、1兆パラメータ規模のLLMまでスケールできるとしている点も見逃せない。エキスパート数は8から128まで拡張可能にしつつ、トークンごとに選択するエキスパートは4つに絞る設計で、計算効率を維持したままモデル規模を引き上げる。
MoEの「コスト問題」にどう対処したか
MoEモデル(Mixture-of-Experts)とは、トークンを生成するたびにモデル全体ではなく、専門化された一部(エキスパート)だけを活性化するアーキテクチャだ。密なモデル(Dense Model)と異なり、総パラメータ数は多くても実際の計算量は少ない。学習効率が高い一方で、モデル全体をGPUメモリに保持しなければならない点や、エキスパート間の通信コストが課題として残っていた。
Ai2が公開したホワイトペーパーによれば、Olmo-core 3はこの問題に以下の3つのアプローチで対処している。
- エキスパート並列化:エキスパートを複数のGPUに分散し、各GPUが保持するエキスパートの量を削減
- レイヤー分割:モデルの各層をGPUグループ間で分割し、1枚のGPUが保持するモデルサイズを縮小
- 分散オプティマイザ:学習時の更新計算に使うオプティマイザ状態を全GPUに複製するのではなく、分散して保持
これらを組み合わせることで、モデルのスケールアップに伴うメモリオーバーヘッドを抑制している。加えて、MXFP8(値を通常より少ないビット数で表現する数値フォーマット)をサポートすることで、計算量とGPU間のデータ転送量を削減している。
研究者コミュニティへの開放が狙い
Ai2がこのリリースで強調するのは、性能改善だけではない。兆規模パラメータのAIモデルは、国家・大企業レベルのインフラなしには開発が難しいという現状に対して、Olmo-core 3は異なるハードウェアへの適応、ルーティング戦略やパラリズムの実験を可能にする基盤として設計されている。
この方向性はAi2の組織としての立場とも深く結びついている。OpenAIやAnthropicといった商業ラボがモデルの重みや学習手法を非公開とする傾向を強める中、Ai2はオープンサイエンスを明示的な使命として掲げ、モデルだけでなく訓練コードや手法の詳細も含めて公開し続けてきた。今回のOlmo-core 3もその姿勢の延長線上にある。訓練インフラの透明性を高めることで、リソースに乏しい学術機関や独立系研究者が大規模モデルの実験に参加しやすい環境を整えることが狙いといえる。
Ai2はオープンソースLLMの分野でOLMoシリーズを継続的に公開してきた研究機関であり、今回のOlmo-core 3もその延長線上に位置する。プロジェクトおよび関連システムはGitHub上で公開されており、開発者やオープンソースコミュニティが利用できる。
詳細はAi2 releases Olmo-core 3 to make developing large mixture-of-experts LLMs more efficientを参照していただきたい。