10月5日、The Next Webが「OpenAI's models reshaped its Jalapeño chip in ways it couldn't explain」と題した記事を公開した。OpenAIが独自AIチップ「Jalapeño」の設計にAIモデル自身を活用し、エンジニアが理由を説明できない形でチップが最適化された経緯について詳しく紹介されている。
AIがチップを設計した——しかし「なぜ」かは分からなかった
今回の記事の核心はここだ。OpenAIのハードウェアチームは、Jalapeñoの設計過程で自社のAIモデルをコード最適化に投入した。その結果、ダイ面積を13%以上削減する変更が加えられた。ところが、その変更がなぜ効果的なのか、エンジニアたちには説明できなかった。
ハードウェアチームを率いるRichard Hoは、More Than MooreのIan Cutressとのインタビュー(9月30日公開)でこう語った。
「私はまだ100%信頼していない」
このインタビューがJalapeñoの設計プロセスを詳細に語った、現時点で最も具体的な一次情報源だ。
HoはGoogle TPUプログラムの初期エンジニアの一人であり、D.E. Shaw ResearchではAntonスーパーコンピュータを開発した人物。2023年にOpenAIに加入している。
XLSという「AIが扱いやすい」設計言語
チームがAIモデルを設計に投入できた背景には、使用した設計ツールの選択がある。コードの多くはXLS(XLS: Accelerated HW Synthesis)と呼ばれるツールで書かれていた。XLSは高水準コードをチップロジックに変換するもので、現在HoのチームにいるChris LearyがGoogle在籍時にオープンソースとして公開した。
チップ設計で一般的に使われる言語はVerilog(ハードウェア記述言語)だが、XLSの記法はRustに近い。AIモデルはVerilogよりもソフトウェア寄りのコードを得意とするため、XLSの採用がモデルによる設計支援を現実的にした、とHoは述べている。
ただし、AIが生成した変更はすべて通常の検証フローを通過している。チップには数億のゲートが存在し、99.99%の精度でも不十分だとHoは明言した。AIの変更を全盲信するのではなく、標準的な設計ツールによる承認を必須とする体制を維持している。
また、Hoはモデルの活用によって人員を削減する意図はないとも述べた。「より多くのことをより速くやるために使う」という立場だ。
プリフィルとデコードを分けない設計判断
記事はチップのアーキテクチャ上の判断にも触れている。現在の業界トレンドは、LLMの推論処理をプリフィル(プロンプトの読み込み)とデコード(回答の生成)で別々のハードウェアに分離する方向に向かっている。
OpenAIはこれを採用せず、一つのユニットで両方を処理する設計を選んだ。理由は、データセンターのキャパシティを固定比率に縛ることへのリスクだ。ワークロードの比率が変動する現実の運用では、分離構成の方が非効率になりうると判断した。Hoはデメリットも認めており、非常に長いコンテキストでは限界が出る可能性があると述べている。
チップは高帯域幅メモリ(HBM)をコアに直結させ、データ移動を最小化する構造を持つ。この設計思想はGPUメーカーを含む競合他社が追随すると予測しており、OpenAIはそれを承知の上で公開することを選んだ。
「GPUがより良くなることを望んでいるから。私たちはまだGPUを必要としている」
OpenAIはNvidiaの主要顧客の一つでもあり、このコメントはその関係性を踏まえると興味深い。
現状と今後
Jalapeñoは2024年6月にBroadcomとの共同開発として発表された推論専用チップで、8月のHot Chips conferenceではNvidia GB300との比較ベンチマークが示された。Jalapeñoの第2世代は現在ラボで資格試験中であり、量産に向けて動いている段階だ。
Hoはスケーリングの限界についても言及している。業界の真の制約はパワーでもメモリでもなく、過去のバブルで痛手を負った経営陣と投資家が「AIがどこまで大きくなるか」を過小評価していることだ、と述べた。AIを使ったチップ設計という手法が今後どこまで普及するかは未知数だが、少なくともOpenAI自身はその有効性を実証しつつある。Hoが「まだ100%信頼していない」と留保しながらも本番チップに適用したという事実は、この取り組みの現在地を端的に示している。
詳細はOpenAI's models reshaped its Jalapeño chip in ways it couldn't explainを参照していただきたい。