8月6日、Inside AIが「Zhang Yiming Says ByteDance's Seed Team Won't Rely on AI Distillation」と題した記事を公開した。この記事では、ByteDance創業者の張一鳴(Zhang Yiming)がAI研究チーム「Seed」に対し、モデル圧縮技術「AIディスティレーション」に依存しない方針を指示したことについて詳しく紹介されている。
Seedチームへの「ディスティレーション禁止」指令
AIディスティレーションとは、大きな「教師モデル」の出力を小さな「生徒モデル」に模倣させる学習手法だ。計算コストを大幅に削減できる一方で、教師モデルの誤りや偏りをそのまま受け継ぐリスクがある。OpenAI、Google、Metaもオンデバイスに向けた軽量モデルの展開にこの手法を活用している。
張一鳴がこの方針をSeedチームの内部会議で示したのは先月のことだという。記事によれば、これはByteDance全社的なディスティレーション禁止令ではなく、あくまでもSeedチーム——ByteDanceの専任AI研究ラボ——における研究哲学として位置付けられている。短期的に競合他社に遅れをとることになっても、「ファーストプリンシプル(第一原理)」から構築されたモデルを追求するという姿勢だ。
この判断の背景には、研究上の根拠もある。2024年に『Transactions on Machine Learning Research』に掲載された論文では、ディスティレーションされたモデルはエッジケースにおいて教師モデルの微妙な失敗パターンを引き継ぎやすいことが示されている。ゼロから構築するアプローチはコストが高いが、こうした「隠れた負債」を減らせる。
なぜ今この判断か——地政学的文脈
この決断はビジネス判断であると同時に、米国の半導体輸出規制という外的圧力への対応でもある。チップへのアクセスが制限される中、ByteDanceはより少ない計算資源で高い性能を引き出す手段を模索せざるを得ない。逆説的ではあるが、ディスティレーションを使わないことで、ハードウェアとソフトウェアを連携した独自の設計革新が生まれる可能性があるという見立てだ。
SeedチームはByteDanceが開発した大規模言語モデル「Doubao(豆包)」を擁しており、中国語ベンチマークでGPT-4に匹敵する性能を示している。Doubaoは2023年後半から2024年にかけて段階的にリリースされ、中国国内で急速にユーザーを獲得してきたモデルだ。ディスティレーションなしでこの水準を維持・向上できるかどうかが、今後の試金石となる。
張一鳴のアプローチは、業界でも一定の支持を受けている考え方と重なる。DeepMindのDemis Hassabisは「既存モデルの出力ではなく生データから学ぶシステム」を支持しており、MetaのYann LeCunも模倣に頼らない自己教師あり学習を推進している。
「純粋主義」への反論もある
批判的な見方もある。AI研究者のGary Marcusは「ディスティレーションは哲学的な妥協ではなく実用的なツールだ」と主張する。スタートアップにとっては、製品をリリースできるかどうかの分岐点になり得る選択肢でもある。
※編集部の考察:Marcusのこの見解は元記事に直接引用されているものではなく、同氏がこれまで公言してきた立場を踏まえた文脈的な補足である。
ByteDanceはTikTokやDouyinからの収益によって長期研究に資金を投じられる体力があるとはいえ、AI業界には「純粋主義」を掲げながら実用主義派に追い抜かれたプロジェクトも少なくない。
張一鳴自身のキャリアを振り返ると、人手によるコンテンツ編集よりもレコメンデーションアルゴリズムに賭けてByteDanceを築いた人物だ。今回もまた、「既存モデルの模倣ではなく、オリジナルアーキテクチャから真のAI進歩が生まれる」という読みに賭けていることになる。
Seedチームへのマンデートは明確だ——既存モデルを模倣する近道に頼らず、独自に革新せよ。それがブレークスルーをもたらすのか、それとも開発の足枷となるのか。タイトルの問いに答えるなら、現時点では「どちらとも言えない」が正直なところだが、張一鳴がこれまでの経営判断で示してきた実績を踏まえれば、根拠なき賭けではないとも言える。チップ制約という逆境が、むしろ独自アーキテクチャの洗練を促す触媒になる可能性——そこにこそ、この「純粋主義」が吉と出る現実的なシナリオがある。
詳細はZhang Yiming Says ByteDance's Seed Team Won't Rely on AI Distillationを参照していただきたい。