10月3日、Omar Sohailが「An iPhone 17 Pro Max Connected To An M4 Pro MacBook Pro Combined With Custom Software Resulted In Up To 44% Prefill Speeds When Running A 27B AI Model」と題した記事を公開した。手元のiPhoneをMacの拡張GPUとして使い、270億パラメータのAIモデルを最大44%高速化する——そんな実験的なアプローチが、ソフトウェアエンジニアによってオープンソースで実装・公開され、AIコミュニティの注目を集めている。追加ハードウェアなし、USB-Cケーブル1本と自作ソフトウェアだけで成立するこの手法は、エッジでのLLM推論の可能性を改めて問い直すものだ。
iPhoneをMacの「第2のGPU」として使う
GitHubユーザー「StayLameBro」(Redditでも同名の「u/StayLameBro」として活動している同一人物)が公開したこの手法の本質は、MacBook ProとiPhone 17 Pro Maxの間でモデルの推論レイヤーを分割するという点にある。
具体的には以下のように処理が分担される。
- MacBook Pro(M4 Pro): 256トークンバッチのレイヤー1〜40を処理し、アクティベーションをiPhoneへストリーミング
- iPhone 17 Pro Max(A19 Pro): レイヤー41〜64をGPUで処理。その間にMacは次のバッチを開始
なお「256トークンバッチ」という値は、実装上の設定値として本実験で採用されたものだ。この並列パイプラインにより、iPhoneのGPUを使った処理速度はGPUなしの場合と比べて約2.4倍になるという。
さらにNeural Engine(NPU)も活用されており、16Kごとの古いコンテキストをNeural Engineモデルとしてコンパイルする仕組みを採用している。これにより、140Kコンテキスト時の1トークンあたりの書き込み時間がA19 Pro GPU単体の279msから176msへ短縮される。
プリフィル速度の実測値
対象モデルはQwen3-27B(270億パラメータのLLM)。2,000トークンのファイルをセッションに読み込む際のプリフィル速度を測定した結果は以下の通りだ。
| コンテキスト長 | Mac単体 | Mac + iPhone | 向上率 |
|---|---|---|---|
| 8K | 132 tok/秒 | 177 tok/秒 | +35% |
| 16K | 109 tok/秒 | 157 tok/秒 | +44% |
| 32K | 101 tok/秒 | 130 tok/秒 | +29% |
プリフィル(prefill)とは、LLMがプロンプト全体を一度に処理してKVキャッシュを構築するフェーズのこと。コンテキストが長くなるほどボトルネックになりやすく、ここを高速化することは長文処理の体感速度に直結する。今回の結果を見ると、コンテキスト長16Kでの向上率が最大となっており、中程度の長さのコンテキストでとくに効果が顕著に現れることがわかる。
M4 Pro MacBook Proの制約が動機
この実験が生まれた背景には、M4 Pro MacBook Proのユニファイドメモリ24GBという制約がある。メモリを20,480MBまで引き上げても、コンテキストウィンドウは64Kまでしか扱えない。iPhone 17 Pro Maxを追加することで、この上限を実質的に押し広げる狙いだ。
ただし制約もある。64K未満のテキスト生成フェーズ(decode)はiPhoneで高速化されない。あくまでプリフィルの加速が主な恩恵であり、トークン生成の速度向上はMac側が担う。手元のデバイス構成や用途によって恩恵の大きさは異なるため、この点は留意しておく必要がある。
オープンソースで公開中
このカスタムソフトウェアは「backburner」という名称でGitHub上で公開されている。開発者本人がGitHubとRedditの両方でフィードバックを受け付けており、実験的な実装ではあるが、手元に対応デバイスがあれば試すことが可能だ。
記事では、将来的にA20 Pro(iPhone 18 Pro搭載予定)を使えばさらなる性能向上が見込めるとも触れている。A20 Proはデュアル16コアのNeural Engineを搭載しており、特定のNPU向けワークロードでは7コアGPUを上回るスループットが報告されている。
一方で記事の末尾では、こうした需要が高まった場合、iPhoneがDRAMやSSDと同様の供給不足フェーズに入る可能性も示唆されている。既製のクラウドGPUに頼らず、手持ちのAppleデバイスを組み合わせてローカルLLM推論を強化するというアプローチは、今後のエッジAI活用の一つの方向性を示唆している。