9月12日、Sergio De Simoneが「NVIDIA Personal AI Router Distributes AI Tasks Across Local Compute」と題した記事を公開した。NVIDIAがベータ公開した「PAIR(Personal AI Router)」は、自宅のローカルネットワーク上に複数のGPU搭載マシンがある場合に、AI推論リクエストを自動で振り分けるルーターだ。既存の推論サービスをそのまま活かしながら、並列ワークロードの完了時間を約半分に短縮できるという点が最大のメリットで、マルチエージェントAIを自宅環境で本格運用したいユーザーにとって注目すべきツールといえる。
ローカル複数GPUへのリクエスト分散を実現するPAIR
NVIDIA PAIR(Personal AI Router)は、ローカルネットワーク上の複数のマシンにAI推論リクエストを自動的に分散させるツールだ。ベータ版として現在公開されており、Windows 11、Linux、macOSのx64/arm64システムで動作する。
PAIRが解決しようとしている課題はシンプルだ。マルチエージェントAIのワークロードでは、リードエージェントが複数のサブエージェントにタスクを割り振る「幅優先」アプローチが一般的になりつつある。このとき、推論リクエストが集中して1枚のGPUがボトルネックになる問題がある。
PAIRのアーキテクチャは以下のように動作する:
エージェントは通常のローカルインターフェース宛てにリクエストを送る。PAIRはプロキシとしてそのリクエストを受け取り、必要なエンジンとモデルを特定して、適切なノードを1つ選択する。そのノードがリクエストを最初から最後まで処理し、PAIRを通じてレスポンスを返す。エージェントから見ると、単一の接続先しか見えない。
重要なのは、OllamaやLM Studioといった既存のローカル推論サービスとそのまま統合できる点だ。エージェントの実装やアーキテクチャを変更する必要がない。
「GPUのVRAMを合算する機能ではない」
PAIRの発表後、SNS上では誤解が広がった。「第三者とコンピューティングリソースを共有できる」「複数の非力なGPUを束ねて大型モデルを動かせる」といった解釈がRedditなどに投稿された。
NVIDIAは明確に否定している。PAIRは「GPUを統合したり、VRAMを一つの大きなアクセラレータとしてプールしたりするものではない」。各推論リクエストを個別のノードに割り振るだけであり、モデルのサイズ上限は各ノードのVRAM容量に依存する。
実際の効果はどれくらいか
NVIDIAはHermes Desktop、Ollama、PAIRを組み合わせたデモ動画を公開している。RTX Spark、DGX Spark、RTX 5090の3台をPAIRで束ねた場合、単一のRTX Sparkラップトップで処理するのに比べて完了時間が約半分に短縮されたという結果が示されている。
デモでは、マルチエージェントフレームワーク「Hermes Desktop」がタスクを5つの独立した専門分析に分解し、それぞれをサブエージェントに委譲する。PAIRが推論リクエストを各ノードに振り分け、OllamaがPAIRの選択したノード上でモデルを実行する。
NVIDIAはただし書きとして、この結果はワークロードの並列性、モデル、エンジン設定、ハードウェア、ネットワーク、ノードの可用性など複数の要因に依存するため、パフォーマンスを保証するものではないと明記している。
実際に使ったユーザーからは肯定的な声も上がっている。元記事が引用するRedditの関連スレッドへのリンクは明示されていないが、あるユーザーは3台のRTX 5090でQwen 3.8 27Bを動かしながらPAIRで分散させた経験をこう述べたとされる:
ジョブを3台のマシンに分散させるのが拍子抜けするくらい楽だった。最大トークン/秒を絞り出すよりも、安定性を重視してすべてのGPUを使い続けたい長くて反復的な「単純作業」には、思いのほか快適だった。
類似ツールとの違い
PAIRとは設計思想の異なるツールも存在する。元記事によると、ネットワーク越しに複数パーティ間でGPUコンピューティングを共有したい場合は、Petalsや「Mesh LLM」が選択肢になる。Mesh LLMは「Skippy」を使い、単一マシンに収まらない大規模モデルを複数台に分割して実行する機能も備えるとされている。
PAIRはあくまでローカルネットワーク内のリクエスト分散に特化したツールと位置付けられる。
PAIRはGitHubからダウンロードでき、セットアップ手順はGetting Startedドキュメントにまとめられている。
詳細はNVIDIA Personal AI Router Distributes AI Tasks Across Local Computeを参照していただきたい。